LPL数据研析 LPL数据研析
公开、可复核的分析框架 独立数据分析平台

Methodology

LPL数据分析方法

说明数据从哪里来、如何被清洗和验证,以及指标、预测概率与公开赔率观察如何形成。我们的目标不是提供无法核验的结论,而是让每项分析都能回到明确的来源、样本和统计口径。

来源优先

优先采用可追溯的官方赛果与公开赛事记录,并标识第三方补充数据。

过程留痕

采集、清洗、映射、验证与发布按批次处理,重要修订保留版本记录。

口径一致

同一指标使用一致定义,并在版本、赛制或数据覆盖变化时重新评估。

表达不确定性

预测以概率而非确定结论呈现,并说明样本不足、阵容变化等风险。

01

Source policy

数据来源政策

数据来源按可核验性、接近原始记录的程度和稳定性分层。来源不同的数据不会在缺少标识的情况下被视为同等可靠。

优先级
一级来源

官方赛果与赛事公告

用于确认比赛结果、赛程状态、赛制、处罚、阵容公告和赛事阶段等基础事实。

作为事实核验的首选依据;如官方后续更正,本站同步进入修订流程。

二级来源

公开赛事数据

包括公开的逐局统计、英雄选择、资源、时长、击杀和地图目标等结构化记录。

执行格式验证、赛事映射与跨字段一致性检查后使用。

补充来源

第三方公开数据

用于补充历史记录、公开赔率快照或官方未提供的结构化字段。

必须标识来源类别与时间戳,不用于覆盖更高优先级的已确认事实。

使用边界: 未公开的信息、无法验证的社交媒体传闻以及缺少来源链的二手汇总,不作为确定性事实进入核心数据集。确有分析价值时,只能作为明确标注的背景信息。
02

Data pipeline

从原始记录到页面发布

数据处理不是一次性复制。每个批次依次经过采集、标准化、去重、验证、异常检测和版本化,尽量降低重复比赛、队名变化与字段错位造成的误差。

  1. 1

    采集与时间标记

    记录来源类别、采集批次、原始时间与可用字段,避免将后续更新误认为赛前信息。

  2. 2

    标准化

    统一战队、选手、赛事、版本、位置、英雄及赛制标识,同时保留必要的历史别名。

  3. 3

    去重与合并

    通过赛事、时间、对阵、局次等组合键识别重复记录,不依赖单一名称字段。

  4. 4

    一致性验证

    检查系列赛比分与逐局结果、胜负方、比赛时长、资源总量及地图目标之间的逻辑关系。

  5. 5

    异常检测

    标记不合理极值、缺失阵容、重复局次和跨版本错位,异常记录不会自动进入模型训练。

  6. 6

    版本化发布

    发布数据快照并保留修订线索,使后续页面更新能够追溯到对应批次和统计口径。

03

Metric definitions

核心指标如何定义

指标用于压缩信息,而不是替代比赛语境。除特别说明外,团队指标按地图局统计,系列赛结果与单局结果分开处理。

战绩与胜率

系列赛胜率反映对阵结果,单局胜率反映地图局表现。两者不会直接混合;不同赛制下的样本会单独标识。

近期状态

使用截至分析时点的滚动比赛窗口,并结合时间衰减。窗口长度、赛事阶段及阵容变化会影响解释。

对手强度

根据对手在同一时点之前的表现估计,而非使用赛季最终排名回填,以减少未来信息泄漏。

资源效率

考察经济、击杀、地图目标或伤害转化为胜势的能力。指标通常按比赛时长、节奏或资源规模标准化。

阵营指标

蓝色方与红色方胜率按版本、阶段和样本量观察,不将全局阵营差异直接归因于单支战队。

BP优先级

综合选择率、禁用率、首轮优先级和放出后的选择倾向。版本与Fearless Draft规则应分别处理。

样本量原则

小样本指标仍可展示,但应附带样本数量或限制提示。样本不足时,不使用高精度小数营造虚假确定性,也不把短期波动直接解释为稳定能力。

04

Prediction method

预测模型与概率校准

预测用于比较赛前条件下的相对胜算,不是赛果保证。模型只使用在预测时间点已经可获得的信息,并通过时间顺序评估泛化能力。

主要特征类别

近期与长期表现
阵容连续性与人员变化
对手强度调整
阵营与地图局环境
版本与赛制因素
比赛节奏与资源效率

训练与评估范围

训练集按时间顺序构建,较早比赛用于训练,较晚比赛用于验证或测试。跨赛季、重大版本和赛制变化会进行分段检查,避免随机切分高估模型能力。

概率校准

模型排序正确并不代表概率可信。我们会比较预测概率与实际发生频率,并关注整体及不同概率区间的校准表现。

  • 使用留出时段或滚动窗口进行赛外评估
  • 检查概率分箱、校准误差与概率评分
  • 样本不足时扩大不确定性提示,而非过度拟合

避免数据泄漏

预测某场比赛时,不使用该场比赛之后才产生的排名、赛果、阵容确认、最终赛季统计或后验标签。滚动指标必须截断到预测时间点,缺失值处理和标准化参数也只能根据训练数据确定。

05

Odds method

公开赔率观察方法

赔率数据仅用于观察公开市场预期及其变化,不用于替代比赛分析,也不构成投注建议。不同来源、时间点与市场规则的数据必须分开记录。

时间戳

每个快照应对应采集时间。开盘、临场与赛后数据不能混合比较,延迟数据需明确提示。

隐含概率

十进制赔率的原始隐含概率为赔率的倒数;比较双方时还需识别并处理市场利润空间。

变化解释

赔率移动可能来自阵容消息、市场流动性或风险控制,不能自动解释为真实胜率发生同等变化。

责任提示: 公开赔率观察用于研究市场信息表达。任何概率或价格都存在误差、延迟和来源差异,不应被理解为收益承诺。
06

Corrections policy

错误反馈与修订政策

数据错误可能来自原始来源修正、名称映射、缺失记录或处理逻辑。收到反馈后,先确认影响范围,再决定局部更正、批次重算或方法更新。

  1. 1

    接收问题

    记录页面、字段、比赛或指标,以及能够支持核验的来源信息。

  2. 2

    复核来源

    对照原始记录、公开赛事信息和数据处理批次确认问题。

  3. 3

    评估影响

    检查错误是否影响其他比赛、聚合指标、排名、模型或历史文章。

  4. 4

    发布修订

    修正数据并在重大变化时说明修订范围、原因及分析影响。

一般更正

拼写、标签或不改变主要结论的局部字段错误可直接修正;必要时在对应页面保留简短说明。

重大修订

若错误改变排名、预测概率、核心图表或文章结论,应重新计算相关内容,并公开说明影响范围。

07

Limitations

方法限制与正确使用方式

数据无法完整描述比赛

公开数据通常无法直接刻画队内沟通、临场决策、训练状态、选手健康和未公开的战术准备。统计关系也不等同于因果关系。

  • 阵容临时变化会迅速降低历史样本的代表性。
  • 重大版本与赛制变化可能造成历史指标失效。
  • 小样本、高波动和数据缺失会扩大预测误差。
  • 概率预测应与阵容、版本、BP及比赛背景共同阅读。

FAQ

研究方法常见问题

不是。本站是独立分析平台,会优先使用官方赛果与公开赛事记录,也可能使用第三方公开数据进行补充。不同来源会按其可核验性和用途分层,不将第三方数据表述为官方发布。

不代表。概率是对不确定性的量化。例如较高胜率只表示在当前信息和模型假设下相对更有利,单场比赛仍可能因BP、状态、临场决策或随机波动出现不同结果。

页面可能采用不同样本区间、赛事阶段、版本、阵容过滤条件或统计单位。阅读时应优先查看页面标注的样本范围和更新时间,而不是仅比较单个数值。

若某项预测使用市场信息,页面必须明确披露。默认情况下,数据模型表现与公开赔率观察应分别展示,以便用户判断模型结论是否独立于市场价格。

请提供相关页面、比赛或字段,以及可供核验的来源。本站会检查原始记录和处理批次;若错误影响聚合统计、预测或主要结论,将扩大复核范围并披露重大修订。

Continue exploring

将方法说明带回具体数据页面

建议结合样本区间、版本、阵容和更新时间阅读每项指标。方法透明并不能消除不确定性,但能帮助你判断结论是否值得信赖。