口径文件 · MISSION-03 · 适用版本 v3.2

数字从哪里来,到哪里为止

新利赛场对 2019 至 2024 五个赛季、四个联赛做过逐场校订。这一页把方法摊开来讲:客场胜率怎么算、首发轮换补时时长怎么记、口径改过哪几处,以及这些数字不适合被拿去做什么。

  • 5 个赛季 · 2019–2024
  • 4 个联赛 · 代号 A–D
  • 8,640 场逐场校订
  • 1,180 个结构化字段
深夜桌面上摊开的记录纸与荧光笔,纸面留着划线与批注
校订现场:纸质记录与电子表并行核对,被划掉的行保留在归档里,不覆盖。
01

为什么先校客场

主场哨声、熟悉的场地、看台压过来的声音——这些东西不会写进比分栏,但会落在比分上。主客场合在一起统计时,被抬高或被压低的那部分很难单独拆出来,跨联赛一比就更对不齐。所以校订从客场这一侧切进去:4,318 场客场比赛单独建表,和主场样本分开跑。

分开跑是有代价的。样本变小,波动变大,同一个联赛相邻两个赛季的客场胜率差值,经常大于合并统计时的差值。我们不会把这个差直接念成强弱变化,它更可能来自样本本身。

于是客场胜率一律并列两个值:全样本值,以及剔除补时进球之后的值。两个值同时出现,差在哪一段,读者自己看得见。1

02

一场比赛要过三道关

校订不是一次录入,而是三段接力。每一段都有放行条件,前一段挂着的场次不会流到下一段里去。

  1. 关卡一原始记录归集

    按场次编号把公开的赛事要点记录汇总到一处,先把字段名字对齐:比分、射门、抢断、拦截、门线解围、替补上场时间、补时时长。来源里没写清的标成待定,不填默认值,也不拿相邻场次去推。

  2. 关卡二逐场比对

    同一场比赛至少用两份来源交叉核对。比分、换人时间点、补时时长逐项对;只要有一项对不齐,整场挂起。挂起的场次不进统计表,会在归档里留下挂起原因。

  3. 关卡三口径复核

    由口径审校岗按当前版本回到字段定义上复查边界情况——比如换人之后不足 15 分钟的上场时间该归到哪一栏。凡涉及边界判定的,逐条写进该版本的修订说明。

03

补时长度和换人节点记在同一条线上

补时怎么记,直接决定轮换数据能不能对得上。这里的做法是:每场的补时时长以分钟为粒度记录,不折算成整五分钟区间;首发布阵发生变更的时间节点一条一条单独记,同一场允许多条。

这两类记录被对齐在同一条时间线上。这样一来,「这次换人落在补时第几分钟」是可以直接读出来的,而不是靠时间戳反推。

秒表与手写记录表并列的局部特写,表上内容不可辨认
分钟粒度的补时记录旁,通常还压着一张手写的换人顺序表。

有一条边界要单独说清楚:换人之后不足 15 分钟的上场时间,不计入替补贡献统计。但换人节点本身仍然保留在记录里,否则整条时间线会断掉,后面的对齐也就无从谈起。2

04

口径改过四次

版本号是跟着数字一起出现的。跨赛季比较之前,先确认两边的数值出自同一版,否则差值里混着口径变化。

四个刻度节点连接而成的横向时间轴抽象图形
  1. v1.0

    基础字段跑通

    • 比分、射门、抢断、拦截四类字段先行
    • 客场胜率只有全样本一个值
    • 字段命名在本版固定,后续版本沿用
  2. v2.0

    引入替补贡献分档

    • 直接贡献:进球、助攻
    • 推进衔接:向前传球成功率、二次助攻、带球推进距离
    • 防守贡献:抢断、拦截、解围、门线解围
  3. v3.0

    补时与轮换节点对齐

    • 补时时长进入结构化字段
    • 首发布阵变更节点与补时放进同一时间线
    • 此后才谈得上「这次补时里换了几个人」
  4. v3.2

    收窄抢断判定边界

    • 对什么算一次抢断做了收窄
    • 跨版本比抢断数前,先看用的是哪一版
    • 客场胜率改为双值并列展示
05

收录了哪四个联赛,各有多少东西

四个联赛在站内以代号出现,各自绑定一种识别色,全站不改叫法。赛季跨度一致,都是 2019 至 2024 五个赛季,但校订侧重并不相同。

四个联赛的代号、识别色、赛季跨度与校订侧重
代号 识别色 赛季跨度 校订侧重
联赛A 荧光青 2019–2024 客场胜率双值并列的记录最完整,补时剔除前后两组数都能落到场次
联赛B 暖橙 2019–2024 替补推进衔接字段的记录密度最高,向前传球与带球距离均可对照
联赛C 客场品红 2019–2024 口径变更提示出现得最多,相邻赛季读数波动也最需要谨慎对待
联赛D 赛程黄绿 2019–2024 补时与轮换节点的对齐条目相对集中,两组记录同步补齐的场次较多

四个联赛共用一套字段命名,各自保留独立的修订记录。结构化字段合计 1,180 个,覆盖比分、射门、抢断、拦截、门线解围、替补上场时间与补时时长等类别。某个联赛某个赛季缺来源的格子,宁可留空并在边注标出,也不做跨联赛补值——补出来的数字看着整齐,却已经不是你比较的那个东西了。

06

谁在做这件事

校订团队一共 12 人,分四个岗位,彼此之间存在明确的复核关系——同一个人的产出不会由他自己签字。

  • 6
    数据校订

    分两组,各自负责一段赛季区间,互相复核对方挂起的场次与挂起原因。

  • 3
    内容编辑

    把校订结果写成复盘与专题,负责在成稿里把口径版本标在原位,不让读者自己去猜。

  • 2
    产品与前端

    维护数据终端里的模块切换、联赛与赛季筛选、口径版本标记和本地导出。

  • 1
    口径审校

    所有版本修订由这个岗位签发,包括字段定义与边界判定,改动的理由一并留档。

如果你想知道某个字段在四个联赛里怎么横向摆在一起看,去数据终端;想看这些口径落到具体一场球上是什么样,去复盘手记

07

明确不做的部分

把边界写清楚,比把能力写满更有用。以下几条是站点层面不会越过的线。

  • 不做赛事直播,站内没有实时比分入口,也没有任何形式的赛况推送。
  • 不做赔率、返水或投注相关功能与内容;站内数据不构成对比赛结果的判断依据。
  • 不把两个口径下的数值混着比。版本号会跟着数字走,混用得出的差值没有意义。
  • 不用单个赛季的读数去推断长期趋势。样本够不够,得先看样本本身。
  • 不披露球员个体薪资。薪资结构只按五个位置档位给出区间中位数,不做个体呈现。

注释

  1. 客场胜率的全样本值与剔除补时进球后的值始终并列展示,不单独引用其中一个作为结论。返回
  2. 上场时间不足 15 分钟的替补不计入替补贡献统计,但对应的换人节点仍保留在时间线记录中。返回

这一页只交代数字怎么来的。具体到某一轮的读数差异与逐场结论,放在复盘手记里;口径上还有疑问,可以到口径答疑找对应条目;发现数值不对,走联络校订组,把场次编号和版本号一起带上。