你打开连珠等级分榜,第一眼看到某人排在前面,随后却发现他的近期对局很少,旁边还跟着一个醒目的 ±。这时只抄下名次,容易漏掉半张表。读 WHR 评分,先确认榜单的更新时间与筛选范围,再沿一行读完评分、对局量和不确定性,最后回到具体比赛。
先确认这张榜单更新于何时
榜单是一张有日期的快照。连珠 WHR 首页显示最近更新为 2026 年 9 月 13 日,页面同时列出 Players 5563、Games 133209。这是页面标示的最近更新日期,不能单凭它断言所有截至当天的比赛都已收录。WHR 这一方法则早在 2008 年的论文中已有介绍。
5563 名棋手和 133209 局描述的是页面所用数据集规模。它们不能直接理解成默认列表里有 5563 行,也不能说明每位棋手都有近期记录。筛选之后,眼前可见的人数会缩小。
接着看页面控件:历史时点、国家或地区,以及 Active、Gy1≥10、All。默认打开的是 Active。截图榜单或比较两个人时,把更新日期和筛选条件一起记下,否则同一个名次很难复核。
沿一行阅读,先看评分再看名次
一行里先确认姓名和国家或地区,避免同名或转述造成混淆;然后读 Rating 与 ±;再看 Gy1、Gy2、Gy5。Rank 放到最后理解,因为它只是当前页面把所选人群按评分排出的顺序。
Rating 是模型对该棋手在相应时点实力的估计,适合在同一数据集、同一版本和同一筛选语境中比较。它没有通用的段位换算表,也不宜直接拿去和另一个网站的数字逐位对齐。
名次会同时受到评分变化、数据补录和筛选范围影响。某人从一页的第十名变成另一页的第十二名,先查页面是否从 Active 切到了 All,或历史年份是否改变,再讨论棋力变化。
Gy1、Gy2、Gy5 记录近期对局量
Gy1、Gy2、Gy5 分别统计棋手在近 1 年、2 年、5 年时间窗口中的对局量。它们是局数,不是胜局数、积分或连胜长度。Gy1 较高,只能说明近期有更多记录进入数据。
榜单公开生成代码显示,Active 要求总对局至少 10 局,并且 Gy5 大于 0;Gy1≥10 则进一步要求近一年至少 10 局。All 会放开活跃筛选,因此默认页不包含每一位已评分棋手。
做一个纸上例子:甲与乙的评分接近,甲的 Gy1 为 30,乙的 Gy1 为 0。你可以说甲的近期记录更充足;你还不能据此宣布甲最近战绩更好,因为这些列没有给出胜负构成。
先读筛选,再读分数,最后回到棋谱。
评分旁的 ±,还需要怎样理解
评分旁的 ± 是榜单输出的不确定性字段。数值较大时,可以谨慎地理解为当前估计更松;数值较小时,模型给出的定位相对更集中。它适合提醒你放慢结论。
页面没有为这个 ± 标注某个置信水平,因此不要把“2800 ± 80”直接写成 95% 置信区间。两人的范围看起来重叠或不重叠,也不足以推出一场对局的确切胜率。
把 ± 与 Gy 列并排看会更稳妥。评分接近时,近期局数较少且 ± 较大的一行,需要保留更多余地。Active 中也可能出现 Gy1 为 0 的棋手,因为该筛选看的是近五年是否有记录,并非近一年必须参赛。
历史曲线是回看估计,不是冻结档案
WHR 原始论文页面说明,这套方法基于动态 Bradley–Terry 模型,直接利用纳入数据的完整历史,估计棋手随时间变化的实力。技术上它求的是整段历史的后验众数,并非把历年胜率简单平均。
因此,历史年份页面更接近“以当前这批数据回看那个时点”。后来补录、修订或新增对局时,模型会重新利用整段历史,过去时点的估计可能随之调整。引用旧年评分时,也要附上你查看榜单的日期。
这层区别在棋手长期停赛后尤其有用。Current、某个历史年份和最后参赛时的状态回答的是不同问题:当前模型怎样定位他、当时轨迹怎样、那场比赛实际发生了什么。三者不要揉成一句判断。
评分提供背景,比赛结果仍由棋谱确认
WHR 可以给赛前比较提供背景,却不会改写一场比赛的胜负。即使高评分者在某局失利,那局结果仍以赛事记录为准;一局冷门也不会自动证明整张长期评分表失效。
阅读具体对阵时,先记录双方在同一更新时间下的 Rating、± 和 Gy1,再查赛事日期、规则、先后手与棋谱。评分差距描述模型背景,落子过程才告诉你胜负如何形成,例如哪里出现活三、冲四或禁手判断。
笔记可以写得具体一些:“我引用的是 2026 年 9 月 13 日更新页的 Active 排名,近期记录见 Gy1 列。”如果切换过历史年份,把年份补上。这句限定语让转述的名次有了可查的出处。