你打開連珠等級分榜,第一眼看到某人排在前面,隨後卻發現他的近期對局很少,旁邊還跟著一個醒目的 ±。這時若只抄下名次,很容易漏掉半張表。閱讀 WHR 評分,先確認榜單的更新時間與篩選範圍,再沿著一列讀完評分、對局量和不確定性,最後回到具體比賽。
先確認這張榜單更新於何時
榜單是一張有日期的快照。連珠 WHR 首頁顯示最近更新日期為 2026 年 9 月 13 日,頁面同時列出 Players 5563、Games 133209。這是頁面標示的最近更新日期,不能只憑這一點便斷言截至當天的所有比賽都已收錄。至於 WHR 方法,早在 2008 年的論文中便已有介紹。
5563 名棋手和 133209 局描述的是頁面所用的資料集規模。它們不能直接解讀為預設清單裡有 5563 列,也不能說明每位棋手都有近期紀錄。經過篩選後,眼前可見的人數會減少。
接著查看頁面控制項:歷史時間點、國家或地區,以及 Active、Gy1≥10、All。預設開啟的是 Active。擷取榜單畫面或比較兩個人時,請把更新日期和篩選條件一併記下,否則同一個名次很難複核。
沿著一列閱讀,先看評分再看名次
一列裡先確認姓名和國家或地區,避免同名或轉述造成混淆;接著讀 Rating 與 ±;再看 Gy1、Gy2、Gy5。Rank 留到最後理解,因為它只是目前頁面依評分排列所選人群的順序。
Rating 是模型對該棋手在相應時間點實力的估計,適合在同一資料集、同一版本和同一篩選脈絡中比較。它沒有通用的段位換算表,也不宜直接拿來與另一個網站的數字逐位對照。
名次會同時受到評分變化、資料補登和篩選範圍影響。某人從一頁的第十名變成另一頁的第十二名時,應先查看頁面是否由 Active 切換成 All,或歷史年份是否改變,再討論棋力變化。
Gy1、Gy2、Gy5 記錄近期對局量
Gy1、Gy2、Gy5 分別統計棋手在近 1 年、2 年、5 年時間範圍內的對局量。它們代表局數,不是勝局數、積分或連勝長度。Gy1 較高,只能說明近期有較多紀錄納入資料。
榜單公開的產生程式碼顯示,Active 要求總對局至少 10 局,且 Gy5 大於 0;Gy1≥10 則進一步要求近一年至少 10 局。All 會取消活躍篩選,因此預設頁面並不包含每一位已有評分的棋手。
不妨做個紙上例子:甲與乙的評分相近,甲的 Gy1 是 30,乙的 Gy1 是 0。你可以說甲的近期紀錄較充足;但還不能據此斷定甲最近的戰績較好,因為這些欄位並未列出勝負構成。
先讀篩選條件,再讀分數,最後回到棋譜。
評分旁的 ±,還需要怎麼理解
評分旁的 ± 是榜單輸出的不確定性欄位。數值較大時,可以審慎理解為目前的估計較寬鬆;數值較小時,模型給出的定位相對更集中。它適合用來提醒你放慢下結論的速度。
頁面並未替這個 ± 標示特定的信賴水準,因此不要把「2800 ± 80」直接寫成 95% 信賴區間。兩人的範圍看起來重疊或沒有重疊,也不足以推導出一場對局的確切勝率。
將 ± 與 Gy 欄位並排閱讀會更穩妥。評分相近時,近期局數較少且 ± 較大的一列,需要保留更多餘地。Active 中也可能出現 Gy1 為 0 的棋手,因為這項篩選看的是近五年內是否有紀錄,並非要求近一年一定要參賽。
歷史曲線是回看估計,不是凍結檔案
WHR 原始論文頁面說明,這套方法以動態 Bradley–Terry 模型為基礎,直接利用納入資料的完整歷史,估計棋手隨時間變化的實力。技術上,它求的是整段歷史的後驗眾數,而不是將歷年勝率簡單平均。
因此,歷史年份頁面更接近「用目前這批資料回看那個時間點」。日後補登、修訂或新增對局時,模型會重新利用整段歷史,過去時間點的估計也可能隨之調整。引用舊年份的評分時,同樣要附上查看榜單的日期。
這項區別在棋手長期停賽後尤其有用。Current、某個歷史年份和最後參賽時的狀態,回答的是不同問題:目前模型如何定位他、當時的軌跡如何,以及那場比賽實際發生了什麼。三者不宜揉成一句判斷。
評分提供背景,賽果仍由棋譜確認
WHR 可以為賽前比較提供背景,卻不會改寫一場比賽的勝負。即使評分較高者在某局失利,那一局的結果仍以賽事紀錄為準;一局冷門也不會自動證明整張長期評分表失效。
閱讀具體對陣時,先記錄雙方在同一更新時間下的 Rating、± 和 Gy1,再查看賽事日期、規則、先後手與棋譜。評分差距描述的是模型背景,落子過程才會告訴你勝負如何形成,例如何處出現活三、衝四或禁手判定。
筆記可以寫得更具體一些:「我引用的是 2026 年 9 月 13 日更新頁面的 Active 排名,近期紀錄見 Gy1 欄。」如果曾切換歷史年份,也把年份補上。這句限定語能讓轉述的名次有可查證的出處。