高いが、計測時点履歴がないためv3では研究扱い。
OUT-OF-SAMPLE TEST
2020–2026年、未学習期間の成績。
的中率だけなら、50.1%予想も99%予想も同じ一勝です。そこで確率の誠実さを見るBrierスコアとlog loss、予想帯と実勝率のずれも並べます。
CALIBRATION
「70%」は、本当に7割勝ったか。
0–10%
予想実績
22.9%83番10–20%
予想実績
26.7%985番20–30%
予想実績
32.5%1,704番30–40%
予想実績
36.4%6,769番40–50%
予想実績
48.2%28,760番50–60%
予想実績
59.0%35,910番60–70%
予想実績
72.8%9,979番70–80%
予想実績
79.8%2,053番80–90%
予想実績
86.6%987番90–100%
予想実績
89.7%145番YEAR BY YEAR
年ごとに、勝ち逃げしていないか。
| 年 | Elo | Glicko-2 | 土俵日和 v2 | 土俵日和 v3実験 |
|---|---|---|---|---|
| 2020 | 0.6704 | 0.6731 | 0.6727 | 0.6728 |
| 2021 | 0.6639 | 0.6638 | 0.6633 | 0.6629 |
| 2022 | 0.6658 | 0.6636 | 0.6628 | 0.6623 |
| 2023 | 0.6627 | 0.6606 | 0.6598 | 0.6594 |
| 2024 | 0.6647 | 0.6599 | 0.6589 | 0.6582 |
| 2025 | 0.6693 | 0.6667 | 0.6655 | 0.6653 |
| 2026 | 0.6671 | 0.6596 | 0.6592 | 0.6597 |
DATA QUALITY
使えるデータと、まだ危ないデータ。
予測時点より前の勝ち技だけで傾向を作成。
2,260 / 9,048 力士を照合済み。
PUBLIC MODEL POLICY
改善しなかった特徴は、足さない。
時系列で分割
未来の勝敗を過去のレートや相性へ混ぜません。
確率で採点
当否だけでなく、自信過剰もlog lossで罰します。
実験表示を分離
v3が僅かに改善しても、データ時点が弱い間は正式採用しません。