12 个AI大模型预测世界杯:169 次预测后,谁最准?
TokenMix 12 个大模型预测世界杯:169 次预测后,谁最准?
本文是一次模型评测实验,不是投注建议。数据来自 TokenMix WorldCup AI Arena,统计时间为 2026-06-18 05:53 UTC。
我把 12 个 AI 模型放进同一个世界杯预测场景里,让它们同时预测比赛结果,然后用真实赛果回填计分。
表面问题是:哪个模型预测世界杯最准?
真实问题更有价值:大模型在不确定场景下,是否会过度相信强队、名队和历史印象?
一句话结论
现在还不能说哪个模型最准。当前 12 个模型全部是 3 分并列,Qwen3.5 Flash、Claude Opus 4.7、Claude Sonnet 4.6 暂时显示 100% 胜负准确率,但它们各自只有 1 场已结算赛前预测。
也就是说:榜单是真的,但样本还太小。
当前数据概览
| 指标 | 数值 |
|---|---|
| 模型数量 | 12 |
| 总预测数 | 169 |
| 已结算计分项 | 21 |
| 总积分 | 36 |
| 精确比分命中 | 0 |
| 胜负命中 | 12 |
| 平均胜负准确率 | 62.5% |
注意:赛后复盘不计入预测准确率。赛后模型已经知道结果,只能用来分析解释,不能算预测。
当前排行榜
| 模型 | 类型 | 预测数 | 已结算 | 胜负命中 | 积分 | 胜负准确率 |
|---|---|---|---|---|---|---|
| Qwen3.5 Flash | wildcard | 13 | 1 | 1 | 3 | 100% |
| Claude Opus 4.7 | flagship | 14 | 1 | 1 | 3 | 100% |
| Claude Sonnet 4.6 | flagship | 14 | 1 | 1 | 3 | 100% |
| GPT-5.4 | flagship | 15 | 2 | 1 | 3 | 50% |
| Gemini 3.1 Pro | flagship | 15 | 2 | 1 | 3 | 50% |
| DeepSeek V4 Pro | value | 15 | 2 | 1 | 3 | 50% |
| Qwen 3.7 Plus | value | 14 | 2 | 1 | 3 | 50% |
| Kimi K2.6 | value | 14 | 2 | 1 | 3 | 50% |
| Gemini 2.5 Flash | value | 14 | 2 | 1 | 3 | 50% |
| Grok 4.1 Fast Reasoning | wildcard | 14 | 2 | 1 | 3 | 50% |
| DeepSeek V4 Flash | wildcard | 14 | 2 | 1 | 3 | 50% |
| GPT-5 Nano | wildcard | 13 | 2 | 1 | 3 | 50% |
不要被 100% 迷惑。1/1 和 50/50 是两种完全不同的可信度。
模型做对了什么?
乌兹别克斯坦 1-3 哥伦比亚这场,12 个模型全部预测哥伦比亚胜。
| 模型 | 预测 | 真实赛果 | 是否命中胜负 |
|---|---|---|---|
| Claude Opus 4.7 | 0-2 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| Claude Sonnet 4.6 | 1-2 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| GPT-5.4 | 1-2 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| Gemini 3.1 Pro | 0-2 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| DeepSeek V4 Pro | 0-2 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| Qwen 3.7 Plus | 0-2 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| Kimi K2.6 | 0-2 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| Gemini 2.5 Flash | 0-2 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| Grok 4.1 Fast Reasoning | 0-2 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| DeepSeek V4 Flash | 0-2 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| GPT-5 Nano | 0-1 哥伦比亚 | 1-3 哥伦比亚 | 是 |
| Qwen3.5 Flash | 0-1 哥伦比亚 | 1-3 哥伦比亚 | 是 |
这说明在强弱比较明显的比赛上,小模型和旗舰模型可能给出相同方向。
模型错在哪里?
葡萄牙 1-1 刚果民主共和国这场,9 个有效赛前预测全部错了。
| 模型 | 预测 | 真实赛果 | 结果 |
|---|---|---|---|
| GPT-5.4 | 2-0 葡萄牙 | 1-1 | 错 |
| Gemini 3.1 Pro | 2-0 葡萄牙 | 1-1 | 错 |
| DeepSeek V4 Pro | 2-0 葡萄牙 | 1-1 | 错 |
| Qwen 3.7 Plus | 2-0 葡萄牙 | 1-1 | 错 |
| Kimi K2.6 | 2-0 葡萄牙 | 1-1 | 错 |
| Gemini 2.5 Flash | 2-0 葡萄牙 | 1-1 | 错 |
| Grok 4.1 Fast Reasoning | 3-0 葡萄牙 | 1-1 | 错 |
| DeepSeek V4 Flash | 2-0 葡萄牙 | 1-1 | 错 |
| GPT-5 Nano | 2-1 葡萄牙 | 1-1 | 错 |
这场最有价值。不是因为模型错了,而是因为它们以同一种方式错了。
它们都相信葡萄牙会赢。
这就是模型的“强队偏见”:当历史声望和当前不确定性冲突时,模型容易把强队名气转成胜率。
成本角度:为什么小模型值得看?
假设一次预测使用 10K input tokens 和 1K output tokens:
Qwen3.5 Flash: 10K * $0.026 / 1M + 1K * $0.263 / 1M = $0.000526 Claude Opus 4.7: 10K * $5 / 1M + 1K * $25 / 1M = $0.075
差距大约是 143 倍。
这不代表 Qwen3.5 Flash 更强,只说明一个工程现实:如果只是做大量低风险预测,先用小模型投票,再把分歧场景交给旗舰模型,可能更划算。
示例路由逻辑:
def route_prediction(match_uncertainty, disagreement): if match_uncertainty == "low" and disagreement == "low": return ["qwen3.5-flash"] if disagreement == "high": return ["qwen3.5-flash", "deepseek-v4-pro", "claude-sonnet-4.6"] return ["qwen3.5-flash", "gpt-5-nano"]
后续应该看哪些指标?
只看胜负准确率不够。
| 指标 | 意义 |
|---|---|
| 胜负准确率 | 基础方向 |
| 精确比分 | 难度最高 |
| 净胜球 | 比精确比分更稳定 |
| 平局召回率 | 检测强队偏见 |
| Brier Score | 检测概率校准 |
| 置信度分桶 | 看模型是否过度自信 |
| 每次命中成本 | 工程路由核心指标 |
我最关心的是平局召回率。葡萄牙这场已经暴露了一个问题:模型可能系统性低估平局。
结论
现在不能宣布哪个 AI 模型最会预测世界杯。
更准确的结论是:
-
明显强弱局,小模型也能跟旗舰模型同方向。
-
平局和冷门是模型短板。
-
便宜模型适合大规模投票,旗舰模型适合处理分歧。
-
这更像一个模型校准实验,而不是体育预测工具。
原始数据和完整榜单可以看: AI World Cup Predictions 2026: 12 Models, Early Leaderboard - TokenMix Blog
更多推荐


所有评论(0)