TokenMix 12 个大模型预测世界杯:169 次预测后,谁最准?

本文是一次模型评测实验,不是投注建议。数据来自 TokenMix WorldCup AI Arena,统计时间为 2026-06-18 05:53 UTC。

我把 12 个 AI 模型放进同一个世界杯预测场景里,让它们同时预测比赛结果,然后用真实赛果回填计分。

表面问题是:哪个模型预测世界杯最准?

真实问题更有价值:大模型在不确定场景下,是否会过度相信强队、名队和历史印象?

一句话结论

现在还不能说哪个模型最准。当前 12 个模型全部是 3 分并列,Qwen3.5 Flash、Claude Opus 4.7、Claude Sonnet 4.6 暂时显示 100% 胜负准确率,但它们各自只有 1 场已结算赛前预测。

也就是说:榜单是真的,但样本还太小。

当前数据概览

指标 数值
模型数量 12
总预测数 169
已结算计分项 21
总积分 36
精确比分命中 0
胜负命中 12
平均胜负准确率 62.5%

注意:赛后复盘不计入预测准确率。赛后模型已经知道结果,只能用来分析解释,不能算预测。

当前排行榜

模型 类型 预测数 已结算 胜负命中 积分 胜负准确率
Qwen3.5 Flash wildcard 13 1 1 3 100%
Claude Opus 4.7 flagship 14 1 1 3 100%
Claude Sonnet 4.6 flagship 14 1 1 3 100%
GPT-5.4 flagship 15 2 1 3 50%
Gemini 3.1 Pro flagship 15 2 1 3 50%
DeepSeek V4 Pro value 15 2 1 3 50%
Qwen 3.7 Plus value 14 2 1 3 50%
Kimi K2.6 value 14 2 1 3 50%
Gemini 2.5 Flash value 14 2 1 3 50%
Grok 4.1 Fast Reasoning wildcard 14 2 1 3 50%
DeepSeek V4 Flash wildcard 14 2 1 3 50%
GPT-5 Nano wildcard 13 2 1 3 50%

不要被 100% 迷惑。1/1 和 50/50 是两种完全不同的可信度。

模型做对了什么?

乌兹别克斯坦 1-3 哥伦比亚这场,12 个模型全部预测哥伦比亚胜。

模型 预测 真实赛果 是否命中胜负
Claude Opus 4.7 0-2 哥伦比亚 1-3 哥伦比亚
Claude Sonnet 4.6 1-2 哥伦比亚 1-3 哥伦比亚
GPT-5.4 1-2 哥伦比亚 1-3 哥伦比亚
Gemini 3.1 Pro 0-2 哥伦比亚 1-3 哥伦比亚
DeepSeek V4 Pro 0-2 哥伦比亚 1-3 哥伦比亚
Qwen 3.7 Plus 0-2 哥伦比亚 1-3 哥伦比亚
Kimi K2.6 0-2 哥伦比亚 1-3 哥伦比亚
Gemini 2.5 Flash 0-2 哥伦比亚 1-3 哥伦比亚
Grok 4.1 Fast Reasoning 0-2 哥伦比亚 1-3 哥伦比亚
DeepSeek V4 Flash 0-2 哥伦比亚 1-3 哥伦比亚
GPT-5 Nano 0-1 哥伦比亚 1-3 哥伦比亚
Qwen3.5 Flash 0-1 哥伦比亚 1-3 哥伦比亚

这说明在强弱比较明显的比赛上,小模型和旗舰模型可能给出相同方向。

模型错在哪里?

葡萄牙 1-1 刚果民主共和国这场,9 个有效赛前预测全部错了。

模型 预测 真实赛果 结果
GPT-5.4 2-0 葡萄牙 1-1
Gemini 3.1 Pro 2-0 葡萄牙 1-1
DeepSeek V4 Pro 2-0 葡萄牙 1-1
Qwen 3.7 Plus 2-0 葡萄牙 1-1
Kimi K2.6 2-0 葡萄牙 1-1
Gemini 2.5 Flash 2-0 葡萄牙 1-1
Grok 4.1 Fast Reasoning 3-0 葡萄牙 1-1
DeepSeek V4 Flash 2-0 葡萄牙 1-1
GPT-5 Nano 2-1 葡萄牙 1-1

这场最有价值。不是因为模型错了,而是因为它们以同一种方式错了。

它们都相信葡萄牙会赢。

这就是模型的“强队偏见”:当历史声望和当前不确定性冲突时,模型容易把强队名气转成胜率。

成本角度:为什么小模型值得看?

假设一次预测使用 10K input tokens 和 1K output tokens:

Qwen3.5 Flash:
10K * $0.026 / 1M + 1K * $0.263 / 1M = $0.000526
​
Claude Opus 4.7:
10K * $5 / 1M + 1K * $25 / 1M = $0.075

差距大约是 143 倍。

这不代表 Qwen3.5 Flash 更强,只说明一个工程现实:如果只是做大量低风险预测,先用小模型投票,再把分歧场景交给旗舰模型,可能更划算。

示例路由逻辑:

def route_prediction(match_uncertainty, disagreement):
    if match_uncertainty == "low" and disagreement == "low":
        return ["qwen3.5-flash"]
    if disagreement == "high":
        return ["qwen3.5-flash", "deepseek-v4-pro", "claude-sonnet-4.6"]
    return ["qwen3.5-flash", "gpt-5-nano"]

后续应该看哪些指标?

只看胜负准确率不够。

指标 意义
胜负准确率 基础方向
精确比分 难度最高
净胜球 比精确比分更稳定
平局召回率 检测强队偏见
Brier Score 检测概率校准
置信度分桶 看模型是否过度自信
每次命中成本 工程路由核心指标

我最关心的是平局召回率。葡萄牙这场已经暴露了一个问题:模型可能系统性低估平局。

结论

现在不能宣布哪个 AI 模型最会预测世界杯。

更准确的结论是:

  1. 明显强弱局,小模型也能跟旗舰模型同方向。

  2. 平局和冷门是模型短板。

  3. 便宜模型适合大规模投票,旗舰模型适合处理分歧。

  4. 这更像一个模型校准实验,而不是体育预测工具。

原始数据和完整榜单可以看: AI World Cup Predictions 2026: 12 Models, Early Leaderboard - TokenMix Blog

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐