Kimi、千问等AI集体押注世界杯⋯⋯大模型不再比拼聊天,为何集体扮演“懂球佬”?
2026-06-12 09:13 每日经济新闻
当下,AI大模型的竞争早已不局限于单纯的参数榜单,而是从“会聊天”转向“能办事”,从“比模型”转向“比场景”。然而,《Build for the Future 2025》全球研究显示,在调研全球1250多家企业后,仅5%的公司实现了AI价值的规模化应用。Gartner数据也显示,截至2025年底,嵌入真正AI Agent的企业应用占比不足5%。
胡延平观察到,大模型和智能体正从对话走向任务,从预训练走向持续学习,从数据语料走向持续多维的现实感知。“预测世界杯这类探索项目会加速这个进化过程。未来行动智能体所需要的能力体系,也是在走向‘感知-交互-决策-协同’这个方向。”
不过,王岩坦言,世界杯预测可以成为Agent能力的公开压力测试,但不能自动证明Agent能力提升,大模型在这场押注中训练和检验的是长任务组织、概率校准和用户交互能力。
“Kimi的300个Agent代表分析覆盖面增加,不直接代表预测准确率提升。相关Agent任务Token消耗研究显示,同一任务的Token消耗可相差几十倍,更多Token并不必然带来更高准确率。同样,相关Prediction Arena研究也显示,多个前沿模型在Kalshi真实预测市场57天交易测试中最终收益为-16.0%至-30.8%,研究量与结果没有相关性。”王岩向每经记者进一步分析道。
正如王岩所言:“当前Agent的最大缺口,正在从‘能否给出合理计划’转向‘能否稳定完成长周期真实任务’。”这意味着,谁能率先落地“实战能力”,谁就将有机会在愈发激烈的争夺赛中脱颖而出。
来源:每日经济新闻
责编:杨童童




