Kimi K3知识工作能力跃居全球第二,超越GPT-5.6 Sol仅次于Claude Fable 5
7月24日,据报道,独立AI评测机构Artificial Analysis于7月22日更新的AA-Briefcase基准测试显示,月之暗面旗下Kimi K3模型以1543分的成绩,超越OpenAI的GPT-5.6 Sol(1501分),在该智能体知识工作评测中位列第二,仅次于Anthropic的Claude Fable 5(1574分)。
AA-Briefcase是专为评估AI在长周期、高复杂度真实业务场景中表现而设计的压力测试。它模拟企业办公环境,包含超过25,000条Slack消息、3,500封电子邮件、会议纪要和财务报表等碎片化信息,要求模型生成Excel财务模型、董事会汇报PPT等实际商务交付物,而非简单的问答对话。
在具体指标上,Kimi K3的客观正确率达51%,仅次于Claude Fable 5的56%;分析质量Elo评分为1754,与Claude Fable 5基本持平,在论证严谨性和数据支撑深度方面达到顶尖水平。但在呈现质量维度上,Kimi K3(1471)显著落后于GPT-5.6 Sol(1660),商务材料的专业呈现能力仍有提升空间。
值得关注的是,Kimi K3在AA-Briefcase上每个任务平均成本为10.57美元,耗时56.4分钟,是榜单上成本最高、耗时最长的模型之一。作为对比,低成本模型DeepSeek V4 Flash每任务仅约0.04美元。
这一成绩延续了Kimi K3在代码能力上的亮眼表现。此前该模型曾在Frontend Code Arena前端代码测试中登顶榜首,超越Claude Fable 5。近期有报道称,微软正在内部测试Kimi K3,评估将其部分接入Copilot AI助手的可行性,以降低推理成本。对于关注AI智能体技术演进与市场格局的读者而言,这组数据提供了两个值得跟踪的方向:中国开源模型在高难度知识工作场景中的客观能力正在逼近行业顶尖水平,但这一能力背后的成本与效率账本,将直接影响企业客户的实际选择。