中国AI公司Moonshot AI正式发布了旗下最大开源模型Kimi K3,该模型拥有2.8万亿参数,采用混合专家(MoE)架构,在多项关键基准测试中超越Claude Fable 5和GPT-5.6 Sol,引发行业广泛关注。
据官方数据,Kimi K3在Towards AI的Writing Elo基准中得分2840,高于Claude Fable 5的2760,该基准通过盲评真实脚本与已发布版本,采用与象棋排名相同的Elo系统。在Arena AI的Frontend Code Leaderboard上,K3以1679分击败Fable 5的1631分,并在七个前端领域中的六个夺得第一。
在Artificial Analysis Intelligence Index综合评分中(涵盖编码、推理、智能体工作及知识,满分100),K3以57分位列第三,仅次于Claude Fable 5的60分和GPT-5.6 Sol的59分,仅落后3%。
Kimi K3采用2.8万亿参数的MoE架构,包含896个专家子网络,仅针对每个任务激活部分参数,从而在保持高性能的同时降低计算成本。其上下文窗口达到100万token,支持原生图像和视频理解,并具备始终在线的推理能力。Moonshot AI表示,K3是“全球首个3万亿参数级别的开源模型,专为长时编码、知识工作和推理等前沿场景设计”。
在价格方面,Kimi K3输入每百万token仅需3美元,输出每百万token需15美元,与Anthropic的中端模型Claude Sonnet 5定价相同。但K3的综合性能接近Claude Fable 5,而每任务成本(0.94美元)低于GPT-5.6 Sol(1.04美元)和Opus 4.8(1.80美元),实现了“顶级性能,中端价格”。
值得关注的是,K3的训练背景反映了美国芯片出口限制的影响。Moonshot AI确认此前使用英伟达H800 GPU训练前代模型,而K3的基准文档提及了H200及“来自替代供应商的GPGPU”——普遍认为是华为昇腾硬件。Moonshot AI总裁张宇彤在达沃斯论坛上表示:“我们无法简单地扩展算力,这迫使我们在基础研究和效率上发力。”美国银行分析师指出,K3证明了“在限制条件下,预训练缩放结合架构创新仍能带来阶梯式进步”。
不过,K3也存在明显短板:其幻觉率在AA-Omniscience基准上从K2.6的39%跃升至51%,意味着更多正确回答的同时,编造答案的比例也更高。此外,模型在长时间自主任务中可能“过度主动”,做出未经用户预期的决策。官方建议团队在升级前务必进行压力测试。
目前K3已在Kimi官网免费开放使用,但由于服务器负载过高,任务频繁中断,几乎无法流畅体验。用户可选择付费订阅或通过API调用。模型权重将于7月27日发布,面向大型企业和商业用户,但当前尚无国产GPU能独立处理如此规模的模型。
图为Kimi K3在零样本提示下构建的iOS克隆应用,对比GPT-5.6 Sol使用更复杂提示得到的结果。
图为Kimi K3在多项基准中的表现对比。
