2.8万亿参数全球最大开源模型,Frontend Code Arena 1679分全球第一,100万上下文不加价。但幻觉率51%是致命伤。八维度评分7.9/10。
2026年7月17日WAIC开幕日凌晨,月之暗面正式发布Kimi K3——这款2.8万亿参数的MoE架构大模型,不仅是全球最大的开源AI模型,更是中国AI产业的一个里程碑。
核心参数:
马斯克在社交平台公开称赞"令人印象深刻"。K3发布后反响远超预期,月之暗面官方声明称算力需求已逼近承载极限。
Kimi K3最亮眼的表现毫无疑问在编程领域。在Frontend Code Arena全球AI大模型榜单中,Kimi K3以1679分位居第一,超越了Claude Fable 5和GPT-5.6 Sol。
具体表现:
实际测试中,K3在前端交互开发、UI组件生成方面表现出色。如果你主要做Web前端开发,K3可能是当前最佳选择。但在复杂后端逻辑和大规模系统工程方面,GPT-5.6 Sol仍然领先。
月之暗面官方公布的基准测试数据显示,Kimi K3在14项基准测试中:
关键细分表现:
Kimi K3的定价策略在旗舰级模型中极具竞争力:
| 项目 | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 | DeepSeek V4-Pro |
|---|---|---|---|---|
| 输入($/百万token) | $3.00 | ~$15 | ~$15 | ~$0.87 |
| 输出($/百万token) | $15.00 | ~$30 | $50.00 | ~$3.50 |
| 缓存命中($/百万token) | $0.30 | — | — | — |
| 100万上下文加价 | 无 | 有 | 有 | — |
亮点:
性价比评分:8/10。对需要大上下文窗口的场景(长文档分析、代码库理解)尤其划算。
Kimi K3在Agent能力上展示了令人惊艳的案例:
K3针对长程、高难任务做了专项优化,主动性很强。但这也带来一个副作用:遇到简单、模糊的需求时,K3会过度思考和发挥,需要在系统提示词或AGENTS.md中做约束。
Kimi K3原生支持视觉理解,不需要外接视觉编码器。在WAIC展台上展示的案例包括:
视觉理解能力的加入使K3在多模态场景下不输闭源旗舰,尤其是"截图转代码"的前端开发工作流中表现出色。
客观地说,Kimi K3并非完美。两个显著短板:
这是K3最严重的问题。在第三方测试中,K3的幻觉率高达约51%——意味着每两次回答就可能有一次编造信息。相比之下:
建议:在使用K3生成事实性内容时,务必交叉验证关键信息。K3更适合代码生成和创意任务(幻觉影响小),而非事实查询和知识问答。
K3的响应速度约为Claude Fable 5的1/2到2/3,在旗舰模型中属于偏慢梯队。2.8万亿参数的庞大体积是主要原因。对于实时对话和高频API调用场景,这可能影响用户体验。
K3使用Responses API协议(非标准Chat Completions),与部分第三方工具兼容性存在问题。Temperature参数默认为1且不可修改,限制了输出控制的灵活性。
| 维度 | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 | DeepSeek V4-Pro |
|---|---|---|---|---|
| 参数规模 | 2.8万亿(MoE) | 未公开 | 未公开 | 未公开 |
| AA智能指数 | 57 | 59 | 60 | — |
| 编程(DeepSWE) | 67.5 | 73 | 70 | — |
| 前端Arena | 1679 (#1) | — | ~1650 | — |
| 幻觉率 | ~51% ⚠️ | ~25% | ~20% | — |
| 输入价格 | $3 | ~$15 | ~$15 | $0.87 |
| 输出价格 | $15 | ~$30 | $50 | $3.50 |
| 上下文 | 100万 | — | — | — |
| 开源 | ✅ 7/27开放 | ❌ | ❌ | 部分 |
| 视觉理解 | ✅ 原生 | ✅ | ✅ | 需外接 |
Kimi K3是一款特点极为鲜明的大模型。它不是"六边形战士"——幻觉率高、速度偏慢是硬伤。但在特定领域,它的表现足以让竞争对手汗颜:
最终评分:7.9/10——在编程和开源维度满分级别,但可靠性和速度拖了后腿。如果你需要一个"聪明的程序员搭档"而非"可靠的知识助手",K3值得尝试。更多模型对比可查看AI模型排行榜。