2026年8月6日,Meta正式发布首款AI编程智能体Muse Code(测试版),由Muse Spark 1.2模型驱动,直接对标Claude Code和Codex。我们基于公开测试数据和基准成绩进行深度评测。
| 维度 | 评分 | 说明 |
|---|---|---|
| 代码库理解 | 9.0 | 全仓库索引,理解架构和依赖,Instagram端到端加密等大型任务 |
| 编程能力 | 8.0 | Terminal-Bench 82.9%,落后Opus 5约4个百分点 |
| 异步Agent | 9.5 | 多子Agent并行,曾同时开发六项功能无冲突 |
| 崩溃恢复 | 9.0 | 保存操作记录,崩溃后可从断点继续 |
| 价格 | 10.0 | 每百万token仅1.5元,远低于竞品 |
| 模型能力 | 7.5 | Muse Spark 1.2能力直追Opus 5但尚有差距 |
| 生态 | 6.0 | 刚发布测试版,Skills生态为零 |
| 文档 | 7.0 | 官方博客详尽,社区文档尚少 |
Muse Code最大亮点:能对整个代码仓库建立索引,理解项目架构、依赖关系和代码规范一致性。传统AI编程工具只能处理单文件或有限代码片段,Muse Code能自主理解跨模块代码结构,执行多步骤编码、重构和调试。Meta内部测试中,Muse Code完成了"为Instagram后端服务添加端到端加密"和"重构WhatsApp消息路由模块"等任务,通常需高级工程师数天工作量,Muse Code数小时完成。
多个专门子Agent在会话中持续活跃,而非按任务重新创建,大幅降低冗余和延迟。任务体量大时自动拆分独立子智能体,在隔离工作目录中并行作业,不改动本地代码副本。测试中曾同时为一款游戏开发六项功能,全程无代码冲突。
Muse Code保存操作记录,程序崩溃后可从断点继续执行。这在长时间运行的复杂任务中极为重要——Claude Code和Codex也有类似机制,但Muse Code的持久化方案更为完善。
| 基准测试 | Muse Code | Claude Code (Opus 5) | Codex (GPT-5.6 Terra) | Grok Build |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 82.9% | 86.7% | 81.8% | 81.6% |
| DeepSWE 1.1 | 落后5-9% | 领先 | 追赶 | — |
| 价格(每百万token) | 1.5元 | ~150元 | ~108元 | — |
Muse Code在Terminal-Bench 2.1中得分82.9%,超越Codex(81.8%)和Grok Build(81.6%),但落后Claude Code(86.7%)约4个百分点。价格优势碾压级:每百万token仅1.5元,比Claude Code便宜100倍。
| 场景 | 推荐 | 理由 |
|---|---|---|
| 预算敏感+大型项目 | Muse Code | 价格仅1.5元/百万token,异步Agent+崩溃恢复 |
| 编程能力最强 | Claude Code | Terminal-Bench 86.7%,Skills 3000+ |
| 推理任务 | Codex | GPT-5.6推理强 |
| 国内开发者 | Qwen Code | 百炼Coding Plan价格低+中文最优 |
Muse Code以8.3分交出了一份令人惊喜的答卷。它不是编程能力最强的AI Agent——Claude Code在这方面依然领先——但它是性价比最高、架构最先进的。异步多Agent并行和崩溃恢复机制是真正的工程创新,1.5元/百万token的价格让每个开发者都负担得起。随着Skills生态发展,Muse Code有望成为Claude Code的有力竞争者。
想了解更多AI编程评测?阅读DeepSeek V4 Flash评测,或了解AI编程Agent四强对比。也推荐Muse Code安装教程。