Claude Opus 5 是 Anthropic 于 2026年7月24日发布的前旗舰模型,在 Artificial Analysis Intelligence Index v4.1 中以 63分位列全球第一,Agentic Index 55.3分同样排名第一。它是 Terminal-Bench 得分最高的编码Agent(86.7%),在多步骤Agent工作流中表现卓越。1M token上下文窗口,$5/$25的定价与前代Opus 4.8持平,但智能水平大幅提升。
| 维度 | 评分 | 说明 |
|---|---|---|
| 推理能力 | 9.5 | AA Intelligence Index 63分全球第一,ARC-AGI-3 30%约3.75倍于第二名 |
| 编程能力 | 9.5 | Terminal-Bench 86.7%编码Agent最高,CursorBench v3.2领先 |
| 长文本 | 9.0 | 1M token上下文窗口,长文档理解与生成稳定 |
| Agent能力 | 9.5 | AA Agentic Index 55.3全球第一,多步骤任务规划最优 |
| 性价比 | 7.0 | $5/$25 per 1M tokens,比Grok 4.6贵4倍,但能力最强 |
| 创意写作 | 8.5 | LMArena写作类排名靠前,但Fable 5在创意上更强 |
| 多模态 | 7.5 | 文档问答/图表理解强,但视觉ELO低于Fable 5 |
| 生态 | 9.0 | Claude Code生态成熟,Skills系统+MCP协议+计算机使用 |
综合评分:8.8/10 — 当前最强编程与Agent模型,推理与编码双冠王。
| 基准 | Claude Opus 5 | GPT-5.6 Sol | Grok 4.6 |
|---|---|---|---|
| AA Intelligence Index | 63 (#1) | 61 (#5) | 61 (#6) |
| AA Agentic Index | 55.3 (#1) | 54.0 (#2) | — |
| Terminal-Bench v3.0 | 86.7% (#1) | 34.6% | 26.0% |
| CursorBench v3.2 | — | 67.2% | 69.9% |
| DeepSWE v1.1 | — | 73 | 65.9 |
| LMArena Elo | 1493 (high) | — | — |
| 输入/输出价格 | $5 / $25 | $4 / $20 | $2 / $6 |
| 上下文窗口 | 1M | 1.05M | 500K |
1. 编码Agent之王:Terminal-Bench 86.7%远超所有竞品,在Claude Code中运行复杂多文件工程项目时可靠性最高。Agentic Index 55.3分证明其在多步骤任务规划、工具调用、错误恢复方面的卓越能力。
2. 推理天花板最高:AA Intelligence Index 63分全球第一。ARC-AGI-3达到30%,约为第二名的3.75倍。在需要深度推理的研究、数学、科学任务中表现最佳。
3. 生态最成熟:Claude Code + Skills系统 + MCP协议 + Computer Use API 构成完整Agent生态。anthropics/skills仓库170k星,社区Skills生态蓬勃发展。
1. 性价比一般:$5/$25的定价是Grok 4.6($2/$6)的4倍多。对于高 volume 编码任务,Grok 4.6或开源模型(Kimi K3 $3/$15)更经济。
2. 视觉能力非顶尖:LMArena Vision ELO低于Fable 5(1327),多模态理解不是Opus 5的强项。
3. 速度中等:74 t/s输出速度低于GPT-5.6 Sol(90 t/s)和Gemini 3.7 Flash(201 t/s)。
| 模型 | 定位 | 优势 | 劣势 |
|---|---|---|---|
| Claude Opus 5 | 编码/Agent之王 | 推理+编码+Agent三冠 | 价格高、速度中等 |
| GPT-5.6 Sol | 综合最强 | LLM Stats综合57.2第一,生态成熟 | Agent能力略逊Opus 5 |
| Grok 4.6 | 性价比之王 | $2/$6极低价,Agent轮次效率最高 | Terminal-Bench仅26% |
| Kimi K3 | 开源之王 | AA 60开源第一,$3/$15,2.8T MoE | 生态不如Claude成熟 |
| Gemini 3.1 Pro | 推理专家 | ARC-AGI-1 98%并列人类,$0.52/任务 | 编码能力不如Opus 5 |
推荐场景:复杂编程项目、多步骤Agent工作流、深度推理任务、企业级代码审查与架构设计。
不推荐场景:高volume简单编码(用Grok 4.6)、创意写作(用Fable 5)、低成本批量任务(用DeepSeek V4 Flash或Kimi K3)。
# Claude Code 中使用 Opus 5
claude --model claude-opus-5
# API 调用
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-d '{"model":"claude-opus-5","max_tokens":4096,"messages":[{"role":"user","content":"Hello"}]}'
Claude Opus 5 是2026年8月最强的编码与Agent模型,AA Intelligence Index全球第一、Agentic Index第一、Terminal-Bench第一。如果你需要最好的编码质量和Agent可靠性,Opus 5是唯一选择。但如果你追求性价比,Grok 4.6和Kimi K3是更聪明的花费。Opus 5的真正价值在于:当正确性比成本更重要时,它是唯一不会让你失望的模型。