厂商:Z.ai(智谱AI) · 发布日期:2026年8月14日 · 评分:7.8/10
GLM 5.3是智谱AI在2026年8月14日发布的最新模型。最引人注目的是:它与前代GLM-5.2使用完全相同的744B参数基座,没有任何新预训练数据,所有提升都来自纯后训练(post-training)。结果是Terminal-Bench 3.0从4.6分飙升至28.3分——这是2026年同基座模型中最大的Agent能力飞跃。
| 维度 | 得分 | 说明 |
|---|---|---|
| 推理能力 | 7.5 | AA Intelligence Index约53,与GLM-5.2持平,纯后训练未改变基础推理 |
| 编程能力 | 8.0 | Terminal-Bench 3.0从4.6→28.3,编程Agent能力大幅提升 |
| Agent能力 | 8.5 | 最大亮点,DeepSWE v1.1和Terminal-Bench均有飞跃式增长 |
| 长文本 | 7.5 | 支持1M上下文窗口,长文本理解稳定 |
| 性价比 | 8.5 | 按量付费API,价格远低于Claude Opus 5和GPT-5.6 |
| 多模态 | 7.0 | 支持图文理解,但视频/音频能力未公开测试 |
| 开源友好 | 5.0 | 权重未开放(因安全审查),GLM-5.2仍是开源首选 |
| 生态 | 8.0 | Z.ai API生态完善,支持MCP协议,国内厂商中领先 |
GLM 5.3最值得关注的不是它有多强,而是它如何变强的。没有新预训练、没有扩大参数量、没有更换架构——744B基座与GLM-5.2完全相同。所有提升来自规模化后训练,包括强化学习、对齐优化和Agent专项训练。
结果是:Terminal-Bench 3.0从4.6分跳到28.3分(6倍提升),DeepSWE v1.1也大幅增长。这证明了一个重要趋势:后训练的ROI可能比预训练更高,对于已有大基座的厂商,不堆算力也能获得显著Agent提升。
| 模型 | AA指数 | Agent能力 | 价格(输入/输出) | 开源 |
|---|---|---|---|---|
| GLM 5.3 | ~53 | Terminal-Bench 28.3 | 按量付费(低价) | 否(安全审查中) |
| Claude Opus 5 | 63 | Agentic Index 55.3 | $5/$25 | 否 |
| GPT-5.6 Sol | 61 | Terminal-Bench 34.6% | $5/$30 | 否 |
| Grok 4.6 | 61 | Terminal-Bench 26% | $2/$6 | 否 |
| Kimi K3 | 60 | Agent #3 | $3/$15 | 是(MIT) |
| GLM-5.2 | ~53 | Terminal-Bench 4.6 | 按量付费 | 是 |
与GLM-5.2对比:基础推理能力几乎不变(AA指数约53),但Agent能力天差地别。如果只做对话/写作,GLM-5.2免费开源版即可;如果做编码Agent或自动化工作流,GLM 5.3的Terminal-Bench提升是决定性的。
权重未开放是最大遗憾。Z.ai表示因安全审查暂缓发布权重,GLM-5.2仍是最强开源国产模型。这意味着需要自部署的团队无法使用GLM 5.3,只能走API调用。Trigger.dev等Agent工作流平台可以通过API接入,但失去本地部署优势。
基础推理天花板仍在。Terminal-Bench飞跃不意味着通用推理也飞跃——AA Intelligence Index约53,与Kimi K3(60)和Claude Opus 5(63)仍有差距。纯后训练能提升Agent表现,但无法突破基座模型的智能上限。
| 场景 | 推荐度 | 理由 |
|---|---|---|
| 编码Agent | ⭐⭐⭐⭐ | Terminal-Bench 28.3,性价比极高 |
| 自动化工作流 | ⭐⭐⭐⭐ | Agent能力飞跃,MCP协议支持完善 |
| 中文NLP | ⭐⭐⭐⭐ | 国产模型中文理解自然 |
| 本地部署 | ⭐ | 权重未开放,只能API调用 |
| 多模态理解 | ⭐⭐⭐ | 基础图文OK,视频/音频未验证 |
| 极限推理 | ⭐⭐⭐ | AA指数53,与第一梯队有差距 |
GLM 5.3是2026年最特殊的模型发布之一:它没有更大的参数、没有更多的数据、没有新的架构,却通过纯后训练实现了Agent能力的6倍飞跃。这证明后训练的ROI正在超越预训练,对整个行业有启示意义。评分7.8/10——Agent能力9分级别,但权重未开放拖了后腿。等Z.ai完成安全审查开放权重后,这个分数可能上升到8.5+。