GLM 5.3深度评测:纯后训练的Agent飞跃

厂商:Z.ai(智谱AI) · 发布日期:2026年8月14日 · 评分:7.8/10

评测概述

GLM 5.3是智谱AI在2026年8月14日发布的最新模型。最引人注目的是:它与前代GLM-5.2使用完全相同的744B参数基座,没有任何新预训练数据,所有提升都来自纯后训练(post-training)。结果是Terminal-Bench 3.0从4.6分飙升至28.3分——这是2026年同基座模型中最大的Agent能力飞跃。

八维度评分

维度得分说明
推理能力7.5AA Intelligence Index约53,与GLM-5.2持平,纯后训练未改变基础推理
编程能力8.0Terminal-Bench 3.0从4.6→28.3,编程Agent能力大幅提升
Agent能力8.5最大亮点,DeepSWE v1.1和Terminal-Bench均有飞跃式增长
长文本7.5支持1M上下文窗口,长文本理解稳定
性价比8.5按量付费API,价格远低于Claude Opus 5和GPT-5.6
多模态7.0支持图文理解,但视频/音频能力未公开测试
开源友好5.0权重未开放(因安全审查),GLM-5.2仍是开源首选
生态8.0Z.ai API生态完善,支持MCP协议,国内厂商中领先

核心亮点:纯后训练的奇迹

GLM 5.3最值得关注的不是它有多强,而是它如何变强的。没有新预训练、没有扩大参数量、没有更换架构——744B基座与GLM-5.2完全相同。所有提升来自规模化后训练,包括强化学习、对齐优化和Agent专项训练。

结果是:Terminal-Bench 3.0从4.6分跳到28.3分(6倍提升),DeepSWE v1.1也大幅增长。这证明了一个重要趋势:后训练的ROI可能比预训练更高,对于已有大基座的厂商,不堆算力也能获得显著Agent提升。

竞品对比

模型AA指数Agent能力价格(输入/输出)开源
GLM 5.3~53Terminal-Bench 28.3按量付费(低价)否(安全审查中)
Claude Opus 563Agentic Index 55.3$5/$25
GPT-5.6 Sol61Terminal-Bench 34.6%$5/$30
Grok 4.661Terminal-Bench 26%$2/$6
Kimi K360Agent #3$3/$15是(MIT)
GLM-5.2~53Terminal-Bench 4.6按量付费

与GLM-5.2对比:基础推理能力几乎不变(AA指数约53),但Agent能力天差地别。如果只做对话/写作,GLM-5.2免费开源版即可;如果做编码Agent或自动化工作流,GLM 5.3的Terminal-Bench提升是决定性的。

不足之处

权重未开放是最大遗憾。Z.ai表示因安全审查暂缓发布权重,GLM-5.2仍是最强开源国产模型。这意味着需要自部署的团队无法使用GLM 5.3,只能走API调用。Trigger.dev等Agent工作流平台可以通过API接入,但失去本地部署优势。

基础推理天花板仍在。Terminal-Bench飞跃不意味着通用推理也飞跃——AA Intelligence Index约53,与Kimi K3(60)和Claude Opus 5(63)仍有差距。纯后训练能提升Agent表现,但无法突破基座模型的智能上限。

适用场景

场景推荐度理由
编码Agent⭐⭐⭐⭐Terminal-Bench 28.3,性价比极高
自动化工作流⭐⭐⭐⭐Agent能力飞跃,MCP协议支持完善
中文NLP⭐⭐⭐⭐国产模型中文理解自然
本地部署权重未开放,只能API调用
多模态理解⭐⭐⭐基础图文OK,视频/音频未验证
极限推理⭐⭐⭐AA指数53,与第一梯队有差距

结论

GLM 5.3是2026年最特殊的模型发布之一:它没有更大的参数、没有更多的数据、没有新的架构,却通过纯后训练实现了Agent能力的6倍飞跃。这证明后训练的ROI正在超越预训练,对整个行业有启示意义。评分7.8/10——Agent能力9分级别,但权重未开放拖了后腿。等Z.ai完成安全审查开放权重后,这个分数可能上升到8.5+。