GLM-5.3 发布:一次关于后训练的坦白
✓ 基座:GLM-5.2(740B+,未更换)
✓ 编程体感:较前代提升 50%
✓ Terminal Bench 3.0:开源第一
! 多模态:本版本不提供
今天智谱发布了 GLM-5.3。新闻通稿里最扎眼的一句是「基座没变」。我盯着这四个字看了很久,觉得它比任何"提升 50%"都更值得写。一次能力跃迁,靠的不是换头,而是把后训练做长、做深。这是本文想聊清楚的事。
先说结论层的新闻。GLM-5.3 与 GLM-5.2 用的是完全相同的基座模型,参数量都是 7400 多亿,没有升级到坊间传闻的万亿级。那"提升 50%“从哪来?官方解释是:后训练 Scaling——把长程任务环境放大到数十倍规模,塞进更丰富多样的环境类型,再用超长周期的后训练去磨。
听起来抽象,翻译成人话就是:同一个脑子,换了一套更严苛、更漫长的训练方式,把神通练出来了。这一年 AI 圈有个趋势越来越明显——大家都开始承认,预训练堆参数的路子有天花板,于是把功夫下到两处:一是后训练,二是推理时计算。GLM-5.3 就是前者的一次集中展示。
通稿说编程体感较前代提升 50%,在 Terminal Bench 3.0 等公开基准里位列开源模型第一。数字很漂亮,但我的读法一向是:先分清楚"体感"和"基准"是两个口径。
- 编程体感提升 50% —— 属自建体感评测,口径偏主观
- Terminal Bench 3.0 开源第一 —— 公开基准,但要看榜单细节与基线
- 网络安全能力 接近 Mythos 5 —— 厂商声称,待独立复现
我不否认这个成绩有价值。尤其"开源第一"这个标签,对开发者和想私有化部署的团队诱惑不小。但坦率讲,“提升 50%“这类数字,翻译成"比我手上现在的模型顺手不少"更稳妥——等独立第三方评测和真实上手再说,别被单一指标牵着走。
这次最让我意外的一点,是官方主动提了网络安全:在白盒代码审查、漏洞发现这些任务上,表现接近 Mythos 5。这在一个"纯文字编程模型"身上并不常见,听上去像是长程 Agent 训练顺带长出来的本事。
仔细想却合理。后训练用海量长程任务环境去磨模型,本质是逼它在"多步推理、读代码、发现问题、动手改"这条链路上反复练。而漏洞发现恰好长在同一个能力簇上——会读代码、会推理、会执行。所以它不是凭空多出来一个技能,而是把同一个底层能力变现到了新的场景。这个逻辑,比"突然冒出一个新能力"更可信,也更值得关注。
评论区里排队吐槽的,几乎都是同一句:怎么还是没有多模态。这个吐槽站得住,但我觉得得看清它为什么没有。
多模态能力基本是在预训练阶段长出来的——得在海量图文、音视频数据上从头喂。既然 GLM-5.3 基座没动,那它自然就带不来多模态,这是后训练路线的必然结果,不是"忘了加”。换句话说,这是一次刻意收敛的取舍:把预算和精力全砸在编程、Agent、安全这条纯文本主线上。
对它的目标用户(开发者、Agent 场景)来说,多模态本就是低频需求,纯文本反而响应更快、成本更可控。所以结论是:把它当"开源最强编程/Agent 模型"看,没多模态无所谓;把它当"全能旗舰"看,吐槽成立。两边说的其实不是同一个东西。
GLM-5.3 值得一看的地方,不在"提升 50%"这个数字,而在它把"后训练能撑起一次能力跃迁"这件事摆到了台面上。基座不变、能力上探,这条路行得通,意味着竞争的重心正在从"卷参数量"转向"卷训练质量"。至于多模态,留给下一代吧——先把这条主线吃透再说。
最后说句实在的。技术发布的消息,越是热闹,越该把镜头对准"它到底改了什么、为什么这么改”。GLM-5.3 给了我们一个很好的样本:一次升级,未必是换一枚更强的心脏,也可能是把同一颗心脏,练得更有力。对开发者而言,多一个能打的开源选项永远是好事——至于它是不是"最强”,你用一用,自然有答案。