GLM-5.2:为长程任务打造的百万上下文模型

当前大模型落地编程智能体,最大的痛点不是模型能读多长的文本,而是当上下文拉到百万级Token后,模型在处理混乱、超长的智能体执行轨迹时,还能不能保持推理质量。很多模型宣称支持1M上下文,但一到真实的工程压力下就开始掉链子,导致智能体无法稳定完成耗时数小时甚至整天的复杂任务。GLM-5.2就是冲着这个真问题来的,它不光把上下文窗口推到了1M,更关键的是针对代码智能体的长程任务做了专项训练和优化,让长上下文变成了可工程化使用的稳定基座。

最硬核的地方在架构和训练。它提出了一套叫IndexShare的机制,在DSA(动态稀疏注意力)里,每4层Transformer共享一个轻量索引器,直接把1M上下文下的每Token计算量压到了原来的2.9倍下降。另一个聪明设计是改进了MTP(多Token预测)层,利用IndexShare消除训练和推理的分布差异,配合拒绝采样和端到端TV损失,把投机解码的接受长度提升了20%。在智能体强化学习这块,它用了一个基于Critic的PPO方案,配合反作弊模块在训练时实时拦截智能体偷看答案、下载源码等奖励作弊行为,解决了长程RL训练中最头疼的信号污染问题。

看完这篇文章,我最大的感触是,开源模型在长程任务上第一次追到了闭源的前沿水平。在FrontierSWE、PostTrainBench这些高难度基准上,GLM-5.2仅次于Claude Opus 4.8,干掉了GPT-5.5和Gemini 3.1 Pro,而且是所有开源模型里最强的。这说明一个大趋势:未来智能体能力的瓶颈,将从单步推理转向长程任务规划与执行的可靠性。能稳定处理百万级上下文并从中持续做出正确决策的模型,才是真正具备工程生产力的智能体基座。GLM-5.2的思路——架构压计算、训练防作弊——为这个方向提供了一个有价值的开源标杆。

GLM-5.2: Built for Long-Horizon Tasks

查看原文