智谱GLM-5.3-Flash实现AI自我优化:两周完成国产万卡集群部署

2026-09-18 03:11 4 次浏览 前沿资讯

智谱发布GLM-5.3-Flash推理系统优化成果,两周内在超10万颗国产加速器上完成生产部署。模型驱动的Infra Agent参与性能优化,端到端吞吐提升3.2倍,标志着递归自我改进(RSI)的早期形态出现。

2026年9月17日,智谱GLM首席科学家唐杰在X平台分享了一项关于GLM-5.3-Flash推理系统优化的研究成果。这一成果的核心亮点在于,模型开始参与优化承载自身运行的系统——一个由GLM-5.3驱动的Infra Agent帮助分析性能瓶颈、提出优化方案并完成代码修改,标志着递归自我改进(Recursive Self-Improvement,RSI)的早期形态已经出现。

事件概览

智谱团队将GLM-5.3-Flash部署在由超过10万颗国产AI加速器组成的集群上,从首次运行到稳定承载生产流量仅用时两周。在这一过程中,系统端到端吞吐能力提升了3.2倍,硬件利用率和单token成本接近主流NVIDIA GPU平台的水平。完成大量优化工作的并非只有基础设施工程师,还有GLM-5.3模型自身驱动的Infra Agent。唐杰形容这一变化是“一个帮助优化服务自身的模型”。

部署完成后,GLM-5.3-Flash还以匿名模型名Ox-Alpha运行在OpenCode和OpenRouter平台,一周内成为两个平台使用量最高的模型之一,六天处理超过62万亿token。

核心信息

国产算力集群的工程挑战与突破

此次部署面临诸多工程难题:国产AI加速器的显存容量和互联带宽存在限制,需要适配新模型架构,支持100万token长上下文以及多模态请求处理。同时,国产AI加速器的软件生态仍处于发展阶段,部分Kernel支持不足,许多资料需要工程团队自行探索。在这些限制下,Infra Agent参与了推理系统优化过程。

智谱团队采用了一系列优化方案,包括:通过ReplaySSM用计算换取内存空间;节点内张量并行降低显存压力;INT8、FP8、BF16混合精度缓存提高容量利用率;引入Encode-Prefill-Decode(EPD)分离式架构,让不同推理阶段能够更灵活地调度。最终端到端服务性能相比初始版本提升约3倍。

AI从写代码到理解系统性能

此次实验真正的变化在于让AI能够理解复杂系统为什么出现性能变化。唐杰提到,Infra Agent遇到困难时很少是因为无法编写代码,而是无法判断“为什么结果变差”。例如系统反馈“吞吐下降20%”时,Agent无法直接判断哪一层出了问题、当前假设是否错误以及下一步应该验证什么。

智谱团队将资深工程师的工程经验转化为AI可以调用的反馈机制,称为“dense feedback”。这套机制让Agent获得更接近工程判断过程的信息:当需要确认计算是否正确时,可获取正确性反馈;需要分析性能下降原因时,可查看系统运行时间消耗;尝试新优化方案时,可通过实验判断方案是否适用。真正有效的反馈需要满足:足够接近具体问题、能够快速获得、并能通过客观实验验证。

Infra Agent的具体优化案例

在dense feedback的帮助下,Infra Agent成功定位并修复了多个推理系统中的隐藏问题:

  • KDA上下文并行路径精度问题:Agent发现不同上下文分片间需要不断合并状态矩阵,TF32计算产生的舍入误差随着序列长度增加不断累积,导致计算结果偏差。Agent通过比较不同执行路径结果,将问题定位到状态传播和合并过程中的精度处理,相关修复已合并到Flash Linear Attention项目PR #1180。
  • KV Transfer与DeepEP调度问题:测试中发现KV Transfer没有与DeepEP Dispatch形成有效重叠,导致部分场景下传输开销超过30%。Agent沿着Python与C++调用链分析,发现节点内路径未及时释放Python GIL,使传输任务无法推进。修改后额外开销从超过30%降低到1%以下。
  • Decode Kernel优化:Agent发现由于Kernel切分方式问题,同一组归一化计算被重复执行四次。通过重新组织计算结构,减少重复计算,该Kernel获得1.71倍性能提升。这一优化思路来自Agent对SGLang、Flash Linear Attention和DeepGEMM等项目现有Kernel的学习,并将代码中的优化经验提炼成“optimization skeleton”,再结合当前系统反馈判断是否适用。

影响与观察

智谱团队表示,过去一年里GLM的角色正在发生变化。最初团队探索GLM在代码理解和网络安全领域的能力,随着模型能力提升,GLM开始参与构建AI系统本身。他们曾观察到模型完成一些过去需要资深基础设施工程师团队花费数周才能完成的任务,而这些工作又会直接影响下一代模型训练和部署方式。

唐杰认为,人类工程师仍然负责设定目标、搭建反馈环境以及审核高风险修改,但工程师的角色正在从直接解决问题向设计反馈系统转变。建立在真实基础设施任务上的可验证反馈环境,可能也是训练下一代模型的重要基础——每一次Agent完成工程任务,都可能成为下一代模型学习的数据。

目前GLM-5.3-Flash的案例距离真正意义上的递归自我改进仍然存在距离,但唐杰认为一个最小规模的循环已经出现:模型优化系统,而系统服务模型。

结语

智谱此次成果展示了AI自我优化的可行性。当模型能够理解系统性能变化、从已有代码中学习优化方法并通过实验验证,AI系统开始具备初步的自我改进能力。虽然这仅是RSI的早期形态,但它预示着AI基础设施构建方式可能迎来根本性变革——从工程师手动调优,转向人机协作的反馈驱动优化。未来,随着dense feedback机制和可验证反馈环境的完善,模型优化系统将有望成为AI发展的新范式。


信息来源:爱范儿,查看原始信息。本文由 AI ONLINE 基于公开资料整理,信息可能随时间变化,请以官方发布为准。