Zhipu's GLM-5.3-driven Infra Agent optimizes 100k-chip cluster, 3.2x throughput
Zhipu founder Tang Jie presented the first engineering result of its RSI effort: a GLM-5.3-driven Infra Agent built and optimized a production inference system on a cluster of over 100,000 domestic chips, boosting end-to-end throughput to 3.2x the initial baseline in under two weeks. The agent autonomously identified and fixed issues such as Python GIL concurrency blocking in KV Transfer, reducing performance loss from over 20% to under 1%, and achieved a 1.71x speedup on the KDA Decode kernel. Zhipu emphasized that RSI is not yet achieved, with humans still defining goals, boundaries, and risk assessment.
Coverage timeline
量子位量子位
刚刚,唐杰发布智谱RSI首个成果 一水 2026-09-17 16:28:23 来源: 量子位 GLM已经开始参与构建GLM了 GLM,已经开始参与构建GLM了。 清华大学计算机系教授、智谱创始人唐杰 刚刚分享了一个他们内部观察到的RSI早期案例: GLM-5.3驱动的Infra Agent,在超过10万张国产芯片组成的集群上,从零参与搭建并优化了一套生产级推理系统。 不到两周,端到端吞吐直接提升至初始基线的3.2倍 。 关键是,这背后可不是简单的“AI写代码”。 从算子精度问题,到Python/C++跨层并发瓶颈,再到Kernel性能优化,Agent已经能自己读取系统反馈、提出假设、修改代码、跑实验,再根据结果继续迭代。 比如它定位出了KV Transfer场景中Python GIL导致的并发阻塞,把Prefill+KV Transfer相比单独Prefill超过20%的性能损失,压到了 1%以内 ;还在KDA Decode算子上,通过重新组织计算拿到了 1.71× 的性能提升。 也就是说,一个有点“套娃”的闭环已经出现了: GLM优化运行GLM的系统,而这套被优化后的系统,又继续承载新的GLM 。 唐杰把它概括成一句话: 模型优化系统,系统承载模型。 当然,这距离真正意义上“AI完全自主设计并训练自己的继任者”还很远。 目标怎么定、边界怎么划、风险怎么判断,目前依然是人类工程师在负责。 智谱自己也明确强调,他们还没有实现RSI 。 但这篇分享值得仔细看的原因正在这里: RSI第一次有了非常工程化、甚至已经跑进生产环境的雏形,超越了“未来某一天AI会自己变强”的抽象讨论。 以下是唐杰分享的技术Blog原文,enjoy。 “最近一次感到震动的时刻” 在GLM的研发过程中, 模型时常会涌现出一些令我们惊喜、甚至让我们感到不安的能力 。 2025年10月,我们开始启动安全能力增强研究。 当时的判断很朴素: 安全能力是代码能力的自然延伸,能够读懂复杂代码的模型,理应也能够理解代码中的漏洞。 我们没有预料它此后的走向 ,不到一年,安全伙伴使用GLM在真实代码库中发现了数千个漏洞。 模型开始改变网络安全的格局,也带来了过去不曾存在的危险。 为了让这种能力能够被负责任地使用,我们不得不为它设计受信访问计划。 最近一次感到震动的时刻,来自一个更加根本的变化: GLM开始越来越多地
