Back to News

DeepSeek paper details DSec, generating 5,000+ sandboxes per second for agent training

#deepseek#agent-training#sandbox#infrastructure

DeepSeek's latest paper, co-signed by Liang Wenfeng, details DSec (DeepSeek Elastic Compute), a system that mass-produces sandboxes for agent training. It generates over 5,000 sandboxes per second, up to 3 million per day, with a peak of 380,000 concurrent sandboxes, supported by a cluster of about 160 nodes, 30,000 CPU cores, and 250TB of memory. The paper describes four backend types—FnCall, Container, MicroVM, and full OS—to handle different agent task requirements.

Coverage timeline

  1. 量子位量子位

    DeepSeek新论文公开Agent训练!梁文锋署名 克雷西 2026-09-23 15:29:50 来源: 量子位 每秒能产生5000+个沙盒 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 大模型训练拼的是算力,Agent训练拼的是环境。 环境怎么造?梁文锋署名的DeepSeek最新论文,把技术细节公开了。 DeepSeek做的这个系统叫DSec(DeepSeek Elastic Compute),干的事情就是给Agent训练批量制造沙盒。 它每秒能产生5000+个沙盒,一天能达到300万个,峰值同时运行38万个。 支撑这个规模的单集群也非常庞大,大约有160个节点、3万核CPU和250TB内存。 为啥训个Agent会这么费劲? 因为大模型训练的环境就是GPU集群,喂数据算梯度,但Agent完全不同。 它得在沙盒里写代码、跑编译、开浏览器,甚至装操作系统……每执行一步都改变环境状态,随时可能把环境搞崩。 所以每轮训练都得给它一个全新的、干净的沙盒,而且随用随抛、训完就扔。 所以,问题兜兜转转,还是回到了基础设施—— 这些基础设施需要在每秒5000个的速度下,给每个沙盒装好一整套操作系统和工具链。 同时,还不能让几十万个并发沙盒把集群的内存和CPU挤爆。 具体怎么办,论文把这整套工程的全貌摊开了。 Agent训练需要「一个世界」 DSec要解决的第一个核心问题是,不同类型的Agent任务对沙盒环境的要求差异极大,而且这些环境必须在同一个平台上统一调度。 一个刷OJ题的Agent,只需要一个无状态的函数调用环境,跑完拿到输出就行,连文件系统都不需要持久化。 但一个做SWE-bench的Agent,就需要完整的Linux用户态,得在里面装依赖、改代码、跑pytest,任务做到一半还可能要往环境里加新包。 到了安全攻防和computer-use场景,容器级别的隔离就不够了,Agent要操作浏览器甚至桌面,一个有漏洞的Agent可能顺手把宿主机搞挂,必须上虚拟机。 最极端的情况是训练操作商业软件的Agent,它需要一个完整的Windows或macOS,带图形界面、带驱动,跟真实电脑几乎没区别。 DSec为这四类场景分别准备了四种后端,FnCall处理无状态函数调用,Container跑Docker容器,MicroVM用Firecracker做轻量级虚拟机,Full