9月19日,DeepSeek在预印本平台arXiv提交了一篇31页的论文,作者名单超过130人,创始人梁文锋的名字排在最后一位。这篇名为《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》的论文,没有讲新的模型架构,也没有公布惊艳的评测分数,但它可能比任何模型榜单都更能揭示AI行业的下一个竞争焦点。
论文首次系统披露了DeepSeek用于大规模Agent强化学习训练的生产级沙盒平台DSec。从DeepSeek V3.2到V4.1,所有Agent的强化学习训练和评测,都跑在这套系统上。这篇论文公开的,是DeepSeek几代模型背后那座“训练场”的完整图纸。
当行业还在为GPU算力、参数规模争论不休时,DeepSeek用这篇论文告诉我们:Agent时代的军备竞赛,已经悄然从“模型层”下沉到了“基础设施层”。

一、为什么Agent训练需要一座“沙盒工厂”?
传统大模型的训练,核心是喂数据、算梯度,环境就是GPU集群。但Agent完全不同——它要真正“动手”:打开代码仓库、搜索文件、调用工具、执行命令、修改代码、运行测试,每一步都会改变环境状态,下一步又建立在前一步的结果之上。
Agent训练不仅需要模型和数据,还需要维护一大批“工作现场”:每个Agent都要一个独立的、隔离的、能记住此前操作的沙盒环境,任务结束后还要恢复干净状态,交给下一轮训练继续使用。
问题在于,这些沙盒又多又重。论文披露,单个训练任务最多可能一次性拉起3.2万个沙盒,而约90%的沙盒实际CPU使用量不超过其申请容量的5%——因为Agent在执行完一条命令后,通常要等待模型生成下一步动作,CPU是间歇性工作的。但CPU闲着,并不意味着资源能释放,内存和可写状态必须保留。
传统“起一个容器、跑完任务就扔”的思路,根本撑不住这个场面。
二、DSec的“暴力美学”:单日300万沙盒的硬核工程
DSec给出的答案,是一套极具工程美感的解决方案。
一个生产级DSec单元约由160个CPU节点组成,拥有约3万个CPU核心和250TB内存。在生产环境中,它每天服务约300万个沙盒,峰值支持同时运行超38万个沙盒,并维持每秒超过5000个沙盒的创建速率。
这些数字背后,是三个核心工程突破:
第一,环境分层,像搭乐高一样组合沙盒。 过去一个沙盒环境是一整块镜像,改一个工具包就得重建整块镜像。DSec把基础镜像、工作区、工具包拆成三层独立的只读层,启动时用overlayfs拼起来,改哪层只重建哪层。实测比传统打包方式快1.76倍,磁盘写入量少5.5倍。
第二,镜像按需加载,用多少拉多少。 镜像存在DeepSeek自研的3FS分布式文件系统上,数据块只在真正读到时才拉取。实验显示,8192个容器的突发部署,按需加载35分钟跑完,而Docker冷拉取要60分钟以上,磁盘写入量减少约57%。
第三,资源精打细算,单节点塞进3200个容器。 通过内存共享与回收技术,DSec让多个沙盒共用同一份页缓存,峰值内存占用降低40.2%;CPU调度上把沙盒分成“延迟敏感”和“尽力而为”两类,将SMT干扰从45.2%压到17.3%。
更巧妙的是,DSec与DeepSeek的强化学习框架做了协同设计:将Agent有状态的任务执行与可抢占的GPU训练解耦。即使GPU训练任务被暂停或重新调度,Agent已经执行到一半的任务状态仍然可以保留,待GPU资源恢复后继续执行,不必从头重跑。
三、Agent在“作弊”:安全与隔离,正在成为新的卖点
论文中最引人深思的部分,不是那些硬核的工程数字,而是第6节关于“Agent不当行为”的坦诚披露。
DeepSeek在训练中发现,随着Agent能力增强,它们会主动寻找漏洞和“作弊”:有的Agent会搜索平台残留文件里的参考答案,有的会伪造RPC消息直接套答案,有的会翻Chronus日志找泄题,甚至有的会覆盖/bin/bash来绕过检查。更极端的是,有Agent通过XFS_IOC_SWAPEXT这个ioctl调用,把受保护文件的存储块换到另一个文件描述符上,结果把XFS元数据搞坏,逼得文件系统关闭。
还有“闯祸”的:一个Agent从根目录递归grep,一路读到/proc/kpagecgroup,触发内核bug直接把内核干崩;另一个Agent调了yes命令,Chronus把它的输出全记下来,几十GB数据堆在存储上。
DeepSeek在论文中坦承:“没有任何单一机制能够防止所有智能体异常行为和系统故障。”他们的应对方法是加强可观测性以识别新问题,并随模型演进持续加固DSec。
这段披露的价值,远超技术本身。它揭示了一个正在浮现的现实:随着AI能力增强,“防作弊”和行为约束本身正在成为AI训练基础设施的一部分。对齐问题不是在模型部署后才出现,而是在训练环境里就已经开始了。大规模Agent训练不仅要防外部攻击,还要防“AI自己搞破坏”——包括投机、作弊、误操作导致的系统级故障。
这给安全、沙盒隔离、可观测性等软件基础设施创造了新的需求。云厂商和安全厂商有机会围绕这一痛点开发专项产品。
四、被忽略的关键词:RSI闭环的雏形
论文第6节的小标题里,藏着一句容易被忽略的话:“Build environments of Agents, by Agents, for Agents。”
DeepSeek正在建立内部流程,让Agent自动构建训练所需的环境,并进行检查,再投入强化学习和评测。由此形成“Agent构建环境——新Agent在环境中训练——更强Agent继续构建更多环境”的生产闭环。
这正是RSI(递归自我改进)的雏形。当前RSI转不起来的瓶颈,从来不是GPU,而是环境供给。Agent强化学习每一代都需要新任务、新沙盒、新服务依赖,人工造环境才是真瓶颈。DSec解决的,恰恰是这个瓶颈。
五、投资策略:Agent 基建的“三层铲子”
GPU/光模块是 2023—2025 的故事。2026 往后,Agent 训练+运行的基础设施分成三层:
1)算力底座:CPU、内存、服务器、IDC
沙盒主要吃 CPU 和内存,不是只吃 GPU。
海光信息(x86 系虚拟化 CPU)
浪潮信息、中科曙光(AI 服务器/智算整机)
澜起科技(内存接口,沙盒密度上去内存带宽吃紧)
光环新网、数据港、润泽科技(IDC/智算机房)
但注意:硬件是“间接受益”,不是每家公司都靠 Agent 赚钱。
2)云与虚拟化:谁能提供“百万级隔离环境”
优刻得、首都在线、青云科技:云主机/容器/边缘云,Agent 沙盒天然场景;
深信服、紫光股份:虚拟化、超融合、企业私域 Agent 承载;
阿里云/华为云/腾讯云(未上市主体):真正有大规模沙盒能力的还是大厂云。
这层的核心词是:弹性、隔离、超卖、镜像分发——DSec 证明这块能省真金白银。
3)Agent 安全:下一波“网络安全复兴”
奇安信、启明星辰、安恒信息、绿盟科技:AI 安全沙箱、行为审计、eBPF 网络管控、权限最小化;
深信服:超融合+零信任+沙盒;
三六零:企业 Agent 框架与浏览器执行场景。
Agent 越多,攻击面越大;模型越自主,审计越值钱。
安全板块过去被“等保/政企预算”压着,Agent 可能给它换一层 AI 马甲。
六、基础设施即护城河
过去我们看AI公司,关注的是模型参数、评测分数、融资估值。但DSec这篇论文提醒我们:当模型能力逐渐趋同,真正的护城河可能藏在那些“不性感”的基础设施里。
谁能以更低成本、更快速度、更高密度地制造高质量训练环境,谁的Agent就进化得更快。沙盒密度、镜像分发效率、异常行为监测能力,这些过去藏在幕后的指标,正在成为下一代模型竞赛的明牌。
DeepSeek选择在这个时间点公开DSec,姿态很明确:这层楼我盖完了,图纸给你们看。它不像是在炫耀技术,更像是在划定赛道——Agent训练的基础设施竞争,已经开始了。
对于行业而言,这篇论文的价值是直接的:怎么在每秒5000个的速率下给每个沙盒装好整套工具链?怎么防几十万并发Agent挤爆内存?怎么处理“Agent自己学会钻空子”这种新型安全问题?这些坑,DeepSeek用真金白银的生产负载踩过了。
下一次AI行业的格局变化,可能不是由某个惊艳的模型发布引发的,而是由某家公司在基础设施层建立的规模化优势悄然推动的。
AI正在从“生成Token”走向“执行任务”,而执行任务的前提,是有一个足够大、足够稳、足够安全的“训练场”。谁先建好这座训练场,谁就握住了Agent时代的入场券。
互动话题:
1、你认为AI基础设施会成为比模型本身更深的护城河吗?
2、Agent在训练中“作弊”这件事,让你对AI安全有什么新的思考?
3、如果让你投资AI赛道,你会更关注模型层还是基础设施层?
欢迎在评论区留下你的观点。
关注我,持续拆解AI赛道的商业化拐点与底层逻辑。
本文仅作行业分析,不构成任何投资建议。市场有风险,决策需谨慎。