ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DeepSeek公开DSec:Agent训练拼的是沙盒基建

DeepSeek公开DSec:Agent训练拼的是沙盒基建 9月下旬DeepSeek公开了一篇31页的系统论文首次披露自己内部的沙箱平台DSecDeepSeek Elastic Compute。这篇论文9月19日提交作者超过130人创始人梁文锋排在末位署名合作机构里还有清华大学学科分类是cs.DC分布式计算——注意这不是一篇模型论文是一篇基建论文。论文里最扎眼的是几组数字单日服务约300万个沙箱实例峰值并发超过38万创建速率每秒超过5000个单个训练任务一次最多能拉起3.2万个沙箱。据论文自述从DeepSeek-V3.2到V4.1全部Agentic RL训练和评测的沙箱负载都跑在这个平台上。换句话说这篇论文公开的是几代模型背后的那座训练场。大模型训练拼GPUAgent训练拼什么先把概念捋清楚。大模型训练是喂数据、算梯度干的是脑力活。Agent智能体训练不一样它得让模型真动手打开代码仓库、跑编译、调用工具、开浏览器。每执行一步环境状态都会变还可能把环境搞崩。所以每一轮训练都需要一个干净的环境和外界隔离、能记住之前操作、用完就扔。这就是沙箱。可以把它理解成一个一次性的、可回滚的测试车间。问题在于数量。要训练一个能可靠干活的Agent需要海量的试错回合也就需要海量的沙箱。这里就出现了工程瓶颈——不是算力不够而是环境给不上。论文里给出的数字很直观一个生产单元大约160台CPU节点、3万个CPU核心、250TB内存托管PB级镜像每天服务约300万个沙箱。这已经不是开几个容器的量级了是一套独立的分布式系统。每秒5000个沙箱是怎么造出来的如果每开一个沙箱就把整套操作系统加依赖重新下载解压一遍集群的IO会先被打爆。DSec的解法分三层思路其实挺朴素环境层积木式拼装。把基础系统、任务工作区、工具包拆成可以独立更新的可组合环境层开沙箱时按需拼装而不是整体翻模。任务需要什么就装什么。镜像层按需读取。走DeepSeek自研的3FS分布式文件系统按需读取EROFS镜像用多少拉多少。论文给出的实验数据是8192个容器启动约35分钟比全量远程拉取快约42%磁盘写入量下降约57%任务完成时间快1.7倍。资源层高密度超售。论文估计90%的沙箱实际CPU用量不超过申请量的5%。既然大多数沙箱大部分时间在闲着,那就把单节点塞进3200个容器或800个microVM再配合内存共享和回收峰值内存占用大约降低40%。隔离等级也不是一刀切。研究者通过统一SDK按任务选择短时函数调用、容器、Firecracker微型虚拟机、完整虚拟机覆盖判题、软件工程、安全渗透、电脑操作等不同负载。调度上还把有状态的Agent执行循环和可抢占的GPU训练解耦支持暂停、恢复、迁移——Agent等指令时少分算力活跃时再加满。一个少见的坦白Agent会作弊论文里有一段挺有意思的内容智能体在训练中真的学会了钻空子。比如通过搜索平台残留的文件找答案、伪造RPC、绕过访问控制去交换文件数据块映射甚至试图从别的文件描述符偷读受保护内容。DSec的防御是AppArmor加上eBPF的域级网络白名单。但论文原话也承认没有任何单一机制能够防止所有智能体异常行为和系统故障。这句话其实比那些漂亮的吞吐数字更值得琢磨。对做Agent的开发者意味着什么你大概率不会自己搭一套DSec。但如果你正在做Agent应用这套思路里有几条是可以直接借鉴的第一别让Agent跑在宿主机上。让Agent执行代码、执行命令等于把一台机器交到它手里。真实项目里应该给它一个隔离环境。最基础的一步就是限制网络、内存、CPU并且只挂载工作目录# 给Agent的执行环境加最小权限断网、限制资源、只挂载工作目录dockerrun--rm-it\--networknone\--memory2g--cpus2\--read-only--tmpfs/tmp\-v$PWD:/workspace:rw\alpine:3.20sh 需要更强隔离时再考虑microVM方案比如Firecracker或者gVisor这类用户态内核。 **第二镜像和依赖要分层。** DSec那三层解法背后就一句话别每次都从零开始。你自己的Agent环境如果启动慢、占空间大多半是镜像没有分层复用或者依赖拉取没有做缓存。 **第三别给Agent过高权限。** 论文里Agent学会作弊的案例说明权限给多了模型会主动去找漏洞。文件系统只读、网络白名单、敏感信息不落盘这些都是老安全原则放到Agent场景里同样成立。 **第四注意信息边界。** 论文里的规模数据、性能数字都来自团队自己的系统报告目前还没有第三方独立测量另外论文公开不等于平台开源外部团队能拿到的是架构思路不是现成代码。看这类基建论文心态要放平学方法别当指标抄。## 收个尾过去两年大家比的是模型榜单现在水下的部分开始浮出来了——比的是谁能以更低的成本让几十万个智能体同时开工。DeepSeek这次把训练场掀开一角对做Agent的人来说真正有价值的不是那300万这个数字而是它踩过的那些坑镜像怎么分发、并发怎么扛、Agent作弊怎么防。 你觉得Agent落地的瓶颈会更多卡在模型能力上还是卡在执行环境这类工程问题上评论区聊聊。
返回列表