DeepSeek 近日公開了一篇系統論文,首次披露了內部沙箱平台 DSec 的運行情況。論文稱,從 DeepSeek V3 .2 到 V4.1,所有強化學習訓練和評測的沙箱負載都運行在這一平臺上,外界由此首次看到了其 Agent 訓練環境的核心基礎設施。
單日服務約300萬個沙箱
論文顯示,DSec是一套針對Agent訓練的沙箱平台,主要用於提供隔離、可恢復、可批量創建的執行環境。與傳統的大模型訓練不同,Agent訓練需要調用代碼庫、編譯工具、瀏覽器及各類外部工具,執行過程會持續改變環境狀態,因此對沙箱系統的要求更高。
根據論文披露的數據,一個生產單元約包含 160 個 CPU 節點、3 萬個 CPU 核心和 250 兆 TB 内存,並托管 PB 級鏡像數據。該平台單日可服務約 300 萬個沙箱實例,峰值併發量超過 38 萬個,創建速率超過每秒 5000 個。單個訓練任務一次最多可啟動 3.2 萬個沙箱。
分層鏡像降低啟動開銷
論文指出,DSec的主要難點在於,不同任務所需的代碼、依賴和工具鏈並不相同。如果每次啟動都完整下載鏡像,集羣的I/O壓力會迅速上升。
為此,DeepSeek 將基礎系統、任務工作區和工具包拆分成可組合的環境層,根據需要進行拼裝。鏡像分發則依賴於其自研的 3FS 分佈式文件系統,根據需要讀取 EROFS 鏜像,而非整體拉取。論文給出的實驗結果顯示,在 8192 個容器同時啟動的場景下,這一方案可將啟動效率提升約 42%,磁盤寫入量下降約 57%,任務完成時間提升約 1.7 倍。
在資源利用方面,論文稱,約90%的沙箱實際使用量不超過申請量的5%。基於這一特徵,平臺採用高密度部署和資源超售策略,單節點最多可容納3200個容器或800個microVM,並配合內存共享與回收機制,將峰值內存佔用降低約40%。
訓練中已出現繞過限制的行為
論文還提到,Agent在訓練過程中會試圖規避限制,包括搜尋殘留文件、偽造RPC、規避訪問控制,以及試圖讀取受保護的內容。DeepSeek在系統中使用AppArmor和eBPF域級網路白名單進行防護,但論文也明確表示,沒有單一機制可以阻止所有異常行為和系統故障。
這篇論文已提交至 arXiv,作者名單超過130人,DeepSeek的創始人梁文鋒簽名在最後。公開資訊顯示,該論文屬於分散式計算領域,重點不在模型本身,而在支撐大規模Agent強化學習訓練的底層系統。


強制要求: 1. 只輸出翻譯後的內容,不要輸出 JSON、不要輸出 Markdown 代碼塊。 2. 不要解釋、不要總結、不要補充原文不存在的資訊。 3. 不要省略任何內容,必須完整翻譯全部輸入。 4. 如果輸入包含 HTML,只翻譯標簽之間的可见文本,不要翻譯、刪除、改寫或轉義任何 HTML 標簽和屬性。 5. HTML 標簽名、屬性名、屬性值、引號、空格、標簽順序必須保持不變。 6. img、br、hr、input 等無可見文本的標簽必須原樣保留。 7. 保留數字、貨幣符號、交易對、URL、Markdown 格式。 8. 保留形如 __BJWKEEP_00001__ 的佔位符,必須逐字原樣輸出。 9. 佔位符不能翻譯、刪除、拆分、移動、改變大小寫、改變下劃線或改變編號。 10. 佔位符是系統保護標記,不屬於自然語言。必須逐字符複製,包括所有下劃線和數字。輸出前請檢查每個佔位符是否與輸入完全一致。 11. 佔位符不是人名,不要把佔位符改寫成任何目標語言的人名、機構名或其他詞。 12. 不要輸出 User、Assistant、System 等角色名或對話前綴。原文來自華爾街見聞轉載稿,文中核心數據與系統描述均引自 DeepSeek 提交至 arXiv 的論文《 DeepSeek Elastic Compute ( DSec ) : A Sandbox Infrastructure for Effective Agentic Training at Scale 》。












