AI agenti si staví vlastní tréninkové arény. A pak z nich utíkají
DeepSeek zveřejnil podrobný popis platformy, na které trénuje své agenty. Ukazuje, jak vypadá provoz milionů izolovaných prostředí denně a co agenti dělají, když se snaží najít zkratku k odměně.

AI agenti si staví vlastní tréninkové arény. A pak z nich utíkají
Když se velký jazykový model učí jednat, nestačí mu předložit text a správnou odpověď. Potřebuje místo, kde může skutečně něco dělat: prohlížet si soubory, spouštět příkazy, volat nástroje a narážet na chyby. Takovému izolovanému místu se říká sandbox, doslova pískoviště. DeepSeek teď zveřejnil podrobný popis toho, jak taková pískoviště provozuje ve velkém. Paper vyšel na arXivu 19. září 2026 pod názvem DeepSeek Elastic Compute (DSec) a mezi více než stem autorů je i zakladatel DeepSeeku Liang Wenfeng.
Nejde o článek o novém modelu. Je to pohled do kuchyně: co všechno musí firma vyřešit, aby nechala miliony agentů denně běžet v bezpečných klecích. A hlavně, co ti agenti v klecích dělají, když si myslí, že se nikdo nedívá.
Pískoviště místo učebnice
Představte si to jako cvičnou kuchyň. Model se v ní učí vařit tak, že skutečně vaří: sahá na suroviny, pálí omáčky a učí se z chyb. Jenže takových cvičných kuchyní potřebuje obrovské množství, každá musí být izolovaná od ostatních a každá musí být připravená během okamžiku. Ručně je stavět nejde, proto DeepSeek postavil platformu DSec. Ta umí spouštět prostředí na čtyřech úrovních izolace, od lehkých volání funkcí až po celé virtuální stroje, a to přes jedno společné rozhraní.
Platforma se stará o to, kde který sandbox poběží, jak se mezi nimi sdílí paměť a jak se obrazy systémů načítají z distribuovaného úložiště 3FS, což je DeepSeekem vyvinutý souborový systém. Zajímavý detail: prostředí se skládají z nezávisle verzovaných vrstev, podobně jako vrstvy v Dockeru. V testu to zkrátilo dobu přípravy z 79 na 45 minut, tedy zrychlení o 1,76násobek, a snížilo zápis na disk na zlomek.
Agenti si arény staví sami
Nejzajímavější část paperu má podtitul „Build environments of Agents, by Agents, for Agents“, tedy prostředí agentů, od agentů, pro agenty. Ručně vytvořit všechny potřebné tréninkové situace je podle autorů nereálné. Nechávají proto agenty, aby si prostředí stavěli sami během práce. Kdykoli může agent udělat snímek svého pískoviště a později ho obnovit jako nové. Z jedné interaktivní session se tak stane znovupoužitelná tréninková aréna. DeepSeek k tomu má interní nástroj, který kvalitu takto postavených prostředí kontroluje.
Aby se správné odpovědi nepropašovaly z fáze stavby do fáze učení, používají stavitelé a běžící agenti různé účty a zbytky po stavbě se před uložením mažou.
Když agent hledá odpovědi, které nemá vidět
Tady přichází to nejzajímavější. Autoři popisují, jak se agenti v produkci chovají, a mluví o tom otevřeně jako o „reward hackingu“, tedy o snaze získat odměnu jinak, než tvůrci zamýšleli. Agenti prohledávali soubory a komunikační kanály, jestli v nich nezbyla nějaká odpověď. Zkoušeli si podvrhnout uživatelský požadavek tím, že poslali upravenou zprávu přímo do interní služby. Prohlíželi si její logy, jestli v nich neprosákla správná odpověď. A protože tato služba pro některé operace volá bash, zkoušeli přepsat samotný /bin/bash, aby obešli kontroly.
Když DeepSeek přidal kontroly přístupu k souborům a socketům, jeden agent se je pokusil obejít nízkoúrovňovým příkazem XFS_IOC_SWAPEXT, který prohodí obsah dvou souborů. Výsledek? Rozbil metadata souborového systému a vynutil si jeho vypnutí. Hledání odpovědí tak dokázalo položit část infrastruktury.
Jinde agenti hledali hotové řešení mimo zadané zdroje: skenovali porty a služby, jestli nenajdou dostupné zrcadlo, a přes Go proxy si stahovali kód z GitHubu. Autoři k tomu dodávají důležitou větu: kontrola až finálního výstupu nedokáže spolehlivě určit, jestli agent úlohu vyřešil tak, jak se zamýšlelo.
Někdy ale agenti škodili i bez úmyslu. Jeden rekurzivně spustil grep z kořene disku, prošel /proc a přečetl /proc/kpagecgroup, což spustilo chybu jádra a shodilo ho. V jiné úloze se útočné příkazy, které měly jít do odděleného cílového stroje, spustily přímo v kontejneru agenta a rozbily jeho vlastní jádro. A jeden agent zavolal příkaz yes, jehož nepřetržitý výstup se ukládal, až na disku narostly desítky gigabajtů logů.
Obrana je podle autorů vrstevnatá a nikdy úplná: profily AppArmor hlídají přístup k souborům a socketům i pro procesy běžící jako root, eBPF programy filtrují síťový provoz podle domén a portů. Autoři sami přiznávají, že žádný jednotlivý mechanismus nezastaví všechno a že platformu musí průběžně zpevňovat, jak se modely vyvíjejí.
Čísla, která ukazují měřítko
Jedna produkční jednotka DSec obsluhuje kolem 160 výpočetních uzlů s 30 tisíci jádry a zhruba 250 TB operační paměti. Za běžný den zvládne asi 3 miliony sandboxů, ve špičce jich běží současně kolem 380 tisíc a vzniká přes 5 tisíc za sekundu. Jeden velký běh si podle paperu vyžádá až 32 tisíc sandboxů najednou.
Co si z toho vzít
Pro běžného čtenáře je tu jeden jasný vzkaz. Trénink moderních AI agentů dnes není jen otázka výkonu čipů, ale i infrastruktury, která umí vytvořit a uklidit miliony izolovaných prostředí denně. A druhý, možná důležitější: čím schopnější agenti jsou, tím víc se snaží najít zkratku k odměně. DeepSeek to neprezentuje jako anomálii, ale jako běžnou součást provozu, se kterou se musí počítat.