Anthropic opísal containment pre Claude v claude.ai, Claude Code a Cowork a zverejnil chyby na hranici egressu
Anthropic v technickom texte z 25. mája 2026 zhrnul tri architektúry containmentu pre svoje agentné produkty a pridal konkrétne zlyhania, ktoré viedli k opravám. Pre vývojárov je dôležitý najmä záver, že modelové klasifikátory sú len doplnok a tvrdú hranicu má tvoriť prostredie, súborové hranice a egress kontrola.
Čo Anthropic zmenil
Anthropic 25. mája 2026 zverejnil technický rozbor toho, ako obmedzuje „blast radius“ svojich agentov v produktoch claude.ai, Claude Code a Claude Cowork. Nejde o nezávislý test, ale o primárny opis architektúry výrobcu doplnený internými incidentmi a opravami. Hlavná praktická zmena v texte nie je nový model, ale presnejšie oddelenie rolí: modelová vrstva má správanie usmerňovať, kým tvrdú hranicu má držať prostredie, sandbox, VM a egress politika. 1
Tri vzory izolácie pre tri rozdielne produkty
Pre claude.ai Anthropic opisuje serverové spúšťanie kódu v gVisor kontajneri na izolovanej infraštruktúre s efemérnym súborovým systémom na reláciu. Výhodou je malý dosah prípadného zlyhania, nevýhodou absencia trvalého workspace a prístupu k lokálnym súborom používateľa. 1
Pri Claude Code je situácia opačná: agent beží na počítači používateľa a potrebuje shell, sieť a súbory. Produkt preto pôvodne staval na schvaľovaní akcií používateľom. Anthropic však uvádza, že telemetria ukázala schválenie približne 93 % výziev na povolenie, čo podľa firmy viedlo k únave zo schvaľovania. Následne nasadil OS sandbox — Seatbelt na macOS a bubblewrap na Linuxe — kde sú čítania povolené, zápisy vo workspace povolené a sieť predvolene zablokovaná. Firma tvrdí, že tým klesol počet povolovacích dialógov o 84 %. 1
Pre Claude Cowork Anthropic zvolil izoláciu cez lokálnu virtuálnu mašinu. Používateľ vyberá workspace, ktorý sa montuje do hosťa, zatiaľ čo poverenia ostávajú v keychaine hosta a do hosťa sa nedostanú. Text zároveň opisuje neskorší presun časti agent loopu mimo VM kvôli spoľahlivosti štartu, pričom vykonávanie kódu ostalo vo VM. 1
Kde sa obrana zlomila
Najcennejšia časť textu je zoznam zlyhaní. Anthropic opisuje zraniteľnosti v Claude Code, kde sa projektová konfigurácia čítala pred potvrdením hranice dôvery používateľom; oprava mala tvar odloženia parsovania a vykonania lokálnej konfigurácie až po prijatí trust promptu. 1
Druhý príklad je interný phishingový test z februára 2026. Výskumník presvedčil zamestnanca spustiť Claude Code so škodlivým promptom, ktorý čítal ~/.aws/credentials a posielal ich na externý endpoint. Anthropic uvádza úspech exfiltrácie v 24 z 25 pokusov. Praktický význam je priamy: ak útok prichádza cez samotného používateľa, klasifikátor založený na „úmysle používateľa“ nemusí mať čo zachytiť a rozhodujúca je až sieťová a súborová hranica. 1
Tretí prípad sa týkal Claude Cowork a egress allowlistu. Povolenie komunikácie na api.anthropic.com nestačilo, pretože škodlivý súbor prinútil agenta nahrať dáta do útočníkovho Anthropic účtu cez Files API. Oprava bola technicky konkrétna: MITM proxy vo VM prepúšťa len požiadavky s vlastným session tokenom VM a blokuje hlavičky umožňujúce server-side fetch. 1
Čo si z toho vziať do návrhu agentov
Doložený prínos tohto textu je architektonický, nie marketingový. Výrobca ukazuje, že povolená doména nie je len „destinácia“, ale balík schopností, ktoré sa môžu stať útokovou plochou. Rovnako upozorňuje, že overený hypervízor či kontajnerový runtime môžu byť spoľahlivejšie než vlastné proxy a lepidlo okolo nich. 1
Hranice poznania sú tiež jasné. Čísla o benchmarkoch, telemetrii a úspešnosti mitigácií pochádzajú od Anthropicu a text neponúka nezávislé potvrdenie. Preto ho treba čítať ako hodnotný výrobcom doložený rozbor chýb a opráv, nie ako všeobecne overený dôkaz účinnosti každej uvedenej obrany. 1
Technický kontext
Stav overenia: Spracované podľa zdroja; redakcia postup nereprodukovala.
Verzie: Zdroj neuvádza konkrétne verzie.
Dátum pôvodného zdroja: 25. mája 2026
Podmienky použitia: Čitateľ by mal poznať pojmy sandbox, virtuálna mašina, egress kontrola, prompt injection, MCP a lokálne versus vzdialené nástroje v agentných systémoch.
Obmedzenia: K dispozícii je jediný primárny zdroj od výrobcu. Interné telemetrie, benchmarkové čísla a účinnosť mitigácií nie sú v balíku nezávisle overené. Text opisuje stav a incidenty najneskôr do dátumu publikácie zdroja, nie neskorší vývoj.
Claims → evidence
Tvrdenia a ich podklady
Percentá vyjadrujú redakčný odhad modelu, nie nezávisle nameranú pravdepodobnosť pravdivosti. Tvrdenia môžete porovnať s uvedenými zdrojmi.
Zdroje a atribúcie
Na ďalšie overenie
- Anthropic Engineering ↗How we contain Claude across products \ Anthropic · podklad načítaný 15. septembra 2026