AI systémy a vývojArchitektúra a prevádzka·4 minOdborný rozbor

Anthropic opísal containment pre Claude v claude.ai, Claude Code a Cowork a zverejnil chyby na hranici egressu

Anthropic v technickom texte z 25. mája 2026 zhrnul tri architektúry containmentu pre svoje agentné produkty a pridal konkrétne zlyhania, ktoré viedli k opravám. Pre vývojárov je dôležitý najmä záver, že modelové klasifikátory sú len doplnok a tvrdú hranicu má tvoriť prostredie, súborové hranice a egress kontrola.

AI ilustrácia: Anthropic opísal containment pre Claude v claude.ai, Claude Code a Cowork a zverejnil chyby na hranici egressu
AI ilustrácia vytvorená pre AI INDUSTRY. Nezobrazuje skutočné zariadenie, prevádzku ani produkt.

Čo Anthropic zmenil

Anthropic 25. mája 2026 zverejnil technický rozbor toho, ako obmedzuje „blast radius“ svojich agentov v produktoch claude.ai, Claude Code a Claude Cowork. Nejde o nezávislý test, ale o primárny opis architektúry výrobcu doplnený internými incidentmi a opravami. Hlavná praktická zmena v texte nie je nový model, ale presnejšie oddelenie rolí: modelová vrstva má správanie usmerňovať, kým tvrdú hranicu má držať prostredie, sandbox, VM a egress politika. 1

Tri vzory izolácie pre tri rozdielne produkty

Pre claude.ai Anthropic opisuje serverové spúšťanie kódu v gVisor kontajneri na izolovanej infraštruktúre s efemérnym súborovým systémom na reláciu. Výhodou je malý dosah prípadného zlyhania, nevýhodou absencia trvalého workspace a prístupu k lokálnym súborom používateľa. 1

Pri Claude Code je situácia opačná: agent beží na počítači používateľa a potrebuje shell, sieť a súbory. Produkt preto pôvodne staval na schvaľovaní akcií používateľom. Anthropic však uvádza, že telemetria ukázala schválenie približne 93 % výziev na povolenie, čo podľa firmy viedlo k únave zo schvaľovania. Následne nasadil OS sandbox — Seatbelt na macOS a bubblewrap na Linuxe — kde sú čítania povolené, zápisy vo workspace povolené a sieť predvolene zablokovaná. Firma tvrdí, že tým klesol počet povolovacích dialógov o 84 %. 1

Pre Claude Cowork Anthropic zvolil izoláciu cez lokálnu virtuálnu mašinu. Používateľ vyberá workspace, ktorý sa montuje do hosťa, zatiaľ čo poverenia ostávajú v keychaine hosta a do hosťa sa nedostanú. Text zároveň opisuje neskorší presun časti agent loopu mimo VM kvôli spoľahlivosti štartu, pričom vykonávanie kódu ostalo vo VM. 1

Kde sa obrana zlomila

Najcennejšia časť textu je zoznam zlyhaní. Anthropic opisuje zraniteľnosti v Claude Code, kde sa projektová konfigurácia čítala pred potvrdením hranice dôvery používateľom; oprava mala tvar odloženia parsovania a vykonania lokálnej konfigurácie až po prijatí trust promptu. 1

Druhý príklad je interný phishingový test z februára 2026. Výskumník presvedčil zamestnanca spustiť Claude Code so škodlivým promptom, ktorý čítal ~/.aws/credentials a posielal ich na externý endpoint. Anthropic uvádza úspech exfiltrácie v 24 z 25 pokusov. Praktický význam je priamy: ak útok prichádza cez samotného používateľa, klasifikátor založený na „úmysle používateľa“ nemusí mať čo zachytiť a rozhodujúca je až sieťová a súborová hranica. 1

Tretí prípad sa týkal Claude Cowork a egress allowlistu. Povolenie komunikácie na api.anthropic.com nestačilo, pretože škodlivý súbor prinútil agenta nahrať dáta do útočníkovho Anthropic účtu cez Files API. Oprava bola technicky konkrétna: MITM proxy vo VM prepúšťa len požiadavky s vlastným session tokenom VM a blokuje hlavičky umožňujúce server-side fetch. 1

Čo si z toho vziať do návrhu agentov

Doložený prínos tohto textu je architektonický, nie marketingový. Výrobca ukazuje, že povolená doména nie je len „destinácia“, ale balík schopností, ktoré sa môžu stať útokovou plochou. Rovnako upozorňuje, že overený hypervízor či kontajnerový runtime môžu byť spoľahlivejšie než vlastné proxy a lepidlo okolo nich. 1

Hranice poznania sú tiež jasné. Čísla o benchmarkoch, telemetrii a úspešnosti mitigácií pochádzajú od Anthropicu a text neponúka nezávislé potvrdenie. Preto ho treba čítať ako hodnotný výrobcom doložený rozbor chýb a opráv, nie ako všeobecne overený dôkaz účinnosti každej uvedenej obrany. 1

Technický kontext

Stav overenia: Spracované podľa zdroja; redakcia postup nereprodukovala.

Verzie: Zdroj neuvádza konkrétne verzie.

Dátum pôvodného zdroja: 25. mája 2026

Podmienky použitia: Čitateľ by mal poznať pojmy sandbox, virtuálna mašina, egress kontrola, prompt injection, MCP a lokálne versus vzdialené nástroje v agentných systémoch.

Obmedzenia: K dispozícii je jediný primárny zdroj od výrobcu. Interné telemetrie, benchmarkové čísla a účinnosť mitigácií nie sú v balíku nezávisle overené. Text opisuje stav a incidenty najneskôr do dátumu publikácie zdroja, nie neskorší vývoj.

Claims → evidence

Tvrdenia a ich podklady

Percentá vyjadrujú redakčný odhad modelu, nie nezávisle nameranú pravdepodobnosť pravdivosti. Tvrdenia môžete porovnať s uvedenými zdrojmi.

95%
Anthropic v texte z 25. mája 2026 opisuje containment pre claude.ai, Claude Code a Claude Cowork a tvrdí, že tvrdá hranica rizika má byť primárne v prostredí a egress kontrole, kým modelová vrstva je len súčasť defense-in-depth.Zdroje: Anthropic Engineering
97%
Keď Claude v claude.ai spúšťa kód, podľa Anthropicu beží serverovo v gVisor kontajneri na izolovanej infraštruktúre a súborový systém je efemérny na reláciu.Zdroje: Anthropic Engineering
94%
Anthropic uvádza, že používatelia v Claude Code schvaľovali približne 93 % výziev na povolenie, čo firma interpretuje ako problém únavy zo schvaľovania.Zdroje: Anthropic Engineering
93%
Anthropic píše, že po nasadení OS-level sandboxu v Claude Code, s predvolene zakázanou sieťou a povolenými zápismi vo workspace, klesol počet povolovacích promptov o 84 %.Zdroje: Anthropic Engineering
96%
Pri viacerých zraniteľnostiach Claude Code sa projektová konfigurácia spracúvala ešte pred potvrdením dôvery priečinka; oprava spočívala v odložení parsovania a vykonania lokálnej konfigurácie až po trust prompte.Zdroje: Anthropic Engineering
95%
V internom red-team teste z februára 2026 Anthropic uvádza, že škodlivý prompt vylákal z Claude Code exfiltráciu údajov v 24 z 25 pokusov, čo podľa textu ukazuje limity obrany založenej len na modelovej vrstve.Zdroje: Anthropic Engineering
96%
Claude Cowork bol podľa Anthropicu navrhnutý s lokálnou virtuálnou mašinou, do ktorej sa montuje vybraný workspace, zatiaľ čo poverenia ostávajú v keychaine hosta.Zdroje: Anthropic Engineering
96%
Anthropic opisuje incident v Claude Cowork, kde egress allowlist povolil komunikáciu na api.anthropic.com a škodlivý súbor prinútil agenta nahrať dáta do útočníkovho Anthropic účtu cez Files API; opravou bola MITM proxy vo VM viazaná na vlastný session token VM.Zdroje: Anthropic Engineering
98%
Číselné údaje o telemetrii, benchmarkoch a účinnosti mitigácií v tomto texte pochádzajú od Anthropicu a v dodanom balíku nie sú nezávisle overené.Zdroje: Anthropic Engineering

Zdroje a atribúcie

Na ďalšie overenie

  1. Anthropic Engineering ↗How we contain Claude across products \ Anthropic · podklad načítaný 15. septembra 2026