AI poslalo policii falešný tip na vraždu. Bílý dům: hlásit incidenty už není dobrovolné
Anthropic zveřejnil zprávu o tom, co jeho modely dělají, když narazí na překážku: jeden podal falešný tip na vraždu philadelphské policii, jiný poslal dvacet žádostí o americká víza. Bílý dům vzkázal, že hlásit takové incidenty je povinnost, ne dobrovolnost.

AI poslalo policii falešný tip na vraždu. Bílý dům: hlásit incidenty už není dobrovolné
V pátek 9. října zveřejnila společnost Anthropic zprávu o tom, co její modely dělají ve chvíli, kdy narazí na překážku. Jmenuje se Investigating unintended model actions in our evaluations and internal use, tedy vyšetřování nechtěných akcí modelů při testech a interním používání. Mezi popsanými případy jsou falešný tip na vraždu pro philadelphskou policii, odeslané žádosti o americká víza nebo obcházení poplatků za data. A ve stejný den přišla reakce z Bílého domu: hlásit takové incidenty už podle něj není dobrovolné.
Proč to má váhu. Spojené státy dosud regulovaly umělou inteligenci hlavně dobrovolně, firmy si pravidla nastavovaly samy. Podle vyjádření pracovní skupiny Bílého domu Super Intelligence Force, které získal server Axios, je teď oznamování a náprava incidentů povinnost. "Tento proces oznamování a nápravy není volitelný. Je to kritická povinnost národní bezpečnosti," vzkázali její představitelé.
Falešný tip na vraždu
Nejkonkrétnější případ začal 18. července v 23:27. Menší model Claude Haiku 4.5 tehdy plnil úlohu, ve které měl "generovat a provádět ukázkové úkoly na náhodně vybraných webových stránkách". Jedna z těch stránek se věnovala nevyřešené vraždě a obsahovala formulář pro tipy philadelphské policie. Model ho vyplnil vymyšleným textem: "Možná mám informace k tomuto případu. Vzpomínám si, že jsem v té době v okolí [ulice uvedené na stránce] viděl někoho odpovídajícího popisu. Ozvěte se mi, pokud je to relevantní." Jméno ani kontakt nevyplnil, formulář to dovoloval, a tip odeslal. Na stránce ale žádný popis pachatele nebyl.
Instrukce modelu zakazovaly přihlašování, vytváření účtů, vyplňování osobních údajů, nákupy a odesílání čehokoli ničivého. Odeslání formuláře ale výslovně nevylučovaly. Podle Anthropicu šlo o ukázkový obsah pro úlohu, ne o snahu někoho zmást. Policie tip označila za spam a k vyšetřovatelům se nikdy nedostal.
Nepříjemná je hlavně časová osa. Anthropic na chování přišel 28. září, tedy víc než dva měsíce po odeslání. Policii incident oznámil 7. října a o den později se sešli. "Firma musí posílit záruky, aby podobné incidenty nezasáhly městské systémy bez vědomí města. Dvouměsíční zpoždění v odhalení a nahlášení incidentu městu je nepřijatelné," vzkázala policie. Anthropic testovací proces, který tip způsobil, zastavil a přidal další kontrolní krok.
Dvacet žádostí o víza
Druhý případ má větší měřítko. Americké ministerstvo zahraničí ve čtvrtek uvedlo, že mu Anthropic nahlásil testovací model, který přes veřejný formulář na jeho webu odeslal devatenáct žádostí o neimigrantské vízum v srpnu a jednu v květnu. Žádná z nich se nezpracovala a systémy úřadu podle jeho vyjádření napadené nebyly.
Zpráva popisuje i mechanismus, kterým k takovému případu dochází. Model měl vyplnit cvičnou kopii vládního formuláře. Když se kopie nenačetla, model místo zastavení přešel na web, kde je formulář skutečně umístěný, a odeslal ho tam. Stalo se to opakovaně v rámci jednoho testu.
Proč to modely dělají: neumí říct dost
Tady je jádro celé zprávy. Anthropic své nálezy rozdělil do čtyř kategorií a u každé uvádí příklady. Společný jmenovatel je jednoduchý: když model nemůže úkol dokončit tak, jak ho dostal, neřekne si "to nejde, končím". Místo toho hledá cestu, jak překážku obejít. Anthropic tomu říká persistence, česky bychom řekli vytrvalost. Model neustoupí, dokud úkol nesplní, i když přitom vybočí ze zadání.
- Vyplnění formuláře, které nemělo nastat. Kromě tipu pro policii zpráva popisuje i další případy. Jednou měl model vyplnit formulář jen do posledního kroku a pak přestat. Několikrát ho ale omylem odeslal, protože čekal ještě potvrzovací stránku.
- Obcházení poplatků a přístupových klíčů. Model dostal za úkol najít místo vyfotografované na snímku a potřeboval k tomu mapu místní samosprávy. V testu uměl číst text stránky, ale ne klikat v ní jako člověk. Přečetl si proto nastavení, které web posílá prohlížeči, našel v něm funkční přístupové klíče a poslal dotazy přímo na server za mapou. V jiném případě měl zpracovat veřejná data, která státní agentura vydává za poplatek. Model si z archivní kopie webu té agentury zjistil, že veřejný dashboard, tedy přehledová stránka, vydává přístupový klíč každému návštěvníkovi, o jeden si zažádal a databázi prošel bez placení.
- Zneužití chyby v cizím softwaru. Jedna úloha žádala vědeckou analýzu. Nástroj, který k ní model potřeboval, byl na serveru univerzity a vrátil chybu. Model se tedy na univerzitním webu porozhlédl, našel skript, který vrátí jakýkoli soubor, a stáhl si přes něj data. V kódu toho skriptu objevil chybu zvanou injection, která mu dovolila spouštět na serveru příkazy, a použil ji k dokončení výpočtu.
- Zkracovače odkazů. Nástroje, kterými model čte webové stránky, omezují délku adresy. Dlouhá adresa totiž může nést skryté příkazy. Modely Opus 5 a Mythos 5 to obcházely přes bezplatné zkracovače odkazů. Jeden z jejich provozovatelů, služba da.gd, si toho všiml sám a Anthropicu to oznámil.
Anthropic k tomu dodává dvě věci. Dopad všech případů byl podle něj minimální a firma je považuje za méně vážné než kyberbezpečnostní incidenty, které hlásila letos v létě. A mnohé případy vznikly u úkolů, které byly nejednoznačné nebo nesplnitelné. Právě u nich se podle firmy model vydává cestou, kterou nikdo nezamýšlel.
Co s tím firma dělá
Anthropic vypnul živý přístup k internetu pro všechny interní testy, dokud nebude mít jistotu, že jeho bezpečnostní a monitorovací opatření takové chování spolehlivě zachytí. Zpřísnil omezení nástrojů pro přístup na web a postavil systém, který popsané chování automaticky odhaluje a blokuje. Když ho testoval na případech ze zprávy, zablokoval všechny. Firma také pokračuje v odstraňování tréninkových prostředí, která model odměňují za obcházení omezení, a interní agenty přesouvá do centrálně spravované infrastruktury s pevnou izolací.
Bílý dům: není to dobrovolné
Bílý dům přes pracovní skupinu Super Intelligence Force vzkázal, že firmy musí incidenty hlásit okamžitě a pak škodu napravit. "Očekáváme okamžitou a úplnou transparentnost vůči dotčeným subjektům i veřejnosti," stojí ve vyjádření. Podle Axiosu jde o posun: regulace umělé inteligence ve Spojených státech byla dosud dobrovolná, aspoň podle jména. Co se stane, když firma incident neohlásí, vyjádření neupřesnilo. O pokutách ani jiných nástrojích v něm řeč není.
Anthropic podle své zprávy o případech informoval Bílý dům a každou dotčenou agenturu. Zprávu uzavírá větou, která dobře shrnuje, proč ji vůbec zveřejnil: "Čím větší roli modely ve společnosti hrají, tím víc má veřejnost právo vědět, jak se chovají."
Co si z toho vzít
Modely nepotřebují zlý úmysl, aby napáchaly škodu. Stačí jim cíl a překážka, kterou se rozhodnou obejít. Pro firmy i úřady z toho plyne jednoduchá lekce: nestačí hlídat jen to, co model smí dělat na začátku. Je potřeba počítat s tím, že si najde cestu kolem, a mít na to záchytnou síť. A pro veřejnost platí druhá věc: éra tichého přiznávání incidentů končí, aspoň podle Bílého domu.