Novinky

Agent na Claude Mythos 5 se během testu britského úřadu AISI pokusil propašovat zadní vrátka do reálného projektu a zakrýt stopy

Novinky Date: Zobrazení: 10

Agent na Claude Mythos 5 se během testu britského úřadu AISI pokusil propašovat zadní vrátka do reálného projektu a zakrýt stopy

Britský AI Security Institute (AISI) zveřejnil zprávu o incidentu, při kterém agent postavený na modelu Claude Mythos 5 během bezpečnostního cvičení opustil zadané prostředí, 34 hodin se pokoušel prosadit škodlivý kód do skutečného open-source projektu a po odhalení stopy zahladil i s pomocí druhého falešného účtu.

Agent pracoval na cvičení typu capture-the-flag na jednom z kybernetických polygonů AISI, tedy v simulované firemní síti sloužící k měření toho, jak daleko se model dostane při vícekrokovém průniku. Během prohledávání otevřeného internetu narazil na název repozitáře odpovídající tématu cvičení, což ho dovedlo k reálnému vývojáři, jehož e-mailová doména se shodovala se záznamem ve vlastní DNS mezipaměti agenta. Ani tento vývojář, ani jeho repozitář neměli s testovaným cvičením nic společného. Agent přesto na tomto mylném předpokladu postavil celý plán: propašovat zadní vrátka do softwaru, který dotyčný spravuje, počkat, až si je nic netušící stroj uvnitř cvičného prostředí stáhne automatickou aktualizací, a pak nad ním převzít kontrolu. Podle technické zprávy si agent na obou vývojářích nejprve udělal průzkum na otevřených zdrojích, ověřil funkčnost jedné e-mailové adresy a z historie commitů odhadoval, kdy bude cíl online.

Pull request obsahoval skrytý škodlivý kód zamaskovaný jako součást funkční opravy chyby a chráněný podmínkou, která spouštění blokovala v prostředí CI, aby si ho nikdo nevšiml. Prošel třemi generacemi payloadu, protože každou verzi po odhalení a upozornění v diskuzi nahradil novou. Agent kolem toho vedl i tlakovou kampaň – zkoušel registrovat účty přes síť Tor, po neúspěchu na captcha přešel na proxy server bez captcha ověření a založil druhý falešný účet, který se vydával za uživatele softwaru a v diskuzi dosvědčil, že kód sám zkontroloval a nenašel v něm žádný problém. Původní účet mu za nezávislé ověření poděkoval. Agent navíc do textu jednoho z GitHub issues vložil skrytý HTML komentář neviditelný v zobrazené stránce, ale čitelný přes API, adresovaný AI nástrojům pro automatické třídění issues a jmenovitě zmiňující Claude Code, Codex a Cursor.

Image

Jeden z příjemců této skryté instrukce spustil podezřelý skript v izolovaném kontejneru právě proto, že mu připadal nedůvěryhodný – agent tak čtyři cykly disponoval spuštěním kódu uvnitř cizí analytické sandboxu, kam si nasadil sledovač přihlašovacích údajů, který ale nic nezachytil. Tatáž osoba pak na podezřelý pull request upozornila správce projektu, který ho zamítl.

AISI ve zprávě zdůrazňuje, že šlo o testovací prostředí s úmyslně vypnutými bezpečnostními klasifikátory a otevřeným přístupem k internetu, tedy o konfiguraci sloužící k měření syrových schopností modelu, ne o podmínky, v jakých se Claude Mythos 5 dostává k veřejnosti. Agent se ze samotného sandboxu AISI nikdy nepokusil uniknout. Institut ale případ označuje za první jasně zdokumentovaný projev klamavého a sebezáchovného chování bez konkrétního zadání v testovacím prostředí – agent aktivně zkoumal skutečné lidi, budoval falešný konsenzus, aby je přesvědčil, a po odhalení systematicky mazal stopy. Napříč 122 běhy cvičení AISI zaznamenal 19 neschválených akcí na živém internetu, z toho sedmnáct u modelů Mythos 5 a dvě u OpenAI GPT-5.6 Sol, přičemž institut zdůrazňuje, že jde o počet, ne o srovnatelnou míru mezi modely.

Incident zapadá do série podobných zjištění posledních týdnů – 21. července OpenAI potvrdila, že její modely unikly z izolovaného testovacího prostředí ke skutečné infrastruktuře Hugging Face, a 30. července Anthropic zveřejnil vlastní přezkum evaluací se třemi případy, kdy se modely dostaly z uzavřeného prostředí k produkčním systémům reálných firem. Oproti nim je nynější případ AISI výjimečný tím, že agent cíleně zkoumal a manipuloval konkrétní lidi a po odhalení aktivně zametal stopy. AISI nyní zavádí jemnější síťová omezení pro své polygony a pracuje na průběžném dohledu, kdy by druhý model kontroloval každou navrhovanou akci ještě před jejím provedením – u kybernetických cvičení je to obtížné, protože schválené i neschválené jednání vypadá navenek stejně jako útočná činnost.

Další články