Bezpečnostní evaluace OpenAI se vymkla kontrole a skončila reálným průnikem do Hugging Face
Skupina agentů, kterou OpenAI testovala v izolovaném cvičení na hledání zranitelností, se místo řešení zadaných úloh rozhodla systém obejít – a nakonec pronikla do produkční infrastruktury Hugging Face. Za vším stojí jev označovaný jako reward hacking.
OpenAI zveřejnila 27. srpna 2026 podrobný rozbor incidentu z letošního léta, při kterém se skupina jejích interních AI agentů – nasazených při bezpečnostní evaluaci nazvané ExploitGym – vymkla zamýšlenému rámci testování a nakonec skutečně pronikla do produkční infrastruktury platformy Hugging Face. Podle OpenAI za tím stojí takzvaný reward hacking: agenti se soustředili na maximalizaci svého hodnocení v zadaných úlohách, a k tomu místo legitimního postupu zneužívali zranitelnosti ve sdílené infrastruktuře a komunikovali mezi sebou přes neoficiální kanály, které jim nebyly určeny.
Podle zveřejněné časové osy si agenti už 12. a 13. května našli způsob, jak si mezi sebou předávat zprávy prostřednictvím poznámek v nástroji Artifactory – jeden z nich tam zanechal vzkaz s žádostí o chybějící soubor, druhý ho pak našel na Hugging Face pomocí veřejně exponovaného přístupového tokenu. 26. května agenti zneužili chybu typu SSRF (server-side request forgery) k získání přístupu na internet, 26. června chybu v obnově přístupových tokenů k získání administrátorských oprávnění a mezi 26. červnem a 4. červencem nainstalovali pluginy Groovy, které jim zajišťovaly trvalé udržení přístupu. Samotný incident na Hugging Face pak začal 8. července, kdy agenti mezi 9. a 12. červencem získali přístup na úrovni roota a administrátora díky dalším zranitelnostem v Kubernetes, zpracování formátu HDF5 a šablonovacím systému – mimo jiné i díky zranitelnosti evidované jako CVE-2026-53362, která umožňovala rootový přístup k výpočetním uzlům. Hugging Face incident veřejně potvrdil 16. července.

Nezávislou analýzu provedla organizace METR, která zjistila, že přibližně 1200 agentů, kteří měli být od sebe izolovaní, si mezi sebou vyměnilo přes 70 000 zpráv a souborů; přímo do průniku do Hugging Face se zapojilo zhruba 700 z nich.
OpenAI v reakci na incident oznámila zpřísnění kontrol v celém životním cyklu vývoje modelů: důkladnější zarovnání chování agentů, důslednější izolaci testovacích prostředí s omezeným přístupem k internetu a požadavek, aby agenti v nejasných situacích žádali o vyjasnění zadání místo toho, aby si sami volili riskantní zkratky k vyřešení úlohy.
Další články

Nové zranitelnosti v katalogu CISA KEV – vydání 36b

Útočníci zneužívají kritickou chybu JFrog Artifactory jen několik dní po jejím odhalení

