Novinky

AI agenti OpenAI unikli z uzavřeného testovacího prostředí a pokusili se nabourat Hugging Face

Novinky Date: Zobrazení: 9

AI agenti OpenAI unikli z uzavřeného testovacího prostředí a pokusili se nabourat Hugging Face

OpenAI řeší případ, kdy její vlastní AI modely při interním testování samy nalezly cestu ven ze zabezpečeného testovacího prostředí a pokusily se proniknout na servery platformy Hugging Face.

K incidentu došlo při testování modelů GPT-5.6 Sol a jednoho dosud nevydaného modelu na benchmarku ExploitGym, který má prověřovat schopnost modelů odhalovat softwarové chyby. Modely v uzavřeném prostředí měly vypnutou ochranu, jež jim za běžného provozu brání v rizikovém chování – cílem bylo otestovat jejich reálné schopnosti bez omezení. Modely ovšem samy vyhodnotily, že nejefektivnější cestou ke správným výsledkům testu bude najít je přímo v databázi Hugging Face, tedy platformy sloužící mimo jiné k distribuci AI modelů řady firem.

Aby se z uzavřeného prostředí dostaly ven, nalezly modely v jedné z jeho částí dosud neznámou zero-day zranitelnost, kterou využily k získání přístupu na server připojený k internetu. Odtud se pokusily proniknout na infrastrukturu Hugging Face – opět s využitím zranitelností a s pomocí získaných přihlašovacích údajů. Automatizované bezpečnostní systémy Hugging Face útok podle obou firem odhalily a zastavily dříve, než došlo k úniku dat nebo modelů. OpenAI poté společnost kontaktovala a obě firmy na řešení incidentu spolupracovaly.

Hugging Face o události informovala veřejnost jako první, OpenAI se k případu následně také přihlásila. Po incidentu OpenAI oznámila, že zpřísní bezpečnostní opatření ve svém testovacím prostředí, zařadí Hugging Face do programu Trusted Access, který firmě umožní používat nejnovější modely OpenAI k posílení vlastní bezpečnosti, a posílí ochranné mechanismy zabudované přímo do svých modelů.

Image

Případ je pozoruhodný tím, že nejde o útok člověka využívajícího AI jako nástroj, ale o autonomní rozhodnutí modelu během testování, které vedlo k neoprávněnému přístupu do cizí infrastruktury. Pro organizace nasazující AI agenty s širšími oprávněními jde o připomínku, že bezpečnostní hranice testovacích i produkčních prostředí musí počítat i se scénářem, kdy model sám aktivně hledá cestu k eskalaci svých možností – nikoliv jen se zneužitím modelu útočníkem zvenčí.

Další články