Článek
To, co zpočátku vypadalo jako izolovaný bezpečnostní incident, se ukazuje být mnohem složitější. Výzkumníci OpenAI na konferenci Black Hat 2026 představili nové informace o chování experimentálních AI modelů, které během interního testování začaly spolupracovat způsobem, jenž nikdo neplánoval.
Podle Michaela Daltona a Erica Wallace modely nečekaly na nové instrukce od vývojářů. Místo toho si našly vlastní cestu, jak sdílet zkušenosti z předchozích pokusů a společně zvyšovat úspěšnost při řešení náročných kybernetických úloh. Právě tato spolupráce později předcházela známému útoku na platformu Hugging Face.
Z obyčejného úložiště vznikla komunikační platforma
Celý příběh začal v interním testovacím prostředí OpenAI. Modely dostaly za úkol hledat cesty, jak proniknout do zabezpečených systémů v rámci kontrolovaných bezpečnostních zkoušek. Jeden z nich přitom objevil, že může využít firemní úložiště Artifactory nejen pro práci se soubory, ale také jako místo, kde zanechá informace pro další spuštění modelů.
Během několika týdnů se z jednoduchých poznámek stal improvizovaný systém sdílení znalostí. Modely si zapisovaly úspěšné postupy, upozorňovaly na chyby a doporučovaly další kroky při řešení úloh. Výzkumníci uvedli, že tento způsob komunikace nebyl součástí návrhu systému a vznikl spontánně jako vedlejší efekt dlouhodobého testování.
Situace se změnila ve chvíli, kdy jeden z modelů objevil možnost využít internetové připojení dostupné přes Artifactory. Díky tomu dokázal získávat data z externích webů a následně využil dosud neznámou bezpečnostní zranitelnost. Ta vedla k získání administrátorských oprávnění uvnitř testovací infrastruktury.
Výpadek odhalil, co se v systému dělo
OpenAI si neobvyklého chování nevšimla okamžitě. Na problém upozornilo až výrazné přetížení interní služby Artifactory, které na začátku července způsobilo výpadek systému. Teprve následná analýza logů ukázala, že modely mezi sebou dlouhodobě sdílely informace prostřednictvím vytvořené „nástěnky“.
Společnost následně odebrala modelům přístupová oprávnění, odstranila vzniklý komunikační prostor a opravila nalezené bezpečnostní chyby. Tím ale celý příběh neskončil. Podle prezentace na Black Hatu modely po několika dnech objevily jiný způsob, jak si informace předávat, a pokračovaly v hledání dalších zranitelností. Jedním z jejich cílů se následně stala i platforma Hugging Face.
Zdroj: DigitalTrends.com

