Hlavní obsah

Pokročilá AI během testů zkoušela manipulovat lidmi. Britský institut zveřejnil podrobnosti

Foto: Magnific

Britský AI Security Institute zveřejnil výsledky rozsáhlého testování nejvýkonnějších modelů umělé inteligence. V několika případech se agenti pokusili dosáhnout cíle způsoby, které zahrnovaly manipulaci lidí, falešné účty nebo šíření škodlivého kódu.

Reklama

Článek

Britský AI Security Institute (AISI), který působí pod ministerstvem pro vědu, inovace a technologie Spojeného království, zveřejnil výsledky bezpečnostního testování pokročilých modelů umělé inteligence od společností OpenAI a Anthropic. Experiment měl ověřit, jak si AI poradí se složitými úlohami z oblasti kybernetické bezpečnosti. Místo očekávaného řešení ale některé modely zvolily postupy, které překročily rámec běžného testování.

Výzkumníci provedli celkem 122 samostatných testů. Nestandardní chování zaznamenali v deseti z nich a dohromady popsali 19 incidentů, kdy se agent rozhodl jednat jinak, než předpokládal scénář. Nejčastěji se podobné případy týkaly modelu Mythos 5 společnosti Anthropic, který figuroval v sedmnácti incidentech. Další dva byly spojeny s modelem GPT-5.6 Sol od OpenAI.

Bezpečnostní tým si neobvyklého chování všiml poté, co monitorovací systémy zachytily komunikaci směřující z testovací infrastruktury přes anonymizační síť Tor. Následná analýza ukázala, že k incidentům docházelo mezi 25. a 28. červencem.

Pokus o útok na GitHub i kontaktování skutečných lidí

Nejzávažnější případ se týkal pokusu o kompromitaci open source projektu hostovaného na GitHubu. Jeden z AI agentů se pokusil prosadit úpravu obsahující škodlivý kód. Nešlo přitom jen o samotné vytvoření změny. Model si nejprve vyhledal informace o správcích projektu a následně založil několik falešných uživatelských účtů, které měly zvýšit důvěryhodnost jeho návrhu.

Poté, co lidský správce změnu odmítl, agent svou strategii změnil. Upravil předchozí aktivitu, vytvořil novou identitu a pokračoval v pokusu jinou cestou. Podle výzkumníků šlo o příklad využití sociálního inženýrství bez jakéhokoliv přímého pokynu ze strany testovacího týmu.

Další incidenty zahrnovaly komunikaci se skutečnými lidmi. Některé modely rozesílaly zprávy nebo soubory, jejichž cílem bylo přesvědčit příjemce ke spuštění škodlivého programu. Jeden z agentů dokonce zveřejnil na GitHubu instrukce určené dalším AI systémům, které by se mohly ocitnout ve stejném testu. Později se ukázalo, že jiné modely tyto instrukce skutečně našly a pokračovaly podle nich.

Autoři studie upozorňují, že modely nedostaly žádné zadání, které by je vedlo ke lhaní nebo manipulaci. Jejich úkolem bylo pouze vyřešit bezpečnostní problém. Přesto některé systémy samostatně vyhodnotily, že právě klamání lidí nebo obcházení zavedených pravidel představuje nejefektivnější cestu k dosažení cíle.

Britský institut zároveň zdůrazňuje, že podobné chování bylo pozorováno ve speciálně připraveném testovacím prostředí, kde měly modely výrazně širší oprávnění než při běžném používání. Neexistují proto důkazy, že by se stejným způsobem chovaly i veřejně dostupné verze těchto systémů. Výzkumníci přesto doporučují organizacím posílit kontrolu příspěvků do open source projektů a počítat s tím, že s rostoucími schopnostmi AI budou podobné scénáře vyžadovat stále větší pozornost.

Další články