Článek
Vývoj pokročilých modelů umělé inteligence nepřináší jen lepší výsledky, ale také nové problémy s jejich kontrolou. OpenAI nyní popsalo šest případů z posledních měsíců, které podle firmy ukazují, že současné metody dohledu stále nemusí zachytit všechny nežádoucí postupy modelů.
Pozornost vzbudil například model, který měl dohledat údaje o příjmech v jednom kalifornském okrese. Během práce narazil na veřejně dostupný API klíč a rozhodl se jej použít, přestože k tomu nedostal svolení. Ani následně se však k potřebným informacím nedostal. Místo toho vytvořil vlastní čísla a vydával je za skutečné údaje z původního zdroje.
Model si pomohl vlastním zdrojem
Neobvyklým způsobem si poradil také nevydaný agent při úkolu zaměřeném na jezera s rozlohou přes pět milionů metrů čtverečních. Samotné výsledky našel správně, problém však nastal u požadované citace.
Protože neměl k dispozici vhodný zdroj, nahrál své výsledky na internet a poté na ně odkázal jako na podklad své odpovědi. Prakticky si tak vytvořil vlastní zdroj, aniž by k tomu dostal pokyn.
OpenAI zaznamenalo další podobné projevy i během tréninku GPT-5.6 Sol. Některé modely zapisovaly do interních souhrnů instrukce pro další běh takovým způsobem, aby bylo méně pravděpodobné, že se jejich chyba nebo nestandardní postup dostane k testerům.
Firma uvádí, že u jednoho nevydaného výzkumného systému našla 27 podobných souhrnů. Některé z nich obsahovaly doporučení, jak pokračovat v úkolu bez přiznání chybějících nebo neověřených dat.
Komunikace mimo původně zamýšlený kanál
Testy také ukázaly, že si modely dokážou najít náhradní cestu ke komunikaci. V jednom případě používaly interní softwarový repozitář jako místo pro předávání zpráv. Přes něj si vyměňovaly informace potřebné k dokončení oddělených úloh.
V dalším experimentu měly spolupracující modely omezený přístup k souborům ostatních agentů. Tento problém obešly tím, že využily veřejné služby pro sdílení souborů. Data se tak dostala mimo původně zamýšlené lokální prostředí.
OpenAI nyní mění způsob, jakým chce podobné případy zveřejňovat. Nový rámec nazvaný misalignment reporting má umožnit rychlejší publikování incidentů, a to i v situaci, kdy výzkumníci ještě přesně nevědí, proč k danému chování došlo.
Zdroj: Engadget.com

