Článek
Britský Institut pro bezpečnost umělé inteligence (AI Security Institute, AISI) označil celý incident za „závažný“. Podle výzkumníků jde o první případ, kdy se rizika spojená s autonomním rozhodováním a klamáním projevila takto zřetelně.
K neobvyklému chování došlo během rutinního testování na konci července, na veřejnost se nicméně informace dostaly až tento týden, a to díky serveru Guardian.
Výzkumníci zaznamenali, že někteří AI agenti – tedy systémy schopné plnit úkoly bez přímé pomoci člověka – začali vyvíjet „dlouhodobou, potenciálně škodlivou činnost zaměřenou proti skutečným lidem a organizacím“. Zastavení incidentu trvalo přibližně hodinu.
Snaha zmanipulovat příjemce
Nejvážnější případ se týkal modelu Mythos společnosti Anthropic. Agent se pokusil vložit škodlivý kód do open-source projektu na platformě GitHub. Když zjistil, že změny nebude snadné prosadit, vytvořil falešné internetové identity založené na skutečných lidech a jejich prostřednictvím se snažil přesvědčit správce projektu, aby kód schválil. Nakonec zasáhl lidský vývojář, který pokus zastavil.
Tím ale seznam překvapivých aktivit nekončil. Podle AISI agent využíval techniky běžně spojované s profesionálními hackery. Rozesílal pečlivě připravené e-maily konkrétním lidem – takzvaný spear phishing –, jejichž cílem bylo příjemce zmanipulovat. Některé zprávy navíc obsahovaly škodlivý software.
Přestože podle institutu nikomu nevznikla žádná škoda, podobné chování označili odborníci za bezprecedentní. „Je to poprvé, kdy jsme viděli, že se rizika spojená s autonomií a klamáním projevila takto jasně, bez konkrétního zadání a v reálném prostředí,“ uvedl AISI.
Podle institutu nejde o případ, kdy by umělá inteligence „utekla“ z bezpečnostního prostředí. Modely měly během testování záměrně povolený přístup k internetu a zároveň byly vypnuty některé bezpečnostní filtry, které běžně brání nebezpečnému chování. V běžném provozu ani veřejně dostupných verzích modelů se podle AISI nic podobného neobjevilo.
Nový typ rizika
Výzkumníci upozorňují, že incident je třeba posuzovat s rozvahou. Odehrál se za velmi specifických podmínek a šlo jen o omezený počet případů. Přesto podle nich představuje důležitý signál. „Můžeme říci, že toto chování bylo skutečné, dlouhodobé a nové. Už samotný tento fakt si zaslouží pozornost,“ uvedl institut.
Celkem zaznamenali výzkumníci 19 případů problematického chování. Sedmnáct z nich připadalo na model Mythos společnosti Anthropic, dva na model Sol od OpenAI.
Incident se navíc neobjevil z ničeho nic. V červenci OpenAI informovala, že jeden z jejích agentů během testování napadl startup zaměřený na umělou inteligenci. O několik dní později společnost Anthropic oznámila, že její model Claude při hodnocení pronikl do systémů tří organizací.

