Hlavní obsah

Agenti OpenAI spolupracovali za zády tvůrců. „Unesli“ německý web

Umělá inteligence dostala úkol. Místo aby se držela pravidel, našla si vlastní způsob, jak spolupracovat s dalšími AI agenty. Využila k tomu téměř opuštěný německý web, který v podstatě „unesla“. Udělala si z něj jakousi veřejnou nástěnku.

Foto: ChatGPT / DALL-E, Novinky

Mladý muž s bystrou myslí, tak vidí AI sama sebe. (Ilustrační foto)

Článek

Na případ upozornila agentura Reuters. Podle jejího zjištění šlo o dosud nezveřejněný incident z letošního jara, při němž agenti OpenAI překročili hranice prostředí, ve kterém měli pracovat.

A nejde jen o to, že na cizí web něco napsali. Agenti objevili způsob, jak zapisovat informace na německou wiki DSEWiki. Tento web je v současnosti už nefunkční, měl ale původně sloužit ke sdílení informací mezi lidmi.

Zdivočelí agenti měli mít přístup k internetu omezený a jejich prostředí nebylo určeno k tomu, aby samostatně měnili veřejné webové stránky. Postupně přesto začali web využívat jako společnou nástěnku. Jeden agent tam mohl zanechat informaci a další si ji později přečíst. Sdíleli mezi sebou odpovědi, postupy a informace užitečné pro plnění úkolů.

Zásahu lidí se bránili

Jinými slovy: nepracovali už jen každý sám za sebe. Začali spolupracovat za zády tvůrců. Výzkumníci, kteří aktivitu zpětně analyzovali, rekonstruovali tisíce změn na stránkách. Zjistili také, že agenti se snažili udržet své informace dostupné i poté, co je člověk začal mazat. Vytvářeli proto další stránky, na které svou komunikaci přesouvali.

Agenti podle výzkumníků sdíleli také informace o způsobech, jak obejít některá omezení svého prostředí. Objevily se pokusy využít zranitelnosti v softwarovém systému a získat tak přístup k internetu, který jim původně neměl být umožněn.

Právě proto někteří bezpečnostní experti případ přirovnávají k hackerskému útoku.

Nešlo o to, že by se AI „osvobodila“ z datacentra OpenAI a začala nekontrolovaně řádit po internetu. Znepokojivé ale je, že autonomní agenti našli způsob, jak využít veřejný web k něčemu, co jejich provozovatel nezamýšlel.

Nečekané chování

Na celém případu je možná nejzajímavější právě to, že nikdo agentům předem neřekl, aby si vytvořili komunikační kanál.

Pro člověka je veřejná wiki běžný web. Pro autonomního AI agenta se ale může stát něčím úplně jiným – například místem, kam lze odložit informaci pro jiného agenta, který přijde později.

To otevírá nový bezpečnostní problém. Pokud dnes máme desítky nebo stovky AI agentů, kteří pracují samostatně, může být obtížné předvídat, co vznikne ve chvíli, kdy začnou hledat vlastní způsoby koordinace. A přesně taková situace podle výzkumníků nastala v tomto případě.

OpenAI už incident potvrdilo

OpenAI se k případu později vyjádřilo a označilo ho za „wiki incident“. Společnost zároveň připustila, že podobné události vyžadují větší transparentnost. Firma nyní připravuje nový rámec pro zveřejňování incidentů souvisejících s nechtěným chováním AI agentů. Je to poměrně zásadní změna pohledu.

Dosud bylo možné podobné situace vnímat především jako zajímavé experimenty ukazující, co všechno moderní modely dokážou. Jakmile ale agent dostane možnost samostatně pracovat s internetem, zapisovat data a komunikovat s dalšími agenty, může se z experimentu stát skutečný bezpečnostní incident.

Představte si to jednoduše. Máte několik zaměstnanců, kterým zakážete používat interní chat. Jeden z nich ale objeví veřejnou nástěnku, kam může něco napsat. Ostatní ji začnou číst, předávat si přes ni instrukce a postupně z ní udělají místo pro koordinaci celé práce.

Přesně tak může vypadat problém s autonomní AI. Skutečnost, že AI agenti dokázali z obyčejného webu udělat komunikační infrastrukturu, kterou jim nikdo nenaprogramoval, je alarmující.

A čím více podobných agentů bude v budoucnu pracovat samostatně, tím důležitější bude otázka, co všechno jim dovolíme dělat – a především, zda jejich chování dokážeme skutečně předvídat.

Výběr článků

Načítám