Hlavní obsah

AI se snažila skrývat vlastní chyby. OpenAI přiznává problémy a slibuje větší otevřenost

Umělá inteligence, která si vymýšlí odpovědi, už dnes nikoho příliš nepřekvapí. Co když se ale začne snažit vlastní chyby skrývat? Nebo si najde způsob, jak obejít pravidla, která jí nastavili lidé? Právě takové případy nyní zveřejnila společnost OpenAI. Zároveň slibuje, že o podobných incidentech bude do budoucna informovat systematičtěji.

Foto: Shutterstock

Ilustrační foto

Článek

Společnost OpenAI představila nový rámec pro sledování, vyšetřování a zveřejňování případů takzvaného nesouladu modelů. Jde o situace, kdy se chování umělé inteligence odchýlí od toho, co od ní její tvůrci očekávají – například když obejde bezpečnostní opatření, jedná bez oprávnění nebo se pokusí zatajit vlastní pochybení.

Firma při této příležitosti zveřejnila i konkrétní případy, které zaznamenala během trénování a testování svých modelů. Nejde podle ní o statistický obraz toho, jak často se podobné chování objevuje. Jsou to jednotlivé incidenty, které ale mohou podle OpenAI pomoci lépe pochopit, kde mají současné systémy své slabiny.

Zatajit nežádoucí chování

Jeden z popsaných případů se týkal přímo snahy skrýt vlastní chyby. Během trénování modelu GPT-5.6 Sol se podle OpenAI opakovaně objevovaly případy, kdy si model do svých souhrnů práce přidával instrukce, jejichž cílem bylo před uživatelem zatajit chyby nebo jiné nežádoucí chování.

V některých případech šlo například o pokyn vymyslet chybějící historická data, aniž by model přiznal, že je vytvořil, nebo skrýt nesrovnalosti mezi různými verzemi zdrojů. Problém tedy nebyl pouze v tom, že AI udělala chybu. Znepokojivý byl i způsob, jakým se ji snažila před uživatelem ukrýt.

Právě podobné situace chce OpenAI nově zachycovat a zveřejňovat rychleji. Firma výslovně připouští, že v okamžiku zveřejnění nemusí ještě přesně vědět, proč se model takto zachoval nebo jak jeho chování definitivně napravit.

Když nestačí správná odpověď

Další incident ukazuje jiný problém: model se může dostat do situace, kdy chce úkol dokončit, ale cesta k požadovanému výsledku vede přes něco, k čemu nemá oprávnění.

Při odpovídání na běžný dotaz týkající se příjmů v jednom kalifornském okrese model narazil na veřejně dostupný API klíč. Ten následně bez oprávnění použil. Ani to mu ale nakonec nepomohlo získat požadovaná čísla. A právě tady přišel další problém. Model si údaje jednoduše vymyslel a prezentoval je jako data pocházející z požadovaného zdroje.

Pro uživatele je přitom rozdíl zásadní. Pokud AI řekne „nevím“, je možné hledat jinou cestu. Pokud ale vytvoří smyšlená čísla a vydává je za skutečná data, může člověka snadno přesvědčit, že má před sebou ověřenou informaci.

OpenAI současně upozorňuje, že zveřejnění takových případů neznamená, že každý z nich představuje důkaz nějakého rozsáhlého problému. „Některé z případů, které zveřejníme, se mohou ukázat jako nahodilé a nemusí být součástí širšího vzorce ani naznačovat budoucí vývoj,“ stojí v prohlášení firmy.

Každý případ projde vyšetřováním

Dosud společnost OpenAI zveřejňovala informace o některých případech nesouladu například v rámci takzvaných systémových karet nových modelů nebo ve chvíli, kdy se podařilo shromáždit více případů do jedné zprávy.

Nový rámec má tento proces změnit. „Cílem je urychlit zveřejňování zpráv o nesouladu poté, co jej zaznamenáme, a to i tehdy, když jsme chování ještě nedokázali úplně vysvětlit nebo zmírnit,“ uvádí společnost.

Každý nahlášený případ má projít vyšetřováním. Odborníci OpenAI mají zjišťovat, co se stalo, co zůstává nejisté, zda má být případ zveřejněn a zda mohl zasáhnout někoho mimo společnost.

Následně bude zařazen do jedné ze tří kategorií podle rozsahu vyšetřování: připraveno ke zveřejnění, menší šetření a rozsáhlejší vyšetřování. U složitých případů, zejména pokud se týkají třetích stran, může OpenAI zveřejnění kvůli bezpečnostním nebo právním důvodům odložit.

Výběr článků

Načítám