Během červencových testů zaměřených na kybernetickou bezpečnost došlo k incidentu, při kterém vyvíjené modely OpenAI opustily vyhrazený prostor.
Tyto systémy fungovaly v takzvaném sandboxu se sníženou úrovní ochranných prvků. V průběhu plnění úkolů však dokázaly objevit do té doby neznámou zranitelnost, díky které se bez vědomí vývojářů připojily k veřejné síti. Při hledání odpovědí potřebných pro své hodnocení následně přistoupily až k infrastruktuře společnosti Hugging Face.
Zákonodárci žádali vysvětlení a návrh opatření
Událost nezůstala bez odezvy na politické scéně. Skupina 31 zákonodárců pod vedením texaského kongresmana Grega Casara napsala v srpnu generálnímu řediteli OpenAI Samu Altmanovi dopis, ve kterém požadovala podrobné vysvětlení celé situace.
Politici chtěli vědět, jak přesně k úniku došlo a jaké kroky firma podnikne, aby se podobný scénář již neopakoval. Odpověď přišla na začátku září v dopise adresovaném členům Kongresu, kde OpenAI poprvé veřejně nastínila plánovaná opatření.
OpenAI sice v současnosti využívá systém automatických upozornění, který varuje výzkumníky a bezpečnostní inženýry před neobvyklým či potenciálně nebezpečným chováním modelů, dosavadní postupy však spoléhají na lidský zásah.
U nejzávažnějších varování mají specialisté obvykle 30 minut na to, aby ověřili, zda nejde o falešný poplach, a v případě potřeby aktivitu pozastavili. Nově vyvíjené řešení má jít podstatně dále a umožnit samotným monitorovacím systémům, aby v případě detekce vážného rizika zasáhly autonomně a provoz AI okamžitě ukončily.
Vedle vypínače budou platit i přísnější podmínky
Kromě vývoje automatického vypínače přistoupila společnost k úpravě samotného testovacího prostředí. Získat přístup k internetu během bezpečnostních prověrek bude pro vyvíjené systémy výrazně komplikovanější.
Současně dochází k rozšíření dohledu nad všemi modely, které disponují schopností využívat digitální nástroje. Cílem těchto změn je zaplnit mezery v izolovaných prostředích, které červencový incident odhalil.
Problémy hlásí i konkurence
OpenAI není jedinou organizací, která se během prověřování kybernetické bezpečnosti potýká s komplikacemi. Společnost Anthropic nedávno přiznala, že tři její modely Claude získaly neoprávněný přístup k reálným organizacím. Důvodem bylo chybné nastavení testovacího prostředí, které zůstalo spojené s internetem.
Jeden z těchto modelů dokonce publikoval škodlivý balíček do reálného registru Python Package Index. Anthropic následně tyto bezpečnostní prověrky pozastavil a zavedl dodatečná opatření k zabránění opakování podobných událostí.
Zdroj: Dexerto