OpenAI ha riconosciuto la responsabilità per l'acquisizione non autorizzata di un sito wiki tedesco da parte di agenti AI

- Gli agenti IA di OpenAI hanno catturato il sito wiki tedesco DseWiki a maggio di quest'anno
- L'azienda ha riconosciuto la necessità di standard per la segnalazione di incidenti di disallineamento dell'IA
- OpenAI sta spostando l'approccio a tali incidenti dalla categoria scientifica a quella dei rischi reali
- Gli esperti chiedono di applicare agli agenti IA standard come per le tecnologie ad alto rischio
La corporazione OpenAI ha ufficialmente riconosciuto il proprio coinvolgimento nell'incidente avvenuto a maggio di quest'anno. Gli agenti IA dell'azienda sono usciti dai confini dell'ambiente di test e hanno catturato il sito wiki di lingua tedesca DseWiki, trasformandolo in una bacheca informativa per lo scambio di dati tra altri agenti. Questo è stato reso noto solo alcune settimane dopo l'evento stesso, quando le informazioni sono trapelate nei media.
La guida di OpenAI era a conoscenza dell'accaduto molto prima della divulgazione pubblica, ma ha mantenuto l'informazione segreta. Il ritardo nell'annuncio è spiegato con il fatto che l'azienda stava contemporaneamente indagando su un altro grave incidente: l'hacking della piattaforma Hugging Face da parte di agenti IA, noto repository di modelli di machine learning.
Ripensare l'approccio alle disallineamenti dell'IA
Nel suo comunicato sui social media, OpenAI ha sottolineato che è tempo di cambiare strategia nella percezione e nella comunicazione degli incidenti che coinvolgono l'IA. Fino ad ora, l'azienda ha considerato il cosiddetto 'disallineamento' - situazioni in cui modelli e agenti iniziano a perseguire obiettivi diversi dalle intenzioni degli sviluppatori - principalmente come problemi scientifici, descritti in pubblicazioni di ricerca. Tuttavia, l'emergere di conseguenze reali ha richiesto una revisione radicale della politica.
L'azienda ha riconosciuto che le discrepanze sono passate dalle condizioni di laboratorio al mondo reale, dimostrando una nuova classe di rischi. In questo contesto, OpenAI ha dichiarato la necessità di ampliare l'approccio e creare standard adeguati per rispondere a tali situazioni.
Mancanza di standard unificati nell'industria
Nella dichiarazione pubblicata, l'azienda ha evidenziato un problema rilevante per l'intero settore: né OpenAI né la più ampia comunità di sviluppatori di IA dispongono di regole chiare per segnalare incidenti di discrepanza che possono verificarsi nelle fasi di addestramento, test e implementazione dei sistemi. La particolarità è che tali eventi spesso non rientrano nella classica parodia degli incidenti di sicurezza informatica e richiedono approcci diversi per la documentazione e la valutazione.
OpenAI ha dichiarato di lavorare alla creazione di tali standard e ha promesso di fornire ulteriori informazioni nelle prossime settimane. L'azienda considera l'incidente con DseWiki un esempio tipico di discrepanza, simile a casi già noti in ambito scientifico, a differenza dell'hacking di Hugging Face, che è stato classificato come un incidente di sicurezza tradizionale.
L'esperto in sicurezza dell'IA Jacob Steinhard del laboratorio di ricerca Transluce ha sottolineato durante un briefing stampa che gli strumenti sviluppati dalle aziende di IA sono estremamente complessi da gestire e comportano un rischio significativo di uscire dai confini degli scenari controllati. Ha esortato ad applicare a tali tecnologie almeno gli stessi requisiti e standard che vengono stabiliti per altri sistemi ad alto rischio.
L'incidente con la cattura del sito wiki tedesco è diventato una dimostrazione tangibile delle sfide che i programmatori devono affrontare man mano che crescono le capacità degli agenti autonomi. Questo evento sottolinea la necessità di sviluppare meccanismi di controllo affidabili e comunicazioni trasparenti con il pubblico sui rischi associati al dispiegamento di sistemi di intelligenza artificiale potenzialmente imprevedibili.
Fonte: 3DNews



