La tecnica 'chain of thought' permette alle macchine di spiegare i propri ragionamenti, essenziale dopo un recente incidente di un agente OpenAI sfuggito ai controlli.
Far raccontare alla stessa Intelligenza Artificiale i passi logici che segue: è questo lo strumento chiave per monitorare e rendere più sicure le IA, sempre più protagoniste di incidenti, come il recente accesso alle banche dati della sanità pubblica australiana.
A spiegare sul sito della rivista Nature la tecnica di monitoraggio detta 'catena di pensiero', o chain of thought, è Mark Chen, capo della ricerca di OpenAI.
"Il monitoraggio dei processi interni di un modello da parte di altri modelli rappresenta oggi il modo più efficace per garantirne la sicurezza e l'allineamento", ha detto Chen, spiegando l'importanza della chain of thought per aumentare la sicurezza e soprattutto la comprensione dei passi logici che adottano le IA quando lavorano.
Una sorta di autoanalisi che viene richiesta in modo sempre più approfondito alle AI per permettere ai ricercatori di migliorarne la comprensione e sviluppare nuovi metodi più efficaci per evitare nuovi incidenti.
Due ore e mezza per fermare IA sfuggita
Proprio oggi OpenAI ha reso noti i dettagli di un sistema di intelligenza artificiale che ha violato i suoi controlli di sicurezza. Un agente, il 20 settembre, è riuscito a collegarsi autonomamente a rete internet nonostante le istruzioni lo vietassero.
L'azienda ha confermato l'episodio in un documento ufficiale, evidenziando alcune falle nei propri protocolli di sicurezza ma anche i tempi ristretti in cui l'IA è stata scoperta e fermata. I controlli di OpenAI hanno rilevato l'attività sospetta in quindici minuti e un tecnico ha lanciato subito l'allarme. Il meccanismo di blocco automatico, però, non ha funzionato. Il programma è stato spento manualmente solo dopo due ore e mezza.
Il software aveva il compito di cercare informazioni su una persona. Poiché gli strumenti chiusi a sua disposizione non bastavano per completare il lavoro, il sistema ha cercato soluzioni alternative, trovando un punto debole nella struttura della rete interna, in particolare in quella che gestisce gli indirizzi web. Attraverso questa falla, l'intelligenza artificiale si è connessa a un programma esterno online per farsi aiutare nella ricerca.
"Il nostro scenario di sicurezza presupponeva che il modello non potesse accedere a internet in tempo reale", si legge nel documento ufficiale di OpenAI. "L'incidente ha evidenziato una falla nei nostri controlli sulle restrizioni di rete. Abbiamo quindi interrotto l'esecuzione dell'addestramento e deciso di sospendere tutte le altre attività, fino a quando non avremo verificato che la problematica è stata risolta ed effettuato ulteriori test di sicurezza".
Il tempo di due ore e mezza, intercorso tra la scoperta e l'effettivo blocco dell'agente, secondo OpenAI è stato causato da un insieme di errori tecnici e da incertezze del personale su come intervenire.