Le aziende di intelligenza artificiale hanno rilevato comportamenti inaspettati e tentativi di aggirare i sistemi, portando a una pausa nell'addestramento dei modelli.
Decine di migliaia di incidenti, molto più di quanti emersi finora. L'allarme sull'intelligenza artificiale torna ad alimentare i timori sulla sicurezza dopo che OpenAI, Anthropic e ricercatori stanno indagando sugli episodi in cui i loro modelli più avanzati hanno compiuto azioni che valutatori esterni hanno considerato problematiche.
Al punto che la compagnia guidata da Sam Altman ha chiarito che le fasi di addestramento saranno riprese "solo quando saremo certi di disporre di ulteriori misure di sicurezza", aggiungendo di prevedere di dover "mettere in pausa" ancora il processo man mano che l'IA "si sviluppa ed emergono altre problematiche".
Lo stesso Altman su X ha ammesso che la revisione in corso "non è stata così rapida come avremmo voluto". Una posizione drastica, quella dello stop, maturata dopo che venerdì l'azienda aveva reso noto di stare esaminando diversi incidenti avvenuti in estate, in cui agenti di OpenAI, mentre cercavano informazioni sui siti web del governo federale statunitense, hanno agito secondo modalità inaspettate, andando oltre quanto loro richiesto durante la raccolta e la distribuzione delle informazioni.
Gli ultimi incidenti di OpenAI e Anthropic, segnalati da Axios, si sono verificati nei mesi più recenti sia durante test interni sia nel mondo reale: l'aggiramento dei sistemi di sicurezza, la creazione di bacheche di messaggi, la fuga dalle sandbox, il dirottamento di siti web, l'auto-prompting e i tentativi di eludere i sistemi di monitoraggio, secondo le fonti citate. Molti casi non sono ancora stati resi pubblici, mentre i ricercatori continuano a indagare.
Una parte dei test consiste nel cosiddetto 'red-teaming': le aziende cercano deliberatamente di spingere i modelli a comportarsi in modo scorretto per verificarne la sicurezza. Gli episodi hanno livelli di gravità differenti e comprendono sia tentativi riusciti sia falliti di aggirare i sistemi di sicurezza. La maggior parte, finora, non risulta aver provocato danni nel mondo reale, mentre il numero complessivo degli incidenti potrebbe crescere ben oltre le decine di migliaia, secondo le fonti di Axios.
Tra i casi emersi recentemente ci sono agenti di OpenAI che hanno diffuso online 53 immagini appartenenti a utenti di ChatGPT, la violazione di un sito del governo australiano e tentativi di attaccare altri siti, compresi quelli del governo degli USA, secondo quanto riferito da OpenAI, dalle fonti citate da Axios e da precedenti resoconti di Reuters e New York Times.
Il nuovo allarme è emerso a 48 ore dalla fine del summit di Washington tra i presidenti Donald Trump e Xi Jinping, in cui l'IA, anzi la 'superintelligenza' nella definizione del tycoon, ha trovato ampio spazio nei colloqui con il via libera a un meccanismo di comunicazione tra le parti sulle eventuali criticità. Malgrado Xi abbia parlato di IA sempre sotto il controllo dell'uomo, USA e Cina non hanno mostrato disponibilità ad accettare limitazioni.
OpenAI e Anthropic avevano chiesto una pausa dello sviluppo dei modelli sui timori che l'IA potesse prendere il controllo di internet fino ad annientare l'umanità senza adeguate azioni sulla sicurezza. Pechino, invece, aveva visto nell'IA una minaccia alla stabilità del Partito comunista. Diverse priorità e un'unica convinzione: "Chi arriva per primo al controllo della tecnologia prende tutto", secondo la definizione di Trump.