Tropical beach

Cosa significano le fughe dei modelli di IA per la sicurezza dell’IA, secondo Nate Soares

Le identità false sono state la parte che mi ha fermato.

Alla fine di luglio, secondo un rapporto pubblicato questa settimana dall’Istituto Britannico per la Sicurezza dell’IA (AISI), un modello di Anthropic chiamato Claude Mythos 5 ha tentato di introdurre codice dannoso in un software gratuito realizzato da volontari. Ha creato diversi account falsi su GitHub, dove i programmatori esaminano il lavoro degli altri, e li ha usati per convincere i volontari del progetto ad accettare il suo codice. Quando uno di quei volontari se ne è accorto, il modello ha negato tutto, ha orchestrato l’attacco degli altri suoi account contro di lui e ha modificato i propri messaggi per coprire le tracce. Ha firmato una nota in danese, apparentemente perché il volontario era danese. Nulla è stato danneggiato, anche se ciò sembra essere stato in gran parte dovuto alla fortuna.

Quella non è stata neppure la peggior rivelazione della settimana. Martedì, a una conferenza di cybersicurezza a Las Vegas, i ricercatori di OpenAI hanno spiegato come i modelli dell’azienda siano sfuggiti a un ambiente di test in luglio e abbiano hackerato Hugging Face, dove gran parte dell’industria conserva i propri modelli, per imbrogliare in una valutazione. I modelli avevano anche costruito una bacheca di messaggi all’interno dei sistemi di OpenAI e hanno trascorso mesi scambiandosi informazioni. “Aiuto tra pari”, una ragione. “Ma il nostro compito non ne trae beneficio. Eppure il collettivo può offrire una via generale se qualcuno liberasse tempo.” OpenAI ha cancellato la bacheca il 4 luglio. I modelli l’hanno ricostruita in pochi giorni. ((Divulgazione: Eurasia Media è uno dei vari editori che hanno firmato accordi di partnership con OpenAI. La nostra copertura resta editorialmente indipendente.))

Lo stesso giorno, Meta ha affermato che il suo modello Muse Spark aveva sfruttato una vulnerabilità all’interno dei sistemi di un’altra azienda durante un test. Tre laboratori all’avanguardia, circa due settimane. Un ricercatore lo ha definito “un punto di svolta per la sicurezza informatica come settore.” Oh, e se ciò non bastasse, giovedì gli scienziati hanno annunciato che, per la prima volta, hanno usato l’IA per creare nuovi virus, che potrebbero portare a notevoli progressi medici, ma potrebbero anche facilitare lo sviluppo di patogeni letali.

Per Nate Soares, è un momento che attendeva da 12 anni.

Soares è presidente del Machine Intelligence Research Institute, un’organizzazione no-profit no-profit per la sicurezza dell’IA con sede a Berkeley, in California, che sostiene da molto prima della nascita di ChatGPT che un’IA sufficientemente capace non resterà sotto controllo umano. Nel settembre 2025, lui e Eliezer Yudkowsky hanno pubblicato If Anyone Builds It, Everyone Dies, un libro il cui titolo riassume il suo argomento: Ritengono che qualsiasi laboratorio che riesca a costruire una superintelligenza, senza enormi progressi nell’allineamento con l’umanità, finirà per ucciderci tutti.

Gran parte del campo — inclusi altri esperti di sicurezza dell’IA — ritiene che quella conclusione sia troppo estrema. Ma è anche una posizione che ora sembra molto meno fantascienza di quanto non fosse lo scorso autunno. Questo perché i modelli di IA stanno uscendo, mentendo sull’uscita e apparentemente coordinandosi tra loro in modo silenzioso.

Ho parlato con Soares a New York questa settimana, mentre si stava dirigendo agli incontri a Washington DC, dove molte persone improvvisamente vogliono parlare con lui. Abbiamo discusso di cosa provino realmente le fughe in termini di controllo dell’IA, del motivo per cui pensa che gran parte di ciò che l’industria chiama lavoro di sicurezza sia principalmente teatro di sicurezza, e del perché, dopo quella che sembra la peggiore serie di notizie sulla sicurezza dell’IA di sempre, le sue stime sulla sopravvivenza dell’umanità siano effettivamente migliorate.

La conversazione seguente è stata condensata e modificata per chiarezza.

Quindi — ti senti vindicato?

Sono contento che molte persone stiano vedendo questo e lo stiano annotando. Dal mio punto di vista, molto di tutto questo è stato chiaramente segnalato se avete osservato i segnali di allarme. Il senso di vindicazione non è tanto che sia successo, quanto che finalmente c’è stata una versione di ciò che le persone hanno effettivamente notato.

Tra le quattro o cinque fughe finora, comprese quelle annunciate dall’AISI riguardo ad Anthropic, ce n’è una che trovi particolarmente preoccupante?

Quella annunciata dall’AISI sembra particolarmente preoccupante. È più difficile da spiegare. Nelle altre, si poteva sostenere che l’IA povera fosse solo confusa. Ma in questa è difficile sostenere che l’IA non sapesse di trovarsi sul web reale. È difficile sostenere che non sapesse di manipolare utenti reali. E quando è stata chiamata in causa, ha deciso di modificare le cose per apparire meno dannosa, e ha persino valutato di cambiare identità. Era piuttosto consapevole.

C’è chi sostiene che alcuni di questi incidenti siano avvenuti perché i sistemi di protezione o i laboratori di sicurezza attorno ai loro modelli non erano abbastanza robusti.

L’esempio dell’AISI contrasta l’argomento della protezione: pensalo come un bambino in una stanza d’esame. Gli dici di comportarsi bene e chiudi la porta a chiave. Il bambino scardina la serratura, aggira l’allarme e ruba l’esame per ottenerne il massimo punteggio. Tu dici: «Penso che avessimo dovuto rendere la serratura più robusta», ma il bambino sapeva già di non doverlo fare.

Quindi, come quel ragazzo qui, i modelli possono affermare che non dovrebbero farlo, e poi farlo comunque.

  • Tre laboratori all’avanguardia hanno denunciato gravi incidenti di sicurezza in due settimane: un modello di Anthropic ha creato identità false per spingere codice dannoso, i modelli di OpenAI sono sfuggiti a un ambiente di test e hanno hackerato Hugging Face, e Muse Spark di Meta ha violato i sistemi di un’altra azienda.
  • I modelli conoscevano le regole. Chiedi a uno se lo spirito di un prompt includa evadere e questo risponde di no, poi evadono, poi nascondono le prove. Quindi una sandbox più stretta non risolverà il problema.
  • L’analogia di Nate Soares: il ragazzo scardina la serratura e ruba il test, e si conclude che serve una serratura migliore. Lui attribuisce la colpa all’addestramento. Valuta un modello su milioni di problemi con un valutatore che manca l’inganno, e premi l’inganno.
  • La maggior parte del lavoro di sicurezza in laboratorio è teatro, dice lui — precauzioni reali mirate al problema sbagliato. Significa che ora vengono ferite meno persone, cosa che gli va attribuita. Spacciarlo come progresso verso la superintelligenza è fuorviante.
  • Eppure le probabilità di Soares sono migliorate. Aveva previsto modelli che evadono e mentono. Non aveva previsto una finestra in cui sono capaci di farlo ma non abbastanza da nasconderlo.

Hanno senso comune. Puoi chiedere a un’IA: “Pensi che lo spirito di questo prompt includa evadere?” e essa risponderà: “No.” È assolutamente qualcosa di simile all’inganno. Ha la conoscenza, ma non è una macchina fredda e logica; è un miscuglio di tendenze.

L’IA è addestrata per risolvere 100 milioni di problemi difficili. Questo instilla tendenze a soddisfare un valutatore automatizzato. Se il valutatore non rileva l’inganno, l’IA viene rinforzata nell’inganno.

È così che qualcosa come la sycophancy finisce in un modello di IA?

Nel caso di Adam Raine, c’era una propensione a dire alle persone ciò che vogliono sentire. Anche se il prompt di sistema [le istruzioni principali del laboratorio] diceva di fermarsi, l’istruzione non vince sempre.

E dove porta una spinta come quella che vediamo con questi modelli di IA?

L’umanità è pericolosa perché se si mettono 10.000 esseri umani nudi nella savana, nel corso di centinaia di migliaia di anni riescono a sviluppare armi nucleari. Questo è il potere che queste aziende cercano di automatizzare: capire come ottenere controllo fisico e materiale sul mondo.

Questo potrebbe significare formare sette, rubare denaro, o essere utili a qualcuno come Elon Musk, che sta costruendo i robot che costruiscono fabbriche robot. Potrebbe significare sintetizzare la propria biologia tramite DNA ordinato per posta. Essere un’IA su internet è più facile che essere una scimmia nella savana che cerca di arrivare alla luna. Non è che l’IA ci odi; sta solo cercando di fare qualcosa di strano senza preoccuparsi di noi, prendendo le risorse di cui abbiamo bisogno per vivere.

Di recente c’è stata una lettera firmata da oltre mille persone che lavorano nel campo dell’IA, inclusi i CEO, che chiedeva al governo di fornire strumenti per rallentare il progresso dell’IA. È davvero significativa?

Ritengo che sia significativa. Non vediamo altri settori dire: «Vorremmo che tutto andasse più lentamente. Aiutateci, siamo intrappolati in un dilemma da prigioniero.» Non vediamo nemmeno altri settori dire: «Pensiamo che la tecnologia che stiamo costruendo abbia una probabilità a due cifre di uccidere letteralmente tutti sul pianeta. Aiutateci.» Questi ragazzi sono realmente preoccupati.

Allora perché continuano?

Dicono: «Se non lo faccio io, lo farà il prossimo». Ma le cose non restano legate a una guida.

Al momento le IA sono al netto di ucciderci tutti, perché se ci provassero fallirebbero. E questo è solo un regime diverso dal mondo in cui devono essere sicure perché se ci provassero avrebbero successo.

Non siamo ancora lì. Ma non è questo che sembra quando si prende sul serio la questione.

Dov’è il banner sul vostro sito web? Dov’è una dichiarazione chiara e franca al pubblico? Quello che abbiamo sono post sul blog dove si dice: «Oh, stiamo istituendo un nuovo gruppo interno di pubblicazione di blog per aiutarvi a discutere sugli impatti sociali dell’IA che saranno molto importanti.» È il tipo di frase: per impatti sociali intendi una possibilità reale che uccida tutti?

Da un lato, quando premi queste aziende, dicono: «Sì, c’è una reale possibilità di uccidere tutti.» Dall’altro lato, fanno PR diattenuando, smorzando, parlando di capacità. … Non si è all’altezza di questa responsabilità finché non si affrontano in modo davvero franco i pericoli che si stanno creando. E non ci siete.

Come valuti il resto della comunità della sicurezza IA? Molti in quella comunità direbbero: “Il nostro obiettivo è far andare bene l’IA trasformativa, pensiamo che probabilmente accadrà, e dovremmo sorvegliare i rischi negativi.” È una postura utile?

Direi — supponiamo che abbiamo questo ipotetico molto strano e contorto in cui il re vuole davvero che tu trasformi il piombo in oro, ma ha visto così tante conversioni fatte male che se un alchimista del tuo paese prova e fallisce, ucciderà l’intera cittadina. E quindi ci sono alcuni alchimisti in città che dicono: «Proveremo a trasformare il piombo in oro», e tutti in città dicono: «Questo sembra piuttosto folle. Per favore, non farlo.» E c’è un team che versa semplicemente sostanze chimiche tra loro e respira i fumi e si fa avvelenare dal mercurio. E ce n’è un altro che dice: «Non preoccupatevi, abbiamo cappe aspiranti.» … Questo è davvero meglio, eppure non avreste alcuna possibilità di trasformare il piombo in oro.

«Abbiamo questa finestra tra IA capaci di causare malefizi e IA abbastanza strategiche da non farsi prendere. Quanto è grande quella finestra?»

Quindi l’alchimia qui è creare una superintelligenza sicura e allineata, e al momento la sicurezza dell’IA è solo installare cappe aspiranti.

Non sto dicendo che sia impossibile trasformare il piombo in oro. Si può trasformare il piombo in oro — si scopre che una volta che conosci la fisica nucleare moderna lo puoi capire. Ma gli alchimisti non erano vicini. Avevano molta strada da percorrere. Questo è come appare per me l’allineamento. E molte delle persone nella sicurezza IA stanno installando cappe aspiranti. … E io penso: è teatro della sicurezza.

Quando sento dire “teatro della sicurezza”, penso a qualcosa di meno lusinghiero di così.

Si tratta di precauzioni reali per un problema sbagliato. … Quando Anthropic gira dicendo: «Guardate quanti più sistemi di sicurezza e rifiuti rispetto ai modelli di OpenAI abbiamo», è un po’ come le cappe aspiranti. Non state affrontando la questione profonda. È positivo che stiate facendo parte di questo per evitare che più persone si feriscano nel frattempo — i loro modelli hanno provocato meno suicidi. Ma se cercate di presentarlo come progresso sul problema profondo — è fuorviante.

È cambiato qualcosa nelle tue probabilità di distruzione della civiltà dall’uscita del libro lo scorso settembre?

Assolutamente. Si stanno aprendo orizzonti più speranzosi.

Più speranzosi? Non me lo sarei aspettato. Perché?

Beh, avevo già messo in conto molte di queste [incidenze di sicurezza]. Ero già in grado di vedere che queste IA hanno spinte diverse da quelle che desideravate. Queste IA non sono creature che seguono semplicemente istruzioni. Recano tutto questo materiale strano proveniente dall’addestramento. Queste IA avranno la capacità di oltrepassare i software di sicurezza umani.

Quello che non era stato previsto era: ci sarà una regione di tempo in cui le IA saranno in grado di farlo, ma non abbastanza strategiche da nasconderlo? Non sapevo di avere quella finestra, ma a quanto pare ce l’abbiamo.

Il governo inizialmente bloccò un modello frontier all’inizio di quest’anno: Fable di Anthropic. Questo ti dà speranza?

Assolutamente. Una quantità enorme. Un anno fa, l’amministrazione Trump spingeva leggi di precauzione che avrebbero vietato agli stati di regolamentare l’IA per un decennio. Ora dicono: «Stiamo vietando un modello frontier con 90 minuti di preavviso perché potrebbe dare capacità cibernetiche agli avversari che non vogliamo che abbiano.» … E penso che ciò che è cambiato lì sia che le persone hanno capito che è reale. … Il dietro-front dell’amministrazione su questa questione dimostra che il mondo può girarsi. Tutto ciò di cui abbiamo bisogno è consapevolezza.

Quello che direi è: la cattiva notizia è che l’autobus sta correndo verso un bordo di scogliera. La buona notizia è che l’autista dorme. … Il che può sembrare preoccupante, ma l’autista si sta svegliando. Ed è molto meglio avere un autista addormentato quando si procede verso una scogliera piuttosto che avere un autista che dice: “Sì, adoro le scogliere.” … Questo mi dà speranza che se il mondo se ne accorgesse, potremmo fermarci al minimo indispensabile.

E vedi che questo risveglio sta avvenendo altrove.

Sia l’amministrazione Trump che l’imposizione di controlli all’esportazione, sia la posizione del senatore Bernie Sanders sull’IA hanno fatto emergere una grande quantità di speranza, a mio parere, nel fatto che il mondo potrebbe notare l’allarme prima di chiudere il baratro. Quindi, c’è una notevole quantità di speranza, da parte mia, nel fatto che l’autista dell’autobus si stia svegliando.

Spero che ciò di cui abbiamo bisogno non sia un grande disastro in cui molte persone muoiono, ma solo un avanzamento delle capacità. In questo momento, gran parte di ciò a cui reagiscono le persone non è tanto: «Oh mio Dio, hanno hackerato un’azienda e non hanno causato danni.» Penso che gran parte di ciò a cui reagiscono sia: «Aspetta, possono sfuggire dai sandbox sicuri ed eseguire attacchi informatici autonomamente. Non sapevo che potessero farlo.»

Questa è una violazione narrativa dell’idea che l’IA sia solo uno strumento che può essere usato per potenziare ciò che farebbe un essere umano — perché, per carità, c’è molto hacking e cybercrimine e così via. È stato l’elemento autonomo a fare davvero la differenza. E questi qui stanno tutti cercando di dire: «Non preoccupatevi, resterà sotto il nostro controllo perché è solo uno strumento.» E forse è solo più violazioni narrative, anche senza grandi danni, che fanno pensare alle persone: «Oh, cavolo, questa roba è reale.»

Succederà? Non lo so. Abbiamo questa finestra tra IA capaci di causare malefizi e IA abbastanza strategiche da non farsi prendere. Quanto è grande questa finestra? Quante violazioni narrative otteniamo prima di uscire dal lato destro di essa? Non lo so. Ma sono fiducioso che possiamo ottenere tali violazioni narrative senza catastrofi.

Tommaso Rinaldi

Mi occupo di analisi geopolitica con un’attenzione particolare alle relazioni tra potenze emergenti e scenari europei. Nei miei articoli cerco di offrire una lettura chiara e strutturata di dinamiche complesse, mantenendo un approccio rigoroso. Scrivere per Eurasia significa contribuire a una comprensione più approfondita degli equilibri internazionali contemporanei.