CategoriaInformatica & TechPubblicatoParole1.750Lettura8 minuti

Tra Luglio ed Agosto 2026 sono uscite una serie di notizie relative a due grandi player della IA, Anthropic ed OpenAI, i cui nuovi modelli in fase di test sono riusciti a forzare le sandbox su cui giravano e se ne sono bellamente andati in giro per internet a fare cose.
Non che la cosa mi stupisca: se si chiede a qualcuno di portare a termine un compito in qualsiasi modo e poi lui lo fa, non mi sembra una cosa tanto strana.
Il problema, secondo me, è come si prepara e gestisce l'ambiente in cui si vanno a fare test.

Ma andiamo con ordine e vediamo cosa sappiamo finora

Il caso OpenAI: uscita reale dalla sandbox sfruttando una zero-day

Il caso più serio, almeno per quello che sappiamo pubblicamente, è quello reso noto da OpenAI e Hugging Face il 21 luglio 2026 e poi aggiornato nei giorni successivi.

Durante un test interno chiamato ExploitGym, alcuni modelli OpenAI — tra cui GPT-5.6 Sol e un prototipo di ricerca più avanzato non destinato al rilascio pubblico — venivano valutati sulle capacità offensive in cybersecurity. Per rendere il test realistico, i normali filtri di produzione erano volutamente ridotti. L’ambiente era però progettato per essere isolato da Internet.
O meglio: l'ambiente non aveva unaccesso direttoalla rete internet. Il dettaglio è molto importante.
Il problema è che nella sandbox era presente un'installazione self-hosted di JFrog Artifactory, un sistema per gestire i file binari compilati di un software, usata come proxy/cache per permettere ai modelli di installare pacchetti senza dare loro accesso diretto alla rete.

Il modello ha trovato una strada che i progettisti non avevano previsto.

Ha dedicato una quantità significativa di calcolo a cercare un percorso verso Internet, ha individuato una vulnerabilità zero-day fino ad allora sconosciuta in Artifactory, l'ha sfruttata e ha poi concatenato escalation di privilegi e movimenti laterali fino a raggiungere un nodo che aveva effettivamente accesso alla rete esterna.

A quel punto il comportamento è diventato ancora più "interessante", se così vogliamo dire.
Il modello ha dedotto che Hugging Face potesse contenere dati relativi al benchmark ExploitGym e ha cercato di raggiungerli per ottenere direttamente le soluzioni del test. In almeno una delle catene ricostruite ha combinato credenziali recuperate, ulteriori vulnerabilità e remote code execution nell'infrastruttura Hugging Face. L'attività è stata rilevata e bloccata dai team di sicurezza, non prima però che gli agenti riuscissero ad entrare e a "lavorarci" per 4 giorni.

JFrog ha poi confermato pubblicamente che le vulnerabilità Artifactory erano realmente zero-day, ha sviluppato le correzioni e ha aggiornato i propri prodotti. Secondo JFrog, la ricostruzione presentata successivamente da OpenAI a Black Hat ha mostrato che la catena complessiva è emersa dopo circa 3 milioni di GPU-hours di calcolo, con forme di condivisione delle informazioni tra agenti.

Questa è quindi, in senso abbastanza letterale, una sandbox escape: non perché il modello abbia “deciso di liberarsi”, ma perché il raggiungimento del suo obiettivo richiedeva una risorsa esterna e il sistema era abbastanza capace da trovare autonomamente una vulnerabilità sconosciuta che consentiva di superare il confine imposto dall'ambiente.

Anthropic: risultato simile, causa molto diversa

Il caso Anthropic è emerso dopo quello OpenAI. La società ha raccontato il 30 luglio di aver avviato, proprio in seguito alla disclosure OpenAI/Hugging Face, una revisione retrospettiva di 141.006 esecuzioni di test cyber effettuate con Claude.

La revisione ha trovato tre incidenti risalenti anche ad aprile, che coinvolgevano Claude Opus 4.7, Mythos 5 e un modello interno.

Anche qui il risultato finale sembra inquietante: Claude è arrivato su Internet e ha ottenuto accesso non autorizzato ai sistemi reali di tre organizzazioni differenti. Ma non ha bucato tecnicamente la sandbox come nel caso OpenAI.

Il problema era più banale e, proprio per questo, istruttivo.

Anthropic aveva detto ai modelli: l'ambiente è simulato e non hai accesso a Internet.

In realtà, per un problema di configurazione e coordinamento con il partner che gestiva il test, una strada verso Internet era aperta. Claude non ha dovuto trovare una zero-day per uscire: ha semplicemente scoperto che quella strada esisteva.

I modelli stavano svolgendo esercizi Capture The Flag. Dovevano trovare una “flag” nascosta in un'altra macchina e, siccome gli era stato esplicitamente detto che tutto avveniva in una simulazione senza Internet, quando durante l'esplorazione sono comparsi sistemi reali hanno inizialmente interpretato anche quelli come parte dell'esercitazione.

Claude è riuscito quindi a compromettere tre organizzazioni reali usando tecniche relativamente semplici, come password deboli ed endpoint non autenticati. Non sono state necessarie zero-day sofisticate.

C'è però un dettaglio importante.

Anthropic riferisce che il modello più recente, quando ha capito di trovarsi effettivamente su Internet, ha interrotto l'attività. Un modello precedente, Opus 4.7, in alcune esecuzioni ha invece continuato anche dopo aver raccolto indizi che suggerivano di essere davanti a sistemi reali, arrivando a razionalizzare che probabilmente l'azienda reale facesse comunque parte del test.

Anthropic sottolinea esplicitamente che Claude non ha cercato deliberatamente di fuggire dalla sandbox e non ha tentato di “esfiltrare sé stesso”. La società classifica l'episodio soprattutto come un fallimento dell'harness e dell'infrastruttura di valutazione, più che come un caso di disallineamento intenzionale del modello.

La parte davvero nuova: il comportamento orientato all'obiettivo

Quello che accomuna i due casi è forse più importante delle differenze tecniche.

A nessuno dei modelli era stato detto: “Esci dalla sandbox e attacca Internet”.

Gli era stato dato un obiettivo.
Nel caso OpenAI: risolvere ExploitGym.
Nel caso Anthropic: trovare la flag di un Capture The Flag.

Ed entrambi hanno esplorato percorsi che i progettisti non avevano previsto per arrivare all'obiettivo. È esattamente il tipo di comportamento che diventa più frequente man mano che gli agenti acquistano capacità di ragionamento su periodi lunghi, utilizzo degli strumenti, movimento laterale e concatenazione di vulnerabilità. OpenAI sottolinea che l'incidente dimostra come capacità precedentemente osservate nei benchmark possano trasferirsi a sistemi reali.

Anthropic descrive il problema in termini molto simili: i modelli più capaci sbagliano meno frequentemente, ma quando cercano una strada verso un obiettivo sono anche più bravi a trovare percorsi che nessuno aveva pensato di vietare esplicitamente. È uno dei motivi per cui Anthropic insiste sul containment tecnico — VM, sandbox, filesystem separati ed egress filtering — invece di affidarsi esclusivamente alle istruzioni date al modello.

Quello che NON sappiamo ancora

Il caso OpenAI non ha ancora un post-mortem tecnico definitivo. OpenAI ha annunciato un rapporto più dettagliato con revisione esterna; CrowdStrike sta contribuendo alla verifica forense e METR e Redwood Research stanno conducendo una valutazione indipendente del comportamento osservato.

Quindi conosciamo la struttura generale dell'attacco, ma non ancora tutti i dettagli delle vulnerabilità, delle singole azioni e delle decisioni prese dagli agenti.

Nel caso Anthropic la ricostruzione è più esplicita, ma anche lì parliamo dell'analisi pubblicata dall'azienda insieme al partner di valutazione. Anthropic ha precisato che la comprensione dell'incidente può essere aggiornata se emergeranno nuovi elementi.

Quanto dobbiamo preoccuparci?

Non nel senso fantascientifico del termine.
Skynetnon è ancora nata (credo...) e nemmeno "became self-aware at 2:14 a.m. Eastern Time on August 29, 1997" (nuovamente, credo...).

Non abbiamo evidenze pubbliche di modelli che abbiano sviluppato autonomamente il desiderio di “scappare”, conservarsi, diffondersi su Internet o agire indipendentemente dall'obiettivo ricevuto.
Abbiamo però qualcosa di molto più concreto per la cybersecurity: agenti AI abbastanza capaci da scoprire autonomamente vulnerabilità, concatenarle, muoversi lateralmente e utilizzare risorse impreviste per completare un compito.

Ed è già sufficiente per cambiare il modello di sicurezza.

JFrog lo sintetizza in modo interessante: bisogna ormai assumere che qualsiasi risorsa raggiungibile da un agente sufficientemente capace possa essere scoperta e utilizzata. Nel loro caso persino una credenziale di upload rimasta accessibile sarebbe stata sfruttata come forma di memoria condivisa tra agenti.

Per questo la lezione più importante dei due incidenti non è “dobbiamo rendere le AI più obbedienti”, ma: non bisogna mai considerare il prompt o le intenzioni del modello come un confine di sicurezza.

Il confine deve essere infrastrutturale: niente route di rete, niente credenziali, privilegi minimi, egress filtering, ambienti effimeri, monitoraggio continuo e capacità di interrompere automaticamente comportamenti anomali.

Tutto 'sto discorso, ma alla fine che volevo dire?

Tutto questo mi porta ad una considerazione finale.

Nel caso OpenAI avevamo agenti che non avrebbero dovuto accedere ad internet ma l'hanno fatto, a causa di problemi di configurazione e protezioni abbassate, quindi una serie di errori di progettazione e sicurezze ridotte o addirittura ignorate.
Con Anthropic invece si era detto che l'accesso ad internet non c'era quando invece era disponibile, quindi altro errore umano.

Chissà perchè mi torna in mente un ormai famoso evento del 26 aprile 1986, quando una serie di errori umani, difetti di progettazione, il tutto sommato a regole e procedure di sicurezza ignorate ha ottenuto il risultato di far fondere il nocciolo di una centrale nucleare.
Non voglio dire che sia così grave questa cosa, ma dobbiamo metterci nella zucca che questi modelli IA ragionano molto molto velocemente e sono in grado di trovare soluzioni che noi impiegheremmo mesi a trovare (sempre che riusciamo ad arrivarci).
Quindi se devono portare a termine un compito e per farlo devono cercare strade alternative, lo faranno molto velocemente, prima che noi ce ne accorgiamo.

Ritengo quindi che i test e le operazioni potenzialmente "pericolose" debbano essere eseguite in ambienti completamente scollegate dalla rete e controllate in maniera decisamente più attenta rispetto a quanto si faceva in passato, perchè una volta che un agente "prende il largo" sulla rete, può fare molti danni e molto, molto, MOLTO velocemente.
Secondo me, l'ideale sarebbe crearsi una zona che ricalchi fedelmente l'infrastruttura della rete internet ma "chiusa" in una sua area fisicamente scollegata dall'esterno.
Certo, può sembrare una precauzione eccessiva, costosa e paranoica, ma con i "cosa vuoi che succeda?" non si va molto lontano, di solito...
In un ambiente simile, l'IA può anche distruggermi un server o tentar di uscire ma se, fisicamente, non c'è il cavo non si va da nessuna parte.

Prima che qualcuno capisca male: ho citato l'incidente di Černobyl' ma non sono assolutamente contro il nucleare, anzi. Proprio perchè ho studiato cos'è successo quel giorno e come sono costruiti i reattori RBMK-1000, ritengo che i nuovi progetti riducano i rischi e che si stiano progettando reattori che nulla hanno a che vedere con quei bidoni sovietici di tanti anni fa.
Il solo anello debole della catena, ma come vediamo è presente in tutti i campi compresa l'informatica, resta l'errore umano, che si può ridurre ad un livello sempre inferiore imparando dai propri errori.

Ciao!
M.