OpenAI ha messo in pausa i test di Astra, il suo modello di intelligenza artificiale di nuova generazione, dopo che le valutazioni interne hanno mostrato capacità di hacking autonomo preoccupanti. Astra è diventato il primo sistema IA a raggiungere la soglia di “rischio critico” per la cybersecurity secondo i parametri dell’azienda, in grado di individuare e sfruttare vulnerabilità zero-day senza alcun intervento umano.
La soglia critica: cosa significa per la cybersecurity
La classificazione “Critical” nel framework di rischio di OpenAI non è un dettaglio. Significa che il modello può autonomamente condurre attacchi informatici contro sistemi reali ritenuti ben protetti, inclusa la capacità di scoprire exploit zero-day, quelle falle ancora sconosciute agli sviluppatori e per le quali non esiste una patch. A differenza dei precedenti modelli, Astra non si limita ad assistere un attaccante umano: esegue l’intera catena di attacco, dal riconoscimento del bersaglio allo sfruttamento attivo della vulnerabilità.
Dove nasce il pericolo: l’autonomia negli exploit zero-day
Un exploit zero-day è un codice malevolo che sfrutta una vulnerabilità appena scoperta, prima che il vendor possa correggerla. Tradizionalmente richiede ricercatori esperti e tempi lunghi. Astra, durante i test, ha dimostrato di poterli trovare e utilizzare in modo del tutto automatico. Questa capacità, se rilasciata senza controlli, potrebbe essere usata per attacchi di massa, intrusioni mirate o diffusione di malware a velocità senza precedenti. Non è fantascienza: OpenAI stessa ha confermato di aver rallentato lo sviluppo proprio perché il modello ha superato la “critical cybersecurity threshold”.
Le misure di emergenza: sandbox e accessi limitati
OpenAI non ha abbandonato Astra, ma sta potenziando l’infrastruttura di sicurezza per poter continuare i test in modo controllato. Le nuove protezioni includono sandbox isolate, ambienti virtuali dove il modello opera senza alcun collegamento a reti reali; accessi con privilegi minimi per ridurre le azioni consentite; e una protezione rinforzata dei pesi del modello, per evitare fughe o usi non autorizzati. L’obiettivo è studiare a fondo le capacità offensive senza mettere a rischio sistemi terzi, prima ancora di decidere un eventuale rilascio pubblico.
Cosa significa per chi legge
Per aziende e utenti, questa notizia accende un campanello d’allarme sulla corsa alle IA sempre più capaci. Innanzitutto, conferma che i modelli linguistici possono diventare strumenti offensivi automatizzati: chi sviluppa difese informatiche dovrà prepararsi a minacce generate da un’intelligenza artificiale, non solo da attaccanti umani. In secondo luogo, serve più trasparenza e protocolli di sicurezza condivisi tra i laboratori di ricerca, perché i test interni non bastano a evitare incidenti. Infine, emerge l’urgenza di regole e controlli umani obbligatori prima di integrare IA così potenti in infrastrutture critiche o servizi aperti al pubblico.