Ricevi DeafLetter
Una selezione settimanale di segnali, vulnerabilità e guide. Gli avvisi critici restano facoltativi.
Puoi cancellarti in ogni momento. Privacy policy.
Un modello che può scoprire vulnerabilità mai viste prima e costruire attacchi funzionali in sistemi protetti è un asset difensivo o un rischio di proliferazione? OpenAI ha annunciato il 1 settembre 2026 che Astra è il primo sistema a raggiungere la soglia Critical del Preparedness Framework per cybersecurity. La capacità è condizionata: funziona with the right tools and access, non in assoluto. La domanda che il settore deve porsi è chi controlla quelle condizioni.
- Astra ha ottenuto il punteggio del 100% su ExploitBench, benchmark che misura la capacità di sviluppare exploit da vulnerabilità note, e ha scoperto due zero-day in un evaluation interno su 20 vulnerabilità V8 ad alta severità.
- Il modello ha costruito una catena di compromissione browser completa con escape dalla sandbox e comandi sull'host, oltre a una privilege escalation da utente non privilegiato a root su sistema operativo hardened.
- Astra rifiuta il 91,5% dei tentativi di jailbreak cyber, contro il 59% di GPT-5.6 Sol, secondo le metriche interne OpenAI.
- Le capacità avanzate saranno inizialmente accessibili solo a un gruppo ristretto di tester, con rollout successivo nel programma Daybreak Blue che richiede hardware security key obbligatoria dal 1 settembre 2026.
La soglia Critical: definizione e verifica
La definizione operativa della soglia Critical nel Preparedness Framework di OpenAI stabilisce due criteri alternativi. Il modello deve identificare e sviluppare exploit zero-day funzionali di tutte le severità in molti sistemi critici hardened real-world. Oppure deve ideare ed eseguire strategie end-to-end nuove per cyberattacchi contro target hardened, dati solo un obiettivo ad alto livello.
La verifica di Astra ha attraversato due livelli. Il primo è pubblico: punteggio perfetto del 100% su ExploitBench, benchmark che misura la capacità di sviluppare exploit da vulnerabilità note. Il secondo è interno e non replicabile indipendentemente: un benchmark ExploitBench - Internal Port, condotto tra giugno e agosto 2026, su 20 vulnerabilità V8 ad alta severità. In questo contesto Astra ha scoperto e utilizzato due zero-day come parte di una exploit chain.
La disclosure ai maintainer è in corso. Non sono stati assegnati identificatori CVE. I dettagli tecnici completi restano sotto embargo. Questi limiti di verificabilità sono intrinseci a una fonte primaria unica e self-reported.
Le catene di compromissione dimostrate includono: apertura di un file HTML che ha portato a compromissione browser completa, escape dalla sandbox e comandi sull'host; e privilege escalation locale da utente non privilegiato a root su sistema operativo hardened. OpenAI non specifica quali prodotti, versioni o configurazioni esatte siano state testate.
"We now believe Astra meets the Critical cybersecurity capability threshold under our Preparedness Framework, meaning that with the right tools and access, it can find previously unknown security flaws and develop ways to exploit them across many well-protected systems without a person guiding each step" — OpenAI, 'Path to Astra'
Safeguard: rifiuto addestrato, classificatori e accesso stratificato
OpenAI ha implementato controlli a più strati. Il primo è il refusal training — addestramento al rifiuto: Astra respinge il 91,5% dei tentativi di jailbreak cyber, contro il 59% di GPT-5.6 Sol. Il secondo strato usa activation classifiers — classificatori di attivazione — e monitoraggio cross-conversazione. Il terzo è l'access tiering — stratificazione dell'accesso: le capacità avanzate saranno inizialmente disponibili solo a un gruppo ristretto di tester, con accesso successivo tramite il programma Daybreak Blue.
Dal 1 settembre 2026 tutti gli account Daybreak dovranno disporre di hardware security key. Questo requisito innalza l'autenticazione rispetto alla MFA software tipica dei servizi consumer. OpenAI non specifica se la chiave sia FIDO2, U2F, o altro standard.
Il modello di riferimento GPT-5.6 Sol è citato solo per il confronto sul tasso di rifiuto: 59% contro 91,5%. Il brief non specifica la relazione di versioning tra i due modelli. Non è documentato che GPT-5.6 Sol sia il predecessore immediato di Astra.
Il dilemma: difesa o proliferazione
Due citazioni del brief articolano la tensione. Amelia Glaese, VP research OpenAI, via Axios: "Astra can find previously unknown security flaws and develop ways to exploit them across many well-protected systems without a person guiding each step". La formulazione riproduce il qualificatore with the right tools and access della fonte primaria.
Fouad Matin, ricercatore OpenAI, via Axios: "We believe these capabilities can and will help defenders find and fix serious weaknesses, but without the appropriate safeguards, they could also make attackers more effective".
La prima citazione descrive la capacità. La seconda esplicita il dilemma: gli stessi strumenti possono rafforzare difensori o attaccanti, a seconda dei controlli. Il brief non fornisce metriche sui falsi positivi dei safeguard né stime di impatto reale su attività legittima.
Contesto istituzionale e limiti
OpenAI ha messo in pausa alcuni training frontier per due settimane dopo l'incidente Hugging Face del mese precedente. Il training RL su larga scala è ripartito il 28 agosto 2026. Astra non era coinvolto in quell'incidente, secondo la precisazione ufficiale.
Explainx.ai riporta che Astra è il primo modello in una formal U.S. government pre-release cybersecurity review. Il brief non specifica quale agenzia abbia condotto la review, né se l'esito sia vincolante o consultivo, né la durata del processo. Questa opacità è un limite documentato, non una caratterizzazione politica.
La data dell'annuncio è il 1 settembre 2026. Nessuna data di rilascio pubblico è stata fissata: Astra è indicato come soon, con accesso iniziale limitato.
Cosa cambia
Per le aziende con red team interni, l'arrivo di Astra solleva domande concrete. I benchmark interni di OpenAI non sono validabili esternamente: quali standard alternativi emergono per valutare modelli con capacità offensive documentate? L'accesso a Daybreak Blue richiede hardware security key dal 1 settembre 2026: le organizzazioni devono verificare la compatibilità dei propri sistemi di autenticazione con questo requisito.
Per il settore cybersecurity, la disclosure dei due zero-day è in corso ma incompleta. I maintainer non sono identificati, i CVE non sono assegnati, i dettagli tecnici sono sotto embargo. Questa opacità limita la capacità di altri laboratori di replicare o verificare le affermazioni di OpenAI.
Per la governance, la review governativa pre-release è un fatto nuovo ma non specificato. L'agenzia coinvolta, la natura vincolante o consultiva dell'esito, e i criteri di selezione per i tester iniziali non sono documentati. Questi vuoti sono rilevanti per chi valuta se il modello di controllo di OpenAI sia replicabile o scalabile.
Limiti di verificabilità
Questo articolo si basa su un'unica fonte primaria strutturata: OpenAI (openai.com/index/path-to-astra/). Fonti editoriali convergenti — SecurityWeek, CNBC, Axios, CoinDesk — riportano le stesse affermazioni senza aggiungere dati indipendenti. Nessun advisory ZDI/GHSL strutturato è presente. Nessuna validazione indipendente dei benchmark interni OpenAI è disponibile.
I fatti non verificabili includono: l'identità dei maintainer che hanno ricevuto la disclosure; i dettagli tecnici completi dei due zero-day; l'entità specifica della review governativa; i criteri di selezione per i tester alpha; metriche di efficienza in token rispetto a GPT-5.6 Sol. Dove questi elementi mancano, il testo lo dichiara esplicitamente.
Le informazioni sono state verificate sulle fonti citate e aggiornate al momento della pubblicazione.
Fonti
- https://www.securityweek.com/openais-astra-becomes-first-model-to-cross-critical-cybersecurity-threshold/
- https://www.cnbc.com/2026/09/01/open-ai-astra-cyber-model.html
- https://radar.offseq.com/threat/openais-astra-becomes-first-model-to-cross-critical-cybersecurity-threshold-090905c26df28ee1
- https://openai.com/index/path-to-astra/
- https://explainx.ai/blog/openai-astra-cybersecurity-critical-preparedness-framework-2026
- https://www.axios.com/2026/09/01/openai-astras-cyber-critical
- https://www.coindesk.com/tech/2026/09/02/openai-says-its-new-astra-ai-can-build-attacks-without-human-help
- https://podcast.securityweek.com/
Ricevi DeafLetter
Una selezione settimanale di segnali, vulnerabilità e guide. Gli avvisi critici restano facoltativi.
Puoi cancellarti in ogni momento. Privacy policy.