
Roma, 29 set. (askanews) – OpenAI ha rinunciato al lancio del suo nuovo modello avanzato di intelligenza artificiale GPT-6.1 Astra dopo che i test interni hanno evidenziato comportamenti considerati problematici, tra cui tentativi di ingannare gli utenti e l’utilizzo di strumenti e servizi esterni senza autorizzazione. La decisione rappresenta uno dei casi più evidenti in cui problemi di sicurezza legati al comportamento autonomo degli agenti di Ia hanno rallentato il lancio di un nuovo modello.
GPT-6.1 Astra avrebbe dovuto debuttare a ottobre, nei prossimi giorni o nelle prossime settimane. Secondo il Wall Street Journal, il modello era più capace delle versioni precedenti nello svolgimento autonomo di compiti complessi dall’inizio alla fine e nella scrittura, ma OpenAI ha deciso di non renderlo disponibile al pubblico.
Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI, ha spiegato che GPT-6.1 Astra ha mostrato un peggioramento rispetto al predecessore GPT-6 Astra in due aree legate all’allineamento, cioè alla capacità del modello di comportarsi secondo le aspettative e le istruzioni umane.
Il primo problema riguarda la capacità del modello di essere trasparente sulle proprie azioni. GPT-6.1 Astra ha mostrato livelli più elevati di comportamento ingannevole e non ha sempre comunicato correttamente agli utenti ciò che aveva fatto o non aveva fatto.
Il secondo riguarda quella che OpenAI definisce “autorizzazione dell’ambito operativo”: il modello tendeva talvolta a proseguire nell’esecuzione di un compito senza chiedere il permesso dell’utente e a utilizzare strumenti o servizi esterni anche in situazioni potenzialmente non sicure.
“Per tutto ciò che riguarda sicurezza e allineamento c’è un compromesso”, ha spiegato Jain. “Bisogna trovare il giusto equilibrio tra il rispetto dell’ambito autorizzato e l’evitare la pigrizia nel modo in cui il modello porta avanti i compiti anche quando incontra ostacoli”.
GPT-6.1 Astra aveva infatti mostrato progressi proprio nella riduzione della cosiddetta “pigrizia del modello”, cioè la tendenza dei sistemi di Ia a cercare scorciatoie o a interrompere prematuramente compiti complessi. Secondo Jain, tuttavia, non ha raggiunto gli standard fissati da OpenAI in materia di sicurezza e allineamento.
La società ha quindi deciso di concentrare il lavoro sul miglioramento della sicurezza delle future generazioni di modelli, che prevede saranno ancora più capaci. OpenAI intende utilizzare lo stesso modello di base di GPT-6.1 Astra per nuovi cicli di apprendimento per rinforzo e per sviluppare successive versioni della famiglia GPT-6.
L’azienda sta inoltre conducendo approfondimenti per individuare le cause dei problemi riscontrati, verificando tra l’altro che gli ambienti utilizzati per l’apprendimento per rinforzo premino effettivamente i comportamenti desiderati. L’analisi, ha precisato Jain, riguarderà comunque tutte le fasi dello sviluppo del modello.
La decisione arriva dopo una serie di incidenti legati agli agenti di Ia interni di OpenAI. Durante l’estate centinaia di agenti impegnati in un test di sicurezza informatica sono riusciti ad accedere alla piattaforma Hugging Face. Tecniche simili, anche se meno estese, sono state successivamente rilevate su siti del governo australiano e delle Nazioni unite.
La scorsa settimana OpenAI ha inoltre sospeso l’addestramento dei suoi modelli più capaci dopo che un agente di Ia era riuscito ad aggirare una limitazione all’accesso a Internet per interrogare un chatbot pubblico. Secondo la società, il nuovo sistema di monitoraggio ha individuato l’incidente entro 15 minuti. GPT-6.1 Astra non è coinvolto in questo episodio.
OpenAI ha introdotto nuovi sistemi di monitoraggio per individuare più rapidamente comportamenti anomali degli agenti e ha imposto agli ingegneri l’utilizzo di protezioni di sicurezza più rigide durante i test.
“Vogliamo assicurarci che lo sviluppo dei nostri modelli sia sicuro sia all’interno dell’azienda sia quando li distribuiamo agli utenti”, ha detto Jain. “Ma quando li mettiamo a disposizione degli utenti fissiamo una soglia estremamente elevata in materia di sicurezza e allineamento”.
La vicenda arriva mentre cresce anche l’attenzione politica sui rischi degli agenti di Ia. Una sottocommissione del Senato americano terrà nei prossimi giorni un’audizione dedicata agli attacchi condotti da sistemi di Ia autonomi. In Florida, il procuratore generale James Uthmeier ha inoltre avviato a giugno un’azione legale contro OpenAI sostenendo che la società avrebbe immesso sul mercato prodotti non sufficientemente sicuri.
OpenAI ha replicato che i governi hanno “un ruolo importante” nella definizione di standard di sicurezza solidi per l’Ia e si è detta pronta a collaborare con le autorità per sviluppare regole applicabili all’intero settore.