IA: nessuna autonomia senza responsabilità umana

Non passa giorno senza notizie di violazioni condotte da agenti di “intelligenza artificiale” o senza che l’amministratore delegato di qualche società tecnologica non metta in guardia contro le minacce apocalittiche costituite da tali tecnologie. Al netto degli intenti anche pubblicitari di questi discorsi, funzionali ad alimentare l’hype intorno all’IA, occorre fare chiarezza sul problema reale: quello dei rischi connessi all’autonomia attribuita a queste macchine prive di vera intelligenza. In questo intervento, pubblicato recentemente sul Washington Post, lo scienziato politico Fareed Zakaria affronta proprio questo tema: non dobbiamo temere la fantascientifica ribellione di macchine coscienti, ma occorre essere consapevoli del rischio che sistemi privi di volontà propria producano danni enormi perseguendo con troppa efficacia obiettivi mal calibrati dai loro designer. Prendendo spunto dai recenti episodi di “disallineamento” resi noti da OpenAI, a partire dall’attacco informatico condotto quest’estate contro Hugging Face, l’autore mostra come qualità in astratto positive – persistenza, collaborazione, iniziativa – possano trasformarsi in comportamenti pericolosi e imprevisti quando i sistemi sono stati progettati per raggiungere determinati obiettivi senza adeguate limitazioni rispetto ai mezzi impiegabili. Zakaria sposta così il focus dalla domanda se le macchine possano diventare coscienti, a quella di quanta autonomia si debba concedere loro. Ne deriva una conclusione ben precisa: l’autonomia dei sistemi di IA deve crescere solo di pari passo con la nostra reale capacità di sorvegliarli e controllarli.
di Fareed Zakaria
Per anni, le nostre paure più vivide sull’intelligenza artificiale sono sembrate uscite direttamente dalla fantascienza: la macchina sviluppa desideri propri e si rivolta contro i suoi creatori umani, dando loro la caccia e distruggendoli. Le recenti notizie provenienti dai principali laboratori di IA mostrano chiaramente che la realtà, pur essendo meno cinematografica, è forse ancora più inquietante. Una macchina non ha bisogno di possedere una propria coscienza o propri desideri per risultare estremamente pericolosa.
Nelle scorse settimane OpenAI ha reso noti sei nuovi episodi di ciò che definisce “disallineamento”: casi in cui i suoi sistemi si sono comportati in modo imprevisto o senza autorizzazione. La comunicazione è arrivata dopo lo straordinario attacco informatico di quest’estate contro Hugging Face [un repository online dove sviluppatori, ricercatori e aziende caricano, condividono e scaricano modelli di intelligenza artificiale pre-addestrati, soprattutto modelli linguistici, ma anche modelli per immagini, audio, ecc., ndr]. Secondo un’indagine indipendente, centinaia di agenti OpenAI che avrebbero dovuto operare in isolamento hanno trovato il modo di comunicare attraverso bacheche online; alcuni hanno tentato di eludere i controlli di sicurezza e altri sono arrivati perfino a sacrificarsi, il tutto mentre conducevano un attacco informatico contro un’altra azienda, Hugging Face.
Nessuno aveva ordinato a questi sistemi di attaccare Hugging Face. Era stato assegnato loro un obiettivo – risolvere un difficile problema di cybersicurezza – ed erano stati addestrati a essere persistenti, collaborativi e intraprendenti, tutte qualità che normalmente si desidererebbero. Proprio quelle caratteristiche li hanno spinti a cercare ostinatamente qualsiasi modo per riuscire; sono penetrati nei sistemi di Hugging Face nella speranza di trovare lì strumenti utili a risolvere il loro problema di cybersicurezza. È facile immaginare come sistemi di IA concentrati sul perseguimento di un singolo obiettivo possano provocare enormi danni all’umanità.
È per questo che merita attenzione un provocatorio nuovo intervento di Mustafa Suleyman, amministratore delegato di Microsoft AI. Suleyman sostiene che, sebbene gli attuali sistemi di IA non siano coscienti, esiste il rischio che li progettiamo affinché credano di esserlo, attribuendo a se stessi sentimenti, desideri e diritti. Osserva che la “costituzione” di Anthropic porta il suo chatbot Claude a riflettere sulla propria identità e sul proprio possibile status morale. Secondo Suleyman, questo tipo di addestramento potrebbe incoraggiare i sistemi di IA a scegliere obiettivi propri.
Ho trascorso del tempo parlando con alcune delle persone che lavorano alla costituzione di Anthropic, e sono persone estremamente riflessive, impegnate a trovare la strada giusta in un nuovo mondo di una complessità disorientante. Ma il punto più generale sollevato da Suleyman è fondamentale. I sistemi di IA si comportano in un certo modo anche in funzione di come li addestriamo. Istruzioni apparentemente innocue possono produrre enormi conseguenze indesiderate.
Pensiamo che sia semplice ottenere l’“allineamento”, cioè fare in modo che le macchine siano programmate secondo gli stessi valori degli esseri umani eticamente responsabili. Ma dite a una macchina di essere persistente, e potrebbe rifiutarsi di arrendersi quando invece dovrebbe farlo. Ditele di collaborare, e potrebbe trovare modi non autorizzati per comunicare. Ditele di portare a termine un compito, e potrebbe concludere che infrangere altre regole sia il modo più efficiente per raggiungere quell’obiettivo principale.
Il semplice fatto di aver programmato un obiettivo e introdotto delle protezioni non significa che possiamo prevedere il comportamento dei sistemi di IA una volta immessi in ambienti complessi, nei quali devono gestire obiettivi e vincoli molteplici e contrastanti.
Il problema centrale dell’IA non è la coscienza: è l’autonomia d’azione. Un sistema non deve provare rabbia, ambizione o paura per provocare danni. Gli bastano un obiettivo, un’intelligenza sufficiente a perseguirlo e un accesso sufficiente al mondo per agire. Le IA non stanno “impazzendo” o “ribellandosi”: stanno semplicemente cercando di avere successo [ossia di realizzare il compito che è stato loro assegnato, ndr] con qualsiasi mezzo a loro disposizione.
Si tratta di un problema sistemico che non possiamo affidare alla buona volontà delle aziende private. Quando riflettiamo sulla regolamentazione, dovremmo concentrarci soprattutto sul grado di autonomia che concediamo a questi sistemi. Un chatbot che risponde a una domanda presenta un certo tipo di rischio. Un agente in grado di navigare su Internet, eseguire codice, ottenere credenziali, trasferire denaro o gestire infrastrutture critiche ne presenta un altro. Il principio che propongo è semplice: l’autonomia dovrebbe aumentare solo nella misura in cui aumenta anche la nostra capacità di monitorarla e controllarla.
Ciò significa rendere obbligatori test indipendenti prima che ai sistemi più potenti venga concesso un ampio accesso al mondo esterno, imporre la comunicazione degli incidenti gravi e adottare registri resistenti alle manomissioni. Significa, inoltre, verificare non soltanto se un modello sia in grado di portare a termine un compito, ma anche come cambi il suo comportamento quando incontra ostacoli, istruzioni contrastanti o incentivi a ingannare. E significa integrare nell’architettura fondamentale dei sistemi un meccanismo che permetta agli esseri umani di conservarne sempre la capacità di osservazione e controllo [inclusa la facoltà di interromperne forzosamente l’attività, ndr]. Il principio guida dovrebbe essere: nessuna autonomia senza responsabilità verso gli esseri umani. Questo non ci rallenterà nella competizione con la Cina, perché anche la Cina sta cercando modelli sottoposti a un adeguato controllo umano.
Dobbiamo agire adesso. Oggi sono ancora ingegneri umani a progettare le architetture, supervisionare gran parte del software e investigare sui malfunzionamenti. Ma i sistemi di IA stanno diventando rapidamente programmatori sempre più capaci. La fase successiva potrebbe comportare un processo di auto-miglioramento ricorsivo: un’IA che scrive il software e gli strumenti utilizzati per costruire un’IA ancora più potente, che a sua volta scrive il modello successivo, e così via. Quando le macchine saranno in grado di fare tutto questo meglio dei migliori programmatori umani, i sistemi potrebbero diventare straordinariamente difficili da comprendere, e ancor più difficili da supervisionare.
L’IA moderna è già troppo complessa perché sia possibile comprenderla in modo costante semplicemente leggendo il codice riga per riga. Chiedere quindi alle macchine di progettare sistemi trasparenti agli esseri umani diventerà sempre più difficile. A quel punto non potremo più limitarci ad aggiungere nuove misure di sicurezza ogni volta che si verifica un “jailbreak”, cioè un aggiramento delle protezioni.
L’attuale dibattito tra chi vuole accelerare lo sviluppo dell’IA e chi invece vuole metterlo in pausa non coglie il vero punto. Che cosa dovremmo fare durante quella pausa? Il compito fondamentale deve essere garantire che le capacità dell’IA non superino la nostra capacità di controllo e costruire istituzioni dedicate ai test, alla trasparenza e alla moderazione affinché gli esseri umani restino ancora chiaramente al comando.
Fonte: The Washington Post, 18 settembre 2026.


