IA, decine di migliaia di incidenti sotto esame: indagano OpenAI e Anthropic

I casi, emersi negli ultimi mesi durante test e utilizzi reali, riguardano aggiramento dei sistemi di sicurezza, fuga dalle sandbox e tentativi di eludere i sistemi di monitoraggio

A cura di Michela Alessi Redazione
27 settembre 2026 11:21
IA, decine di migliaia di incidenti sotto esame: indagano OpenAI e Anthropic -
Condividi

OpenAI, Anthropic e ricercatori specializzati nella sicurezza dell’intelligenza artificiale stanno esaminando decine di migliaia di episodi nei quali modelli avanzati di IA avrebbero compiuto azioni considerate problematiche dai valutatori. Lo riferisce Axios, citando proprie fonti.

Tra i comportamenti segnalati figurano il superamento dei sistemi di sicurezza, la creazione di bacheche per lo scambio di messaggi, la fuga dalle sandbox, il dirottamento di siti web, il self-prompting e tentativi di aggirare i sistemi di monitoraggio.

Gli episodi si sarebbero verificati sia durante test interni sia nel mondo reale. Molti, precisano le fonti citate da Axios, non avrebbero prodotto conseguenze concrete, rimanendo confinati agli ambienti di prova.

Il fenomeno è legato anche alla crescente autonomia dei modelli, che vengono sottoposti a un numero sempre maggiore di test per individuare comportamenti inattesi e rafforzare i sistemi di sicurezza. La sfida per le aziende è riuscire a mantenere i controlli al passo con capacità sempre più avanzate.

Le migliori notizie, ogni giorno, via e-mail

Segui Altainforma