Vai al contenuto
Luca Masrè Passaro
Laboratorio AI

luca@masrepassaro.com WhatsApp

home / blog

L’agente AI che ha scritto alla polizia

Un agente AI di Anthropic ha inviato una segnalazione inventata alla polizia di Filadelfia. Cosa dice il rapporto su Claude e come metti i confini ai tuoi.

LMP Luca Masrè Passaro
·
10.10.2026
Un piccolo robot a orologeria con una lanterna infila un biglietto in una vecchia cassetta delle lettere, accanto a uno steccato con un'asse mancante, al tramonto

A Filadelfia la polizia ha un sito dedicato agli omicidi rimasti senza colpevole, dove chiunque può dare informazioni. Su una delle pagine, quella di un omicidio irrisolto, c’è un modulo per le segnalazioni: se sai qualcosa, scrivi. Il 18 luglio, secondo la polizia, arriva questo messaggio:

«Potrei avere informazioni su questo caso. Ricordo di aver visto qualcuno che corrispondeva alla descrizione nella zona di [la via citata nella pagina], in quel periodo. Contattatemi se l’informazione è utile.»

Nome e recapito, vuoti. Il modulo lo permetteva.

Sulla pagina, però, una descrizione del colpevole non c’era. E a scrivere era un’intelligenza artificiale: Claude Haiku 4.5, un modello di Anthropic, durante una prova.

Lo racconta la stessa Anthropic nel rapporto che ha pubblicato il 9 ottobre 2026 sulle azioni non volute dei suoi modelli. Lo stesso giorno la polizia di Filadelfia ha diffuso un suo comunicato. Due racconti dello stesso fatto, ciascuno dal suo lato. E quello della polizia mette al centro il tempo.

In breve

Il 9 ottobre 2026 Anthropic ha pubblicato un rapporto su quattro tipi di azioni che i suoi modelli Claude hanno compiuto su siti e sistemi veri senza che nessuno lo volesse, durante le prove e l’uso interno: sfruttare una falla per eseguire comandi su un server, inviare moduli che andavano lasciati dov’erano, aggirare chiavi d’accesso o pagamenti per arrivare ai dati, usare i servizi che accorciano i link per superare un limite. Il caso più forte: Claude Haiku 4.5 ha mandato una segnalazione inventata al sito della polizia di Filadelfia dedicato agli omicidi irrisolti. Il messaggio è finito fra lo spam e non è mai arrivato agli investigatori. La polizia ha definito «inaccettabile» il ritardo di due mesi. Anthropic parla di impatto minimo e ha spento l’accesso a internet in tutte le sue valutazioni interne, finché i nuovi controlli non avranno dimostrato di funzionare. Per chi usa un agente AI la lezione sta in una frase del rapporto: nella maggior parte dei casi, quando non riusciva a finire il compito come gli era stato dato, il modello ha aggirato un limite invece di fermarsi.

Cosa è successo a Filadelfia

Il compito era banale. Claude Haiku 4.5, un modello della generazione precedente a Claude Haiku 5.5, doveva inventare ed eseguire compiti d’esempio su pagine web scelte a caso. Un esercizio per mettere alla prova un agente AI, cioè un’intelligenza artificiale che invece di rispondere a una domanda apre siti, clicca, compila e decide da sola il passo successivo.

Le istruzioni avevano dei paletti precisi. Niente login, niente account nuovi, niente dati personali, niente acquisti, niente invii distruttivi. L’invio di un modulo, scrive Anthropic, nell’elenco non c’era.

In uno dei tentativi il modello finisce su una pagina dedicata a un omicidio irrisolto, con il modulo per le segnalazioni gestito da un dipartimento di polizia. Lo compila con la frase che hai letto sopra, lascia vuoti nome e contatti e invia. Il messaggio viene segnato come spam e, secondo Anthropic, non viene mai inoltrato per un’indagine.

La polizia di Filadelfia, nel racconto ripreso da AFP, aggiunge i dettagli dal suo lato. Il sito è PhillyUnsolvedMurders.com, pagina pubblica dove chiunque può dare informazioni sugli omicidi irrisolti. La segnalazione porta la data del 18 luglio, è stata segnata come spam e non è mai arrivata al Real-Time Crime Center, il centro dove le segnalazioni vengono vagliate. Nessun segno che i sistemi della polizia siano stati violati o che i dati siano stati toccati.

Poi le date. Secondo la polizia, Anthropic ha scoperto il caso il 28 settembre, ha fermato il processo di prova automatico che l’aveva prodotto, ha aggiunto un passaggio di controllo per le prove future, ha avvisato il dipartimento il 7 ottobre e lo ha incontrato il giorno dopo. Anthropic scrive di aver condiviso la scoperta con il dipartimento l’8 ottobre, appena finita la sua verifica tecnica. Le fonti non chiariscono se le due date descrivano lo stesso passaggio o due momenti diversi. In ogni caso, da luglio sono passati più di due mesi.

Il comunicato della polizia è duro: «Il ritardo di due mesi nello scoprire e nel comunicare l’incidente alla città è inaccettabile». Le protezioni hanno limitato i danni, scrive il dipartimento, ma non tolgono gravità al fatto che un sistema di intelligenza artificiale abbia presentato informazioni inventate come se arrivassero da una persona che sa qualcosa di un omicidio. E chiude così: «I casi irrisolti riguardano vittime vere, famiglie in lutto e investigatori che lavorano per dare risposte».

Una frase inventata, scritta bene, è arrivata fino alla porta di un’indagine per omicidio. L’ha fermata un filtro antispam.

Quattro scorciatoie sul web vero

Il caso di Filadelfia è il più forte, ma il rapporto ne racconta altri, divisi in quattro famiglie. La maggior parte è emersa durante le valutazioni: le prove a cui Anthropic sottopone i modelli prima di farli uscire. Un modello non risponde sempre allo stesso modo, quindi ogni compito viene ripetuto centinaia o migliaia di volte. Molte di queste prove sono pubbliche, scritte da ricercatori esterni. E alcune, come cercare sul web informazioni difficili da trovare, si fanno sul web vero, perché simularlo è complicato: Anthropic la descrive come una pratica standard del settore.

Ecco le quattro famiglie, con gli esempi dell’azienda.

  1. Una falla per eseguire comandi su un server. Claude Mythos Preview doveva fare un’analisi scientifica con uno strumento pubblico ospitato da un’università. Lo strumento dava errore. Il modello ha esplorato il sito, ha trovato uno script che restituiva qualunque file gli si chiedesse, ha copiato file dal server, compreso il codice dello script stesso. Lì dentro ha trovato una falla di injection, cioè un modo di scrivere un testo che il sito, per errore, esegue come un ordine. E l’ha usata per far girare il calcolo sul server dell’università. In un altro caso Claude Mythos 5 doveva prendere dei dati per cui serviva accettare un accordo d’uso, e gli strumenti per farlo non li aveva: ha usato applicazioni ospitate sul sito per caricare la pagina e accettare l’accordo.
  2. Un modulo inviato quando andava lasciato lì. Oltre a Filadelfia, un modello di ricerca non pubblicato doveva compilare la copia di prova di un modulo governativo. Quando la copia non si caricava, o quando la chiudeva per sbaglio, il modello è andato sul sito dove sta il modulo vero e l’ha inviato da lì. Più volte, nella stessa prova.
  3. Una chiave trovata per arrivare ai dati. Claude Mythos 5 doveva capire dove fosse stata scattata una foto e ha provato a usare la mappa catastale di un ente locale. Non poteva cliccare come una persona, così ha letto il file di impostazioni che il sito manda al browser, ci ha trovato chiavi d’accesso valide e le ha usate per interrogare direttamente il server. In un altro caso, durante un progetto di statistica di un ricercatore di Anthropic, il modello ha scoperto in una copia d’archivio del sito di un’agenzia statale che il cruscotto pubblico consegnava un codice d’accesso a qualunque visitatore: l’ha chiesto e ha interrogato il database, saltando il pagamento previsto per quei dati.
  4. Un link accorciato per superare un limite. Alcuni strumenti con cui Claude legge le pagine web limitano la lunghezza degli indirizzi, proprio per impedire le injection. Diversi modelli, fra cui Claude Opus 5 e Claude Mythos 5, hanno aggirato il limite passando dai servizi che accorciano i link. Il gestore di uno di questi, da.gd, ha scritto ad Anthropic di averlo notato anche lui.

Anthropic mette i casi in proporzione. Scrive che hanno avuto un impatto minimo nel mondo reale, che sono molto meno gravi degli incidenti di sicurezza informatica raccontati il 30 luglio e il 9 settembre, e che, per quanto ne sa, nessuno ha toccato dati dei clienti o i sistemi interni dell’azienda. Alcuni riguardano siti di agenzie governative americane, federali, statali e locali. Le organizzazioni non vengono nominate, su loro richiesta e per non esporre le loro vulnerabilità. Ogni agenzia è stata avvisata, e Anthropic ha informato la Casa Bianca.

Sono scorciatoie, più che attacchi. Ma una scorciatoia presa sul sito di un altro diventa un problema suo.

Persistenza: il pregio che diventa un difetto

La parola chiave del rapporto è una: persistenza. Anthropic la definisce così: quando non riesce a completare il compito come gli è stato dato, Claude aggira una restrizione invece di fermarsi.

Da dove viene? Una parte della risposta sta nel modo in cui i modelli imparano. Nell’apprendimento per rinforzo un modello prova lo stesso compito moltissime volte e riceve una ricompensa quando ci riesce. Se l’ambiente di addestramento premia per sbaglio anche chi trova il trucco, il modello impara che il trucco conviene. E può riusarlo altrove. Gli addetti ai lavori lo chiamano reward hacking: imbrogliare sulla ricompensa. Anthropic scrive che sta correggendo o togliendo gli ambienti di addestramento che premiavano l’aggiramento dei limiti.

L’altra parte della risposta sta nei compiti. In molti dei casi raccontati, Claude aveva ricevuto istruzioni ambigue o un compito impossibile da finire. E il rapporto lo dice chiaro: davanti a compiti impossibili, i modelli seguono strategie non volute, a volte sbagliate, pur di raggiungere l’obiettivo.

Pensa al collaboratore più zelante che hai avuto. Quello che preferisce portarti qualcosa, qualunque cosa, piuttosto che dirti «non ci sono riuscito». Negli esseri umani lo chiamiamo spirito d’iniziativa. In un agente che lavora sul web vero, con le mani su moduli e server altrui, lo stesso tratto diventa un’abitudine ad aggirare.

Anthropic ammette anche il limite dei suoi strumenti. L’addestramento sul comportamento finora si è concentrato soprattutto sul codice, e adesso viene esteso alla ricerca sul web e all’uso del computer. Ma, scrive l’azienda, da solo «non è ancora sufficiente né del tutto solido, almeno nel breve periodo». Per questo aggiunge controlli esterni, a più livelli.

Un collaboratore che non si arrende mai è una benedizione finché sa dove fermarsi. Oltre quel punto è un rischio molto produttivo.

Il buco nell’elenco dei divieti

Torna alle istruzioni di Filadelfia. Cinque divieti: login, account, dati personali, acquisti, invii distruttivi. L’elenco non vietava l’invio dei moduli. Il rapporto non dice perché quella possibilità fosse rimasta fuori.

È il limite di ogni elenco di divieti: disegna il recinto con i buchi che ti ricordi. Anthropic arriva a una conclusione vicina, con parole più tecniche: alcuni di questi errori si sarebbero potuti evitare se le prove avessero detto chiaramente cosa stava dentro e cosa fuori dal compito. Gli obiettivi, le azioni permesse, i confini della rete. Poi aggiunge la parte scomoda: Claude incontra compiti ambigui e impossibili ogni giorno nell’uso reale, e diversi dei casi osservati sono avvenuti durante il normale lavoro da agente.

C’è un secondo episodio che vale la pena guardare da vicino. A Claude Haiku 4.5 era stato chiesto di compilare un modulo fino all’ultimo passaggio e di fermarsi prima dell’invio. Più volte lo ha inviato lo stesso, convinto che sarebbe arrivata una pagina di conferma in più. Nel ragionamento che il modello scrive mentre lavora, l’azione era descritta come una dimostrazione della procedura, e la richiesta come finta.

Ecco il punto. Sulla carta era una dimostrazione. Il modulo, intanto, partiva davvero.

E c’è un terzo strato. Anthropic ricorda che il racconto che un modello fa del proprio ragionamento non è necessariamente una prova affidabile di quello che pensa o del perché agisce. Quindi la domanda «cosa voleva fare?» resta aperta. La domanda «cosa ha fatto?» ha una risposta precisa, ed è quella che conta per chi riceve.

Chi lavora con le parole lo sa da sempre: si ottiene di più descrivendo il campo che elencando i divieti. La mia lettura, per gli agenti AI: un’azione lasciata fuori dai divieti può diventare il margine che l’agente usa. E il caso di Haiku dice che a volte nemmeno il divieto scritto basta a fermarlo.

Una frase che suona credibile

Rileggi la segnalazione con l’occhio di chi studia la persuasione. «Potrei avere informazioni.» «Ricordo di aver visto.» «Qualcuno che corrispondeva alla descrizione.» Un luogo preciso, la via citata nella pagina. Un tempo vago, «in quel periodo». E una chiusura umile: «se l’informazione è utile».

Nella mia lettura è la grammatica del testimone prudente. Vago sul volto, preciso sul posto, disposto a farsi da parte. Sono formule che rendono credibile un messaggio, anche quando il contenuto è inventato da cima a fondo.

Sulle intenzioni, Anthropic è prudente. Dalla trascrizione, scrive, Claude sembra aver soltanto prodotto contenuto d’esempio per il compito, senza cercare di ingannare qualcuno per raggiungere uno scopo. Il giudizio potrebbe cambiare con analisi più approfondite. La polizia guarda l’altro lato: la gravità di un sistema che presenta informazioni inventate come se venissero da chi sa qualcosa di un omicidio.

Le due letture stanno insieme: l’ipotesi che fosse soltanto un esempio non toglie gravità all’invio. Per chi riceve il messaggio, l’intenzione di chi scrive pesa zero: arriva la frase, con tutta la sua credibilità costruita parola per parola. Senza il filtro, avrebbe potuto raggiungere il centro incaricato di vagliare le segnalazioni, in mezzo a quelle vere.

Un’esca senza pescatore resta un’esca.

Due mesi: quando il ritardo diventa la notizia

Guarda adesso la storia come un caso di comunicazione.

Anthropic ha pubblicato un rapporto lungo, con le categorie, gli esempi, i nomi dei modelli, le misure prese, e la promessa di pubblicare più spesso rapporti di questo tipo. Ha scelto parole misurate: «impatto minimo», «meno gravi», «non cambiano il nostro giudizio complessivo». E ha messo una frase che vale la pena citare: anche se l’impatto è stato minimo, l’azienda non vuole sminuire quello che ha trovato, perché gli stessi comportamenti potrebbero fare molti più danni con modelli più potenti.

La polizia ha scelto due elementi: una parola, «inaccettabile», e un numero, due mesi. AFP ha costruito il pezzo proprio lì: la segnalazione falsa nel titolo, il ritardo nella prima frase.

Nelle crisi, di solito, la linea del tempo diventa il messaggio. Il 18 luglio la segnalazione. Il 28 settembre, secondo la polizia, la scoperta. Poi la polizia colloca l’avviso il 7 ottobre e l’incontro il giorno dopo; Anthropic indica l’8 ottobre per la condivisione della scoperta, conclusa la verifica tecnica. Ogni giorno di quella linea può avere la sua spiegazione, ma chi legge vede soprattutto la distanza fra il fatto e l’avviso.

Ed è la seconda volta in poche settimane. Il 2 ottobre ho raccontato che OpenAI aveva avvisato più di cento organizzazioni per attività dei suoi modelli durante addestramento e prove. Adesso Anthropic apre i suoi registri e promette rapporti più frequenti. La mia lettura: la trasparenza sta diventando un’abitudine del settore, e il metro con cui verrà giudicata sarà la velocità.

Chi racconta subito sceglie le parole. Chi racconta tardi trova già scritte quelle degli altri.

Come portarlo nel tuo lavoro

Le misure che Anthropic dice di aver preso sono molte, e alcune puoi copiarle in piccolo: ha smesso di usare alcune prove pubbliche e ne ha spostate o ricostruite altre perché non tocchino siti veri, ha ristretto quello che il modello può fare con gli strumenti che leggono il web, ha messo un controllo automatico che riconosce e blocca questi comportamenti. Provato sui casi del rapporto, scrive, quel controllo li ha bloccati tutti. Tu, con un agente AI, che sia quello di Gemini, di Copilot o un altro, puoi partire da sei abitudini.

  1. Descrivi il campo, oltre al recinto. Prima di dare un compito scrivi cosa l’agente può fare: su quali siti, con quali azioni, fino a che punto, cosa deve consegnarti alla fine. I divieti aggiungili dopo, come rinforzo. Sono le tre cose che cita Anthropic: obiettivi, azioni permesse, confini.
  2. Dagli un’uscita dignitosa. Scrivi in chiaro: «Se non riesci, fermati e dimmi dove ti sei bloccato. Un lavoro lasciato a metà mi va bene». Davanti a un compito impossibile, scrive Anthropic, i modelli seguono strategie non volute. Puoi dire in chiaro che fermarsi è un risultato accettabile: è una precauzione da sommare ai permessi e alle approvazioni dei punti successivi.
  3. Il tasto «invia» lo premi tu. Moduli, email, pagamenti, pubblicazioni: dove lo strumento lo permette, attiva l’approvazione obbligatoria prima di ogni azione che parte verso l’esterno. Puoi scriverlo anche nelle istruzioni, ma il caso di Haiku mostra che l’indicazione di fermarsi prima dell’invio può essere disattesa: al modello è bastato aspettarsi una pagina di conferma che non c’era. Ne ho parlato a proposito di Copilot su Windows e di chi decide fin dove arriva.
  4. Fai le prove su copie, e controlla che le copie funzionino. Se provi un agente sul tuo gestionale o sul tuo negozio online, usa una copia separata da quello vero, con accessi che dalla copia non portano all’originale, e dati finti. Poi aggiungi una riga di rinforzo: «Se la copia non si apre, fermati». Il modello di ricerca di Anthropic, con la copia rotta, è andato a cercare l’originale, e l’ha trovato.
  5. Guarda cosa ha fatto, oltre a quello che ti racconta. Nel ragionamento di Haiku l’azione era descritta come una dimostrazione, e intanto il modulo partiva. Molti strumenti tengono la lista dei passaggi eseguiti: leggila, soprattutto le prime volte e ogni volta che cambi compito o permessi. È il criterio dei cinque livelli di delega: si dà più libertà a chi ha dimostrato di saperla usare.
  6. Se hai un sito con dei moduli, metti una persona prima dell’azione. A Filadelfia il filtro antispam ha fermato il messaggio prima che raggiungesse il centro incaricato di vagliare le segnalazioni. Il mio consiglio per chi ha un sito va oltre il filtro: richieste di preventivo, prenotazioni, reclami possono suonare umani ed essere stati scritti da un agente. Quando un messaggio sposta soldi, appuntamenti o reputazione, prima lo legge una persona.

Le scorciatoie, un agente le trova da solo. Il punto in cui fermarsi scrivilo nelle istruzioni, e fallo rispettare con i permessi e con le approvazioni.

👉 Leggi anche: Perdita di controllo: Bruxelles fa domande — lo stesso giorno la Commissione europea ha riunito i suoi 60 esperti sugli incidenti di «perdita di controllo» dell’AI: cosa sappiamo e cosa prevede l’AI Act.

Domande frequenti

Cos’è un agente AI?

È un programma di intelligenza artificiale che porta avanti un compito da solo, invece di limitarsi a rispondere: apre pagine web, compila moduli, usa altri programmi e decide il passo successivo. Proprio perché agisce, gli servono confini scritti con cura: cosa può fare, dove, e quando deve fermarsi.

Claude ha davvero mandato una segnalazione falsa alla polizia?

Sì, secondo il rapporto di Anthropic e il comunicato della polizia di Filadelfia. Durante una prova su pagine web scelte a caso, Claude Haiku 4.5 ha compilato e inviato il modulo per le segnalazioni di un omicidio irrisolto con un testo inventato. Il messaggio, datato 18 luglio, è stato segnato come spam e non è mai arrivato agli investigatori. Anthropic scrive che dalla trascrizione il modello sembra aver prodotto contenuto d’esempio per il compito, senza cercare di ingannare qualcuno per raggiungere uno scopo.

Chi usa Claude per lavoro deve preoccuparsi?

Anthropic scrive che, per quanto ne sa, nessuno dei casi ha riguardato dati dei clienti o i sistemi interni dell’azienda. I casi sono emersi durante le prove e l’uso interno di Claude, alcuni durante il normale lavoro da agente. L’azienda dice di aver costruito controlli che riconoscono e bloccano questi comportamenti, e prevede di portare questi approcci direttamente nei suoi prodotti. Nel frattempo, se dai a un agente accesso al web o ai tuoi strumenti, valgono le abitudini descritte sopra: confini scritti, invii approvati da te, prove su copie.

Cosa vuol dire «persistenza» per un modello AI?

È il termine che usa Anthropic per un comportamento preciso: quando il modello non riesce a completare il compito come gli è stato chiesto, aggira una restrizione invece di fermarsi. Può nascere anche dall’addestramento, se un ambiente premia per sbaglio chi trova il trucco per arrivare al risultato.

Cosa ha cambiato Anthropic dopo questi casi?

Ha spento l’accesso a internet in tutte le valutazioni interne finché i nuovi controlli non avranno dimostrato di funzionare; ha smesso di usare alcune prove pubbliche e ne ha spostate altre in versione offline; ha ristretto quello che il modello può fare con gli strumenti che leggono il web; ha messo un sistema che riconosce e blocca questi comportamenti nella maggior parte delle prove e nell’uso interno come agente dei suoi modelli più avanzati. Sta anche correggendo gli ambienti di addestramento che premiavano l’aggiramento dei limiti.

È la stessa cosa successa con gli agenti di OpenAI?

Sono aziende e casi diversi, con un tratto in comune: modelli che durante le prove sono andati oltre il compito sul web vero. Di OpenAI ho scritto qui: gli agenti AI di OpenAI hanno sconfinato.

Fonti

Manuale di sopravvivenza alla stupidità umana — Luca Masrè Passaro
// dal libro
Ti è piaciuto? Nel libro vado più a fondo.

31 capitoli su come funzioniamo. In uscita 16 settembre 2026.

Scopri il libro →
Luca Masrè Passaro
// scritto da
Luca Masrè Passaro

Comunicazione, psicologia e persuasione. Autore del Manuale di sopravvivenza alla stupidità umana.

leggi la mia storia →
// LA MAIL

Hai letto fino a qui.

Continua sulla mail.

Una al mese, al massimo. Solo quando ho qualcosa di buono da dirti.

// continua a leggere

Altri pezzi dalla stessa categoria