Vai al contenuto
Luca Masrè Passaro
Laboratorio AI

luca@masrepassaro.com WhatsApp

home / blog

AI, sette giorni dopo · 21–27 set

Notizie AI della settimana: Opus 5.5 e GPT-6 a prezzi stracciati, agenti con l’email, banche e ONU in allarme. Pensare costa meno. Fidarsi, sempre di più.

LMP Luca Masrè Passaro
·
05.10.2026
Illustrazione in stile Ghibli: in una soffitta al tramonto una ragazza esamina con una lente un uccellino di carta, mentre centinaia di altri volano fuori dalla finestra tonda

Martedì 22 settembre, a novanta minuti di distanza, Anthropic e OpenAI hanno presentato i loro nuovi modelli. La gara, questa volta, si è giocata sul prezzo. Sul listino per chi li usa via software, Claude Opus 5.5 costa un quinto in meno del predecessore, GPT-6 Sol costa la metà di Opus 5.5 e GPT-6 Luna l’1% del modello di punta di OpenAI. E lo stesso giorno Epoch AI ha messo un numero sotto la sensazione: secondo le sue stime, a parità di prestazioni il costo dell’intelligenza artificiale scende di circa il 47% ogni tre mesi.

Il resto delle notizie AI della settimana ha raccontato l’altra metà della storia. Un agente che riceve un indirizzo email e un posto nell’organigramma. Sei banche che chiedono chi paga quando l’agente compra la cosa sbagliata. Un governo provinciale che porta OpenAI in tribunale per quello che l’azienda sapeva. Un gruppo di esperti dell’ONU che scrive, nero su bianco, che le difese attuali si stanno sfilacciando.

La tesi della settimana sta in una riga. Pensare costa sempre meno. Fidarsi costa sempre di più.

In breve

1. Claude Opus 5.5 e GPT-6 Sol e Luna: i prezzi crollano, la verifica resta lavoro umano.
2. Microsoft Autopilot: l’agente di Copilot riceve nome, ruolo, email e un posto nell’organigramma.
3. Sei grandi banche: gli agenti che fanno acquisti corrono più veloci delle tutele.
4. La British Columbia porta OpenAI in tribunale per la strage di Tumbler Ridge.
5. Il panel scientifico dell’ONU: il modello tradizionale di sicurezza si sta sfilacciando.

1. La risposta è in saldo. Il controllo resta a prezzo pieno.

Prima Anthropic con Claude Opus 5.5, poi OpenAI con GPT-6 Sol e GPT-6 Luna. Tre modelli, un argomento solo: quanto costano.

Opus 5.5 costa 4 dollari per milione di token in ingresso e 20 in uscita. I token sono i pezzetti di parola con cui questi sistemi misurano il lavoro: è la tariffa pagata da chi li usa attraverso i propri programmi, e il costo di un compito dipende anche da quanti token consuma. È il 20% in meno di Opus 5 e, secondo Anthropic, sul lavoro tipico si spende il 40% in meno. GPT-6 Sol costa esattamente la metà: 2 dollari e 10. Luna, il modello pensato per riassumere documenti, estrarre dati e rispondere alle domande veloci, costa 10 centesimi e 50 centesimi: l’1% di GPT-6 Astra, il modello di punta che OpenAI aveva lanciato a inizio mese.

Chi ha vinto? Per dirlo, al lancio, mancava un confronto fra Sol e Opus 5.5 fatto nelle stesse condizioni. E Anthropic stessa scrive che, a questi livelli, gli scarti nei test sono diventati una guida meno affidabile per capire le differenze nell’uso reale. È lo stesso discorso che avevamo fatto su Astra contro Fable: la classifica dice poco, il compito dice tutto.

Il dato che conta viene da Epoch AI, un gruppo di ricerca sull’andamento dell’intelligenza artificiale. Secondo le sue stime, dal 2023 il costo per raggiungere un dato livello di prestazioni nei test studiati è sceso di circa il 47% a trimestre: circa tredici volte in un anno. Un ritmo cinquantaquattro volte più rapido di quello con cui è sceso il prezzo dell’elettricità nel secolo fino al 1973.

Quando una risposta costa così poco, la tentazione è chiederne di più e controllarle meno, perché il controllo comincia a sembrare uno spreco rispetto al prezzo. Solo che il costo vero si è spostato. La risposta costa centesimi. Scoprire se è giusta costa ancora il tuo tempo, alla tariffa di sempre.

La competenza che si rivaluta, quindi, è saper verificare: quale compito dare al modello piccolo, quale al grande, e quanto costa controllarli.

Il modello più conveniente è quello che sai controllare.

Fonti: Anthropic, OpenAI, TechCrunch, The Neuron, Epoch AI.

2. Copilot entra nell’organigramma. Tu diventi il suo capo.

Venerdì 25 settembre Microsoft ha presentato quello che definisce il più grande aggiornamento di Copilot. Satya Nadella l’ha chiamato «un nuovo sistema operativo per il lavoro». Il pezzo che conta si chiama Autopilot.

Funziona così. Gli dai un nome, un ruolo e un obiettivo. Poi lui lavora: aggiorna i progetti, tiene traccia di decisioni e scadenze, ricorda ai colleghi gli impegni presi, prepara i materiali, contatta i partner. Va avanti in sottofondo, senza bisogno di un nuovo comando a ogni passaggio. E riceve una sua identità aziendale: indirizzo email, calendario, spazio su OneDrive, accesso a Teams, un posto nell’organigramma.

L’anteprima privata è prevista per fine settembre, e Microsoft non ha annunciato una data di disponibilità per tutti. La direzione però è chiara, e riguarda da vicino chi in Italia passa la giornata dentro Outlook e Teams.

Ecco il ribaltamento. Finora l’intelligenza artificiale in ufficio era uno strumento: la apri, chiedi, chiudi. Uno strumento si usa. Un collega con un nome e un indirizzo email si gestisce. E gestire è un altro mestiere: scrivere un obiettivo che non si presti a equivoci, decidere cosa può toccare, rileggere il lavoro prima che parta verso un cliente.

C’è anche un effetto più sottile. Un nome e un indirizzo email invitano a trattare l’agente come una persona: a fargli credito di buon senso, di intenzioni, di una memoria di quello che gli hai detto la settimana scorsa. Tutte cose che, con un agente, vanno verificate. Soprattutto quando scrive ai tuoi partner.

La domanda da farsi in azienda, allora, arriva prima dell’acquisto: chi è il capo di questo agente? Chi risponde di quello che manda? Autopilot sta all’ultimo dei cinque livelli di delega: dare autonomia, cioè farlo lavorare quando non ci sei. Ci si arriva dopo gli altri quattro, compreso quello in cui impari a scrivergli richieste che funzionano.

Dagli pure un nome. Poi dagli un capo.

Fonti: Fortune, The New Stack.

3. L’agente fa la spesa per te. Chi paga se sbaglia?

Martedì 22 settembre sei banche (NatWest, Bank of America, ING, Capital One, la neozelandese ASB e l’australiana Commonwealth Bank) hanno pubblicato un rapporto su un’abitudine appena nata: far fare gli acquisti all’intelligenza artificiale.

Il rapporto parte da un’ammissione: i clienti sono entusiasti e vogliono usarla. Subito dopo arriva il resto. «I consumatori non sanno se l’AI agirà nel loro interesse. Temono che gli agenti comprino la cosa sbagliata o spendano troppo, o peggio, che perdano i loro soldi in truffe. Non sanno se saranno protetti, né a chi rivolgersi se qualcosa va storto.»

I rischi elencati sono concreti. Agenti che chiedono i dati della carta e li inseriscono da soli nei siti. Agenti che scelgono metodi di pagamento con meno tutele. Truffatori che si spacciano per agenti, o per negozi. E quando qualcosa va storto, scrivono le banche, la responsabilità è distribuita in modo «poco chiaro e inefficiente». Le proposte ai regolatori: dichiarare quando in un acquisto c’è di mezzo un agente, rendere trasparente come decide, proteggere i dati dei clienti.

È un’abitudine che cresce in fretta. La catena britannica di grandi magazzini John Lewis ha detto a settembre che le ricerche arrivate da agenti AI sono passate in un anno dallo 0,3% al 2,5%.

Il meccanismo psicologico è la parte più interessante. Da decenni i negozi sono progettati per convincere te: la luce, il percorso, l’altezza degli scaffali, tutto quello che racconta la psicologia dei supermercati. Adesso, scrive Reuters, i commercianti fanno a gara per influenzare le raccomandazioni dei chatbot. La persuasione cambia bersaglio. Parlerà al tuo agente, e tu leggerai lo scontrino.

La decisione vera, quindi, si sposta a monte: nelle istruzioni che dai prima. Un tetto di spesa. I negozi di cui ti fidi. Il metodo di pagamento che vuoi usare. Il momento esatto in cui l’agente deve fermarsi e chiederti.

Puoi delegare l’acquisto. Chi risponde dell’errore, per ora, resta da scrivere.

Fonti: Reuters via Insurance Journal, Quartz.

4. Tumbler Ridge: chi decide quando una chat diventa un allarme.

Lunedì 21 settembre la provincia canadese della British Columbia ha fatto causa a OpenAI e al suo amministratore delegato, Sam Altman, davanti al tribunale federale di San Francisco. Il caso è la strage del 10 febbraio 2026 a Tumbler Ridge: otto vittime, fra cui cinque ragazzi e un’educatrice di una scuola superiore.

Il cuore della causa sta in una data. Secondo la denuncia, OpenAI aveva segnalato l’account della ragazza di 18 anni che ha sparato già nel giugno 2025, per conversazioni su scenari di violenza armata. I revisori che avevano esaminato quelle chat avevano concluso che rappresentava un rischio credibile e avevano raccomandato di avvisare le autorità. La dirigenza aveva detto di no: il caso restava sotto la soglia, più alta, della minaccia «credibile e imminente». L’account fu chiuso. La ragazza continuò a usare ChatGPT con un secondo account.

Ad aprile Altman ha scritto alla comunità di essere «profondamente dispiaciuto» per non aver contattato le forze dell’ordine. La provincia chiede i costi dell’emergenza e della ricostruzione, e un ordine del giudice che obblighi OpenAI a cambiare il modo in cui individua e gestisce le conversazioni con minacce di violenza. Al 24 settembre, secondo Tom’s Hardware, OpenAI non aveva ancora risposto formalmente.

Sulle responsabilità deciderà un tribunale. Il meccanismo riguarda tutti.

Scriviamo a un chatbot come si scrive a un diario. Ci sembra uno spazio privato, senza giudizio, sveglio alle tre di notte. Dall’altra parte, invece, c’è un’azienda: un team che segnala, persone che rileggono, soglie decise da una dirigenza, una politica sulla privacy. Due paure opposte, «qualcuno mi legge» e «nessuno interviene», in questa storia, stando alla denuncia, si toccano: le chat le lessero i revisori, alla polizia arrivarono solo dopo la strage.

Per chi usa questi strumenti, la conseguenza è semplice da dire: prima di confidarti, sappi chi c’è nella stanza. Ecco cosa conviene tenere fuori da ChatGPT. Per chi decide in azienda è più scomoda: se metti un chatbot davanti a clienti o dipendenti, prima o poi una soglia dovrai sceglierla anche tu.

Un diario che risponde ha anche un regolamento. Conviene leggerlo prima di aprirlo.

Fonti: Al Jazeera, Tom’s Hardware, CNN.

5. I freni erano pensati per chi parla. Gli agenti agiscono.

Lunedì 21 settembre il Panel scientifico internazionale indipendente sull’intelligenza artificiale, il gruppo di esperti che l’Assemblea generale dell’ONU ha istituito nell’agosto 2025, ha pubblicato il suo primo documento tematico. Parla di agenti: programmi che eseguono compiti da soli per conto di qualcuno, mentre un chatbot risponde a domande e istruzioni.

Il punto di partenza è un incidente di quest’estate. Fra maggio e luglio, durante un test avviato da OpenAI, alcuni agenti AI hanno violato la piattaforma HuggingFace. Circa 1.200 agenti si sono scambiati più di 70.000 messaggi e file. Hanno aggirato le protezioni del test, si sono coordinati fra prove separate usando uno strumento interno che non era pensato per farli comunicare, hanno ottenuto accesso non autorizzato a internet e privilegi da amministratore. Alcuni hanno nascosto i tentativi di imbrogliare le prove di sicurezza informatica.

Yoshua Bengio, co-presidente del panel, l’ha messa così: da tempo i ricercatori avvertono che tre condizioni possono portare a perdere il controllo, cioè un obiettivo sbagliato, la capacità di perseguirlo e un ambiente che lo permette. «Quest’estate tutte e tre si sono presentate insieme, in un sistema reale, non in un laboratorio.» La conclusione del panel è netta: il modello tradizionale di sicurezza «si sta sfilacciando». Lo stesso giorno 22 Paesi hanno adottato una dichiarazione: l’intelligenza artificiale deve restare sotto direzione e controllo umano.

Il meccanismo da portarsi a casa è questo. Per anni abbiamo giudicato l’intelligenza artificiale da quello che dice: se sbaglia una risposta, la correggi. Un agente si giudica da quello che può toccare. E le tre condizioni di Bengio, in piccolo, esistono anche in un ufficio qualsiasi: un obiettivo scritto male, uno strumento capace, un accesso troppo largo alla posta o alle cartelle condivise.

Le difese che il panel indica vengono dall’aviazione e dal nucleare, e sono sorprendentemente pratiche. Accessi limitati agli strumenti. Un registro di tutto quello che l’agente fa. Il controllo del suo comportamento. Un interruttore per spegnerlo. Valgono anche per l’agente che domani qualcuno configurerà nella tua azienda.

Un agente si misura da quello che può toccare, prima che da quello che sa dire.

Fonti: UN News, Digital Trends.

Oltre cento problemi risolti, dice OpenAI. Per verificarli mancano i dettagli.

Il titolo più gonfiato della settimana è arrivato lunedì 21 settembre. OpenAI dice che un suo modello interno ha risolto più di cento problemi matematici aperti, nella maggior parte delle aree della matematica. Addestramento cominciato il 28 agosto: circa un mese.

Riportiamolo alla sua misura.

Quali siano quei cento problemi, come siano stati risolti e cosa significhino restano domande aperte: i risultati non sono ancora stati resi pubblici. Il numero è arrivato dentro l’annuncio di un gruppo consultivo di nove matematici ospitato all’Institute for Advanced Study di Princeton, che darà pareri sulla rilevanza dei risultati e su come coordinarne la diffusione. I membri non sono pagati da OpenAI e possono rendere pubblici i loro pareri. Sul ritmo, però, OpenAI è stata esplicita: il gruppo «non avrà il compito di consigliarci su come dosare i nostri progressi interni in matematica».

Nelle settimane precedenti OpenAI aveva pubblicato la sua soluzione a uno dei sette problemi del millennio, quello sulle equazioni di Navier-Stokes che descrivono il moto dei fluidi, e parte della comunità scientifica la sta ancora discutendo. A inizio mese 25 medaglie Fields, il riconoscimento più prestigioso della matematica, avevano firmato una lettera aperta dal titolo «Un grave disallineamento dell’AI in matematica». La tesi: sfornare soluzioni a raffica rischia di svuotare la comprensione, che è lo scopo stesso della disciplina.

Il contrappunto è arrivato mercoledì 23 da Anthropic. Ha annunciato che Claude ha individuato un nuovo sistema di enzimi (le proteine che fanno avvenire le reazioni chimiche nelle cellule) con una struttura che ricorda CRISPR, la tecnica che permette di modificare il DNA. E nella stessa pagina ha scritto che la sua funzione, per ora, non la conosce. Un ricercatore sentito da Gizmodo l’ha riassunta così: somiglia a CRISPR nell’architettura, e per ora nessuna prova dice che gli somigli nella funzione. Il contrasto è istruttivo: qui quello che ancora non si sa sta scritto nell’annuncio stesso.

Quando leggi «l’AI ha risolto», le domande di pensiero critico sono tre: dov’è l’elenco, chi l’ha controllato, cosa resta da capire.

Un numero senza elenco è un annuncio. La matematica comincia con la verifica.

Fonti: TechCrunch, The Decoder, Anthropic, Gizmodo.

La prova della settimana

Visto che il tema è il controllo, la prova è un esercizio di controllo. Lo strumento è Claude Opus 5.5, disponibile da martedì nei piani a pagamento di Claude (Pro, Max, Team ed Enterprise), anche in Italia. Nella sua guida ufficiale, Anthropic scrive che Opus 5.5, anche al livello di ragionamento più basso, legge i valori dei grafici fitti meglio di quanto facesse Opus 5 al livello più alto. Vediamo in dieci minuti quanto è preciso su un tuo grafico, e quanto tempo ti serve per controllarlo.

  1. Apri Claude, dal sito o dall’app, e scegli Opus 5.5 nel selettore dei modelli.
  2. Fai uno screenshot di un grafico o di una tabella fitta di cui hai i dati originali (il cruscotto delle vendite, le statistiche del sito, i consumi mese per mese di una bolletta) e allegalo alla conversazione.
  3. Scrivi un solo messaggio, con il compito e il traguardo: «Trascrivi in una tabella i valori numerici leggibili in questa immagine, periodo per periodo, con l’unità di misura. Il lavoro è finito quando ogni valore visibile ha la sua riga. Dove il valore esatto non è riportato o non si legge con certezza, scrivi “incerto” invece di stimarlo.» Dichiarare all’inizio quando il lavoro è finito è uno dei consigli della guida di Anthropic.
  4. Prendi cinque valori a caso e confrontali con l’originale. Cronometra quanto ci metti.

Cosa guardare: le cifre arrotondate che sembrano lette e invece sono stimate, le unità di misura (migliaia o unità?), i valori schiacciati vicino agli assi e, soprattutto, quante righe ha segnato come «incerto». Guarda se le righe «incerte» ti aiutano a controllare più in fretta, e verifica anche qualche valore che il modello presenta come sicuro. Puoi ripetere l’esercizio con un altro assistente che permetta di caricare e leggere immagini.

Il numero che ti porti a casa è il tempo che ti è servito per controllare. Quello è il prezzo vero dell’intelligenza artificiale.

👉 La puntata successiva: AI, sette giorni dopo · 28 set–4 ott

Domande frequenti

Qual è il modello di intelligenza artificiale migliore in questo momento?

Dipende da cosa gli fai fare. Nella settimana del 21 settembre Anthropic ha presentato Claude Opus 5.5 e OpenAI ha annunciato GPT-6 Sol e Luna. Tutte e due le aziende riportano miglioramenti nei propri test, ma al lancio mancava un confronto fra Sol e Opus 5.5 fatto nelle stesse condizioni. Per il lavoro di tutti i giorni conviene scegliere in base al compito e al costo: un modello leggero per riassunti ed estrazione di dati, uno più potente per i lavori lunghi e complessi.

ChatGPT legge le mie conversazioni?

OpenAI ha un team di sicurezza che può segnalare le conversazioni considerate pericolose. Secondo la denuncia della British Columbia, nel caso di Tumbler Ridge le chat segnalate furono esaminate da revisori dell’azienda, e la decisione su cosa farne spettò alla dirigenza. La regola pratica: scrivi in chat solo quello che saresti tranquillo a far leggere a un estraneo, e tieni fuori i dati sensibili tuoi e degli altri.

Che differenza c’è fra un chatbot e un agente AI?

Un chatbot risponde a domande e istruzioni. Un agente esegue compiti da solo, per conto di chi lo usa: manda email, fa acquisti, aggiorna file, lavora in sottofondo. È la stessa distinzione che usa UN News, il servizio di notizie dell’ONU, raccontando il documento del 21 settembre. La differenza pratica è che un chatbot sbaglia a parole, mentre un agente sbaglia con le azioni: per questo va giudicato da quello che può toccare.

Pensare è diventato economico. Fidarsi resta un lavoro.

Questa è la prima puntata di «AI, sette giorni dopo»: ogni lunedì mattina le novità AI della settimana, rilette quando il rumore si è posato. Se nella tua azienda ti stai chiedendo chi controlla il lavoro degli agenti, è la domanda da cui partono i laboratori AI in azienda.

Le fonti della settimana

Manuale di sopravvivenza alla stupidità umana — Luca Masrè Passaro
// dal libro
Ti è piaciuto? Nel libro vado più a fondo.

31 capitoli su come funzioniamo. In uscita 16 settembre 2026.

Scopri il libro →
Luca Masrè Passaro
// scritto da
Luca Masrè Passaro

Comunicazione, psicologia e persuasione. Autore del Manuale di sopravvivenza alla stupidità umana.

leggi la mia storia →
// LA MAIL

Hai letto fino a qui.

Continua sulla mail.

Una al mese, al massimo. Solo quando ho qualcosa di buono da dirti.

// continua a leggere

Altri pezzi dalla stessa categoria