Vai al contenuto
Luca Masrè Passaro
Laboratorio AI

luca@masrepassaro.com WhatsApp

home / blog

Suno Speech: la musica sotto le tue parole

Suno AI apre a tutti Speech: scrivi un testo, descrivi voce e musica e ricevi un’unica traccia. Cosa fa, i limiti, i diritti e perché la musica ti convince.

LMP Luca Masrè Passaro
·
06.10.2026
Illustrazione in stile anime: un microfono d'epoca in una soffitta al tramonto, da cui salgono un'onda di voce e un nastro di strumenti musicali intrecciati, mentre un gatto guarda

Prendi una frase qualunque. «Domani si riparte.» Immaginala detta con un pianoforte lento sotto. Adesso immaginala con i tamburi di uno stadio.

Le parole sono le stesse. Tu no. Con il pianoforte senti stanchezza, forse un addio. Con i tamburi senti una partita da vincere.

Giovedì sera Suno, l’azienda che ha reso famose le canzoni fatte con l’intelligenza artificiale, ha aperto a tutti Speech: scrivi un testo, descrivi la voce e la musica che vuoi, e ricevi una traccia sola, voce e colonna sonora insieme. Sembra un giocattolo per le favole della buonanotte. È lo strumento più vecchio della persuasione, messo in mano a chiunque con una frase.

In breve

Il 1° ottobre 2026 Suno ha aperto a tutti gli utenti la beta di Speech, cioè una versione ancora in prova, dopo un mese di test con un gruppo ristretto. Scrivi un testo (un’idea, una poesia, un discorso), descrivi la voce e lo stile musicale, e Speech genera parlato e musica originale in un’unica traccia. Funziona dall’app e dal sito. Suno stessa avverte che è una beta vera: gli accenti possono cambiare e le pause drammatiche possono diventare molto drammatiche. Secondo la testata tecnica AlphaSignal non sono stati pubblicati prezzi specifici per Speech, che usa i crediti dei piani di Suno (le unità che si consumano a ogni generazione), né annunciati strumenti ufficiali per integrarlo nei propri programmi. Per chi lavora con la comunicazione il punto è un altro: la musica sotto le parole cambia il modo in cui le senti, e adesso la sceglie chiunque con una frase.

Cosa ha lanciato Suno

L’annuncio è un articolo sul blog di Suno, pubblicato giovedì 1° ottobre alle 22:35 ora italiana, e una voce nelle note di rilascio dello stesso giorno. Suno descrive Speech come «il primo modello audio che genera voce e musica insieme, come un’unica traccia coerente». Il primato lo dichiara l’azienda: è il suo modo di presentarlo.

Suno descrive tre elementi, che la testata tecnica AlphaSignal dettaglia così:

  • Il testo. Scrivi un’idea, una poesia o qualcosa di tuo.
  • La voce. La descrivi a parole: accento, epoca, tono, registro.
  • La musica. Descrivi lo stile; secondo AlphaSignal anche l’umore e la direzione drammatica.

Esce una traccia continua: qualcuno che legge il tuo testo, con una musica originale scritta apposta sotto. Gli esempi li dà Suno stessa: favole della buonanotte su un pianoforte morbido, discorsi motivanti sui tamburi da stadio, perfino la lista della spesa sussurrata come un video rilassante. Durante lo sviluppo, racconta l’azienda, il team ha usato Speech per trasformare i messaggi degli amici in letture drammatiche esagerate e ha dato colonne sonore epiche a note vocali qualunque. E ha fatto meditazioni, poesie, discorsi d’incoraggiamento, favole per i figli.

Speech sta dentro Suno, dall’app per telefono e dal sito. Dopo un mese di prove con un piccolo gruppo di utenti, la beta adesso è aperta a tutti. E Suno, cosa rara in un annuncio, mette subito in vista i difetti: «la beta è davvero una beta». Un accento britannico ogni tanto se ne va in Australia e torna. Le pause drammatiche possono essere molto drammatiche.

AlphaSignal aggiunge quello che manca. Non sono stati pubblicati prezzi specifici: Speech usa i crediti, cioè le unità che si consumano a ogni generazione, dei piani che Suno ha già. E non sono stati annunciati strumenti ufficiali per integrarlo nei propri programmi. La beta, poi, non promette controlli sulla durata esatta, sui tempi parola per parola, sul punto preciso in cui entra la musica. Non dichiara nemmeno di poter copiare una voce da una registrazione: quella è un’altra funzione di Suno, ci arriviamo.

Il contesto aiuta a capire la mossa. Suno è nota per le canzoni generate con l’AI; il 9 settembre ha presentato v6, una nuova generazione di modelli musicali sviluppata con Warner Music Group, BMG e Believe. Secondo Superpower Daily, che riprende il resoconto di Bloomberg, il suo amministratore delegato Mikey Shulman ha detto giovedì a una conferenza di Bloomberg a Los Angeles che Suno vuole diventare un punto di riferimento per l’intrattenimento creativo oltre la musica. Con la voce Suno aveva già lavorato: nel 2023 aveva pubblicato Bark, un modello aperto per voce e audio. Speech porta il parlato con la musica dentro il suo servizio principale.

Un’azienda di canzoni che si mette a far parlare. La musica, però, se la porta dietro.

Perché la novità sta nella parola «insieme»

Le voci sintetiche esistono da anni. La musica generata pure. La novità sta nel fatto che qui nascono nello stesso momento.

Pensa a come si fa oggi un audio con voce e musica, per esempio la presentazione di un corso o un breve video per i social. Prima generi o registri la voce. Poi scegli una musica. Poi le metti insieme in un programma di montaggio e cominci il lavoro noioso: abbassi la musica quando parla la voce, sposti una pausa, allunghi un finale perché coincida con l’ultima frase. AlphaSignal lo descrive proprio così, e spiega cosa cambia con Speech: le due cose vengono generate insieme, quindi una pausa nella lettura può cadere su un cambio della musica, e un momento in cui la voce cresce può arrivare insieme a un crescendo o a un colpo di batteria.

In altre parole, la musica ascolta la voce. Quando funziona, su un pezzo breve può risparmiarti buona parte del montaggio. Quando sbaglia, rigeneri e speri: AlphaSignal nota che ritmo e interpretazione cambiano da una generazione all’altra, e che la beta non promette di ottenere due volte lo stesso risultato.

Fin qui la musica si aggiungeva dopo. Qui la chiedi con una frase, e nasce insieme alla voce.

La musica sceglie al posto tuo

Nel 1997 tre psicologi dell’Università di Leicester, Adrian North, David Hargreaves e Jennifer McKendrick, pubblicarono su Nature un esperimento di una pagina sola e di lunga vita. Nel reparto vini di un supermercato britannico misero vini francesi e tedeschi di prezzo e dolcezza simili, con una bandierina accanto a ciascuno. Per due settimane, a giorni alterni, dagli altoparlanti uscì musica francese o musica tedesca.

Secondo la sintesi dello studio pubblicata da The Decision Lab, nei giorni della musica francese si vendettero in media 40 bottiglie di vino francese e 12 di tedesco. Nei giorni della musica tedesca, 22 di tedesco e 8 di francese. Fin qui, un dato di marketing. La parte che interessa a te viene dopo. Dopo l’acquisto i ricercatori proposero ai clienti un questionario: lo compilarono in 44. Uno solo indicò la musica come motivo principale della scelta. Alla domanda diretta, «la musica ha influito?», risposero di sì in sei.

Gli altri trentotto dissero di no. Eppure, nel complesso, le vendite seguivano la musica.

È un’osservazione fatta in un solo supermercato, quasi trent’anni fa, e vale per quel contesto. Ma racconta bene una cosa scomoda. Quello che ci spinge e quello che crediamo ci abbia spinto possono essere due cose diverse.

Gli autori parlano di «fit», cioè di coerenza fra la musica e il prodotto: quando quello che senti si accorda con quello che vedi, la scelta tende ad andare da quella parte. Un altro studio citato dalla stessa sintesi, di Areni e Kim nel 1993, aveva trovato un effetto vicino in un’enoteca americana: con la musica classica il numero di bottiglie vendute non cambiava in modo significativo, ma si vendevano più spesso vini costosi. La mia lettura: la musica suggeriva che tipo di acquisto fosse adatto a quel momento. Se ti incuriosisce tutto lo strato sensoriale dei negozi, l’ho raccontato nella psicologia dei supermercati.

Adesso torna a Speech. La stessa frase, con un pianoforte o con i tamburi, può arrivare a chi ascolta con due colori diversi. La musica contribuisce alla lettura emotiva di un messaggio, ed è questo l’aspetto di Speech che mi interessa. Per anni scegliere la musica giusta sotto un messaggio è stato un mestiere: un regista, un fonico, un’agenzia. Da giovedì basta una riga: «musica calda, archi, sensazione di fiducia». La cornice emotiva di un messaggio è diventata una casella da riempire.

Speech è uno strumento potente, e la differenza fra convincere e manipolare resta dove è sempre stata: in chi lo usa e in cosa ha da dire.

Le parole dicono cosa pensare. La musica suggerisce cosa provare. E fra i 44 intervistati di quel supermercato, solo sei dissero che la musica aveva influito.

Chi lavora, cosa ci fa

Per un professionista o una piccola impresa gli usi vengono in mente da soli, e sono quelli che Suno e AlphaSignal suggeriscono, portati in ufficio. Un formatore può fare la sigla parlata di un corso, o l’introduzione di una lezione da ascoltare in macchina. Uno studio di yoga o un centro benessere può preparare una meditazione guidata con la sua musica, uno degli esempi che fa la stessa Suno. Un negozio può mandare ai clienti migliori un messaggio di auguri che sembri preparato per loro. Un’agenzia può far sentire al cliente il tono di uno spot prima di pagare una sala di registrazione: una prova, da buttare dopo averla ascoltata.

Tre cose, però, vanno sapute prima di cominciare.

La prima è la lingua. Suno non pubblica l’elenco delle lingue di Speech, e io in italiano non ho potuto provarlo. Gli esempi descritti nelle fonti sono in inglese, e Suno stessa avverte che gli accenti possono cambiare durante la generazione. Ascolta ogni traccia dall’inizio alla fine prima di farla sentire a qualcuno.

La seconda sono i diritti. Per le canzoni il centro assistenza di Suno è chiaro: con il piano Basic, quello senza abbonamento, Suno resta proprietaria di quello che generi e tu puoi usarlo solo per scopi non commerciali; con un piano Pro o Premier attivo nel momento in cui crei, il brano è tuo e puoi usarlo anche per lavoro, per esempio nei video su YouTube o TikTok. E se ti abboni dopo, quello che hai fatto prima resta non commerciale. Quelle pagine però parlano di canzoni, e io una regola specifica per le tracce di Speech non l’ho trovata. Prima di usare Speech per lavoro, anche solo in una prova da far sentire a un cliente, controlla i termini o scrivi a Suno.

La terza è la beta. Ogni generazione è un tiro di dadi un po’ diverso dal precedente. Per un messaggio una tantum va benissimo. Per una serie di contenuti che devono suonare sempre uguali, oggi è un limite vero.

Uno strumento in prova si usa per provare. Il cliente merita la versione che hai già ascoltato tu.

Una voce scritta a parole

C’è un ultimo punto, e per chi fa comunicazione è il più delicato. Quando ascolti una voce, è facile immaginarti una persona: un’età, un carattere, a volte una faccia. Viene da farlo anche quando la voce è generata.

La voce di Speech viene generata a partire da una descrizione, e le fonti non documentano una funzione di Speech per copiarla da una registrazione. Se chiedi una voce inventata, «narratore maturo, tono rassicurante», la prima questione è di fiducia: chi ascolta ha diritto di sapere che dall’altra parte c’è una macchina? Io penso di sì, ed è una scelta che ti conviene fare prima che te la chieda qualcun altro.

Poi c’è la legge. L’AI Act, il regolamento europeo sull’intelligenza artificiale, chiama deep fake un’immagine, un audio o un video generati o manipolati con l’AI che somigliano a persone, oggetti, luoghi, entità o fatti esistenti e che a qualcuno potrebbero sembrare falsamente autentici o veritieri. Se il tuo contenuto rientra lì, l’articolo 50 chiede a chi usa il sistema per lavoro di dichiarare che è stato generato o manipolato artificialmente, in modo chiaro e al più tardi al primo ascolto; per le opere evidentemente creative, satiriche o di finzione la segnalazione può rispettare la fruizione dell’opera, restando chiara, distinguibile e accessibile. Una voce che imita una persona vera è il caso più vicino a quella definizione. Lo stesso articolo chiede ai fornitori di questi sistemi di marcare i contenuti sintetici in modo che una macchina li possa riconoscere.

Suno, per la sua funzione che usa la tua voce vera, Voices, chiede una frase di verifica pronunciata a voce: secondo AlphaSignal serve a scoraggiare chi vuole clonare la voce di un altro. È la stessa domanda posta dall’altro lato: questa voce è di chi dice di essere?

Nell’articolo sulla prova dei vestiti in ChatGPT c’era un’immagine che ti mostra come potresti apparire. Il parallelo che vedo è questo: lì la tecnologia costruisce il tuo aspetto, qui il tono emotivo di un messaggio. Resta a te dire a chi guarda, e a chi ascolta, cosa è vero e cosa è costruito.

Una voce si genera con una riga. La fiducia di chi ascolta ci mette anni.

Come portarlo nel tuo lavoro

Se lavori con le parole, Speech è anche una palestra di comunicazione per l’orecchio, a patto di usarla con un metodo. Eccone uno in cinque passi.

  1. Scrivi prima il testo, e leggilo tu ad alta voce, senza musica. Se il messaggio regge così, la musica lo rinforza. Se regge solo con la musica, il problema è il testo, e una colonna sonora epica lo copre senza risolverlo.
  2. Fai tre versioni dello stesso testo con tre musiche diverse. Una calda, una solenne, una ritmata. Ascoltale una dopo l’altra e chiediti cosa capirebbe un cliente da ciascuna. È il modo più veloce che conosco per capire cos’è una cornice, cioè il contesto che decide il significato di un messaggio.
  3. Decidi l’emozione prima del genere. Al posto di «musica elettronica» scrivi cosa deve provare chi ascolta: fiducia, curiosità, urgenza. Poi scegli i suoni che la portano. È lo stesso ragionamento dello storytelling: prima l’effetto, poi gli strumenti.
  4. Verifica i diritti prima di usarlo per lavoro. Per le canzoni, con il piano Basic l’uso commerciale è escluso; per Speech le regole specifiche non le ho trovate. Controlla i termini anche per una prova da far sentire a un cliente.
  5. Dichiaralo, e descrivi le voci per le loro qualità. Puoi usare una formula come «voce e musica generate con l’intelligenza artificiale», messa in modo che si senta o si legga fin dal primo ascolto. Lascia stare le imitazioni di persone vere: è la strada più pulita. E se il tuo audio rientra nella definizione di deep fake, dichiararlo è un obbligo dell’AI Act, oltre che una scelta di fiducia.

C’è anche un uso al contrario, il più utile di tutti. La prossima volta che uno spot, un video o un messaggio vocale ti convince, prova a togliere la musica con l’immaginazione e a rileggere solo le parole. Se dopo ti convincono ancora, era un buon messaggio. Se no, avevi comprato la musica.

Se vuoi capire come i suoni e le immagini lavorano sotto la soglia dell’attenzione, il punto di partenza è il neuromarketing.

Prima ti chiedevi cosa dire. Adesso devi chiederti anche con quale musica lo stai dicendo.

👉 Leggi anche: FLUX 3: cambi un dettaglio, il resto resta — la stessa domanda sulla cornice di un messaggio, questa volta per le immagini.

👉 Leggi anche: Meloni e il marchio sulla voce: cosa protegge — quando una voce diventa una firma, e cosa possono fare un marchio e la legge contro le copie.

👉 Leggi anche: Suno e l’Antitrust: di chi sono le tue canzoni — il 6 ottobre l’Antitrust ha aperto un’istruttoria sui termini di servizio di Suno, a partire dai diritti d’autore.

Domande frequenti

Cos’è Suno Speech?

È una funzione di Suno, in beta pubblica dal 1° ottobre 2026, che trasforma un testo scritto in una traccia audio parlata con una musica originale sotto, generate insieme. Scrivi il testo, descrivi la voce (accento, tono, registro) e lo stile musicale, e ricevi un unico file. Si usa dall’app di Suno e dal sito.

Quanto costa usare Speech?

Suno non ha pubblicato un prezzo a parte: secondo AlphaSignal, Speech usa i crediti dei piani che Suno ha già. Le fonti disponibili non indicano quanti crediti servano per una traccia, né se il piano Basic basti per provarlo.

Posso usare le tracce di Speech per la mia attività?

Per le canzoni le regole di Suno sono chiare: con il piano Basic l’uso è solo non commerciale, con un piano Pro o Premier attivo al momento della creazione puoi usarle anche per lavoro. Le pagine d’aiuto parlano di canzoni e non nominano Speech: prima di usare una traccia per lavoro controlla i termini o chiedi a Suno.

Speech funziona in italiano?

Suno non pubblica l’elenco delle lingue, e gli esempi descritti nelle fonti sono in inglese. Io non ho potuto provarlo in italiano. Suno avverte che gli accenti possono cambiare durante la generazione: ascolta ogni traccia per intero prima di usarla.

Una voce generata con l’AI va dichiarata?

Se l’audio rientra nella definizione di deep fake dell’AI Act (somiglia a persone, oggetti, luoghi, entità o fatti esistenti e potrebbe sembrare falsamente autentico o veritiero), chi lo usa per lavoro deve dichiarare che è stato generato o manipolato con l’AI, in modo chiaro e al più tardi al primo ascolto. Una voce che imita una persona vera è il caso più vicino. Per una voce inventata la valutazione dipende dal contenuto e dal contesto: dichiararlo comunque resta la scelta più sicura per la fiducia di chi ascolta.

Che differenza c’è fra Speech e Voices di Suno?

Speech crea una voce nuova partendo da una descrizione, insieme alla musica. Voices, arrivata con la versione 5.5 di marzo 2026, usa la tua voce vera: registri da 15 secondi a quattro minuti di parlato e pronunci una frase di verifica, pensata per scoraggiare chi vuole clonare la voce di un altro.

Fonti

Manuale di sopravvivenza alla stupidità umana — Luca Masrè Passaro
// dal libro
Ti è piaciuto? Nel libro vado più a fondo.

31 capitoli su come funzioniamo. In uscita 16 settembre 2026.

Scopri il libro →
Luca Masrè Passaro
// scritto da
Luca Masrè Passaro

Comunicazione, psicologia e persuasione. Autore del Manuale di sopravvivenza alla stupidità umana.

leggi la mia storia →
// LA MAIL

Hai letto fino a qui.

Continua sulla mail.

Una al mese, al massimo. Solo quando ho qualcosa di buono da dirti.

// continua a leggere

Altri pezzi dalla stessa categoria