MODELLO / AGENTE / ALGORITMO

Che tipo di sistema c’è davvero.

Sistema
Il dossier confronta sistemi differenti per ascolto, separazione, trasformazione timbrica, generazione continua e conversazione vocale.
Modello o LLM
Solo alcuni casi sono LLM o audio-language model, come Magenta RealTime 2 e Moshi. RAVE, Morpho, AudioShake, CEDAR e le funzioni Yamaha appartengono a categorie differenti.
Agente
Nessuno dei sistemi documentati costituisce da solo un agente autonomo di regia. Un livello agente richiederebbe osservazione dello stato, scelta di azioni, uso di strumenti e controllo dell’esito.
Stato della prova
VERIFICATO SU FONTI PUBBLICHE — NESSUNA PROVA COMPARATIVA LCC

VERIFICA DEI FATTI // CHECKPOINT TECNICO

Elementi verificati e asserzioni tecniche.

Classificazione dei sistemiLLM, modelli neurali e algoritmi distinti nel testo
Latenze e prestazioniDichiarazioni di paper o produttori; non confrontate da LCC
Casi artisticiPerformance, sessioni e prototipi distinti dalle demo commerciali
DisponibilitàProdotti, modelli scaricabili e technology preview indicati separatamente
Regia autonomaNon documentata nei sistemi analizzati

01 / APPROFONDIMENTO

Dal laboratorio al tempo dello spettacolo

Fino a poco tempo fa, chiedere a un modello di generare o trasformare audio significava aspettare. Il suono entrava, la macchina elaborava, il risultato arrivava dopo. Per il palco era già troppo tardi. Oggi alcuni sistemi lavorano dentro il tempo dello spettacolo. Un modello può seguire il MIDI e generare musica senza fermarsi; un altro può cambiare il timbro di una voce mentre viene cantata; un altro ancora può separare il dialogo dal fondo o sostenere una conversazione senza attendere il proprio turno. Non è successo tutto quest'anno: RAVE risale al 2021, Yamaha DM7 Assist al 2023, Moshi e Morpho al 2024. La novità del 2026 è che linee di ricerca nate in momenti diversi stanno convergendo in plug-in, applicazioni locali, prototipi hardware e performance che possiamo ascoltare. Non fanno tutti la stessa cosa e, soprattutto, non sono tutti LLM. Il punto interessante non è l'etichetta AI: è capire dove il modello entra nella catena, quanto ritardo introduce, che cosa decide e chi mantiene il controllo quando qualcosa non funziona.

02 / APPROFONDIMENTO

Prima delle specifiche: tre prove da ascoltare

Nel gennaio 2025, la performance audiovisiva New Ruins di Abo Abo e Tania Cortés Becerra ha messo RAVE e Somax2 in relazione con giradischi, sintetizzatori modulari e immagini reattive. Non era una demo commerciale: era una performance commissionata da IRCAM Forum, poi premiata con una menzione d'onore al Prix Ars Electronica 2025. Qualche mese prima, il 9 ottobre 2024, Canblaster aveva usato RAVE in una live performance e in una dimostrazione pubblica nello Studio 5 dell'IRCAM. È un caso utile perché mostra il modello dentro una pratica musicale, non soltanto in un confronto di laboratorio. Sul versante hardware, Project LYDIA porta una versione di Morpho su Raspberry Pi 5 dentro un oggetto pensato per essere suonato. La Phase II del maggio 2026 integra audio, memorie e controllo MIDI, ma Roland lo definisce ancora una technology preview "funzionale ma incompleta": non è un prodotto commerciale disponibile. Tre esempi, tre stati differenti: opera presentata al pubblico, sessione artistica documentata, prototipo industriale. La distinzione conta più della parola AI.

03 / APPROFONDIMENTO

Cinque frontiere nella stessa catena

La prima frontiera è l'ascolto. Un sistema analizza ciò che entra e propone una classificazione. Il Naming Assist della Yamaha DM7 usa machine learning per riconoscere la probabile sorgente e suggerire nome e icona. HA Assist, invece, usa istogrammi e statistica; Fader Assist un algoritmo matematico di convergenza. Nessuno dei tre è un LLM o un agente autonomo. La seconda è la separazione. Il modello tenta di ricostruire parti già mescolate: voce, dialogo, musica o rumore. Qui si collocano AudioShake Dialogue RT e CEDAR VoicEX 2. Il risultato può essere molto utile per intelligibilità, sottotitolazione e traduzione, ma non coincide necessariamente con la sorgente originale: può perdere consonanti, transienti o lasciare residui. La terza è la trasformazione. RAVE e Morpho non compongono al posto del musicista: risintetizzano il segnale attraverso un timbro appreso. Il gesto, l'altezza e la dinamica restano in ingresso; il modello cambia il materiale sonoro con cui vengono restituiti. La quarta è la generazione continua. Magenta RealTime 2 produce token audio in streaming e può essere guidato da testo, riferimenti sonori e MIDI. Qui compare esplicitamente un Transformer decoder-only che gli autori chiamano LLM. La quinta è la conversazione full-duplex. Moshi modella contemporaneamente il flusso dell'utente e quello del sistema. Può gestire sovrapposizioni, interruzioni e interiezioni senza imporre il rigido turno domanda-risposta dei normali assistenti vocali. Un sesto passaggio, però, non è ancora contenuto in nessuno di questi strumenti: l'agente. Un modello produce un risultato. Un agente osserva uno stato, sceglie un'azione, usa strumenti e controlla l'esito. Collegare un modello a mixer, cue, playback o show control cambia la responsabilità molto più di un nuovo effetto sonoro.

Cinque funzioni alternative dei modelli nella catena audio, con controllo umano, percorso originale e bypass. Ricostruzione editoriale LCC basata sulle fonti; non è l’architettura di un singolo prodotto.
Cinque funzioni alternative dei modelli nella catena audio, con controllo umano, percorso originale e bypass. Ricostruzione editoriale LCC basata sulle fonti; non è l’architettura di un singolo prodotto.

04 / APPROFONDIMENTO

La scheda tecnica, senza confondere pesi e promesse

• Magenta RealTime 2 — LLM generativo di token audio — Small 230M, file MLX ~464 MB; Base 2,4B, ~2,79 GB; risorse comuni ~1,38 GB — Streaming su Apple Silicon; controllo ~200 ms — Codice Apache 2.0; pesi CC BY 4.0 — Scaricabile e sperimentabile; nessuna produzione scenica indipendente verificata da Signals • Moshi — Speech-text LLM full-duplex — Transformer 7B; pesi MLX indicativi ~5,19 GB Q4, ~8,55 GB Q8, ~15,8 GB BF16 — ~160 ms teorici, ~200 ms pratici; PyTorch non quantizzato ~24 GB VRAM — Codice MIT / Apache 2.0; pesi CC BY 4.0 — Prototipi vocali e installazioni sperimentali; principalmente inglese • RAVE — VAE generativo per timbre — Dipende dal modello addestrato — Paper: 48 kHz fino a 20x real time su CPU portatile — Repository CC BY-NC 4.0 — Usato in performance; verificare la licenza per usi commerciali • Neutone Morpho — Trasformazione timbrica proprietaria — Parametri e peso non pubblicati — VST3/AU; macOS 12+, Windows 10/11; CPU consigliata equivalente a M1 — Plug-in proprietario; SDK separato LGPL 2.1 — Plug-in disponibile; Project LYDIA resta un prototipo • AudioShake Dialogue RT — Separazione neurale proprietaria — Non pubblicato — 11 ms end-to-end su DGX Spark / Blackwell, secondo AudioShake — SDK proprietario — Uso broadcast dichiarato; nessun benchmark indipendente equivalente trovato • CEDAR VoicEX 2 — Rete neurale proprietaria — Non pubblicato — Meno di 10 ms, secondo CEDAR — Commerciale — Plug-in acquistabile; prestazione non verificata da Signals • Yamaha DM7 Assist — ML, statistica e algoritmi di supporto — Non pertinente / non pubblicato — Integrato nella console — Proprietario — Assistenza operativa, non generazione e non agente La tabella non è una classifica. Le latenze non sono direttamente comparabili: misurano compiti, macchine e catene differenti. I valori di Magenta, Moshi, AudioShake e CEDAR provengono dagli sviluppatori o dai rispettivi paper, non da un banco prova comune di Low Confidence Club.

05 / APPROFONDIMENTO

Linea temporale: ricerca, dimostrazione e uso non sono la stessa data

• 9 novembre 2021 - pubblicazione del paper RAVE - [OLTRE 2 ANNI]. • 20 luglio 2023 - Yamaha presenta le funzioni Assist della DM7 - [OLTRE 2 ANNI]. • 20 marzo 2024 - Roland e UMG pubblicano i Principles for Music Creation with AI - [OLTRE 2 ANNI]. • 15 aprile 2024 - Neutone presenta Morpho - [OLTRE 2 ANNI]. • 17 settembre 2024 - prima versione pubblica del paper Moshi - [OLTRE 2 ANNI]. • 9 ottobre 2024 - Canblaster usa RAVE nella prima IRCAM Forum Studio Session. • 21 gennaio 2025 - prima performance documentata di New Ruins. • 7 aprile 2025 - CEDAR presenta la gamma che comprende VoicEX 2. • 11 novembre 2025 - Roland presenta Project LYDIA come technology preview. • 14 aprile 2026 - AudioShake annuncia Dialogue RT. • 7 maggio 2026 - Roland presenta Project LYDIA Phase II. • 4 giugno 2026 - Google pubblica Magenta RealTime 2. La sequenza evita un equivoco frequente: la data del modello, quella della demo e quella dell'eventuale utilizzo artistico descrivono fatti diversi.

06 / APPROFONDIMENTO

Magenta RealTime 2: il modello diventa uno strumento

Magenta RealTime 2 genera audio stereo a 48 kHz in continuità. Il sistema combina il codec neurale SpectroStream, MusicCoCa e un Transformer decoder-only che predice token audio. La model card dichiara due taglie: mrt2_small, 230 milioni di parametri, e mrt2_base, 2,4 miliardi. Il repository documenta lo streaming in tempo reale su Apple Silicon. Small gira anche sui MacBook Air; Base è indicato per M4 Pro e chip M2, M3 o M5 Max. Gli altri Mac Apple Silicon e le GPU NVIDIA possono eseguire inferenza offline. Google non pubblica un requisito minimo di RAM: trasformare 16 o 32 GB in un requisito ufficiale sarebbe un'invenzione. La model card dichiara circa 200 millisecondi per il controllo a bassa latenza, ma rinvia le metriche complete a un rapporto tecnico futuro. Dichiara inoltre circa 71.000 ore di stock music, soprattutto strumentale, come dati di addestramento. Il modello è quindi realmente scaricabile e integrabile, ma il suo comportamento artistico, la ripetibilità e il carico della catena completa devono ancora essere provati produzione per produzione.

07 / APPROFONDIMENTO

Moshi: una voce che ascolta mentre parla

Moshi parte da un backbone linguistico e genera token vocali attraverso il codec neurale Mimi. Il paper descrive due flussi paralleli, uno per l'utente e uno per il sistema, e dichiara 160 millisecondi di latenza teorica e circa 200 in pratica. Il repository ufficiale offre stack PyTorch, Rust e MLX; quest'ultimo porta l'inferenza locale su Mac e iPhone. La possibilità scenica è concreta: un personaggio sintetico interrompibile, capace di sovrapporsi a una voce umana. Ma il modello pubblico lavora principalmente in inglese e non accede da solo a strumenti esterni. Senza un livello ulteriore non può mandare cue o governare dispositivi: è un LLM vocale, non un agente di regia.

08 / APPROFONDIMENTO

RAVE e Morpho: il timbro come materia eseguibile

RAVE è un variational autoencoder con fine-tuning avversariale. Il paper, pubblicato il 9 novembre 2021, dichiara sintesi a 48 kHz fino a venti volte più veloce del tempo reale su una CPU da portatile. Il repository consente di addestrare ed esportare modelli e rimanda anche a una versione VST beta. RAVE non comprende istruzioni, non conversa e non decide: trasforma. Proprio questa limitazione può renderlo interessante dal vivo. Il rapporto fra gesto e risultato è più diretto, mentre l'autonomia resta bassa. La licenza del repository è CC BY-NC 4.0, quindi l'impiego commerciale richiede attenzione. Neutone Morpho porta un principio simile in un plug-in VST3/AU disponibile per macOS e Windows. L'utente può caricare il proprio materiale, far addestrare un modello tramite il servizio Neutone e poi eseguirlo localmente. Architettura completa, numero di parametri e peso dei modelli non sono pubblicati. Il Neutone SDK, separato dal plug-in, è invece un framework LGPL 2.1 che gestisce buffer, conversioni di sample rate e adattamento dei modelli alle DAW.

09 / APPROFONDIMENTO

Separare una voce in undici millisecondi

La frontiera più vicina al lavoro quotidiano del fonico potrebbe non essere quella generativa. AudioShake Dialogue RT dichiara due flussi indipendenti - dialogo e fondo - con 11 millisecondi di latenza end-to-end su hardware NVIDIA DGX Spark / Blackwell. L'azienda riferisce anche un uso in produzione da parte di AI-Media per captioning e traduzione. Modello, dataset, parametri e pesi non sono però pubblicati, e non abbiamo trovato un benchmark indipendente equivalente. CEDAR VoicEX 2 usa una rete neurale proprietaria e dichiara meno di 10 millisecondi. È acquistabile, ma una pagina commerciale non prova come reagirà con PA, rientri, microfoni aperti e livelli reali di palco. In entrambi i casi il segnale originale deve restare instradabile. La separazione non può diventare un punto unico di guasto solo perché il numero di millisecondi appare compatibile con il live.

010 / APPROFONDIMENTO

Diritti e trasparenza: dal principio volontario alla regola

Nel marzo 2024 Roland e Universal Music Group hanno pubblicato i Principles for Music Creation with AI. È un'iniziativa volontaria e aziendale, non una legge né una certificazione dei modelli. Chiede però che l'uso di opere protette, nome, immagine, voce e likeness sia autorizzato in anticipo, e lega l'uso responsabile dell'AI a trasparenza, tracciabilità e ascolto dei creatori. Come antecedente, aiuta a capire quali problemi l'industria musicale aveva già messo a fuoco prima del 2026. Il quadro internazionale resta disomogeneo. Nell'Unione europea, l'articolo 50 dell'AI Act si applica dal 2 agosto 2026 e prevede, nei casi definiti dalla norma, marcature machine-readable e disclosure per contenuti sintetici e deepfake. In Cina, le misure di etichettatura in vigore dal 1 settembre 2025 comprendono esplicitamente anche l'audio e distinguono marcature visibili e metadati. Regno Unito e Stati Uniti presentano un quadro diverso: nel 2026 il primo ha pubblicato un rapporto e una valutazione d'impatto sull'uso di opere protette per sviluppare sistemi AI; il Copyright Office statunitense ha pubblicato rapporti su repliche digitali, copyrightability e training e ha raccomandato una legge federale sulle repliche non autorizzate. Rapporti e raccomandazioni non vanno descritti come un obbligo generale già in vigore. Il Giappone ha aggiornato nel marzo 2026 le AI Guidelines for Business alla versione 1.2, con un approccio prevalentemente di linee guida. In Canada, il National Summit on Artificial Intelligence and Culture ha portato nel dibattito copyright, trasparenza, lavoro e sovranità culturale, ma non costituisce da solo una nuova norma generale. Per una produzione audio, la domanda pratica resta la stessa: da dove arrivano i dati, chi ha autorizzato una voce, come si dichiara un contenuto sintetico e chi risponde della sua messa in onda.

011 / APPROFONDIMENTO

La prova non è la demo

Prima di mettere uno di questi sistemi in uno spettacolo servono domande molto tradizionali: • qual è la latenza totale, comprese interfaccia, buffer, rete e conversioni; • il risultato è ripetibile oppure varia a ogni esecuzione; • che cosa accade quando CPU o GPU non mantengono il tempo reale; • esiste un bypass che non interrompa il segnale; • il segnale originale resta disponibile su un percorso separato; • chi può cambiare prompt, modello e parametri; • l'audio resta locale oppure lascia il teatro; • quali licenze regolano codice, pesi, dati e uscita generata; • configurazioni, versioni e decisioni vengono registrate; • chi prende la decisione finale durante lo spettacolo. La novità non è che una macchina possa produrre un suono. Succede da decenni. La novità è che modelli capaci di ascoltare, separare, trasformare, conversare e generare stanno raggiungendo il tempo operativo della scena. Quando entrano in quel tempo, smettono di essere soltanto strumenti di post-produzione. Diventano parte della regia. E una parte della regia deve sempre dichiarare chi la controlla, quanto ritarda, che cosa conserva e come viene esclusa.

012 / APPROFONDIMENTO

La posizione di LCC: il futuro non è un modello, è una nuova catena di responsabilità

I dati raccolti non descrivono l'arrivo imminente di una regia autonoma. Mostrano qualcosa di meno spettacolare e più concreto: sistemi molto diversi stanno entrando, uno alla volta, in punti specifici della catena audio. Alcuni separano una voce, altri trasformano un timbro, altri generano un flusso musicale o sostengono un dialogo. Le latenze dichiarate possono essere compatibili con il tempo reale, ma non sono direttamente confrontabili; l'hardware richiesto cambia molto; i casi artistici documentati dimostrano possibilità, non ancora una maturità generale del settore. Per Low Confidence Club, il futuro più plausibile nel breve periodo non è quindi la sostituzione del fonico, del musicista o del sound designer. È una forma di intelligenza distribuita nella quale il modello ascolta, separa, trasforma o propone, mentre una persona stabilisce i limiti entro cui può agire e conserva la possibilità di escluderlo. Questa è un'inferenza editoriale, fondata sulla distanza che le fonti mostrano ancora tra paper, demo, prototipo, prodotto e uso in produzione: non è una previsione certa. Le applicazioni più credibili saranno probabilmente quelle in cui l'errore è visibile e recuperabile: assistenza, pulizia del segnale, strumenti reattivi, trasformazione performativa e preparazione di alternative. Più delicato è affidare a un sistema opaco decisioni irreversibili o cue critici. Non perché un modello non possa produrre un risultato convincente, ma perché uno spettacolo deve poter spiegare, ripetere o interrompere quel risultato mentre sta accadendo. Se questa traiettoria continuerà, cambierà anche la documentazione di una produzione. Accanto a patch, routing, firmware e cue list dovranno comparire versione del modello, origine e diritti dei dati quando noti, configurazione, latenza misurata sulla catena reale, criteri di intervento, registrazione delle modifiche e procedura di fallback. Il lavoro tecnico non consisterà soltanto nel far funzionare il modello, ma nel definire le condizioni in cui gli è consentito funzionare. Sul piano artistico, questo può aprire opere meno rigidamente riprodotte e più negoziate fra partitura, interprete, ambiente e sistema. Può però produrre anche dipendenza dai fornitori, risultati difficili da ricostruire e un'estetica uniformata dai dati e dagli strumenti disponibili. L'incertezza diventa interessante quando è una scelta compositiva controllata; diventa un problema quando nasconde l'impossibilità di sapere perché qualcosa è accaduto. La posizione di LCC, alla luce delle prove disponibili oggi, è questa: il futuro non apparterrà necessariamente al modello più sorprendente, ma ai sistemi che renderanno leggibili i propri limiti, reversibili le proprie azioni e chiara la responsabilità umana. Low confidence non significa rinunciare alla tecnologia. Significa trasformare l'incertezza da difetto nascosto a condizione dichiarata del progetto.

013 / APPROFONDIMENTO

Fonti principali e trasparenza

• Google DeepMind - Magenta RealTime 2, model card • Magenta RealTime 2 - repository e requisiti hardware • Kyutai - Moshi, repository • Moshi - paper • RAVE - paper • RAVE - repository • Neutone Morpho • Neutone SDK • AudioShake Dialogue RT • CEDAR VoicEX 2 • Yamaha DM7 Assist • Roland + UMG - Principles for Music Creation with AI Le prestazioni numeriche riportate provengono da documentazione, paper e dichiarazioni dei rispettivi sviluppatori. Low Confidence Club non ha eseguito prove comparative indipendenti sui sistemi descritti. Low confidence. High output. Media — ILLUSTRAZIONE GENERATA CON AI · DIREZIONE E REVISIONE UMANA LCC. La hero è un’illustrazione editoriale concettuale e non raffigura un prodotto o un allestimento reale. Il diagramma è una grafica vettoriale originale LCC. THE MACHINE HELPED. HUMANS DECIDED. Articolo verificato su fonti pubbliche aggiornate al 26 settembre 2026. Low Confidence Club non ha eseguito prove comparative indipendenti sui sistemi descritti. Testo, taglio, media e pubblicazione approvati da Umberto Fiore.

FONTE PRIMARIA VERIFICATA