Modelli

Un giornalista ha creato tre video musicali con Claude Opus 5.5 usando migliaia di righe di codice

11 ottobre 2026 · 4 min di lettura

a bunch of wires and wires in a room
Ivan N / Unsplash

Un giornalista ha prodotto tre video musicali distinti durante la settimana precedente utilizzando il modello di intelligenza artificiale Claude Opus 5.5 sviluppato da Anthropic. Il processo ha richiesto oltre dieci ore di lavoro autonomo da parte del chatbot per generare i contenuti visivi e testuali necessari alla realizzazione dei progetti multimediali completi.

La metodologia adottata per la creazione dei video non ha fatto ricorso a generatori di immagini diretti come Sora o Veo. Il flusso di lavoro ha previsto invece che il modello scrivesse testi di canzoni basati su istruzioni specifiche fornite dall'utente. Questi testi sono stati successivamente inseriti nella piattaforma Suno versione sei, che ha generato le tracce audio complete includendo la parte vocale. Poiché il modello linguistico non è in grado di ascoltare direttamente i file audio prodotti, l'utente ha dovuto annotare manualmente i tempi di inizio per ogni strofa, ritornello e sezione strumentale. Questi dati temporali sono stati poi restituiti al sistema per sincronizzare la generazione visiva con la colonna sonora.

La fase di rendering visivo è stata eseguita interamente attraverso la scrittura di codice da parte dell'intelligenza artificiale. Il sistema ha generato migliaia di righe di istruzioni programmatiche che definivano elementi grafici specifici come stelle, pennellate, movimenti di camera ed effetti luminosi. Un computer ha quindi calcolato ogni singolo fotogramma in modo indipendente basandosi su queste istruzioni prima di assemblare la sequenza finale insieme alla traccia audio. Per il video considerato come opera principale del progetto, il sistema ha calcolato esattamente 7.392 immagini distinte partendo da oltre 5.500 righe di codice scritte automaticamente.

Una limitazione fondamentale del processo risiede nel fatto che il modello non vede mai il video muoversi durante la sua creazione. Il sistema analizza solo immagini statiche e deve prevedere il movimento risultante senza poter verificare la fluidità dell'animazione in tempo reale. Questa caratteristica spiega la presenza di alcuni errori visivi nei prodotti finali, dove le figure si muovono in modo rigido simile a ritagli di carta e nessun personaggio cammina in maniera naturale. In una scena specifica, un giovane tiene un saldatore in modo errato, un dettaglio che nessun disegnatore umano avrebbe rappresentato in quel modo.

Il primo video musicale racconta la storia di un ragazzo che smonta una radio all'età di nove anni e sogna di costruire ponti a sedici anni. Il narrativa prosegue mostrando il protagonista a diciannove anni mentre ripara droni in una trincea e legge su un telefono con il quattro percento di batteria che una macchina ha risolto una dimostrazione matematica di novant'anni. La voce nel brano è stata descritta come aggressiva hip hop del Midwest americano dei primi anni duemila con una tonalità nasale e acuta, ottenendo un risultato sonoro molto simile a quello di un famoso rapper statunitense nonostante le restrizioni della piattaforma audio sui nomi degli artisti. La produzione di questo clip ha richiesto tre ore e quarantasei minuti di elaborazione attiva su un tempo totale assegnato di quattro ore, producendo settantadue inquadrature in stile fumetto.

Un secondo progetto ha esplorato la vita di un celebre pittore olandese attraverso le lettere inviate al fratello Theo. Il ritornello del brano ripeteva la richiesta di inviare più colore giallo. Lo stile visivo ha cercato di imitare le pennellate spesse tipiche dell'artista, dato che queste texture sono più facili da calcolare algoritmicamente rispetto ai volti umani. Di conseguenza, gli autoritratti nel video appaiono simili a maschere con proporzioni errate e alcune figure di minatori scompaiono improvvisamente mentre camminano verso la telecamera. Sebbene la maggior parte dei fatti narrativi corrisponda alle lettere storiche, esiste una discrepanza creativa riguardante la posizione delle tombe, che nel video appaiono adiacenti mentre nella realtà rimasero separate per ventitré anni.

L'utente ha spinto il sistema al massimo delle sue capacità durante la notte per generare una versione finale che sovrapponeva dipinti reali alle illustrazioni generate. Tuttavia, sono rimasti evidenti i limiti dell'abbonamento utilizzato, che non ha permesso di correggere completamente le imperfezioni nel movimento e nella logica spaziale delle scene animate. Il risultato finale dimostra le capacità del modello nel gestire compiti complessi di codifica e narrazione, pur evidenziando le attuali difficoltà nella creazione di animazioni fluide e coerenti senza supervisione umana costante sul movimento.