Notizie
Presentazione di Sonilo Sound Effects 1.0
Un passo verso un Sound World Model per il video
- Scritto da
- Team Sonilo
- Pubblicato il
Un suono generato ha una sola prova decisiva: ci credi, oppure no. Un’auto sportiva deve suonare come quel motore, a quella velocità, da quella distanza, altrimenti l’intera inquadratura sembra finta.
Abbiamo costruito Sonilo Sound Effects 1.0 attorno a questo standard. È un altro passo verso un Sound World Model per il video: un modello che capisce cosa accade sullo schermo, quando accade, a che velocità si muove, quanto è lontano e che cosa dovrebbe far provare il momento.
Carica un video e Sonilo restituisce musica originale ed effetti sonori, posizionati sull’azione, come un’unica traccia finita. Oppure parti da un prompt testuale e genera direttamente effetti sonori originali. Ogni traccia è licenziata.
Benchmark
In testa nei benchmark
Abbiamo valutato Sonilo Sound Effects 1.0 e Sonilo Music 1.1 con audio-eval, un toolkit open source per il benchmarking dell’audio generato. Misura ogni modello su metriche percettive e distribuzionali standard, tra cui similarità CLAP, Fréchet Distance, divergenza KL, Audiobox Aesthetics, DeSync e allineamento ImageBind, su cinque set di valutazione consolidati.
Sonilo Sound Effects 1.0 ha guidato 15 metriche su 15 su CineBench, il nostro set interno di valutazione video-to-sound-effects, rispetto a Mirelo v1.6.
- 27 of 30
- metriche video-to-sound-effects guidate su Movie Gen Audio Bench e CineBench, rispetto a Mirelo v1.6
- 16 of 24
- metriche text-to-sound-effects guidate su Clotho e AudioCaps, rispetto a ElevenLabs SFX v2 e Mirelo v1.6
- 10 of 13
- metriche MusicCaps in cui Sonilo Music 1.1 supera Suno v5.5
Benchmark video-to-sound-effects
Movie Gen Audio Bench e CineBench
Sonilo Sound Effects 1.0 confrontato con Mirelo v1.6, valutato su DeSync (quanto il suono si discosta dall’azione), allineamento ImageBind (il suono giusto per ciò che appare sullo schermo), divergenza KL, Inception Score, Audiobox Aesthetics e Fréchet Distance.

Benchmark text-to-sound-effects
Clotho e AudioCaps
Sonilo Sound Effects 1.0 confrontato con ElevenLabs SFX v2 e Mirelo v1.6, sullo stesso set di metriche più la similarità CLAP per la corrispondenza al prompt.

Benchmark text-to-music
MusicCaps
Sonilo Music 1.1 confrontato con Suno v5.5, sullo stesso set di metriche usato per la generazione text-to-music.

Funzionalità 01
Il video decide il posizionamento, non la tua timeline
La decisione di cui vogliamo parlare è quella che non si vede nella demo. Avremmo potuto pubblicare clip sonore separate e lasciare a te il posizionamento. Quella versione funziona bene in demo, ma ti lascia comunque a cercare librerie, tagliare clip e allineare il suono a mano: esattamente il lavoro che volevamo eliminare.
Per questo il modello legge il girato prima di generare qualsiasi cosa: timing, ritmo, azione ed emozione di ogni scena. Deve sapere quando il motore accelera prima di creare il rombo.
Funzionalità 02
Musica ed effetti, un’unica traccia finita
La musica funziona allo stesso modo. Segue la storia invece di girare in loop sotto il video, e nasce dallo stesso upload degli effetti. Un’unica traccia finita, bilanciata, non una pila di clip lasciate a te da mixare.
L’arco più lungo è un Sound World Model: un solo modello che legge ciò che accade sullo schermo e genera colonne sonore end to end. La musica porta l’emozione. Gli effetti sonori creano presenza.
Dicci se credi al motore.
Disponibilità