La famiglia di modelli vocali

Cinque modelli vocali, una trascrizione.

Il montaggio basato sul testo vale quanto valgono le parole sotto. Scenaristo fa girare sul tuo computer una piccola famiglia di modelli di riconoscimento vocale di primo livello, ognuno scelto per un basso tasso di errore, tempi rapidi e ciò da cui dipende ogni taglio: una tempistica al singolo termine precisa.

Cosa guardiamo

Parole giuste, al momento giusto, in locale.

Ogni modello della famiglia supera le stesse tre soglie prima di entrare nell’app.

Basso tasso di errore

Meno errori di trascrizione significa meno correzioni e una trascrizione di cui fidarsi abbastanza da montare eliminando testo.

Prima il tasso

Tempi rapidi

La trascrizione gira in background e finisce in fretta, così una registrazione lunga diventa montabile in minuti, non in pause caffè.

Classe tempo reale

Tempistica al termine

Ogni parola porta il proprio riferimento temporale. È questo che permette a una frase eliminata di richiudere il girato su un confine pulito.

Tempo per parola
In ordine di velocità

Scegli il compromesso che serve al tuo audio.

Il più veloce in alto, la copertura più ampia in basso. Scenaristo usa Parakeet come predefinito e ti lascia passare agli altri quando servono precisione o una lingua più rara. Ogni modello si scarica su richiesta, fissato con checksum, salvato in locale, mai preso due volte.

1.Il più veloce

Parakeet TDT

Modello predefinitoNVIDIA
nvidia/parakeet-tdt-0.6b-v3

Il predefinito. Un trasduttore adatto al flusso continuo, che elabora un’ora di audio in una frazione del tempo, con i riferimenti temporali per parola già inclusi.

Token-and-Duration Transducer, costruito per la resa in tempo reale.

25lingue
2.Molto veloce

Canary

Scelta precisioneNVIDIA
nvidia/canary-1b-v2

Quando la precisione conta più della velocità pura. Un modello più pesante, che cede un po’ di resa in cambio di trascrizioni più pulite su audio difficile.

Un encoder più grande, per il tasso di errore più basso del gruppo.

25lingue
3.Veloce

Cohere Transcribe

Cohere Labs
CohereLabs/cohere-transcribe-03-2025

Un’opzione equilibrata, concentrata sulle lingue più diffuse, con tempistica e punteggiatura affidabili da subito.

Solido sul parlato pulito nelle principali lingue di lavoro.

14lingue
4.Il più ampio

Whisper Large v3 Turbo

Copertura massimaOpenAI
openai/whisper-large-v3-turbo

La riserva per tutto il resto. Quando il tuo audio è in una lingua che i modelli veloci non coprono, Whisper quasi certamente la copre, e Turbo ti ci porta in fretta.

Un decoder distillato, nettamente più veloce di large-v3 a fronte di un piccolo costo in precisione.

99lingue
5.Accurato

Whisper Large v3

Gradino precisioneOpenAI
openai/whisper-large-v3

L’opzione più precisa della famiglia Whisper. Più lenta di Turbo, ma la più solida su audio rumoroso e sulle lingue meno coperte.

Il modello completo, non distillato. Da tirare fuori sull’audio più difficile.

99lingue

Gli identificativi dei modelli rimandano ai rispettivi repository pubblici su Hugging Face. Parakeet, Canary, Cohere Transcribe e Whisper sono marchi rispettivamente di NVIDIA, Cohere e OpenAI. Disponibilità e versioni esatte possono cambiare con l’aggiornarsi della famiglia.

Come lavora insieme la famiglia

Un predefinito sensato, con margine quando serve.

La maggior parte delle registrazioni non ha mai bisogno di più del predefinito. Parakeet è veloce, preciso e copre le lingue in cui si fa gran parte del video parlato: per la tipica intervista o clip parlata, funziona e basta.

Quando un file è rumoroso, multilingue o in una lingua fuori dalla portata dei modelli veloci, puoi cambiare modello al download e rifare la trascrizione. Montaggio, tagli e tempistica restano intatti.

In localeOgni modello gira sul posto. L’audio non lascia il tuo computer.
SostituibileCambia modello per progetto e rifai la trascrizione sul posto.
Fino a 99lingue coperte dall’intera famiglia.
Parole migliori, montaggi migliori

Trascrizione allo stato dell’arte,
sulla tua scrivania.

In locale · senza account · senza caricamenti