De familie spraakmodellen

Vijf spraakmodellen, één transcriptie.

Tekstgebaseerd monteren is niet beter dan de woorden eronder. Scenaristo draait op je eigen machine een kleine familie eersteklas spraakherkenningsmodellen, elk gekozen op een lage foutmarge, snelle doorloop en datgene waarvan elke knip afhangt: nauwkeurige timing op woordniveau.

Waar we op selecteren

Kloppende woorden, op tijd, lokaal.

Elk model in de familie haalt dezelfde drie drempels voordat het in de app komt.

Lage foutmarge

Minder verkeerd getranscribeerde woorden betekent minder corrigeren, en een transcriptie die je genoeg vertrouwt om al tekst verwijderend te monteren.

Foutmarge eerst

Snelle doorloop

De transcriptie draait op de achtergrond en is snel klaar, zodat een lange opname in minuten te monteren is en niet in koffiepauzes.

Realtime-klasse

Timing op woordniveau

Elk woord draagt zijn eigen tijdstempel. Daardoor sluit een verwijderde zin het beeld op een schone grens.

Tijdstempel per woord
Op snelheid gerangschikt

Kies de afweging die je audio nodig heeft.

Het snelst bovenaan, de breedste dekking onderaan. Scenaristo gebruikt standaard Parakeet en laat je naar de andere grijpen als nauwkeurigheid of een zeldzamere taal daarom vraagt. Elk model wordt op aanvraag gedownload, met controlesom vastgezet, lokaal bewaard en nooit twee keer opgehaald.

1.Snelst

Parakeet TDT

StandaardmodelNVIDIA
nvidia/parakeet-tdt-0.6b-v3

De standaard. Een transducer die goed omgaat met doorlopende stromen en een uur audio in een fractie van de tijd verwerkt, met tijdstempels per woord er meteen bij.

Token-and-Duration Transducer, gebouwd voor realtime doorvoer.

25talen
2.Zeer snel

Canary

Keuze op nauwkeurigheidNVIDIA
nvidia/canary-1b-v2

Als nauwkeurigheid zwaarder weegt dan pure snelheid. Een zwaarder model dat wat doorvoer inlevert voor schonere transcripties bij lastige audio.

Een grotere encoder, voor de laagste foutmarge van het stel.

25talen
3.Snel

Cohere Transcribe

Cohere Labs
CohereLabs/cohere-transcribe-03-2025

Een evenwichtige optie, gericht op de meest voorkomende talen, met betrouwbare timing en interpunctie zonder instellen.

Sterk bij heldere spraak in de grote werktalen.

14talen
4.Breedst

Whisper Large v3 Turbo

Breedste dekkingOpenAI
openai/whisper-large-v3-turbo

De achtervang voor al het andere. Staat je audio in een taal die de snelle modellen niet dekken, dan doet Whisper dat vrijwel zeker wel, en Turbo brengt je er snel.

Een gedestilleerde decoder, merkbaar sneller dan large-v3 tegen een kleine prijs in nauwkeurigheid.

99talen
5.Grondig

Whisper Large v3

Nauwkeurigste tredeOpenAI
openai/whisper-large-v3

De nauwkeurigste optie binnen Whisper. Trager dan Turbo, maar het sterkst bij ruisige audio en bij talen die minder goed gedekt zijn.

Het volledige, niet-gedestilleerde model. Pak dit bij de lastigste audio.

99talen

De model-ID’s verwijzen naar hun openbare repositories op Hugging Face. Parakeet, Canary, Cohere Transcribe en Whisper zijn handelsmerken van respectievelijk NVIDIA, Cohere en OpenAI. Beschikbaarheid en exacte versies kunnen veranderen naarmate de familie wordt bijgewerkt.

Hoe de familie samenwerkt

Een verstandige standaard, met ruimte als je die nodig hebt.

De meeste opnames hebben nooit meer nodig dan de standaard. Parakeet is snel, nauwkeurig en dekt de talen waarin het meeste gesproken video wordt gemaakt: bij een gewoon interview of een praatvideo werkt het gewoon.

Is een bestand ruisig, meertalig of in een taal buiten het bereik van de snelle modellen, dan wissel je bij het downloaden van model en draai je de transcriptie opnieuw. De montage, de knippen en de timing blijven intact.

LokaalElk model draait ter plekke. Audio verlaat je machine niet.
VerwisselbaarWissel per project van model en transcribeer ter plekke opnieuw.
Tot 99talen gedekt door de hele familie.
Betere woorden, betere montages

Transcriptie van het hoogste niveau,
op je eigen bureau.

Lokaal · geen account · geen upload