Familjen talmodeller

Fem talmodeller, en transkription.

Textbaserad klippning är aldrig bättre än orden under den. Scenaristo kör en liten familj av förstklassiga taligenkänningsmodeller på din egen dator, var och en vald för låg felfrekvens, snabb bearbetning och det som varje klipp hänger på: exakt tidsangivelse på ordnivå.

Vad vi väljer efter

Rätt ord, i rätt tid, lokalt.

Varje modell i familjen klarar samma tre krav innan den kommer med i programmet.

Låg felfrekvens

Färre feltranskriberade ord betyder färre rättelser, och en transkription du litar på tillräckligt för att klippa genom att ta bort text.

Felfrekvensen först

Snabb bearbetning

Transkriptionen går i bakgrunden och blir klar snabbt, så en lång inspelning går att klippa på minuter i stället för på kafferaster.

Realtidsklass

Tidsangivelse på ordnivå

Varje ord bär sin egen tidsstämpel. Det är det som gör att en borttagen mening sluter bilden på en ren gräns.

Tidsstämpel per ord
Sorterade efter hastighet

Välj den avvägning ditt ljud behöver.

Snabbast överst, bredast täckning underst. Scenaristo använder Parakeet som standard och låter dig gå över till de andra när precision eller ett ovanligare språk kräver det. Varje modell hämtas vid behov, låses med kontrollsumma, sparas lokalt och hämtas aldrig två gånger.

1.Snabbast

Parakeet TDT

StandardmodellNVIDIA
nvidia/parakeet-tdt-0.6b-v3

Standarden. En transduktor som passar löpande strömmar och klarar en timmes ljud på en bråkdel av tiden, med tidsstämplar per ord från början.

Token-and-Duration Transducer, byggd för genomströmning i realtid.

25språk
2.Mycket snabb

Canary

Val för precisionNVIDIA
nvidia/canary-1b-v2

När precisionen väger tyngre än ren hastighet. En tyngre modell som ger avkall på lite genomströmning för renare transkriptioner vid svårt ljud.

En större kodare, med familjens lägsta felfrekvens.

25språk
3.Snabb

Cohere Transcribe

Cohere Labs
CohereLabs/cohere-transcribe-03-2025

Ett balanserat val med fokus på de vanligaste språken, med pålitlig tidsangivelse och skiljetecken direkt.

Stark på tydligt tal i de stora arbetsspråken.

14språk
4.Bredast

Whisper Large v3 Turbo

Bredast täckningOpenAI
openai/whisper-large-v3-turbo

Reserven för allt annat. Är ditt ljud på ett språk som de snabba modellerna inte täcker gör Whisper det nästan säkert, och Turbo tar dig dit snabbt.

En destillerad avkodare, märkbart snabbare än large-v3 mot ett litet pris i precision.

99språk
5.Grundlig

Whisper Large v3

PrecisionsstegetOpenAI
openai/whisper-large-v3

Det mest precisa valet i Whisper-familjen. Långsammare än Turbo, men starkast vid brusigt ljud och vid de språk som täcks sämst.

Den fullständiga, odestillerade modellen. Ta fram den vid det svåraste ljudet.

99språk

Modell-id:na hänvisar till deras offentliga arkiv på Hugging Face. Parakeet, Canary, Cohere Transcribe och Whisper är varumärken som tillhör NVIDIA, Cohere respektive OpenAI. Tillgänglighet och exakta versioner kan ändras allteftersom familjen uppdateras.

Så samspelar familjen

En förnuftig standard, med marginal när du behöver den.

De flesta inspelningar behöver aldrig mer än standarden. Parakeet är snabb, precis och täcker de språk som det mesta av talad video görs på, så vid en vanlig intervju eller talvideo fungerar den bara.

Är en fil brusig, flerspråkig eller på ett språk utanför de snabba modellernas räckvidd byter du modell vid hämtningen och kör transkriptionen igen. Klippningen, klippen och tidsangivelserna står kvar.

LokaltVarje modell körs på plats. Ljudet lämnar inte din dator.
UtbytbarByt modell per projekt och transkribera om på plats.
Upp till 99språk som hela familjen täcker.
Bättre ord, bättre klippning

Transkription i toppklass,
på ditt eget skrivbord.

Lokalt · inget konto · ingen uppladdning