Familien af talemodeller

Fem talemodeller, én transskription.

Tekstbaseret klipning er kun så god som ordene under den. Scenaristo kører en lille familie af førsteklasses talegenkendelsesmodeller på din egen maskine, hver valgt på lav fejlrate, hurtig behandling og det som hvert klip afhænger af: præcis tidsangivelse på ordniveau.

Det vi vælger efter

Rigtige ord, til tiden, lokalt.

Alle modeller i familien klarer de samme tre krav, før de kommer med i programmet.

Lav fejlrate

Færre fejl i transskriptionen betyder færre rettelser og en transskription du stoler nok på til at klippe ved at slette tekst.

Fejlraten først

Hurtig behandling

Transskriptionen kører i baggrunden og bliver hurtigt færdig, så en lang optagelse kan klippes på minutter og ikke på kaffepauser.

Realtidsklassen

Tidsangivelse på ordniveau

Hvert ord har sit eget tidsstempel. Det er det der får en slettet sætning til at lukke optagelsen på en ren grænse.

Tidsstempel per ord
Sorteret efter hastighed

Vælg det kompromis din lyd har brug for.

Hurtigst øverst, bredest dækning nederst. Scenaristo bruger Parakeet som standard og lader dig gribe efter de andre, når præcision eller et sjældnere sprog kræver det. Hver model hentes efter behov, låses med tjeksum, gemmes lokalt og hentes aldrig to gange.

1.Hurtigst

Parakeet TDT

StandardmodelNVIDIA
nvidia/parakeet-tdt-0.6b-v3

Standarden. En transducer der er god til løbende strømme og klarer en times lyd på en brøkdel af tiden, med tidsstempler per ord fra start.

Token-and-Duration Transducer, bygget til behandling i realtid.

25sprog
2.Meget hurtig

Canary

Valg efter præcisionNVIDIA
nvidia/canary-1b-v2

Når præcision vejer tungere end ren hastighed. En tungere model der giver lidt afkald på hastighed til gengæld for renere transskriptioner ved svær lyd.

En større encoder, med familiens laveste fejlrate.

25sprog
3.Hurtig

Cohere Transcribe

Cohere Labs
CohereLabs/cohere-transcribe-03-2025

Et afbalanceret valg med fokus på de mest udbredte sprog, med pålidelig tidsangivelse og tegnsætning fra start.

Stærk ved klar tale på de store arbejdssprog.

14sprog
4.Bredest

Whisper Large v3 Turbo

Bredeste dækningOpenAI
openai/whisper-large-v3-turbo

Reserven til alt det andet. Er din lyd på et sprog de hurtige modeller ikke dækker, dækker Whisper det næsten med sikkerhed, og Turbo bringer dig hurtigt derhen.

En destilleret dekoder, mærkbart hurtigere end large-v3 mod en lille pris i præcision.

99sprog
5.Grundig

Whisper Large v3

PræcisionstrinnetOpenAI
openai/whisper-large-v3

Det mest præcise valg i Whisper-familien. Langsommere end Turbo, men stærkest ved støjende lyd og ved de sprog der er dårligst dækket.

Den fulde, udestillerede model. Grib den ved den sværeste lyd.

99sprog

Model-id’erne henviser til deres offentlige arkiver på Hugging Face. Parakeet, Canary, Cohere Transcribe og Whisper er varemærker tilhørende henholdsvis NVIDIA, Cohere og OpenAI. Tilgængelighed og præcise versioner kan ændre sig, efterhånden som familien opdateres.

Sådan spiller familien sammen

En fornuftig standard, med luft når du har brug for den.

De fleste optagelser har aldrig brug for mere end standarden. Parakeet er hurtig, præcis og dækker de sprog som det meste talte video laves på, så ved det typiske interview eller den typiske talevideo virker den bare.

Er en fil støjende, flersproget eller på et sprog uden for de hurtige modellers rækkevidde, kan du skifte model ved hentningen og køre transskriptionen igen. Klipningen, klippene og tidsangivelserne bliver som de var.

LokaltAlle modeller kører på stedet. Lyden forlader ikke din maskine.
UdskifteligSkift model fra projekt til projekt, og transskribér igen på stedet.
Op til 99sprog dækket af hele familien.
Bedre ord, bedre klipning

Transskription i topklasse,
på dit eget skrivebord.

Lokalt · ingen konto · ingen upload