La famille de modèles vocaux

Cinq modèles vocaux, une transcription.

Le montage par le texte ne vaut que ce que valent les mots en dessous. Scenaristo fait tourner sur votre propre machine une petite famille de modèles de reconnaissance vocale de premier plan, chacun choisi pour un faible taux d’erreur, un traitement rapide et ce dont dépend chaque coupe : un horodatage au mot précis.

Nos critères

Des mots justes, à l’heure, en local.

Chaque modèle de la famille franchit les trois mêmes barres avant d’entrer dans l’application.

Faible taux d’erreur

Moins d’erreurs de transcription, c’est moins de corrections, et une transcription assez fiable pour monter en supprimant du texte.

Le taux d’abord

Traitement rapide

La transcription tourne en arrière-plan et se termine vite : un long enregistrement devient montable en quelques minutes, pas en quelques pauses café.

Classe temps réel

Horodatage au mot

Chaque mot porte son propre horodatage. C’est ce qui permet à une phrase supprimée de refermer l’image sur une frontière nette.

Horodatage par mot
Classés par vitesse

Choisissez le compromis qu’exige votre audio.

Le plus rapide en haut, la couverture la plus large en bas. Scenaristo utilise Parakeet par défaut et vous laisse passer aux autres quand la précision ou une langue plus rare l’exige. Chaque modèle se télécharge à la demande, figé par somme de contrôle, stocké en local, jamais récupéré deux fois.

n°1Le plus rapide

Parakeet TDT

Modèle par défautNVIDIA
nvidia/parakeet-tdt-0.6b-v3

Le modèle par défaut. Un transducteur adapté au flux continu, qui traite une heure d’audio en une fraction du temps, horodatage au mot compris d’emblée.

Token-and-Duration Transducer, conçu pour le débit en temps réel.

25langues
n°2Très rapide

Canary

Choix précisionNVIDIA
nvidia/canary-1b-v2

Quand la précision compte plus que la vitesse brute. Un modèle plus lourd, qui échange un peu de débit contre des transcriptions plus propres sur un audio difficile.

Un encodeur plus grand, pour le taux d’erreur le plus bas de la famille.

25langues
n°3Rapide

Cohere Transcribe

Cohere Labs
CohereLabs/cohere-transcribe-03-2025

Une option équilibrée, centrée sur les langues les plus courantes, avec une temporisation et une ponctuation fiables d’emblée.

Solide sur la parole claire dans les grandes langues de travail.

14langues
n°4Le plus large

Whisper Large v3 Turbo

Couverture maximaleOpenAI
openai/whisper-large-v3-turbo

Le recours pour tout le reste. Quand votre audio est dans une langue que les modèles rapides ne couvrent pas, Whisper la couvre presque à coup sûr, et Turbo vous y amène vite.

Un décodeur distillé, nettement plus rapide que large-v3 pour un léger coût en précision.

99langues
n°5Minutieux

Whisper Large v3

Palier précisionOpenAI
openai/whisper-large-v3

L’option la plus précise de la famille Whisper. Plus lente que Turbo, mais la plus solide sur un audio bruité et sur les langues moins bien couvertes.

Le modèle complet, non distillé. À sortir pour l’audio le plus difficile.

99langues

Les identifiants de modèles renvoient à leurs dépôts publics sur Hugging Face. Parakeet, Canary, Cohere Transcribe et Whisper sont des marques de NVIDIA, Cohere et OpenAI respectivement. La disponibilité et les versions exactes peuvent changer au fil des mises à jour de la famille.

Comment la famille s’articule

Un défaut sensé, avec de la marge au besoin.

La plupart des enregistrements n’ont jamais besoin de plus que le modèle par défaut. Parakeet est rapide, précis et couvre les langues dans lesquelles se fait l’essentiel de la vidéo parlée : pour un entretien ou un plan face caméra ordinaire, il fait simplement le travail.

Quand un fichier est bruité, multilingue ou dans une langue hors de portée des modèles rapides, vous pouvez changer de modèle au téléchargement et relancer la transcription. Le montage, les coupes et la temporisation restent intacts.

En localChaque modèle tourne sur place. L’audio ne quitte pas votre machine.
InterchangeableChangez de modèle par projet et relancez la transcription sur place.
Jusqu’à 99langues couvertes par l’ensemble de la famille.
De meilleurs mots, de meilleurs montages

Une transcription de pointe,
sur votre bureau.

En local · sans compte · sans envoi