La familia de modelos de voz

Cinco modelos de voz, una transcripción.

El montaje basado en texto vale lo que valen las palabras que hay debajo. Scenaristo ejecuta en tu propio equipo una pequeña familia de modelos de reconocimiento de voz de primer nivel, cada uno elegido por su baja tasa de error, su rapidez y aquello de lo que depende cada corte: una sincronía por palabra precisa.

Qué buscamos

Palabras exactas, a tiempo, en local.

Todos los modelos de la familia superan los mismos tres listones antes de entrar en la aplicación.

Baja tasa de error

Menos errores de transcripción significa menos correcciones y una transcripción lo bastante fiable para montar eliminando texto.

La tasa primero

Rapidez

La transcripción va en segundo plano y termina pronto, así una grabación larga se puede montar en minutos, no en pausas para el café.

Clase tiempo real

Sincronía por palabra

Cada palabra lleva su propia marca de tiempo. Eso es lo que permite que una frase eliminada cierre la imagen en un límite limpio.

Marca por palabra
Ordenados por velocidad

Elige el equilibrio que pide tu audio.

El más rápido arriba, la cobertura más amplia abajo. Scenaristo usa Parakeet por defecto y te deja pasar a los demás cuando hace falta precisión o un idioma más raro. Cada modelo se descarga a demanda, fijado por suma de comprobación, guardado en local y nunca descargado dos veces.

1.El más rápido

Parakeet TDT

Modelo predeterminadoNVIDIA
nvidia/parakeet-tdt-0.6b-v3

El predeterminado. Un transductor pensado para el flujo continuo, que resuelve una hora de audio en una fracción del tiempo, con marcas de tiempo por palabra ya incluidas.

Token-and-Duration Transducer, construido para el rendimiento en tiempo real.

25idiomas
2.Muy rápido

Canary

Opción por precisiónNVIDIA
nvidia/canary-1b-v2

Cuando la precisión importa más que la velocidad pura. Un modelo más pesado que cede algo de rendimiento a cambio de transcripciones más limpias en audio difícil.

Un codificador mayor, para la tasa de error más baja del conjunto.

25idiomas
3.Rápido

Cohere Transcribe

Cohere Labs
CohereLabs/cohere-transcribe-03-2025

Una opción equilibrada, centrada en los idiomas más habituales, con sincronía y puntuación fiables de serie.

Sólido con habla clara en los principales idiomas de trabajo.

14idiomas
4.El más amplio

Whisper Large v3 Turbo

Mayor coberturaOpenAI
openai/whisper-large-v3-turbo

El recurso para todo lo demás. Cuando tu audio está en un idioma que los modelos rápidos no cubren, Whisper casi seguro sí, y Turbo te lleva allí deprisa.

Un decodificador destilado, bastante más rápido que large-v3 a cambio de un pequeño coste en precisión.

99idiomas
5.Minucioso

Whisper Large v3

Escalón de precisiónOpenAI
openai/whisper-large-v3

La opción más precisa de la familia Whisper. Más lenta que Turbo, pero la más sólida con audio ruidoso y con los idiomas menos cubiertos.

El modelo completo, sin destilar. Para el audio más difícil.

99idiomas

Los identificadores de modelo remiten a sus repositorios públicos en Hugging Face. Parakeet, Canary, Cohere Transcribe y Whisper son marcas de NVIDIA, Cohere y OpenAI respectivamente. La disponibilidad y las versiones exactas pueden cambiar según se actualiza la familia.

Cómo encaja la familia

Un valor por defecto sensato, con margen cuando hace falta.

La mayoría de las grabaciones no necesitan más que el modelo por defecto. Parakeet es rápido, preciso y cubre los idiomas en los que se hace casi todo el vídeo hablado: para la entrevista o el plano a cámara típico, sencillamente funciona.

Cuando un archivo tiene ruido, mezcla idiomas o está en uno fuera del alcance de los modelos rápidos, puedes cambiar de modelo en la descarga y repetir la transcripción. El montaje, los cortes y la sincronía se mantienen intactos.

En localTodos los modelos se ejecutan en el sitio. El audio no sale de tu equipo.
IntercambiableCambia de modelo por proyecto y vuelve a transcribir sobre la marcha.
Hasta 99idiomas cubiertos por toda la familia.
Mejores palabras, mejores montajes

Transcripción de última generación,
en tu escritorio.

En local · sin cuenta · sin subidas