Parakeet TDT
기본 모델NVIDIAnvidia/parakeet-tdt-0.6b-v3기본 모델. 흐름 처리에 맞는 트랜스듀서로, 한 시간짜리 소리를 짧은 시간에 처리하고 낱말 단위 타임스탬프도 처음부터 갖추고 있습니다.
Token-and-Duration Transducer. 실시간 처리량을 위해 만들어졌습니다.
텍스트 기반 편집은 그 아래에 깔린 말의 정확도만큼만 좋습니다. Scenaristo 는 일급 음성 인식 모델을 소수만 골라 당신의 컴퓨터에서 돌립니다. 모두 낮은 단어 오류율, 빠른 처리, 그리고 모든 컷이 기대는 것, 정확한 낱말 단위 타이밍으로 골랐습니다.
이 모델들은 모두 앱에 실리기 전에 같은 세 가지 기준을 통과합니다.
잘못 받아쓴 말이 적으면 고칠 것도 적고, 글자를 지워서 편집할 만큼 믿을 수 있는 전사본이 됩니다.
WER 우선전사는 뒤에서 돌아가 금세 끝나므로, 긴 녹화도 커피 한 잔이 아니라 몇 분이면 편집에 들어갑니다.
실시간급모든 낱말이 저마다의 타임스탬프를 지닙니다. 그래서 한 문장을 지우면 화면이 깔끔한 경계에서 맞물립니다.
낱말마다 시각위로 갈수록 빠르고, 아래로 갈수록 지원 언어가 넓습니다. Scenaristo 는 기본으로 Parakeet 을 쓰고, 정확도나 흔치 않은 언어가 필요할 때 다른 것으로 바꿀 수 있게 합니다. 모든 모델은 필요할 때 내려받아 체크섬으로 고정하고 로컬에 저장하며, 두 번 받지 않습니다.
nvidia/parakeet-tdt-0.6b-v3기본 모델. 흐름 처리에 맞는 트랜스듀서로, 한 시간짜리 소리를 짧은 시간에 처리하고 낱말 단위 타임스탬프도 처음부터 갖추고 있습니다.
Token-and-Duration Transducer. 실시간 처리량을 위해 만들어졌습니다.
nvidia/canary-1b-v2속도보다 정확도가 먼저일 때. 무거운 모델로, 처리량을 조금 내주는 대신 조건이 나쁜 소리에서도 깨끗한 전사본을 돌려줍니다.
인코더가 더 크고, 이 가운데 단어 오류율이 가장 낮습니다.
CohereLabs/cohere-transcribe-03-2025균형 잡힌 선택지. 가장 많이 쓰는 언어에 집중하며, 타이밍과 문장 부호를 그대로 안정적으로 돌려줍니다.
주요 업무 언어의 또렷한 말에 강합니다.
openai/whisper-large-v3-turbo나머지 전부를 받는 자리. 빠른 모델이 지원하지 않는 언어라도 Whisper 라면 거의 확실히 되고, Turbo 면 짧은 시간에 끝납니다.
증류된 디코더. 정확도를 조금 내주는 대신 large-v3 보다 눈에 띄게 빠릅니다.
openai/whisper-large-v3Whisper 계열에서 가장 정확한 선택지. Turbo 보다 느리지만, 잡음이 많은 소리와 지원이 얇은 언어에서 가장 강합니다.
증류하지 않은 완전판. 가장 어려운 소리일 때 꺼내 쓰세요.
모델 식별자는 공개된 Hugging Face 저장소를 가리킵니다. Parakeet, Canary, Cohere Transcribe, Whisper 는 각각 NVIDIA, Cohere, OpenAI 의 상표입니다. 제공 상황과 정확한 버전은 이 모델들이 갱신되면서 달라질 수 있습니다.
대부분의 녹화는 기본 모델로 충분합니다. Parakeet 은 빠르고 정확하며 말하는 영상이 만들어지는 언어를 대체로 아우르므로, 보통의 대담이나 대담 영상이라면 그냥 잘됩니다.
잡음이 많거나, 여러 언어가 섞였거나, 빠른 모델의 범위 밖 언어라면 내려받을 때 모델을 바꿔 전사를 다시 돌리면 됩니다. 편집도 컷도 타이밍도 그대로 남습니다.