Whisper local / open source
GPU와 오후가 있으면 무료입니다. 기본적으로 화자 분리 없음.
MP3 파일을 64~320 kbps의 모든 비트레이트에서 사용할 수 있습니다. 99개 언어로 타임스탬프가 있는 스피커 라벨 필사본을 받으세요 — 형식 변환 없음, 재인코딩 없음, 대기열에서 기다릴 필요 없음.
↓ 어떤 결과물이 나오는지 확인해보세요
MP3 프레임 헤더를 직접 읽습니다 — VBR, CBR, joint-stereo, 모든 인코더(LAME, Fraunhofer, FFmpeg). 파일이 true stereo이고 화자가 별도 채널에 있으면 그것을 사용해서 음성을 분리합니다. Mono mix-down은 음향 화자 분리로 폴백합니다.
그래서 언제 아카이브가 불완전하다는 걸 깨달았어요?
아마 2019년쯤, 릴 투 릴을 디지털화하기 시작했을 때.
그리고 빠진 테이프들은 어디든 카탈로그되지 않았어요?
'78년 종이 인덱스가 있는데 절반이 물에 젖었어요.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
세 가지 실제 선택지 · 정직한 비교
기술 능력이 있다면 자신의 노트북에서 Whisper를 무료로 실행할 수 있습니다. Otter와 Sonix는 구독 대시보드 내에서 MP3 업로드를 허용합니다. 우리는 파일을 받아서 필사본을 반환하며 UI 안에서 살 필요가 없습니다.
GPU와 오후가 있으면 무료입니다. 기본적으로 화자 분리 없음.
MP3를 드롭합니다. 스피커 라벨이 있는 텍스트를 거의 실시간 × 0.025로 받습니다.
세련된 대시보드, 월간 분 제한, 영어 최적화. 파일 업로드는 부수 기능처럼 느껴집니다.
가격 및 기능 가용성은 2026년 5월 기준입니다. Whisper 성능은 모델 크기와 하드웨어에 따라 다릅니다.
MP3에만 해당
MP3는 녹음 스타일이 아닌 포맷입니다 — 즉, 실패 모드는 음성이 아닌 인코더에서 나옵니다.
~80%의 MP3 파일에 맞는 기본값. 양식에서 작업당 재정의합니다.
Accuracy · real-world numbers
MP3 정확도는 인코더가 유지한 것으로 제한되며, 우리가 아닙니다. ~96 kbps 이상의 지각적 압축은 음성 명확성을 매우 잘 보존합니다. 64 kbps 미만에서는 시빌런트와 자음이 녹기 시작합니다. 아래 숫자는 실제 고객 MP3의 프로덕션 데이터입니다.
음성에 대해 거의 무손실입니다. 팟캐스트 마스터, 받아쓰기 앱 내보내기, 전문 인터뷰 리그. 스피커가 별도 채널에 있으면 화자 분리가 깔끔합니다.
음성 MP3의 가장 일반적인 비트레이트. Zoom 내보내기, Riverside 다운로드, 음성 레코더 기본값. 압축 아티팩트는 인식기에서 들을 수 없습니다.
대부분의 휴대폰에서 음성 메모 기본값. 음향 화자 분리는 2-4명의 화자를 처리합니다. 숫자와 고유 명사는 때때로 확인이 필요합니다.
오래된 응답 장치 추출, 강의 아카이브, 좁은 대역 소스. 고주파 자음(f/s/sh)이 흐릿합니다. 여전히 읽을 수 있습니다 — 교정을 계획하세요.
자주 묻는 질문