MP4 동영상을 텍스트로 변환하세요.오디오는 자동으로 추출됩니다.

MP4 파일을 그대로 드롭하면 — 오디오 트랙을 서버 측에서 추출한 후 타임스탬프가 있는 스크립트를 반환하고 YouTube, Vimeo, 또는 당신의 NLE로 바로 업로드할 수 있는 SRT를 제공합니다.

오디오 또는 비디오를 드롭하세요

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

브라우저에서 직접 녹음

가입은 30초면 충분합니다. 녹음은 가입 후 대시보드에서 바로 열립니다.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXT파일 24시간 내 자동 삭제

↓ 어떤 결과가 나오는지 보세요

MP4 들어오고. 스크립트 + SRT 나가고.

MP4는 컨테이너예요 — 오디오 스트림을 바로 읽어서 비디오를 다시 인코딩하지 않습니다. 타임스탬프는 원본 타임라인에 정확하게 유지되니까 SRT가 처음 가져올 때 바로 맞습니다.

training-module-04.mp4REC 1080p · 22:14 · 412 MB
auto-detected en-USAAC 48 kHz stereo · 192 kbps
~90s
스크립트 · 실시간95% 정확도
S1

좋아요, 이 모듈에서는 환불 워크플로우를 처음부터 끝까지 살펴볼 거예요.

S2

시작하기 전에 빠른 질문이 있는데 — 부분 환불에도 적용되나요?

S1

좋은 질문이네요. 부분 환불도 같은 화면을 쓰는데 다른 사유 코드를 사용합니다.

S2

알겠습니다. 그래도 승인 한도는 여전히 200달러인가요?

깨끗한 대화에서 95% 정확도SRT · VTT · DOCX · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

세 가지 실제 옵션 · 솔직한 비교

ffmpeg로 직접. 비디오 에디터. 또는 우리.

오디오를 직접 추출하고 Whisper를 실행할 수 있습니다. MP4를 Descript나 VEED로 끌어다 놓고 그들의 에디터 안에서 작업할 수도 있습니다. 또는 여기에 파일을 드롭하면 스크립트와 SRT를 받으면 되고, 에디터에 갇힐 필요가 없습니다.

Option 01

ffmpeg + Whisper

무료, 로컬, 까다로워요. 파이프라인과 그 안의 모든 버그를 당신이 소유합니다.

필요한 것CLI + 10 GB 모델 + GPU
화자 분리(Diarization)별도 도구 필요(pyannote)
SRT 출력네, 수동 플래그
1시간 MP4 처리 시간CPU에서 20–90분
멀티트랙 오디오직접 스트림 선택
비용$0 + 하드웨어 비용
Best for이미 로컬에서 Whisper를 실행 중이고 화자 분리를 직접 붙일 수 있는 엔지니어.
Option 02

Transcription.Solutions

MP4를 드롭하세요. 오디오 추출, 화자 분리, SRT, 요약 — 한 번에.

필요한 것브라우저, 그게 전부
화자 분리(Diarization)기본 포함, 모든 작업
SRT 출력소스에 프레임 정렬
1시간 MP4 처리 시간약 4분, 실시간 스트림
멀티트랙 오디오모든 스트림 나열
분당 비용$0.03
Best for비디오 에디터나 CLI를 배우지 않고도 텍스트와 SRT를 원하는 모든 MP4 사용자.
Option 03

Descript / VEED

MP4를 에디터에 불러오세요. 스크립트가 타임라인 UI의 일부로 나타납니다.

필요한 것계정 + 에디터 학습 곡선
화자 분리(Diarization)네, EN 튜닝됨
SRT 출력플랜 제한
업로드 제한5 GB (Descript 무료)
멀티트랙 오디오첫 번째 트랙만
비용$12–24/사용자/월
Best for같은 도구에서 비디오와 스크립트를 편집하려는 편집���.

가격 및 기능 제한은 2026년 기준 대략입니다. Descript와 VEED 티어 이름은 자주 변하니 최신 제한은 그들의 사이트를 확인하세요.

MP4에만 해당

세 가지. 일반 전사 도구에서 사람들이 헤매는

MP4는 코덱이 아니라 컨테이너고 — 대부분의 전사 도구는 그걸 하나의 오디오 덩어리로 처리합니다. 거기서 실수가 나옵니다.

잘못되는 것

  1. 1붐 마이크와 라벨이 있는 멀티트랙 MP4. 일반 도구는 트랙 1만 가져가고 나머지는 무시해서 더 깨끗한 마이크를 잃습니다. FCP와 Premiere 내보내기에서 흔합니다.
  2. 2블로그와 광고의 배경음악은 유령 단어를 유발합니다. 인식기가 음악 베드의 보컬을 전사하려고 합니다.
  3. 3SRT 타임스탐프 드리프트 — 도구가 들어오면서 비디오를 다시 인코딩할 때. 40분째엔 자막이 1초 어긋납니다.

여기서 바꿀 것

  1. 1업로드 — 모든 오디오 스트림을 검사하고 어느 스트림을 전사할지 선택합니다. 기본값은 가장 높은 비트레이트 트랙입니다.
  2. 2작업 양식에서 음악 억제를 켜세요. 음성 VAD에서 인식기를 게이팅하니까 기악 섹션은 비워집니다.
  3. 3우리는 비디오를 다시 인코딩하지 않습니다. 오디오는 기본 샘플레이트로 추출되고 타임스탐프는 컨테이너의 에디트 리스트를 참조합니다 — SRT는 프레임 정확합니다.

MP4에 권장되는 작업 설정

MP4를 드롭하면 이것들이 기본으로 켜집니다. 작업 양식에서 작업별로 무시할 수 있습니다.

오디오 추출
기본 샘플레이트, 다시 인코딩 없음
트랙 선택
가장 높은 비트레이트 ���트림
화자 분리(Diarization)
음향 기반 · 1–6명
음악 억제
블로그/광고 프리셋에서 켜짐
SRT 형식
≤42자/줄, 최대 2줄
내보내기
SRT · VTT · DOCX · 타임스탐프된 TXT

Accuracy · real-world numbers

깨끗한 촬영에서 95%. 오디오가 거슬릴 때도 솔직한 수치.

MP4 정확도는 코덱이 아니라 마이크로 결정됩니다. 조용한 스튜디오에서 라벨 마이크를 사용하는 게 4K 카메라 온보드 오디오보다 항상 낫습니다. 아래 수치는 실제 고객 MP4에서 나온 것으로 오디오를 캡처한 방식으로 정렬했습니다.

96%+
스튜디오 촬영, 라벨 또는 샷건 마이크

레이펠이나 붐을 레코더로, 48 kHz AAC 192+ kbps, 방음 처리된 공간. 최고의 경우입니다. 화자 표시는 두 명 촬영에서 완벽하게 작동합니다.

93%
DSLR 온카메라 샷건 마이크

카메라 상단 마이크 스피커로부터 2–4피트. 약간의 방음이지만 음성은 명확합니다. 대부분의 YouTube 크리에이터 영상이 여기에 해당합니다.

89%
USB 마이크로 화면 녹화

OBS, Loom, Camtasia 내보내기. 마이크는 가깝지만 방음이 안 됐고 종종 시스템 오디오 누수가 있습니다. 튜토리얼 스크립트에는 충분합니다.

84%
휴대폰 촬영 블로그, 내장 마이크

휴대폰 내장 마이크, 바람 또는 핸들링 노이즈, 샷마다 거리가 다릅니다. 말은 사용 가능한데 고유 명사는 분당 1–2개 수정을 예상하세요.

자주 묻는 질문

자주 묻는 8가지. MP4 전사에 관해

01비디오를 다시 인코딩하나요?+
아니요. MP4 컨테이너에서 오디오 스트림만 읽습니다. 비디오 스트림은 건드리지도 않고, 다시 인코딩하지도 않으며, 작업 완료 후 저장되지 않습니다 — 원본 파일은 그대로 유지됩니다.
02MP4 안의 어떤 코덱을 지원하나요?+
표준 H.264 + AAC가 일반적인 경우입니다. HEVC/H.265, MP4 속 ProRes, MP3, Opus, ALAC, PCM 오디오도 지원합니다. ffmpeg이 감지할 수 있으면 우리가 전사할 수 있습니다.
03파일 크기 제한은?+
웹 업로더에서 업로드당 10 GB, API를 통해 재개 가능한 청크로 50 GB까지. 일반적인 1시간 1080p MP4는 1–3 GB니까 대부분 파일이 웹 경로에 생각 없이 들어갑니다.
04SRT가 원본 비디오와 맞나요?+
네 — 타임스탐프는 MP4의 에디트 리스트와 기본 샘플레이트를 참조합니다. 다시 인코딩하지 않아서 드리프트가 없습니다. SRT를 MP4 옆에 드롭해서 아무 플레이어나 NLE에 넣으면 자막이 처음 로드에서 맞춰집니다.
05자막을 비디오에 합성할 수 있나요?+
우리 측에선 아니요 — SRT를 출력하고 합성은 에디터에 맡깁니다. ffmpeg 원라이너, HandBrake, Premiere, DaVinci, Kapwing 모두 우리가 만든 SRT를 받습니다. 우린 인코딩 도구까지 될 건 아닙니다.
06MOV, MKV, M4V, WebM은요?+
모두 같은 파이프라인으로 지원됩니다. 특히 MOV — 같은 MPEG-4 제품군, 동일한 추출 경로. 멀티트랙 오디오 MKV는 멀티트랙 MP4와 같은 스트림 선택 UI를 얻습니다.
07YouTube나 Vimeo URL을 그냥 보낼 수 있나요?+
YouTube는 네 — 업로드 화면에 공개 URL을 붙여 넣으면 MP4 다운로드 없이 오디오를 바로 가져옵니다. Vimeo는 플레이어가 스트림을 게이팅하니까 직접 파일이나 서명된 다운로드 링크가 필요합니다.
08음성 대사가 없고 음악이나 B롤만 있으면?+
VAD가 침묵 및 음악 전용 섹션을 감지해서 건너뛰니까 배경 영상에 비용을 내지 않습니다. 스크립트는 그 범위를 단어를 만드는 대신 `[음악]` 또는 `[음성 없음]`으로 표시합니다.

MP4를 드롭하세요. 스크립트와 SRT를 받으세요.

매월 무료 30분. 카드 필요 없음. 오디오는 서버 측에서 추출되고 화자 표시, 프레임 정확한 SRT — 모두 포함됩니다.

무료 시작