Transcribe ficheiros de audio longos.Ata 10 horas. Sen timeout.

Solta un ficheiro de audio longo — ata 10 horas, 5 GB en Business. Segmentamos en paralelo, mantemos os IDs de parlante consistentes de extremo a extremo e devolveches un transcripto en lugar dunha carpeta numerada.

Solta o teu audio ou vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Grava directamente desde o navegador

O rexistro lévache 30 segundos — a gravaciónel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTOs ficheiros bórranse en 24 h

↓ Un ficheiro de 5 horas, no medio da transcripción

Horas dentro. Un ficheiro limpo fóra.

A maioría de ferramentas caduca arredor dos 90 minutos ou divide o teu gravación longa en parciais numeradas que tes que unir. Segmentamos en ventás sobrepostas de 12 minutos, procesamos en paralelo e reensamblamos cun paso de parlante global.

Sesión de estratexia de directivaREC 3 parlantes · 5:14:22 · 3.1 GB
en-GB detectado automaticamente44.1 kHz estéreo · 192 kbps
~90s
Transcripto · ficheiro único92% precisión · t=3:14:08
S1

Levamos tres horas — volvamos á cuestión da cadea de subministración da sesión da mañá.

S2

Certo, o xiro de fabricación en Vietnam. Creo que pasamos por alto o risco dos prazos de entrega.

S1

Os prazos de entrega pasaron de 14 a 31 días despois da mudanza de aranceles.

S3

E iso antes de contar a congestión portuaria en Long Beach.

92% en todo o ficheiro de 5hDOCX · SRT · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Tres opcións reais · comparación honesta

Otter Pro. Segmentación manual con Whisper. Ou nós.

As ferramentas de consumo limitan a duración do ficheiro e truncan en silencio. Whisper API ten un límite de 25 MB por solicitude, así que ti constrúes o segmentador. Aceptamos o ficheiro completo de 10 horas e devolveches un transcripto.

Option 01

Otter Pro

Limita ficheiros longos a 4 horas por gravación. As etiquetas de parlante quedan irregulares despois dos 2 minutos.

Duración máxima do ficheiro4 horas (nivel Pro)
Tamaño máximo do ficheiro~1.5 GB carga
IDs de parlante de extremo a extremoQuedan irregulares despois de 2 horas
Saída de ficheiro longoDocumento único, truncado no límite
Custo$16.99/usuario/mes
Carga reanudableNon
Best forReunións curtas de menos de 2 horas. Falla en gravacións de día completo.
Option 02

Transcription.Solutions

10 horas por ficheiro. Segmentación en paralelo, paso de parlante global, un DOCX de saída.

Duración máxima do ficheiro10 horas (Pro e Business)
Tamaño máximo do ficheiro2 GB Pro · 5 GB Business
IDs de parlante de extremo a extremoPaso de incorporación global
Saída de ficheiro longoFicheiro único · DOCX/SRT/TXT
Custo · por minuto$0.03 plano independentemente da duración
Carga reanudableMultiparte, resiste caídas
Best forTalleres de día completo, deposicións, reunións de directiva, historias orais — calquera cousa máis alá da barreira dos 90 minutos.
Option 03

Whisper API + segmentación manual

Máis barato por minuto. Ti constrúes o segmentador, a unión de parlantes e a lóxica de reintentos.

Duración máxima do ficheiro25 MB por solicitude (~25 min)
Tamaño máximo do ficheiroLímite fixo de 25 MB
IDs de parlante de extremo a extremoNingún — sen diarización
Saída de ficheiro longoParciais numeradas, ti unes
Custo · por minuto$0.006 (OpenAI Whisper)
Tempo de enxeñaríaHoras a días por pipeline
Best forEnxeñeiros que queren texto en bruto por fragmento e non precisan parlantes, resumos ou unha única saída.

Os precios e límites son precisos a partir de maio de 2026. O límite de duración de Otter Pro verificouse por última vez na súa páxina de prezo público.

Específico para ficheiros longos

Tres formas nas que as ferramentas xenéricas morren máis alá dos 90 minutos.

A maioría de pipelines construíronse para reunións dun hora. O audio longo rómpeas de formas predecibles — aquí está o que facemos diferente.

O que sae mal

  1. 1Timeout silencioso aos 90 minutos. O traballo xira durante unha hora, despois morre sen un erro útil. Quedas sen nada para reintentar.
  2. 2Os IDs de parlante quedan irregulares entre fragmentos. O parlante 1 na hora 1 convértese en Parlante 4 na hora 3 porque cada fragmento se diariza en illamento.
  3. 3A saída é unha carpeta numerada. `transcript_part_01.txt` a través de `transcript_part_24.txt` con reinicio de marca temporal en cada límite de fragmento. Ti unes.

O que inverter aquí

  1. 1Carga multiparte reanudable. A conexión cae na hora 2 de carga? Resumes a partir da última parte completada. Sen recarga dos 4 GB.
  2. 2Paso de incorporación de parlante global. Despois da diarización por fragmento, agrupamos voces en todo o ficheiro para que o Parlante 3 sexa a mesma persoa no minuto 12 e no minuto 487.
  3. 3Un DOCX único con marcadores de hora. Un ficheiro, marcas temporais continuas, parada de capítulo opcional cada 60 minutos. Sen unión.

Configuración de traballo recomendada para ficheiros longos

Solta calquera cousa por riba de 90 minutos e estas actívanse automaticamente. Anula por traballo desde o formulario.

Estratexia de segmentación
Ventás de 12 min · overlap de 10s
Diarización
Paso global en todos os fragmentos
Modelo de parlante
Forma longa · 2-20 parlantes
Carga
Multiparte reanudable
Cola
Prioritaria (plan Business)
Exportación
DOCX único · marcadores de hora activados

Accuracy · real-world numbers

O 92% mantense nas 5 horas. A calidade non varía hora a hora.

O difícil coa audio longa non é o modelo — é manter a precisión plana desde o minuto 1 ata o minuto 600. A desviaciónn de parlante e os erros de límite de fragmento son o que matan a maioría de pipelines. Os números seguintes mídense en ficheiros de clientes de duración completa, non só nos primeiros 10 minutos.

95%
Forma longa de estudio, un único parlante

Narración de audiolibro, podcast individual, manuscrito ditado. 6-10 horas de voz limpa sen ruído ambiental. Non se precisa diarización.

92%
Sala de xunta, 2-6 parlantes

Mesa de conferencia, micrófono decente, 3-5 horas. O paso de parlante global mantén os IDs estables en todo o ficheiro.

88%
Obradoiro de día completo, micrófonos lapela

Día de formación de 7-9 horas con transferencia de micrófono e preguntas do público. Os nomes precisan un paso de 5 minutos nos chips de parlante.

82%
Mesa redonda de campo, 8+ parlantes

Historia oral longa, grupo focal ou panel con voces sobrepostas e ruído ambiental. Usable, pero espera limpeza.

Preguntas comúns

8 cousas que a xente pregunta sobre a transcripción de audio longo.

01Cal é o límite real de duración e tamaño do ficheiro?+
10 horas por ficheiro en Pro e Business. Pro limita o tamaño do ficheiro a 2 GB, Business a 5 GB. Se tes algo máis longo de 10 horas, divídeo dunha vez nun descanso natural — manteremos os IDs de parlante consistentes se os cargas de volta a trás no mesmo proxecto.
02Obteño un transcripto ou unha carpeta de parciais numeradas?+
Un ficheiro. Sempre. DOCX, SRT, TXT ou JSON — a túa opción. As marcas temporais corren continuamente desde 00:00:00 ata o final da gravación, non se restablecen en cada límite de fragmento.
03Canto tarda un ficheiro de 6 horas en volver?+
Aproximadamente 18-25 minutos na cola de Pro, 8-12 en prioridade de Business. Procesamos os fragmentos de 12 minutos en paralelo, así que o tempo de reloxo escálase sublinealmente coa duración do ficheiro, non minuto a minuto.
04Os IDs de parlante permanecen consistentes de extremo a extremo?+
Si. Despois da diarización por fragmento, un paso de incorporación global agrupa voces en todo o ficheiro. O parlante 3 no minuto 12 é o mesmo parlante 3 no minuto 487. Isto é o principal que os pipelines manuais con Whisper fan mal.
05Que ocorre se a miña carga cae na hora 3 dun ficheiro de 4 GB?+
A carga multiparte reanudable recupérase a partir da última parte completada. Non recarga os primeiros 3 GB. Funciona en Wi-Fi de hotel inestable e tethering por redes móbiles — probamos ambas.
06Por que Whisper API afoguea con ficheiros longos?+
O punto final Whisper de OpenAI ten un límite fixo de 25 MB por solicitude — aproximadamente 25 minutos de audio comprimido. Calquera cousa máis longa necesita que fragmentes, transcribas en paralelo e despois unas transcripcións e alinear parlantes ti mesmo. Facemos todo iso no servidor.
07O prezo por minuto é o mesmo nun ficheiro de 10 horas que nun ficheiro de 10 minutos?+
Si. $0.03 por minuto plano, independentemente da duración. Un ficheiro de 10 horas custa $18. Non cobramos de máis ficheiros longos do xeito que Rev fai ($1.50/min humano × 10 horas = $900).
08Podo obter marcadores de capítulo ou marcas temporais cada hora?+
Activa 'Marcadores de hora' no formulario de traballo e o DOCX exporta coa parada de encabezamento cada 60 minutos. SRT mantén código de tempo continuo. JSON ten ambos — matriz de capítulo máis marcas temporais de nivel de palabra.

Solta o teu ficheiro longo. Obtén un transcripto de volta.

30 minutos gratis cada mes. Sen tarxeta. Ficheiros ata 10 horas, etiquetas de parlante que permanecen consistentes, exportación de ficheiro único.

Comeza gratuitamente