Transcreva arquivos de áudio longo.Até 10 horas. Sem timeout.

Solte um arquivo de áudio longo — até 10 horas, 5 GB no Business. Dividimos em paralelo, mantemos IDs de orador consistentes de ponta a ponta e devolvemos um único arquivo em vez de uma pasta numerada.

Solte seu áudio ou vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Grave direto do navegador

O cadastro leva 30 segundos — a gravação abre logo em seguida, no painel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTArquivos apagados automaticamente em 24h

↓ Um arquivo de 5 horas, meio da transcrição

Horas dentro. Um arquivo limpo sai.

A maioria das ferramentas expira em torno da marca de 90 minutos ou divide seu arquivo de longa duração em partials numerados que você precisa costurar. Dividimos em janelas sobrepostas de 12 minutos, processamos em paralelo e remontamos com uma passagem global de orador.

Sessão de estratégia de diretoriaREC 3 oradores · 5:14:22 · 3.1 GB
detectado automaticamente en-GB44.1 kHz estéreo · 192 kbps
~90s
Transcrição · arquivo único92% de precisão · t=3:14:08
S1

Estamos com três horas — vamos retomar o ponto da cadeia de suprimentos da sessão matinal.

S2

Certo, a mudança de manufatura do Vietnã. Acho que negligenciamos o risco de prazo de entrega.

S1

Os prazos de entrega aumentaram de 14 para 31 dias após a mudança de tarifa.

S3

E isso é antes de considerarmos o congestionamento portuário em Long Beach.

92% em todo o arquivo de 5hDOCX · SRT · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Três opções reais · comparação honesta

Otter Pro. Chunking DIY Whisper. Ou nós.

Ferramentas de consumidor limitam o comprimento do arquivo e truncam silenciosamente. A API Whisper tem um limite de 25 MB por solicitação, então você constrói o chunker você mesmo. Aceitamos o arquivo de 10 horas inteiro e devolvemos uma transcrição.

Option 01

Otter Pro

Limita arquivos longos a 4 horas por gravação. Rótulos de orador se desviam após a marca de 2 horas.

Comprimento máximo de arquivo4 horas (nível Pro)
Tamanho máximo de arquivo~1.5 GB de upload
IDs de orador de ponta a pontaSe desvia após 2 horas
Saída de arquivo longoDocumento único, truncado no limite
Custo$16,99/usuário/mês
Upload retomávelNão
Best forReuniões curtas com menos de 2 horas. Falha em gravações de dia inteiro.
Option 02

Transcription.Solutions

10 horas por arquivo. Chunking paralelo, passagem global de orador, um DOCX sai.

Comprimento máximo de arquivo10 horas (Pro & Business)
Tamanho máximo de arquivo2 GB Pro · 5 GB Business
IDs de orador de ponta a pontaPassagem de embedding global
Saída de arquivo longoArquivo único · DOCX/SRT/TXT
Custo · por minuto$0,03 fixo independentemente do comprimento
Upload retomávelMultipart, sobrevive a quedas
Best forWorkshops de dia inteiro, depoimentos, reuniões de diretoria, histórias orais — qualquer coisa após a barreira de 90 minutos.
Option 03

Whisper API + chunking DIY

Mais barato por minuto. Você constrói o chunker, a costura de orador e a lógica de repetição.

Comprimento máximo de arquivo25 MB por solicitação (~25 min)
Tamanho máximo de arquivoLimite fixo de 25 MB
IDs de orador de ponta a pontaNenhum — sem diarização
Saída de arquivo longoPartials numerados, você costura
Custo · por minuto$0,006 (OpenAI Whisper)
Tempo de engenhariaHoras a dias por pipeline
Best forEngenheiros que querem texto bruto por pedaço e não precisam de oradores, resumos ou uma saída única.

Preços e limites precisos em maio de 2026. Limite de comprimento do Otter Pro verificado pela última vez em sua página de preços pública.

Específico para arquivos longos

Três formas pelas quais ferramentas genéricas morrem após a marca de 90 minutos.

A maioria dos pipelines foi construída para reuniões de uma hora. Áudio longo os quebra de maneiras previsíveis — aqui está o que fazemos de forma diferente.

O que dá errado

  1. 1Timeout silencioso aos 90 minutos. O trabalho gira por uma hora, depois morre sem um erro útil. Você fica sem nada para repetir.
  2. 2IDs de orador se desviam entre pedaços. Orador 1 na hora 1 se torna Orador 4 na hora 3 porque cada pedaço é diarizado isoladamente.
  3. 3A saída é uma pasta numerada. `transcript_part_01.txt` até `transcript_part_24.txt` com resets de marca de tempo em cada limite de pedaço. Você a costura você mesmo.

O que fazer diferente

  1. 1Upload multipart retomável. A conexão cai na hora 2 do upload? Retoma a partir da última parte concluída. Sem re-upload de 4 GB.
  2. 2Passagem de embedding global de orador. Após a diarização por pedaço, agrupamos vozes em todo o arquivo para que Orador 3 seja a mesma pessoa no minuto 12 e no minuto 487.
  3. 3DOCX único com marcadores de hora. Um arquivo, marcas de tempo contínuas, quebra de capítulo opcional a cada 60 minutos. Sem costura.

Configurações de trabalho recomendadas para arquivos longos

Solte qualquer coisa acima de 90 minutos e essas se ativam automaticamente. Substitua por trabalho no formulário.

Estratégia de chunking
Janelas de 12 min · sobreposição 10s
Diarização
Passagem global em todos os pedaços
Modelo de orador
Formato longo · 2-20 oradores
Upload
Multipart retomável
Fila
Prioridade (plano Business)
Exportação
DOCX único · marcadores de hora ativados

Accuracy · real-world numbers

92% se mantém em um arquivo de 5 horas. A qualidade permanece plana hora após hora.

A parte difícil com áudio longo não é o modelo — é manter a precisão plana do minuto 1 ao minuto 600. Desvio de orador e erros de limite de pedaço são o que mata a maioria dos pipelines. Os números abaixo são medidos em arquivos de cliente de comprimento completo, não nos primeiros 10 minutos.

95%
Estúdio, formato longo, orador único

Narração de audiolivro, podcast solo, manuscrito ditado. 6-10 horas de voz limpa sem ruído de ambiente. Nenhuma diarização necessária.

92%
Sala de reunião, 2-6 oradores

Mesa de conferência, microfone decente, 3-5 horas. A passagem global de orador mantém IDs estáveis em todo o arquivo.

88%
Workshop de dia inteiro, microfones lapela

Dia de treinamento de 7-9 horas com handoff de microfone e perguntas do público. Os nomes precisam de uma passagem de 5 minutos nos chips de orador.

82%
Mesa redonda em campo, 8+ oradores

História oral longa, grupo focal ou painel com vozes sobrepostas e ruído ambiente. Usável, mas espere limpeza.

Perguntas comuns

8 coisas que as pessoas perguntam sobre transcrição de áudio longo.

01Qual é o limite real de comprimento e tamanho de arquivo?+
10 horas por arquivo em Pro e Business. Pro limita o tamanho do arquivo a 2 GB, Business a 5 GB. Se você tiver algo mais longo que 10 horas, divida uma vez em uma quebra natural — manteremos IDs de orador consistentes se você os fizer upload novamente no mesmo projeto.
02Obtenho uma transcrição ou uma pasta de partials numerados?+
Um arquivo. Sempre. DOCX, SRT, TXT ou JSON — sua escolha. As marcas de tempo correm continuamente de 00:00:00 até o final da gravação, não resetam em cada limite de pedaço.
03Quanto tempo um arquivo de 6 horas leva para volta?+
Aproximadamente 18-25 minutos na fila Pro, 8-12 no Business com prioridade. Processamos os pedaços de 12 minutos em paralelo, então o tempo de parede escala sub-linearmente com o comprimento do arquivo, não minuto a minuto.
04Os IDs de orador permanecem consistentes de ponta a ponta?+
Sim. Após a diarização por pedaço, uma passagem de embedding global agrupa vozes em todo o arquivo. Orador 3 no minuto 12 é o mesmo Orador 3 no minuto 487. É isso que a maioria dos pipelines DIY Whisper fazem errado.
05O que acontece se meu upload cair na hora 3 de um arquivo de 4 GB?+
Upload multipart retomável pega de onde parou na última parte concluída. Você não re-faz upload dos primeiros 3 GB. Funciona em Wi-Fi de hotel instável e ligação por tethering celular — testamos ambos.
06Por que a API Whisper falha em arquivos longos?+
O ponto final Whisper do OpenAI tem um limite fixo de 25 MB por solicitação — aproximadamente 25 minutos de áudio comprimido. Qualquer coisa mais longa precisa que você divida em pedaços, transcreva em paralelo e costure transcrições e alinhe oradores você mesmo. Fazemos tudo isso no lado do servidor.
07O preço por minuto é o mesmo em um arquivo de 10 horas e um de 10 minutos?+
Sim. $0,03 por minuto fixo, independentemente do comprimento. Um arquivo de 10 horas custa $18. Não temos preço premium em arquivos longos como Rev faz ($1,50/min humano × 10 horas = $900).
08Posso obter marcadores de capítulo ou marcas de tempo a cada hora?+
Ative 'Marcadores de hora' no formulário de trabalho e o DOCX exporta com quebra de heading a cada 60 minutos. SRT mantém timecode contínuo. JSON tem ambos — matriz de capítulo mais marcas de tempo em nível de palavra.

Solte seu arquivo longo. Obtenha uma transcrição de volta.

30 minutos grátis por mês. Sem cartão. Arquivos até 10 horas, rótulos de orador que permanecem consistentes, exportação de arquivo único.

Comece grátis