Transcreva arquivos de áudio longos.Até 10 horas. Sem tempo limite.

Envie um arquivo de áudio longo — até 10 horas, 5 GB em Business. Dividimos em paralelo, mantemos IDs de falantes consistentes de ponta a ponta e entregamos uma transcrição em vez de uma pasta numerada.

Solte seu áudio ou vídeo

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Grave diretamente do seu navegador

O cadastro leva 30 segundos — a gravação abre logo após, no painel.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTArquivos são excluídos automaticamente em 24h

↓ Um arquivo de 5 horas, no meio da transcrição

Horas dentro. Um arquivo limpo sai.

A maioria das ferramentas atinge o tempo limite em torno dos 90 minutos ou divide sua gravação longa em partes numeradas que você tem que unir. Dividimos em janelas de 12 minutos com sobreposição, processamos em paralelo e remontamos com uma passagem global de falante.

Sessão de estratégia do conselhoREC 3 falantes · 5:14:22 · 3.1 GB
auto-detectado en-GB44.1 kHz estéreo · 192 kbps
~90s
Transcrição · arquivo únicoPrecisão de 92% · t=3:14:08
S1

Estamos três horas adentro — vamos voltar ao ponto da cadeia de suprimentos da sessão desta manhã.

S2

Certo, o giro de manufatura do Vietnã. Acho que passamos por alto o risco de tempo de entrega.

S1

Os tempos de entrega aumentaram de 14 para 31 dias após a mudança tarifária.

S3

E isso é antes de considerarmos o congestionamento portuário em Long Beach.

92% em toda a gravação de 5hDOCX · SRT · TXT · JSON

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Três opções reais · comparação honesta

Otter Pro. Chunking DIY com Whisper. Ou nós.

As ferramentas de consumidor limitam o comprimento do arquivo e truncam silenciosamente. A API Whisper tem um teto de 25 MB por solicitação, então você constrói o chunker sozinho. Aceitamos o arquivo inteiro de 10 horas e retornamos uma transcrição.

Option 01

Otter Pro

Limita arquivos longos a 4 horas por gravação. Rótulos de falantes mudam após a marca de 2 horas.

Comprimento máximo de arquivo4 horas (tier Pro)
Tamanho máximo de arquivo~1.5 GB upload
IDs de falantes de ponta a pontaMuda após 2 horas
Saída de arquivo longoDoc único, truncado no limite
Custo$16.99/usuário/mês
Upload retomávelNão
Best forReuniões curtas com menos de 2 horas. Falha em gravações o dia todo.
Option 02

Transcription.Solutions

10 horas por arquivo. Divisão em paralelo, passagem global de falante, um DOCX de saída.

Comprimento máximo de arquivo10 horas (Pro & Business)
Tamanho máximo de arquivo2 GB Pro · 5 GB Business
IDs de falantes de ponta a pontaPassagem de embedding global
Saída de arquivo longoArquivo único · DOCX/SRT/TXT
Custo · por minuto$0.03 flat independente do comprimento
Upload retomávelMultiparte, sobrevive a desconexões
Best forOficinas o dia todo, deposições, reuniões do conselho, histórias orais — qualquer coisa além da barreira de 90 minutos.
Option 03

Whisper API + DIY chunking

Mais barato por minuto. Você constrói o chunker, a costura de falante e a lógica de tentativa.

Comprimento máximo de arquivo25 MB por solicitação (~25 min)
Tamanho máximo de arquivoLimite difícil de 25 MB
IDs de falantes de ponta a pontaNenhum — sem diarização
Saída de arquivo longoPartes numeradas, você cose
Custo · por minuto$0.006 (OpenAI Whisper)
Tempo de engenhariaHoras a dias por pipeline
Best forEngenheiros que querem texto bruto por bloco e não precisam de falantes, resumos ou uma saída única.

Preços e limites precisos em maio de 2026. Limite de comprimento de Otter Pro verificado pela última vez em sua página de preços pública.

Específico para arquivos longos

Três formas como ferramentas genéricas falham após a marca de 90 minutos.

A maioria dos pipelines foi construída para reuniões de uma hora. Áudio longo os quebra de formas previsíveis — aqui está o que fazemos diferente.

O que dá errado

  1. 1Tempo limite silencioso de 90 minutos. O trabalho gira por uma hora, depois morre sem um erro útil. Você fica sem nada para repetir.
  2. 2IDs de falantes variam entre blocos. Falante 1 na hora 1 se torna Falante 4 na hora 3 porque cada bloco é diarizado isoladamente.
  3. 3Saída é uma pasta numerada. `transcript_part_01.txt` até `transcript_part_24.txt` com resets de timestamp em cada limite de bloco. Você cose isso sozinho.

O que mudar aqui

  1. 1Upload multiparte retomável. Conexão cai na hora 2 do upload? Retoma da última parte concluída. Sem re-upload de 4 GB.
  2. 2Passagem global de embedding de falante. Após diarização por bloco, agrupamos vozes em todo o arquivo para que Falante 3 seja a mesma pessoa no minuto 12 e no minuto 487.
  3. 3DOCX único com marcadores de hora. Um arquivo, timestamps contínuos, quebra de capítulo opcional a cada 60 minutos. Sem costura.

Configurações de trabalho recomendadas para arquivos longos

Solte qualquer coisa acima de 90 minutos e essas se ligam automaticamente. Substitua por trabalho no formulário.

Estratégia de divisão
Janelas de 12 min · sobreposição de 10s
Diarização
Passagem global em todos os blocos
Modelo de falante
Forma longa · 2-20 falantes
Upload
Multiparte retomável
Fila
Prioridade (plano Business)
Exportação
DOCX único · marcadores de hora ligados

Accuracy · real-world numbers

92% se mantém em um arquivo de 5 horas. Qualidade se mantém constante hora após hora.

A parte difícil do áudio longo não é o modelo — é manter a precisão consistente do minuto 1 ao minuto 600. Variação de falante e erros de limite de bloco são o que mata a maioria dos pipelines. Os números abaixo são medidos em arquivos completos de clientes, não nos primeiros 10 minutos.

95%
Studio long-form, falante único

Narração de audiobook, podcast solo, manuscrito ditado. 6-10 horas de voz limpa sem ruído ambiente. Nenhuma diarização necessária.

92%
Sala de reuniões, 2-6 falantes

Mesa de conferência, microfone decente, 3-5 horas. A passagem global de falante mantém IDs estáveis em todo o arquivo.

88%
Oficina o dia todo, microfones de lapela

Dia de treinamento de 7-9 horas com transferências de microfone e perguntas e respostas do público. Nomes precisam de uma passagem de 5 minutos nos chips do falante.

82%
Mesa redonda de campo, 8+ falantes

História oral longa, grupo focal ou painel com vozes sobrepostas e ruído ambiente. Utilizável, mas espere limpeza.

Perguntas comuns

8 coisas que as pessoas perguntam sobre transcrição de áudio longo.

01Qual é o limite real de comprimento e tamanho do arquivo?+
10 horas por arquivo em Pro e Business. Pro limita o tamanho do arquivo a 2 GB, Business a 5 GB. Se você tiver algo mais longo que 10 horas, divida uma vez em uma pausa natural — manteremos IDs de falantes consistentes se você enviá-los consecutivamente no mesmo projeto.
02Recebo uma transcrição ou uma pasta de partes numeradas?+
Um arquivo. Sempre. DOCX, SRT, TXT ou JSON — sua escolha. Timestamps rodam continuamente de 00:00:00 até o final da gravação, não reset em cada limite de bloco.
03Quanto tempo leva um arquivo de 6 horas para voltar?+
Aproximadamente 18-25 minutos na fila Pro, 8-12 na prioridade Business. Processamos os blocos de 12 minutos em paralelo, então o tempo real escala sublinearmente com o comprimento do arquivo, não minuto a minuto.
04Os IDs de falantes permanecem consistentes de ponta a ponta?+
Sim. Após diarização por bloco, uma passagem global de embedding agrupa vozes em todo o arquivo. Falante 3 no minuto 12 é o mesmo Falante 3 no minuto 487. Esta é a coisa principal que os pipelines DIY Whisper acertam errado.
05O que acontece se meu upload cair na hora 3 de um arquivo de 4 GB?+
O upload multiparte retomável continua da última parte concluída. Você não faz re-upload dos primeiros 3 GB. Funciona em Wi-Fi de hotel instável e tethering celular — testamos ambos.
06Por que a API Whisper engasga com arquivos longos?+
O endpoint Whisper da OpenAI tem um limite difícil de 25 MB por solicitação — aproximadamente 25 minutos de áudio comprimido. Qualquer coisa mais longa precisa que você divida, transcreva em paralelo e depois costure as transcrições e alinhe os falantes sozinho. Fazemos tudo isso no lado do servidor.
07O preço por minuto é o mesmo em um arquivo de 10 horas quanto em um arquivo de 10 minutos?+
Sim. $0.03 por minuto flat, independente do comprimento. Um arquivo de 10 horas custa $18. Não cobramos taxa adicional em arquivos longos como Rev faz ($1.50/min humano × 10 horas = $900).
08Posso obter marcadores de capítulo ou timestamps a cada hora?+
Alterne 'Marcadores de hora' no formulário de trabalho e o DOCX exporta com uma quebra de cabeçalho a cada 60 minutos. SRT mantém timecode contínuo. JSON tem ambos — array de capítulo mais timestamps em nível de palavra.

Envie seu arquivo longo. Obtenha uma transcrição de volta.

30 minutos grátis a cada mês. Sem cartão. Arquivos de até 10 horas, rótulos de falantes que permanecem consistentes, exportação de arquivo único.

Começar grátis