Whisper local / código aberto
Gratis se tes un GPU e unha tarde. Sen diarización de orador fóra da caixa.
Solta un ficheiro MP3 a calquera taxa de bits de 64 a 320 kbps. Obtén un transcript con marca de tempo e etiquetas de orador en 99 idiomas — sen conversión de formato, sen recodificación, sen agardar en cola.
↓ Mira que sae
Lemos directamente os encabezados de marcos de MP3 — VBR, CBR, estéreo conxunto, calquera codificador (LAME, Fraunhofer, FFmpeg). Se o ficheiro é verdadeiro estéreo con oradores en canais separados, usámoselo para dividir voces. O mix-down mono volvese á diarización acústica.
Entón, cándo che deu conta de que o arquivo estaba incompleto?
Probablemente arredor de 2019, cando comezamos a dixitalizar as bobinas.
E as cintas que faltan — estaban catalogadas en algún lugar?
Hai un índice en papel do '78, pero a metade está dañada pola auga.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Tres opcións reais · comparación honesta
Podes executar Whisper no teu portátil de forma gratuíta se tes coñecementos técnicos. Otter e Sonix aceptan cargas de MP3 dentro de paneis de subscrición. Tomamos o ficheiro, devolveremos o transcript, e non te facemos vivir dentro dunha IU.
Gratis se tes un GPU e unha tarde. Sen diarización de orador fóra da caixa.
Solta o MP3. Obtén texto con etiquetas de orador de volta en tempo máis ou menos real × 0.025.
Panel pulido, límite de minutos mensuais, afinación en inglés. A carga de ficheiros parece unha característica secundaria.
Prezos e dispoñibilidade de funcións precisos a maio de 2026. O rendemento de Whisper varía segundo o tamaño do modelo e o hardware.
Específico de MP3
MP3 é un formato, non un estilo de gravación — o que significa que os modos de fallo vén do codificador, non da fala.
Predeterminados que se axustan a ~80% dos ficheiros MP3. Anula por traballo desde o formulario.
Accuracy · real-world numbers
A precisión de MP3 está limitada por o que o codificador mantivo, non por nós. A compresión perceptual por encima de ~96 kbps preserva moi ben a inteligibilidade da fala; por debaixo de 64 kbps, os sibilantes e consonantes comezar a disolverse. Os números de abaixo son de MP3s reais de clientes en produción.
Case sen perdas para fala. Mestres de podcast, exportacións de aplicacións de ditado, equipos de entrevista profesionais. Diarización limpa se os oradores están en canais separados.
Taxa de bits máis común para MP3s de fala. Exportacións de Zoom, descargas de Riverside, predeterminado de gravadores de voz. Artefactos de compresión inaudibles para o recoñecedor.
Predeterminado de notas de voz na maioría dos teléfonos. A diarización acústica maneja 2-4 oradores. Os números e nomes propios ás veces necesitan unha ollada.
Rips antigos de máquinas de contestador, arquivos de conferencias, fontes de banda estreita. Os consonantes de alta frecuencia (f/s/sh) bórran. Aínda legible — planifica unha corrección.
Preguntas comúns
30 minutos gratis cada mes. Non se require tarxeta. Etiquetas de orador, 99 idiomas, cada formato de exportación incluído.
Comeza gratis