Whisper local / open source
Gratuit si vous avez un GPU et un après-midi. Pas de diarisation d'intervenants en standard.
Déposez un fichier MP3 à n'importe quel débit de 64 à 320 kbps. Obtenez une transcription horodatée avec identification des intervenants en 99 langues — aucune conversion de format, aucun ré-encodage, aucune attente en queue.
MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously
YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more
↓ Voir ce qui en sort
Nous lisons les en-têtes de trame MP3 directement — VBR, CBR, joint-stereo, n'importe quel encodeur (LAME, Fraunhofer, FFmpeg). Si le fichier est une vraie stéréo avec des intervenants sur des canaux séparés, nous l'utilisons pour séparer les voix. Un mixdown mono revient à la diarisation acoustique.
Alors, quand avez-vous d'abord réalisé que l'archive était incomplète ?
Probablement autour de 2019, quand nous avons commencé à numériser les bobines.
Et les bandes manquantes — étaient-elles cataloguées quelque part ?
Il y a un index papier de '78, mais la moitié est endommagée par l'eau.
↓ This is the dashboard
Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.
Sample preview from a founder interview about post-call workflow. Real transcripts look exactly like this — same tabs, same summary block, same key-points / action-items split, same auto-tag chips.
Trois vraies options · comparaison honnête
Vous pouvez exécuter Whisper gratuitement sur votre ordinateur portable si vous êtes technique. Otter et Sonix acceptent les uploads MP3 dans les tableaux de bord d'abonnement. Nous prenons le fichier, renvoyons la transcription et ne vous forçons pas à vivre dans une interface.
Gratuit si vous avez un GPU et un après-midi. Pas de diarisation d'intervenants en standard.
Déposez le MP3. Récupérez le texte avec identification des intervenants à peu près en temps réel × 0,025.
Tableau de bord soigné, limite mensuelle de minutes, optimisé pour l'anglais. L'upload de fichier semble un trait secondaire.
Prix et disponibilité des fonctionnalités à jour en mai 2026. Les performances de Whisper varient selon la taille du modèle et le matériel.
Spécifique à MP3
MP3 est un format, pas un style d'enregistrement — ce qui signifie que les modes de défaillance proviennent de l'encodeur, pas de la parole.
Paramètres par défaut qui conviennent à ~80 % des fichiers MP3. Remplacez par job depuis le formulaire.
Accuracy · real-world numbers
La précision MP3 est limitée par ce que l'encodeur a conservé, pas par nous. La compression perceptuelle au-dessus de ~96 kbps préserve très bien la compréhension du discours ; en dessous de 64 kbps, les sifflantes et les consonnes commencent à se dissoudre. Les chiffres ci-dessous proviennent de MP3 clients réels en production.
Quasi sans perte pour la parole. Maîtres de podcast, exports d'apps de dictée, montages d'interview professionnels. Diarisation claire si les intervenants sont sur des canaux séparés.
Débit d'accès le plus courant pour les MP3 parlés. Exports Zoom, téléchargements Riverside, standard des enregistreurs vocaux. Artefacts de compression inaudibles pour le reconnaisseur.
Standard des mémos vocaux sur la plupart des téléphones. La diarisation acoustique gère 2-4 intervenants. Les chiffres et noms propres ont occasionnellement besoin d'un coup d'œil.
Vieux extraits de répondeurs, archives de conférences, sources de bande étroite. Les consonnes haute fréquence (f/s/sh) s'estompent. Toujours lisible — prévoyez une relecture.
Questions courantes
30 minutes gratuites chaque mois. Aucune carte requise. Identification des intervenants, 99 langues, tous les formats d'exportation inclus.
Commencer gratuitement