Απογράψτε MP3 σε κείμενο.Ετικέτες ομιλητή, 100+ γλώσσες.

Ρίξτε ένα αρχείο MP3 σε οποιοδήποτε bitrate από 64 έως 320 kbps. Λάβετε ένα χρονολογημένο, με ετικέτες ομιλητή απογραφή σε 99 γλώσσες — χωρίς μετατροπή μορφής, χωρίς επανακωδικοποίηση, χωρίς αναμονή σε ουρά.

Ρίξε τον ήχο ή το βίντεό σου

MP3 · WAV · M4A · MP4 · MOV · MKV · OGG · OPUS · FLAC · WEBM — up to 100 MB anonymously

Paste a link, we’ll fetch the audio

YouTube · TikTok · Vimeo · Twitter · SoundCloud · Spotify · 50+ more

Ηχογράφηση απευθείας από το browser

Η εγγραφή παίρνει 30 δευτερόλεπτα — η ηχογράφηση ανοίγει αμέσως μετά, μέσα στο dashboard.

No card required~90s per 60-min fileSRT · VTT · DOCX · TXTΤα αρχεία διαγράφονται αυτόματα σε 24 ώρες

↓ ��είτε τι βγαίνει

MP3 μέσα. Απογραφή με διαχωρισμό ομιλητών έξω.

Διαβάζουμε τις κεφαλίδες πλαισίου MP3 απευθείας — VBR, CBR, joint-stereo, οποιοσδήποτε encoder (LAME, Fraunhofer, FFmpeg). Εάν το αρχείο είναι true stereo με ομιλητές σε ξεχωριστά κανάλια, το χρησιμοποιούμε για να διαχωρίσουμε φωνές. Το mono mix-down πέφτει πίσω σε ακουστικό διαχωρισμό.

interview-tape-04.mp3REC 192 kbps · stereo · 38:42
auto-detected en-GB44.1 kHz · LAME 3.100
~90s
Απογραφή · streaming95% ακρίβεια
S1

So when did you first realise the archive was incomplete?

S2

Probably around 2019, when we started digitising the reel-to-reels.

S1

And the missing tapes — were they catalogued anywhere at all?

S2

There's a paper index from '78, but half of it's water-damaged.

95% on 192 kbps stereoSRT · DOCX · TXT · JSON · VTT

↓ This is the dashboard

This is what loads when the job finishes.

Same layout as the real dashboard — Summary, full Transcript, Speakers tab, Exports. Key points and action items extracted automatically. Auto-tags on every job.

Try it on your own file — it's free

Τρεις πραγματικές επιλογές · ειλικρινής σύγκριση

Δωρεάν local Whisper. Otter ή Sonix. Ή εμείς.

Μπορείτε να εκτελέσετε Whisper στο δικό σας laptop για δωρεάν εάν είστε τεχνικά καταρτισμένοι. Otter και Sonix δέχονται ανεβάσματα MP3 μέσα σε dashboards συνδρομής. Παίρνουμε το αρχείο, επιστρέφουμε την απογραφή, και δεν σας αναγκάζουμε να ζήσετε μέσα σε ένα UI.

Option 01

Whisper local / open source

Δωρεάν εάν έχετε GPU και πολλές ώρες ελεύθερες. Χωρίς διαχωρισμό ομιλητών εκ των προεπιλογών.

SetupPython + CUDA + 10 GB models
Διαχωρισμός ομιλητώνΔεν περιλαμβάνεται (πρόσθετο pyannote)
Ταχύτητα · 1 ώρα MP35–40 λεπτά σε consumer GPU
Γλώσσες99, αλλά μικρό μοντέλο πέφτει κάτω από 80%
ΕξαγωγήTXT / SRT / VTT / JSON
ΚόστοςΔωρεάν + το ηλεκτρικό σας
Best forΜηχανικοί που ήδη ιδιοκτησίας GPU, δεν χρειάζονται ετικέτες ομιλητή, και θέλουν πλήρη τοπικό απόρρητο.
Option 02

Transcription.Solutions

Ρίξτε το MP3. Λάβετε κείμενο με ετικέτες ομιλητή σε σχεδόν πραγματικό χρόνο × 0.025.

SetupDrag-and-drop, δεν απαιτείται λογαριασμός για δοκιμή
Διαχωρισμός ομιλητώνΕνσωματωμένο (Pro & Business plans)
Ταχύτητα · 1 ώρα MP3~90 δευτερόλεπτα
Γλώσσες99, αυτόματος εντοπισμός
ΕξαγωγήSRT · VTT · DOCX · TXT · JSON
Κόστος · ανά λεπτό$0.03
Best forΟποιοσδήποτε με MP3 — ταινία δημοσιογράφου, εξαγωγή podcast, voice memo, αρχειακή αντιγραφή — που απλώς θέλει ακριβές κείμενο στην άλλη άκρη.
Option 03

Otter / Sonix

Polished dashboard, μηνιαίο όριο λεπτών, English-tuned. Το ανέβασμα αρχείου νοιώθει σαν δευτερεύον χαρακτηριστικό.

SetupΛογαριασμός + πληρωμένο σχέδιο
Διαχωρισμός ομιλητώνΑκουστικό, EN-leaning
Ταχύτητα · 1 ώρα MP35–10 λεπτά σε ουρά
ΓλώσσεςOtter EN-only; Sonix ~40
ΕξαγωγήΚλειδωμένη πίσω από πληρωμένες σταθμές
Κόστος$17+/μήνας ή $10+/ώρα (Sonix)
Best forΟμάδες που θέλουν έναν επεξεργαστή απογραφής και UI συνεργασίας παραπάνω από μια καθαρή ροή API αρχείο→κείμενο.

Τα τιμολόγια και η διαθεσιμότητα χαρακτηριστικών είναι ακριβή από Μάιος 2026. Η απόδοση Whisper ποικίλει ανάλογα με το μέγεθος του μοντέλου και το υλικό.

Συγκεκριμένο για MP3

Τρία πράγματα που δαγκώνουν τους ανθρώπους σε γενικά εργαλεία απογραφής.

Το MP3 είναι μια μορφή, όχι ένα στυλ εγγραφής — πράγμα που σημαίνει ότι τα σημεία αποτυχίας προέρχονται από τον κωδικοποιητή, όχι από την ομιλία.

Τι πάει στραβά

  1. 1Οι κεφαλίδες VBR λάβουν λάθος ανάλυση. Ορισμένα εργαλεία διαβάζουν MP3s μεταβλητού bitrate ως σταθερού ρυθμού και λάθος υπολογίζουν διάρκεια — τα χρονόσημα αποκλίνουν κατά λεπτά σε ένα αρχείο ώρας.
  2. 2Joint-stereo πεσιά σε mono κατά τη διάρκεια της προ-επεξεργασίας ανεβάσματος. Χάνετε τον διαχωρισμό ανά-ομιλητή καναλιού που ήταν στο αρχείο.
  3. 3Ενσωματωμένη τέχνη άλμπουμ ID3 διαταράσσει λίγα uploaders — απορρίπτουν το αρχείο ως 'όχι καθαρός ήχος' ή το αφαιρούν και επανακωδικοποιούν, ρίχνοντας την ποιότητα περαιτέρω.

Τι κάνουμε εναλλακτικά

  1. 1Χρησιμοποιούμε την κεφαλίδα Xing/LAME όταν υπάρχει και πρόσφυγα πλαισίου-αριθμού όταν όχι. Τα χρονόσημα VBR παραμένουν ακριβή έως ±0.1 s σε αρχεία πολλών ωρών.
  2. 2Joint-stereo και true-stereo MP3s αποκωδικοποιούνται σε L/R PCM πριν από διαχωρισμό. Εάν οι ομιλητές σας πανικοβλήθησαν, τους κρατάμε χωρισμένους.
  3. 3ID3v1, ID3v2, ετικέτες APE, ενσωματωμένη τέχνη — όλα περάστηκαν μέσω ανέγγιχτα. Δεν επανακωδικοποιούμε ποτέ το MP3 σας.

Προτεινόμενες ρυθμίσεις εργασίας για ανεβάσματα MP3

Προεπιλογές που ταιριάζουν ~80% των αρχείων MP3. Παράκαμψη ανά εργασία από τη φόρμα.

Αποκωδικοποιητής
Frame-accurate, χωρίς επανακωδικοποίηση
Διαχωρισμός
Διαχωρισμός καναλιού εάν stereo, αλλιώς ακουστικό
Μοντέλο ομιλητή
Αυτό · 1-12 ομιλητές
Γλώσσα
Αυτόματος εντοπισμός από πρώτα 30 s
Λέξεις πληρώματος
Αφαιρέθηκαν (αλλαγή για να κρατηθούν)
Πακέτο εξαγωγής
DOCX + SRT + χρονολογημένο TXT

Accuracy · real-world numbers

95%+ σε 192 kbps stereo. Χρήσιμο έως και 64 kbps mono.

Η ακρίβεια MP3 περιορίζεται από αυτό που ο κωδικοποιητής κράτησε, όχι από εμάς. Η αντιληπτική συμπίεση πάνω από ~96 kbps διατηρεί την νοητικότητα ομιλίας πολύ καλά. κάτω από 64 kbps, ο σιγαμός και οι σύμφωνοι αρχίζουν να διαλύονται. Οι αριθμοί παρακάτω είναι από πραγματικά MP3 πελατών σε παραγωγή.

96%
320 kbps stereo, studio source

Σχεδόν ασυμπίεστο για ομιλία. Podcast masters, εξαγωγές εφαρμογής υπαγόρευσης, επαγγελματικά συστήματα συνέντευξης. Ο διαχωρισμός είναι καθαρός εάν οι ομιλητές είναι σε ξεχωριστά κανάλια.

95%
192 kbps stereo, 2-3 speakers

Το πιο κοινό bitrate για MP3s που ομιλούν. Εξαγωγές Zoom, λήψεις Riverside, προεπιλογή καταγραφέων φωνής. Τα αρχουραφήματα συμπίεσης δεν ακούγονται στον αναγνώρισμα.

91%
128 kbps mono, conversational

Προεπιλογή voice memo στα περισσότερα τηλέφωνα. Ο ακουστικός διαχωρισμός χειρίζεται 2-4 ομιλητές. Οι αριθμοί και τα κύρια ονόματα χρειάζονται περιστασιακά μια ματιά.

84%
64 kbps mono, archival / phone-dump

Παλιά rips απαντητικής μηχανής, αρχεία διαλέξεων, πηγές στενής ζώνης. Οι υψηλής συχνότητας σύμφωνοι (f/s/sh) θολώνουν. Ακόμα ευα��άγνωστο — σχεδιάστε διόρθωση.

Συχνές ερωτήσεις

8 πράγματα που ρωτούν οι άνθρωποι για απογραφή MP3.

01Ποιο είναι το ελάχιστο bitrate MP3 που εξακολουθεί να δίνει χρησιμοποιήσιμη απογραφή;+
64 kbps είναι το πρακτικό όριο. Κάτω από αυτό, σιγαμός (s, sh, f) συμπιέζεται σε θόρυβο και το ποσοστό σφάλματος λέξης ανέρχεται πάνω από 20%. Εάν χάρτογραφείτε φρέσκο, στοχεύστε 128 kbps mono ή 192 kbps stereo — οτιδήποτε υψηλότερο είναι περίσσεια για ομιλία.
02Πρέπει να μετατρέψω το MP3 μου στο WAV πρώτα;+
Όχι. Η επανακωδικοποίηση MP3 → WAV προσθέτει μηδέν ακρίβεια γιατί τα δεδομένα που ο κωδικοποιητής απέρριψε έχουν χαθεί για καλό. Ανεβάστε το MP3 απευθείας. Αποκωδικοποιούμε πλαίσια σε μνήμη και τροφοδοτούμε PCM στον αναγνώρισμα.
03Θα μου δώσει stereo MP3 καλύτερες ετικέτες ομιλητή από mono;+
Μόνο εάν οι ομιλητές εγγραφείτε στην πραγματικότητα σε ξεχωριστά κανάλια — τα περισσότερα stereo MP3s έχουν τον ίδιο ήχο και στις δύο πλευρές ('dual mono') και κερδίζουν τίποτα. Ο πραγματικός διαχωρισμός καναλιού (π.χ. εξαγωγές Riverside, δύο rig πεδίου μικροφώνων) μας αφήνει να παραλείψουμε ακουστικό διαχωρισμό και ετικέτα ομιλητών σχεδόν τέλεια.
04Ποιο είναι το μέγιστο μέγεθος αρχείου MP3 που δέχεστε;+
5 GB ανά ανέβασμα, που είναι περίπου 60 ώρες στα 192 kbps ή 90 ώρες στα 128 kbps. Εάν το αρχείο σας είναι μεγαλύτερο θα εμφανίσουμε ανέβασμα κατατεμαχισμένων — δεν χρειάζεται να το χωρίσετε μόνοι σας.
05Πόσο καιρό χρειάζεται ένα 60λεπτο MP3 να απογραφεί;+
Συνήθως 90 δευτερόλεπτα από ανέβασμα-πλήρης έως απογραφή-έτοιμη, ανεξάρτητα από bitrate. Η αποκωδικοποίηση πλαισίων MP3 είναι γρήγορη· ο χρόνος είναι στον αναγνώρισμα. Ο διαχωρισμός προσθέτει 5-10 δευτερόλεπτα σε αρχεία δολίχη ομιλητή.
06Το MP3 μου έχει background music — θα καταστραφεί η απογραφή;+
Ήσυχο κρεβάτι μουσικής κάτω από ομιλία είναι καλό. Ηχηρή μουσική που ανταγωνίζεται τη φωνή (stings εισόδου, σκοροφ κάτω από συνεντεύξεις) περιστασιακά ενεργοποιεί εσφαλμένες αναγνωρίσεις σε επικαλυπτόμενες συλλαβές. Toggle music suppression στη φόρμα εργασίας για προφιλτρār.
07Μπορείτε να χειριστείτε MP3s που αποκόπησαν από τον φωνητικό ταχυδρόμο ή τις απαντητικές μηχανές του τηλεφώνου;+
Ναι, αν και αυτά είναι συχνά 8 kHz narrow-band επανακωδικοποίηση ως MP3 — το όριο ποιότητας ήχου ορίζεται από την αρχική καταγραφή PSTN, όχι από το κέλυφος MP3. Αναμένετε 78-85% ακρίβεια σε αυτό το είδος πηγής, που είναι το ίδιο που θα παίρναμε στην υποκείμενη κλήση.
08Κρατάτε το MP3 μου αφού ολοκληρωθεί η απογραφή;+
Τα αρχεία διαγράφονται μετά από 30 ημέρες εξ' ορισμού, ή αμέσως κατόπιν αιτήματος μέσω του dashboard. Η απογραφή παραμένει στο λογαριασμό σας μέχρι να την διαγράψετε. Δεν χρησιμοποιούμε ήχο πελάτη για εκπαίδευση οποιουδήποτε μοντέλου — ποτέ.

Ρίξτε το MP3 σας. Λάβετε κείμενο σε 90 δευτερόλεπτα.

30 δωρεάν λεπτά κάθε μήνα. Χωρίς κάρτα. Ετικέτες ομιλητή, 99 γλώσσες, κάθε μορφή εξαγωγής περιλαμβάνεται.

Ξεκινήστε δωρεάν