Audio in testo online: trascrizione gratuita
Trascrivi MP3, WAV, M4A: inglese, russo, oltre 16 lingue. Alimentato da Whisper in esecuzione localmente nel tuo browser. Gratuito, nessuna registrazione.
Trascina e rilascia il tuo file qui o fai clic per selezionarlo
Informazioni sulla trascrizione audio nel browser
La conversione da voce a testo trascrive automaticamente un file audio. Carica un MP3, WAV o M4A: Whisper, il modello open source di OpenAI, divide la registrazione in finestre di 30 secondi, rileva il parlato, aggiunge la punteggiatura e restituisce il testo. Puoi quindi copiarlo, scaricare un .txt oppure premere «Traduci» per aprirlo nel nostro traduttore.
Dietro le quinte viene usato Whisper, convertito in formato ONNX ed eseguito tramite transformers.js (Hugging Face) come WebAssembly direttamente nel browser. Supporta 99 lingue; nell'interfaccia ne proponiamo 16 tra le più comuni: inglese, russo, tedesco, francese, spagnolo, italiano, portoghese, ucraino, polacco, ceco, turco, olandese, cinese, giapponese, coreano e arabo. La modalità «Auto» consente a Whisper di rilevare la lingua dai primi secondi di audio.
L'audio non lascia mai il tuo dispositivo: la trascrizione viene eseguita localmente, nel browser. Il modello viene scaricato una volta (~75 MB per Tiny, ~145 MB per Base) e memorizzato nella cache. Nessuna registrazione, nessun limite, niente caricato su un server. I file lunghi (>5 minuti) richiedono più tempo per essere trascritti: questo è il prezzo da pagare per rimanere privati.
Quando è utile
Trascrivi un'intervista o un podcast
Hai registrato una conversazione con un esperto o il tuo podcast? Carica il file e ottieni un testo pronto per modifiche, citazioni o articoli. Whisper gestisce bene la punteggiatura e la suddivisione in righe.
Crea il verbale di una riunione
Hai registrato una riunione sul telefono o su Zoom? Trasformala in testo per trovare rapidamente chi ha detto cosa e inviare un riepilogo. La precisione è migliore con una registrazione nitida e poco rumore.
Estrai citazioni dai messaggi vocali
Note vocali Telegram, messaggi vocali WhatsApp, memo vocali iPhone: esporta il file, trascrivilo in testo. Utile quando hai bisogno di trovare ciò che ha detto il tuo contatto o citarlo.
Trascrivi e traduci il parlato in un'altra lingua
Lezione in inglese, tutorial video in tedesco, canzone in spagnolo: trascrivi prima, quindi fai clic su "Traduci" per aprire il testo nel nostro traduttore (funziona anche localmente).
Domande frequenti
Quali lingue sono supportate?
Il menu a discesa mostra 16 dei più comuni: inglese, russo, tedesco, francese, spagnolo, italiano, portoghese, ucraino, polacco, ceco, turco, olandese, cinese, giapponese, coreano, arabo. Il modello Whisper riconosce circa 99 lingue: la modalità "Auto" seleziona la lingua fin dai primi secondi. Se la tua lingua non è nell'elenco, scegli "Auto".
L'audio è caricato su un server?
No. La trascrizione avviene interamente sul dispositivo: il modello Whisper ONNX viene scaricato una sola volta da huggingface.co ed eseguito localmente tramite WebAssembly. Il file audio non viene mai caricato. Dopo il caricamento del modello puoi disconnetterti da Internet e continuare a trascrivere.
Quanto è accurato?
Con un parlato nitido, la precisione tipica è del 90–96% con il modello Tiny e del 94–98% con Base. Diminuisce con rumore di fondo, più persone che parlano contemporaneamente, accenti marcati, parlato poco chiaro e gergo specialistico. Suggerimento: registra vicino al microfono, senza musica di sottofondo, e scegli Base quando la precisione è importante.
Quali formati audio sono supportati?
Tutto ciò che Web Audio API può decodificare: MP3, WAV, M4A (iPhone AAC), AAC, OGG Vorbis, FLAC, OPUS, WebM audio. Memo vocali iPhone (.m4a), note vocali Telegram (.ogg/.oga), registrazioni Zoom (.m4a), podcast standard (.mp3): funzionano tutti.
Quanto tempo richiede la trascrizione?
Dipende dalla durata e dal modello. Tiny su CPU funziona in genere quasi in tempo reale (1 minuto di audio ≈ 1 minuto di trascrizione); Base è 1.5–2× più lento, ma più preciso. La prima esecuzione richiede più tempo perché deve scaricare il modello (~75 MB per Tiny, ~145 MB per Base). In seguito, il modello resta nella cache del browser.
Posso scaricare il testo con i timestamp?
Nella versione attuale è disponibile soltanto il testo semplice. Whisper può restituire timestamp a livello di frase e parola e potremmo aggiungerli in futuro. Ti servono sottotitoli .srt o .vtt? Faccelo sapere.
Posso tradurlo subito?
Sì: dopo la trascrizione, fai clic su "→ Traduci". Il nostro traduttore di testo si apre con il testo precompilato. La traduzione viene eseguita anche localmente (tramite Bergamot WASM di Mozilla), non viene caricato nulla.