Áudio para Texto Online — Transcrição Grátis
Transcreva MP3, WAV, M4A: português, inglês, espanhol e mais de 16 idiomas. Funciona com Whisper localmente no seu navegador. Grátis, sem cadastro.
Arraste e solte seu arquivo aqui ou clique para selecionar
Sobre o reconhecimento de voz no navegador
Speech-to-Text é a transcrição automática de áudio para texto. Solte um MP3, WAV ou M4A — o Whisper (o modelo de licença aberta da OpenAI) divide a gravação em janelas de 30 segundos, localiza a fala, adiciona pontuação e devolve o texto. Depois copie, baixe um .txt, ou clique em 'Traduzir' para abrir o resultado no nosso tradutor.
Por trás dos panos — Whisper, convertido para formato ONNX e executado via transformers.js (Hugging Face) como WebAssembly diretamente no seu navegador. Suporta 99 idiomas; mostramos 16 dos mais comuns na interface — português, inglês, espanhol, russo, alemão, francês, italiano, ucraniano, polonês, checo, turco, holandês, chinês, japonês, coreano, árabe. O modo 'Auto' permite que o Whisper detecte o idioma a partir dos primeiros segundos de áudio.
O áudio nunca sai do seu dispositivo — a transcrição roda localmente, no navegador. O modelo é baixado uma vez (~75 MB para o Tiny, ~145 MB para o Base) e armazenado em cache. Sem cadastro, sem limites, nada é enviado a um servidor. Arquivos longos (>5 min) demoram mais para transcrever — esse é o preço de manter a privacidade.
Onde é útil
Transcrever uma entrevista ou podcast
Gravou uma conversa com um especialista ou seu próprio podcast? Solte o arquivo e obtenha texto pronto para editar, citar ou transformar em um artigo. O Whisper lida bem com pontuação e separa as linhas.
Fazer a ata de uma reunião
Gravou uma reunião no celular ou no Zoom — transforme a gravação em texto para encontrar rapidamente quem disse o quê e enviar um resumo. A precisão é melhor com uma gravação limpa e sem muito ruído.
Extrair citações de mensagens de voz
Notas de voz do Telegram, mensagens de voz do WhatsApp, memos de voz do iPhone — exporte o arquivo, transcreva para texto. Útil quando você precisa encontrar o que seu contato disse ou citá-lo.
Transcrever um discurso estrangeiro e traduzi-lo
Palestra em inglês, tutorial em vídeo em alemão, música em espanhol — transcreva primeiro e depois clique em 'Traduzir' para abrir o texto no nosso tradutor (também funciona localmente).
Perguntas frequentes
Quais idiomas são suportados?
O menu suspenso mostra 16 dos mais comuns: português, inglês, espanhol, russo, alemão, francês, italiano, ucraniano, polonês, checo, turco, holandês, chinês, japonês, coreano, árabe. O próprio modelo Whisper reconhece ~99 idiomas — o modo 'Auto' escolhe o idioma a partir dos primeiros segundos. Se seu idioma não estiver na lista, escolha 'Auto'.
O áudio é enviado a um servidor?
Não. A transcrição é totalmente do lado do cliente — o modelo Whisper ONNX é baixado uma vez para o seu dispositivo (do huggingface.co) e funciona localmente via WebAssembly. O arquivo de áudio em si nunca é enviado. Você pode desconectar-se da internet depois de carregar o modelo — a transcrição vai continuar funcionando.
Qual é a precisão?
Para voz limpa — normalmente 90–96% (modelo Tiny) ou 94–98% (modelo Base). A precisão cai com ruído de fundo, vários falantes simultâneos, sotaques, fala pouco clara e jargão especializado. Dica — grave perto do microfone, sem música de fundo, e escolha o Base se a precisão for importante.
Quais formatos de áudio são suportados?
Qualquer formato que a Web Audio API consiga decodificar: MP3, WAV, M4A (AAC do iPhone), AAC, OGG Vorbis, FLAC, OPUS, áudio WebM. Memos de voz do iPhone (.m4a), notas de voz do Telegram (.ogg/.oga), gravações do Zoom (.m4a), podcasts padrão (.mp3) — todos funcionam.
Quanto tempo leva a transcrição?
Depende da duração e do modelo. O Tiny em uma CPU geralmente roda quase em tempo real (1 minuto de áudio ≈ 1 minuto de transcrição), o Base é 1,5–2× mais lento, mas mais preciso. A primeira execução é mais lenta porque o modelo precisa ser baixado (~75 MB para o Tiny, ~145 MB para o Base). Depois, o modelo fica em cache no navegador.
Posso baixar o texto com marcações de tempo?
Não na versão atual — apenas texto simples. O Whisper pode devolver marcações de tempo em nível de frase e de palavra; podemos adicionar isso no futuro. Precisa de legendas .srt ou .vtt? Nos avise e vamos adicionar.
Posso traduzir na hora?
Sim — após a transcrição, clique em '→ Traduzir'. Nosso tradutor de texto se abre com o texto já preenchido. A tradução também funciona localmente (via Bergamot WASM da Mozilla), sem enviar nada.