ConvertiloConvertilo

Áudio para Texto Online — Transcrição Grátis

Transcreva MP3, WAV, M4A: português, inglês, espanhol e mais de 16 idiomas. Funciona com Whisper localmente no seu navegador. Grátis, sem cadastro.

Arraste e solte seu arquivo aqui ou clique para selecionar

Sobre o reconhecimento de voz no navegador

Speech-to-Text é a transcrição automática de áudio para texto. Solte um MP3, WAV ou M4A — o Whisper (o modelo de licença aberta da OpenAI) divide a gravação em janelas de 30 segundos, localiza a fala, adiciona pontuação e devolve o texto. Depois copie, baixe um .txt, ou clique em 'Traduzir' para abrir o resultado no nosso tradutor.

Por trás dos panos — Whisper, convertido para formato ONNX e executado via transformers.js (Hugging Face) como WebAssembly diretamente no seu navegador. Suporta 99 idiomas; mostramos 16 dos mais comuns na interface — português, inglês, espanhol, russo, alemão, francês, italiano, ucraniano, polonês, checo, turco, holandês, chinês, japonês, coreano, árabe. O modo 'Auto' permite que o Whisper detecte o idioma a partir dos primeiros segundos de áudio.

O áudio nunca sai do seu dispositivo — a transcrição roda localmente, no navegador. O modelo é baixado uma vez (~75 MB para o Tiny, ~145 MB para o Base) e armazenado em cache. Sem cadastro, sem limites, nada é enviado a um servidor. Arquivos longos (>5 min) demoram mais para transcrever — esse é o preço de manter a privacidade.

Onde é útil

Transcrever uma entrevista ou podcast

Gravou uma conversa com um especialista ou seu próprio podcast? Solte o arquivo e obtenha texto pronto para editar, citar ou transformar em um artigo. O Whisper lida bem com pontuação e separa as linhas.

Fazer a ata de uma reunião

Gravou uma reunião no celular ou no Zoom — transforme a gravação em texto para encontrar rapidamente quem disse o quê e enviar um resumo. A precisão é melhor com uma gravação limpa e sem muito ruído.

Extrair citações de mensagens de voz

Notas de voz do Telegram, mensagens de voz do WhatsApp, memos de voz do iPhone — exporte o arquivo, transcreva para texto. Útil quando você precisa encontrar o que seu contato disse ou citá-lo.

Transcrever um discurso estrangeiro e traduzi-lo

Palestra em inglês, tutorial em vídeo em alemão, música em espanhol — transcreva primeiro e depois clique em 'Traduzir' para abrir o texto no nosso tradutor (também funciona localmente).

Perguntas frequentes

Quais idiomas são suportados?

O menu suspenso mostra 16 dos mais comuns: português, inglês, espanhol, russo, alemão, francês, italiano, ucraniano, polonês, checo, turco, holandês, chinês, japonês, coreano, árabe. O próprio modelo Whisper reconhece ~99 idiomas — o modo 'Auto' escolhe o idioma a partir dos primeiros segundos. Se seu idioma não estiver na lista, escolha 'Auto'.

O áudio é enviado a um servidor?

Não. A transcrição é totalmente do lado do cliente — o modelo Whisper ONNX é baixado uma vez para o seu dispositivo (do huggingface.co) e funciona localmente via WebAssembly. O arquivo de áudio em si nunca é enviado. Você pode desconectar-se da internet depois de carregar o modelo — a transcrição vai continuar funcionando.

Qual é a precisão?

Para voz limpa — normalmente 90–96% (modelo Tiny) ou 94–98% (modelo Base). A precisão cai com ruído de fundo, vários falantes simultâneos, sotaques, fala pouco clara e jargão especializado. Dica — grave perto do microfone, sem música de fundo, e escolha o Base se a precisão for importante.

Quais formatos de áudio são suportados?

Qualquer formato que a Web Audio API consiga decodificar: MP3, WAV, M4A (AAC do iPhone), AAC, OGG Vorbis, FLAC, OPUS, áudio WebM. Memos de voz do iPhone (.m4a), notas de voz do Telegram (.ogg/.oga), gravações do Zoom (.m4a), podcasts padrão (.mp3) — todos funcionam.

Quanto tempo leva a transcrição?

Depende da duração e do modelo. O Tiny em uma CPU geralmente roda quase em tempo real (1 minuto de áudio ≈ 1 minuto de transcrição), o Base é 1,5–2× mais lento, mas mais preciso. A primeira execução é mais lenta porque o modelo precisa ser baixado (~75 MB para o Tiny, ~145 MB para o Base). Depois, o modelo fica em cache no navegador.

Posso baixar o texto com marcações de tempo?

Não na versão atual — apenas texto simples. O Whisper pode devolver marcações de tempo em nível de frase e de palavra; podemos adicionar isso no futuro. Precisa de legendas .srt ou .vtt? Nos avise e vamos adicionar.

Posso traduzir na hora?

Sim — após a transcrição, clique em '→ Traduzir'. Nosso tradutor de texto se abre com o texto já preenchido. A tradução também funciona localmente (via Bergamot WASM da Mozilla), sem enviar nada.

Você também pode experimentar