Transcrever áudio em texto
A gravação é transcrita no seu próprio aparelho e não é enviada a servidor nenhum. Depois você corrige cada linha ouvindo o trecho e exporta em SRT, VTT, TXT ou DOCX.
- Grátis
- Sem cadastro
- Sem envio
Solte aqui um arquivo de áudio ou vídeo
MP3, WAV, M4A, OGG, Opus, FLAC, WebM, MP4, MOV
Como funciona
- Abra a gravação. Solte um arquivo de áudio ou vídeo na página. O navegador decodifica o som e desenha a forma de onda; nada é enviado.
- Toque em Transcrever. O idioma já vem em português; mude se a gravação for em outra língua. Na primeira vez o navegador baixa o modelo de fala (44 MB no pequeno) e o guarda para as próximas.
- Corrija e exporte. Toque no tempo de uma linha para ouvir o trecho, digite por cima do que saiu errado, ajuste início e fim e identifique quem fala. Salve como legenda ou como documento.
Qual modelo escolher para português
Os três modelos são o Whisper, da OpenAI, em tamanhos que rodam no processador de um notebook. Em português, a diferença entre eles aparece nos acentos, nas palavras curtas e nos nomes próprios.
- Pequeno (44 MB). O mais rápido. Bom para um rascunho ou para áudio limpo de uma pessoa só. Em um teste nosso com 14 segundos de fala em português, errou uma preposição e deixou um acento de fora.
- Médio (80 MB). No mesmo teste, acertou o texto inteiro. É o ponto de equilíbrio para o dia a dia.
- Grande (252 MB). O mais preciso e o mais lento. Vale para entrevistas, reuniões com ruído e tudo o que será publicado.
Esses testes foram feitos com frases curtas e voz sintética em 3 de outubro de 2026; uma gravação real, com ruído e sotaque, erra mais. Por isso o editor fica logo abaixo da onda: a transcrição automática é o ponto de partida, e a revisão é sua.
Para que as pessoas usam
- Entrevistas e pesquisa. Preencha o campo de falante em cada linha e exporte em DOCX: o arquivo sai com o tempo de início e o nome em negrito, pronto para citar.
- Aulas e reuniões. Copie o texto corrido para suas anotações. Gravações longas pedem um computador com boa memória; dividir o arquivo em partes resolve.
- Legendas. Exporte SRT para YouTube e editores de vídeo, ou VTT para players na web. Com um vídeo aberto, a legenda aparece sobre a imagem enquanto toca.
- Áudios do WhatsApp. Há uma página só para isso, com o passo a passo para salvar o áudio como arquivo.
O que “no seu aparelho” quer dizer
Serviços de transcrição na nuvem recebem o seu arquivo e devolvem o texto. Aqui acontece o contrário: o modelo vem até o arquivo. Ele é baixado para o navegador e roda ali.
Uma requisição sai do seu aparelho: o download do modelo no Hugging Face, que vê o seu endereço IP como qualquer site que você visita. Ele não recebe áudio nem texto. Os detalhes estão na política de privacidade (em inglês).
Por que usar o Transcribe Tools
- O arquivo fica no seu aparelho
- O navegador decodifica a gravação e um modelo Whisper a transcreve em um Web Worker. Nem o áudio nem o texto são enviados a este site.
- Você vê o download antes de começar
- O modelo de fala é o único download: 44 MB, 80 MB ou 252 MB, conforme o que você escolher. Ele vem uma vez do Hugging Face e fica guardado no navegador.
- Editor preso à forma de onda
- Cada linha é uma faixa sob a onda. Toque no tempo para ouvir, corrija o texto e mova o início e o fim.
- SRT, VTT, TXT e DOCX
- Os quatro arquivos são gerados no navegador a partir da mesma transcrição, com o nome dos falantes quando você preenche.
- Recarregar não apaga o trabalho
- A transcrição é salva neste navegador enquanto você digita, e “Limpar transcrição” remove o rascunho.
- Sem cadastro e sem contagem de minutos
- Não existe conta. O limite é a memória e o processador do seu aparelho.
Perguntas frequentes
O áudio é enviado para algum servidor?
Não. O arquivo é decodificado pelo seu navegador e transcrito por um modelo de fala Whisper que roda no próprio aparelho. A única coisa baixada é o modelo, do Hugging Face, no primeiro uso.
Qual o tamanho do download?
O modelo pequeno tem 44 MB, o médio 80 MB e o grande 252 MB. O tamanho aparece antes de começar, e o navegador guarda o modelo: da segunda vez não há download.
A transcrição em português é boa?
Com fala clara de uma pessoa, o modelo pequeno já acerta a maior parte, mas costuma errar acentos e palavras curtas. Nos nossos testes com frases em português, os modelos médio e grande acertaram o texto inteiro. Para entrevistas, ruído ou sotaque marcado, prefira o grande e revise no editor.
Tem limite de minutos ou precisa de cadastro?
Não há cadastro nem contagem de minutos. O limite é o seu aparelho: uma hora de áudio ocupa cerca de 230 MB de memória depois de decodificada, então gravações muito longas podem falhar em celulares e computadores antigos.
Dá para exportar legenda?
Sim: SRT e VTT para vídeo, TXT e DOCX para texto. Cada linha tem início e fim que você pode ajustar antes de exportar.
Outras ferramentas do site
- Transcribe audio to textOpen a recording, get the text, correct it while you listen.Open
- Audio to textMP3, WAV, M4A, OGG and Opus, and what changes the result.Open
- Video to textTranscribe the audio track and preview subtitles over the picture.Open
- SRT generatorTimed subtitles from a recording, exported as SRT or VTT.Open
- Subtitle editorFix an existing .srt or .vtt file, with or without the video.Open
- DictationSpeak and get text, with a local option that keeps the audio here.Open
- Transcrever áudio do WhatsAppArquivos .opus direto, sem converter.Abrir