Pular para o conteúdo

Transcrever áudio em texto

A gravação é transcrita no seu próprio aparelho e não é enviada a servidor nenhum. Depois você corrige cada linha ouvindo o trecho e exporta em SRT, VTT, TXT ou DOCX.

  • Grátis
  • Sem cadastro
  • Sem envio
Salva emSRTVTTTXTDOCX

Solte aqui um arquivo de áudio ou vídeo

MP3, WAV, M4A, OGG, Opus, FLAC, WebM, MP4, MOV

Como funciona

  1. Abra a gravação. Solte um arquivo de áudio ou vídeo na página. O navegador decodifica o som e desenha a forma de onda; nada é enviado.
  2. Toque em Transcrever. O idioma já vem em português; mude se a gravação for em outra língua. Na primeira vez o navegador baixa o modelo de fala (44 MB no pequeno) e o guarda para as próximas.
  3. Corrija e exporte. Toque no tempo de uma linha para ouvir o trecho, digite por cima do que saiu errado, ajuste início e fim e identifique quem fala. Salve como legenda ou como documento.

Qual modelo escolher para português

Os três modelos são o Whisper, da OpenAI, em tamanhos que rodam no processador de um notebook. Em português, a diferença entre eles aparece nos acentos, nas palavras curtas e nos nomes próprios.

  • Pequeno (44 MB). O mais rápido. Bom para um rascunho ou para áudio limpo de uma pessoa só. Em um teste nosso com 14 segundos de fala em português, errou uma preposição e deixou um acento de fora.
  • Médio (80 MB). No mesmo teste, acertou o texto inteiro. É o ponto de equilíbrio para o dia a dia.
  • Grande (252 MB). O mais preciso e o mais lento. Vale para entrevistas, reuniões com ruído e tudo o que será publicado.

Esses testes foram feitos com frases curtas e voz sintética em 3 de outubro de 2026; uma gravação real, com ruído e sotaque, erra mais. Por isso o editor fica logo abaixo da onda: a transcrição automática é o ponto de partida, e a revisão é sua.

Para que as pessoas usam

  • Entrevistas e pesquisa. Preencha o campo de falante em cada linha e exporte em DOCX: o arquivo sai com o tempo de início e o nome em negrito, pronto para citar.
  • Aulas e reuniões. Copie o texto corrido para suas anotações. Gravações longas pedem um computador com boa memória; dividir o arquivo em partes resolve.
  • Legendas. Exporte SRT para YouTube e editores de vídeo, ou VTT para players na web. Com um vídeo aberto, a legenda aparece sobre a imagem enquanto toca.
  • Áudios do WhatsApp. Há uma página só para isso, com o passo a passo para salvar o áudio como arquivo.

O que “no seu aparelho” quer dizer

Serviços de transcrição na nuvem recebem o seu arquivo e devolvem o texto. Aqui acontece o contrário: o modelo vem até o arquivo. Ele é baixado para o navegador e roda ali.

Uma requisição sai do seu aparelho: o download do modelo no Hugging Face, que vê o seu endereço IP como qualquer site que você visita. Ele não recebe áudio nem texto. Os detalhes estão na política de privacidade (em inglês).

Por que usar o Transcribe Tools

O arquivo fica no seu aparelho
O navegador decodifica a gravação e um modelo Whisper a transcreve em um Web Worker. Nem o áudio nem o texto são enviados a este site.
Você vê o download antes de começar
O modelo de fala é o único download: 44 MB, 80 MB ou 252 MB, conforme o que você escolher. Ele vem uma vez do Hugging Face e fica guardado no navegador.
Editor preso à forma de onda
Cada linha é uma faixa sob a onda. Toque no tempo para ouvir, corrija o texto e mova o início e o fim.
SRT, VTT, TXT e DOCX
Os quatro arquivos são gerados no navegador a partir da mesma transcrição, com o nome dos falantes quando você preenche.
Recarregar não apaga o trabalho
A transcrição é salva neste navegador enquanto você digita, e “Limpar transcrição” remove o rascunho.
Sem cadastro e sem contagem de minutos
Não existe conta. O limite é a memória e o processador do seu aparelho.

Perguntas frequentes

O áudio é enviado para algum servidor?

Não. O arquivo é decodificado pelo seu navegador e transcrito por um modelo de fala Whisper que roda no próprio aparelho. A única coisa baixada é o modelo, do Hugging Face, no primeiro uso.

Qual o tamanho do download?

O modelo pequeno tem 44 MB, o médio 80 MB e o grande 252 MB. O tamanho aparece antes de começar, e o navegador guarda o modelo: da segunda vez não há download.

A transcrição em português é boa?

Com fala clara de uma pessoa, o modelo pequeno já acerta a maior parte, mas costuma errar acentos e palavras curtas. Nos nossos testes com frases em português, os modelos médio e grande acertaram o texto inteiro. Para entrevistas, ruído ou sotaque marcado, prefira o grande e revise no editor.

Tem limite de minutos ou precisa de cadastro?

Não há cadastro nem contagem de minutos. O limite é o seu aparelho: uma hora de áudio ocupa cerca de 230 MB de memória depois de decodificada, então gravações muito longas podem falhar em celulares e computadores antigos.

Dá para exportar legenda?

Sim: SRT e VTT para vídeo, TXT e DOCX para texto. Cada linha tem início e fim que você pode ajustar antes de exportar.