Áudio

Transcrever áudio para texto online grátis

Transcreva gravações para texto diretamente no navegador, com detecção automática de idioma, timestamps e ferramentas de revisão.

  • GrátisSem cadastro
  • Processamento localSeu áudio fica no dispositivo
  • Revisão completaTXT, SRT, VTT e JSON

Como transcrever áudio para texto?

1

Selecione o áudio

Adicione uma gravação compatível e confira duração, formato, tamanho e forma de onda.

2

Transcreva localmente

Escolha idioma e qualidade. O Worker carrega o modelo somente após o clique e processa o áudio em trechos.

3

Revise e exporte

Ouça pontos exatos, corrija o texto e baixe TXT, SRT, VTT ou JSON.

Quais formatos de áudio podem ser transcritos?

A ferramenta aceita MP3, WAV, M4A, AAC, OGG, Opus, FLAC e WebM de áudio. A compatibilidade real depende dos codecs implementados pelo navegador. O arquivo é validado e decodificado localmente; se o navegador não entender o formato, nenhum upload alternativo é realizado.

Arquivos de vídeo não são aceitos nesta versão. Vídeo para texto terá uma ferramenta própria, com decisões específicas de demux e desempenho.

Como funciona a transcrição local com Whisper?

Modelo proporcional ao dispositivo

Whisper Small é reservado a hardware WebGPU mais forte. Whisper Base atende o equilíbrio e o fallback WASM quantizado.

Áudio dividido em trechos

A decodificação é reamostrada para 16 kHz e enviada ao Worker em janelas de 29 segundos, com pausa segura entre trechos.

Detecção de idioma

No automático, o modelo multilíngue decide o idioma. A interface usa Português (Brasil) apenas como fallback de produto.

Conteúdo em memória

O modelo pode permanecer no cache do navegador, mas áudio, transcrição e dados de revisão não são persistidos.

Como revisar uma transcrição ouvindo o áudio?

Os timestamps retornados pelo modelo são associados ao player. Clique em qualquer horário para buscar o ponto correspondente, altere a velocidade entre 0,75x e 2x e edite o trecho sem perder o intervalo temporal.

A busca localiza ocorrências no resultado e permite avançar ou voltar entre trechos. A marca “Revisar” usa somente sinais verificáveis, como volume muito baixo, repetição incomum ou texto longo sem pontuação, e não inventa uma nota de confiança.

Como transcrever áudios longos?

Recomendamos até 30 minutos por arquivo em computadores. Entre 30 e 60 minutos, mantenha a aba aberta; entre 60 e 120, dividir o áudio costuma ser mais estável. Acima de 120 minutos, a ferramenta pede confirmação explícita.

Em celulares ou hardware limitado, a faixa ideal é de até 15 minutos. O processamento local usa a memória e a energia do próprio aparelho, por isso tempo e estabilidade variam de forma real entre dispositivos.

TXT, SRT, VTT ou JSON: qual formato escolher?

TXT

Texto simples revisado, sem marcação temporal.

SRT

Legenda numerada, compatível com editores e players populares.

VTT

Legenda WebVTT adequada para reprodução em páginas web.

JSON

Metadados, status parcial, modelo e lista estruturada de segmentos.

O que permanece privado?

O arquivo, o nome, a forma de onda, o vocabulário, a transcrição e os timestamps não são colocados em URL, cookies, analytics, localStorage ou sessionStorage. As únicas solicitações específicas da engine baixam JavaScript, WASM e pesos ONNX estáticos depois da ação do usuário.

Perguntas frequentes

Meu áudio é enviado para algum servidor?

Não. O arquivo é decodificado e transcrito no navegador. A rede é usada somente para carregar os arquivos estáticos do aplicativo, do runtime e do modelo de reconhecimento de fala.

Quais formatos de áudio são aceitos?

A ferramenta reconhece MP3, WAV, M4A, AAC, OGG, Opus, FLAC e WebM de áudio. A decodificação final depende dos codecs disponíveis no navegador; se um formato não for compatível, a página informa o problema localmente.

Posso transcrever áudio do WhatsApp?

Sim, quando o arquivo exportado pelo WhatsApp estiver em um formato de áudio que o navegador consegue decodificar, como Opus em contêiner OGG.

A ferramenta detecta o idioma automaticamente?

Sim. No modo automático, o próprio modelo Whisper multilíngue identifica o idioma durante a inferência. Se você já souber o idioma, a seleção manual pode tornar o comportamento mais previsível.

Português do Brasil é compatível?

Sim. O modelo Whisper multilíngue reconhece português. A interface usa Português (Brasil) como fallback de produto, sem afirmar que o modelo diferencia automaticamente a variante brasileira da europeia.

Quanto tempo leva para transcrever?

Depende do modelo escolhido, do tamanho do áudio e do processador ou GPU disponível. A estimativa restante só aparece depois de pelo menos dois trechos concluídos, quando existe uma amostra real do dispositivo.

Posso pausar ou cancelar?

Sim. A pausa ocorre ao terminar o trecho atual. Cancelar interrompe o Worker, libera os recursos do modelo e mantém os trechos já concluídos para revisão e exportação parcial.

Qual duração é recomendada?

Recomendamos até 30 minutos por arquivo em computadores e até 15 minutos em celulares ou hardware limitado. Arquivos maiores podem funcionar, mas exigem mais memória e tempo.

Posso corrigir o texto antes de baixar?

Sim. O texto completo e cada trecho com timestamp são editáveis. As exportações usam o conteúdo revisado.

Como criar legendas SRT ou VTT?

Depois da transcrição, revise os trechos com tempo e use Baixar SRT ou Baixar VTT. Os tempos são derivados dos segmentos retornados pelo modelo.

O modelo fica salvo no navegador?

Os arquivos estáticos do modelo podem ficar no cache do navegador para reduzir downloads futuros. O áudio, o nome do arquivo, a transcrição, os timestamps e o vocabulário não são salvos pela ferramenta.

Por que alguns trechos aparecem como Revisar?

A marca usa heurísticas verificáveis, como volume muito baixo, repetição incomum ou trecho longo sem pontuação. Ela não é uma porcentagem inventada de confiança do modelo.