Como transcrever áudio para texto?
Selecione o áudio
Adicione uma gravação compatível e confira duração, formato, tamanho e forma de onda.
Transcreva localmente
Escolha idioma e qualidade. O Worker carrega o modelo somente após o clique e processa o áudio em trechos.
Revise e exporte
Ouça pontos exatos, corrija o texto e baixe TXT, SRT, VTT ou JSON.
Quais formatos de áudio podem ser transcritos?
A ferramenta aceita MP3, WAV, M4A, AAC, OGG, Opus, FLAC e WebM de áudio. A compatibilidade real depende dos codecs implementados pelo navegador. O arquivo é validado e decodificado localmente; se o navegador não entender o formato, nenhum upload alternativo é realizado.
Arquivos de vídeo não são aceitos nesta versão. Vídeo para texto terá uma ferramenta própria, com decisões específicas de demux e desempenho.
Como funciona a transcrição local com Whisper?
Modelo proporcional ao dispositivo
Whisper Small é reservado a hardware WebGPU mais forte. Whisper Base atende o equilíbrio e o fallback WASM quantizado.
Áudio dividido em trechos
A decodificação é reamostrada para 16 kHz e enviada ao Worker em janelas de 29 segundos, com pausa segura entre trechos.
Detecção de idioma
No automático, o modelo multilíngue decide o idioma. A interface usa Português (Brasil) apenas como fallback de produto.
Conteúdo em memória
O modelo pode permanecer no cache do navegador, mas áudio, transcrição e dados de revisão não são persistidos.
Como revisar uma transcrição ouvindo o áudio?
Os timestamps retornados pelo modelo são associados ao player. Clique em qualquer horário para buscar o ponto correspondente, altere a velocidade entre 0,75x e 2x e edite o trecho sem perder o intervalo temporal.
A busca localiza ocorrências no resultado e permite avançar ou voltar entre trechos. A marca “Revisar” usa somente sinais verificáveis, como volume muito baixo, repetição incomum ou texto longo sem pontuação, e não inventa uma nota de confiança.
Como transcrever áudios longos?
Recomendamos até 30 minutos por arquivo em computadores. Entre 30 e 60 minutos, mantenha a aba aberta; entre 60 e 120, dividir o áudio costuma ser mais estável. Acima de 120 minutos, a ferramenta pede confirmação explícita.
Em celulares ou hardware limitado, a faixa ideal é de até 15 minutos. O processamento local usa a memória e a energia do próprio aparelho, por isso tempo e estabilidade variam de forma real entre dispositivos.
TXT, SRT, VTT ou JSON: qual formato escolher?
TXT
Texto simples revisado, sem marcação temporal.
SRT
Legenda numerada, compatível com editores e players populares.
VTT
Legenda WebVTT adequada para reprodução em páginas web.
JSON
Metadados, status parcial, modelo e lista estruturada de segmentos.
O que permanece privado?
O arquivo, o nome, a forma de onda, o vocabulário, a transcrição e os timestamps não são colocados em URL, cookies, analytics, localStorage ou sessionStorage. As únicas solicitações específicas da engine baixam JavaScript, WASM e pesos ONNX estáticos depois da ação do usuário.
