Áudio para Markdown
Transcreva MP3, WAV e outros formatos para texto usando Whisper. 100% no navegador, grátis e privado. Suporta português.
O que é Áudio para Markdown?
O humberto.ai transcreve arquivos de áudio (MP3, WAV, WebM, OGG, FLAC ou M4A, até 50 MB cada, em lote de até 10) para texto em Markdown. A transcrição roda 100% no navegador com o modelo Whisper tiny (Xenova) — o áudio nunca é enviado a nenhum servidor. As opções extras "Gerar Artigo" e "Extrair Ata" enviam apenas o texto já transcrito para a IA gratuita do site reescrever em Markdown estruturado.
Como usar
- Escolha o idioma da fala (ou deixe em "Automático") e ative "Processar em lote" se for transcrever vários arquivos de uma vez.
- Arraste ou selecione até 10 arquivos de áudio (MP3, WAV, WebM, OGG, FLAC, M4A — até 50 MB cada).
- Clique em "Transcrever": o Whisper tiny carrega e roda no navegador, convertendo a fala em Markdown sem sair do seu dispositivo.
- Alterne entre pré-visualização e código-fonte, copie o texto ou baixe o arquivo .md gerado.
- Opcional: use "Gerar Artigo" ou "Extrair Ata" para reescrever a transcrição com IA gratuita em um formato estruturado.
Perguntas frequentes
O áudio é enviado para algum servidor?
Não. A transcrição roda inteiramente no navegador com o modelo Whisper tiny (Xenova/whisper-tiny); o arquivo de áudio não sai do seu dispositivo. Só o texto já transcrito é enviado a um provedor de IA gratuito se você usar "Gerar Artigo" ou "Extrair Ata".
Quais formatos de áudio são aceitos e qual o limite de tamanho?
MP3, WAV, WebM, OGG, FLAC e M4A, até 50 MB por arquivo (cerca de 5–10 minutos de áudio).
Posso transcrever vários arquivos de uma vez?
Sim. Ative "Processar em lote" para enviar até 10 arquivos; cada um vira uma seção separada (## nome-do-arquivo) no Markdown final.
O texto saiu no idioma errado ou "picado". Como corrijo?
Selecione manualmente o idioma da fala (em vez de "Automático") antes de transcrever. O modelo tiny é limitado na deteção automática, principalmente em áudios longos ou ruidosos; áudios grandes já usam segmentação de 30s para ficar mais fluido.
O que fazem os botões "Gerar Artigo" e "Extrair Ata"?
Enviam o texto já transcrito (não o áudio) para a cascata de IA gratuita do site (Gemini → OpenRouter) para reescrevê-lo como artigo de blog estruturado ou como ata de reunião com participantes, decisões e itens de ação.
Preciso de chave de API para usar a transcrição?
Não. A transcrição é gratuita e roda localmente no navegador. Só as funções opcionais de IA (artigo/ata) usam a cascata gratuita já configurada no site — não exigem chave sua.