Free Web Tool

Free Audio to Text

Transcribe any audio using Whisper AI — runs entirely in your browser. Private, free, no sign-up, no upload to servers.

🎵
Drop audio here or browse
MP3 · WAV · M4A · OGG · FLAC · WebM · max 25 MB
Language
🤖 Uses Whisper Tiny AI model (~40 MB, downloaded once and cached). All processing runs in your browser — your audio never leaves your device.

How to use

1
Upload an audio file (MP3, WAV, M4A…) or record directly from your mic.
2
Select a language or leave on Auto-detect. Then click Transcribe.
3
The first run downloads the Whisper AI model (~40 MB). After that it's instant — even offline.
4
Copy or download the transcript. Nothing is sent to any server.

Frequently Asked Questions

Is this free?
Yes — completely free, no sign-up, no limits.
Is my audio private?
Yes. Your audio never leaves your device. The Whisper AI model runs entirely inside your browser using WebAssembly — no server, no tracking.
What audio formats are supported?
Any format your browser can decode: MP3, WAV, M4A, OGG, FLAC, WebM. If it plays in your browser, it can be transcribed.
What languages does it support?
Whisper supports 99 languages including English, Chinese, Japanese, Korean, Spanish, French, German, Portuguese, Indonesian, Arabic, Russian and more. Use Auto-detect or pick a language for better accuracy.
Why does it take time on first use?
The Whisper AI model (~40 MB) is downloaded once from a CDN and cached by your browser. After the first use, transcription starts immediately — even offline.
Is there a file size limit?
25 MB per file. For longer recordings, consider splitting the audio first. Processing time depends on your device — modern laptops handle 5 minutes of audio in about 30 seconds.
Also try
🔊
Free Text to Speech
Convert text to natural speech using your device's voices. Free, no sign-up.
🎬
YouTube Caption Downloader
Download subtitles as SRT or TXT from any YouTube video. Free, no sign-up.

Casos de uso comunes

Whisper es el modelo open-source más potente para transcripción. Históricamente requería Python, GPU y línea de comandos — completamente inaccesible para la mayoría de usuarios. Whisper en el navegador transforma el flujo: arrastra el audio, transcribe, descarga SRT o TXT. Sin instalación, sin cuentas, sin código.

La privacidad es decisiva. Whisper del lado del cliente significa que el audio nunca sale de tu dispositivo. Grabaciones de entrevistas, dictados médicos, deposiciones legales, reuniones confidenciales — cualquier audio que no puedes ni debes subir a una API de terceros, ahora se puede transcribir sin riesgo.

Consejos y prácticas

Compromiso de tamaño de modelo: tiny/base es el más rápido pero precisión moderada, apto para audio limpio. small/medium es el punto dulce práctico, maneja acentos, ruido y jerga razonablemente. large tiene la máxima precisión pero es lento — unos 30 segundos de cómputo por minuto de audio.

Audio limpio importa más que modelo grande. Un modelo tiny sobre grabación limpia supera a un large sobre audio turbio. Si controlas la grabación, usa buen micrófono, reduce ruido de fondo, graba de cerca. Archivos muy largos (2+ horas) pueden chocar con memoria del navegador — divide en trozos de 30 minutos con cualquier editor de audio y transcribe cada uno.

Preguntas frecuentes

¿Whisper en navegador es tan preciso como la versión de escritorio?

Sí — los pesos del modelo son idénticos. La única diferencia es la velocidad, que depende de tu dispositivo, no de la calidad del modelo.

¿Qué formatos de audio se soportan?

MP3, WAV, M4A, MP4, WebM, OGG, FLAC — cualquier cosa que el navegador pueda decodificar con la Web Audio API. Los videos también funcionan; se extrae la pista de audio.

¿Funciona sin conexión?

Sí — tras la descarga inicial del modelo (cacheado en el navegador), la transcripción funciona totalmente offline. Ideal para vuelos o dispositivos aislados.

¿Qué idiomas se soportan?

Whisper soporta 99 idiomas. Deja Auto-detectar para audio desconocido; especifica el idioma para resultados algo más rápidos y precisos.

¿Se suben mis archivos de audio?

No. El audio se decodifica y transcribe íntegramente en tu navegador con WebAssembly. Sin uploads, sin almacenamiento, sin logs.

Herramientas relacionadas

Built in the quiet hours, between everything else. Bookmark it for next time — and if it helped — Buy me a coffee
GistAI
GistAI App YT captions & AI summary Free on Google Play
If it saved you time — Buy me a coffee