Free Web Tool

Free Audio to Text

Transcribe any audio using Whisper AI — runs entirely in your browser. Private, free, no sign-up, no upload to servers.

🎵
Drop audio here or browse
MP3 · WAV · M4A · OGG · FLAC · WebM · max 25 MB
Language
🤖 Uses Whisper Tiny AI model (~40 MB, downloaded once and cached). All processing runs in your browser — your audio never leaves your device.

How to use

1
Upload an audio file (MP3, WAV, M4A…) or record directly from your mic.
2
Select a language or leave on Auto-detect. Then click Transcribe.
3
The first run downloads the Whisper AI model (~40 MB). After that it's instant — even offline.
4
Copy or download the transcript. Nothing is sent to any server.

Frequently Asked Questions

Is this free?
Yes — completely free, no sign-up, no limits.
Is my audio private?
Yes. Your audio never leaves your device. The Whisper AI model runs entirely inside your browser using WebAssembly — no server, no tracking.
What audio formats are supported?
Any format your browser can decode: MP3, WAV, M4A, OGG, FLAC, WebM. If it plays in your browser, it can be transcribed.
What languages does it support?
Whisper supports 99 languages including English, Chinese, Japanese, Korean, Spanish, French, German, Portuguese, Indonesian, Arabic, Russian and more. Use Auto-detect or pick a language for better accuracy.
Why does it take time on first use?
The Whisper AI model (~40 MB) is downloaded once from a CDN and cached by your browser. After the first use, transcription starts immediately — even offline.
Is there a file size limit?
25 MB per file. For longer recordings, consider splitting the audio first. Processing time depends on your device — modern laptops handle 5 minutes of audio in about 30 seconds.
Also try
🔊
Free Text to Speech
Convert text to natural speech using your device's voices. Free, no sign-up.
🎬
YouTube Caption Downloader
Download subtitles as SRT or TXT from any YouTube video. Free, no sign-up.

Cas d'usage courants

Whisper est le modèle open-source de transcription le plus performant. Historiquement il fallait Python, un GPU et la ligne de commande — totalement inaccessible pour la plupart des utilisateurs. Whisper dans le navigateur inverse ça : glisse l'audio, transcris, télécharge SRT ou TXT. Sans installation, sans compte, sans code.

La confidentialité est décisive. Whisper côté client signifie que l'audio ne quitte jamais l'appareil. Enregistrements d'interviews, dictées médicales, dépositions légales, réunions confidentielles — tout audio que tu ne peux ni ne dois envoyer à une API tierce est désormais transcriptible sans risque.

Conseils et astuces

Compromis de taille de modèle : tiny/base est le plus rapide mais précision moyenne, pour audio propre. small/medium est le sweet spot pratique, gère accents, bruit et jargon raisonnablement. large a la précision maximale mais est lent — environ 30 secondes de calcul par minute d'audio.

Un audio propre compte plus qu'un gros modèle. Un modèle tiny sur enregistrement propre bat un large sur audio brouillé. Si tu contrôles l'enregistrement, utilise un bon micro, réduis le bruit ambiant, capte de près. Fichiers très longs (2+ heures) peuvent buter sur la mémoire du navigateur — découpe en tranches de 30 minutes avec un éditeur audio et transcris chaque partie.

Questions fréquentes

Whisper dans le navigateur est-il aussi précis que la version desktop ?

Oui — les poids du modèle sont identiques. La seule différence est la vitesse, qui dépend de ton appareil et non de la qualité du modèle.

Quels formats audio sont supportés ?

MP3, WAV, M4A, MP4, WebM, OGG, FLAC — tout ce que le navigateur peut décoder via la Web Audio API. Les vidéos aussi ; la piste audio est extraite.

Ça marche hors ligne ?

Oui — une fois le modèle téléchargé (en cache dans le navigateur), la transcription tourne totalement hors ligne. Idéal pour les vols ou les machines isolées.

Quelles langues sont supportées ?

Whisper supporte 99 langues. Laisse Auto-détection pour audio inconnu ; spécifie la langue pour des résultats un peu plus rapides et précis.

Mes fichiers audio sont-ils uploadés ?

Non. L'audio est décodé et transcrit entièrement dans ton navigateur via WebAssembly. Aucun upload, aucun stockage, aucun log.

Outils gratuits associés

Built in the quiet hours, between everything else. Bookmark it for next time — and if it helped — Buy me a coffee
GistAI
GistAI App YT captions & AI summary Free on Google Play
If it saved you time — Buy me a coffee