Transcribe any audio using Whisper AI — runs entirely in your browser. Private, free, no sign-up, no upload to servers.
Whisper 是当前最强开源转录模型。历史上意味着 Python、GPU 和命令行——对普通用户完全不可及。浏览器版 Whisper 让流程变成:拖入音频,转录,下载 SRT 或 TXT。零安装,零账号,零代码。
隐私是关键。客户端 Whisper 意味着音频永远不离开设备。采访录音、医疗口述、法律证词、机密会议——任何不能上传给第三方 API 的音频,现在都可以安全转录。
模型大小的权衡:tiny/base 最快但精度一般,适合清晰音频;small/medium 是实用甜点,处理口音、噪声、术语都还不错;large 精度最高但慢——每分钟音频约 30 秒计算时间。
干净音频比大模型更重要。tiny 模型跑干净录音的效果比 large 跑浑浊音频还好。有录音控制时用好话筒、控制背景噪音、近讲。极长文件(2+ 小时)在浏览器内存里可能受限——用音频软件切成 30 分钟块分别转录。
是的——模型权重完全相同。区别只是计算速度,取决于你的设备而非模型质量。
MP3、WAV、M4A、MP4、WebM、OGG、FLAC——任何浏览器能通过 Web Audio API 解码的格式。视频文件也支持,会提取音频轨道。
能——模型下载一次后(缓存在浏览器里),转录完全离线运行。适合飞机上或离线设备。
Whisper 支持 99 种语言。对未知音频用自动检测;已知语言可以明确设置获得更快更准的结果。
不会。音频完全在浏览器里通过 WebAssembly 解码和转录,没有上传、存储或日志。