Transcribe any audio using Whisper AI — runs entirely in your browser. Private, free, no sign-up, no upload to servers.
Whisperは現在最強のオープンソース転写モデルです。従来はPython、GPU、コマンドラインが必要で一般ユーザーには手が届きませんでした。ブラウザ版Whisperなら音声をドロップ、転写、SRTまたはTXTをダウンロード——インストール不要、アカウント不要、コード不要。
プライバシーは決定的です。クライアントサイドWhisperなら音声はデバイスから出ません。インタビュー録音、医療口述、法的証言、機密会議——第三者APIに上げられない音声も安全に転写できます。
モデルサイズのトレードオフ:tiny/baseは最速だが精度は普通、クリーンな音声向け。small/mediumは実用的なスイートスポット、訛り・ノイズ・専門用語を程よく処理。largeは最高精度だが遅く、音声1分あたり約30秒の計算時間。
クリーンな音声は大きなモデルより重要です。tinyモデルでもクリーンな録音ならlargeで濁った音声を回すより結果が良いです。録音を制御できるならまともなマイク、背景ノイズ抑制、近接マイクで。超長時間ファイル(2+時間)はブラウザメモリに引っかかる可能性——音声ソフトで30分単位に分割してから転写を。
はい——モデル重みは完全に同じです。違いは計算速度のみで、モデル品質ではなくデバイスに依存します。
MP3、WAV、M4A、MP4、WebM、OGG、FLAC——ブラウザがWeb Audio APIでデコードできるものすべて。動画ファイルも対応、音声トラックを抽出します。
動きます——モデルを一度ダウンロード(ブラウザにキャッシュ)すれば、転写は完全オフラインで動作。飛行機内やエアギャップ環境で有用。
Whisperは99言語対応。未知の音声には自動検出、既知言語は明示指定で若干高速・高精度の結果が得られます。
いいえ。音声はブラウザ内でWebAssemblyを介してデコード・転写されます。アップロード、保存、ログ記録は一切ありません。