Whisper Webとは何ですか?
Whisper Webは、OpenAIのWhisper AIモデルをブラウザ上で直接実行する音声認識ツールです。インストールやアカウント登録は不要で、マイク入力、ファイルアップロード、URL経由の3つの方法で音声をテキストに変換できます。Freeプランではすべての処理が端末内で完結し、データが外部に送信されることはありません。Unlimitedプランではクラウド処理により、1ファイル最大10時間・5GBまで対応します。ポッドキャスター、ジャーナリスト、学生、研究者など、100以上の言語に対応した高精度な文字起こしを求めるユーザーに適しています。
Whisper Webの特徴は何ですか?
- ブラウザ内ローカル処理: WebGPUとWebAssemblyを活用し、音声データを端末から出さずに文字起こし。Freeプランでは完全オフラインでも動作します(初回モデルダウンロード後)。
- 3つの入力方法: マイク(リアルタイム録音)、ファイルアップロード(200MB/20分までFree)、URLまたはブラウザ音声の直接取り込みに対応。
- 100以上の言語対応と自動検出: 英語、中国語、スペイン語、フランス語、ドイツ語、日本語など100以上の言語をサポート。話された言語を自動で識別し、手動選択不要。
- WebGPU高速処理: デバイスのGPUを活用し、通常のWebAssembly処理より3〜5倍高速な推論を実現。
- 複数エクスポート形式: 文字起こし結果をTXT、SRT(字幕)、VTT、JSON形式で出力可能。YouTube動画からの字幕生成などにも応用できます。
- Unlimitedプランでのクラウド処理: 月額10ドル(年払い)でファイル上限10時間/5GB、一度に50ファイルのバッチアップロード、全デバイス間での同期が可能。Freeではローカル処理のみ。
Whisper Webの使用例は何ですか?
- ポッドキャスター: 収録した音声ファイル(最大200MB)をブラウザにアップロードし、自動で文字起こし。SRTやVTT形式でエクスポートして字幕付きエピソードを公開。
- ジャーナリスト: インタビュー録音をマイク入力でリアルタイム文字起こし。100以上の言語対応で多言語取材にも対応し、ローカル処理で機密情報を保護。
- 学生・研究者: 講義の録音ファイルをアップロードし、テキスト化してノート作成。Unlimitedプランなら10時間までの長尺講義もクラウドで高速処理。
- 動画クリエイター: YouTube動画のURLから直接音声を抽出し、キャプションや字幕ファイル(SRT/VTT)を生成。Freeプランでも20分以内の動画に対応。
- 会議・ミーティングの文字起こし: ブラウザ上で録音を開始し、リアルタイムにテキスト化。データが端末外に出ないため、企業の機密情報にも安全。
- 言語学習者: 学習したい言語の音声ファイルをアップロードし、文字起こし結果と照らし合わせて聞き取り練習。自動言語検出機能で言語指定不要。
Whisper Webの使い方は?
- ブラウザを開く: 対応ブラウザ(Chrome、EdgeなどWebGPU対応)でWhisper Webの公式サイトにアクセスします。アカウント登録は不要です。
- モデルをダウンロード(初回のみ): 初回訪問時にWhisperモデルが自動でダウンロードされます。この後はオフラインでも動作可能です。
- 入力方法を選択: 画面の「From file」「Record」「From URL」のいずれかをクリック。ファイルを直接アップロード、マイク録音を開始、またはYouTubeなどの音声URLを貼り付けます。
- 文字起こしを開始: 自動で処理が始まり、数秒〜数分でテキストが表示されます。Freeプランでは200MB/20分まで。Unlimitedプランではさらに大容量ファイルをクラウド処理できます。
- 結果を確認・エクスポート: 生成されたテキストを画面上で確認し、TXT、SRT、VTT、JSON形式でダウンロード。必要に応じて編集も可能です。
- プライバシー設定を確認: Freeプランではデータが端末外に出ないことを確認。Unlimitedプランではクラウド処理後、ファイルは削除されます。









