インタビューと会議の音声録音が何時間もあり、テキストに変換する必要があります。OtterなどはFree tierが厳しく制限されていて、分単位の課金制だと費用がかさみます。2026年でも長時間の録音をテキスト化する本当に無料な方法ってありますか?努力が必要でもいいので。
あります — しかも珍しいことに、無料オプションが最高のオプションです:
Whisper(OpenAIのオープンソースモデル、パソコンで実行) これは「何時間もの録音、ゼロ予算」という質問への答えです:
- 完全無料、制限なし、アップロードなし — 音声はマシンから出ません(インタビュー・研究倫理上、しばしば必須)。
- 明確な音声に対する精度は有料サービスと同等か上回り、多言語(約100言語)やアクセント対応も優秀。
- 簡単な使い方:Whisperをラップした GUI アプリ — 例えば whisper.cpp をベースにした無料デスクトップアプリ(「whisper desktop app」をOS別で検索してください;Mac でのMacWhisperの無料版が最も有名)。MP3をドラッグ&ドロップするとタイムスタンプ付きテキストが出ます。
- 普通のノートパソコンなら small/medium モデルで概ねリアルタイムか更に高速に文字起こしでき、夜間バッチ処理も余裕です。
インストール不要な無料オプション(軽めのニーズ向け):
- Google Recorder(Pixel phones):無料のライブ文字起こし、驚くほど精度が高い。
- YouTube裏ワザ:音声をアンリストされた動画としてアップロード → 自動字幕を待つ → トランスクリプトをダウンロード。ちょっと不格好ですが無料で無制限。
- Word / OneNote文字起こし機能は存在しますが Microsoft 365 サブスクリプションと紐付けられていて、本当の意味で無料ではありません。
正直な期待値: 6人が喋っていて音質が悪い会議はどのツールでも(有料含む)メッシュなテキストになります。話者ラベリング(「誰が喋ったか」)は無料ツールが最も弱い部分です — Whisperは追加機能(ダイアライゼーション)が必要で、それもまだ試行錯誤が多いです。1対1のインタビューで音質が良ければ、無料の Whisper 出力はかなり綺麗です。
クリーンアップのコツ:生の文字起こしテキストの塊を無料のAIチャットボットに貼り付けて — 「文字起こしのエラーを直して、段落を加えて、要約はしないで」 — 引用を開始する前に処理しておくといいです。
音声はどういう形態ですか — 1対1のインタビューですか、それとも複数人の会議ですか?