音声文字起こし
無料
MP3、WAV、M4A、MP4 の音声ファイルを無料で文字起こし。ブラウザ内で処理され、アップロードは不要です。
ここに音声ファイルをドロップ
クリックして選択も可能 — MP3、WAV、M4A、OGG、WEBM、MP4 対応 · データが端末外に出ることはありません
音声ファイルを無料で文字起こしできるブラウザツール
この無料の音声文字起こしツールは、MP3、WAV、M4A、OGG、WEBM、MP4 の音声ファイルをテキスト化します。音声ファイルを追加し、言語を選んで文字起こしを開始すると、Whisper Tiny がブラウザ内でローカル処理します。多くのオンライン文字起こしサービスと違い、ファイルをアップロードしないため、会議、インタビュー、ボイスメモも端末内で処理できます。
音声を追加する
MP3、WAV、M4A、OGG、WEBM、MP4 のいずれかのファイルをドロップゾーンにドラッグするか、クリックしてファイルを選択します。音声はページに直接読み込まれ、サーバーに送信されることはありません。
言語を選んで文字起こしする
話されている言語を選択するか、自動検出のままにして「文字起こしする」を押します。Whisper Tiny モデルが初回のみダウンロードされ(約 40 MB)、あなたの CPU 上で発話をテキストに変換します。
文字起こし結果をコピーまたはダウンロードする
文字起こし結果を確認し、クリップボードにコピーするか、.txt ファイルとしてダウンロードします。動画の字幕用には、タイムスタンプ付きの .srt / .vtt 字幕としてもダウンロードできます。
音声をテキスト化
発話が含まれる録音を指定するだけで、編集可能なテキストが返ってきます。手作業での打ち直しも、タイムラインを行き来する必要も、高額な文字起こしサービスも不要です。
Whisper AI で音声文字起こし
認識には OpenAI の Whisper Tiny モデルを使用しています。これは本物のニューラル音声認識ネットワークで、サーバーではなく WebAssembly を通じてローカルで動作します。
MP3、WAV、M4A ほか多数の形式に対応
ボイスメモはたいてい M4A、ポッドキャストや音楽はたいてい MP3、録音は WAV であることが多いです。これらはすべて、OGG、WEBM、そして MP4 動画の音声トラックとともに利用できます。
タイムスタンプ付き字幕
プレーンテキストだけでなく、タイムコード付きの SRT や VTT の字幕ファイルも書き出せます。そのまま動画の字幕として使え、すべてブラウザ内で生成されます。
無料・無制限
本当の意味で無料の音声テキスト変換ツールです。アカウント登録もクレジットも透かしもなく、分単位の上限もありません。何本でも好きなだけ文字起こしできます。
2 回目以降はオフラインでも動作
一度モデルがブラウザにキャッシュされれば、文字起こしにネットワークは一切不要です。飛行機の中でも、ファイアウォールの内側でも、音声からテキストへの変換を続けられます。
インタビューや会議
録音したインタビュー、会議、講義を検索可能なテキストに変換し、引用したり要約したり、メモに貼り付けたりできます。しかも機密性の高い会話をクラウドサービスに送る必要はありません。
ボイスメモと口述筆記
とっさのボイスメモ、口述したアイデア、電話の録音を編集可能なテキストに変換します。すでに声に出したことを、あらためて打ち直す必要はありません。
字幕とキャプション
動画の音声トラックから SRT や VTT の字幕を生成し、ポッドキャスト、チュートリアル、SNS 用クリップに字幕を付けてアクセシビリティを高めます。
MP3 をテキストに
ポッドキャスト、音楽、ダウンロードコンテンツで最も一般的な音声形式です。事前に変換することなく、MP3 をそのままテキストに変換できます。
WAV をテキストに
多くのレコーダーや DAW が出力する非圧縮形式です。WAV はロスレスのため、通常は最もクリーンで正確な文字起こし結果が得られます。
M4A をテキストに
iPhone のボイスメモや多くのスマートフォンのレコーダーが保存に使う形式です。端末から直接、M4A のボイスノートを文字起こしできます。
OGG、WEBM、MP4
ブラウザやアプリの録音はしばしば OGG や WEBM で、MP4 動画には音声トラックが含まれています。いずれも別途変換する手間なく、デコードして文字起こしできます。
あえて選んだ、極小モデル
文字起こしには、OpenAI の Whisper ファミリーで最小のモデルである Whisper Tiny を使っています。量子化された重みは約 40 MB。このサイズだからこそ、ブラウザでの文字起こしが現実的になります。大きな Whisper モデルは数ギガバイトにもなり、訪問者のブラウザに配信することはできません。このモデルは WebAssembly 上の ONNX Runtime Web を通じて動作するため、本来サーバーで動くはずのニューラルネットワークが、あなたの CPU 上でそのまま動きます。Whisper Tiny は速度とサイズと引き換えに、いくらかの精度を手放しています。鮮明な発話はよく認識できますが、強い訛り、背景雑音、声の重なりは、どんな極小モデルにとっても難しい対象です。
設計段階から多言語対応
Whisper Tiny は多言語モデルです(英語専用の tiny.en ではありません)。英語、中国語、日本語、韓国語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、ロシア語、アラビア語、ヒンディー語をはじめ、数十の言語の発話を認識します。最良の結果を得るにはセレクターから話されている言語を選択するか、Whisper に自動検出させてください。
アップロードなし、サーバーなし
音声を送るアップロード先も API 呼び出しも存在しません。ファイルはページが読み込み、同じブラウザタブ内で動くモデルに渡されます。
何も保存されません
音声がそもそもサーバーに届かないため、保持するもの、記録するもの、削除するものが存在しません。タブを閉じれば、録音もその文字起こし結果も痕跡ごと消えます。
機密録音にも安心
インタビュー、カウンセリングのセッション、法律関連の通話、非公開の会議も、ネットワークを一度も経由せずに文字起こしできます。これは、ほとんどのオンライン文字起こしツールが正直には言えないことです。
通信するのはモデルだけ
ネットワークを通るのはモデル本体だけで、それはブラウザへとダウンロードされます。データはあなたへ流れてくるだけで、あなたから流れ出ることはありません。
多くの音声テキスト変換ツールはファイルをアップロードする
よくあるオンライン文字起こしサービスは、録音をサーバーに送信し、そこで音声認識を実行して結果のテキストを返します。つまりあなたの音声は他社のディスク上に置かれ、その会社の保持ポリシーに従うことになります。このツールでは、録音はあなたの端末に留まります。
登録不要、分単位の上限なし
クラウド型の文字起こしサービスは、分単位の上限、月間クォータ、登録の壁で無料利用を絞ります。1 分ごとに自社の計算リソースを消費するからです。ブラウザ内の文字起こしが使うのはあなたの CPU なので、計測して制限する理由がありません。
精度について正直に
極小モデルは、そもそもローカルで動かせることと引き換えに、いくらかの精度を手放しています。鮮明な発話では非常に使いやすいですが、雑音の多い音声、強い訛り、話者の声が重なる場面では、何語か修正する必要があると考えてください。スタジオ品質の精度が必要な場合は、より大きなモデルを検討することをおすすめします。
01音声をテキストに変換するにはどうすればいいですか?+
このページ上部のボックスに音声ファイルをドロップし、話されている言語を選択(または自動検出のままに)して、「文字起こしする」をクリックします。音声認識モデルが音声を読み取り、コピーしたり .txt、.srt、.vtt としてダウンロードしたりできる文字起こし結果を生成します。アカウント登録もインストールも不要です。
02この音声テキスト変換ツールは無料ですか?+
はい、完全に無料で無制限です。アカウントもクレジット制も透かしもなく、文字起こしできるファイル数や時間にも上限はありません。文字起こしはあなた自身のコンピューター上で動くため、利用者に転嫁すべきサーバー費用が発生しないのです。
03音声はサーバーにアップロードされますか?+
いいえ。ここが多くのオンライン音声テキスト変換ツールとの最大の違いです。ファイルはページが直接読み込み、ブラウザタブ内で動くモデルが処理します。音声がネットワークを通ることはないため、こちらが保存できるものも、聞けるものも存在しません。
04どの音声形式を文字起こしできますか?+
MP3、WAV、M4A、OGG、WEBM、MP4 に加えて AAC、FLAC にも対応しています。ボイスメモ、ポッドキャスト、レコーダーの出力、ブラウザの録音、動画の音声トラックまでこれでカバーできます。ファイルサイズは 200 MB まで対応しています。
05どの言語に対応していますか?+
Whisper Tiny は多言語モデルで、英語、中国語、日本語、韓国語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、オランダ語、ロシア語、ポーランド語、ウクライナ語、インドネシア語、ベトナム語、タイ語、マレー語、ヒンディー語、アラビア語、トルコ語、ヘブライ語、ギリシャ語、チェコ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語など、数十の言語の発話を認識します。セレクターから選択するか、自動検出に任せてください。
06どの音声認識モデルを使っていますか?+
OpenAI の Whisper ファミリーで最小の多言語モデルである Whisper Tiny です。量子化された重みは約 40 MB。WebAssembly 上の ONNX Runtime Web を通じて、すべてブラウザ内で動作します。英語専用の tiny.en ではなく、多言語版のチェックポイントを使用しています。
07タイムスタンプ付きの字幕は取得できますか?+
はい。プレーンテキストに加えて、文字起こし結果をタイムコード付きの .srt や .vtt の字幕ファイルとしてダウンロードでき、そのまま動画の字幕として使えます。タイムスタンプは、モデルが文字起こしを行う際に生成されます。
08最初の文字起こしだけ時間がかかるのはなぜですか?+
初回の実行では Whisper モデル(約 40 MB)をダウンロードし、WebAssembly ランタイムをコンパイルします。その後モデルはブラウザにキャッシュされるため、以降のファイルはダウンロードなしで即座に文字起こしされます。
09精度はどのくらいですか?+
Whisper Tiny は最小のモデルなので、最大限の精度よりも速度とサイズを優先しています。鮮明な単一話者の発話では非常に使いやすいですが、雑音の多い音声、強い訛り、声の重なりでは、何語か修正する必要があると考えてください。自動検出ではなく実際の話されている言語を指定すると、通常は結果が向上します。
10オフラインでも使えますか?+
初回の実行以降は使えます。ブラウザがモデルをキャッシュしてしまえば、それ以上の通信は発生しないため、接続が一切なくても音声からテキストへの変換を続けられます。
音声はすべてブラウザ内で処理され、送信も保存もされないため、このツールの利用によって当社へのデータ移転が生じることはありません。そのため、GDPR や HIPAA、社内の機密情報規定の対象となる録音にも適しています。ただし、文字起こし結果を適切に取り扱う責任は利用者にあります。