AI Toolbox
AI Toolbox
ai-toolbox.ai
ツールボックス/audio / audio-to-text-converterローカル · クライアント側
§00 — 音声文字起こし 無料

音声文字起こし
無料

MP3、WAV、M4A、MP4 の音声ファイルを無料で文字起こし。ブラウザ内で処理され、アップロードは不要です。

§00 — 主な機能
ローカル文字起こし アップロード不要 100% プライベート 40以上の言語に対応
§01 — 仕組み

音声ファイルを無料で文字起こしできるブラウザツール

この無料の音声文字起こしツールは、MP3、WAV、M4A、OGG、WEBM、MP4 の音声ファイルをテキスト化します。音声ファイルを追加し、言語を選んで文字起こしを開始すると、Whisper Tiny がブラウザ内でローカル処理します。多くのオンライン文字起こしサービスと違い、ファイルをアップロードしないため、会議、インタビュー、ボイスメモも端末内で処理できます。

§02 — 音声ファイルを文字起こしする方法
1

音声を追加する

MP3、WAV、M4A、OGG、WEBM、MP4 のいずれかのファイルをドロップゾーンにドラッグするか、クリックしてファイルを選択します。音声はページに直接読み込まれ、サーバーに送信されることはありません。

2

言語を選んで文字起こしする

話されている言語を選択するか、自動検出のままにして「文字起こしする」を押します。Whisper Tiny モデルが初回のみダウンロードされ(約 40 MB)、あなたの CPU 上で発話をテキストに変換します。

3

文字起こし結果をコピーまたはダウンロードする

文字起こし結果を確認し、クリップボードにコピーするか、.txt ファイルとしてダウンロードします。動画の字幕用には、タイムスタンプ付きの .srt / .vtt 字幕としてもダウンロードできます。

§03 — 音声文字起こし無料ツールの機能

音声をテキスト化

発話が含まれる録音を指定するだけで、編集可能なテキストが返ってきます。手作業での打ち直しも、タイムラインを行き来する必要も、高額な文字起こしサービスも不要です。

Whisper AI で音声文字起こし

認識には OpenAI の Whisper Tiny モデルを使用しています。これは本物のニューラル音声認識ネットワークで、サーバーではなく WebAssembly を通じてローカルで動作します。

MP3、WAV、M4A ほか多数の形式に対応

ボイスメモはたいてい M4A、ポッドキャストや音楽はたいてい MP3、録音は WAV であることが多いです。これらはすべて、OGG、WEBM、そして MP4 動画の音声トラックとともに利用できます。

タイムスタンプ付き字幕

プレーンテキストだけでなく、タイムコード付きの SRT や VTT の字幕ファイルも書き出せます。そのまま動画の字幕として使え、すべてブラウザ内で生成されます。

無料・無制限

本当の意味で無料の音声テキスト変換ツールです。アカウント登録もクレジットも透かしもなく、分単位の上限もありません。何本でも好きなだけ文字起こしできます。

2 回目以降はオフラインでも動作

一度モデルがブラウザにキャッシュされれば、文字起こしにネットワークは一切不要です。飛行機の中でも、ファイアウォールの内側でも、音声からテキストへの変換を続けられます。

§04 — こんな用途に使われています

インタビューや会議

録音したインタビュー、会議、講義を検索可能なテキストに変換し、引用したり要約したり、メモに貼り付けたりできます。しかも機密性の高い会話をクラウドサービスに送る必要はありません。

ボイスメモと口述筆記

とっさのボイスメモ、口述したアイデア、電話の録音を編集可能なテキストに変換します。すでに声に出したことを、あらためて打ち直す必要はありません。

字幕とキャプション

動画の音声トラックから SRT や VTT の字幕を生成し、ポッドキャスト、チュートリアル、SNS 用クリップに字幕を付けてアクセシビリティを高めます。

§05 — MP3・WAV・M4A の音声ファイル文字起こし

MP3 をテキストに

ポッドキャスト、音楽、ダウンロードコンテンツで最も一般的な音声形式です。事前に変換することなく、MP3 をそのままテキストに変換できます。

WAV をテキストに

多くのレコーダーや DAW が出力する非圧縮形式です。WAV はロスレスのため、通常は最もクリーンで正確な文字起こし結果が得られます。

M4A をテキストに

iPhone のボイスメモや多くのスマートフォンのレコーダーが保存に使う形式です。端末から直接、M4A のボイスノートを文字起こしできます。

OGG、WEBM、MP4

ブラウザやアプリの録音はしばしば OGG や WEBM で、MP4 動画には音声トラックが含まれています。いずれも別途変換する手間なく、デコードして文字起こしできます。

§06 — エンジン: Whisper Tiny

あえて選んだ、極小モデル

文字起こしには、OpenAI の Whisper ファミリーで最小のモデルである Whisper Tiny を使っています。量子化された重みは約 40 MB。このサイズだからこそ、ブラウザでの文字起こしが現実的になります。大きな Whisper モデルは数ギガバイトにもなり、訪問者のブラウザに配信することはできません。このモデルは WebAssembly 上の ONNX Runtime Web を通じて動作するため、本来サーバーで動くはずのニューラルネットワークが、あなたの CPU 上でそのまま動きます。Whisper Tiny は速度とサイズと引き換えに、いくらかの精度を手放しています。鮮明な発話はよく認識できますが、強い訛り、背景雑音、声の重なりは、どんな極小モデルにとっても難しい対象です。

設計段階から多言語対応

Whisper Tiny は多言語モデルです(英語専用の tiny.en ではありません)。英語、中国語、日本語、韓国語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、ロシア語、アラビア語、ヒンディー語をはじめ、数十の言語の発話を認識します。最良の結果を得るにはセレクターから話されている言語を選択するか、Whisper に自動検出させてください。

§07 — プライバシー: 音声は一切アップロードされません

アップロードなし、サーバーなし

音声を送るアップロード先も API 呼び出しも存在しません。ファイルはページが読み込み、同じブラウザタブ内で動くモデルに渡されます。

何も保存されません

音声がそもそもサーバーに届かないため、保持するもの、記録するもの、削除するものが存在しません。タブを閉じれば、録音もその文字起こし結果も痕跡ごと消えます。

機密録音にも安心

インタビュー、カウンセリングのセッション、法律関連の通話、非公開の会議も、ネットワークを一度も経由せずに文字起こしできます。これは、ほとんどのオンライン文字起こしツールが正直には言えないことです。

通信するのはモデルだけ

ネットワークを通るのはモデル本体だけで、それはブラウザへとダウンロードされます。データはあなたへ流れてくるだけで、あなたから流れ出ることはありません。

§08 — 他の文字起こしツールとの違い

多くの音声テキスト変換ツールはファイルをアップロードする

よくあるオンライン文字起こしサービスは、録音をサーバーに送信し、そこで音声認識を実行して結果のテキストを返します。つまりあなたの音声は他社のディスク上に置かれ、その会社の保持ポリシーに従うことになります。このツールでは、録音はあなたの端末に留まります。

登録不要、分単位の上限なし

クラウド型の文字起こしサービスは、分単位の上限、月間クォータ、登録の壁で無料利用を絞ります。1 分ごとに自社の計算リソースを消費するからです。ブラウザ内の文字起こしが使うのはあなたの CPU なので、計測して制限する理由がありません。

精度について正直に

極小モデルは、そもそもローカルで動かせることと引き換えに、いくらかの精度を手放しています。鮮明な発話では非常に使いやすいですが、雑音の多い音声、強い訛り、話者の声が重なる場面では、何語か修正する必要があると考えてください。スタジオ品質の精度が必要な場合は、より大きなモデルを検討することをおすすめします。

§09 — よくある質問
01音声をテキストに変換するにはどうすればいいですか?+

このページ上部のボックスに音声ファイルをドロップし、話されている言語を選択(または自動検出のままに)して、「文字起こしする」をクリックします。音声認識モデルが音声を読み取り、コピーしたり .txt、.srt、.vtt としてダウンロードしたりできる文字起こし結果を生成します。アカウント登録もインストールも不要です。

02この音声テキスト変換ツールは無料ですか?+

はい、完全に無料で無制限です。アカウントもクレジット制も透かしもなく、文字起こしできるファイル数や時間にも上限はありません。文字起こしはあなた自身のコンピューター上で動くため、利用者に転嫁すべきサーバー費用が発生しないのです。

03音声はサーバーにアップロードされますか?+

いいえ。ここが多くのオンライン音声テキスト変換ツールとの最大の違いです。ファイルはページが直接読み込み、ブラウザタブ内で動くモデルが処理します。音声がネットワークを通ることはないため、こちらが保存できるものも、聞けるものも存在しません。

04どの音声形式を文字起こしできますか?+

MP3、WAV、M4A、OGG、WEBM、MP4 に加えて AAC、FLAC にも対応しています。ボイスメモ、ポッドキャスト、レコーダーの出力、ブラウザの録音、動画の音声トラックまでこれでカバーできます。ファイルサイズは 200 MB まで対応しています。

05どの言語に対応していますか?+

Whisper Tiny は多言語モデルで、英語、中国語、日本語、韓国語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、オランダ語、ロシア語、ポーランド語、ウクライナ語、インドネシア語、ベトナム語、タイ語、マレー語、ヒンディー語、アラビア語、トルコ語、ヘブライ語、ギリシャ語、チェコ語、スウェーデン語、デンマーク語、フィンランド語、ノルウェー語など、数十の言語の発話を認識します。セレクターから選択するか、自動検出に任せてください。

06どの音声認識モデルを使っていますか?+

OpenAI の Whisper ファミリーで最小の多言語モデルである Whisper Tiny です。量子化された重みは約 40 MB。WebAssembly 上の ONNX Runtime Web を通じて、すべてブラウザ内で動作します。英語専用の tiny.en ではなく、多言語版のチェックポイントを使用しています。

07タイムスタンプ付きの字幕は取得できますか?+

はい。プレーンテキストに加えて、文字起こし結果をタイムコード付きの .srt や .vtt の字幕ファイルとしてダウンロードでき、そのまま動画の字幕として使えます。タイムスタンプは、モデルが文字起こしを行う際に生成されます。

08最初の文字起こしだけ時間がかかるのはなぜですか?+

初回の実行では Whisper モデル(約 40 MB)をダウンロードし、WebAssembly ランタイムをコンパイルします。その後モデルはブラウザにキャッシュされるため、以降のファイルはダウンロードなしで即座に文字起こしされます。

09精度はどのくらいですか?+

Whisper Tiny は最小のモデルなので、最大限の精度よりも速度とサイズを優先しています。鮮明な単一話者の発話では非常に使いやすいですが、雑音の多い音声、強い訛り、声の重なりでは、何語か修正する必要があると考えてください。自動検出ではなく実際の話されている言語を指定すると、通常は結果が向上します。

10オフラインでも使えますか?+

初回の実行以降は使えます。ブラウザがモデルをキャッシュしてしまえば、それ以上の通信は発生しないため、接続が一切なくても音声からテキストへの変換を続けられます。

§10 — さっそく始める

無料で音声文字起こしを開始

無料、無制限、そして設計段階からプライベート。音声はブラウザ内で文字起こしされ、アップロードされることはありません。

音声を文字起こしする
コンプライアンスについて

音声はすべてブラウザ内で処理され、送信も保存もされないため、このツールの利用によって当社へのデータ移転が生じることはありません。そのため、GDPR や HIPAA、社内の機密情報規定の対象となる録音にも適しています。ただし、文字起こし結果を適切に取り扱う責任は利用者にあります。