AI Toolbox
AI Toolbox
ai-toolbox.ai
工具箱/audio / audio-to-text-converter本地 · 客户端处理
§00 — 音频转文字

音频转文字
免费工具

在线把音频转文字,支持 MP3、WAV、M4A 和 MP4。文件在浏览器本地处理,不会上传。

§00 — 功能特性
本地转录 无需上传 100% 隐私 支持 40+ 种语言
§01 — 工作原理

免费音频转文字:浏览器本地把音频转成文字

这款免费音频转文字工具可以把录音、语音备忘录、采访和会议音频转换成可复制、可搜索、可下载的文字。上传 MP3、WAV、M4A、OGG、WEBM 或 MP4,选择语音语言,工具会在浏览器中用 Whisper Tiny 完成本地转录。与常见在线音频转文字服务不同,你的音频不会被上传到服务器。

§02 — 如何在线把音频转文字
1

添加音频

把 MP3、WAV、M4A、OGG、WEBM 或 MP4 文件拖入上传区域,或点击选择文件。音频直接加载到页面中 — 绝不会发送到任何服务器。

2

选择语言并转录

选择语音的语言,或保持「自动检测」,然后点击「转录」。Whisper Tiny 模型只需下载一次(约 40 MB),随后即可在你自己的 CPU 上把语音转换成文字。

3

复制或下载转录文本

查看转录文本,一键复制到剪贴板,或下载为 .txt 文件 — 也可以下载带时间戳的 .srt / .vtt 字幕文件,用于视频配字幕。

§03 — 音频转文字工具功能

一键音频转文字

只要录音中有语音,就能直接得到可编辑的文本。无需手动打字,无需在时间轴上来回拖动查找,也不用花钱使用昂贵的转录服务。

AI 音频转文字:Whisper 本地转录

识别由 OpenAI 的 Whisper Tiny 模型完成,这是一个真正的神经网络语音转文字模型,通过 WebAssembly 在本地运行,而不是跑在服务器上。

MP3、WAV、M4A 等多种格式

语音备忘录通常是 M4A,播客和音乐通常是 MP3,录音笔录制的文件则常见 WAV。这些格式都能直接使用,OGG、WEBM 以及 MP4 视频的音轨也同样支持。

带时间戳的字幕

除了纯文本,还可以导出带时间码的 SRT 和 VTT 字幕文件,直接用于视频配字幕 — 全部在你的浏览器中生成。

免费且不限次数

真正免费的音频转文字工具:无需账号、不消耗额度、没有水印,也没有时长限制。想转录多少文件就转录多少。

首次运行后即可离线使用

模型被浏览器缓存之后,转录本身完全不需要联网。在飞机上或公司防火墙后,页面依然能把音频转成文字。

§04 — 大家都用它来做什么

采访与会议

把录制的采访、会议或讲座变成可搜索的文本,方便引用、总结或粘贴到笔记里 — 而无需把敏感对话发送给任何云端服务。

语音备忘录与口述

把一条快速的语音备忘录、口述的想法或一段电话录音转成可编辑的文本,这样你就不必把已经说出口的内容重新打一遍。

字幕与配字幕

从视频的音轨生成 SRT 或 VTT 字幕,为播客、教程或社交短片配上字幕,让内容更容易被理解和访问。

§05 — MP3、WAV、M4A、MP4 音频转文字

MP3 转文字

播客、音乐和下载文件中最常见的音频格式。无需先转换文件格式,即可直接把 MP3 转成文字。

WAV 转文字

大多数录音笔和数字音频工作站输出的无压缩格式。WAV 是无损格式,因此通常能获得最干净、最准确的转录结果。

M4A 转文字

iPhone「语音备忘录」和大多数手机录音应用保存文件所用的格式。可以直接把设备上的 M4A 语音笔记转录成文字。

OGG、WEBM 和 MP4

浏览器和应用内录音通常是 OGG 或 WEBM 格式,MP4 视频则自带音轨。这些格式都能直接解码并转录,无需额外的格式转换步骤。

§06 — 识别引擎:Whisper Tiny

刻意做小的模型

转录由 Whisper Tiny 完成,它是 OpenAI 的 Whisper 系列中最小的模型:量化后的权重约 40 MB。正是这个体积让浏览器端转录成为可能 — 大型 Whisper 模型动辄几个 GB,根本不可能下发到访客的浏览器里。模型通过 ONNX Runtime Web 在 WebAssembly 上运行,原本要跑在服务器上的同一套神经网络,如今直接跑在你自己的 CPU 上。Whisper Tiny 用一部分准确率换取了速度和体积上的优势;清晰的语音转录效果很好,而浓重的口音、背景噪音或多人重叠说话,对任何微型模型来说都更具挑战。

生来支持多语言

Whisper Tiny 是一个多语言模型(不是仅支持英语的 tiny.en)。它能识别数十种语言的语音,包括英语、中文、日语、韩语、西班牙语、法语、德语、意大利语、葡萄牙语、俄语、阿拉伯语、印地语等等。从选择器中选出语音的语言可以获得最佳效果,也可以让 Whisper 自动检测。

§07 — 隐私:你的音频永远不会被上传

不上传,无服务器

这里没有任何上传接口,也没有携带你音频的 API 请求。文件由页面本地解码,再交给同一个浏览器标签页里运行的模型。

不留存任何数据

既然音频从未到达服务器,也就没有任何东西需要保留、记录或删除。关掉标签页,录音及其转录文本的一切痕迹随即消失。

机密录音也能放心处理

采访、心理咨询、法律通话和私人会议都可以在完全不经过网络的情况下转录 — 这一点,大多数在线转录工具都无法坦然承诺。

只有模型会被下载

唯一经过网络传输的是模型本身,它被下载到你的浏览器。数据只会流向你,绝不会从你这里流出去。

§08 — 与其他转录工具相比

大多数音频转文字工具都会上传你的文件

常见的在线转录服务会把你的录音发送到服务器,在那里运行语音识别,再把文字返回给你。这意味着你的音频躺在别人的硬盘上,受制于对方的数据留存策略。在这里,录音始终留在你的设备上。

无需注册,没有时长限制

云端转录服务会用分钟数上限、每月配额或注册门槛来限制免费用量,因为每一分钟都要消耗他们的计算资源。浏览器端转录用的是你自己的 CPU,自然没有什么可计量的。

对准确率保持坦诚

微型模型牺牲一部分准确率,换来了能够在本地运行的能力。面对清晰的语音,它表现相当实用;面对嘈杂的音频、浓重的口音或多人重叠说话,就要做好校正个别词语的准备。如果需要录音室级别的准确率,你可能仍然需要更大的模型。

§09 — 常见问题
01如何把音频转成文字?+

把音频文件拖到本页顶部的上传框里,选择语音的语言(或保持「自动检测」),然后点击「转录」。语音识别模型会读取音频并生成转录文本,你可以复制它,或下载为 .txt、.srt 或 .vtt 文件。无需注册,也不用安装任何软件。

02这款音频转文字工具是免费的吗?+

是的,完全免费且不限次数。无需账号、没有积分制、没有水印,转录多少文件或多长时长都不设上限。转录在你自己的电脑上运行,我们没有服务器成本需要转嫁给你。

03你们会把我的音频上传到服务器吗?+

不会。这正是我们与大多数在线音频转文字工具最大的区别。你的文件由页面直接解码,并交由运行在你浏览器标签页内的模型处理。音频从不经过网络传输,我们既无法存储,也无从听到。

04可以转录哪些音频格式?+

MP3、WAV、M4A、OGG、WEBM 和 MP4,还有 AAC 和 FLAC。这覆盖了语音备忘录、播客、录音笔输出、浏览器录音以及视频的音轨。支持最大 200 MB 的文件。

05它支持哪些语言?+

Whisper Tiny 是多语言模型,能识别数十种语言的语音,包括英语、中文、日语、韩语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、俄语、波兰语、乌克兰语、印尼语、越南语、泰语、马来语、印地语、阿拉伯语、土耳其语、希伯来语、希腊语、捷克语、瑞典语、丹麦语、芬兰语和挪威语。可以从选择器中选择一种,也可以让它自动检测。

06这个工具使用的是哪个语音识别模型?+

Whisper Tiny,OpenAI 的 Whisper 系列中最小的多语言模型 — 量化后的权重约 40 MB。它通过 ONNX Runtime Web 在 WebAssembly 上运行,完全在你的浏览器内完成。我们使用的是多语言版本,而不是仅支持英语的 tiny.en。

07可以获得带时间戳的字幕吗?+

可以。除了纯文本,你还可以把转录文本下载为带时间码的 .srt 或 .vtt 字幕文件,直接附加到视频上用作字幕。时间戳由模型在转录过程中自动生成。

08为什么第一次转录比之后的要慢?+

第一次运行需要下载 Whisper 模型(约 40 MB)并编译 WebAssembly 运行时。之后模型会被浏览器缓存,因此后续每个文件都能立即转录,完全无需再次下载。

09它的准确率如何?+

Whisper Tiny 是最小的模型,因此它更偏向速度和体积,而非极致的准确率。面对清晰的单人语音,它相当实用;面对嘈杂的音频、浓重的口音或多人重叠说话,就要做好校正个别词语的准备。手动选择准确的语音语言,而不是使用「自动检测」,通常能提升识别效果。

10它可以离线使用吗?+

第一次运行之后可以。一旦浏览器缓存了模型,就不再有任何网络活动,即使完全断网,页面仍能继续把音频转成文字。

§10 — 立即开始

立即免费音频转文字

免费、不限次数,从设计上就保护隐私。你的音频在浏览器中完成转录,绝不会被上传。

音频转文字
合规说明

由于音频完全在你的浏览器中处理,既不会被传输也不会被存储,使用本工具不会向我们产生任何数据传输。因此,它非常适合处理受 GDPR、HIPAA 或企业内部保密规定约束的录音 — 但你仍需自行妥善处理转录出的文本。