音频转文字
免费工具
在线把音频转文字,支持 MP3、WAV、M4A 和 MP4。文件在浏览器本地处理,不会上传。
把音频文件拖到这里
或点击选择文件 — 支持 MP3、WAV、M4A、OGG、WEBM、MP4 · 文件不会离开你的设备
免费音频转文字:浏览器本地把音频转成文字
这款免费音频转文字工具可以把录音、语音备忘录、采访和会议音频转换成可复制、可搜索、可下载的文字。上传 MP3、WAV、M4A、OGG、WEBM 或 MP4,选择语音语言,工具会在浏览器中用 Whisper Tiny 完成本地转录。与常见在线音频转文字服务不同,你的音频不会被上传到服务器。
添加音频
把 MP3、WAV、M4A、OGG、WEBM 或 MP4 文件拖入上传区域,或点击选择文件。音频直接加载到页面中 — 绝不会发送到任何服务器。
选择语言并转录
选择语音的语言,或保持「自动检测」,然后点击「转录」。Whisper Tiny 模型只需下载一次(约 40 MB),随后即可在你自己的 CPU 上把语音转换成文字。
复制或下载转录文本
查看转录文本,一键复制到剪贴板,或下载为 .txt 文件 — 也可以下载带时间戳的 .srt / .vtt 字幕文件,用于视频配字幕。
一键音频转文字
只要录音中有语音,就能直接得到可编辑的文本。无需手动打字,无需在时间轴上来回拖动查找,也不用花钱使用昂贵的转录服务。
AI 音频转文字:Whisper 本地转录
识别由 OpenAI 的 Whisper Tiny 模型完成,这是一个真正的神经网络语音转文字模型,通过 WebAssembly 在本地运行,而不是跑在服务器上。
MP3、WAV、M4A 等多种格式
语音备忘录通常是 M4A,播客和音乐通常是 MP3,录音笔录制的文件则常见 WAV。这些格式都能直接使用,OGG、WEBM 以及 MP4 视频的音轨也同样支持。
带时间戳的字幕
除了纯文本,还可以导出带时间码的 SRT 和 VTT 字幕文件,直接用于视频配字幕 — 全部在你的浏览器中生成。
免费且不限次数
真正免费的音频转文字工具:无需账号、不消耗额度、没有水印,也没有时长限制。想转录多少文件就转录多少。
首次运行后即可离线使用
模型被浏览器缓存之后,转录本身完全不需要联网。在飞机上或公司防火墙后,页面依然能把音频转成文字。
采访与会议
把录制的采访、会议或讲座变成可搜索的文本,方便引用、总结或粘贴到笔记里 — 而无需把敏感对话发送给任何云端服务。
语音备忘录与口述
把一条快速的语音备忘录、口述的想法或一段电话录音转成可编辑的文本,这样你就不必把已经说出口的内容重新打一遍。
字幕与配字幕
从视频的音轨生成 SRT 或 VTT 字幕,为播客、教程或社交短片配上字幕,让内容更容易被理解和访问。
MP3 转文字
播客、音乐和下载文件中最常见的音频格式。无需先转换文件格式,即可直接把 MP3 转成文字。
WAV 转文字
大多数录音笔和数字音频工作站输出的无压缩格式。WAV 是无损格式,因此通常能获得最干净、最准确的转录结果。
M4A 转文字
iPhone「语音备忘录」和大多数手机录音应用保存文件所用的格式。可以直接把设备上的 M4A 语音笔记转录成文字。
OGG、WEBM 和 MP4
浏览器和应用内录音通常是 OGG 或 WEBM 格式,MP4 视频则自带音轨。这些格式都能直接解码并转录,无需额外的格式转换步骤。
刻意做小的模型
转录由 Whisper Tiny 完成,它是 OpenAI 的 Whisper 系列中最小的模型:量化后的权重约 40 MB。正是这个体积让浏览器端转录成为可能 — 大型 Whisper 模型动辄几个 GB,根本不可能下发到访客的浏览器里。模型通过 ONNX Runtime Web 在 WebAssembly 上运行,原本要跑在服务器上的同一套神经网络,如今直接跑在你自己的 CPU 上。Whisper Tiny 用一部分准确率换取了速度和体积上的优势;清晰的语音转录效果很好,而浓重的口音、背景噪音或多人重叠说话,对任何微型模型来说都更具挑战。
生来支持多语言
Whisper Tiny 是一个多语言模型(不是仅支持英语的 tiny.en)。它能识别数十种语言的语音,包括英语、中文、日语、韩语、西班牙语、法语、德语、意大利语、葡萄牙语、俄语、阿拉伯语、印地语等等。从选择器中选出语音的语言可以获得最佳效果,也可以让 Whisper 自动检测。
不上传,无服务器
这里没有任何上传接口,也没有携带你音频的 API 请求。文件由页面本地解码,再交给同一个浏览器标签页里运行的模型。
不留存任何数据
既然音频从未到达服务器,也就没有任何东西需要保留、记录或删除。关掉标签页,录音及其转录文本的一切痕迹随即消失。
机密录音也能放心处理
采访、心理咨询、法律通话和私人会议都可以在完全不经过网络的情况下转录 — 这一点,大多数在线转录工具都无法坦然承诺。
只有模型会被下载
唯一经过网络传输的是模型本身,它被下载到你的浏览器。数据只会流向你,绝不会从你这里流出去。
大多数音频转文字工具都会上传你的文件
常见的在线转录服务会把你的录音发送到服务器,在那里运行语音识别,再把文字返回给你。这意味着你的音频躺在别人的硬盘上,受制于对方的数据留存策略。在这里,录音始终留在你的设备上。
无需注册,没有时长限制
云端转录服务会用分钟数上限、每月配额或注册门槛来限制免费用量,因为每一分钟都要消耗他们的计算资源。浏览器端转录用的是你自己的 CPU,自然没有什么可计量的。
对准确率保持坦诚
微型模型牺牲一部分准确率,换来了能够在本地运行的能力。面对清晰的语音,它表现相当实用;面对嘈杂的音频、浓重的口音或多人重叠说话,就要做好校正个别词语的准备。如果需要录音室级别的准确率,你可能仍然需要更大的模型。
01如何把音频转成文字?+
把音频文件拖到本页顶部的上传框里,选择语音的语言(或保持「自动检测」),然后点击「转录」。语音识别模型会读取音频并生成转录文本,你可以复制它,或下载为 .txt、.srt 或 .vtt 文件。无需注册,也不用安装任何软件。
02这款音频转文字工具是免费的吗?+
是的,完全免费且不限次数。无需账号、没有积分制、没有水印,转录多少文件或多长时长都不设上限。转录在你自己的电脑上运行,我们没有服务器成本需要转嫁给你。
03你们会把我的音频上传到服务器吗?+
不会。这正是我们与大多数在线音频转文字工具最大的区别。你的文件由页面直接解码,并交由运行在你浏览器标签页内的模型处理。音频从不经过网络传输,我们既无法存储,也无从听到。
04可以转录哪些音频格式?+
MP3、WAV、M4A、OGG、WEBM 和 MP4,还有 AAC 和 FLAC。这覆盖了语音备忘录、播客、录音笔输出、浏览器录音以及视频的音轨。支持最大 200 MB 的文件。
05它支持哪些语言?+
Whisper Tiny 是多语言模型,能识别数十种语言的语音,包括英语、中文、日语、韩语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、俄语、波兰语、乌克兰语、印尼语、越南语、泰语、马来语、印地语、阿拉伯语、土耳其语、希伯来语、希腊语、捷克语、瑞典语、丹麦语、芬兰语和挪威语。可以从选择器中选择一种,也可以让它自动检测。
06这个工具使用的是哪个语音识别模型?+
Whisper Tiny,OpenAI 的 Whisper 系列中最小的多语言模型 — 量化后的权重约 40 MB。它通过 ONNX Runtime Web 在 WebAssembly 上运行,完全在你的浏览器内完成。我们使用的是多语言版本,而不是仅支持英语的 tiny.en。
07可以获得带时间戳的字幕吗?+
可以。除了纯文本,你还可以把转录文本下载为带时间码的 .srt 或 .vtt 字幕文件,直接附加到视频上用作字幕。时间戳由模型在转录过程中自动生成。
08为什么第一次转录比之后的要慢?+
第一次运行需要下载 Whisper 模型(约 40 MB)并编译 WebAssembly 运行时。之后模型会被浏览器缓存,因此后续每个文件都能立即转录,完全无需再次下载。
09它的准确率如何?+
Whisper Tiny 是最小的模型,因此它更偏向速度和体积,而非极致的准确率。面对清晰的单人语音,它相当实用;面对嘈杂的音频、浓重的口音或多人重叠说话,就要做好校正个别词语的准备。手动选择准确的语音语言,而不是使用「自动检测」,通常能提升识别效果。
10它可以离线使用吗?+
第一次运行之后可以。一旦浏览器缓存了模型,就不再有任何网络活动,即使完全断网,页面仍能继续把音频转成文字。
由于音频完全在你的浏览器中处理,既不会被传输也不会被存储,使用本工具不会向我们产生任何数据传输。因此,它非常适合处理受 GDPR、HIPAA 或企业内部保密规定约束的录音 — 但你仍需自行妥善处理转录出的文本。