录音怎么转成文字(带时间戳)
一句话:把音频(或视频,会自动取音轨)丢进语音转文字工具,知道是什么语言就别用「自动」、直接选对应语言,需要时间戳就导出 SRT,只要文字就导 TXT。
下面说怎么转得干净、避开常见坑。
先把语言选对
「自动检测」省事,但它是转写出乱码的头号原因。录音主要是中文就选中文;中英混杂(比如中文里夹英文术语)时,选占主导的那种语言通常比自动好——这等于告诉模型该往哪个方向猜,能少很多奇怪的替换。
音质好,文字才好
转写质量基本跟着音质走:
- 单人、离麦近、清晰,几乎能逐字转准。
- 多人抢话、回声、背景音乐会让准确率掉得很快。录差了事后没法补救,所以录的时候就讲究:安静环境、麦靠近、一次一个人说。
- 长停顿和口头禅没关系,就是结果里会有「呃、那个」需要你删。
时间戳与字幕
要给视频配字幕、或想点一下跳到某个时刻,导出 SRT——每行带起止时间。只是做笔记或要可检索的文档,TXT 就够。多数工具(包括我们的)给句级时间戳,点一下就能跳到音频对应位置。
本地转写 vs 云端转写,怎么选
- 本地(浏览器内):音频不离开你的电脑。采访、医疗、法律、内部会议这类敏感内容首选。代价是速度看硬件,旧机器上会慢。
- 云端:更快,长音频/嘈杂音频往往更准,但音频要发到服务端处理。
经验法则:敏感或短 → 本地;长、吵、或赶时间 → 云端。
快速流程
- 打开音频转文字,加音频或视频。
- 设置语言(知道就别选「自动」)。
- 转写后通读一遍,把人名、术语等模型猜错的改过来。
- 导出 SRT(配字幕)或 TXT(做笔记)。
花几分钟人工校一遍人名、数字、专业术语,文字稿才真的能用——没有哪个工具能把这些 100% 转对。
有录音要转?丢进音频转文字工具,导出你的文字稿。