视频转文字:先抽音轨再本地识别

视频里的话要变成字幕时,不必把文件传到转写网站。浏览器先抽出声音,再用和「语音转文字」相同的引擎识别。

最近更新:2026年10月7日

需要马上处理?使用 视频转文字 ,浏览器本地完成,不上传服务器。

打开视频转文字

先有声音才有文字

没有音轨的画面无法识别。抽出的是 16 kHz 单声道,只用于识别,不会额外给你一份音乐母带。

只要声音、不要文字时,请用「提取音频」。

字幕下一步

下载的 SRT 可以拿到「SRT 字幕工具箱」做时间轴偏移或双语合并,也可以再烧进画面。

长视频请先裁剪到 15 分钟以内。模型在点击开始后才下载,并缓存在本机。

操作步骤

  1. 选择视频
  2. 开始后等待抽音轨和识别
  3. 下载 TXT 或 SRT

常见问题

视频会上传吗?

不会。抽音轨和识别都在浏览器本地完成。

和语音转文字是两套模型吗?

不是。两个入口共用同一套本地识别,视频只是多了抽音轨这一步。