想把一场英文演讲变成中文笔记,或者给自己录的视频配一段旁白,过去要么交给收费的云服务,要么在命令行里折腾半天。最近一年 GitHub 上有两个开源项目把这些事装进了桌面软件。VoiceStudio 自称本机版的 ElevenLabs,能克隆声音、给视频配音;VidBee 能从 YouTube、B 站等一千多个网站下载音视频,在自己电脑上转成文字。
两个都免费开源,核心音视频处理都能留在本机;但 VidBee 若接云端 AI 做摘要或问答,提示词和转写文字仍会发给所选服务商。〔1〕〔2〕
源
我们自己一直在 Mac 上做演讲、播客的转写,用的是同一批开源模型。所以这次没有只看介绍页,而是读了两个项目的代码和许可证,再拿手上已经转好的 13 场英文演讲做了一次对照。最有用的发现不在这两款软件本身,而在一个很多人都会踩的坑上。
先说结论里最意外的一条
斯坦福 2005 年那场乔布斯毕业演讲,我们的本机转写一直「看起来没问题」:900 秒的音频不到一分钟就转完,开头几个故事一字不差。
拿 YouTube 上的人工字幕一对,词错率却高达 38%。打开转写稿往下翻,从第 12 分 46 秒起,同一句「Don’t let the noise of others’ opinions.」连续出现了 94 次,一直重复到结尾。也就是说,最后两分多钟,包括那句「Stay hungry, stay foolish」和《全球概览》停刊的那段收尾,在转写稿里根本不存在。
这是 Whisper 类模型一个有名的毛病:它会把前面已经写出的文字当成上下文,接着往下猜,一旦猜进一个句子,就可能一直绕不出来。保存下来的转写显示,这不是零星错字,而是一段持续到结尾的循环。换成「不参考前文」的模式(whisper.cpp 的 -mc 0 参数)再跑一次,重复变回 1 次,结尾回来了,词错率从 38.3% 降到 2.9%。〔3〕
源
我们把同一批 24 份转写全扫了一遍,连续重复四次以上的还有两份。一份是 Brené Brown 那场 TED 末尾的掌声被写成 9 句「Thank you」,另一份是 Randy Pausch 的「最后一课」里观众真的唱了生日歌,那是对的。所以判断要分开看:重复本身不等于出错,但连着几十次的,几乎一定是模型卡住了。
如果你也用 Whisper、剪映字幕或任何基于它的工具转长录音,最省事的检查是拉到最后看一眼:结尾那几分钟的内容在不在,有没有一句话反复出现。
VidBee:最值得学的是「先找现成字幕」
VidBee 的下载靠 yt-dlp,转写用 sherpa-onnx 跑 Whisper、SenseVoice、Parakeet、Qwen3-ASR 这几种模型。它还能订阅 RSS 或 YouTube 频道,有新节目就自动加进下载队列。它有桌面版、浏览器扩展、Docker 网页版,也有不用装桌面的命令行版本,许可证是 MIT,商用没有限制。〔2〕
源
读它的转写代码时,我们注意到一个顺序:下载完成后,它先看视频有没有能导入的字幕轨,有就直接用,没有才动用语音识别。它收的字幕也包括平台自动生成的那种(比如 B 站的 AI 字幕,会打上标记),只把弹幕和聊天记录挡在外面。我们借这一步时收得更紧,只要人工上传的字幕。
这一步听起来平常,效果却很实在。我们那 13 场演讲里,11 场在 YouTube 上有人工英文字幕;把我们本机的转写和这些人工字幕逐词对比,合计近四万词,加权词错率 7.1%,好的一场只有 1.3%,差的就是上面那场乔布斯。这些轨道至少不是平台标注的自动字幕,能省掉一次语音识别,而且不用下载音频;人名、引语、数字仍要回听确认。
这里有两点限定。人工字幕会删掉「嗯」「you know」和口误,所以 7.1% 量的是转写离「整理过的字幕」有多远,不是离原话有多远。另外,有些上传者会把自动字幕导出再当作普通字幕上传,看上去是人工轨,其实不是。我们现在的做法是:字幕覆盖不到视频时长的八成,或者每分钟词数明显不对,就退回本机转写。
对一般读者,VidBee 是目前比较顺手的一站式工具:贴个链接,下视频、拿字幕、在本机转文字,想要摘要和翻译再接自己的 AI 账号。要注意的是,转写在本机,接 AI 做摘要或问答时,文字会发给你选的那家服务商。〔2〕
源
VoiceStudio:功能最全,但默认那个声音不能拿去赚钱
VoiceStudio 是 Electron 桌面程序,后台起一个 Python 服务,本机端口 3900,带 API,也能让 AI 助手通过 MCP 调用。功能列表很长:声音克隆、按文字描述「设计」一个声音、视频配音(转写、翻译、按时间轴重新配音)、听写、有声书批量生成。今年 4 月才建仓,半年拿了五万多颗星。〔1〕
源
它在 Mac 上的门槛写得清楚。本机推理只支持 Apple Silicon,Intel 的 Mac 只能开界面、连别处的后端。首次安装连 Python 环境和模型大约要 10 GB 硬盘。默认模型在独立显卡上建议至少 6 GB 显存;Apple Silicon 使用统一内存,项目没有把这条独显下限直接套到 Mac。〔4〕
源
最需要看清的是许可证,而且分两层。软件本身是 AGPL-3.0,允许个人、商业和公司内部使用;如果修改后通过网络提供给别人使用,必须向这些使用者提供完整的相应源码。另一层是模型:它默认的 OmniVoice,代码是 Apache 2.0,但预训练权重是 CC-BY-NC,模型页写明是因为训练数据的限制,不能商用。〔5〕〔6〕
源
换句话说,默认预训练模型的许可明确带有 NC(非商业)限制:给自家视频配旁白可以,公司的广告、付费课程、带货视频不能用这套默认权重,除非另获许可。
它支持的其他引擎许可证各不相同,例如 IndexTTS 2.5 用的是 bilibili 自己的模型许可,对用户规模和年营收设有另行授权门槛,装之前要逐个看。〔7〕
源 它和另一款本机语音工具 Voicebox 怎么取舍,论坛这一篇有对照。
还有两件事和许可证一样要紧。一是克隆谁的声音:项目自己的说明就要求先取得本人同意。2025 年加拿大反诈骗中心与网络安全中心的通报里,已经有用 AI 模仿官员声音的真实案例,声音克隆在家里也该当成需要授权的事。〔1〕〔8〕
源
二是配音别人的节目:在加拿大,制作或发布作品译本属于权利人的专有权;把一场 TED 配成中文再公开,通常要先取得相应许可。〔9〕
源
到底要不要装
不必两个都装。已经能在本机跑 Whisper、SenseVoice 或 Qwen3-ASR 的人,没有必要仅为了同一套转写引擎再装 VidBee;它真正省事的是界面、下载队列和字幕导入。VoiceStudio 的视频配音更完整,但默认模型的商用限制和第三方节目的版权边界都要先解决。
更值得带走的是两步:一是先取平台非自动字幕,没有才转写;二是转写出来连续五句一模一样,就换「不参考前文」的模式重跑,取重复少的那份。这套检查已经把乔布斯那份漏掉的结尾找了回来。
如果你只是想偶尔把一个视频变成文字,VidBee 装上就能用;想克隆自己的声音录个有声书,VoiceStudio 值得一试,先确认你选的那个模型许可证允许你的用途。无论用哪个,长录音转完都拉到最后看一眼。
参考资料
- debpalash/VoiceStudio :GitHub 项目页与 README;2026 年 10 月 1 日核读功能、平台、API/MCP、星标数(约 5.1 万)与建仓日期(2026 年 4 月 9 日)。版本 v0.5.6 发布于 2026 年 9 月 23 日。
- nexmoe/VidBee :GitHub 项目页、README 与
packages/transcription源码(coordinator.ts 先导入字幕再回退转写;captions.ts 收录平台 AI 字幕、排除弹幕与聊天)。
2026 年 10 月 1 日核读下载、转写引擎、RSS 订阅、命令行版本、MIT 许可与「AI 提示会把文字发给所选服务商」的说明。版本 v2.1.0 发布于 2026 年 8 月 30 日。 - OpenAI Whisper 转写代码 :代码说明关闭前文上下文可减少重复循环;ggml-org/whisper.cpp :提供
--max-context参数(-mc 0即不保留前文上下文)。
文中 38.3%、2.9%、7.1% 为我们对 13 场演讲(11 场有人工字幕,共 39,646 词)的实测,参照物是 YouTube 人工字幕,统计前统一小写并去掉标点和括号内的 [Applause] 之类标注。 - VoiceStudio 安装说明(macOS) 与
OmniVoice 引擎说明 :Apple Silicon 要求与约 10 GB 硬盘;6 GB 显存建议值适用于独立显卡,文档没有把它直接套到 Apple Silicon。 - VoiceStudio LICENSE-NOTICE :AGPL-3.0 的网络使用义务;说明模型权重不随软件许可。
- k2-fsa/OmniVoice 模型页 :代码 Apache 2.0,预训练模型 CC-BY-NC,原因是训练数据(如 Emilia)的限制。
- VoiceStudio 的 IndexTTS 引擎说明 :IndexTTS 2.5 使用 bilibili Model Use License,超过规定的用户规模或年营收门槛需另行授权。
- 加拿大网络安全中心与反诈骗中心联合通报 :2025 年 6 月 23 日;记录冒充高管与官员的活动中使用 AI 模仿声音。
- 加拿大《著作权法》第 3 条 :权利人的专有权包括制作、复制、表演或发布作品译本;法条页面核读时更新至 2026 年 9 月 21 日。