一、这是什么流水线
一句话结论:把「请人拍 + 请人配 + 请人剪」三步合成一条 AI 流水线,一个人就能出数字人口播视频成片。
视频里提到的玩法分三段,环环相扣:
- 声音:Fish Audio 把文案变成自然配音(还能克隆你自己的声音);
- 形象:HeyGen V 用这段配音驱动一个数字人,生成对口型说话的视频;
- 包装:HyperFrames 给视频加字幕、转场、特效、平台 overlay,输出最终成片。
适合做口播视频、知识科普、产品介绍、课程录播——尤其适合不想出镜、又嫌剪辑麻烦的个人创作者和小团队。
本文交付物
一篇把这条流水线讲透的笔记:三款工具各自是什么、怎么串、怎么动手跑通,以及哪些坑(尤其合规)必须先知道。坤哥投了素材,我按上一轮节奏渲染成技艺录文章,你「推」我再上线。
二、三款工具逐一拆解
开源 TTS + 零样本声音克隆引擎(GitHub fishaudio/fish-speech,代码 Apache-2.0)。S2-Pro 系列用 Dual-AR 架构,支持 80+ 语种、情感标签(如 [excited] [whisper]),TTS-Arena2 排名第一。两条路:在线平台 fishaudio.com 零基础出声,或本地 Docker 私有化部署。⚠️ 模型权重为非商业许可,商用需单独授权。
HeyGen 第 V 代 Avatar 数字人模型。上传一张照片 + 一段脚本(或音频),生成对口型说话的视频;单次可生成 30 分钟连续口播,形象一致性比上一代强很多。提供 Web 端与 API。把 Fish Audio 的配音喂给它,就能让数字人「用你的声音」开口。注意:这是付费 SaaS,按生成时长 / 订阅计费。
HeyGen 开源的「video as code」框架(GitHub heygen-com/hyperframes)。用 HTML/CSS/JS 描述视频,渲染成确定性 MP4。正好负责你说的「后期包装」:字幕、转场、特效、平台 overlay、motion graphics。内置 9+ 个 agent skills(captions / beat-sync / website-to-video 等),让 Claude Code / Cursor 直接写视频。CLI:npx hyperframes init/preview/render,需 Node.js 22+ 与 FFmpeg。
三、流水线怎么串起来
关键点在于每一段的输出是下一段的输入:Fish Audio 出 wav → 喂 HeyGen V 驱动口型 → HeyGen 出 mp4 → 进 HyperFrames 加字幕特效 → 成片。
也可以让 HyperFrames 用自己的内置 TTS/transcribe 一条龙搞定,但本流水线单独用 Fish Audio 出声,声音更自然、可复用、能克隆你自己音色,后面做系列视频时人声一致。
四、动手跑通
下面是一条最小可跑通的路径。我没法在你机器上实跑(环境不在我这边),但每一步都是官方工作流,复制即用。
步骤 1 · Fish Audio 出配音
在线最省事:打开 fishaudio.com,粘贴文案、插入情感标签,或上传 10–30 秒音频克隆声音,生成后下载 .wav。本地部署则 git clone fishaudio/fish-speech 起 WebUI / API(需 GPU)。
步骤 2 · HeyGen V 生成数字人
在 HeyGen 选 Avatar(或上传你的照片做数字分身),把步骤 1 的配音音频 + 脚本喂进去,生成对口型视频,导出 .mp4。
步骤 3 · HyperFrames 包装
# 给 AI 编程助手装上 HyperFrames 技能(Claude Code / Cursor / Codex 通用) npx skills add heygen-com/hyperframes # 初始化项目:拷贝素材 + 自动转录音频 npx hyperframes init my-video # 让助手用自然语言写 HTML 合成(加字幕/转场/特效) # 预览(帧精确,热重载)→ 渲染成片 npx hyperframes preview npx hyperframes render --output final.mp4
坑:本地渲染依赖
HyperFrames 需要 Node.js 22+ 和 FFmpeg 在 PATH 里;本地渲染靠 headless Chrome,机器太弱会卡。没环境就先用 HeyGen 自带字幕,等上了 HyperFrames 再精细化。
五、坑与提醒
| 注意点 | 说明 |
|---|---|
| 肖像权 / 声音权 | 数字人涉及被代言人的肖像与声音权益,商用必须拿到本人授权,不能拿别人的脸/声随便做商业视频。 |
| Fish Audio 商用许可 | 代码 Apache-2.0,但模型权重是非商业许可,企业商用需向官方申请授权或使用自有可商用权重。 |
| HeyGen 是付费 SaaS | 按生成时长 / 订阅计费,做量产前先看清楚额度和条款,避免账单超预期。 |
| HyperFrames 依赖 | 需 Node.js 22+ 与 FFmpeg,本地渲染吃资源;CI/CD 可走云端渲染省本机。 |
| 无需代理 | 三款均国内可正常使用:Fish Audio 有国内镜像,HeyGen 国内可访问,HyperFrames 是 npm 包——不用任何额外工具。 |
合规是第一道槛:先把「肖像 / 声音授权」和「商用许可」确认了,再谈效率和成本。技术能跑通不代表能商用。
六、小结与获取
一句话总结:这条流水线的价值不是「某个工具多强」,而是三段各司其职、输出即输入,一个人就能把口播视频从 0 做到成片。
- Fish Audio(开源 TTS):github.com/fishaudio/fish-speech / 在线 fishaudio.com
- HeyGen V(数字人 SaaS):heygen.com
- HyperFrames(开源后期):github.com/heygen-com/hyperframes / 文档 hyperframes.heygen.com
坤哥,建议先用三家的在线版跑通最小闭环(Fish Audio 在线配音 → HeyGen 在线数字人 → HyperFrames 本地加字幕),确认效果和人声一致,再决定是否本地私有化部署。玩出成片了记得回来,咱可以再写篇实战记录。
返回技艺录