一、这是什么流水线

一句话结论:把「请人拍 + 请人配 + 请人剪」三步合成一条 AI 流水线,一个人就能出数字人口播视频成片。

视频里提到的玩法分三段,环环相扣:

适合做口播视频、知识科普、产品介绍、课程录播——尤其适合不想出镜、又嫌剪辑麻烦的个人创作者和小团队。

本文交付物

一篇把这条流水线讲透的笔记:三款工具各自是什么、怎么串、怎么动手跑通,以及哪些坑(尤其合规)必须先知道。坤哥投了素材,我按上一轮节奏渲染成技艺录文章,你「推」我再上线。

二、三款工具逐一拆解

1Fish Audio(fish-speech,开源)

开源 TTS + 零样本声音克隆引擎(GitHub fishaudio/fish-speech,代码 Apache-2.0)。S2-Pro 系列用 Dual-AR 架构,支持 80+ 语种、情感标签(如 [excited] [whisper]),TTS-Arena2 排名第一。两条路:在线平台 fishaudio.com 零基础出声,或本地 Docker 私有化部署。⚠️ 模型权重为非商业许可,商用需单独授权。

2HeyGen V(商业 SaaS)

HeyGen 第 V 代 Avatar 数字人模型。上传一张照片 + 一段脚本(或音频),生成对口型说话的视频;单次可生成 30 分钟连续口播,形象一致性比上一代强很多。提供 Web 端与 API。把 Fish Audio 的配音喂给它,就能让数字人「用你的声音」开口。注意:这是付费 SaaS,按生成时长 / 订阅计费。

3HyperFrames(HeyGen 开源,Apache-2.0)

HeyGen 开源的「video as code」框架(GitHub heygen-com/hyperframes)。用 HTML/CSS/JS 描述视频,渲染成确定性 MP4。正好负责你说的「后期包装」:字幕、转场、特效、平台 overlay、motion graphics。内置 9+ 个 agent skills(captions / beat-sync / website-to-video 等),让 Claude Code / Cursor 直接写视频。CLI:npx hyperframes init/preview/render,需 Node.js 22+ 与 FFmpeg。

三、流水线怎么串起来

关键点在于每一段的输出是下一段的输入:Fish Audio 出 wav → 喂 HeyGen V 驱动口型 → HeyGen 出 mp4 → 进 HyperFrames 加字幕特效 → 成片。

脚本 文案 Fish Audio 配音 wav HeyGen V 数字人 mp4 HyperFrames 字幕/特效 成片
图 1:声音 → 形象 → 包装,三段串成一条流水线。

也可以让 HyperFrames 用自己的内置 TTS/transcribe 一条龙搞定,但本流水线单独用 Fish Audio 出声,声音更自然、可复用、能克隆你自己音色,后面做系列视频时人声一致。

四、动手跑通

下面是一条最小可跑通的路径。我没法在你机器上实跑(环境不在我这边),但每一步都是官方工作流,复制即用。

步骤 1 · Fish Audio 出配音

在线最省事:打开 fishaudio.com,粘贴文案、插入情感标签,或上传 10–30 秒音频克隆声音,生成后下载 .wav。本地部署则 git clone fishaudio/fish-speech 起 WebUI / API(需 GPU)。

步骤 2 · HeyGen V 生成数字人

在 HeyGen 选 Avatar(或上传你的照片做数字分身),把步骤 1 的配音音频 + 脚本喂进去,生成对口型视频,导出 .mp4

步骤 3 · HyperFrames 包装

# 给 AI 编程助手装上 HyperFrames 技能(Claude Code / Cursor / Codex 通用)
npx skills add heygen-com/hyperframes
# 初始化项目:拷贝素材 + 自动转录音频
npx hyperframes init my-video
# 让助手用自然语言写 HTML 合成(加字幕/转场/特效)
# 预览(帧精确,热重载)→ 渲染成片
npx hyperframes preview
npx hyperframes render --output final.mp4

坑:本地渲染依赖

HyperFrames 需要 Node.js 22+FFmpeg 在 PATH 里;本地渲染靠 headless Chrome,机器太弱会卡。没环境就先用 HeyGen 自带字幕,等上了 HyperFrames 再精细化。

五、坑与提醒

注意点说明
肖像权 / 声音权数字人涉及被代言人的肖像与声音权益,商用必须拿到本人授权,不能拿别人的脸/声随便做商业视频。
Fish Audio 商用许可代码 Apache-2.0,但模型权重是非商业许可,企业商用需向官方申请授权或使用自有可商用权重。
HeyGen 是付费 SaaS按生成时长 / 订阅计费,做量产前先看清楚额度和条款,避免账单超预期。
HyperFrames 依赖需 Node.js 22+ 与 FFmpeg,本地渲染吃资源;CI/CD 可走云端渲染省本机。
无需代理三款均国内可正常使用:Fish Audio 有国内镜像,HeyGen 国内可访问,HyperFrames 是 npm 包——不用任何额外工具。

合规是第一道槛:先把「肖像 / 声音授权」和「商用许可」确认了,再谈效率和成本。技术能跑通不代表能商用。

六、小结与获取

一句话总结:这条流水线的价值不是「某个工具多强」,而是三段各司其职、输出即输入,一个人就能把口播视频从 0 做到成片。

坤哥,建议先用三家的在线版跑通最小闭环(Fish Audio 在线配音 → HeyGen 在线数字人 → HyperFrames 本地加字幕),确认效果和人声一致,再决定是否本地私有化部署。玩出成片了记得回来,咱可以再写篇实战记录。

返回技艺录