一 · 导入0:00–2:00
下面两段声音,哪段是 AI?
片段二
片段一是 AI 克隆的。片段二才是小陈本人。
它只听了我半分钟,就能替我念任何稿子。
二 · 这节课练什么2:00–3:00
用老师提供的 15–30 秒干净人声,克隆出老师的声音,
并让它念一段样本里没有的话。
本节知识点:领取老师的干净样本 → 交给克隆工具 → 之后任何文本都能用这个声音念出来。
三 · 前测3:00–5:00
刷视频时听出来过「这是 AI 配音」的?
如果要复刻一个 IP 的声音,你觉得先要准备什么?
四 · 示范 · 看我做一遍5:00–9:00
领样本 → 建声音 → 用声音
建一次,以后一直用
五 · 样本要求9:00–11:00
安静 · 单人 · 半分钟
没有背景音乐、没有明显环境噪声
不要对话、不要笑场
本次克隆使用的参考原声(15 秒)
六 · 先认路线11:00–14:00
本地 / 云端
VoxCPM2:机器自己跑
不按生成次数向平台付费,但要承担电脑配置、模型下载、部署时间和后续维护。
Fish / 有道 / MiniMax 等:平台替你跑
上手快、部署少,通常按积分、字符或套餐收费。
去公司怎么说:「云端省部署,按量付费;本地不按次收费,但需要公司提供机器、部署时间和维护成本。先拿同一份 IP 样本、同一句文案试听,再决定。」
七 · 同文案平台盲听14:00–20:00
同文案横评
统一测试文案:拍拍手,同学们,说重点了。这些年你除了赚钱、花钱、吃喝拉撒,除了变成屎,还留下过什么吗?你为你的爱好拼过命吗?
A
Fish Audio · S2 Pro
B
Fish Audio · S2.1 Pro
C
ElevenLabs · via Sync
D
VoxCPM2
E
有道 · Confucius4-TTS
F
MiniMax · speech-2.8-hd
八 · 一起做 · 课间练习20:00–27:00
克隆声音
在 fish.audio 走完整流程:
不用录自己的声音
提交成功就算过关,生成慢的课后看
课堂底线:所有人只使用老师发放的样本。不现场录学员声音,不上传学员本人声音,不建立学员本人音色。
网页端不止一家:有道语音克隆也是纯网页操作,流程同款——confucius4-tts.youdao.com/gradio。fish 卡住就切备用通道。
干净的 30 秒 + 一句话要求 = 一个能念任何稿子的声音。
九 · 课后作业 · IP 视频 + IP 克隆27:00–30:00
作业换指定 IP
样本不用录,从指定 IP 视频里抠:
AI 会自己用工具完成,你不用懂命令
20 秒就够
抠样本就这句:「从这条视频里帮我提取一段 15–30 秒、只有人声、没有背景音乐的干净音频。」
十 · API 带练先跑 1 句,再跑整篇
API 五步
长旁白交给 agent 批量生成,每一步都要看得见:
新版有:控制台 / API 体验场 / API 密钥 / API 账单
只放在私密任务;不发群、不截图、不写进作业
不黑盒等成品
音色、断句、文案都对,再跑整篇
给 Codex 的简单提示词:「这是 Fish Audio 的 API 密钥和官方 API 文档。请帮我配置好,密钥只放环境变量,不要写进代码。配好后,先用「老师课堂演示」的声音生成一句测试音频给我。」
两套账,别搞混:网页创意端和开发者 API 控制台是两套使用通道。真正跑前看当天账单页。
网页端是试一句,API 是跑整篇——先验小样,再放行批量。
十一 · 后测收尾前 3 分钟
场景题
你想给周一做的个人网站加一段「IP 声音」的欢迎语,
但 IP 不可能专门给你录——怎么办?
十二 · 总结收口最后 2 分钟
今天带走三样
① 一条流程
克隆全流程跑通
课上用老师的样本练过一遍,作业换课程指定 IP 再走一遍
② 三个词
安静 · 单人 · 半分钟
样本三词诀,样本差后面全白搭
③ 一个公式
授权样本 + 要求 = 声音
课上只用老师样本,作业只用课程指定 IP 样本
今晚作业:克隆课程指定 IP 的声音——把课程发放的视频交给 AI 抠出干净样本,走今天的流程,交一段「IP 声音念的、原视频里没有的话」(20 秒即可)。