克隆音 · 课件
打开后点文字直接改
示范 样本三词 本地 / 云端 同稿盲听 一起做 API 接入 收口
一 · 导入0:00–2:00

下面两段声音,哪段是 AI

片段一

片段二

片段一是 AI 克隆的。片段二才是小陈本人。
它只听了我半分钟,就能替我念任何稿子。

二 · 这节课练什么2:00–3:00

用老师提供的 15–30 秒干净人声,克隆出老师的声音,
并让它念一段样本里没有的话。

本节知识点:领取老师的干净样本 → 交给克隆工具 → 之后任何文本都能用这个声音念出来。
三 · 前测3:00–5:00
刷视频时听出来过「这是 AI 配音」的? 如果要复刻一个 IP 的声音,你觉得先要准备什么?
四 · 示范 · 看我做一遍5:00–9:00

领样本 → 建声音 → 用声音

  • 1 · 领样本领取老师提供的一段 20 秒左右干净人声。
  • 2 · 建声音上传样本、起个名字,得到一个可复用的「声音」。

    建一次,以后一直用

  • 3 · 用声音输入任何文本,用这个声音念出来。
  • 上传样本截图
    ① 上传样本fish.audio · 创建声音入口
    给声音起名截图
    ② 起名建声音起个认得出的名字
    输入文本截图
    ③ 输入要念的文本选老师样本建的声音 + 贴文本
    合成结果截图
    ④ 合成结果点播放,听它替你念
    五 · 样本要求9:00–11:00

    安静 · 单人 · 半分钟

  • 安静检查老师 / 指定 IP 素材。

    没有背景音乐、没有明显环境噪声

  • 单人只有一个人连续说话。

    不要对话、不要笑场

  • 半分钟15–30 秒就够。
  • 本次克隆使用的参考原声(15 秒)

    六 · 先认路线11:00–14:00

    本地 / 云端

    本地模型

    VoxCPM2:机器自己跑

    不按生成次数向平台付费,但要承担电脑配置、模型下载、部署时间和后续维护。

    云端平台

    Fish / 有道 / MiniMax 等:平台替你跑

    上手快、部署少,通常按积分、字符或套餐收费。

    去公司怎么说:「云端省部署,按量付费;本地不按次收费,但需要公司提供机器、部署时间和维护成本。先拿同一份 IP 样本、同一句文案试听,再决定。」
    七 · 同文案平台盲听14:00–20:00

    同文案横评

    统一测试文案:拍拍手,同学们,说重点了。这些年你除了赚钱、花钱、吃喝拉撒,除了变成屎,还留下过什么吗?你为你的爱好拼过命吗?
    A
    Fish Audio · S2 Pro
    本地文件 08 · 8.99 秒
    B
    Fish Audio · S2.1 Pro
    本地文件 09 · 8.65 秒
    C
    ElevenLabs · via Sync
    本地文件 10 · 9.06 秒
    D
    VoxCPM2
    本地模型 · 文件 11 · 8.80 秒
    E
    有道 · Confucius4-TTS
    云端 · 文件 12 · 8.58 秒
    F
    MiniMax · speech-2.8-hd
    云端 · 文件 13 · 11.85 秒
    八 · 一起做 · 课间练习20:00–27:00

    克隆声音

    fish.audio 走完整流程:

  • 1 · 领样本群里下载老师的样本音频(20 秒干净人声)。

    不用录自己的声音

  • 2 · 传上传样本 → 起名建声音。
  • 3 · 验让它念一句样本里没有的话。

    提交成功就算过关,生成慢的课后看

  • 课堂底线:所有人只使用老师发放的样本。不现场录学员声音,不上传学员本人声音,不建立学员本人音色。
    网页端不止一家:有道语音克隆也是纯网页操作,流程同款——confucius4-tts.youdao.com/gradio。fish 卡住就切备用通道。

    干净的 30 秒 + 一句话要求 = 一个能念任何稿子的声音。

    九 · 课后作业 · IP 视频 + IP 克隆27:00–30:00

    作业换指定 IP

    样本不用录,从指定 IP 视频里抠:

  • 1 · 抠样本把视频发给 AI,一句话让它提取干净人声。

    AI 会自己用工具完成,你不用懂命令

  • 2 · 走流程和今天课上完全一样:上传 → 建声音。
  • 3 · 交作业交一段「IP 声音念的、原视频里没有的话」。

    20 秒就够

  • 抠样本就这句:「从这条视频里帮我提取一段 15–30 秒、只有人声、没有背景音乐的干净音频。」
    十 · API 带练先跑 1 句,再跑整篇

    API 五步

    长旁白交给 agent 批量生成,每一步都要看得见:

  • 1 · 进开发者侧边栏点「开发者」。

    新版有:控制台 / API 体验场 / API 密钥 / API 账单

  • 2 · 建专用密钥进「API 密钥」新建一枚本课专用密钥。

    只放在私密任务;不发群、不截图、不写进作业

  • 3 · 密钥 + 文档一起给把 API 密钥和官方 API 文档一起丢给私密 Codex 任务。
  • 4 · 看过程要求 agent 回报:读文档 → 定位声音 → 生成 → 保存。

    不黑盒等成品

  • 5 · 先验再放行先听 10–20 秒测试音频。

    音色、断句、文案都对,再跑整篇

  • 给 Codex 的简单提示词:「这是 Fish Audio 的 API 密钥和官方 API 文档。请帮我配置好,密钥只放环境变量,不要写进代码。配好后,先用「老师课堂演示」的声音生成一句测试音频给我。」
    两套账,别搞混:网页创意端和开发者 API 控制台是两套使用通道。真正跑前看当天账单页。

    网页端是试一句,API 是跑整篇——先验小样,再放行批量。

    十一 · 后测收尾前 3 分钟

    场景题

    你想给周一做的个人网站加一段「IP 声音」的欢迎语,
    但 IP 不可能专门给你录——怎么办?

    十二 · 总结收口最后 2 分钟

    今天带走三样

    ① 一条流程

    克隆全流程跑通

    课上用老师的样本练过一遍,作业换课程指定 IP 再走一遍

    ② 三个词

    安静 · 单人 · 半分钟

    样本三词诀,样本差后面全白搭

    ③ 一个公式

    授权样本 + 要求 = 声音

    课上只用老师样本,作业只用课程指定 IP 样本

    今晚作业:克隆课程指定 IP 的声音——把课程发放的视频交给 AI 抠出干净样本,走今天的流程,交一段「IP 声音念的、原视频里没有的话」(20 秒即可)。