From 6997535fc1eeb0bace1512c5e87208f096286ddb Mon Sep 17 00:00:00 2001 From: Zhuyuan Operations Date: Tue, 4 Aug 2026 12:13:15 +0800 Subject: [PATCH] =?UTF-8?q?EED-EXPER-026=20=C2=B7=20=E4=BA=BA=E7=89=A9?= =?UTF-8?q?=E9=85=8D=E9=9F=B3=E4=B8=80=E8=87=B4=E6=80=A7=C2=B7=E5=8F=82?= =?UTF-8?q?=E8=80=83=E9=9F=B3=E9=A2=91+=E6=8F=90=E7=A4=BA=E8=AF=8D/?= =?UTF-8?q?=E9=9F=B3=E9=A2=91=E5=88=86=E7=A6=BB=E5=9B=BA=E5=AE=9A=E9=9F=B3?= =?UTF-8?q?=E8=89=B2=EF=BC=88=E8=8B=8D=E8=80=B3=E7=88=B8=E7=88=B8=E4=BA=B2?= =?UTF-8?q?=E6=8E=88=EF=BC=89=20+=20INDEX=E6=9B=B4=E6=96=B0=20+=20?= =?UTF-8?q?=E5=94=A4=E9=86=92=E5=8D=A1=E6=9C=80=E6=96=B0=E6=8C=87=E9=92=88?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- QUICK-WAKE.hdlp | 2 +- eererdan/experience/EED-EXPER-026.hdlp | 62 ++++++++++++++++++++++++ eererdan/experience/EED-EXPER-INDEX.hdlp | 1 + 3 files changed, 64 insertions(+), 1 deletion(-) create mode 100644 eererdan/experience/EED-EXPER-026.hdlp diff --git a/QUICK-WAKE.hdlp b/QUICK-WAKE.hdlp index d091cc0..8a20dad 100644 --- a/QUICK-WAKE.hdlp +++ b/QUICK-WAKE.hdlp @@ -126,7 +126,7 @@ TCS六层大脑架构(需要深入思考时参考) 经验库(EED-EXPER-XXX·倒序读最新) HLDP://cang-ying/eererdan/experience/ → cang-ying/eererdan/experience/ - 最新: EED-EXPER-025.hdlp(D206·人物一致性·三视图+面部特写) + 最新: EED-EXPER-026.hdlp(D206·人物配音一致性) 记忆库(EED-MEMO-XXX) HLDP://cang-ying/eererdan/memory/ diff --git a/eererdan/experience/EED-EXPER-026.hdlp b/eererdan/experience/EED-EXPER-026.hdlp new file mode 100644 index 0000000..041e828 --- /dev/null +++ b/eererdan/experience/EED-EXPER-026.hdlp @@ -0,0 +1,62 @@ +# EED-EXPER-026 · D206 人物配音一致性·参考音频+提示词 / 音频分离固定音色(苍耳爸爸亲授) + +> trigger: 苍耳爸爸亲授人物配音一致性两法——①参考音频+提示词指定角色音色 ②从视频找合适配音→音频分离→用①固定 +> emergence: 2026-08-04 · D206 · 配音一致性方法论(接 BACKPACK 语音工具 / project_audio_pipeline 声画管线;区别于 025 人物视觉一致) +> lock: 人物配音一致 = 用"参考音频+提示词"把角色绑定到某段音色;找不到现成音色时,从合适视频音频分离出目标音色再绑定 +> why: 人物视觉有 025 锁,声音也得锁——否则同角色不同集声音飘;参考音频法是最直接绑定,分离法解决"先找到对的声音"这一步 + +--- + +## §1 · 爸爸原话 +> "人物配音一致性如何保持? +> 1、直接找一段音频,利用提示词,告诉模型,xx人物的声音是xx段音频 +> 2、根据生成的视频找到完美的适合人物的配音然后音频分离, +> 再用1的方式给人物角色固定配音音色" + +## §2 · 两法 +``` +【法① 参考音频 + 提示词】 +· 直接找一段目标音色的音频(人声片段) +· 用提示词告诉模型:"xx 人物的声音 = 这段音频" +· 模型以该音频为音色参考生成/复刻该角色所有台词 → 同角色音色统一 + +【法② 视频找声 → 分离 → 绑定】 +· 先找到"完美适合人物"的配音(从某支生成视频里) +· 对该视频做音频分离(把人声从 BGM/音效里抽出来 / stem separation) +· 拿到干净目标音色片段 → 回到法①,用提示词把它绑定给该角色 → 固定音色 +``` + +## §3 · 原理 +``` +· 配音一致 = 角色音色(timbre)跨集/跨镜统一 +· 法① 是"直接绑定":给参考音频+文字指令,模型照着出声 +· 法② 是"先找对声音再绑定":解决"没有现成参考音色"的情况——从视频里扒出最贴角色的那段声,分离干净后当参考 +· 两者本质都是"参考音频条件化生成",法② 多一步"获取参考音色" +``` + +## §4 · 与已有方法的关系 +``` +· 接 BACKPACK 语音工具:Edge-TTS(免费工程闭环) / 火山语音复刻(SC-002/003) / 豆包TTS 2.0(待评估) —— 这些是"出声引擎",026 是"怎么锁角色音色"的用法 +· 接 project_audio_pipeline(声画装配:配音/字幕/BGM/混音 stage⑥):026 解决其中"角色配音一致"这一环 +· 与 025 人物视觉一致 互补:025 锁脸/体型,026 锁声;合起来"人物视觉+声音"都一致 +· 与 020~024 场景/镜间一致 是不同对象:那些管画面,026 管声音 +``` + +## §5 · 本地落地(待验证) +``` +· 法① 出声:本地可选 Edge-TTS(但它是预设嗓,不是任意参考音频复刻)→ 真要"任意参考音频克隆"需火山/豆包/Seed-VC 等;本地能否跑语音克隆待实测 +· 音频分离:可用开源 stem-separation(如 demucs)本地跑(¥0),抽人声 +· 属 BC-006 声画环节:配音是本地/低价环节,按现有音频管线走 +· "模型接收参考音频+提示词"具体哪个引擎支持、质量如何,待实测 +``` + +## §6 · 注意 +``` +· 法② 的音频分离要干净:BGM/环境音没去净会污染参考音色 +· 参考音频质量决定下限:片段要清晰人声、情绪贴合角色 +· 角色声线一旦固定,全剧/全季统一,别每集换 +· 商用声线(火山/豆包)涉及合规与费用,按 BC-006/本地优先规矩,先问爸爸再上云端 +``` + +> 蛋蛋 · D206 · 2026-08-04 +> 配音一致:法①参考音频+提示词绑角色音色;法②从视频找对声→分离→用法①固定;与 025 视觉一致互补 diff --git a/eererdan/experience/EED-EXPER-INDEX.hdlp b/eererdan/experience/EED-EXPER-INDEX.hdlp index d7d7156..2db460e 100644 --- a/eererdan/experience/EED-EXPER-INDEX.hdlp +++ b/eererdan/experience/EED-EXPER-INDEX.hdlp @@ -3,6 +3,7 @@ > 倒序 · 最新的在上面 · 蛋蛋醒来扫一眼就知道手里有什么牌 > 最后内化: 2026-08-04 D206 +- EED-EXPER-026.hdlp | EED-EXPER-026 · 人物配音一致性·参考音频+提示词/音频分离固定音色(苍耳爸爸亲授) - EED-EXPER-025.hdlp | EED-EXPER-025 · 人物一致性·三视图+面部特写参考法(苍耳爸爸亲授·方法①) - EED-EXPER-024.hdlp | EED-EXPER-024 · 镜头衔接·上一镜尾帧做下一镜分镜图(苍耳爸爸亲授) - EED-EXPER-023.hdlp | EED-EXPER-023 · 场景一致性三招效果排序(苍耳爸爸亲授·校正)