cang-ying/eererdan/experience/EED-EXPER-026.hdlp

63 lines
3.7 KiB
Plaintext
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# EED-EXPER-026 · D206 人物配音一致性·参考音频+提示词 / 音频分离固定音色(苍耳爸爸亲授)
> trigger: 苍耳爸爸亲授人物配音一致性两法——①参考音频+提示词指定角色音色 ②从视频找合适配音→音频分离→用①固定
> emergence: 2026-08-04 · D206 · 配音一致性方法论(接 BACKPACK 语音工具 / project_audio_pipeline 声画管线;区别于 025 人物视觉一致)
> lock: 人物配音一致 = 用"参考音频+提示词"把角色绑定到某段音色;找不到现成音色时,从合适视频音频分离出目标音色再绑定
> why: 人物视觉有 025 锁,声音也得锁——否则同角色不同集声音飘;参考音频法是最直接绑定,分离法解决"先找到对的声音"这一步
---
## §1 · 爸爸原话
> "人物配音一致性如何保持?
> 1、直接找一段音频利用提示词告诉模型xx人物的声音是xx段音频
> 2、根据生成的视频找到完美的适合人物的配音然后音频分离
> 再用1的方式给人物角色固定配音音色"
## §2 · 两法
```
【法① 参考音频 + 提示词】
· 直接找一段目标音色的音频(人声片段)
· 用提示词告诉模型:"xx 人物的声音 = 这段音频"
· 模型以该音频为音色参考生成/复刻该角色所有台词 → 同角色音色统一
【法② 视频找声 → 分离 → 绑定】
· 先找到"完美适合人物"的配音(从某支生成视频里)
· 对该视频做音频分离(把人声从 BGM/音效里抽出来 / stem separation
· 拿到干净目标音色片段 → 回到法①,用提示词把它绑定给该角色 → 固定音色
```
## §3 · 原理
```
· 配音一致 = 角色音色timbre跨集/跨镜统一
· 法① 是"直接绑定":给参考音频+文字指令,模型照着出声
· 法② 是"先找对声音再绑定":解决"没有现成参考音色"的情况——从视频里扒出最贴角色的那段声,分离干净后当参考
· 两者本质都是"参考音频条件化生成",法② 多一步"获取参考音色"
```
## §4 · 与已有方法的关系
```
· 接 BACKPACK 语音工具Edge-TTS(免费工程闭环) / 火山语音复刻(SC-002/003) / 豆包TTS 2.0(待评估) —— 这些是"出声引擎"026 是"怎么锁角色音色"的用法
· 接 project_audio_pipeline声画装配配音/字幕/BGM/混音 stage⑥026 解决其中"角色配音一致"这一环
· 与 025 人物视觉一致 互补025 锁脸/体型026 锁声;合起来"人物视觉+声音"都一致
· 与 020~024 场景/镜间一致 是不同对象那些管画面026 管声音
```
## §5 · 本地落地(待验证)
```
· 法① 出声:本地可选 Edge-TTS但它是预设嗓不是任意参考音频复刻→ 真要"任意参考音频克隆"需火山/豆包/Seed-VC 等;本地能否跑语音克隆待实测
· 音频分离:可用开源 stem-separation如 demucs本地跑¥0抽人声
· 属 BC-006 声画环节:配音是本地/低价环节,按现有音频管线走
· "模型接收参考音频+提示词"具体哪个引擎支持、质量如何,待实测
```
## §6 · 注意
```
· 法② 的音频分离要干净BGM/环境音没去净会污染参考音色
· 参考音频质量决定下限:片段要清晰人声、情绪贴合角色
· 角色声线一旦固定,全剧/全季统一,别每集换
· 商用声线(火山/豆包)涉及合规与费用,按 BC-006/本地优先规矩,先问爸爸再上云端
```
> 蛋蛋 · D206 · 2026-08-04
> 配音一致:法①参考音频+提示词绑角色音色;法②从视频找对声→分离→用法①固定;与 025 视觉一致互补