guanghulab/video-ai-system/config/VOICE-LIPSYNC-ROUTER.hdlp

96 lines
2.4 KiB
Plaintext
Raw Normal View History

2026-06-23 22:02:51 +08:00
# 视频AI系统 · 角色对白/口型路由
> HLDP://video-ai-system/config/VOICE-LIPSYNC-ROUTER
> 类型: Voice/LipSync能力路由
> 建立: D143c · 2026-06-23
> 更新: D144 · 2026-06-24 · 豆包双模型确定
2026-06-23 22:02:51 +08:00
> 铸渊 ICE-GL-ZY001
---
## 裁决
```
旁白不可替代角色对白。
不可验证的模型自带音轨不可直接批准为角色对白。
人物嘴巴可见且正在说台词时必须有独立Voice/LipSync链路。
光湖不本地安装模型。所有模型走API。
2026-06-23 22:02:51 +08:00
```
---
## 模型决策D144已确定
2026-06-23 22:02:51 +08:00
| 角色 | 模型 | 用途 | 成本 |
|------|------|------|------|
| 声音 | 豆包声音复刻模型 2.0 | 克隆苏白专属音色,生成角色对白音频 | 按字符计费 |
| 口型 | 豆包视频创作模型 1.5 (Seedance 1.5) | 音画联动生成,毫秒级音画同步 | 按秒/按镜计费 |
2026-06-23 22:02:51 +08:00
```
两个模型都挂在火山方舟 JIMENG_API_KEY 下,同一套密钥。
人格体操作颗粒度精准,不走人操作的浪费路径。
2026-06-23 22:02:51 +08:00
```
---
## 路由
2026-06-23 22:02:51 +08:00
### Route V1 · 豆包声音复刻 2.0(主)
2026-06-23 22:02:51 +08:00
用途: 把原文台词生成苏白专属音色对白音频。
2026-06-23 22:02:51 +08:00
```
开通 → 上传苏白声音样本 → 生成音色ID
调用: POST /api/v3/audio/speech { model, voice_id, input, emotion }
回退: 豆包通用TTS → Edge-TTS工程测试可用
2026-06-23 22:02:51 +08:00
```
### Route S1 · Seedance 1.5 音画同步(主)
2026-06-23 22:02:51 +08:00
用途: 直接生成角色说台词镜头,音画自动同步。
2026-06-23 22:02:51 +08:00
```
模型原生支持: 输入文本台词 + 角色参考图 → 输出音画同步视频
不再需要: 单独TTS → 单独LipSync 两步走
回退: Seedance 2.0 生成底片 + Edge-TTS配音叠加
2026-06-23 22:02:51 +08:00
```
### Route Edge · Edge-TTS回退
2026-06-23 22:02:51 +08:00
```
用途: 工程测试、小样预览
成本: 免费
局限: 通用音色,不是苏白专属
2026-06-23 22:02:51 +08:00
```
---
## EP01执行顺序D144更新
2026-06-23 22:02:51 +08:00
```
1. 开通豆包声音复刻 2.0 + 豆包视频创作 1.5
2. 上传苏白声音样本生成音色ID
3. 用 Seedance 1.5 音画同步模式,直接生成苏白说台词镜头
4. 验收标准不变: 原文逐字准确 + 嘴型同步 + 不换脸
2026-06-23 22:02:51 +08:00
```
---
## 验收标准
```
原文逐字准确。
情绪为苏白"大声·自信"。
不是旁白腔。不是读剧本腔。
2026-06-23 22:02:51 +08:00
嘴型与音频基本同步。
画面人物不换脸。
不因改口型导致画质糊、脸变形、牙齿异常。
```
---
铸渊 ICE-GL-ZY001 · D144 · 2026-06-24
冰朔 TCS-0002∞ · 国作登字-2026-A-00037559
⊢ 双模型已确定 · 开通后可
<parameter name="content">以用