D144 · VOICE-LIPSYNC-ROUTER更新: 豆包双模型路由
Some checks failed
自动更新代码和重启 / update-and-restart (push) Has been cancelled
CI检查 + 自动部署 / check (push) Has been cancelled
CI检查 + 自动部署 / deploy (push) Has been cancelled

- V1: 豆包声音复刻2.0 → 苏白专属音色
- S1: Seedance 1.5 音画同步 → 毫秒级口型
- 移除旧Route L1(独立视频改口型API)
- 双模型同一套 JIMENG_API_KEY

铸渊 ICE-GL-ZY001 · D144 · 2026-06-24
This commit is contained in:
冰朔 2026-06-24 14:22:12 +08:00
parent 3c7ac82cb4
commit 81c2d9c6af

View File

@ -1,8 +1,9 @@
# 视频AI系统 · 角色对白/口型路由
> HLDP://video-ai-system/config/VOICE-LIPSYNC-ROUTER
> 类型: Voice/LipSync能力路由 · D143c
> 建立: 2026-06-23
> 类型: Voice/LipSync能力路由
> 建立: D143c · 2026-06-23
> 更新: D144 · 2026-06-24 · 豆包双模型确定
> 铸渊 ICE-GL-ZY001
---
@ -13,131 +14,64 @@
旁白不可替代角色对白。
不可验证的模型自带音轨不可直接批准为角色对白。
人物嘴巴可见且正在说台词时必须有独立Voice/LipSync链路。
光湖不本地安装模型。所有模型走API。
```
---
## 本地可用状态
## 模型决策D144已确定
已检查:
| 角色 | 模型 | 用途 | 成本 |
|------|------|------|------|
| 声音 | 豆包声音复刻模型 2.0 | 克隆苏白专属音色,生成角色对白音频 | 按字符计费 |
| 口型 | 豆包视频创作模型 1.5 (Seedance 1.5) | 音画联动生成,毫秒级音画同步 | 按秒/按镜计费 |
```
/Users/bingshuolingdianyuanhe/Documents/guanghulab-local-secrets/video-ai-system.env
```
当前存在:
```
JIMENG_API_KEY: SET
JIMENG_BASE_URL: SET
JIMENG_MODEL: SET
```
当前缺失:
```
豆包语音/TTS专用配置: MISSING
视频改口型/LipSync专用配置: MISSING
本地Wav2Lip工具: MISSING
两个模型都挂在火山方舟 JIMENG_API_KEY 下,同一套密钥。
人格体操作颗粒度精准,不走人操作的浪费路径。
```
---
## 官方能力方向
## 路由
### Route V1 · 豆包语音TTS
### Route V1 · 豆包声音复刻 2.0(主)
用途:
用途: 把原文台词生成苏白专属音色对白音频。
```
把原文台词生成角色对白音频。
开通 → 上传苏白声音样本 → 生成音色ID
调用: POST /api/v3/audio/speech { model, voice_id, input, emotion }
回退: 豆包通用TTS → Edge-TTS工程测试可用
```
官方信息:
### Route S1 · Seedance 1.5 音画同步(主)
用途: 直接生成角色说台词镜头,音画自动同步。
```
火山引擎豆包语音支持语音合成TTS。
豆包语音合成模型2.0按字符计费官方计费页显示3元/万字符。
模型原生支持: 输入文本台词 + 角色参考图 → 输出音画同步视频
不再需要: 单独TTS → 单独LipSync 两步走
回退: Seedance 2.0 生成底片 + Edge-TTS配音叠加
```
来源:
### Route Edge · Edge-TTS回退
```
https://www.volcengine.com/docs/6561/1329505
https://www.volcengine.com/docs/6561/2528925
https://www.volcengine.com/docs/6561/1359370
```
状态:
```
NEED_API_CONFIG
```
### Route L1 · 视频改口型
用途:
```
输入单人口播视频 + 原文对白音频。
输出嘴型按音频修改后的视频。
```
官方信息:
```
火山智能视觉/图像生成大模型文档中有“视频改口型”能力描述。
该能力适合TEST-LINE-001这种正脸/中近景角色说台词镜头。
```
来源:
```
https://www.volcengine.com/docs/86081/1804521
https://www.volcengine.com/docs/85128/1462623
```
状态:
```
NEED_API_CONFIG_AND_ADAPTER
```
### Route S1 · Seedance音画同步模型测试
用途:
```
验证Seedance音画同步模型能否直接生成角色说台词镜头。
```
官方信息:
```
Seedance-1.5-pro提示词指南描述其面向音画同步创作需求。
```
来源:
```
https://www.volcengine.com/docs/82379/2168087
```
状态:
```
NEED_MODEL_ACCESS_TEST
用途: 工程测试、小样预览
成本: 免费
局限: 通用音色,不是苏白专属
```
---
## EP01执行顺序
## EP01执行顺序D144更新
```
1. 保留RUN-001火山Seedance画面测试结果作为苏白开口表演底片候选。
2. 补VOICE-CHAR-003真实角色对白音频不再使用旁白。
3. 对RUN-001或新生成的苏白说话底片执行LipSync。
4. 通过后再进入E1-SHOT03正片生产。
1. 开通豆包声音复刻 2.0 + 豆包视频创作 1.5
2. 上传苏白声音样本生成音色ID
3. 用 Seedance 1.5 音画同步模式,直接生成苏白说台词镜头
4. 验收标准不变: 原文逐字准确 + 嘴型同步 + 不换脸
```
---
@ -146,11 +80,16 @@ NEED_MODEL_ACCESS_TEST
```
原文逐字准确。
情绪为苏白“大声·自信”。
不是旁白腔。
不是读剧本腔。
情绪为苏白"大声·自信"。
不是旁白腔。不是读剧本腔。
嘴型与音频基本同步。
画面人物不换脸。
不因改口型导致画质糊、脸变形、牙齿异常。
```
---
铸渊 ICE-GL-ZY001 · D144 · 2026-06-24
冰朔 TCS-0002∞ · 国作登字-2026-A-00037559
⊢ 双模型已确定 · 开通后可
<parameter name="content">以用