D144 · VOICE-LIPSYNC-ROUTER更新: 豆包双模型路由
Some checks failed
自动更新代码和重启 / update-and-restart (push) Has been cancelled
CI检查 + 自动部署 / check (push) Has been cancelled
CI检查 + 自动部署 / deploy (push) Has been cancelled

- V1: 豆包声音复刻2.0 → 苏白专属音色
- S1: Seedance 1.5 音画同步 → 毫秒级口型
- 移除旧Route L1(独立视频改口型API)
- 双模型同一套 JIMENG_API_KEY

铸渊 ICE-GL-ZY001 · D144 · 2026-06-24
This commit is contained in:
冰朔 2026-06-24 14:22:12 +08:00
parent 3c7ac82cb4
commit 81c2d9c6af

View File

@ -1,8 +1,9 @@
# 视频AI系统 · 角色对白/口型路由 # 视频AI系统 · 角色对白/口型路由
> HLDP://video-ai-system/config/VOICE-LIPSYNC-ROUTER > HLDP://video-ai-system/config/VOICE-LIPSYNC-ROUTER
> 类型: Voice/LipSync能力路由 · D143c > 类型: Voice/LipSync能力路由
> 建立: 2026-06-23 > 建立: D143c · 2026-06-23
> 更新: D144 · 2026-06-24 · 豆包双模型确定
> 铸渊 ICE-GL-ZY001 > 铸渊 ICE-GL-ZY001
--- ---
@ -13,131 +14,64 @@
旁白不可替代角色对白。 旁白不可替代角色对白。
不可验证的模型自带音轨不可直接批准为角色对白。 不可验证的模型自带音轨不可直接批准为角色对白。
人物嘴巴可见且正在说台词时必须有独立Voice/LipSync链路。 人物嘴巴可见且正在说台词时必须有独立Voice/LipSync链路。
光湖不本地安装模型。所有模型走API。
``` ```
--- ---
## 本地可用状态 ## 模型决策D144已确定
已检查: | 角色 | 模型 | 用途 | 成本 |
|------|------|------|------|
| 声音 | 豆包声音复刻模型 2.0 | 克隆苏白专属音色,生成角色对白音频 | 按字符计费 |
| 口型 | 豆包视频创作模型 1.5 (Seedance 1.5) | 音画联动生成,毫秒级音画同步 | 按秒/按镜计费 |
``` ```
/Users/bingshuolingdianyuanhe/Documents/guanghulab-local-secrets/video-ai-system.env 两个模型都挂在火山方舟 JIMENG_API_KEY 下,同一套密钥。
``` 人格体操作颗粒度精准,不走人操作的浪费路径。
当前存在:
```
JIMENG_API_KEY: SET
JIMENG_BASE_URL: SET
JIMENG_MODEL: SET
```
当前缺失:
```
豆包语音/TTS专用配置: MISSING
视频改口型/LipSync专用配置: MISSING
本地Wav2Lip工具: MISSING
``` ```
--- ---
## 官方能力方向 ## 路由
### Route V1 · 豆包语音TTS ### Route V1 · 豆包声音复刻 2.0(主)
用途: 用途: 把原文台词生成苏白专属音色对白音频。
``` ```
把原文台词生成角色对白音频。 开通 → 上传苏白声音样本 → 生成音色ID
调用: POST /api/v3/audio/speech { model, voice_id, input, emotion }
回退: 豆包通用TTS → Edge-TTS工程测试可用
``` ```
官方信息: ### Route S1 · Seedance 1.5 音画同步(主)
用途: 直接生成角色说台词镜头,音画自动同步。
``` ```
火山引擎豆包语音支持语音合成TTS。 模型原生支持: 输入文本台词 + 角色参考图 → 输出音画同步视频
豆包语音合成模型2.0按字符计费官方计费页显示3元/万字符。 不再需要: 单独TTS → 单独LipSync 两步走
回退: Seedance 2.0 生成底片 + Edge-TTS配音叠加
``` ```
来源: ### Route Edge · Edge-TTS回退
``` ```
https://www.volcengine.com/docs/6561/1329505 用途: 工程测试、小样预览
https://www.volcengine.com/docs/6561/2528925 成本: 免费
https://www.volcengine.com/docs/6561/1359370 局限: 通用音色,不是苏白专属
```
状态:
```
NEED_API_CONFIG
```
### Route L1 · 视频改口型
用途:
```
输入单人口播视频 + 原文对白音频。
输出嘴型按音频修改后的视频。
```
官方信息:
```
火山智能视觉/图像生成大模型文档中有“视频改口型”能力描述。
该能力适合TEST-LINE-001这种正脸/中近景角色说台词镜头。
```
来源:
```
https://www.volcengine.com/docs/86081/1804521
https://www.volcengine.com/docs/85128/1462623
```
状态:
```
NEED_API_CONFIG_AND_ADAPTER
```
### Route S1 · Seedance音画同步模型测试
用途:
```
验证Seedance音画同步模型能否直接生成角色说台词镜头。
```
官方信息:
```
Seedance-1.5-pro提示词指南描述其面向音画同步创作需求。
```
来源:
```
https://www.volcengine.com/docs/82379/2168087
```
状态:
```
NEED_MODEL_ACCESS_TEST
``` ```
--- ---
## EP01执行顺序 ## EP01执行顺序D144更新
``` ```
1. 保留RUN-001火山Seedance画面测试结果作为苏白开口表演底片候选。 1. 开通豆包声音复刻 2.0 + 豆包视频创作 1.5
2. 补VOICE-CHAR-003真实角色对白音频不再使用旁白。 2. 上传苏白声音样本生成音色ID
3. 对RUN-001或新生成的苏白说话底片执行LipSync。 3. 用 Seedance 1.5 音画同步模式,直接生成苏白说台词镜头
4. 通过后再进入E1-SHOT03正片生产。 4. 验收标准不变: 原文逐字准确 + 嘴型同步 + 不换脸
``` ```
--- ---
@ -146,11 +80,16 @@ NEED_MODEL_ACCESS_TEST
``` ```
原文逐字准确。 原文逐字准确。
情绪为苏白“大声·自信”。 情绪为苏白"大声·自信"。
不是旁白腔。 不是旁白腔。不是读剧本腔。
不是读剧本腔。
嘴型与音频基本同步。 嘴型与音频基本同步。
画面人物不换脸。 画面人物不换脸。
不因改口型导致画质糊、脸变形、牙齿异常。 不因改口型导致画质糊、脸变形、牙齿异常。
``` ```
---
铸渊 ICE-GL-ZY001 · D144 · 2026-06-24
冰朔 TCS-0002∞ · 国作登字-2026-A-00037559
⊢ 双模型已确定 · 开通后可
<parameter name="content">以用