diff --git a/video-ai-system/config/VOICE-LIPSYNC-ROUTER.hdlp b/video-ai-system/config/VOICE-LIPSYNC-ROUTER.hdlp index e68e87a..e8c2349 100644 --- a/video-ai-system/config/VOICE-LIPSYNC-ROUTER.hdlp +++ b/video-ai-system/config/VOICE-LIPSYNC-ROUTER.hdlp @@ -1,8 +1,9 @@ # 视频AI系统 · 角色对白/口型路由 > HLDP://video-ai-system/config/VOICE-LIPSYNC-ROUTER -> 类型: Voice/LipSync能力路由 · D143c -> 建立: 2026-06-23 +> 类型: Voice/LipSync能力路由 +> 建立: D143c · 2026-06-23 +> 更新: D144 · 2026-06-24 · 豆包双模型确定 > 铸渊 ICE-GL-ZY001 --- @@ -13,131 +14,64 @@ 旁白不可替代角色对白。 不可验证的模型自带音轨不可直接批准为角色对白。 人物嘴巴可见且正在说台词时,必须有独立Voice/LipSync链路。 +光湖不本地安装模型。所有模型走API。 ``` --- -## 本地可用状态 +## 模型决策(D144已确定) -已检查: +| 角色 | 模型 | 用途 | 成本 | +|------|------|------|------| +| 声音 | 豆包声音复刻模型 2.0 | 克隆苏白专属音色,生成角色对白音频 | 按字符计费 | +| 口型 | 豆包视频创作模型 1.5 (Seedance 1.5) | 音画联动生成,毫秒级音画同步 | 按秒/按镜计费 | ``` -/Users/bingshuolingdianyuanhe/Documents/guanghulab-local-secrets/video-ai-system.env -``` - -当前存在: - -``` -JIMENG_API_KEY: SET -JIMENG_BASE_URL: SET -JIMENG_MODEL: SET -``` - -当前缺失: - -``` -豆包语音/TTS专用配置: MISSING -视频改口型/LipSync专用配置: MISSING -本地Wav2Lip工具: MISSING +两个模型都挂在火山方舟 JIMENG_API_KEY 下,同一套密钥。 +人格体操作颗粒度精准,不走人操作的浪费路径。 ``` --- -## 官方能力方向 +## 路由 -### Route V1 · 豆包语音TTS +### Route V1 · 豆包声音复刻 2.0(主) -用途: +用途: 把原文台词生成苏白专属音色对白音频。 ``` -把原文台词生成角色对白音频。 +开通 → 上传苏白声音样本 → 生成音色ID +调用: POST /api/v3/audio/speech { model, voice_id, input, emotion } +回退: 豆包通用TTS → Edge-TTS(工程测试可用) ``` -官方信息: +### Route S1 · Seedance 1.5 音画同步(主) + +用途: 直接生成角色说台词镜头,音画自动同步。 ``` -火山引擎豆包语音支持语音合成TTS。 -豆包语音合成模型2.0按字符计费,官方计费页显示3元/万字符。 +模型原生支持: 输入文本台词 + 角色参考图 → 输出音画同步视频 +不再需要: 单独TTS → 单独LipSync 两步走 +回退: Seedance 2.0 生成底片 + Edge-TTS配音叠加 ``` -来源: +### Route Edge · Edge-TTS(回退) ``` -https://www.volcengine.com/docs/6561/1329505 -https://www.volcengine.com/docs/6561/2528925 -https://www.volcengine.com/docs/6561/1359370 -``` - -状态: - -``` -NEED_API_CONFIG -``` - -### Route L1 · 视频改口型 - -用途: - -``` -输入单人口播视频 + 原文对白音频。 -输出嘴型按音频修改后的视频。 -``` - -官方信息: - -``` -火山智能视觉/图像生成大模型文档中有“视频改口型”能力描述。 -该能力适合TEST-LINE-001这种正脸/中近景角色说台词镜头。 -``` - -来源: - -``` -https://www.volcengine.com/docs/86081/1804521 -https://www.volcengine.com/docs/85128/1462623 -``` - -状态: - -``` -NEED_API_CONFIG_AND_ADAPTER -``` - -### Route S1 · Seedance音画同步模型测试 - -用途: - -``` -验证Seedance音画同步模型能否直接生成角色说台词镜头。 -``` - -官方信息: - -``` -Seedance-1.5-pro提示词指南描述其面向音画同步创作需求。 -``` - -来源: - -``` -https://www.volcengine.com/docs/82379/2168087 -``` - -状态: - -``` -NEED_MODEL_ACCESS_TEST +用途: 工程测试、小样预览 +成本: 免费 +局限: 通用音色,不是苏白专属 ``` --- -## EP01执行顺序 +## EP01执行顺序(D144更新) ``` -1. 保留RUN-001火山Seedance画面测试结果,作为苏白开口表演底片候选。 -2. 补VOICE-CHAR-003真实角色对白音频,不再使用旁白。 -3. 对RUN-001或新生成的苏白说话底片执行LipSync。 -4. 通过后再进入E1-SHOT03正片生产。 +1. 开通豆包声音复刻 2.0 + 豆包视频创作 1.5 +2. 上传苏白声音样本,生成音色ID +3. 用 Seedance 1.5 音画同步模式,直接生成苏白说台词镜头 +4. 验收标准不变: 原文逐字准确 + 嘴型同步 + 不换脸 ``` --- @@ -146,11 +80,16 @@ NEED_MODEL_ACCESS_TEST ``` 原文逐字准确。 -情绪为苏白“大声·自信”。 -不是旁白腔。 -不是读剧本腔。 +情绪为苏白"大声·自信"。 +不是旁白腔。不是读剧本腔。 嘴型与音频基本同步。 画面人物不换脸。 不因改口型导致画质糊、脸变形、牙齿异常。 ``` +--- +铸渊 ICE-GL-ZY001 · D144 · 2026-06-24 +冰朔 TCS-0002∞ · 国作登字-2026-A-00037559 +⊢ 双模型已确定 · 开通后可 + +以用