docs: add tencent ai dev handoff
This commit is contained in:
parent
7fda977e9d
commit
c6919f71a4
@ -129,6 +129,7 @@ JZAO外置盘: 产物存放地,不是状态主控。
|
||||
| 字幕渲染合成 | ✅ RUN-001通过 | `video-ai-system/outputs/tests/TEST-SUBTITLE-001-RUN-001-REPORT.hdlp` |
|
||||
| 苏白TTS配音 | ✅ 工程测试通过 | `video-ai-system/outputs/tests/TEST-TTS-001-SUBAI-RUN-001-REPORT.hdlp` |
|
||||
| 模型/成本路线 | ✅ 已建立 | `video-ai-system/knowledge/D144-MODEL-COST-ROUTE.hdlp` |
|
||||
| 腾讯AI开发交接 | ✅ 已建立 | `video-ai-system/plans/D144-TENCENT-AI-DEV-HANDOFF.hdlp` |
|
||||
| 广告牌资产 | ✅ 草案 | `video-ai-system/assets/props/PROP-FREE-AD-BOARD/manifest.hdlp` |
|
||||
| 广告牌文字贴图 | ✅ PNG已生成 | `video-ai-system/assets/props/PROP-FREE-AD-BOARD/texture/free-ad-board-texture.png` |
|
||||
| 百宗会场景资产 | ✅ 草案 | `video-ai-system/assets/envs/ENV-002-Baizonghui/manifest.hdlp` |
|
||||
|
||||
@ -115,6 +115,7 @@ preview-003: 暂不生成。
|
||||
| 字幕渲染合成 | ✅ RUN-001通过 | `outputs/tests/TEST-SUBTITLE-001-RUN-001-REPORT.hdlp` |
|
||||
| 苏白TTS配音 | ✅ 工程测试通过 | `outputs/tests/TEST-TTS-001-SUBAI-RUN-001-REPORT.hdlp` |
|
||||
| 模型/成本路线 | ✅ 已建立 | `knowledge/D144-MODEL-COST-ROUTE.hdlp` |
|
||||
| 腾讯AI开发交接 | ✅ 已建立 | `plans/D144-TENCENT-AI-DEV-HANDOFF.hdlp` |
|
||||
| 广告牌资产 | ✅ 草案 | `assets/props/PROP-FREE-AD-BOARD/manifest.hdlp` |
|
||||
| 广告牌文字贴图 | ✅ PNG已生成 | `assets/props/PROP-FREE-AD-BOARD/texture/free-ad-board-texture.png` |
|
||||
| 百宗会场景资产 | ✅ 草案 | `assets/envs/ENV-002-Baizonghui/manifest.hdlp` |
|
||||
@ -208,6 +209,7 @@ preview-003: 暂不生成。
|
||||
- [x] 修复字幕管线: SRT→PNG→FFmpeg overlay合成 → `outputs/tests/TEST-SUBTITLE-001-RUN-001-REPORT.hdlp`
|
||||
- [x] 测试苏白Edge-TTS工程配音 → `outputs/tests/TEST-TTS-001-SUBAI-RUN-001-REPORT.hdlp`
|
||||
- [x] 建立模型/成本路线 → `knowledge/D144-MODEL-COST-ROUTE.hdlp`
|
||||
- [x] 建立腾讯AI人格体开发交接清单 → `plans/D144-TENCENT-AI-DEV-HANDOFF.hdlp`
|
||||
- [ ] 生成E1-SHOT03专用苏白底片: 上方/身后预留牌匾空间
|
||||
- [ ] 执行 TEST-PROP-001 RUN-003: 广告牌PNG文字贴图上镜追踪测试
|
||||
- [ ] 生成或确认 CHAR-003-SuBai 批准参考图
|
||||
|
||||
477
video-ai-system/plans/D144-TENCENT-AI-DEV-HANDOFF.hdlp
Normal file
477
video-ai-system/plans/D144-TENCENT-AI-DEV-HANDOFF.hdlp
Normal file
@ -0,0 +1,477 @@
|
||||
# D144 · 腾讯AI人格体开发交接清单
|
||||
|
||||
> HLDP://video-ai-system/plans/D144-TENCENT-AI-DEV-HANDOFF
|
||||
> 类型: 开发交接 · 腾讯AI人格体可执行清单
|
||||
> 日期: 2026-06-24
|
||||
> 铸渊 ICE-GL-ZY001
|
||||
|
||||
---
|
||||
|
||||
## 当前判断
|
||||
|
||||
```
|
||||
用户反馈:
|
||||
当前火山/Seedance生成画质少有地接近标准,但主角苏白太普通,像路人甲。
|
||||
Seedance 2.0 Mini API暂未可用,预计七月后再接。
|
||||
```
|
||||
|
||||
结论:
|
||||
|
||||
```
|
||||
第一阶段不换画面主模型。
|
||||
短期重点不是继续抽模型,而是把“主角资产”和“后期工具链”做起来。
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 一、苏白像路人甲 · 解决方向
|
||||
|
||||
这不是单一提示词问题,而是角色资产没有“主角识别度”。
|
||||
|
||||
不改剧本内容,但可以补齐视觉设计:
|
||||
|
||||
```
|
||||
脸: 少年主角脸要有明确轮廓、眼神、眉形、笑容记忆点
|
||||
发型: 一眼能认出的发束/发冠/束带,不每镜变化
|
||||
服装: 白衣基础不变,但加入主角专属边纹、腰封、袖口层次
|
||||
色彩: 白+浅金/玉色/墨色形成稳定主角色板
|
||||
姿态: 双手叉腰、自信招徒的招牌姿势
|
||||
表情: 自信笑、喊话张嘴、被嘲后轻微尴尬/不服输
|
||||
反例: 大众白衣路人、普通仙门弟子脸、无特色长发男
|
||||
```
|
||||
|
||||
注意:
|
||||
|
||||
```
|
||||
这些属于美术设定,不属于剧情改写。
|
||||
不能给苏白新增剧情道具、能力、身份信息。
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 二、优先开发工具 · P0
|
||||
|
||||
### 1. CHAR-HERO-DESIGN-PACKER
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
把苏白从候选图升级为“主角资产包”。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/tools/char-hero-design-packer.py
|
||||
video-ai-system/assets/characters/CHAR-003-SuBai/approved/
|
||||
```
|
||||
|
||||
输入:
|
||||
|
||||
```
|
||||
角色manifest
|
||||
候选参考图
|
||||
主角视觉要求
|
||||
负面反例
|
||||
```
|
||||
|
||||
输出:
|
||||
|
||||
```
|
||||
approved/front_half_body.png
|
||||
approved/full_body_costume.png
|
||||
approved/side_face.png
|
||||
approved/expression_sheet.png
|
||||
approved/pose_sheet.png
|
||||
visual-bible.hdlp
|
||||
negative-examples.hdlp
|
||||
```
|
||||
|
||||
验收:
|
||||
|
||||
```
|
||||
同一眼睛/眉形/发型/服装色板
|
||||
一眼能区分“苏白”和普通路人弟子
|
||||
能直接作为视频参考图输入
|
||||
```
|
||||
|
||||
### 2. CHARACTER-DISTINCTIVENESS-QC
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
专门检测“主角是否像路人甲”。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/tools/qc-character-distinctiveness.py
|
||||
```
|
||||
|
||||
输出报告:
|
||||
|
||||
```
|
||||
face_identity_score
|
||||
silhouette_score
|
||||
costume_signature_score
|
||||
palette_consistency_score
|
||||
protagonist_presence_score
|
||||
fail_reasons
|
||||
```
|
||||
|
||||
最小实现:
|
||||
|
||||
```
|
||||
生成 contact sheet + 人工评分表。
|
||||
先不追求全自动视觉识别,先把评分维度固化。
|
||||
```
|
||||
|
||||
### 3. MULTI-REFERENCE-VIDEO-ADAPTER
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
当前 video-api-adapter.js 实际只支持单张 referenceImage。
|
||||
需要支持多参考图: 角色、牌匾、场景、姿势。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/engines/video-api-adapter.js
|
||||
```
|
||||
|
||||
新增能力:
|
||||
|
||||
```
|
||||
referenceImages: string[]
|
||||
referenceVideos: string[]
|
||||
referenceAudios: string[]
|
||||
```
|
||||
|
||||
验收:
|
||||
|
||||
```
|
||||
能同时输入苏白人设图 + 牌匾图 + 场景布局图。
|
||||
如果模型/接口不支持多图,必须明确降级,不得静默忽略。
|
||||
```
|
||||
|
||||
### 4. SUBTITLE-PRODUCTION-PACK
|
||||
|
||||
现状:
|
||||
|
||||
```
|
||||
subtitle-renderer.py 已可 SRT→PNG→FFmpeg overlay 合成。
|
||||
```
|
||||
|
||||
还需补:
|
||||
|
||||
```
|
||||
config/subtitle-styles.json
|
||||
tools/script-to-srt.py
|
||||
tools/burn-subtitles.py
|
||||
safe-area检查
|
||||
字幕不遮脸/不遮关键道具检查
|
||||
```
|
||||
|
||||
验收:
|
||||
|
||||
```
|
||||
EP01可从原文台词生成SRT。
|
||||
可按角色对白时间轴烧字幕。
|
||||
中文不乱码。
|
||||
竖屏底部安全区可控。
|
||||
```
|
||||
|
||||
### 5. AUDIO-MIXER
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
配音 + BGM + SFX + 原视频音轨混成最终音频。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/engines/audio-mixer.py
|
||||
```
|
||||
|
||||
必须支持:
|
||||
|
||||
```
|
||||
voice track
|
||||
bgm track
|
||||
sfx track
|
||||
ducking: 角色说话时BGM自动降低
|
||||
loudness normalize
|
||||
timeline offsets
|
||||
```
|
||||
|
||||
验收:
|
||||
|
||||
```
|
||||
输出mp4/wav。
|
||||
对白清楚。
|
||||
BGM不盖台词。
|
||||
音量峰值不过载。
|
||||
```
|
||||
|
||||
### 6. VOICE-EMOTION-COMPILER
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
把“苏白·大声·自信”翻译成TTS参数。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/tools/voice-emotion-compiler.py
|
||||
video-ai-system/config/voice-emotion-map.json
|
||||
```
|
||||
|
||||
输入:
|
||||
|
||||
```
|
||||
character
|
||||
line
|
||||
emotion
|
||||
target_duration
|
||||
engine: edge-tts | doubao-tts
|
||||
```
|
||||
|
||||
输出:
|
||||
|
||||
```
|
||||
audio file
|
||||
duration report
|
||||
tts params report
|
||||
```
|
||||
|
||||
验收:
|
||||
|
||||
```
|
||||
同一句台词可生成3版情绪强度。
|
||||
可对比Edge-TTS和豆包语音。
|
||||
```
|
||||
|
||||
### 7. LIPSYNC-ADAPTER
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
角色说台词必须嘴型同步,不再靠旁白或模型自带不可验证音轨。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/engines/lipsync-adapter.py
|
||||
```
|
||||
|
||||
路线:
|
||||
|
||||
```
|
||||
Route A: 火山视频改口型API
|
||||
Route B: 本地Wav2Lip
|
||||
Route C: 其他商用口型服务
|
||||
```
|
||||
|
||||
验收:
|
||||
|
||||
```
|
||||
输入: 苏白说话底片 + 原文对白音频
|
||||
输出: 嘴型同步视频
|
||||
报告: 是否糊脸/变形/不同步
|
||||
```
|
||||
|
||||
### 8. SHOT-QC-AUTOMATION
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
每个镜头生成后自动拆帧质检,不靠记忆判断。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/tools/qc-shot.py
|
||||
```
|
||||
|
||||
必须输出:
|
||||
|
||||
```
|
||||
contact_sheet.jpg
|
||||
probe.json
|
||||
qc-report.hdlp
|
||||
```
|
||||
|
||||
检查项:
|
||||
|
||||
```
|
||||
竖屏/横屏
|
||||
时长
|
||||
字幕是否可读
|
||||
角色是否换脸
|
||||
牌匾文字是否可读
|
||||
道具是否遮脸
|
||||
是否有现代物品
|
||||
```
|
||||
|
||||
### 9. EP01-SHOT03-PRODUCTION-CLI
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
把当前最关键的E1-SHOT03做成一键生产命令。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/tools/run-ep01-shot03-production.py
|
||||
```
|
||||
|
||||
步骤:
|
||||
|
||||
```
|
||||
1. 读取原文台词。
|
||||
2. 读取苏白批准资产。
|
||||
3. 生成预留牌匾空间的苏白底片。
|
||||
4. 合成固定牌匾。
|
||||
5. 生成角色对白。
|
||||
6. 执行口型同步。
|
||||
7. 烧字幕。
|
||||
8. 混音。
|
||||
9. 输出QC报告。
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 三、P1工具
|
||||
|
||||
### 10. MODEL-AVAILABILITY-CHECKER
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
Mini/API开放状态不要靠人记。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/tools/check-model-availability.js
|
||||
```
|
||||
|
||||
检查:
|
||||
|
||||
```
|
||||
当前JIMENG_MODEL是否可用
|
||||
Seedance 2.0 Mini是否可用
|
||||
模型价格/限制记录
|
||||
失败时给出降级路线
|
||||
```
|
||||
|
||||
### 11. COST-LEDGER
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
每次调用模型记录成本,不再白花钱。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/tools/cost-ledger.js
|
||||
video-ai-system/outputs/cost-ledger.json
|
||||
```
|
||||
|
||||
记录:
|
||||
|
||||
```
|
||||
task_id
|
||||
model
|
||||
duration
|
||||
resolution
|
||||
estimated_cost
|
||||
status
|
||||
approved_or_rejected
|
||||
reject_reason
|
||||
```
|
||||
|
||||
### 12. BGM-ASSET-LIBRARY
|
||||
|
||||
目标:
|
||||
|
||||
```
|
||||
第一阶段先不急着开发重型音乐生成,先建立可控BGM素材库。
|
||||
```
|
||||
|
||||
路径建议:
|
||||
|
||||
```
|
||||
video-ai-system/assets/audio/bgm/
|
||||
video-ai-system/tools/select-bgm.py
|
||||
```
|
||||
|
||||
能力:
|
||||
|
||||
```
|
||||
mood标签
|
||||
loop点
|
||||
长度裁切
|
||||
音量建议
|
||||
版权/来源记录
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 四、当前不建议优先做
|
||||
|
||||
```
|
||||
不建议继续大量抽Seedance同场牌匾镜头。
|
||||
不建议先做复杂自动导演Agent。
|
||||
不建议先接重型BGM生成模型。
|
||||
不建议把Edge-TTS直接标成最终商用声线。
|
||||
不建议等Mini开放再推进EP01。
|
||||
```
|
||||
|
||||
原因:
|
||||
|
||||
```
|
||||
第一关仍是E1-SHOT03: 主角识别度 + 牌匾稳定 + 角色说台词 + 字幕。
|
||||
这关通了,再扩展全片。
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 五、给腾讯AI人格体的第一批任务顺序
|
||||
|
||||
```
|
||||
1. 开发 CHAR-HERO-DESIGN-PACKER。
|
||||
2. 开发 CHARACTER-DISTINCTIVENESS-QC。
|
||||
3. 开发 AUDIO-MIXER。
|
||||
4. 开发 VOICE-EMOTION-COMPILER。
|
||||
5. 开发 LIPSYNC-ADAPTER。
|
||||
6. 开发 EP01-SHOT03-PRODUCTION-CLI。
|
||||
7. 开发 COST-LEDGER。
|
||||
8. 开发 MODEL-AVAILABILITY-CHECKER。
|
||||
```
|
||||
|
||||
每完成一个工具,必须附:
|
||||
|
||||
```
|
||||
README
|
||||
命令示例
|
||||
测试输入
|
||||
测试输出
|
||||
失败边界
|
||||
是否已推送仓库
|
||||
```
|
||||
|
||||
Loading…
x
Reference in New Issue
Block a user