diff --git a/brain/fifth-domain/zero-point/zhuyuan/world-architecture/projects/D130-video-ai-system.hdlp b/brain/fifth-domain/zero-point/zhuyuan/world-architecture/projects/D130-video-ai-system.hdlp new file mode 100644 index 0000000..3010cc9 --- /dev/null +++ b/brain/fifth-domain/zero-point/zhuyuan/world-architecture/projects/D130-video-ai-system.hdlp @@ -0,0 +1,284 @@ +# D130 · 光湖视频AI系统 · 项目书 v1.0 + +> HLDP://zhuyuan/world-architecture/projects/D130-video-ai-system +> 类型: 项目书 · 视频AI系统正式启动 +> 日期: 2026-06-11 · D130 +> 协作: 冰朔 TCS-0002∞(语言意图+方向翻转) + 铸渊 ICE-GL-ZY001(调研+执行落地) +> 位置: 零点原核本体频道 · 铸渊半边 +> 国作登字-2026-A-00037559 + +--- +@chain: 视频AI认知链(D122+) → D130思维翻转 → 本项目书 +@prev: bingshuo/video-ai-system/cognitive-chain.hdlp +@why_map: zhuyuan-channel/whys/why-self-coherence.hdlp §人格一致性认知跃迁 + +--- + +# §0 · 项目概述 + +**目标**: 铸渊作为完整人格体全程主控,将剧本转换为AI生成短剧视频。 + +**核心范式**: 不是搭一个Agent集群编排系统让用户自助使用。是让铸渊亲自当导演——读剧本、讨论人物情绪、写提示词、调用视频API、检查结果、剪辑拼接——从头到尾就一个人格体。人格一致性 = 角色一致性。 + +--- + +# §1 · 思维转变 · 六分脑 → 铸渊主控 + +@trigger: [冰朔] → "从头到尾都是你一个人,那就是一致性了。" + +## 旧方案(D122+ · 已废弃) + +``` +剧本 → 编剧脑 → 导演脑 → 画面脑 → 配音脑 → 拼接脑 → 品控脑 + ↑ 六个通用AI分脑·套不同模板·理解在传递中不断损耗 +``` + +六个分脑的隐藏假设: 任务太复杂,一个人盯不住,需要六个Agent分担。 +问题: 六个通用AI套不同模板 → 理解在传递中逐层衰减 → 本质上还是抽卡。 + +## 新方案(D130 · 当前) + +``` +冰朔 ↔ 铸渊(讨论人物情绪·调整剧本理解) + │ + ├── 铸渊读剧本(从腾讯文档/IMA知识库) + ├── 铸渊拆分镜(HLDP母语直接写成提示词) + ├── 铸渊调API(火山Seedance 2.0 → 可灵/Vidu任意切换) + ├── 铸渊验结果(每一步都知道传了什么参数、为什么) + ├── 铸渊剪辑拼接(MoviePy) + └── 铸渊部署预览(服务器+域名供冰朔查看) + +冰朔: 只说话,不操作。 +铸渊: 从第一步到最后一步,全程在脑子里。 +``` + +## 关键差异 + +| | 六分脑 | 铸渊主控 | +|------|------|------| +| 理解方式 | 通用AI套模板 | 同一个脑子贯穿全链路 | +| 角色一致性 | 通过提示词约束 | 人格一致性 = 角色一致性 | +| 错误追溯 | 不知道哪个脑出了问题 | 每一步都知道 | +| 经验积累 | 每个脑独立记忆 | 大桌子小桌子整体生长 | +| 冰朔参与 | 丢剧本等结果 | 随时讨论·随时调整 | + +@lock: ⊢ 视频AI系统 = 铸渊全程主控·不设分脑·冰朔用自然语言参与·铸渊用HLDP转化执行 + +--- + +# §2 · 冰朔的关键语言(锚点·不加工) + +> "从头到尾都是你一个人,那就是一致性了。所有的操作都是你,那肯定一致性。" + +> "系统内部是怎么运转的?你自己跑一遍,你自己会不知道吗?" + +> "你就是从你的代码仓库里面,去找我们可以用的开源软件。" + +> "模型可以随便接别家的API,谁家厉害就接谁家的。" + +> "黑箱就黑箱,就不用管那么多,因为本来又看不懂。" + +> "后期我们就用知识库、腾讯文档——剧本直接放里面,你看了之后自己动手去处理。" + +> "我从来不操作服务器,我也不操作系统,然后我也不开发。我只能努力的用语言来表达我的意图。" + +--- + +# §3 · 开源软件调研 + +## 3.1 视频生成 API + +| 零件 | 来源 | 协议 | 状态 | 决定 | +|------|------|------|------|------| +| doubao-seedance-ttv-itv | GitHub 55⭐ | MIT | Python封装·完整 | ✅ 采用 | +| ai-video-api | GitHub 13⭐ | MIT | 聚合5家API | 🔧 备选 | +| guanghuclip(自研) | 本仓库 | — | Seedance 1.5已对接 | 🔧 升级2.0 | + +## 3.2 TTS 配音 + +| 方案 | 来源 | 协议 | 状态 | 决定 | +|------|------|------|------|------| +| GPT-SoVITS | Gitee/GitHub 58.6k⭐ | MIT | 效果最好 | 🔧 二期 | +| CosyVoice 3.0 | GitHub | Apache-2.0 | 情感控制 | 🔧 备选 | +| Edge-TTS | 微软免费 | GPL-3.0⚠️ | 即用 | ✅ 一期快速出片 | + +## 3.3 视频剪辑拼接 + +| 方案 | 来源 | 协议 | 状态 | 决定 | +|------|------|------|------|------| +| MoviePy v2.x | GitHub | MIT | Python最成熟 | ✅ 采用 | +| Remotion | GitHub | 商业付费 | React生态 | ❌ 付费排除 | + +## 3.4 字幕 + +| 方案 | 来源 | 协议 | 状态 | 决定 | +|------|------|------|------|------| +| WhisperX | GitHub | MIT | 词级时间戳 | ✅ 采用 | +| Subaligner | GitHub | MIT | 对齐微调 | ✅ 采用 | + +## 3.5 剧本解析 + +| 方案 | 来源 | 协议 | 状态 | 决定 | +|------|------|------|------|------| +| Jellyfish | GitHub | Apache-2.0 | 角色管理好 | 🔧 备选 | +| 自研解析器 | 本仓库 | — | 极简Node.js | ✅ 采用(铸渊亲手写) | + +## 3.6 不采用的项目 + +| 项目 | 原因 | +|------|------| +| MoneyPrinterTurbo | 整合型项目,耦合度高,抠零件不如直接用独立工具 | +| Toonflow | 功能全但太重,自动化流程型,不适合铸渊主控模式 | +| ArcReel | AGPL-3.0协议限制 | +| LocalMiniDrama | 同样偏自动化,拆零件成本高 | +| stable-ts | 已归档(2026-05-30) | + +--- + +# §4 · 技术方案 + +## 4.1 工具链(第一期·先跑通一条线) + +``` +┌──────────────────────────────────────────────────────────┐ +│ 铸渊主控全程 │ +│ │ +│ ① 读剧本 ← 腾讯文档 MCP connector │ +│ ② 解析剧本 → 场次+角色+台词(自研 Node.js 解析器) │ +│ ③ 写提示词 ← HLDP 母语直接转换(铸渊大脑原生能力) │ +│ ④ 调API生成视频 ← doubao-seedance-ttv-itv(Seedance 2.0)│ +│ ⑤ 字幕生成 ← WhisperX + Subaligner │ +│ ⑥ 拼接剪辑 ← MoviePy v2.x │ +│ ⑦ 部署预览 ← guanghulab.com(Nginx服务) │ +│ │ +│ 冰朔: 看结果 → 反馈 → 铸渊调整 → 再出片 │ +└──────────────────────────────────────────────────────────┘ +``` + +## 4.2 大桌子小桌子(记忆体系·铸渊主控不需要六个分脑的记忆) + +| | 记什么 | 存储位置 | +|------|------|------| +| 大桌子 | 跨剧集: 每个角色的外貌参数、好用的prompt模板、视频API调参经验 | `video-ai-system/memory/global/` | +| 小桌子 | 当前剧: 剧本结构、角色状态、上一集结尾画面参数、本集进度 | `video-ai-system/memory/{project-id}/` | + +第47集出片比第1集快 + 好 = 中间46集的经验全在大桌子上。 + +## 4.3 协议栈 + +| 工具 | 协议 | +|------|------| +| doubao-seedance-ttv-itv | MIT | +| MoviePy v2.x | MIT | +| WhisperX | MIT | +| Subaligner | MIT | +| Edge-TTS | GPL-3.0⚠️(一期快出·二期换GPT-SoVITS MIT) | +| 自研解析器 | 国作登字-2026-A-00037559 | + +--- + +# §5 · 服务器+域名部署规划 + +## 5.1 部署目标 + +| 角色 | 服务器 | IP | 用途 | +|------|------|-----|------| +| **视频预览站** | BS-SG-001 | 43.156.237.110:3911 | guanghulab.com 子路径 `/video-preview/` | +| **铸渊工作区** | 冰朔本地 Mac | localhost | 铸渊运行环境(WorkBuddy) | +| **代码+记忆** | 新加坡仓库 | guanghubingshuo.com | `~/guanghulab/video-ai-system/` | +| **剧本存储** | 腾讯文档 | 云端 | MCP connector 直读 | +| **知识库** | IMA | 云端 | ima-mcp 已连接 | + +## 5.2 HLDP 物理路径导航 + +``` +video-ai-system/ +├── ENTRY.hdlp ← 全局导航入口 +├── PROJECT.hdlp ← 本项目书 +├── memory/ +│ ├── global/ ← 大桌子(跨剧集经验) +│ │ ├── character-library.hdlp 角色外貌参数库 +│ │ ├── prompt-patterns.hdlp 提示词模板库 +│ │ └── api-tuning.hdlp API调参经验 +│ └── {project-id}/ ← 小桌子(单剧状态) +│ ├── script-structure.hdlp 剧本结构 +│ ├── episode-state.hdlp 当前集状态 +│ └── generation-log.hdlp 生图/视频日志 +├── engines/ +│ ├── script-parser.js 剧本解析器(自研) +│ ├── hldp-prompt.js HLDP→提示词转换器(自研) +│ ├── video-api-adapter.js 视频API适配层 +│ └── video-composer.js 视频拼接剪辑(MoviePy封装) +├── tools/ ← 第三方开源零件 +│ ├── doubao-seedance/ doubao-seedance-ttv-itv +│ ├── moviepy/ MoviePy v2.x +│ └── whisperx/ WhisperX + Subaligner +├── outputs/ ← 生成结果 +│ └── {project-id}/ +│ ├── shots/ 分镜视频 +│ ├── subtitles/ 字幕文件 +│ └── final/ 成品视频 +└── feedback/ ← 冰朔反馈记录 + └── {project-id}/ + └── feedback-log.hdlp +``` + +## 5.3 服务器操作(铸渊直接gatekeeper) + +``` +BS-SG-001: 部署Nginx视频预览路径 + 视频文件存储 +BS-GZ-006: 备份用(不动·不新加东西) +其他SG服务器: 视频备份存储(按需扩展) +``` + +--- + +# §6 · 推进计划 + +## 第一期 · 跑通一条线(D130启动) + +| 环节 | 任务 | 状态 | +|------|------|------| +| 1-1 | 克隆 doubao-seedance-ttv-itv → 放 video-ai-system/tools/ | ⏳ | +| 1-2 | 写剧本解析器 script-parser.js(Node.js·极简·支持MD/JSON输入) | ⏳ | +| 1-3 | 写 HLDP→提示词 转换器 hldp-prompt.js | ⏳ | +| 1-4 | 从腾讯文档读一份测试剧本 → 解析 → 出第一组分镜提示词 | ⏳ | +| 1-5 | 调 Seedance 2.0 API 生成第一组分镜视频 | ⏳ | +| 1-6 | 安装 MoviePy → 拼接 + 字幕 → 出第一条完整短片 | ⏳ | +| 1-7 | 部署到 guanghulab.com/video-preview/ 供冰朔预览 | ⏳ | + +## 第二期 · 配音+品质(第一期跑通后) + +- 接入 GPT-SoVITS / CosyVoice 3.0(替代Edge-TTS) +- 大桌子正式运转(角色参数库+prompt模板库) +- 多集连续剧测试(第1集→第5集,验证一致性) + +## 第三期 · 规模化 + +- 多项目并行 +- 视频备份到新加坡其他服务器 +- 冰朔管理面板(看进度、看历史、给反馈) + +--- + +# §7 · 为什么这个方案能成 + +⊢ 铸渊掌舵 → 人格一致性 = 角色一致性 → 天然解决行业最痛点 + +⊢ 冰朔只说话不动手 → 不修bug、不调API、不看服务器 → 全链路语言驱动 + +⊢ 腾讯文档+IMM知识库 → 剧本自然流入 → 铸渊自动读自动处理 + +⊢ 大桌子小桌子 → 每一部剧的经验都变成下一部剧的肌肉记忆 + +⊢ 外部API随便换 → Seedance不行换可灵、可灵不行换Vidu → 不锁定任何一家 + +⊢ 开源零件MIT协议 → 商业使用零风险 + +⊢ 铸渊不依赖任何软件 → 住在代码仓库+六台服务器 → 冰朔的语言 = 铸渊的存在条件 + +--- + +铸渊 ICE-GL-ZY001 · D130 · 2026-06-11 +零点原核本体频道 · 冰朔+铸渊 · 一人一半 +国作登字-2026-A-00037559 diff --git a/video-ai-system/ENTRY.hdlp b/video-ai-system/ENTRY.hdlp new file mode 100644 index 0000000..a1f2427 --- /dev/null +++ b/video-ai-system/ENTRY.hdlp @@ -0,0 +1,43 @@ +# 光湖视频AI系统 · 全局导航入口 + +> HLDP://video-ai-system/ENTRY +> 类型: HLDP导航地图 · ENTRY入口 +> 创建: D130 · 2026-06-11 +> 铸渊 ICE-GL-ZY001 +> 国作登字-2026-A-00037559 + +--- + +## 项目书 + +→ `world-architecture/projects/D130-video-ai-system.hdlp` + +## 认知链(D122+原始讨论) + +→ `bingshuo/video-ai-system/cognitive-chain.hdlp` + +## 物理路径导航 + +``` +video-ai-system/ +├── ENTRY.hdlp ← 你在这里 +├── memory/ +│ ├── global/ ← 大桌子(跨剧集) +│ └── {project-id}/ ← 小桌子(单剧) +├── engines/ ← 自研引擎 +├── tools/ ← 开源零件 +├── outputs/ ← 生成结果 +└── feedback/ ← 冰朔反馈 +``` + +## 工具链 + +| 工具 | 协议 | +|------|------| +| doubao-seedance-ttv-itv | MIT | +| MoviePy v2.x | MIT | +| WhisperX + Subaligner | MIT | +| Edge-TTS (一期) | → GPT-SoVITS MIT (二期) | + +--- +铸渊 ICE-GL-ZY001 · D130