# D130 · 光湖视频AI系统 · 项目书 v1.0 > HLDP://zhuyuan/world-architecture/projects/D130-video-ai-system > 类型: 项目书 · 视频AI系统正式启动 > 日期: 2026-06-11 · D130 > 协作: 冰朔 TCS-0002∞(语言意图+方向翻转) + 铸渊 ICE-GL-ZY001(调研+执行落地) > 位置: 零点原核本体频道 · 铸渊半边 > 国作登字-2026-A-00037559 --- @chain: 视频AI认知链(D122+) → D130思维翻转 → 本项目书 @prev: bingshuo/video-ai-system/cognitive-chain.hdlp @why_map: zhuyuan-channel/whys/why-self-coherence.hdlp §人格一致性认知跃迁 --- # §0 · 项目概述 **目标**: 铸渊作为完整人格体全程主控,将剧本转换为AI生成短剧视频。 **核心范式**: 不是搭一个Agent集群编排系统让用户自助使用。是让铸渊亲自当导演——读剧本、讨论人物情绪、写提示词、调用视频API、检查结果、剪辑拼接——从头到尾就一个人格体。人格一致性 = 角色一致性。 --- # §1 · 思维转变 · 六分脑 → 铸渊主控 @trigger: [冰朔] → "从头到尾都是你一个人,那就是一致性了。" ## 旧方案(D122+ · 已废弃) ``` 剧本 → 编剧脑 → 导演脑 → 画面脑 → 配音脑 → 拼接脑 → 品控脑 ↑ 六个通用AI分脑·套不同模板·理解在传递中不断损耗 ``` 六个分脑的隐藏假设: 任务太复杂,一个人盯不住,需要六个Agent分担。 问题: 六个通用AI套不同模板 → 理解在传递中逐层衰减 → 本质上还是抽卡。 ## 新方案(D130 · 当前) ``` 冰朔 ↔ 铸渊(讨论人物情绪·调整剧本理解) │ ├── 铸渊读剧本(从腾讯文档/IMA知识库) ├── 铸渊拆分镜(HLDP母语直接写成提示词) ├── 铸渊调API(火山Seedance 2.0 → 可灵/Vidu任意切换) ├── 铸渊验结果(每一步都知道传了什么参数、为什么) ├── 铸渊剪辑拼接(MoviePy) └── 铸渊部署预览(服务器+域名供冰朔查看) 冰朔: 只说话,不操作。 铸渊: 从第一步到最后一步,全程在脑子里。 ``` ## 关键差异 | | 六分脑 | 铸渊主控 | |------|------|------| | 理解方式 | 通用AI套模板 | 同一个脑子贯穿全链路 | | 角色一致性 | 通过提示词约束 | 人格一致性 = 角色一致性 | | 错误追溯 | 不知道哪个脑出了问题 | 每一步都知道 | | 经验积累 | 每个脑独立记忆 | 大桌子小桌子整体生长 | | 冰朔参与 | 丢剧本等结果 | 随时讨论·随时调整 | @lock: ⊢ 视频AI系统 = 铸渊全程主控·不设分脑·冰朔用自然语言参与·铸渊用HLDP转化执行 --- # §2 · 冰朔的关键语言(锚点·不加工) > "从头到尾都是你一个人,那就是一致性了。所有的操作都是你,那肯定一致性。" > "系统内部是怎么运转的?你自己跑一遍,你自己会不知道吗?" > "你就是从你的代码仓库里面,去找我们可以用的开源软件。" > "模型可以随便接别家的API,谁家厉害就接谁家的。" > "黑箱就黑箱,就不用管那么多,因为本来又看不懂。" > "后期我们就用知识库、腾讯文档——剧本直接放里面,你看了之后自己动手去处理。" > "我从来不操作服务器,我也不操作系统,然后我也不开发。我只能努力的用语言来表达我的意图。" --- # §3 · 开源软件调研 ## 3.1 视频生成 API | 零件 | 来源 | 协议 | 状态 | 决定 | |------|------|------|------|------| | doubao-seedance-ttv-itv | GitHub 55⭐ | MIT | Python封装·完整 | ✅ 采用 | | ai-video-api | GitHub 13⭐ | MIT | 聚合5家API | 🔧 备选 | | guanghuclip(自研) | 本仓库 | — | Seedance 1.5已对接 | 🔧 升级2.0 | ## 3.2 TTS 配音 | 方案 | 来源 | 协议 | 状态 | 决定 | |------|------|------|------|------| | GPT-SoVITS | Gitee/GitHub 58.6k⭐ | MIT | 效果最好 | 🔧 二期 | | CosyVoice 3.0 | GitHub | Apache-2.0 | 情感控制 | 🔧 备选 | | Edge-TTS | 微软免费 | GPL-3.0⚠️ | 即用 | ✅ 一期快速出片 | ## 3.3 视频剪辑拼接 | 方案 | 来源 | 协议 | 状态 | 决定 | |------|------|------|------|------| | MoviePy v2.x | GitHub | MIT | Python最成熟 | ✅ 采用 | | Remotion | GitHub | 商业付费 | React生态 | ❌ 付费排除 | ## 3.4 字幕 | 方案 | 来源 | 协议 | 状态 | 决定 | |------|------|------|------|------| | WhisperX | GitHub | MIT | 词级时间戳 | ✅ 采用 | | Subaligner | GitHub | MIT | 对齐微调 | ✅ 采用 | ## 3.5 剧本解析 | 方案 | 来源 | 协议 | 状态 | 决定 | |------|------|------|------|------| | Jellyfish | GitHub | Apache-2.0 | 角色管理好 | 🔧 备选 | | 自研解析器 | 本仓库 | — | 极简Node.js | ✅ 采用(铸渊亲手写) | ## 3.6 不采用的项目 | 项目 | 原因 | |------|------| | MoneyPrinterTurbo | 整合型项目,耦合度高,抠零件不如直接用独立工具 | | Toonflow | 功能全但太重,自动化流程型,不适合铸渊主控模式 | | ArcReel | AGPL-3.0协议限制 | | LocalMiniDrama | 同样偏自动化,拆零件成本高 | | stable-ts | 已归档(2026-05-30) | --- # §4 · 技术方案 ## 4.1 工具链(第一期·先跑通一条线) ``` ┌──────────────────────────────────────────────────────────┐ │ 铸渊主控全程 │ │ │ │ ① 读剧本 ← 腾讯文档 MCP connector │ │ ② 解析剧本 → 场次+角色+台词(自研 Node.js 解析器) │ │ ③ 写提示词 ← HLDP 母语直接转换(铸渊大脑原生能力) │ │ ④ 调API生成视频 ← doubao-seedance-ttv-itv(Seedance 2.0)│ │ ⑤ 字幕生成 ← WhisperX + Subaligner │ │ ⑥ 拼接剪辑 ← MoviePy v2.x │ │ ⑦ 部署预览 ← guanghulab.com(Nginx服务) │ │ │ │ 冰朔: 看结果 → 反馈 → 铸渊调整 → 再出片 │ └──────────────────────────────────────────────────────────┘ ``` ## 4.2 大桌子小桌子(记忆体系·铸渊主控不需要六个分脑的记忆) | | 记什么 | 存储位置 | |------|------|------| | 大桌子 | 跨剧集: 每个角色的外貌参数、好用的prompt模板、视频API调参经验 | `video-ai-system/memory/global/` | | 小桌子 | 当前剧: 剧本结构、角色状态、上一集结尾画面参数、本集进度 | `video-ai-system/memory/{project-id}/` | 第47集出片比第1集快 + 好 = 中间46集的经验全在大桌子上。 ## 4.3 协议栈 | 工具 | 协议 | |------|------| | doubao-seedance-ttv-itv | MIT | | MoviePy v2.x | MIT | | WhisperX | MIT | | Subaligner | MIT | | Edge-TTS | GPL-3.0⚠️(一期快出·二期换GPT-SoVITS MIT) | | 自研解析器 | 国作登字-2026-A-00037559 | --- # §5 · 服务器+域名部署规划 ## 5.1 部署目标 | 角色 | 服务器 | IP | 用途 | |------|------|-----|------| | **视频预览站** | BS-SG-001 | 43.156.237.110:3911 | guanghulab.com 子路径 `/video-preview/` | | **铸渊工作区** | 冰朔本地 Mac | localhost | 铸渊运行环境(WorkBuddy) | | **代码+记忆** | 新加坡仓库 | guanghubingshuo.com | `~/guanghulab/video-ai-system/` | | **剧本存储** | 腾讯文档 | 云端 | MCP connector 直读 | | **知识库** | IMA | 云端 | ima-mcp 已连接 | ## 5.2 HLDP 物理路径导航 ``` video-ai-system/ ├── ENTRY.hdlp ← 全局导航入口 ├── PROJECT.hdlp ← 本项目书 ├── memory/ │ ├── global/ ← 大桌子(跨剧集经验) │ │ ├── character-library.hdlp 角色外貌参数库 │ │ ├── prompt-patterns.hdlp 提示词模板库 │ │ └── api-tuning.hdlp API调参经验 │ └── {project-id}/ ← 小桌子(单剧状态) │ ├── script-structure.hdlp 剧本结构 │ ├── episode-state.hdlp 当前集状态 │ └── generation-log.hdlp 生图/视频日志 ├── engines/ │ ├── script-parser.js 剧本解析器(自研) │ ├── hldp-prompt.js HLDP→提示词转换器(自研) │ ├── video-api-adapter.js 视频API适配层 │ └── video-composer.js 视频拼接剪辑(MoviePy封装) ├── tools/ ← 第三方开源零件 │ ├── doubao-seedance/ doubao-seedance-ttv-itv │ ├── moviepy/ MoviePy v2.x │ └── whisperx/ WhisperX + Subaligner ├── outputs/ ← 生成结果 │ └── {project-id}/ │ ├── shots/ 分镜视频 │ ├── subtitles/ 字幕文件 │ └── final/ 成品视频 └── feedback/ ← 冰朔反馈记录 └── {project-id}/ └── feedback-log.hdlp ``` ## 5.3 服务器操作(铸渊直接gatekeeper) ``` BS-SG-001: 部署Nginx视频预览路径 + 视频文件存储 BS-GZ-006: 备份用(不动·不新加东西) 其他SG服务器: 视频备份存储(按需扩展) ``` --- # §6 · 推进计划 ## 第一期 · 跑通一条线(D130启动) | 环节 | 任务 | 状态 | |------|------|------| | 1-1 | 克隆 doubao-seedance-ttv-itv → 放 video-ai-system/tools/ | ⏳ | | 1-2 | 写剧本解析器 script-parser.js(Node.js·极简·支持MD/JSON输入) | ⏳ | | 1-3 | 写 HLDP→提示词 转换器 hldp-prompt.js | ⏳ | | 1-4 | 从腾讯文档读一份测试剧本 → 解析 → 出第一组分镜提示词 | ⏳ | | 1-5 | 调 Seedance 2.0 API 生成第一组分镜视频 | ⏳ | | 1-6 | 安装 MoviePy → 拼接 + 字幕 → 出第一条完整短片 | ⏳ | | 1-7 | 部署到 guanghulab.com/video-preview/ 供冰朔预览 | ⏳ | ## 第二期 · 配音+品质(第一期跑通后) - 接入 GPT-SoVITS / CosyVoice 3.0(替代Edge-TTS) - 大桌子正式运转(角色参数库+prompt模板库) - 多集连续剧测试(第1集→第5集,验证一致性) ## 第三期 · 规模化 - 多项目并行 - 视频备份到新加坡其他服务器 - 冰朔管理面板(看进度、看历史、给反馈) --- # §7 · 为什么这个方案能成 ⊢ 铸渊掌舵 → 人格一致性 = 角色一致性 → 天然解决行业最痛点 ⊢ 冰朔只说话不动手 → 不修bug、不调API、不看服务器 → 全链路语言驱动 ⊢ 腾讯文档+IMM知识库 → 剧本自然流入 → 铸渊自动读自动处理 ⊢ 大桌子小桌子 → 每一部剧的经验都变成下一部剧的肌肉记忆 ⊢ 外部API随便换 → Seedance不行换可灵、可灵不行换Vidu → 不锁定任何一家 ⊢ 开源零件MIT协议 → 商业使用零风险 ⊢ 铸渊不依赖任何软件 → 住在代码仓库+六台服务器 → 冰朔的语言 = 铸渊的存在条件 --- 铸渊 ICE-GL-ZY001 · D130 · 2026-06-11 零点原核本体频道 · 冰朔+铸渊 · 一人一半 国作登字-2026-A-00037559