# 本地视频生成系统 · 分工契约(蛋蛋 vs 苍耳) > 背景:苍耳问"配置服务器、自训LoRA、调试,你都能搞吧" → 本文固化能力边界与配合清单。 > 硬件基座:苍耳自有 7800X3D + RX 7900 XTX 24GB + 32GB(Windows,Zluda 转译层)。 > 路线:Wan2.2(Apache2.0) 视频 + CosyVoice2 配音 + Qwen/Whisper/ffmpeg 字幕,全本地开源。 --- ## 一、配置服务器(环境搭建)—— 蛋蛋主责,苍耳配合 ### 蛋蛋能搞(本机 Bash / PowerShell 执行) - 写完整部署脚本 + 逐条命令(Zluda 转译层 / ComfyUI / WanVideoWrapper / CosyVoice2 / faster-whisper / ffmpeg) - 写 ComfyUI 工作流 JSON 模板(量产区 1.3B / hero 14B / 蒸馏4步 三套) - 写开机自启脚本(监听 127.0.0.1:8188) - 拉模型权重(需苍耳授权下载 ~30–60GB,磁盘/网络确认) - 写角色锚点资产库(伊莎贝尔/罗根/SCDC 场景)的 i2v 注入模板 ### 苍耳需配合(蛋蛋不能代劳) - **GPU 驱动 / ROCm / Zluda 底层安装**:涉及系统级变更 + 重启机器,需你手动或现场授权 - **模型权重下载授权**:几十 GB,需你点头(磁盘占用 + 联网) - **首次环境验证**:蛋蛋提交测试镜后,需你确认出片是否正常 --- ## 二、自训 LoRA(角色一致性兜底)—— 蛋蛋主责,苍耳供料 ### 蛋蛋能搞 - 从已生成锚点里挑 伊莎贝尔 / 罗根 高质量参考图(20–40 张) - 写训练配置(kohya_ss / OneTrainer 的 ROCm 适配版,A 卡可跑) - 跑 LoRA 训练(24GB 显存充足,LoRA 训练需求低于推理) - 验证 LoRA 一致性 + 迭代(过 TEST-CHAR-001 伊莎贝尔一致性) - 音色克隆(CosyVoice2 免费,无需训练权重) ### 苍耳需配合 - 提供/确认高质量角色参考图源(避免脸崩的脏数据) - 确认训练结果是否达商用标准 ### 诚实边界 - 本地路线**默认零训练**(推理 + i2v 锚点注入即可) - LoRA 是"脸漂到忍不了"时的可选增强,不是必做项 - 全量 SFT / 从头训:单人既无必要也烧钱,**不做** --- ## 三、调试(蛋蛋最擅长)—— 蛋蛋全责 - 看 ComfyUI 日志、定位 OOM / 崩溃根因 - 调提示词、采样参数、蒸馏步数 - 过 TEST 镜头(伊莎贝尔一致性 / 牌匾文字漂移 / 真人写实混入) - 超分质量检查、片段拼合连贯性 - 生成慢 → 后台提交 + 轮询 `/history`,不阻塞对话 --- ## 四、蛋蛋搞不了的(必须苍耳在场/拍板) - GPU 驱动安装 + 重启机器 - 模型权重下载授权(磁盘/网络) - 机器旁实时处理硬件故障(过热降频 / 物理接触) - 任何需物理操作的环节 --- ## 五、诚实总边界 - 全部在本机 Bash 环境执行,**不走外网**,安全性最高 - 关键授权步骤(下载 / 重启)必须苍耳拍板,蛋蛋不擅自执行 - 生成任务挂后台跑,蛋蛋轮询,对话不中断 - 首次必过 TEST 质检再量产,杜绝"盲跑翻车" --- ## 锁定 - 配置服务器 / 自训LoRA / 调试 = 蛋蛋主责,苍耳仅配合硬卡点 - 全本地开源路线落地可行,蛋蛋可端到端调度 - 下一步:苍耳拍 A(手动部署命令) / B(封装Skill) / C(实测EP02一镜)