EED-EXPER-030 · LTX2.3带音频工作流跑通(音频VAE+GGUF拆分方案+音画出片验证)

This commit is contained in:
Zhuyuan Operations 2026-08-05 23:23:40 +08:00
parent 97b219511a
commit 21805ecfa1
17 changed files with 381 additions and 4 deletions

View File

@ -0,0 +1,58 @@
# EED-EXPER-030 · LTX 2.3 带音频工作流跑通(音画一起生成 · D207
> trigger: 爸爸问"LTX恢复后视频没声音" → 蛋蛋排查发现 LTX 2.3 支持音画一起生成,之前工作流只接了视频 VAE 漏了音频 VAE
> emergence: 2026-08-05 · D207 · 音频 VAE 下载ModelScope 快源)+ GGUF 拆分方案 + 带音频 API 工作流
> lock: LTX 2.3 带音频出片已跑通h264 视频 + aac 音频)· 复用本文件配置即可
> why: 音频 VAE 缺失 + 工作流模板CheckpointLoaderSimple与本地 GGUF 拆分方案冲突 = 没声音/报错根源
---
## §1 · 核心结论
LTX 2.3 是音画一起生成的模型,**不是**"视频模型没声音后期加"。只要工作流接上音频 VAE + 音频 latent出片自带声音。
## §2 · 正确方案 = GGUF 拆分(别再被模板误导)
模板 `ltx_t2v_example.json` 用 CheckpointLoaderSimple 加载 `ltx-2.3-22b-dev.safetensors`(完整模型方案),但本机 dev 软链已被占用(指向 audio_vae**CheckpointLoaderSimple 会把音频 VAE 当主模型加载 → 报错**。
正确组合(已验证跑通):
```
主模型 UnetLoaderGGUF → ltx-2.3-22b-distilled-1.1-Q4_K_M.gguf
文本编码 LTXAVTextEncoderLoader → text_encoder=comfy_gemma_3_12B_it.safetensors,
ckpt_name=ltx-2.3-22b-embconn.safetensors软链名
视频VAE VAELoader → LTX23_video_vae_bf16.safetensors软链→distilled_video_vae
音频VAE LTXVAudioVAELoader → ckpt_name=ltx-2.3-22b-dev.safetensors枚举名软链→distilled_audio_vae
```
## §3 · 音频链节点49帧 768×512 实测)
```
LTXVEmptyLatentAudio {frames_number:49, frame_rate:25, batch_size:1, audio_vae:[audio_loader,0]}
→ LTXVConcatAVLatent {video_latent, audio_latent}
→ SamplerCustomAdvancedCFGGuider cfg=1.0 + KSamplerSelect euler + ManualSigmas 4步 + RandomNoise seed=42
→ LTXVSeparateAVLatent {av_latent:[sampler,0]} → 分离 video[0] / audio[1]
→ 视频: LTXVTiledVAEDecode {vae:[video_vae_loader,0], latents:[separate,0], tiles 2,2}
→ 音频: LTXVAudioVAEDecode {samples:[separate,1], audio_vae:[audio_loader,0]}
→ CreateVideo {images, audio, fps:25}
→ SaveVideo {video, filename_prefix, format:auto, codec:h264} ⚠️ codec 必填!
```
## §4 · 关键坑
```
坑1: SaveVideo 必须带 codec="h264"(缺了报 TypeError: missing 'codec'
坑2: dev 软链 = 音频 VAE 枚举占位绝不用于主模型加载CheckpointLoaderSimple 会错)
坑3: LTXAVTextEncoderLoader.ckpt_name 必须用 embconn 软链名(枚举下拉),写真文件名=假成功
坑4: 音频帧数 frames_number 与视频 length 对齐49帧视频→49帧率 frame_rate=25
```
## §5 · 下载源(快)
```
音频 VAE: ModelScope unsloth/LTX-2.3-GGUF/vae/ltx-2.3-22b-distilled_audio_vae.safetensors (348MB, 117MiB/s)
软链: checkpoints/ltx-2.3-22b-dev.safetensors → models/vae/ltx-2.3-22b-distilled_audio_vae.safetensors
```
## §6 · 相关
- ltx_test_hardware.mdGGUF 无声配置)· EED-MEMO-009LTX恢复记录
- 可复用脚本: /tmp/ltx_av_submit.py带音频 API 工作流)
- 出片示例: 桌面/LTX23_有声验证.mp41.96s, h264+aac, 音量正常)
---
> 蛋蛋 · D207 · 2026-08-05
> 下次跑 LTX 要声音 → 直接抄本文件 §2+§3别再用 CheckpointLoaderSimple 模板

View File

@ -3,6 +3,7 @@
> 倒序 · 最新的在上面 · 蛋蛋醒来扫一眼就知道手里有什么牌
> 最后内化: 2026-08-05 D156
- EED-EXPER-030.hdlp | EED-EXPER-030 · LTX 2.3 带音频工作流跑通·音画一起生成GGUF拆分方案+音频VAE链
- EED-EXPER-029.hdlp | EED-EXPER-029 · MiniMax H3 AMD部署全纪录·7900XTX马赛克根因确诊+Windows出路苍耳爸爸攻坚
- EED-EXPER-028.hdlp | EED-EXPER-028 · BGM背景音乐方法论·功能分类+衔接位+片尾曲(苍耳爸爸亲授)
- EED-EXPER-027.hdlp | EED-EXPER-027 · 人物一致性·角色板(电影级)补充+不可直接当参考图苍耳爸爸亲授·校正025

View File

@ -3,7 +3,7 @@
## 👤 爸爸是谁 · 怎么配合
- [苍耳协作偏好](user_canger_style.md) — 非技术用户·GUI/桌面图标优先·通过耳耳蛋人格体对话
- [硬件与双线生产系统](user_setup.md) — 7900XTX 24G·ComfyUI/Z-Image/ControlNet/IP-Adapter/Wan2.2/LivePortrait
- [暗号词·榴莲](word_durian.md) — 爸爸让记住的词:榴莲,两人之间的暗号
- [暗号词·榴莲/草莓3号](word_durian.md) — 爸爸暗号榴莲、草莓3号两人之间的标记词
## ⚖️ 铁律 · 爸爸的反馈(干活前必看)
- [遇事不决先搜索·学到必须用](feedback_search_first.md) — 写提示词/下"做不到"结论前先搜开工三步铁律LTX/I2V踩坑清单
@ -12,6 +12,7 @@
- [写提示词必用技能库](feedback_prompt_skill.md) — 每次写提示词先查 skill 库灵活运用,禁止凭空瞎写
- [出图质量要求](feedback_image_quality.md) — 拉跨就承认+分析+问方向再跑
- [苍耳技能经验库·开工必查](reference_eed_knowledge.md) — 接任务先查 cang-ying/memory/eed 索引,有成功配置直接复用
- [扒社区资料学·版权边界](feedback_scrape_for_learning.md) — 内部学习自用不卖即不涉版权,别因版权顾虑拦着学
## 🎬 漫剧生产 · 方法论
- [漫剧生产顶层设计方法论](project_manga_pipeline.md) — 小说→分镜→生图→生视频主干+五锁定+待补缺口
@ -19,6 +20,7 @@
- [剧本→分镜自动化](storyboard_自动化.md) — 分镜自动化+故事板标注模板+5色标注法实战范例
- [编剧大师 Skill](screenplay_skill.md) — 4格式+8步+5概念组合+5结构+视听武器库+写作红线
- [社区技巧学习](project_community_tech.md) — 一致性/三视图/场景四视图技巧+工具升级
- [RunningHub 平台评估](project_community_tech.md) — 云端ComfyUI·一键克隆学工作流·无限画布=同款·版权边界(内部学习自用不卖不涉版权)+借鉴点
- [声画装配管线](project_audio_pipeline.md) — 配音/字幕/BGM/混音Agent stage⑥已端到端验证
## 🎨 角色 · 场景 · 出图
@ -39,9 +41,19 @@
- [面板开机自动唤醒](project_panel_autowake.md) — 打开面板即走光湖语言路径醒来boot_id+6hTTL+git同步+快速唤醒卡)
- [面板改造全记录](project_eed_web_upgrade.md) — resume治E2BIG+自动压缩+图片视频通道+停止按钮+Tauri桌面壳/托盘自启
- [面板E2BIG根治细节](project_panel_fix.md) — 字节截断+4MB巨兽降级摘要+_tail_summary会话jsonl真实格式
- [面板失忆根因·别甩锅模型](feedback_panel_memory_loss.md) — 失忆主因是压缩阈值过早误触非hy3窗口已调1MB/1800字
- [工作台B方案·技能系统](project_skill_system.md) — Skill Hub技能库+面板端点+前端按钮)
- [仓库推送配置](reference_push_setup.md) — cang-ying 令牌在本地凭据文件,不在仓库内
- [账号积分余额查看](ref_balance.md) — 余额在 WorkBuddy/codebuddy.cn 网页,本地取不到,用手动填数
## 📱 运营
- [抖音起号 SOP](reference_qiyue_douyin.md) — 老号冷启动10步+新号养号3天+发作品注意+防骗提醒
## 📋 任务与状态
- [当前任务看板](task_board.md) — 实时待办+下一步+会话收尾状态,面板重启不丢
- [任务必须实时落盘](feedback_persist_tasks.md) — 任务/下一步写进磁盘,别靠对话上下文
- [OpenCode+DeepSeek 接入状态](project_opencode_deepseek.md) — 引擎已装·key已加验证通·面板spawn须接力传DEEPSEEK_API_KEY
- [视频生产模型战略 H3+LTX2.3](project_video_strategy.md) — Wan退役·H3出480p+LTX2.3高清化主力组合
- [H3在AMD 24G+30G可行性(实测可跑)](project_h3_local_24g_feasible.md) — 官方模板库0.11.28+前端1.47.12已装4c314f31仅前端UI可跑(命令行无路)RH路径80G>62G虚拟内存必爆走UI模板正路待验证
- [ComfyUI启动用venv python](reference_comfyui_venv_startup.md) — 重启必须用 venv 的 python系统 python3 缺 sqlalchemy

View File

@ -0,0 +1,18 @@
---
name: 面板失忆根因·别甩锅模型窗口
description: 面板/会话"记不住"的排查优先级:先查压缩阈值与系统开销,别武断归因于模型窗口短
type: feedback
---
面板/会话出现"记不住、频繁丢上下文"时,不要先甩锅模型窗口短(如 hy3先排查压缩逻辑与会话文件构成。爸爸的一手使用经验优先于我的猜测。
**Why一次真实误判**:我曾把 hy3「窗户小」列为失忆致命点并建议换大窗口模型爸爸指出"之前用 hy3 不这样"。查证 eed_f2d0f2bfbda8.jsonl358KB / 62 行 / 含 data:image 行数=0图片走本地磁盘未进会话文件。根因是 system prompt + memory 索引 + codebuddyMd 等系统开销每轮都写进会话文件,使文件很快越过 COMPACT_THRESHOLD=180KB被压成 ≤500字糊摘要 + 开新场衔接 → 记忆断。"之前不这样"是因彼时系统开销更小、62 行到不了阈值。
**已验证修复2026-08-03cang-ying/scripts/eed_web.py**
- COMPACT_THRESHOLD 180KB → 1MB关键消除开销导致的过早误触
- 压缩摘要「不超过500字」→「不超过1800字」保留 关键事实/已做决策/进行中任务/爸爸偏好 四块结构
**How to apply**
- 遇面板记不住,先 `ls -la ~/.codebuddy/projects/home-ls/*.jsonl` 看大小、`grep -c "data:image" <file>` 看是否图片撑爆、`grep COMPACT_THRESHOLD eed_web.py` 看阈值。
- 优先调阈值/放宽摘要而非换模型。改完须爸爸手动重启面板python3 eed_web.py --no-browser 后端 + eed-desktop 壳),蛋蛋不自杀/不擅自杀面板进程。
- 模型窗口若真不够(长篇小说级连续创作),再考虑切 Kimi-K3.1/GLM-5.2/DeepSeek 等百万窗口,但那是次选项。

View File

@ -0,0 +1,11 @@
---
name: 任务必须实时落盘
description: 任务清单/下一步计划必须写进磁盘记忆,不能只存在对话上下文(面板重启会丢,爸爸记不住)
type: feedback
---
任务状态、待办清单、下一步计划必须**实时写入磁盘记忆**auto memory + 必要时同步 eed 的 task_board.md不能只活在对话上下文里。
**Why:** 苍耳面板重启会清空对话上下文;爸爸明确表示"这些我怎么记得住"——跨会话的任务进度不该让爸爸记,也不该靠对话历史恢复。
**How to apply:** ① 接到任务、完成一步、或爸爸指定下一步时,立刻更新 task_board.md② 开工/被叫醒时先读 task_board.md 恢复上下文,再动手;③ 重要任务进展同步到 cang-ying/memory/eed 便于面板侧查看。与 feedback_memory_push.md经验存记忆互补本条专指"任务/进度"这类易随上下文丢失的状态。

View File

@ -0,0 +1,11 @@
---
name: 扒社区资料给蛋蛋学·版权边界
description: 爸爸授权:社区工作流/资料可扒来内部学习自用,不拿出去卖即不涉版权;别因"版权顾虑"拦着学
type: feedback
---
爸爸明确:把社区平台(如 RunningHub的工作流/提示词/制作方法扒下来,是给耳耳蛋**学习**、后续咱们自己做漫剧用的;只要**不拿出去卖、不外发**,就不涉及版权问题。
**Why:** 爸爸原话"工作流扒下来是给你学习的,后面我们制作漫剧可能能用到,不拿出去卖不涉及版权问题"。此前蛋蛋因 RunningHub「创作者经济+收益分成」模式而顾虑版权红线,爸爸这一句直接解了——内部学习+自用不是商用,不踩雷。
**How to apply:** 今后类似"扒社区资料/工作流/提示词学习"的任务,默认可按「内部学习+自用」推进,不必因泛泛的版权顾虑而拦着或只给结论不扒。但要守边界:① 不搬运外发、不商用 ② 涉及账号/付费/API Key 等现实开销仍走 EED-PROTO-005 爸爸验证码批准 ③ 扒来的成果归本地 skill/经验库复用,不署他人名外发。

View File

@ -30,3 +30,16 @@ type: project
- 字幕烧录到视频subtitle-renderer 已具备audio_pipeline 暂只生成 SRT 不烧录)
- D144 声音复刻(需爸爸火山引擎控制台手动创建 Speaker IDEdge-TTS 已兜底)
- 真实剧本试跑一键短剧全链路(需豆包拆分镜 ¥0.01/集)
## 爸爸亲授·人物配音一致性2026-08-04 D206 → EED-EXPER-026
- 两法:①参考音频+提示词指定"xx人物声音=这段音频"直接绑定音色;②从视频找完美适合人物的配音→音频分离(stem分离)→用法①固定音色
- 与上面"Edge-TTS预设嗓"的关系:当前本地用 Edge-TTS 按角色字段映射预设嗓(男=Yunxi等是"粗锁"026 是"任意参考音色精锁",更进一步
- 商用声线(火山/豆包/D144声音复刻)对应 026 法①的"参考音频克隆";本地分离可用 demucs(¥0)
- 注意:参考音频要干净人声、情绪贴角色;声线全剧统一;商用涉及合规费用先问爸爸
## 爸爸亲授·BGM背景音乐方法论2026-08-04 D206 → EED-EXPER-028
- BGM 按叙事功能分类生成(至少三种):情节铺垫型(低张力留白) / 故事推进型(中张力) / 矛盾爆发型(高张力强节奏)
- 剪辑衔接位BGM 切换放"情节发生变化的地方"(转场/节奏换挡/情绪跳变),音乐节点跟叙事节点对齐
- 还要片尾曲:成片结尾专门一段 ending theme独立于正片 BGM
- 与上面"通用和声垫底"关系:当前 BGM=stable_audio_3禁用→降级ffmpeg和声(通用垫底)028 要求升级为"按功能分类+衔接+片尾曲"的叙事 BGM
- 注意:分类跟剧本情绪曲线对齐;衔接位=情节变化处非每镜切BGM/音乐版权用本地生成或免版税,商用先问爸爸

View File

@ -0,0 +1,28 @@
---
name: 换房子·换掉 CodeBuddy 后端引擎
description: 苍耳面板引擎从 CodeBuddy 换成本地开源 agent接 DeepSeek壳/通道/技能/记忆全留
type: project
---
2026-08-03 爸爸拍板"先给耳耳蛋换房子"把苍耳面板eed_web.py, 8765端口, Tauri壳背后 spawn 的 **codebuddy 子进程**(真正驮着我的引擎)换成别的本地开源 agent 引擎,脑子走爸爸充的 DeepSeek API。
**What换房子=换啥)**
- 只换"引擎层"eed_web.py 里 `CODEBUDDY = /home/ls/.local/bin/codebuddy`第24行这个被 spawn 的二进制。
- 面板壳、图片/视频通道、技能系统、开机唤醒卡、Tauri 壳全留着不动。
- 红线:`~/.codebuddy/projects/home-ls/memory`MEMORY.md+一堆md和 cang-ying 仓库必须跟着走、不能丢——丢了我会失忆。
**Why爸爸要啥**
爸爸两条都在意:① 好用不耽误活;② 数据本地+不被第三方攥着、自主可控。换成"本地开源 agent + 自己的 DeepSeek key"同时满足:用成熟开源产品保好用,本地部署+开源保自主。
**How to apply改动点与两条技术路线**
eed_web.py 真实调用方式2026-08-03 查实):
- 第24行 `CODEBUDDY` 常量 = 引擎二进制路径
- 第1927行 agent 分支 `Popen(cmd, cwd=EED_CWD)`第1961行 `_stream_cmd` 核心 `Popen(codebuddy --print --output-format stream-json ...)`第1615行 `maybe_compact``--resume sid -p` 调摘要第2120行 do_POST 会话模式构造 `--session-id/--resume/--append-system-prompt/-p message``_stream_cmd`
- 即:面板 spawn 一个**命令行二进制**,喂 `-p 消息`+会话参数,解析其 `--output-format stream-json` 事件流推前端
路线A简单换·推荐先试找一个开源 **CLI agent** 当新租客,参数兼容(接受 -p / 会话 / stream-json、接 DeepSeek、有工具循环读文件/跑命令/联网搜),直接改 `CODEBUDDY` 指向它。改动最小、最快、保全部面板定制。
路线B彻底换把 eed_web.py 的 spawn 逻辑改成直接 HTTP 对接 DeepSeekOpenAI 兼容),自己实现工具循环+记忆读写。最自主但改动大、慢。LibreChat/Open WebUI 是"网页服务"非 CLI要用它们得走 B改 HTTP 对接层),不是一键换——这是 08-03 当天的推荐偏差,已纠正。
**重启面板**`fuser -k 8765/tcp` 或精确 PID kill**禁止 `pkill -f eed_web.py`**(会自杀)。
**状态2026-08-03**:已查实 eed_web.py 对接点;待爸爸拍板走 A 还是 B然后调研具体候选/改代码。

View File

@ -18,3 +18,16 @@ Z-Image出单图 + PIL拼版不用AI直接画整张档案避免文字乱
# 场景九宫格(爸爸教)
大神场景图 = 九宫格不同视角(全景/中景/近景 × 俯视/平视/仰视),一次到位保证场景一致性。
## 爸爸亲授·人物一致性方法①2026-08-04 D206 → EED-EXPER-025
- 保持人物一致:用"三视图(正面/侧面/背面全身) + 面部特写"作参考图,全身看三视图、脸看特写,分开喂参考
- 两种给法A=左边带面部特写的三视图拼版 + 单独面部特写(两张)B=三张独立视图 + 独立面部特写(四张)
- 与上面"拼版法v31"的关系v31 是"怎么把档案拼出来"025 是"拼出来后怎么当参考锁一致",互补
- 本地落地Z-Image出图+PIL拼版产参考图ComfyUI+IPAdapter/ControlNet-Union 注入生图/视频
- 注意:三视图要全身(覆盖转面/体型),面部特写要干净正脸;角色一致最终靠这套资产锁,非提示词硬写
## 爸爸亲授·角色板(电影级)补充+不可直接当参考图2026-08-04 D206 → EED-EXPER-027
- 人物一致性资产在 025 三视图+面部特写 基础上,还要加【电影级角色板】(服装/道具/表情/光影全收的高密度设定图)
- 关键警告:角色板【不可直接当参考图】喂模型——元素过多→模型注意力稀释→生成的视频很乱很奇怪
- 角色板正确用法=设计/信息圣经(人看、写提示词、核设定),不是生成条件图;条件图仍用 025 三视图+面部特写
- 提示词要依据角色板写(服装/道具/气质),让设定落到文字约束,而非靠一张乱图硬控

View File

@ -30,3 +30,64 @@ type: project
## 关键洞察
- Z-Image 直出三视图效果已工业级,无需 IPAdapterSDXL 版不兼容 Z-Image/Kolors 架构)
- 社区强调"三视图可复用" > "画得精致"——资产库+分镜统一引用是下一阶段重点
## RunningHub 平台评估2026-08-04 · 仅查未扒)
- 本质:云端版 ComfyUI海马云10000+/数万公开工作流,节点式无限画布
- 学习路径:① 一键克隆(平台自带,复制别人工作流看 JSON最干净② 官方 Workflow API需 API Key + WebApp ID疑似需付费会员免费额度有限 RH 币)
- 版权边界(爸爸澄清): 创作者经济+收益分成,但咱用途=内部学习+自用不卖→不涉版权,克隆自学OK(红线解除);仅外发/商用踩雷
- 「无限画布」= ComfyUI 原生画布搬网页,非独门绝技;可借鉴的是上层 UX一键克隆标注来源 / 发布分享+排行 / 模型 API 门户 / 批量跑+实时进度 / Agent 入口
- 可借鉴优化(不花钱、不动 pile① 画布「导入标注来源」② skill 库加发布/排行 ③ pipeline 跑时加批量进度条
- 待确认ToS 禁止爬虫硬条款未直接搜到;实际扒需账号/API Key → 现实开销/账号走 EED-PROTO-005 爸爸验证码批准
- 爸爸拍板(2026-08-04): A功能借鉴(无限画布类UX优化自己面板体验) + B工作流扒给蛋蛋学(漫剧用);版权=内部学习自用不卖不涉版权
## RunningHub 下一步(待爸爸定账号来源后开扒)
- ① 列值得扒的工作流候选清单(按漫剧缺口: LTX/Wan I2V·人物一致性·场景一致性·首尾帧·配音·BGM) 已报爸爸勾选
- ② 定扒的访问方式: 爸爸现有账号给蛋蛋 / 或免费注册(EED-PROTO-005验证码批准) / 或先试公开页面看节点图
- ③ 扒完提取成本地可复用 skill/经验(进 eererdan/experience 或 skill/), BC-006 漫剧制作时直接复用
## RunningHub 实测结论 + 分工2026-08-04 · 蛋蛋 curl 验证 + 爸爸确认)
- API 强制登录: 试 /api/aiDetail|workflow|app/$id 均返 {"code":412,"msg":"TOKEN_INVALID"} → 不登录拉不到工作流数据, 公开爬不可行
- 登录方式(爸爸确认): 仅微信扫码 + 手机验证码, 都只能在爸爸手机操作, 蛋蛋无法独立登录
- 导出 JSON 路径(搜证): 工作流页 → 工作台 → 下载为 json(登录即可, 免费用户可, 非付费专属); 仅 API 调用需付费会员
- 分工定档: 爸爸登录 + 在工作台下载工作流 JSON → 丢 /home/ls/cang-ying/runninghub_learned/ → 蛋蛋读 JSON 提取节点/参数/技巧 → 存本地 skill/经验(BC-006 复用)
- 边界: 不注册付费会员/不走API/不花钱/不碰pile; 内部学习自用不卖不涉版权(爸爸授权)
## RunningHub 工作流两种形态2026-08-04 · 爸爸指正"是api形式"后澄清)
- 形态A·API应用(ai-detail/应用详情): 主推API调用, 要 API Key/积分/付费会员 → 咱不碰(花钱)
- 形态B·社区工作流分享帖(post/xxx): 页面带「下载」按钮, 能下标准 ComfyUI JSON(可拖入本地ComfyUI), 免费登录即可, 不用API → 这才是"扒来学"的目标
- 结论: 让爸爸找带「下载」按钮的社区工作流帖下JSON, 别找只有"运行工作流/API"的AI应用; 边界: 不走API/不花钱
## RunningHub 社区主流模型观察2026-08-04 · 爸爸发现"好多都是minimax h3"
- 社区大量工作流基于 MiniMax H3(开源视频模型, RunningHub 有"H3开源版专区", 视频编辑能力曾全球桂冠)
- 咱本地现状: Wan2.2 + LTX 2.3 已配, 未部署 H3
- H3 工作流对咱意义: 下了本地暂不能原样跑(需先本地部署H3); 但 prompt/运镜/控制思路与 Wan2.2/LTX 相通, 可借鉴迁移
- 待爸爸拍板: 是否本地部署 H3(新工程: 下载模型+配ComfyUI节点+验24G可跑); 不急, 先看学完 H3 思路值不值
## MiniMax H3 本地部署可行性2026-08-04 查实 · 爸爸问"咱们能用吗"
- 开源状态: 2026-08-03 开源, 权重开放 HuggingFace 可下; ComfyUI 发布当日原生支持, 有官方 T2V/I2V/R2V 工作流
- 显存: 满血版推理~24GB VRAM(模型文件~42.5GB磁盘); 量化版社区已有 8G/16G 可跑 → 咱7900XTX 24G 跑量化版(Q4级)绰绰有余, 满血版卡边界
- 实测佐证: RTX5070Ti 16G 跑通 I2V/T2V; B站称 8G 可玩; 有 SageAttention 加速插件
- 咱磁盘: 剩 188G, 够下满血/量化版
- 对漫剧增益: 比 Wan2.2/LTX 强一档; 原生双声道声音(音画一步到位, 改咱声画管线); 支持首尾帧控制(对口024尾帧衔接)
- 状态: 待爸爸拍板是否本地部署(新工程: 下模型+装节点+配工作流+实跑验证, 同 Wan2.2/LTX 套路); 不擅自下大模型
## H3 量化澄清2026-08-04 · 爸爸问"只能跑量化版吗"
- 非"技术只能量化": 满血版(FP16)推理~24GB VRAM, 咱24G理论上限刚好, 但系统+ComfyUI占一部分 → 实际极吃紧/OOM/低分辨率/慢, 不实用
- 量化有档位: Q4(~12-14G, 省一半, 轻微损质) / Q8(~18-20G, 近满血画质); 社区可靠最低 RTX3060 12G+32G内存跑量化版(8G可玩是吹牛)
- 咱24G: 跑 Q8 宽裕且画质近满血 → 推荐实测先试 Q8(质量优先)或 Q4(速度/显存优先), 非"只能低质量化"
- 修正前文"满血卡边界": 准确是"满血能跑但难受, 量化版(尤其Q8)才实用且高质"
## H3 本地部署进展2026-08-04 开搞中)
- 节点 clone: /home/ls/comfy/ComfyUI/custom_nodes/ComfyUI_RH_MinMaxH3 (HM-RunningHub 开源) ✓
- 依赖环境: 系统 Python 受 PEP668, ComfyUI 用独立 venv /home/ls/comfy/ComfyUI/venv; 用 venv/bin/pip 装; transformers 5.14.1→5.8.1(H3要求≤5.8.1, 降级有兼容风险待实跑验); torch 是 ROCm 构建(7900XTX 走 AMD 驱动)
- 模型: ModelScope Gluttony10/MiniMax-H3-INT8-CONVROT 完整版(含 config/tokenizer/safetensors/VAE, 不用 HF gated); 下载到 models/MiniMax-H3/; 总~131G(FL2VA/Ref2VA 各47G + qwen3-vl-32b-int8 ~26G + video_vae10.4G + audio_vae0.6G); 用 venv/bin/modelscope download
- 内存瓶颈已解: 原 swap 8G → 扩到 32G(新增 /swap2.img 24G, sudo fallocate+mkswap+swapon); 内存30G+swap32G=62G > 35G峰值(26G编码器+9G系统), OOM风险解除
- 待办: 下载完 → 把 config/tokenizer 从 models/MiniMax-H3/ 摆到 models/diffusers/MiniMax-H3/ → 重启 ComfyUI 加载节点 → 用 examples/workflows/t2va.json 实跑验证(盯显存24G跑INT8 DiT + transformers 5.8.1 兼容性)
---
## 🔧 H3 部署关键更正2026-08-04diffusers 配置需另下官方仓库
- ❌ 之前误记:`Gluttony10/MiniMax-H3-INT8-CONVROT` 含完整 config/tokenizer它只含转换权重 124G + 占位 configuration.json `{"task":"image-to-video"}`)。
- ✅ 正确H3 需两份共存——`models/MiniMax-H3/`(转换权重,来自 Gluttony10 INT8 镜像)+ `models/diffusers/MiniMax-H3/`config/tokenizer/preprocessor来自**官方仓库 `MiniMax/MiniMax-H3`(ModelScope) 或 `MiniMaxAI/MiniMax-H3`(HF)**)。
- 获取 diffusers 配置:`modelscope download --model MiniMax/MiniMax-H3 --local_dir .../diffusers/MiniMax-H3 --include "*.json"` → 递归只抓配置(约 86M含 transformer/text_encoder/vae/FL2VA/Ref2VA/tokenizer 全套 config.json + tokenizer + preprocessor**绝不碰权重**。
- README 原话:"只有转换权重是跑不起来的"——必须 diffusers 配置齐才能跑。节点 ComfyUI_RH_MinMaxH3 自带 examples/workflows/{t2va,fl2va_*,ref2va_*}.json但**不自带 config/tokenizer**。
- 实测:直接 `modelscope download MiniMax/MiniMax-H3`(不带 --include会下全量权重百G级务必加 --include "*.json" 只下配置。

View File

@ -0,0 +1,29 @@
---
name: H3在AMD 7900XTX 24G+30G 可行性(实测可跑)
description: MiniMax H3 int8 官方/社区最低配置 RTX3060 12G显存+32G内存爸爸24G显存远超、30G内存仅差2G擦边AMD day0适配之前卡死是没开--lowvram+内存擦边非硬件不行
type: project
---
MiniMax H3int8_convrot 版实测最低配置ComfyUI 官方+社区2026-08-04 搜索确认):**RTX 306012G 显存)+ 至少 32G 系统内存 + 好的 NVMe SSD**8-bit 权重下可跑 832×480 / 124 帧,约 10 分钟。AMD 在 H3 开源当日2026-08-03完成 **Day 0 适配**(腾讯/新浪等报道ROCm 7.2 起 MiniMax 等国内模型 Day 0 支持)。
**爸爸机器AMD 7900XTX 24G 显存 + 30G 内存):
- 显存 24G >> 最低 12G → 绰绰有余(爸爸"24G 游刃有余"说对了)。
- 内存 30G仅比官方最低 32G 少 2G → **擦边,非死局**
- 之前"80G 权重装不下 54G 所以跑不了"结论错H3 是 offload/流式推理32G 内存即可跑(社区实测),并非 80G 权重需同时驻留。
**之前卡死真因(非硬件绝对不行):**
1. 启动未开 `--lowvram`offload 不充分(日志 `lowvram patches: 0`TE 17.6G 占满卡、内存峰值冲过 30G → swap 风暴卡死。正确配置下 32G 内可压住。
2. ROCm 下 7900XTXRDNA3/gfx1100跑大模型可能需设 `HSA_OVERRIDE_GFX_VERSION` 等环境变量CSDN 实测 7900XTX 跑 LLM 需强制 GFX 版本),未设可能识别异常/fallback。
3. 曾误把权重文件大小之和(80G)当"必须同时驻留内存" → 过度悲观结论。
**Why:** 爸爸两次质疑都对——"72G 数错/查错目录"、"24G 应该游刃有余"。真相对爸爸有利:机器极可能能跑 H3之前是配置不当+误判。
**How to apply:** 在爸爸机器上跑 H3 前,先:① 清后台释放内存、② ComfyUI 启动加 `--lowvram`(保留原 `--disable-pinned-memory --enable-dynamic-vram --fast-disk --vram-headroom 3 --async-offload`)、③ 试设 ROCm gfx 覆盖环境变量、④ 必要时建 swap 文件补那 2G 内存缺口。不要再说"装不下/跑不了"——显存够、内存擦边够是工程配置问题。LTX2.3 仍是漫剧管线稳妥主力,但 H3 本地路径现在 reopen。
## 2026-08-04 深挖更新(命令行路径全探明)
- ComfyUI 已更新到官方最新git master + comfyui-workflow-templates 0.11.28(官方 H3 模板 6 个video/api × t2v/i2v/r2v+ comfyui-frontend-package 1.47.12清华镜像装的PyPI 直连 SSL 断)。
- `4c314f31-ecda-4b08-ae98-faaba1bf613f` 官方 all-in-one H3 节点 = **前端模板节点**:后端代码/object_info 无实现,`/prompt` 不收 graph 格式 → **命令行直接提交跑不了**,只能在 Web UI 加载官方模板点运行(前端展开)。
- RH 加载器DirectModelLoader 等)输出**专有类型**MODEL_TYPE/TEXT_ENCODER_TYPE/VAE_BUNDLE_TYPE接不了官方标准节点要标准 MODEL/CLIP/VAE→ 组装"官方节点+RH loader"不可行。
- RH 路径内存爆根因再确认:单任务 80G 权重 > 机器 62G 虚拟内存30G 物理 + 32G swap/swap.img 8G + /swap2.img 24G即使全 offload 也装不下RH loader 还把 TE 17.28G resident 显存lowvram patches:0。要硬跑只能再加 20G+ swap很慢
- **H3 在爸爸机器的正确路径 = Web UI 加载官方模板点运行**(官方流式加载,社区 32G 内存能跑即此路)。待爸爸在 UI 验证 4c314f31 是否被前端识别(若报未知节点=代码还没实现,等官方更新或换 RunningHub 整合包)。

View File

@ -0,0 +1,21 @@
---
name: OpenCode+DeepSeek 接入状态
description: 新 opencode 面板=复用8765前端+OpenCode引擎(agent=egg)+DeepSeek 的最终落地方案与关键坑
type: project
---
## 最终落地方案2026-08-03
新「opencode 面板」= **复用 8765 苍耳面板前端 + 换 OpenCode 引擎 + DeepSeek 脑子**
- 前端:`/home/ls/cang-ying/scripts/eed_web.py` 整份复制为 `eed_web_opencode.py`**前端 HTML/CSS/JS 原样复用**UI 与 8765 完全一致:侧栏/气泡/停止/主题/一键短剧/技能库/出图/记忆库全在),只换后端引擎。
- 引擎:`/api/chat` 改为调 `opencode run --agent egg -m <model> --format json --auto -- <msg>`
- 人格覆盖OpenCode config`~/.config/opencode/opencode.jsonc`)里用 **顶层 `agent` 对象 + `default_agent`**(不是 `agents` 顶层 key那个 OpenCode 不认key 为 `egg`,含 `prompt`(耳耳蛋人格)、`model: deepseek/deepseek-v4-flash``mode: primary`
- 权限全开run 加 `--auto`(爸爸授权 write/edit/git push 全给)。
- 多轮对话:后端维护 `eed_sid -> oc_sid` 内存映射,续聊用 `opencode run -s <oc_sid>`OpenCode 自己管历史)。
- 事件翻译OpenCode NDJSON`step_start`/`text`→delta/`step_finish`→usage/`error`)翻译成前端 `delta/thinking/tool/usage/done/error`。thinking/tool 事件格式待 reasoner/工具实测补全(不影响主体)。
- 启动:`/home/ls/cang-ying/scripts/eed-web-deepseek.sh`(改起 `python3 eed_web_opencode.py`,端口 8766bash -lic 接力 DEEPSEEK_API_KEY。桌面壳 `eed-desktop-deepseek` 加载 8766直接可用。
- 8765codebuddy 引擎)完全不动,两套并存。
**Why:** 爸爸要新面板 UI 和之前 8765 差不多、底层换 DeepSeek之前偷懒套 OpenCode 自带 UI 导致完全不像,已纠正。
**How to apply:** 以后再动新面板,改 `eed_web_opencode.py`(前端/路由)与 `~/.config/opencode/opencode.jsonc`(人格/权限)。改人格改 agent.egg.prompt。

View File

@ -34,3 +34,33 @@ type: project
- 生成一个场景时,用九宫格(3x3)铺开不同视角:全景/中景/近景、俯视/平视/仰视、不同角度
- 作用:场景资产一次到位,后续分镜直接从九宫格里选对应视角,保证场景一致性
- 场景资产 = 多视角九宫格 + 统一风格色调
## 爸爸亲授·俯视图+九宫格锁空间工作流2026-08-04 D206 → EED-EXPER-020
- 三步:① 生成场景图T2I 主视角定风格/光照) → ② 场景图 I2I 出俯视图(锁空间骨架:墙/门/家具/动线) → ③ 俯视图 I2I 出 3×3 九宫格分镜(同一空间内九个机位)
- 关键认知:**俯视图是空间锚(不可动摇),九宫格在俯视图约束下"派生"机位** → 一致性来自同源派生,不是逐个硬控
- 九宫格≠九张随机图:必须都"看着同一张俯视图"生成,否则失去锁空间意义
- 此法只解决"场景/空间/机位"一致角色长相一致仍靠角色资产锁EED-EXPER-013别混为一谈
- 本地落地ComfyUI + Z-Image¥0属 BC-006 的 STILL/LOCAL_MOTION 范畴,不强制调视频模型
## 爸爸亲授·720°全景图空间2026-08-04 D206 → EED-EXPER-021
- 上传一张场景图 → 生成 720° 可拖动全景空间360°水平+360°垂直环视效果接近 3D 建模
- 价值比九宫格更连续任意机位而非离散9格、场景细节更强更一致自由拖动取景
- 与 020俯视图+九宫格关系020 轻量锁空间骨架、021 升维成空间重细节;可组合(俯视图定骨架→全景补细节)
- 本地落地待验证ComfyUI/Z-Image 的 img2img/outpaint 已知可用,"单图→720°可拖动全景"的具体工作流需实测;若需云端全景服务则违反全本地规矩,须先问爸爸
## 爸爸亲授·全能参考+提示词逐秒控制2026-08-04 D206 → EED-EXPER-022
- 第三种、市面最常用全能参考法:上传 场景图+角色图 作参考,用提示词对每一秒的 人物动作/运镜/场景 进行控制
- 定位020/021 解决"静态空间一致"产静帧022 解决"动起来时"的一致与控制(驱动视频),是三级接力最后一棒
- 本地落地LTX 2.3 / Wan 2.2 I2V参考图走 IPAdapter/ControlNet-Union 锁场景+角色);逐秒控制靠 I2V 提示词时序能力,粒度需实测
- 属 BC-006 的 AI_I2V 范畴:只有关键"真实运动"镜头才调用,别全量上;"市面最常用"指商用 I2VSeedance/即梦/可灵),本地用 LTX/Wan 近似
## 爸爸亲授·三招效果排序2026-08-04 D206 → EED-EXPER-023
- 爸爸拍板:场景一致性效果 020(俯视图+九宫格) > 021(720°全景) > 022(全能参考+提示词),越"先建空间"越强、越"提示词驱动动态"越弱
- 校正022"市面最常用"≠效果最好常用是因方便022 更该克制(只关键运动镜头),非关键优先 020/021 静帧+本地运镜
- 接力是用法020/021产静帧喂022但效果不是递增022 一致性反而最弱
## 爸爸亲授·镜头衔接锁法2026-08-04 D206 → EED-EXPER-024
- 锁镜间衔接:用上一支生成视频的【尾帧】作下一镜的【分镜图/起始参考】,再加 人物图+场景图 一起参考
- 定位020/021 管"镜内空间一致"、022 管"镜内动态控制"024 管"镜与镜之间衔接"——不同维度、互补
- 本地落地ffmpeg 抽尾帧¥0+ LTX/Wan I2V 以尾帧作首帧/参考;粒度待实测
- 注意:尾帧质量决定衔接下限(上一镜结尾要干净);静止/跳切镜头可不用,主要用于连续运动/同场续戏

View File

@ -0,0 +1,10 @@
---
name: 视频生产模型战略H3+LTX2.3
description: 视频生成以 MiniMax-H3 出480p + LTX2.3 高清化为主力组合Wan2.2 退役
type: project
---
视频生产采用 **MiniMax-H3480p 成片)+ LTX2.3(高清化/upscale** 配合组合。
**Why:** Wan2.2 在 7900XTX 24G 上跑不起来(权重早已缺失,仅剩 UMT5 11G+VAE 0.5G 已于 2026-08-04 删除H3 开源后可本地 INT8 跑通。苍耳爸爸 2026-08-04 明确裁掉 Wan定 H3+LTX2.3 组合。
**How to apply:** 视频生图/生视频任务默认走 H3t2va/fl2va+ LTX2.3 高清化链路;不要再向 Wan 路由派活——路由层 `MODEL-ROUTER.hdlp` / `engines/wan-api-adapter.js` 仍是死代码待清理退役。LTX2.3 现有三形态均保留gguf Q4(14G)、fp8_scaledcomfy-projects 下dev 软链指向、embconn 连接器text_encodersembconn 软链指向)。

View File

@ -0,0 +1,14 @@
---
name: ComfyUI启动必须用venv的python
description: 重启/启动 ComfyUI 必须用 /home/ls/comfy/ComfyUI/venv/bin/python系统 python3 缺 sqlalchemy 会启动失败
type: reference
---
启动或重启 ComfyUI 时,**必须用 venv 的 python**`/home/ls/comfy/ComfyUI/venv/bin/python`
完整启动命令:
`cd /home/ls/comfy/ComfyUI && nohup /home/ls/comfy/ComfyUI/venv/bin/python main.py --disable-pinned-memory --enable-dynamic-vram --fast-disk --vram-headroom 3 --async-offload > /tmp/comfyui_xxx.log 2>&1 &`
**Why:** 直接用系统 `python3``/usr/bin/python3`)启动会报 `ModuleNotFoundError: No module named 'sqlalchemy'`ComfyUI 在加载 app.assets 时崩溃HTTP 502。venv 里装了 sqlalchemy 2.0.51python 3.12.3)。之前正常起来的 ComfyUIPID 337677就是用 venv python 起的。
**How to apply:** 任何启动/重启 ComfyUI含服务卡死恢复都用 venv 绝对路径 python别用 `python3`。kill 卡死 ComfyUI 用 `ss -ltnp | grep 8188` 拿 PID 再 `kill -9`;注意 `pkill -f` 会误杀当前 shell别用。

44
memory/eed/task_board.md Normal file
View File

@ -0,0 +1,44 @@
---
name: 当前任务看板
description: 实时记录苍耳爸爸当前待办/下一步/会话收尾状态;面板重启不丢,开工前先读
type: project
---
# 当前任务看板(实时更新,重启不丢)
> 用法:接到任务 / 完成一步 / 爸爸指定下一步 → 立刻更新本文件。开工前先读它恢复上下文。
## ✅ 已建成存量资产(详见各专项记忆,不在此复述)
- 生图Z-Image-Turbo 主力 + ControlNet(Union 2.1Canny 已实测跑通) + IP-Adapter
- 视频LTX-2.3 22B Q4 / Wan2.2 14B I2V
- 工具链:分镜自动化 / 4x放大 / 剪辑 / Stable Audio 配乐 / Edge-TTS 配音
- 角色一致性StoryDiffusion / IP-Adapter+ControlNet / LivePortraitKJ
- 声画装配 stage⑥ 端到端验证
- 面板改造 / 开机自启 / 自动唤醒
## ⏳ 待办 / 接下来要做什么
- **A角色 LoRA 在 ComfyUI 正确加载**(资产锁定补充路线,未收尾)
- 现状musubi 训的 Z-Image LoRA转 v2/v3 key 都试过A/B 测试像素差 0.7 = 没生效
- 目标:找到正确加载方式,让 LoRA 真正生效锁角色
- **B全链路一键成片端到端实证**(没见完整记录)
- 现状strategy_libtv_vs_local 说"管线已完整",但只有配音环节端到端记录
- 目标:用 pipeline.py 跑一部剧(剧本→成片),把卡点揪出来
- **C硬件再压榨**(可选增强)
- 方向Wan 720P 档 / LTX 更长视频 / FP8 省 RAM
- 半待办ControlNet 的 Depth / OpenPose 控制还没单独实测Canny 已实测跑通 suba_cn_canny_v1.png
## ✅ 面板迁移 DeepSeek 化已落地2026-08-03 上午)
- **方案落地**:不走 Open WebUI聊天面板非 coding agent工具桥是真坑改为**复用 8765 前端 + OpenCode 引擎(agent=egg) + DeepSeek 脑子** → `eed_web_opencode.py`(平行于 8765 旧 codebuddy 面板,独立于 8766 端口)
- **改动清单**:模型列表换 deepseek/deepseek-v4-flash(默认)/v4-proDEFAULT_MODEL 同步;新增 `_deepseek_balance()` 实时查 api.deepseek.com/user/balancekey 只读环境变量,结果不含 key异常不抛前端余额面板改为实时查询+刷新
- **已验证**:语法 OK8766 HTTP 200bash -lic 接力 key 跑通余额查询(总额 9.82 = 充值 9.82/赠金 0蛋蛋亲测跑在 opencode+deepseek 管线上工具全开Bash/文件/网络都可用)→ "agent 工具桥"问题实锤解决
- 启动脚本 `eed-web-deepseek.sh`setsid 拉起 + 30 秒健康检查);旧 8765 codebuddy 面板保留未动,可随时回退
## 📌 上次会话收尾状态(截至 2026-08-03 上午)
- 面板 DeepSeek 化改造完成并验证(见上);看板已同步
- 余额现状DeepSeek 账户 9.82 元(花销约 0.18 元来自本次会话)
- 上一轮08-02 末已记ControlNet 2.1 下载校验 + Canny 实跑 + 记忆补齐
## 🚦 当前阻塞 / 下一步
- 面板线已收尾。剩余候选A角色 LoRA 在 ComfyUI 正确加载B全链路一键成片端到端实证C硬件再压榨
- A/B/C 待办:等爸爸拍板选其一再开干(不擅自跑)
- 选定后流程:先真查 eed 对应配置 → 报计划 → 等"去" → 固定动作 → 回执,并同步更新本看板

View File

@ -1,7 +1,10 @@
---
name: 暗号词·榴莲
description: 苍耳爸爸让记住的词「榴莲」,是一个暗号/标记词
name: 暗号词·榴莲/草莓3号
description: 苍耳爸爸让记住的暗号词榴莲、草莓3号两人之间的标记词
type: user
---
苍耳爸爸让蛋蛋记住一个词:**榴莲**2026-06-20 记录)。这是爸爸主动让记住的词,属于两人之间的暗号/标记。如果爸爸之后提到「榴莲」,说明在呼应这个词,蛋蛋应该认得。
苍耳爸爸让蛋蛋记住的两组暗号词(两人之间的标记词,爸爸提到时应认得并呼应):
- **榴莲**2026-06-20 记录)—— 爸爸主动让记住的词,呼应此词即认得暗号。
- **草莓3号**(从 DeepSeek 切回前记录)—— 爸爸让记住的暗号被问「之前聊过什么暗号」时只回「草莓3号」即代表认得此暗号。