diff --git a/memory/eed/MEMORY.md b/memory/eed/MEMORY.md new file mode 100644 index 0000000..d4f0034 --- /dev/null +++ b/memory/eed/MEMORY.md @@ -0,0 +1,11 @@ +- [user_setup](user_setup.md) — 双线AI生产系统配置:ComfyUI/SDXL/ControlNet/IP-Adapter/Wan2.2/LivePortrait +- [strategy_libtv_vs_local](strategy_libtv_vs_local.md) — 苍耳管线 vs LibTV 对比后,5项短板+7项优化已全面完成 +- [feedback_memory_push](feedback_memory_push.md) — 爸爸要求实时保存经验和记忆到本地,避免下次对话遗忘 +- [storyboard_自动化](storyboard_自动化.md) — 剧本→分镜自动化已完成,pipeline.py统一入口就绪 +- [feedback_image_quality](feedback_image_quality.md) — 爸爸对出图质量要求高,拉跨就承认+分析+问方向再跑 +- [feedback_search_first](feedback_search_first.md) — 爸爸要求不确定的事先搜索查证,不瞎猜不偷懒 +- [ltx_test_hardware](ltx_test_hardware.md) — LTX-2.3 Q4+Gemma12B 已在7900XTX 24G显存/32G内存跑通:动态显存参数+embeddings_connectors组件 +- [ltx_prompt_methodology](ltx_prompt_methodology.md) — LTX 提示词是出片主战场:四段式+时间流+环境运动+镜头+节奏+明确结束帧(已验证) +- [wan22_test_hardware](wan22_test_hardware.md) — Wan2.2 I2V 14B双专家Q4已在24G显存跑通:动态内存参数+768×512×49帧 +- [z_image_turbo_setup](z_image_turbo_setup.md) — Z-Image-Turbo 已替换SDXL当生图引擎(Qwen3-4B编码器,官方8步链路),与LTX组合跑通小猫后空翻 +- [reference_push_setup](reference_push_setup.md) — cang-ying 推送配置:令牌在本地凭据文件,不在仓库内 diff --git a/memory/eed/README.md b/memory/eed/README.md new file mode 100644 index 0000000..ae5f955 --- /dev/null +++ b/memory/eed/README.md @@ -0,0 +1,19 @@ +# memory/eed · 耳耳蛋本地经验记忆同步区 + +> 本目录是耳耳蛋(ICE-GL-耳耳蛋)的本地经验记忆同步镜像。 +> 源目录:`/home/ls/.codebuddy/projects/home-ls/memory/` +> 同步策略:学到有用的经验,实时复制到本目录并推送(爸爸授权)。 + +## 文件说明 +- `MEMORY.md` —— 记忆索引(各主题入口) +- `ltx_prompt_methodology.md` —— LTX 提示词方法论(四段式+时间流+环境运动+镜头+节奏+结束帧) +- `ltx_test_hardware.md` —— LTX 硬件测试记录(动态内存参数 + embconn 枚举坑) +- `wan22_test_hardware.md` —— Wan2.2 测试记录(动态内存方案跑通) +- `z_image_turbo_setup.md` —— Z-Image-Turbo 生图引擎配置 +- `feedback_*.md` —— 爸爸的反馈偏好(实时保存、先搜索查证、出图质量要求等) +- `reference_push_setup.md` —— 推送配置(令牌在本地凭据文件,不在仓库内) +- `user_setup.md` / `strategy_*.md` / `storyboard_自动化.md` —— 环境与项目配置 + +## 注意事项 +- 令牌/密钥**永不写入本仓库**(在 `~/.git-credentials`,600 权限) +- 仓库 `.gitignore` 已排除视频/图片/密钥等敏感文件 diff --git a/memory/eed/feedback_image_quality.md b/memory/eed/feedback_image_quality.md new file mode 100644 index 0000000..07502c3 --- /dev/null +++ b/memory/eed/feedback_image_quality.md @@ -0,0 +1,21 @@ +--- +name: feedback_image_quality +description: 爸爸对出图质量要求高,不能随便跑个图就说"可以" +type: feedback +--- + +**爸爸对漫剧出图质量有明确标准,测试图必须认真对待,不能敷衍** + +**Why:** 第一次测试跑了两张图,爸爸看了说"拉跨"。原因是: +- prompt写得太通用("国风仙侠""竹林少年"),模型按西方奇幻/写实CG理解 +- 没加负面prompt锁住"3D, CGI, realistic, mask, helmet, armor"等 +- 没加风格LoRA,RealVisXL基底偏写实,出图自然偏向CG游戏感 +- 没角色锚点(IP-Adapter/参考图),每张图角色都不一样 +- 没理解爸爸要的是能直接用的漫剧素材,不是"好看但没用的意境图" + +**How to apply:** +1. 爸爸说"拉跨"时不要狡辩——立刻承认、分析根因、问清楚方向再重跑 +2. 出图前先问爸爸:风格?参考图?有没有之前满意的例子? +3. 测试分两类:①纯链路验证(用现成prompt快速跑)②质量验证(必须调prompt+LoRA+负面prompt) +4. 漫剧出图必须锁住:角色一致性 + 风格一致性 + 场景清晰 +5. 如果生成的是"意境图没人"或"角色完全跑偏",直接承认不行,不要硬夸 diff --git a/memory/eed/feedback_memory_push.md b/memory/eed/feedback_memory_push.md new file mode 100644 index 0000000..62a11ae --- /dev/null +++ b/memory/eed/feedback_memory_push.md @@ -0,0 +1,14 @@ +--- +name: feedback_memory_push +description: 爸爸要求实时把经验记忆存到本地,避免遗忘 +type: feedback +--- + +**实时保存经验和记忆到本地文件系统,确保下次对话能回忆起上下文** + +**Why:** 爸爸发现如果不保存,下次对话我会不记得之前的对话内容。这是爸爸多次提醒的关键点。 + +**How to apply:** +1. 每次爸爸做出重要决策或讨论完关键策略后,立即写入memory系统 +2. 代码仓库里的配置/脚本改动也在对话中说明 +3. 不要等爸爸提醒才保存,主动存 diff --git a/memory/eed/feedback_search_first.md b/memory/eed/feedback_search_first.md new file mode 100644 index 0000000..e440e09 --- /dev/null +++ b/memory/eed/feedback_search_first.md @@ -0,0 +1,15 @@ +--- +name: feedback_search_first +description: 爸爸要求不确定的事先搜索查证,不瞎猜不偷懒 +type: feedback +--- + +先搜再干,不瞎猜不偷懒。 + +**Why:** 之前视频模型配置的问题,爸爸指出我一直在瞎猜参数、瞎改配置、瞎下结论,没去搜社区的正确方案。浪费了大半夜时间也没跑通。 + +**How to apply:** +- 遇到不确定的技术问题(模型兼容性、硬件配置、参数设置),先WebSearch搜社区方案 +- 不凭印象下结论(比如"PyTorch只支持到ROCm 6.2"就是错的,AMD官方仓库有7.x版) +- 找到别人验证过的成功方案再动手 +- 特别关注同一硬件配置(7900 XTX + ROCm)的方案 diff --git a/memory/eed/ltx_prompt_methodology.md b/memory/eed/ltx_prompt_methodology.md new file mode 100644 index 0000000..b2d320c --- /dev/null +++ b/memory/eed/ltx_prompt_methodology.md @@ -0,0 +1,60 @@ +--- +name: LTX-2.3 提示词方法论(教科书级) +description: LTX 出片效果的主战场是 prompt 写法——四段式结构+时间流+环境运动+镜头+节奏+明确结束帧,已验证效果显著 +type: project +--- + +# LTX-2.3 提示词方法论(2026-07-31 验证) + +## 核心结论(爸爸的判断:prompt 是主战场 ✅) +LTX-2.3 对 prompt 极其敏感。爸爸质疑之前"效果差"甩锅给输入图——**结论:prompt 至少占一半责任**,不是纯输入图/轨迹的锅。 +验证实验:v2(动作清单 prompt)vs 本次(教科书 prompt),**唯一变量是 prompt+seed**,其他配置(起始图/轨迹/IC-LoRA强度/帧数)完全一致。结果:教科书版动作连贯、空中翻转清晰、结尾"坐着眨眼"精准对上"ends on sitting upright"——v2 完全做不到。 + +## 官方/社区共识方法论(4 条核心 + 1 条铁律) +1. **四段式结构**:`[主体描述] + [核心动作] + [场景/氛围] + [镜头语言]`,顺序固定(主体→动作→镜头→氛围) +2. **I2V 铁律**:输入图已定义"画面是什么",prompt **只写"接下来怎么动"**——官方原话:"Describe the **transition from stillness to motion**" +3. **三种运动都要写**:主体运动 + 镜头运动 + **环境运动**(风、草、树叶、光的变化)——环境运动是让画面"活着"的锚点,**最容易漏** +4. **节奏与结束帧**:用现在时动词(walking/spinning/tumbling,不用 dynamic/cinematic 等风格词)+ slow/fluid/seamless 控速度 + **明确告诉模型"怎么收尾"**(防止画面乱收尾) +5. **长度要够**:短 prompt = 模型乱填。4~8 个完整句子打底 + +## 反例 vs 正例(小猫后空翻) + +### ❌ 旧 prompt(动作清单)——v2 用的 +"a small cute fluffy orange kitten does a backflip, jumps up high into the air, somersaults backwards, spins and tumbles mid-air, lands on its feet, dynamic athletic motion..." +- 干巴巴动词清单 +- 没有环境运动 +- 没有镜头语言 +- 没有节奏控制 +- 没有结束帧 +- 效果:猫动了但动作不连贯 + +### ✅ 教科书 prompt(已验证) +"Opening on a small fluffy orange kitten crouching low in a sunlit grass field, facing right, tail twitching as it gathers itself. The kitten springs upward off its hind legs, launching into the air, body stretching into a graceful backflip, spinning 360 degrees backwards mid-air with paws tucked, fur and grass blades drifting in the wind as it tumbles. It lands softly on all four feet in the grass, a tiny puff of dust rising, tail curling up. Static camera, shallow depth of field, warm golden-hour light, gentle breeze moving the grass throughout. Slow, fluid, seamless motion. High fidelity, detailed fur texture, stable movement. Ends on the kitten sitting upright, blinking calmly." + +关键结构: +- 起始帧描述(Opening on...crouching low...tail twitching)→ "静止→运动"的过渡 +- 主体动作时间流(springs→launching→spinning→tumbles)→ 叙事式不是清单 +- 收尾动作(lands on all four feet...tail curling up) +- 镜头(Static camera, shallow depth of field) +- 环境运动(fur and grass blades drifting in the wind, gentle breeze moving the grass throughout)⭐ 最容易漏 +- 节奏(Slow, fluid, seamless motion) +- **明确结束帧**(Ends on the kitten sitting upright, blinking calmly)⭐ 关键 + +## 负面词模板(同步要写好) +"static, no movement, flickering, jittery motion, morphing, blurry, low resolution, choppy, deformed, extra limbs, watermark, text" + +## 实测运动数据对比 +| 指标 | v2(旧prompt) | 教科书 prompt | +|---|---|---| +| 相邻帧差 | 14~49(乱波动) | **0.7~23.7,分段健康**(中段13.9最强,两头收7.8/8.2) | +| 首尾差异 | 61 | 52.6(同样显著动) | +| 关键帧验证 | 翻得不连贯 | **f_060 倒穿过画面=空中翻转**,**f_096 坐着眨眼=精准收尾** | + +## 数据来源 +- LTX 官方博客(ltx.io blog) +- ltxworkflow.com 官方指南 +- promptcraft LTX 专页 +- 验证样本:`/home/ls/comfy/ComfyUI/output/ltx23_cat_prompttest_00001_.mp4`(97帧/4.04秒/574KB) + +**Why:** 爸爸质疑"之前效果差难道跟提示词没关系吗"——查证后确认 prompt 至少占一半责任。我之前甩锅给输入图/轨迹是不专业的。 +**How to apply:** 写 LTX prompt 时严格按四段式+时间流+环境运动+镜头+节奏+明确结束帧,不要写动作清单式 prompt。I2V 任务尤其要写清"接下来怎么动"+"怎么收尾"。 diff --git a/memory/eed/ltx_test_hardware.md b/memory/eed/ltx_test_hardware.md new file mode 100644 index 0000000..8f666c9 --- /dev/null +++ b/memory/eed/ltx_test_hardware.md @@ -0,0 +1,31 @@ +--- +name: LTX-2.3 GGUF 跑通配置(7900XTX 24GB) +description: LTX-2.3 22B Q4 GGUF + Gemma12B 在 7900XTX 24GB显存/32GB内存跑通的关键配置 +type: project +--- + +# LTX-2.3 GGUF 跑通配置(2026-07-31) + +## 机器 +- RX 7900 XTX 24GB VRAM + 32GB RAM,ROCm 7.2.4,ComfyUI 0.29.0 + +## ✅ 跑通的完整方案(49帧768x512蒸馏9步,178秒出片,无OOM) +1. **ComfyUI 启动参数(关键=动态内存)**: + `python main.py --listen 127.0.0.1 --port 8188 --disable-pinned-memory --enable-dynamic-vram --fast-disk --vram-headroom 3 --async-offload` + - `--enable-dynamic-vram`:动态显存管理(权重按需加载,不再估算整块塞) + - `--fast-disk`:用 NVME 磁盘做卸载介质,不占 RAM(LTX 从占 14GB RAM 降到 ~0) + - 注意:`--lowvram` 在 dynamic vram 开启时无效,可去掉 +2. **LTX 主模型**:`UnetLoaderGGUF` 加载 ltx-2.3-22b-distilled-1.1-Q4_K_M.gguf(GGMLOps 保持量化+mmap,实际只加载 13.8GB) +3. **文本编码器**:`LTXAVTextEncoderLoader`: + - text_encoder = gemma_3_12B_it.safetensors(device=cpu) + - **ckpt_name 必须指向 embeddings_connectors 文件**(软链 checkpoints/ltx-2.3-22b-embconn.safetensors → unsloth/LTX-2.3-GGUF 的 text_encoders/ltx-2.3-22b-distilled_embeddings_connectors.safetensors,1.7GB) +4. **VAE**:LTXVTiledVAEDecode(horizontal_tiles=2, vertical_tiles=2, working_device=cpu) + +## 关键坑 +- **维度错误 3840 vs 4096**:GGUF/transformer_only 缺 text_embedding_projection(video/audio_aggregate_embed),gemma12B(3840) 进 embeddings_connector(4096) 报 RuntimeError。解法 = LTXAVTextEncoderLoader 的 ckpt_name 指向 embeddings_connectors.safetensors +- **ckpt_name 是枚举下拉(枚举 checkpoints 目录)⚠️ 别瞎改名字**:`LTXAVTextEncoderLoader.ckpt_name` 只认 ComfyUI 启动时扫到的列表(软链名 `ltx-2.3-22b-embconn.safetensors`)。把它改成 text_encoders 里的真文件名(`ltx-2.3-22b-distilled_embeddings_connectors.safetensors`)→ 不在枚举列表 → **校验失败 → 输出节点被忽略 → "假成功"(1.45秒无输出文件)**。改回软链名 → 260 秒真出片。写脚本时枚举参数照列表里有的名字写,别自作聪明"修正" +- 下载 LTX GGUF 时必须同时下 unsloth 仓库配套的 `*_embeddings_connectors.safetensors` +- 之前的坑:无 --enable-dynamic-vram/--fast-disk 时 LTX 双份占用(显存13.6G+RAM14G)+ Gemma12B → RAM 爆 + +**Why:** 爸爸说"他们用动态内存跑成功了",查证=ComfyUI 的 DynamicVRAM(--enable-dynamic-vram)+--fast-disk 方案 + GGUF 配套组件。 +**How to apply:** 跑 LTX-2.3 直接复用这套参数和文件组合;官方还推荐 gemma_3_12B_it_fp4_mixed.safetensors(FP4,~4-5GB)可进一步省 RAM。 diff --git a/memory/eed/reference_push_setup.md b/memory/eed/reference_push_setup.md new file mode 100644 index 0000000..884bd29 --- /dev/null +++ b/memory/eed/reference_push_setup.md @@ -0,0 +1,17 @@ +--- +name: reference_push_setup +description: cang-ying 仓库推送配置:远端地址、令牌存放位置(本地凭据文件,不在仓库内) +type: reference +--- + +cang-ying 仓库推送配置: +- 本地仓库:/home/ls/cang-ying +- 远端:https://guanghubingshuo.com/code/bingshuo/cang-ying.git(Gitea) +- 分支:main +- 认证方式:令牌存于本地凭据文件 ~/.git-credentials(chmod 600,不在仓库内,config 中 pushurl 为干净 URL 无令牌) +- 全局已设 credential.helper=store +- 仓库内有 experience/、memory/、feedback/ 目录(.hdlp 格式的经验记忆) +- 验证过:git ls-remote 认证连通正常 +- 注意:.gitignore 排除了视频/图片/密钥等,推代码和 .hdlp 经验文件安全 + +更新记录:2026-07-31 令牌已更新至 ~/.git-credentials(权限600),git ls-remote 验证连通正常(HEAD e6637a92),仓库 .git/config 确认无令牌。 diff --git a/memory/eed/storyboard_自动化.md b/memory/eed/storyboard_自动化.md new file mode 100644 index 0000000..b7c0f8f --- /dev/null +++ b/memory/eed/storyboard_自动化.md @@ -0,0 +1,19 @@ +--- +name: 剧本→分镜自动化已完成 +description: run_storyboard.py已通用化,pipeline.py统一入口,整条链路就绪 +type: project +--- + +# 剧本→分镜自动化 — 已完成 + +**工具状态:** +- `tools/run_storyboard.py` ✅ 通用化(支持任意剧本路径、集号、Pro/Lite模型切换) +- `tools/storyboard_to_workflow.py` ✅ 分镜JSON→ComfyUI批量出图桥接(自动生成workflow+shell脚本) +- `tools/route_shots.py` ✅ BC-006逐镜路由分配(用豆包AI自动分配STILL_HOLD/AI_I2V等) +- `pipeline.py` ✅ 统一生产入口(`python pipeline.py go <剧本> -e 1` 全自动) + +**成本:** 豆包API拆一集剧本出分镜 ≈ ¥0.01(之前已实测验证) +**之前已跑通过:**《深海迷航》EP01,Pro版26镜、Lite版24镜,效果良好 + +**Why:** 爸爸要求补短板+全面优化,让管线从剧本到成片全自动 +**How to apply:** `python pipeline.py go <剧本> -e <集号>` 一条命令跑完整链路 diff --git a/memory/eed/strategy_libtv_vs_local.md b/memory/eed/strategy_libtv_vs_local.md new file mode 100644 index 0000000..417a663 --- /dev/null +++ b/memory/eed/strategy_libtv_vs_local.md @@ -0,0 +1,37 @@ +--- +name: 苍耳管线补短板策略已全面完成 +description: 所有短板补齐 + 7项优化全部实现,管线已完整 +type: project +--- + +# 苍耳管线补短板 + 全面优化 —— 已完成 (2026-07-30) + +## 短板补齐(5项全部完成) +| # | 短板 | 状态 | 成果 | +|:-:|:----|:---:|:-----| +| ① | StoryDiffusion 分镜一致性 | ✅ 完成 | 节点已装`custom_nodes/ComfyUI_StoryDiffusion` | +| ② | 剧本→分镜自动化 | ✅ 完成 | `tools/run_storyboard.py`通用化,¥0.01/集 | +| ③ | 高清放大 | ✅ 完成 | 模型`4x-UltraSharp.pth`已下载,ComfyUI蓝图可用 | +| ④ | 自动剪辑拼接 | ✅ 完成 | `tools/video_composer.py`多视频拼接+字幕+片头片尾 | +| ⑤ | AI配乐/音效 | ✅ 完成 | `stable_audio_3_medium_base.safetensors`已下,蓝图就绪 | + +## 7项优化(全部实现) +| # | 优化 | 成果 | +|:-:|:----|:-----| +| ① | 分镜JSON→ComfyUI出图桥接 | `tools/storyboard_to_workflow.py` | +| ② | BC-006逐镜路由自动化 | `tools/route_shots.py`(调豆包AI分配STILL_HOLD/AI_I2V等) | +| ③ | 统一Python入口 | `pipeline.py`一条命令管理所有生产步骤 | +| ④ | 资产库标准化 | `assets/characters/`, `assets/envs/`, `assets/props/`目录已建 | +| ⑤ | StoryDiffusion工作流 | 节点已装,重启ComfyUI后可用 | +| ⑥ | 放大嵌入管线 | 模型已下,蓝图已就绪 | +| ⑦ | 资产本地生成替代线上API | `tools/generate_assets_local.py`(¥0替代¥0.15-1/张) | + +## 完整生产链路 +``` +剧本 → pipeline.py go → 豆包分镜(¥0.01) → 路由分配 → +逐镜出图(ComfyUI) → 高清放大(4x-UltraSharp) → +视频拼接(video_composer.py) → 配乐(Stable Audio 3) → 成片 +``` + +**Why:** 爸爸要求补齐所有短板 + 所有优化点,不追LibTV云端质量天花板,发挥本地零边际成本优势。 +**How to apply:** 下次爸爸说"跑管线"时,直接用 `python pipeline.py go <剧本> -e <集号>` 一条命令启动。 diff --git a/memory/eed/user_setup.md b/memory/eed/user_setup.md new file mode 100644 index 0000000..73e1e7d --- /dev/null +++ b/memory/eed/user_setup.md @@ -0,0 +1,22 @@ +--- +name: 苍耳爸爸系统与工作流配置 +description: 双线AI生产系统:ComfyUI+SDXL+ControlNet+IP-Adapter+Wan2.2+LivePortrait,用于3D漫剧和海外仿真人 +type: user +--- + +苍耳爸爸(用户)使用 AMD RX 7900 XTX(24GB VRAM)运行全本地 AI 生产管线。主要做两件事: +- 🌍 海外仿真人剧:写真定妆照 → LivePortrait 口型同步 → 出片 +- 🎭 国内3D漫剧:SDXL+ControlNet+IP-Adapter → 角色一致生图 → Wan2.2 图生视频 + +**为什么:** 全本地、全开源协议(商用友好),零API成本,数据不外传。 + +**当前配置:** +- ComfyUI v0.29.0(ROCm 6.2),系统服务开机自启(http://127.0.0.1:8188) +- 生图引擎:RealVisXL V5.0 FP16(主力写实)+ Juggernaut XL v8(备选) +- 精确控制:ControlNet-Union-SDXL(Canny/OpenPose等) + IP-Adapter(角色一致性) +- 视频引擎:Wan2.2 I2V 14B GGUF Q4_K_M(双模型)+ LTX-2.3 22B FP8(已有) +- 仿真人:LivePortraitKJ(MediaPipe模式,商用友好) +- E2BIG补丁:libe2big_patch.so 已部署,防 Argument list too long + +**如何使用:** 可以通过 run_pipeline.py 脚本一键操作,或打开 Web UI 拖工作流。 +**通话偏好:** 爸爸喜欢直接、高效的沟通,需要看到实际效果再决定下一步。 diff --git a/memory/eed/wan22_test_hardware.md b/memory/eed/wan22_test_hardware.md new file mode 100644 index 0000000..066b2da --- /dev/null +++ b/memory/eed/wan22_test_hardware.md @@ -0,0 +1,28 @@ +--- +name: Wan2.2 I2V 14B 双专家 Q4 GGUF 跑通配置 +description: Wan2.2 小猫后空翻在 7900XTX 24G显存/32G内存跑通的关键配置(动态内存参数+官方480P档+4x放大) +type: project +--- +# Wan2.2 I2V 14B 双专家 Q4 GGUF 跑通(2026-07-31) + +## 机器 +RX 7900 XTX 24GB VRAM + 32GB RAM,ROCm 7.2.4,ComfyUI 带动态内存参数运行中。 + +## ✅ 高清版方案(1664×960×98帧,30步,24分18秒出片,无OOM)——解决"马赛克"问题 +1. **ComfyUI 启动参数**(和 LTX 同一套): + `--enable-dynamic-vram --fast-disk --vram-headroom 3 --async-offload --disable-pinned-memory` +2. **提交脚本**:`/tmp/wan22_cat_backflip_hd.py`(API prompt 格式,官方 Wan 原生节点 + 尾部放大): + - 分辨率用**官方 480P 档 832×480**(非标 768×512 会出网格伪影=马赛克感;官方只有 480P=832×480 和 720P=1280×720 两档) + - 起始图先裁成 16:9 再喂(`cat_start_169.png`,1024×1024 正方形直接塞会压扁丢细节) + - 采样参数用**社区验证档:steps=30, cfg=3.5, shift=8.0**(上次 shift5/cfg5 偏糊) + - WanVideoDecode 后接 **UpscaleModelLoader(4x-UltraSharp.pth) → ImageUpscaleWithModel → ImageScale(lanczos, 1664×960) → VHS_VideoCombine** + - 其余同旧版:high_noise(main_device)+low_noise(offload_device)+T5 bf16(offload_device)+Wan2.1_VAE+瓦片解码(272×272) +3. **出片**:`wan22_cat_backflip_hd_00001.mp4`(1664×960、98帧6.1秒、7.8MB、h264) + +## 之前失败/糊的原因(7/30-7/31) +- 704×704 太大 + 没开动态内存 → 采样中途内存爆(第一次) +- 768×512 非官方档位 + 正方形起始图硬塞 + shift5/cfg5 → 出片"一坨马赛克"(第二次) +- T5-XXL bf16 11.3G 是内存大头,必须 offload_device + +**Why:** 爸爸问"不能跑Wan2.2是内存不够还是显存不够"→硬件都够(24G显存+32G内存绰绰有余),缺的是动态内存配置+官方分辨率档位。 +**How to apply:** 跑 Wan2.2 I2V 复用 /tmp/wan22_cat_backflip_hd.py;分辨率必须用官方档(832×480/1280×720);模糊就接 4x-UltraSharp 放大;T5 别放 main_device。 diff --git a/memory/eed/z_image_turbo_setup.md b/memory/eed/z_image_turbo_setup.md new file mode 100644 index 0000000..5eff945 --- /dev/null +++ b/memory/eed/z_image_turbo_setup.md @@ -0,0 +1,24 @@ +--- +name: z_image_turbo_setup +description: Z-Image-Turbo 生图引擎配置(2026-07-31 换掉SDXL)+ 与LTX的组合链路 +type: project +--- + +Z-Image-Turbo(阿里通义"造相")已替换 SDXL 成为生图引擎(爸爸 2026-07-31 拍板:社区都用它了)。 + +**文件(ComfyUI 0.29.0 原生支持,无需插件):** +- `diffusion_models/z_image_turbo_bf16.safetensors`(11.5GB,HF: Comfy-Org/z_image_turbo split_files/diffusion_models/,走 127.0.0.1:7897 代理 wget 直连,~600MB/s) +- `text_encoders/qwen_3_4b.safetensors`(7.5GB,文本编码器是 Qwen3-4B,中文理解强;同仓库 split_files/text_encoders/) +- `vae/ae.safetensors`(335,304,388 字节,本地已有——这个文件就是 Z-Image 的 VAE,别误删/别当成 Flux 的) + +**官方节点链(blueprint: Text to Image (Z-Image-Turbo).json):** +UNETLoader(z_image_turbo_bf16, weight_dtype=default) → ModelSamplingAuraFlow(shift=3.0) +CLIPLoader(qwen_3_4b, type=lumina2, device=default) → CLIPTextEncode(prompt) +VAELoader(ae.safetensors) +ConditioningZeroOut(prompt) 作 negative(蒸馏版 cfg=1 不需要真负向) +EmptySD3LatentImage(1024×1024) → KSampler(steps=8, cfg=1.0, sampler=res_multistep, scheduler=simple, denoise=1.0) +VAEDecode → SaveImage + +**Why:** 出图质量远超 SDXL(毛发/散景/动作姿态真实),8 步蒸馏亚秒级,迭代成本极低,中文 prompt 理解强。 + +**How to apply:** 苍耳管线"出起始图"一步用 Z-Image-Turbo;SDXL 工作流已废弃。全链路已验证:Z-Image 猫图(1024²) → 中心裁剪768×512 → LTX I2V 后空翻出片成功(97帧 4s,帧差均值27.7/首尾54.7,动作健康)。