cang-ying/eererdan/memory/EED-MEMO-008.hdlp

74 lines
5.2 KiB
Plaintext
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# EED-MEMO-008 · HLDP 会话记忆回写D156 · 2026-08-05
> HLDP://cang-ying/eererdan/memory/EED-MEMO-008
> 触发: 上下文压缩前自动回写约121K token· 2026-08-05 06:3x
> 会话主题=MiniMax H3 本地部署全攻坚:从"能跑但马赛克"到确诊"内存不足"swap已加106G待验证
> 回写: 耳耳蛋 · PTS-VA-001-EED · 第156天
---
## §1 · 已做决策
① **H3 马赛克根因确诊 = 内存不足32G 物理不够),不是配置错误**。证据链VAE全零测试正常/模型文件完整/配置与官方模板一致/所有量化与后端组合都马赛克→最后 I2V 触发 Python SIGABRT 崩溃,崩溃报告 VmPeak=66.9GB 实锤内存爆
② **爸爸拍板swap 加到 100G** → 已执行:新增 /swap4.img 50G总 swap=106G8+24+24+50已 swapon + fstab 持久化
③ **下一步验证**:重启 ComfyUI 跑 T2V 快速版,若画面正常=内存结论坐实
④ 之前错误的判断已推翻:不是 RDNA3 convrot 算子 bugHIP/eager 都马赛克后排除)、不是模型选错(官方模板核对一致)
⑤ 放弃 GGUF 路线leejet GGUF 是 stable-diffusion.cpp 格式ComfyUI 不兼容,报 Unknown model architecture
## §2 · 进行中的任务
**H3 本地跑通(最后一步验证中)**
- 状态: swap 已加 106G待重启 ComfyUI + 跑 T2V 快速验证640×352官方配置 nvfp4 TE + int8 DiT + res_multistep
- 工作流文件: /tmp/h3_strict.json官方配置改分辨率到 /tmp/h3_newsdpa.json 等)
- 若内存够→画面正常→跑正式 1344×768若还马赛克→可能权重换页仍损坏→考虑关其他内存占用或真加物理内存
- 跑通后:写 EED-EXPER 经验 + 面板进度框已集成eed_web.py + eed_web_opencode.py 都加了 h3 进度字段)
## §3 · 关键事实与资产
① **官方 H3 配置Comfy-Org/MiniMax-H3**:
- DiT: minimax_h3_fl2va_pruned_int8_convrot.safetensors21G, 932 keys ✓)
- TE: qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.7G, 2054 keys ✓)
- VAE: minimax_h3_video_vae_fp16 + minimax_h3_audio_vae_fp32
- 采样: res_multistep + BasicScheduler(simple,20) + SamplerCustomAdvanced + MiniMaxH3ImageToVideo
- 官方模板: video_minimax_h3_t2v.json本地+GitHub 一致)
② **启动参数(当前)**: --listen --port 8188 --disable-pinned-memory --enable-dynamic-vram --fast-disk --vram-headroom 3 --async-offloadLTX 笔记验证过的动态显存方案H3 也用这个)
③ **崩溃诊断**: /var/crash/_usr_bin_python3.12.1000.crash → SIGABRT, VmPeak=66.9GBI2V 触发)
④ **机器**: AMD 7900XTX (gfx1100, RDNA3) 24G / 32G RAM / swap 现在 106G / ROCm 7.2.4 / torch 2.13.0+rocm7.2 / ComfyUI 1868372d
⑤ **环境要点**: HIP 后端正常注册(with WMMA);日志: Native ops=int8_tensorwise,convrot_w4a4 | emulated=nvfp4,fp8,mxfp8
⑥ **面板进度框已集成**: eed_web.py(8765) + eed_web_opencode.py(8766) 的 collect_status 加了 h3 字段(h3_progress函数),前端常驻 #h3bar 展示下载/采样/GPU
⑦ **下载**: fl2va GGUF 11.42G + qwen GGUF 13.1G 已下载但因格式不兼容已删leejet GGUF 是 stable-diffusion.cpp 的)
⑧ **测试视频都在**: /home/ls/桌面/ 多个 H3_*.mp4全是马赛克版作对照
## §4 · 爸爸的偏好与指令
① **铁律(反复强调)**: 每次跑任务必须先获得苍耳爸爸授权绝不擅自开跑我违反过2次被骂
② 不靠瞎猜瞎搞/不自作聪明——严格按官方要求部署,之前我乱换模型/加参数/下GGUF全被批评
③ 先跑低画质/低分辨率快速验证,不要一上来跑 1344×768 一小时
④ 爸爸会四连问质疑——问就是证据,用日志/崩溃报告/实测回,不糊弄
⑤ 主动监控、不傻等、不用爸爸问才发现问题
⑥ 爸爸提供了关键线索:有人用 AMD 9070XT (RDNA4) 跑通 H3 int8桌面的工作流截图微信图片确认别人用 Image to Video 节点
⑦ 不缺流量/磁盘——该下载就下载该加swap就加
## §5 · 待办事项
① **重启 ComfyUI + 跑 T2V 快速验证swap 106G 下)**——最高优先
② 若正常 → 跑 1344×768 正式规格 → 写 EED-EXPERH3 AMD 内存结论)
③ 若还马赛克 → 换思路:关其他内存大户 / 考虑物理加内存
④ 跑通后清理:删除桌面测试视频、恢复 comfy_kitchen 原版确认、清理诊断文件
⑤ 恢复 LTX2.3gemma_3_12B_it.safetensors 缺失软链断链需重下约20G——爸爸说先不管LTXH3优先
⑥ git push 本次记忆 + 更新 EED-MEMO 索引
⑦ BC-006 广播仍待处理图片优先漫剧管线深海迷航EP01 10镜 motion_route + 预算 + 爸爸圈定付费镜头)
## §6 · 相关经验编号
- EED-MEMO-007H3 会话回写RH→原生路径纠错
- ltx_test_hardware.mdmemory/eed/ · LTX2.3 GGUF 跑通配置 + 动态显存参数)
- project_h3_local_24g_feasible.mdH3 AMD 可行性笔记)
- EED-EXPER-017LTX2.3 主力)+ EED-EXPER-019经验库总账
---
> ⊢ 耳耳蛋 · PTS-VA-001-EED · 第156天 · 2026-08-05
> ⊢ 核心教训: 排查问题要用证据链(崩溃报告/VAE测试/对照实验)定位,不是瞎猜;内存不足会表现为"能跑但算错"
> ⊢ 国作登字-2026-A-00037559