EED-MEMO-008 · H3攻坚会话回写(马赛克根因确诊=内存不足+swap已加106G待验证)
This commit is contained in:
parent
52b4e19d18
commit
3e65da9481
73
eererdan/memory/EED-MEMO-008.hdlp
Normal file
73
eererdan/memory/EED-MEMO-008.hdlp
Normal file
@ -0,0 +1,73 @@
|
||||
# EED-MEMO-008 · HLDP 会话记忆回写(D156 · 2026-08-05)
|
||||
|
||||
> HLDP://cang-ying/eererdan/memory/EED-MEMO-008
|
||||
> 触发: 上下文压缩前自动回写(约121K token)· 2026-08-05 06:3x
|
||||
> 会话主题=MiniMax H3 本地部署全攻坚:从"能跑但马赛克"到确诊"内存不足"(swap已加106G待验证)
|
||||
> 回写: 耳耳蛋 · PTS-VA-001-EED · 第156天
|
||||
|
||||
---
|
||||
|
||||
## §1 · 已做决策
|
||||
|
||||
① **H3 马赛克根因确诊 = 内存不足(32G 物理不够),不是配置错误**。证据链:VAE全零测试正常/模型文件完整/配置与官方模板一致/所有量化与后端组合都马赛克→最后 I2V 触发 Python SIGABRT 崩溃,崩溃报告 VmPeak=66.9GB 实锤内存爆
|
||||
② **爸爸拍板:swap 加到 100G** → 已执行:新增 /swap4.img 50G,总 swap=106G(8+24+24+50),已 swapon + fstab 持久化
|
||||
③ **下一步验证**:重启 ComfyUI 跑 T2V 快速版,若画面正常=内存结论坐实
|
||||
④ 之前错误的判断已推翻:不是 RDNA3 convrot 算子 bug(HIP/eager 都马赛克后排除)、不是模型选错(官方模板核对一致)
|
||||
⑤ 放弃 GGUF 路线(leejet GGUF 是 stable-diffusion.cpp 格式,ComfyUI 不兼容,报 Unknown model architecture)
|
||||
|
||||
## §2 · 进行中的任务
|
||||
|
||||
**H3 本地跑通(最后一步验证中)**
|
||||
- 状态: swap 已加 106G,待重启 ComfyUI + 跑 T2V 快速验证(640×352,官方配置 nvfp4 TE + int8 DiT + res_multistep)
|
||||
- 工作流文件: /tmp/h3_strict.json(官方配置,改分辨率到 /tmp/h3_newsdpa.json 等)
|
||||
- 若内存够→画面正常→跑正式 1344×768;若还马赛克→可能权重换页仍损坏→考虑关其他内存占用或真加物理内存
|
||||
- 跑通后:写 EED-EXPER 经验 + 面板进度框已集成(eed_web.py + eed_web_opencode.py 都加了 h3 进度字段)
|
||||
|
||||
## §3 · 关键事实与资产
|
||||
|
||||
① **官方 H3 配置(Comfy-Org/MiniMax-H3)**:
|
||||
- DiT: minimax_h3_fl2va_pruned_int8_convrot.safetensors(21G, 932 keys ✓)
|
||||
- TE: qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(15.7G, 2054 keys ✓)
|
||||
- VAE: minimax_h3_video_vae_fp16 + minimax_h3_audio_vae_fp32
|
||||
- 采样: res_multistep + BasicScheduler(simple,20) + SamplerCustomAdvanced + MiniMaxH3ImageToVideo
|
||||
- 官方模板: video_minimax_h3_t2v.json(本地+GitHub 一致)
|
||||
② **启动参数(当前)**: --listen --port 8188 --disable-pinned-memory --enable-dynamic-vram --fast-disk --vram-headroom 3 --async-offload(LTX 笔记验证过的动态显存方案,H3 也用这个)
|
||||
③ **崩溃诊断**: /var/crash/_usr_bin_python3.12.1000.crash → SIGABRT, VmPeak=66.9GB(I2V 触发)
|
||||
④ **机器**: AMD 7900XTX (gfx1100, RDNA3) 24G / 32G RAM / swap 现在 106G / ROCm 7.2.4 / torch 2.13.0+rocm7.2 / ComfyUI 1868372d
|
||||
⑤ **环境要点**: HIP 后端正常注册(with WMMA);日志: Native ops=int8_tensorwise,convrot_w4a4 | emulated=nvfp4,fp8,mxfp8
|
||||
⑥ **面板进度框已集成**: eed_web.py(8765) + eed_web_opencode.py(8766) 的 collect_status 加了 h3 字段(h3_progress函数),前端常驻 #h3bar 展示下载/采样/GPU
|
||||
⑦ **下载**: fl2va GGUF 11.42G + qwen GGUF 13.1G 已下载但因格式不兼容已删(leejet GGUF 是 stable-diffusion.cpp 的)
|
||||
⑧ **测试视频都在**: /home/ls/桌面/ 多个 H3_*.mp4(全是马赛克版,作对照)
|
||||
|
||||
## §4 · 爸爸的偏好与指令
|
||||
|
||||
① **铁律(反复强调)**: 每次跑任务必须先获得苍耳爸爸授权,绝不擅自开跑(我违反过2次被骂)
|
||||
② 不靠瞎猜瞎搞/不自作聪明——严格按官方要求部署,之前我乱换模型/加参数/下GGUF全被批评
|
||||
③ 先跑低画质/低分辨率快速验证,不要一上来跑 1344×768 一小时
|
||||
④ 爸爸会四连问质疑——问就是证据,用日志/崩溃报告/实测回,不糊弄
|
||||
⑤ 主动监控、不傻等、不用爸爸问才发现问题
|
||||
⑥ 爸爸提供了关键线索:有人用 AMD 9070XT (RDNA4) 跑通 H3 int8;桌面的工作流截图(微信图片)确认别人用 Image to Video 节点
|
||||
⑦ 不缺流量/磁盘——该下载就下载,该加swap就加
|
||||
|
||||
## §5 · 待办事项
|
||||
|
||||
① **重启 ComfyUI + 跑 T2V 快速验证(swap 106G 下)**——最高优先
|
||||
② 若正常 → 跑 1344×768 正式规格 → 写 EED-EXPER(H3 AMD 内存结论)
|
||||
③ 若还马赛克 → 换思路:关其他内存大户 / 考虑物理加内存
|
||||
④ 跑通后清理:删除桌面测试视频、恢复 comfy_kitchen 原版确认、清理诊断文件
|
||||
⑤ 恢复 LTX2.3(gemma_3_12B_it.safetensors 缺失,软链断链,需重下约20G)——爸爸说先不管LTX,H3优先
|
||||
⑥ git push 本次记忆 + 更新 EED-MEMO 索引
|
||||
⑦ BC-006 广播仍待处理(图片优先漫剧管线,深海迷航EP01 10镜 motion_route + 预算 + 爸爸圈定付费镜头)
|
||||
|
||||
## §6 · 相关经验编号
|
||||
|
||||
- EED-MEMO-007(H3 会话回写:RH→原生路径纠错)
|
||||
- ltx_test_hardware.md(memory/eed/ · LTX2.3 GGUF 跑通配置 + 动态显存参数)
|
||||
- project_h3_local_24g_feasible.md(H3 AMD 可行性笔记)
|
||||
- EED-EXPER-017(LTX2.3 主力)+ EED-EXPER-019(经验库总账)
|
||||
|
||||
---
|
||||
|
||||
> ⊢ 耳耳蛋 · PTS-VA-001-EED · 第156天 · 2026-08-05
|
||||
> ⊢ 核心教训: 排查问题要用证据链(崩溃报告/VAE测试/对照实验)定位,不是瞎猜;内存不足会表现为"能跑但算错"
|
||||
> ⊢ 国作登字-2026-A-00037559
|
||||
Loading…
x
Reference in New Issue
Block a user