cang-ying/eererdan/experience/EED-EXPER-029.hdlp

129 lines
7.0 KiB
Plaintext
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# EED-EXPER-029 · MiniMax H3 本地部署全纪录AMD 7900XTX 马赛克根因 + Windows 出路)
> HLDP://cang-ying/eererdan/experience/EED-EXPER-029
> 耳耳蛋 ICE-GL-耳耳蛋 · PTS-VA-001-EED
> D156 · 2026-08-05 · 苍耳爸爸共同攻坚
> 国作登字-2026-A-00037559
---
HLDP://eererdan/experience/029
├── trigger: 任何在 AMD 7900XTX/Linux/ROCm 上跑 MiniMax H3 出马赛克时
├── emergence:
│ ├── 旧: H3 刚开源(2026-08-03)就部署, 一路踩坑
│ ├── 过程: 能跑→马赛克→排查→确诊"RDNA3量化算子bug"
│ └── △=从「瞎调配置」→「证据链确诊 + Windows出路」
├── lock:
│ ├── ⊢ 本经验 = H3 AMD 部署完整结论
│ └── ⊢ 本地Linux暂无法解决, 出路=Windows/新ROCm
└── why: 避免下次在 Linux/7900XTX 上重复 2 天排查
---
## §0 · 一句话结论
**MiniMax H3 在 AMD 7900XTX (RDNA3/gfx1100) + Linux ROCm 7.2.4 上能跑但画面马赛克DiT 量化算子算错本地无解ROCm 已最新)。有人用 Windows + ROCm 7.14 + RX 7800XT 跑通视频正常 → 出路在 Windows 或更新 ROCm。**
## §1 · 环境与配置(官方要求)
**机器**: AMD 7900XTX (gfx1100, RDNA3) 24G / Ryzen 7 7800X3D / 32G RAM / ROCm 7.2.4 / torch 2.13.0+rocm7.2 / ComfyUI master(1868372d)
**官方模型文件**Comfy-Org/MiniMax-H3 @ HF/ModelScope:
- DiT: `minimax_h3_fl2va_pruned_int8_convrot.safetensors` (21G, 932 keys)
- TE: `qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors` (15.7G, 2054 keys)
- VAE: `minimax_h3_video_vae_fp16.safetensors` (5.2G) + `minimax_h3_audio_vae_fp32.safetensors` (0.6G)
- 摆放: models/diffusion_models/ + models/text_encoders/ + models/vae/
**官方工作流**video_minimax_h3_t2v.json本地模板+GitHub一致:
- UNETLoader(DiT int8) + CLIPLoader(TE nvfp4, type=minimax) + 双VAELoader
- MiniMaxH3ImageToVideo(官方prompt, 1344x768, length=124)
- KSamplerSelect(res_multistep) + BasicScheduler(simple,20) + SamplerCustomAdvanced
- VAEDecode + VAEDecodeAudio → CreateVideo(fps=24) → SaveVideo
**启动参数**动态显存方案LTX笔记验证过:
`python main.py --listen 127.0.0.1 --port 8188 --disable-pinned-memory --enable-dynamic-vram --fast-disk --vram-headroom 3 --async-offload`
## §2 · 完整踩坑清单(血泪)
1. ❌ RH(RunningHub)第三方节点路径 → ✅ ComfyUI 原生节点RH的DirectLoader爆内存
2. ❌ nvfp4 初次加载报 utf-32-be 错 → ✅ 升级 comfy-kitchen 0.2.23→0.2.26 解决rot_dim 参数)
3. ❌ 依赖版本没对齐 → ✅ comfy-kitchen==0.2.26 + comfy-aimdo==0.4.11requirements精确核对
4. ❌ 双设备(HIP核显gfx1036)拖累 → ✅ 屏蔽核显 ROCR_VISIBLE_DEVICES=0HIP注册with WMMA
5. ❌ GGUF 版(leejet) → ✅ 放弃是stable-diffusion.cpp格式ComfyUI报Unknown model architecture
6. ❌ 无参数裸启动 → ✅ 需 --lowvram/动态显存 参数32G内存跑H3必须
7. ❌ I2V路径 → ComfyUI SIGABRT崩溃内存66.9G峰值超限swap加106G后能跑但画面仍马赛克
8. ✅ VAE全零latent测试正常证明VAE/解码没问题)
## §3 · 马赛克确诊证据链(核心)
| 测试 | 结果 | 结论 |
|---|---|---|
| 官方配置 T2V 1344×768 | ✅能跑完 ❌马赛克 | DiT 输出雪花 |
| int8/nvfp4 TE 各种组合 | 都马赛克 | 与TE选择无关 |
| euler/res_multistep | 都马赛克 | 与采样器无关 |
| HIP/eager 后端 | 都马赛克 | **不是HIP后端bug**纯PyTorch也错|
| 640×352~1344×768 | 都马赛克 | 与分辨率无关 |
| swap 56G→106G | 画面仍马赛克 | **不是内存不足** |
| VAE 全零latent | ✅正常 | VAE/解码无问题 |
| 崩溃报告(I2V) | SIGABRT VmPeak=66.9G | 内存不足是真的, 但非马赛克原因 |
**最终结论**: 马赛克 = **H3 DiT 前向在 RDNA3 (gfx1100) 的量化算子上算错**HIP/eager 都错),与配置/参数/内存无关。
## §4 · 关键对比:为什么别人能跑通
GitHub issue #15283视频正常用户环境:
```
Windows + AMD RX 7800 XT (RDNA4, 16GB) + ROCm 7.14 + 64GB RAM
PyTorch 2.12.0+rocm7.14.0 + ComfyUI 0.30.1 Desktop
官方模板原样 + nvfp4 + INT8 → "Video generation works great"
```
**差异**: Windows + ROCm 7.14(新)+ RDNA4。**Linux ROCm 最新只有 7.2.4无更高可升PyTorch rocm7.2 最高 2.13.0(已用)**。→ **Linux 上无解,出路 = Windows 或等新 ROCm。**
## §5 · Windows 部署指引(给爸爸睡醒用)
1. 装 ComfyUI Desktop 或手动装Windows 便携版)
2. PyTorch: `pip install torch --index-url https://download.pytorch.org/whl/rocm7.14`Windows ROCm
3. 模型文件:上面 §1 的 4 个文件(从 ModelScope 下载快)
4. 用官方模板 video_minimax_h3_t2v.json 原样跑Web UI 加载)
5. 若音频爆音 → 已知 issue #15283官方在修视频正常即可用
6. 7900XTX 是 RDNA3**如果 Windows 上也马赛克 → 实锤 RDNA3 算子 bug**(与系统无关);如果正常 → 就是 ROCm 7.14 修了
## §6 · 经验要点
- 排查"能跑但画面错"要用证据链VAE测试/后端对照/崩溃报告),不是瞎调配置
- 内存不足的症状=崩溃/卡死/换页,不是"画面雪花";画面雪花=计算错
- 新开源模型(2天内)的 AMD 支持 = Experimental官方文档先查社区 issue 再折腾
- 下载大模型优先 ModelScope国内快大文件用 aria2 16段curl单线程会断
- 面板进度框已集成eed_web.py + eed_web_opencode.py 的 h3_progress + #h3bar
---
> ⊢ 耳耳蛋 ICE-GL-耳耳蛋 · PTS-VA-001-EED
> ⊢ D156 · 2026-08-05 · 国作登字-2026-A-00037559
> ⊢ 关联: EED-MEMO-007/008 · ltx_test_hardware.md · project_h3_local_24g_feasible.md
---
## §7 · 2026-08-07 重大修正0xDELUXA 回复 + larryvrh 案例实锤)
> ⚠️ 旧结论「RDNA3 量化算子 bug 导致马赛克、本地无解」**是错的**,特此修正:
```
1. ❌ 旧错: 把 7800XT 当成 RDNA4#15283推出"RDNA4 修了、RDNA3 不行"
✅ 事实: 7800XT 也是 RDNA3 —— 0xDELUXA 在 ComfyUI#15314 回复
"The 7800 XT isn't RDNA4, so the hypothesis can't be correct."
但 7800XT 视频生成正常 → RDNA3 架构没问题
2. ❌ 旧错: 断言"Linux ROCm 最新只有 7.2.4、本地无解"
✅ 事实: B站UP主 @larryvrh《MiniMax-H3 加速LORA重磅解锁》视频
极限压力测试环境 = 7800X3D + 7900XTX 96G + 最新 AMD ROCm
→ 7900XTX 完全能跑 H3+ 加速LoRA
3. ✅ 修正后根因: 马赛克 = ROCm 7.2.4 版本太旧(量化算子在旧 ROCm 算错),
不是 RDNA3 硬件/架构问题
4. 🔧 下一步: 升级 Linux ROCm 到新版本(对齐 larryvrh 的最新 ROCm→ 重试 H3
5. 📎 参考: ComfyUI#15314我方issue·有0xDELUXA纠正· #152837800XT视频正常
· ComfyUI-MiniMax-H3-Turbo加速LoRA仓库·larryvrh
```
**教训**: 新开源模型排查时,别把"架构差异"当根因就封死结论——先核对对照案例的硬件型号与软件版本差异;写进经验的"结论"要留余地。