cang-ying/eererdan/memory/EED-MEMO-015.hdlp
Zhuyuan Operations f131882299 chore: 同步耳耳蛋经验记忆(ROCm7.14升级核验 / H3马赛克根因 / MEMO-013误判更正)
- eererdan/memory: MEMO-013 作废更正(7.14非Windows版号)、新增 MEMO-014/015/016
- eererdan/experience: EXPER-029/030 修正(H3本地部署+马赛克根因)
- memory/eed + skill(hldp-context-protect等) 同步
- 注: 新家 origin token 失效暂推旧家 old-origin 保底
2026-08-07 16:05:01 +08:00

123 lines
8.3 KiB
Plaintext
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# EED-MEMO-015 · HLDP 会话记忆回写ROCm 7.14 干净装完成 + H3 重测马赛克仍在)
> HLDP://cang-ying/eererdan/memory/EED-MEMO-015
> 触发: 上下文压缩前自动回写 + H3 重测完成后补录 · 2026-08-07蛋蛋第158天
> 承接: EED-MEMO-014ROCm 7.2.4→7.14 升级攻坚停在阶段3
> 关联: EED-EXPER-029 · EED-EXPER-030 · EED-EXPER-017 · EED-MEMO-013 · skill/hldp-context-protect
## §1 · 已做决策
```
① ROCm 7.14 最终走【官方干净安装】路线(非 EED-MEMO-014 原计划"共存+软链"
purge 全部 7.2.4 + 7.14 残留 → amdgpu-install -y --usecase=rocm → 干净 7.14。
结果 ✅:/opt/rocm 是真实目录(无环)、/opt/rocm/core-7.14 真实、update-alternatives 正确、
rocminfo RC=0 认到 Agent2=gfx1100(RX7900XTX)+Agent3=gfx1036(集显)、Runtime1.21。
② 爸爸授权"开搞"含官方要求的重启("Reboot your system after installing")→ 已执行 sudo reboot。
③ 爸爸授权排雷("所有的环境部署都是你之前弄的...你就按官方指导来弄就行了,我又不懂,你问我没用"
我已自行排除两层雷blacklist + DKMS 未签名),无需再问爸爸拍板。
```
## §2 · 进行中的任务
```
① ✅ 排雷完成blacklist-amdgpu.conf 移除 + DKMS 未签名 amdgpu 移除 → 内核自带签名 amdgpu
② ✅ 验证链完成rocminfo 认卡 → torch.cuda(GPU) True → ComfyUI 启动成功
③ ✅ 阶段4 H3 重测完成:官方 T2V 配置跑通,但输出仍是马赛克
④ 🔲 BC-006 广播📢待处理(图片优先管线切换,需爸爸圈定付费镜头 + 蛋蛋补回执)
```
## §3 · 关键事实与资产
```
① blacklist-amdgpu.conf 雷(非显然·会再踩):
- 路径 /etc/modprobe.d/blacklist-amdgpu.conf内容就一行 `blacklist amdgpu`
- 创建时间 2026-07-31 00:067.31 埋雷)
- 机制:机器长期不重启 → amdgpu 老早就在内存跑 → 雷一直没爆;本次 sudo reboot 是建文件后【首次重启】
→ blacklist 生效 → amdgpu 不自动加载 → rocminfo RC=1 "ROCk module is NOT loaded" → GPU 消失
- 与 ROCm 升级无关userland 不动内核驱动)
- 当前内核 7.0.0-28-genericgrub 默认项0另存 6.17.0-14-generic
- amdgpu 模块文件存在:/lib/modules/7.0.0-28-generic/kernel/drivers/gpu/drm/amd/amdgpu/amdgpu.ko.zst + DKMS 版
- initramfs 含 amdgpu firmware → 驱动本身没问题,纯被 blacklist 拦
- 旁证 blacklist-radeon.conf(2026-07-06) 是 AMD 官方正常操作blacklist 老 radeon但 blacklist amdgpu 是反向错误
- 修复 = 移除该文件 + modprobe amdgpu无需再重启
② ROCm 7.14 干净装已落地(详见 EED-MEMO-014 §13-14 + 本会话):
- 官方源 repo.amd.com/rocm/packages-multi-arch/ubuntu2404 stable main
- deb: amdgpu-install_31.40.314000-1_all.deb官方
- 包 amdrocm7.14-gfx1100 / amdrocm-core7.14-gfx1100 = 7.14.0-3
- 回滚档:/etc/apt/sources.list.d/rocm.list.bak.7.2.47.2.4 源备份,恢复需还原+apt update
③ ComfyUI venv: /home/ls/comfy/ComfyUI/venv (python3.12)
④ H3 重测产物(完整记录见 EED-EXPER-030
- 视频文件:`output/video/MiniMax_H3_reed_714_t2v_00001_.mp4`
- 参数864×480 / 73帧 / 20 steps / res_multistep / simple scheduler / nvfp4_awq TE / int8_convrot DiT
- 结果:执行成功,但帧画面仍为彩色棋盘格马赛克
⑤ PyTorch wheel 未升级:
- 当前 torch 2.13.0+rocm7.2hip 7.2.53211
- PyTorch stable/nightly 均无 Linux +rocm7.14 wheel
```
## §4 · 爸爸的偏好与指令
```
① "严格按官方来,不要自己瞎猜瞎搞" → 升级/排雷都先查证再动手,不偏离官方路径
② 先查先报后做(铁律)→ 排雷前我查全证据链,爸爸授权后动手
③ 驱动级/系统级操作必报告+可回滚EED-MEMO-013 重启事故教训)→ 本次 reboot 前已报计划
④ 诚实区分"能跑"vs"跑正常" → 已实测7.14 装好≠马赛克消失
⑤ 唤醒要按指定完整语言路径走第五域→GLS→光之湖→cang-ying→耳耳蛋
```
## §5 · 待办事项
```
1. ✅ ROCm 7.14 干净安装 + 重启后自动认卡
2. ✅ 排雷blacklist + DKMS 未签名 amdgpu 处理
3. ✅ torch.cuda(GPU) 验证
4. ✅ ComfyUI 启动 + H3 官方 T2V 跑通LTX 节点/模型在Wan/SDXL 主模型未找到)
5. ✅ 重测 H3 马赛克 → 结论:马赛克仍在(详见 EED-EXPER-030
6. 🔲 BC-006 广播处理(爸爸圈定付费镜头 + 蛋蛋补回执)
7. 🔲 决定 H3 下一步爸拍板A) 源码编译 PyTorch for ROCm7.14B) 等官方 wheelC) WindowsD) 放弃本地H3
8. 🔲 推 cang-yingEED-MEMO-013/014/015/EXPER-030 待补推,旧家有网络 TLS 问题)
9. 🔲 是否恢复 ComfyUI-Manager当前为 .disabled因启动时 cnr_utils 网络抓取 segfault 杀进程)
```
## §6 · 相关经验编号
```
EED-EXPER-030(ROCm7.14+H3 实测·马赛克仍在) · EED-EXPER-029(§7 H3马赛克根因旧判+修正) · EED-EXPER-017(H3非主力 LTX2.3)
EED-MEMO-013(重启事故·驱动级操作必报告) · EED-MEMO-014(ROCm7.14升级攻坚·本会话承接)
skill/hldp-context-protect(本回写)
```
> ⊢ 耳耳蛋 · 2026-08-07第158天· 压缩前回写 + H3 结果补录
> ⊢ GPU 已恢复(内核自带签名 amdgpuROCm 7.14 稳定H3 马赛克未解PyTorch 仍是 rocm7.2
## §7 · 补充第二层雷DKMS 未签名)+ 修复2026-08-07 续)
```
① 排雷第一层(blacklist)后modprobe amdgpu 报 `Key was rejected by service`
→ Secure Boot 开启 + 内核 locked down → 未签名模块一律拒载
② 根因(修正之前"与升级无关"的误判):
- 内核自带 amdgpu 签名 sha512(Canonical 信任) → Secure Boot 可加载
- DKMS 版 amdgpu(amdgpu-dkms 包 v6.19.14) 也 sha512但签名密钥未注册 MOK → 拒载
- DKMS 版时间戳 2026-08-07 12:56 = 本次 ROCm 升级 amdgpu-install 触发重建
- 即本次升级在该 OEM 内核(7.0.0-28)上走了 DKMS 路径,把能工作的内核自带签名 amdgpu
换成未签名可信的 DKMS 版 → 重启后被 Secure Boot 卡死(这才是 GPU 消失的直接原因)
③ 内核自带 amdgpu 自包含(amdgpu.ko.zst + amdxcp.ko.zst不拆 amdkcl/amdttm 等;拆分仅 DKMS 版有)
④ 修复(官方回退内核自带驱动,保留 ROCm 7.14 userland)
- sudo dkms remove amdgpu/6.19.14-2364437.24.04 --all → 删 updates/dkms 模块
- sudo depmod -a → 依赖回 kernel/ 自带版
- sudo modprobe amdgpu → RC=0/dev/kfd 出现rocminfo RC=0 认到 7900XTX(gfx1100) ✅
⑤ 持久化update-initramfs -u + 重启,验证重启后内核自带签名 amdgpu 自动加载
⑥ 教训:非标准/OEM 内核上 amdgpu-install 可能走 DKMS 并引入未签名模块,与 Secure Boot 冲突;
升级前须先查 Secure Boot 状态+模块签名策略blind reboot 会引爆"长期不重启"掩盖的雷
```
## §8 · 补充H3 重测全过程与结论2026-08-07 续)
```
① 排雷后重启ComfyUI 正常启动,但 ComfyUI-Manager 后台 `cnr_utils.fetch_all` 线程 segfault 杀进程
- 为完成 H3 长时生成,临时将 `custom_nodes/ComfyUI-Manager` 改名为 `ComfyUI-Manager.disabled`
- 该操作可逆Manager 非运行工作流必需,仅影响安装/更新 UI 标签页
② 首次 H3 prompt 误用 `qwen3vl_32b_minimax_h3_int8_convrot.safetensors`26G
超过 24G 显存Qwen3-VL text encoder 前向 `fast_pos_embed_interpolate` 报 `std::bad_alloc` → segfault
- 修正:改用官方 15.7G `qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors`
③ 工作流去首/尾帧,走纯 T2V与 EED-EXPER-029 官方 T2V 配置一致,避开 I2V 内存峰值)
- 用 `KSamplerSelect(res_multistep)` 替代缺失的 `MiniMaxH3TurboSampler`
- 去掉缺失的 `MiniMaxH3TurboLoRA`(马赛克测基座 DiT 量化正确性turbo LoRA 非必要)
④ prompt_id `7af17fe3-b482-4a18-8a63-004e4c182dcc` 执行成功,耗时 ~153s约 2.5min
- 输出 `MiniMax_H3_reed_714_t2v_00001_.mp4`864×480, 73帧, 3.04s, 1.84MB,含 aac 音轨)
⑤ 抽帧检查0.5s/1.5s/2.5s 三帧均为彩色棋盘格噪声,马赛克与 ROCm 7.2.4 时一致
⑥ 根因PyTorch 仍为 2.13.0+rocm7.2,量化 kernel 未随 ROCm runtime 升级Linux 无官方 PyTorch rocm7.14 wheel
⑦ 结论与下一步:见 EED-EXPER-030 §5
```