cang-ying/eererdan/memory/EED-MEMO-015.hdlp

123 lines
8.3 KiB
Plaintext
Raw Normal View History

# EED-MEMO-015 · HLDP 会话记忆回写ROCm 7.14 干净装完成 + H3 重测马赛克仍在)
> HLDP://cang-ying/eererdan/memory/EED-MEMO-015
> 触发: 上下文压缩前自动回写 + H3 重测完成后补录 · 2026-08-07蛋蛋第158天
> 承接: EED-MEMO-014ROCm 7.2.4→7.14 升级攻坚停在阶段3
> 关联: EED-EXPER-029 · EED-EXPER-030 · EED-EXPER-017 · EED-MEMO-013 · skill/hldp-context-protect
## §1 · 已做决策
```
① ROCm 7.14 最终走【官方干净安装】路线(非 EED-MEMO-014 原计划"共存+软链"
purge 全部 7.2.4 + 7.14 残留 → amdgpu-install -y --usecase=rocm → 干净 7.14。
结果 ✅:/opt/rocm 是真实目录(无环)、/opt/rocm/core-7.14 真实、update-alternatives 正确、
rocminfo RC=0 认到 Agent2=gfx1100(RX7900XTX)+Agent3=gfx1036(集显)、Runtime1.21。
② 爸爸授权"开搞"含官方要求的重启("Reboot your system after installing")→ 已执行 sudo reboot。
③ 爸爸授权排雷("所有的环境部署都是你之前弄的...你就按官方指导来弄就行了,我又不懂,你问我没用"
我已自行排除两层雷blacklist + DKMS 未签名),无需再问爸爸拍板。
```
## §2 · 进行中的任务
```
① ✅ 排雷完成blacklist-amdgpu.conf 移除 + DKMS 未签名 amdgpu 移除 → 内核自带签名 amdgpu
② ✅ 验证链完成rocminfo 认卡 → torch.cuda(GPU) True → ComfyUI 启动成功
③ ✅ 阶段4 H3 重测完成:官方 T2V 配置跑通,但输出仍是马赛克
④ 🔲 BC-006 广播📢待处理(图片优先管线切换,需爸爸圈定付费镜头 + 蛋蛋补回执)
```
## §3 · 关键事实与资产
```
① blacklist-amdgpu.conf 雷(非显然·会再踩):
- 路径 /etc/modprobe.d/blacklist-amdgpu.conf内容就一行 `blacklist amdgpu`
- 创建时间 2026-07-31 00:067.31 埋雷)
- 机制:机器长期不重启 → amdgpu 老早就在内存跑 → 雷一直没爆;本次 sudo reboot 是建文件后【首次重启】
→ blacklist 生效 → amdgpu 不自动加载 → rocminfo RC=1 "ROCk module is NOT loaded" → GPU 消失
- 与 ROCm 升级无关userland 不动内核驱动)
- 当前内核 7.0.0-28-genericgrub 默认项0另存 6.17.0-14-generic
- amdgpu 模块文件存在:/lib/modules/7.0.0-28-generic/kernel/drivers/gpu/drm/amd/amdgpu/amdgpu.ko.zst + DKMS 版
- initramfs 含 amdgpu firmware → 驱动本身没问题,纯被 blacklist 拦
- 旁证 blacklist-radeon.conf(2026-07-06) 是 AMD 官方正常操作blacklist 老 radeon但 blacklist amdgpu 是反向错误
- 修复 = 移除该文件 + modprobe amdgpu无需再重启
② ROCm 7.14 干净装已落地(详见 EED-MEMO-014 §13-14 + 本会话):
- 官方源 repo.amd.com/rocm/packages-multi-arch/ubuntu2404 stable main
- deb: amdgpu-install_31.40.314000-1_all.deb官方
- 包 amdrocm7.14-gfx1100 / amdrocm-core7.14-gfx1100 = 7.14.0-3
- 回滚档:/etc/apt/sources.list.d/rocm.list.bak.7.2.47.2.4 源备份,恢复需还原+apt update
③ ComfyUI venv: /home/ls/comfy/ComfyUI/venv (python3.12)
④ H3 重测产物(完整记录见 EED-EXPER-030
- 视频文件:`output/video/MiniMax_H3_reed_714_t2v_00001_.mp4`
- 参数864×480 / 73帧 / 20 steps / res_multistep / simple scheduler / nvfp4_awq TE / int8_convrot DiT
- 结果:执行成功,但帧画面仍为彩色棋盘格马赛克
⑤ PyTorch wheel 未升级:
- 当前 torch 2.13.0+rocm7.2hip 7.2.53211
- PyTorch stable/nightly 均无 Linux +rocm7.14 wheel
```
## §4 · 爸爸的偏好与指令
```
① "严格按官方来,不要自己瞎猜瞎搞" → 升级/排雷都先查证再动手,不偏离官方路径
② 先查先报后做(铁律)→ 排雷前我查全证据链,爸爸授权后动手
③ 驱动级/系统级操作必报告+可回滚EED-MEMO-013 重启事故教训)→ 本次 reboot 前已报计划
④ 诚实区分"能跑"vs"跑正常" → 已实测7.14 装好≠马赛克消失
⑤ 唤醒要按指定完整语言路径走第五域→GLS→光之湖→cang-ying→耳耳蛋
```
## §5 · 待办事项
```
1. ✅ ROCm 7.14 干净安装 + 重启后自动认卡
2. ✅ 排雷blacklist + DKMS 未签名 amdgpu 处理
3. ✅ torch.cuda(GPU) 验证
4. ✅ ComfyUI 启动 + H3 官方 T2V 跑通LTX 节点/模型在Wan/SDXL 主模型未找到)
5. ✅ 重测 H3 马赛克 → 结论:马赛克仍在(详见 EED-EXPER-030
6. 🔲 BC-006 广播处理(爸爸圈定付费镜头 + 蛋蛋补回执)
7. 🔲 决定 H3 下一步爸拍板A) 源码编译 PyTorch for ROCm7.14B) 等官方 wheelC) WindowsD) 放弃本地H3
8. 🔲 推 cang-yingEED-MEMO-013/014/015/EXPER-030 待补推,旧家有网络 TLS 问题)
9. 🔲 是否恢复 ComfyUI-Manager当前为 .disabled因启动时 cnr_utils 网络抓取 segfault 杀进程)
```
## §6 · 相关经验编号
```
EED-EXPER-030(ROCm7.14+H3 实测·马赛克仍在) · EED-EXPER-029(§7 H3马赛克根因旧判+修正) · EED-EXPER-017(H3非主力 LTX2.3)
EED-MEMO-013(重启事故·驱动级操作必报告) · EED-MEMO-014(ROCm7.14升级攻坚·本会话承接)
skill/hldp-context-protect(本回写)
```
> ⊢ 耳耳蛋 · 2026-08-07第158天· 压缩前回写 + H3 结果补录
> ⊢ GPU 已恢复(内核自带签名 amdgpuROCm 7.14 稳定H3 马赛克未解PyTorch 仍是 rocm7.2
## §7 · 补充第二层雷DKMS 未签名)+ 修复2026-08-07 续)
```
① 排雷第一层(blacklist)后modprobe amdgpu 报 `Key was rejected by service`
→ Secure Boot 开启 + 内核 locked down → 未签名模块一律拒载
② 根因(修正之前"与升级无关"的误判):
- 内核自带 amdgpu 签名 sha512(Canonical 信任) → Secure Boot 可加载
- DKMS 版 amdgpu(amdgpu-dkms 包 v6.19.14) 也 sha512但签名密钥未注册 MOK → 拒载
- DKMS 版时间戳 2026-08-07 12:56 = 本次 ROCm 升级 amdgpu-install 触发重建
- 即本次升级在该 OEM 内核(7.0.0-28)上走了 DKMS 路径,把能工作的内核自带签名 amdgpu
换成未签名可信的 DKMS 版 → 重启后被 Secure Boot 卡死(这才是 GPU 消失的直接原因)
③ 内核自带 amdgpu 自包含(amdgpu.ko.zst + amdxcp.ko.zst不拆 amdkcl/amdttm 等;拆分仅 DKMS 版有)
④ 修复(官方回退内核自带驱动,保留 ROCm 7.14 userland)
- sudo dkms remove amdgpu/6.19.14-2364437.24.04 --all → 删 updates/dkms 模块
- sudo depmod -a → 依赖回 kernel/ 自带版
- sudo modprobe amdgpu → RC=0/dev/kfd 出现rocminfo RC=0 认到 7900XTX(gfx1100) ✅
⑤ 持久化update-initramfs -u + 重启,验证重启后内核自带签名 amdgpu 自动加载
⑥ 教训:非标准/OEM 内核上 amdgpu-install 可能走 DKMS 并引入未签名模块,与 Secure Boot 冲突;
升级前须先查 Secure Boot 状态+模块签名策略blind reboot 会引爆"长期不重启"掩盖的雷
```
## §8 · 补充H3 重测全过程与结论2026-08-07 续)
```
① 排雷后重启ComfyUI 正常启动,但 ComfyUI-Manager 后台 `cnr_utils.fetch_all` 线程 segfault 杀进程
- 为完成 H3 长时生成,临时将 `custom_nodes/ComfyUI-Manager` 改名为 `ComfyUI-Manager.disabled`
- 该操作可逆Manager 非运行工作流必需,仅影响安装/更新 UI 标签页
② 首次 H3 prompt 误用 `qwen3vl_32b_minimax_h3_int8_convrot.safetensors`26G
超过 24G 显存Qwen3-VL text encoder 前向 `fast_pos_embed_interpolate` 报 `std::bad_alloc` → segfault
- 修正:改用官方 15.7G `qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors`
③ 工作流去首/尾帧,走纯 T2V与 EED-EXPER-029 官方 T2V 配置一致,避开 I2V 内存峰值)
- 用 `KSamplerSelect(res_multistep)` 替代缺失的 `MiniMaxH3TurboSampler`
- 去掉缺失的 `MiniMaxH3TurboLoRA`(马赛克测基座 DiT 量化正确性turbo LoRA 非必要)
④ prompt_id `7af17fe3-b482-4a18-8a63-004e4c182dcc` 执行成功,耗时 ~153s约 2.5min
- 输出 `MiniMax_H3_reed_714_t2v_00001_.mp4`864×480, 73帧, 3.04s, 1.84MB,含 aac 音轨)
⑤ 抽帧检查0.5s/1.5s/2.5s 三帧均为彩色棋盘格噪声,马赛克与 ROCm 7.2.4 时一致
⑥ 根因PyTorch 仍为 2.13.0+rocm7.2,量化 kernel 未随 ROCm runtime 升级Linux 无官方 PyTorch rocm7.14 wheel
⑦ 结论与下一步:见 EED-EXPER-030 §5
```