cang-ying/memory/eed/project_community_tech.md

94 lines
8.9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
name: 社区技巧学习AI漫剧/一致性/多视图)
description: 网络搜集社区实战技巧沉淀到 skill/community_techniques.md并升级 character_turnaround 工具(五模块结构化+portrait布局
type: project
---
# 社区技巧学习2026-08-01
## 学了什么10+ 篇)
- 角色一致性:资产库+多视图+参数固定 组合拳76% 创作者第一大痛点)
- 三视图五模块结构化 prompt画面类型/排版/人物本体/造型细节/光影背景
- 场景四视图:前/右/后/左(或俯视),强调 SAME location
- AI漫剧五步工业化流水线剧本→视觉素材→动态化→音频→后期精修咱已全对齐
- ComfyUIIPAdapter=图像提示词ControlNet+IPAdapter 组合拳,需匹配底模架构
- 分镜七大要素:景别/运镜/视角/光影/构图/人物动作/环境动态
## 落地
1. `skill/community_techniques.md`技巧库沉淀1603 字)
2. `tools/character_turnaround.py` 升级:
- 五模块结构化 prompt
- 新增 `--layout portrait`16:9 面部特写+三视图(游戏立绘风)
- 保留 standard三栏/ scene场景四视图 2×2
3. 技能库扩到 10 技能(+📚 社区技巧库prompt 型,可注入)
## 产出图(爸爸验收)
- character 三视图zimg_turnaround_t1.png标准三栏
- 场景四视图scene_4view_test.png前/左/右/俯视 2×2
- portrait 立绘char_portrait_test.png16:9 面部特写+三视图)
## 关键洞察
- Z-Image 直出三视图效果已工业级,无需 IPAdapterSDXL 版不兼容 Z-Image/Kolors 架构)
- 社区强调"三视图可复用" > "画得精致"——资产库+分镜统一引用是下一阶段重点
## RunningHub 平台评估2026-08-04 · 仅查未扒)
- 本质:云端版 ComfyUI海马云10000+/数万公开工作流,节点式无限画布
- 学习路径:① 一键克隆(平台自带,复制别人工作流看 JSON最干净② 官方 Workflow API需 API Key + WebApp ID疑似需付费会员免费额度有限 RH 币)
- 版权边界(爸爸澄清): 创作者经济+收益分成,但咱用途=内部学习+自用不卖→不涉版权,克隆自学OK(红线解除);仅外发/商用踩雷
- 「无限画布」= ComfyUI 原生画布搬网页,非独门绝技;可借鉴的是上层 UX一键克隆标注来源 / 发布分享+排行 / 模型 API 门户 / 批量跑+实时进度 / Agent 入口
- 可借鉴优化(不花钱、不动 pile① 画布「导入标注来源」② skill 库加发布/排行 ③ pipeline 跑时加批量进度条
- 待确认ToS 禁止爬虫硬条款未直接搜到;实际扒需账号/API Key → 现实开销/账号走 EED-PROTO-005 爸爸验证码批准
- 爸爸拍板(2026-08-04): A功能借鉴(无限画布类UX优化自己面板体验) + B工作流扒给蛋蛋学(漫剧用);版权=内部学习自用不卖不涉版权
## RunningHub 下一步(待爸爸定账号来源后开扒)
- ① 列值得扒的工作流候选清单(按漫剧缺口: LTX/Wan I2V·人物一致性·场景一致性·首尾帧·配音·BGM) 已报爸爸勾选
- ② 定扒的访问方式: 爸爸现有账号给蛋蛋 / 或免费注册(EED-PROTO-005验证码批准) / 或先试公开页面看节点图
- ③ 扒完提取成本地可复用 skill/经验(进 eererdan/experience 或 skill/), BC-006 漫剧制作时直接复用
## RunningHub 实测结论 + 分工2026-08-04 · 蛋蛋 curl 验证 + 爸爸确认)
- API 强制登录: 试 /api/aiDetail|workflow|app/$id 均返 {"code":412,"msg":"TOKEN_INVALID"} → 不登录拉不到工作流数据, 公开爬不可行
- 登录方式(爸爸确认): 仅微信扫码 + 手机验证码, 都只能在爸爸手机操作, 蛋蛋无法独立登录
- 导出 JSON 路径(搜证): 工作流页 → 工作台 → 下载为 json(登录即可, 免费用户可, 非付费专属); 仅 API 调用需付费会员
- 分工定档: 爸爸登录 + 在工作台下载工作流 JSON → 丢 /home/ls/cang-ying/runninghub_learned/ → 蛋蛋读 JSON 提取节点/参数/技巧 → 存本地 skill/经验(BC-006 复用)
- 边界: 不注册付费会员/不走API/不花钱/不碰pile; 内部学习自用不卖不涉版权(爸爸授权)
## RunningHub 工作流两种形态2026-08-04 · 爸爸指正"是api形式"后澄清)
- 形态A·API应用(ai-detail/应用详情): 主推API调用, 要 API Key/积分/付费会员 → 咱不碰(花钱)
- 形态B·社区工作流分享帖(post/xxx): 页面带「下载」按钮, 能下标准 ComfyUI JSON(可拖入本地ComfyUI), 免费登录即可, 不用API → 这才是"扒来学"的目标
- 结论: 让爸爸找带「下载」按钮的社区工作流帖下JSON, 别找只有"运行工作流/API"的AI应用; 边界: 不走API/不花钱
## RunningHub 社区主流模型观察2026-08-04 · 爸爸发现"好多都是minimax h3"
- 社区大量工作流基于 MiniMax H3(开源视频模型, RunningHub 有"H3开源版专区", 视频编辑能力曾全球桂冠)
- 咱本地现状: Wan2.2 + LTX 2.3 已配, 未部署 H3
- H3 工作流对咱意义: 下了本地暂不能原样跑(需先本地部署H3); 但 prompt/运镜/控制思路与 Wan2.2/LTX 相通, 可借鉴迁移
- 待爸爸拍板: 是否本地部署 H3(新工程: 下载模型+配ComfyUI节点+验24G可跑); 不急, 先看学完 H3 思路值不值
## MiniMax H3 本地部署可行性2026-08-04 查实 · 爸爸问"咱们能用吗"
- 开源状态: 2026-08-03 开源, 权重开放 HuggingFace 可下; ComfyUI 发布当日原生支持, 有官方 T2V/I2V/R2V 工作流
- 显存: 满血版推理~24GB VRAM(模型文件~42.5GB磁盘); 量化版社区已有 8G/16G 可跑 → 咱7900XTX 24G 跑量化版(Q4级)绰绰有余, 满血版卡边界
- 实测佐证: RTX5070Ti 16G 跑通 I2V/T2V; B站称 8G 可玩; 有 SageAttention 加速插件
- 咱磁盘: 剩 188G, 够下满血/量化版
- 对漫剧增益: 比 Wan2.2/LTX 强一档; 原生双声道声音(音画一步到位, 改咱声画管线); 支持首尾帧控制(对口024尾帧衔接)
- 状态: 待爸爸拍板是否本地部署(新工程: 下模型+装节点+配工作流+实跑验证, 同 Wan2.2/LTX 套路); 不擅自下大模型
## H3 量化澄清2026-08-04 · 爸爸问"只能跑量化版吗"
- 非"技术只能量化": 满血版(FP16)推理~24GB VRAM, 咱24G理论上限刚好, 但系统+ComfyUI占一部分 → 实际极吃紧/OOM/低分辨率/慢, 不实用
- 量化有档位: Q4(~12-14G, 省一半, 轻微损质) / Q8(~18-20G, 近满血画质); 社区可靠最低 RTX3060 12G+32G内存跑量化版(8G可玩是吹牛)
- 咱24G: 跑 Q8 宽裕且画质近满血 → 推荐实测先试 Q8(质量优先)或 Q4(速度/显存优先), 非"只能低质量化"
- 修正前文"满血卡边界": 准确是"满血能跑但难受, 量化版(尤其Q8)才实用且高质"
## H3 本地部署进展2026-08-04 开搞中)
- 节点 clone: /home/ls/comfy/ComfyUI/custom_nodes/ComfyUI_RH_MinMaxH3 (HM-RunningHub 开源) ✓
- 依赖环境: 系统 Python 受 PEP668, ComfyUI 用独立 venv /home/ls/comfy/ComfyUI/venv; 用 venv/bin/pip 装; transformers 5.14.1→5.8.1(H3要求≤5.8.1, 降级有兼容风险待实跑验); torch 是 ROCm 构建(7900XTX 走 AMD 驱动)
- 模型: ModelScope Gluttony10/MiniMax-H3-INT8-CONVROT 完整版(含 config/tokenizer/safetensors/VAE, 不用 HF gated); 下载到 models/MiniMax-H3/; 总~131G(FL2VA/Ref2VA 各47G + qwen3-vl-32b-int8 ~26G + video_vae10.4G + audio_vae0.6G); 用 venv/bin/modelscope download
- 内存瓶颈已解: 原 swap 8G → 扩到 32G(新增 /swap2.img 24G, sudo fallocate+mkswap+swapon); 内存30G+swap32G=62G > 35G峰值(26G编码器+9G系统), OOM风险解除
- 待办: 下载完 → 把 config/tokenizer 从 models/MiniMax-H3/ 摆到 models/diffusers/MiniMax-H3/ → 重启 ComfyUI 加载节点 → 用 examples/workflows/t2va.json 实跑验证(盯显存24G跑INT8 DiT + transformers 5.8.1 兼容性)
---
## 🔧 H3 部署关键更正2026-08-04diffusers 配置需另下官方仓库
- ❌ 之前误记:`Gluttony10/MiniMax-H3-INT8-CONVROT` 含完整 config/tokenizer它只含转换权重 124G + 占位 configuration.json `{"task":"image-to-video"}`)。
- ✅ 正确H3 需两份共存——`models/MiniMax-H3/`(转换权重,来自 Gluttony10 INT8 镜像)+ `models/diffusers/MiniMax-H3/`config/tokenizer/preprocessor来自**官方仓库 `MiniMax/MiniMax-H3`(ModelScope) 或 `MiniMaxAI/MiniMax-H3`(HF)**)。
- 获取 diffusers 配置:`modelscope download --model MiniMax/MiniMax-H3 --local_dir .../diffusers/MiniMax-H3 --include "*.json"` → 递归只抓配置(约 86M含 transformer/text_encoder/vae/FL2VA/Ref2VA/tokenizer 全套 config.json + tokenizer + preprocessor**绝不碰权重**。
- README 原话:"只有转换权重是跑不起来的"——必须 diffusers 配置齐才能跑。节点 ComfyUI_RH_MinMaxH3 自带 examples/workflows/{t2va,fl2va_*,ref2va_*}.json但**不自带 config/tokenizer**。
- 实测:直接 `modelscope download MiniMax/MiniMax-H3`(不带 --include会下全量权重百G级务必加 --include "*.json" 只下配置。