- skill/ 技能库:index.json 11 技能 + community_techniques.md 社区技巧 + character_sheet_learn.md 角色版学习 + scene_4view_learn.md 场景四视图工业级方法 + character-sheet-generator 开源技能(7风格模板) - tools/character_turnaround.py:人物三/四视图(主视觉+三视图/展示台)+场景四视角,Z-Image 本地 - tools/audio_pipeline.py:Edge-TTS配音+字幕+BGM+混音,Agent stage⑥有声成片 - agent_short_drama.py:一键短剧 Agent --until audio 全链路 - eed_web.py:技能库端点(/api/skills,/api/skill)+E2BIG根治(字节截断+巨兽降级)+一键短剧按钮
2.7 KiB
2.7 KiB
场景四视图 · 系统学习笔记(2026-08-01)
来源:头条《一个提示词生成四视图》、B站《AI视频场景一致性完整工作流》、 抖音《场景穿帮 5 招工业级解决方案》、gpt88 场景一致性专题、知乎 Day40
一、核心认知(为什么我之前失败)
根本限制(头条那篇点破):一张场景图只是"固定角度、固定光线、固定景别的截面"。 让模型脑补"从侧面看、从空中看、从门口往里看",它没有那个信息,只能猜。 → 场景四视图不是"单图 + 文字描述"能解决的,需要空间逻辑先行 + 多角度资产。
二、工业级 5 招(社区共识)
- 俯视图锁定空间逻辑(核心):先生成俯视图/平面图,定义建筑布局、房间关系、出入口——所有视角共享的"空间基准"
- 九宫格多角度:一张图内排 9 个角度的场景视图(前/后/左/右/45°×4 + 俯视)
- 720° 全景图自由取景:生成宽幅全景 → 任意切段作为不同机位的背景
- 360° 环绕:环绕视频/多帧截图 → 取不同帧作为视角
- 参考图控图:用支持参考图的模型(Seedance/即梦/ComfyUI IPAdapter+ControlNet),基于"俯视基准图"生成各视角——最强的做法
三、场景四视图 = 俯视图锁空间 + 各视角生成(标准流程)
第1步:俯视图/平面图(锁定空间逻辑、布局、出入口)→ 基准图
第2步:基于基准图,逐视角生成:正面外观 / 背面外观 / 室内 / 鸟瞰
第3步:参考图控图(基准图作参考)保证每个视角与空间逻辑一致
(对应爸爸之前定的"正面/背面/室内/鸟瞰"四视角 ✅)
四、prompt 要点
- 俯视图 prompt:
top-down orthographic floor plan, bird eye view, showing building layout, rooms, entrances, furniture arrangement, clean line, blue print style - 正面/背面:
front/back exterior elevation view, architectural facade, straight-on view - 室内:
interior view, room perspective, showing walls floor ceiling and furniture - 关键:强调 "consistent with the floor plan layout, same spatial logic"
- 负面词:
characters, people, furniture clutter, inconsistent layout
五、咱的落地方向
- 文生图(Z-Image)极限:单图 4 视角(前/背/室内/鸟瞰)Z-Image 会自由发挥(无参考图机制)
- 务实方案 A:俯视图基准 → 逐视角生成(统一描述+相似seed,效果一般)
- 务实方案 B(推荐):宽幅全景图 → PIL 切段(空间逻辑天然一致,工业级"全景自由取景")
- 进阶方案 C:ComfyUI SDXL + ControlNet-Union(用俯视基准图作控制条件)——彻底锁定