cang-ying/skill/scene_4view_learn.md
Zhuyuan Operations 80805449ca EED: 经验记忆推送——技能库(11技能+开源角色设定板)+遇事不决先搜索铁律+人物三/四视图+场景四视图工业级方法论+声画装配+多视图工具
- skill/ 技能库:index.json 11 技能 + community_techniques.md 社区技巧 + character_sheet_learn.md 角色版学习 + scene_4view_learn.md 场景四视图工业级方法 + character-sheet-generator 开源技能(7风格模板)
- tools/character_turnaround.py:人物三/四视图(主视觉+三视图/展示台)+场景四视角,Z-Image 本地
- tools/audio_pipeline.py:Edge-TTS配音+字幕+BGM+混音,Agent stage⑥有声成片
- agent_short_drama.py:一键短剧 Agent --until audio 全链路
- eed_web.py:技能库端点(/api/skills,/api/skill)+E2BIG根治(字节截断+巨兽降级)+一键短剧按钮
2026-08-01 03:16:48 +08:00

2.7 KiB
Raw Blame History

场景四视图 · 系统学习笔记2026-08-01

来源头条《一个提示词生成四视图》、B站《AI视频场景一致性完整工作流》、 抖音《场景穿帮 5 招工业级解决方案》、gpt88 场景一致性专题、知乎 Day40

一、核心认知(为什么我之前失败)

根本限制(头条那篇点破):一张场景图只是"固定角度、固定光线、固定景别的截面"。 让模型脑补"从侧面看、从空中看、从门口往里看",它没有那个信息,只能猜。 → 场景四视图不是"单图 + 文字描述"能解决的,需要空间逻辑先行 + 多角度资产

二、工业级 5 招(社区共识)

  1. 俯视图锁定空间逻辑(核心):先生成俯视图/平面图,定义建筑布局、房间关系、出入口——所有视角共享的"空间基准"
  2. 九宫格多角度:一张图内排 9 个角度的场景视图(前/后/左/右/45°×4 + 俯视)
  3. 720° 全景图自由取景:生成宽幅全景 → 任意切段作为不同机位的背景
  4. 360° 环绕:环绕视频/多帧截图 → 取不同帧作为视角
  5. 参考图控图用支持参考图的模型Seedance/即梦/ComfyUI IPAdapter+ControlNet基于"俯视基准图"生成各视角——最强的做法

三、场景四视图 = 俯视图锁空间 + 各视角生成(标准流程)

第1步俯视图/平面图(锁定空间逻辑、布局、出入口)→ 基准图
第2步基于基准图逐视角生成正面外观 / 背面外观 / 室内 / 鸟瞰
第3步参考图控图基准图作参考保证每个视角与空间逻辑一致

(对应爸爸之前定的"正面/背面/室内/鸟瞰"四视角

四、prompt 要点

  • 俯视图 prompttop-down orthographic floor plan, bird eye view, showing building layout, rooms, entrances, furniture arrangement, clean line, blue print style
  • 正面/背面front/back exterior elevation view, architectural facade, straight-on view
  • 室内interior view, room perspective, showing walls floor ceiling and furniture
  • 关键:强调 "consistent with the floor plan layout, same spatial logic"
  • 负面词characters, people, furniture clutter, inconsistent layout

五、咱的落地方向

  • 文生图Z-Image极限:单图 4 视角(前/背/室内/鸟瞰Z-Image 会自由发挥(无参考图机制)
  • 务实方案 A:俯视图基准 → 逐视角生成(统一描述+相似seed效果一般
  • 务实方案 B推荐:宽幅全景图 → PIL 切段(空间逻辑天然一致,工业级"全景自由取景"
  • 进阶方案 CComfyUI SDXL + ControlNet-Union用俯视基准图作控制条件——彻底锁定