ChatGPT Image 2.5 Sunburst 适合去做精灵图吗?
先说结论
目前常见的做法,是在 ChatGPT 里用 Image 2.5 Sunburst 去生成 ChatGPT 精灵图。Developing sprite sheets with gpt-image-2 这条讨论里,AI Game Studio Dev Log 的作者提出了一套比较稳定的工作流:
- 通过 GPT Image 模型来生成角色设定图(当时测试的模型还是 GPT-Image-2);
- 通过 MiniMax H3 Max 模型生成 3–5 秒的动作序列帧;
- 使用 ffmpeg 提取并调整序列帧的大小和角色位置,保证动画的连贯性;
- 使用 Aseprite 继续编辑调整精灵图,作为这批精灵图的资产管理;
- 使用 ElevenLabs 做音效。
可以做到吗?可以,但是不推荐。精灵图需要的是一个能让多个工具链共通的美术资源生成 Harness,而不是去依赖一个无法打通和共享上下文的独立环境。
作者后续的两条经验
首先,在生成角色时,拥有同一角色的多个对齐视图非常有用。作者的做法是生成侧面、正面和背面视图。这样就能有一致的参考图像,可以从不同角度创建动画序列。过去总会遇到「基线对齐」的问题,使用 GPT Image 2.5 后,这个问题已基本解决。这并非强制性的,也可以仅基于侧面视图生成正面和背面动画,但这样一来,角色的某些细节就容易发生变化。例如,身份牌可能会消失,或者头发颜色可能会略有变化。因此,拥有多个参考帧可以确保从不同角度生成一致的动画。
第二条是,在生成动画时,要对起始帧和结束帧进行条件化处理。如果要一段能循环的待机动画,需要确保第一帧和最后一帧重合。如果角色正在执行一个向北转身、然后又回到侧视图的动作序列,需要确保最后一帧的衔接保持一致。
视频评论区中讨论的分层方案
因为我会经常更新自己的探索过程的视频,也拿到了很多人的讨论信息和看法,例如在一个视频站点下就出现了这样的对话:
- 毫无意义,seedream 5.0 pro已经支持了图像分层,一个api的事儿
- 老大,请问这个seedream的分层要在哪里使用呀
- 你大概率不是程序员,你按我说的一步一步做:打开deepseek官网,下载deepseek harness,在deepseek注册账号申请key充五块钱,然后直接在harness软件的聊天窗口让deepseek帮你做个图像分层小工具,其接入字节Seedream 5.0 Pro的api,让它自己搜api文档接入
- 哈哈,有个词语叫重复造轮子。话说回来,也亏是这位UP在网上发了视频,大佬你在评论区指出来了,咱们才能知道还有这样好的方法
上面两个例子,处理上都还停在出图、分层这一步。
角色精灵图是一整块需求
产品调研里曾经发现过类似 SpriteCook 这样的产品,专注去处理角色的 Sprite 及相应的图片资源。这里面其实涵盖的是一整块需求,并不是上面两个例子的处理那么简单,例如:
- 生成的精灵图后期的管理维护,按照原尺寸的资产重新生成,并和提示词对齐;
- 生成的精灵图资产在一个页面下的快速编辑;
- 大批量的角色图资源的批量化生成;
- 不同角色的持久化、稳定的提示词 Harness。
上面的情况当然都可以实现。但如果需要大量、批量化、稳定地生成和处理、后期管理,甚至团队资产管理,目前更接近的是 VberAI Studio 这一套工作链。
小结
在 ChatGPT 中使用 Image 2.5 生成精灵图,不如直接在 Codex 项目中调用 Figma 的 MCP 去进行这批美术资源的管理,但后续还牵涉到更多如何与游戏引擎的同步和交互。见 Figma 到 Godot 的导入工具是单向的。所以并不推荐在 ChatGPT 中直接生成精灵图,这意味着后期还要面对大量的 Harness 流程与美术处理流程需要构建。