先說結論

目前常見的做法,是在 ChatGPT 裡用 Image 2.5 Sunburst 去生成 ChatGPT 精靈圖。Developing sprite sheets with gpt-image-2 這條討論裡,AI Game Studio Dev Log 的作者提出了一套比較穩定的工作流:

  1. 通過 GPT Image 模型來生成角色設定圖(當時測試的模型還是 GPT-Image-2);
  2. 通過 MiniMax H3 Max 模型生成 3–5 秒的動作序列幀;
  3. 使用 ffmpeg 提取並調整序列幀的大小和角色位置,保證動畫的連貫性;
  4. 使用 Aseprite 繼續編輯調整精靈圖,作為這批精靈圖的資產管理;
  5. 使用 ElevenLabs 做音效。

可以做到嗎?可以,但是不推薦。精靈圖需要的是一個能讓多個工具鏈共通的美術資源生成 Harness,而不是去依賴一個無法打通和共享上下文的獨立環境。

作者後續的兩條經驗

首先,在生成角色時,擁有同一角色的多個對齊檢視非常有用。作者的做法是生成側面、正面和背面檢視。這樣就能有一致的參考影像,可以從不同角度建立動畫序列。過去總會遇到「基線對齊」的問題,使用 GPT Image 2.5 後,這個問題已基本解決。這並非強制性的,也可以僅基於側面檢視生成正面和背面動畫,但這樣一來,角色的某些細節就容易發生變化。例如,身份牌可能會消失,或者頭髮顏色可能會略有變化。因此,擁有多個參考幀可以確保從不同角度生成一致的動畫。

第二條是,在生成動畫時,要對起始幀和結束幀進行條件化處理。如果要一段能迴圈的待機動畫,需要確保第一幀和最後一幀重合。如果角色正在執行一個向北轉身、然後又回到側檢視的動作序列,需要確保最後一幀的銜接保持一致。

影片評論區中討論的分層方案

因為我會經常更新自己的探索過程的影片,也拿到了很多人的討論資訊和看法,例如在一個影片站點下就出現了這樣的對話:

  • 毫無意義,seedream 5.0 pro已經支援了影像分層,一個api的事兒
  • 老大,請問這個seedream的分層要在哪裡使用呀
  • 你大機率不是程式設計師,你按我說的一步一步做:開啟deepseek官網,下載deepseek harness,在deepseek註冊帳號申請key充五塊錢,然後直接在harness軟體的聊天視窗讓deepseek幫你做個影像分層小工具,其接入位元組Seedream 5.0 Pro的api,讓它自己搜api文件接入
  • 哈哈,有個詞語叫重複造輪子。話說回來,也虧是這位UP在網上發了影片,大佬你在評論區指出來了,咱們才能知道還有這樣好的方法

上面兩個例子,處理上都還停在出圖、分層這一步。

角色精靈圖是一整塊需求

產品調研裡曾經發現過類似 SpriteCook 這樣的產品,專注去處理角色的 Sprite 及相應的圖片資源。這裡面其實涵蓋的是一整塊需求,並不是上面兩個例子的處理那麼簡單,例如:

  1. 生成的精靈圖後期的管理維護,按照原尺寸的資產重新生成,並和提示詞對齊;
  2. 生成的精靈圖資產在一個頁面下的快速編輯;
  3. 大批次的角色圖資源的批次化生成;
  4. 不同角色的持久化、穩定的提示詞 Harness。

上面的情況當然都可以實現。但如果需要大量、批次化、穩定地生成和處理、後期管理,甚至團隊資產管理,目前更接近的是 VberAI Studio 這一套工作鏈。

小結

在 ChatGPT 中使用 Image 2.5 生成精靈圖,不如直接在 Codex 專案中呼叫 Figma 的 MCP 去進行這批美術資源的管理,但後續還牽涉到更多如何與遊戲引擎的同步和互動。見 Figma 到 Godot 的匯入工具是單向的。所以並不推薦在 ChatGPT 中直接生成精靈圖,這意味著後期還要面對大量的 Harness 流程與美術處理流程需要構建。