最近在库拉KULAAI(c.kulaai.cn)这个AI模型聚合平台上第一时间把GPT-Image 2和GPT-4o的图像生成能力都跑了一遍。4月21日OpenAI正式发布GPT-Image 2,Arena榜单直接clean sweep——全榜第一,Arena创始人看完数据说了句"literally broke the chart"。两天实测下来,两者差距比预想的大。这篇文章从六个维度做拆解,不讲概念,只讲体感。

一、架构逻辑变了:从"两步走"到"边理解边画"
GPT-4o的图像生成依赖独立的视觉生成插件与核心文本模型协同。文本模型先把自然语言解析为结构化的视觉描述向量,再传递给图像生成插件进行像素级构建。中间有一次信息压缩——过去的模型是"先听懂你说什么,再动手画"。
GPT-Image 2的架构完全不同。研究负责人Boyuan Chen将其定义为"GPT for images"——一个从头设计的独立系统。从两阶段生成转向单次推理,语言理解和图像生成在同一过程中完成。所以文字渲染终于准了——生成每个像素时,模型仍然"知道"自己在写什么字。
对开发者来说,调用API时GPT-Image 2对复杂指令的解析路径更短,语义一致性更强。
二、文字渲染:从"能看"到"能用"
AI图像生成最大的笑话,一直是文字。DALL-E 3拼不对复杂单词,Midjourney把招牌写成乱码,Stable Diffusion在海报上输出鬼画符。文字渲染是生图模型的"手指问题"——不是不重要,而是一做就露馅。
GPT-4o在字符生成上已经比其他模型好,字体美观,没有字母畸形。但处理中文时仍有瑕疵。有记者实测生成"传统中式风格餐厅菜单"时,排版优雅、插画风格契合,但中文字符渲染存在瑕疵。非拉丁语系文本的语义理解和渲染效果有明显短板。
GPT-Image 2把文字渲染准确率从前代的90-95%直接跳到约99%。VentureBeat记者让模型生成三大帝国版图历史地图,附完整图例,输出"seemingly flawlessly"。TechCrunch记者生成的墨西哥餐厅菜单,评价是"可以直接放进餐厅使用,客人不会察觉任何异样"。
99%的准确率如果成立,AI生成的海报、菜单、UI截图、品牌物料第一次可以跳过人工修正,直接交付。生图模型的能力边界,正在从"视觉"扩展到"信息"。
三、Thinking模式:GPT-Image 2独有的杀手锏
GPT-4o是纯粹的执行器——你给指令,它执行,不验证。GPT-Image 2引入了Thinking模式,开启后模型在落笔前先规划构图,生成后检查输出,发现错误还会迭代修正。
anti gamble创始人@damianplayer的拆解:"reasoning mid-generation——plans the composition, checks its own output"。推理集成还让模型可以在生成过程中调用网页搜索、将文档转化为视觉图表、在8张图片间维持角色一致性。
本质上是从"画图工具"向"视觉内容助手"的跨越。
四、拟真能力:已经到了让人不安的程度
GPT-Image 2的训练数据明显偏向真实世界的视觉素材:UI截图、店面招牌、界面布局。当你要求生成"普通工程师的屏幕",它输出的是可信的显示器画面,不是关键词拼贴。
有记者测试了一个极简提示词:"生成一张女主播抖音截图"。短短11个字,没有写一大串详细要求。但恰恰因为它简单,才更能看出模型的理解能力。因为"女主播抖音截图"不是一个单纯的视觉对象,它背后包含人物、直播间UI设计、中文文字、手机截图质感,以及我们对短视频平台的共同认知。
结果出来的图,人物面部、手部、身体结构都非常自然。直播间布局完全理解了这个语境——头像在哪,昵称在哪,评论如何滚动,互动按钮如何排列。中文评论区不再是随便糊出来的假字符,而是像真有人在直播间里互动一样。
这种能力比单纯的审美更重要。
五、角色一致性与分镜能力
GPT-Image 2支持单次生成最多8张风格一致的图片。OpenAI演示了从一张自拍生成三页漫画的工作流,角色在多页间保持一致。美妆博主甚至用一条prompt生成了一整套品牌kit——logo、配色、排版、多页应用。
GPT-4o经过一年多迭代,多轮对话中保持主体一致性的能力已经成熟。但从单次生成多张风格统一的序列图这个维度看,GPT-Image 2是降维打击。
六、定价与可用性
GPT-Image 2定价每百万token8−8−30,折合单张图片0.006−0.006−0.211。分两种模式:Instant快出图,所有人可用;Thinking模式集成推理和网页搜索,锁在Plus及以上付费层级。生成速度比前代快一倍。支持最高4096×4096分辨率。
趋势判断:从"创意玩具"到"生产基础设施"
StartupFortune在发布日给了一个定位:从"creative novelty"到"production infrastructure"。品牌mockup、广告设计、信息图表,过去因为文字不可靠而必须人工介入的场景,开始变成一条prompt可以交付的工作流。
但99%是实验室数字,真实世界的多语言、多字体、多排版场景能不能hold住,5月API开放后才会有答案。
架构决定了它能"读懂"文字,Thinking让它能"检查"文字,世界知识让它知道文字应该"长什么样"。三层能力叠在一起,文字渲染从短板变成了长板。
过去我们惊讶的是:AI居然能画成这样。现在我们惊讶的是:这居然是AI生成的。