
Luna-Lisa-Alpha:OpenAI 下一代 GPT-image 检查点泄露,知识截止日期更新
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
曾将 mona-lisa-1 的知识截止日期定为 2025 年 5 月的测试者,如今有了一个新代号要分享:luna-lisa-alpha——这看起来是同一个 OpenAI 图像模型谱系的下一个检查点,而据报道,它恰好达到了上一个模型未能达到的标准:最新的知识截止日期、强大的文字渲染能力,以及"超逼真"的输出。这一说法来自 X 上的一篇帖子(@chetaslua,8 月 19 日),并非出自 OpenAI,也没有任何 API、Arena 收录或公告与之挂钩。但它是第一个具体信号,预示着在本月初接管 LMArena 图像竞技场的匿名模型之后、以及在当前仍登顶图像排行榜的现役旗舰 gpt-image-2 之后,接下来会发生什么。
如果这一说法成立,那么头条不是逼真度——该系列每一次检查点泄露都声称皮肤更好、更少“塑料感”。头条是知识截止日期。mona-lisa-1 过时的训练数据是它在实际使用中最致命的缺点,而更新的截止日期是让继任者真正值得等待的唯一事实。以下是泄露内容、使其易于理解的背景,以及截至今天仍未得到验证的部分。
泄漏的实际内容是什么
这一信号来自X账号@chetaslua的一条消息,正是那位测试者,其针对mona-lisa-1的“Charlie Kirk测试”在八月初被中国科技媒体报道,作为该模型训练截止日期的证据。转述帖子内容:一个名为luna-lisa-alpha的新GPT-image检查点正在测试中;它是一个新的检查点,前一个是monalisa;它经过了同样的Charlie Kirk测试来检验知识截止日期;这个检查点的知识截止日期较新;文本渲染效果极佳;超级逼真。帖子附带了一张展示测试输出的图片。
这些说法每一项都只是单个账号的汇报。没有任何内容被独立复现,OpenAI 也未承认该代号,且没有水印分析、没有分词器指纹、也没有 Arena 出场记录与之关联——而这三类证据正是当初将 mona-lisa-1 与 OpenAI 联系在一起的依据。请将此视为线索,而非定论。
为什么知识截止日期就是破绽
“Charlie Kirk测试”是一种衡量图像模型训练数据截止时间的粗略工具:让其推理某个已知日期之后发生的事情,然后看它是否具备相关知识。对于mona-lisa-1,该测试得出了一个明显过时的答案。反复的日期探针使模型将年份写成2025年,而当被问及保守派评论员Charlie Kirk于2025年9月去世一事时,模型将其视为尚未发生——这与约2025年5月的训练截止时间一致。测试人员还指出,该版本模型不具备网页搜索能力,因此过时的截止时间没有被实时检索所掩盖。
这一点之所以重要,有其具体原因。图像模型中的知识截止时间是模型视觉-语言主干完成训练时间的代理指标——而一个出现在2026年8月的模型,其知识截止时间却是2025年5月,这意味着该检查点基本冻结自较早的一次运行,无论其图像质量看起来多么新颖。luna-lisa-alpha 上的“近期知识截止时间”(如果属实)则说明相反的情况:该检查点是在更新的世界模型上训练的,而这正是区分一个模型是知道2026年智能手机、界面或名人长什么样,还是一无所知的关键。对于图像生成产品来说,这并非无关紧要的小事——它决定了模型能否正确呈现当下的品牌、产品和文化元素。
有一点值得说明:图像模型的知识截止时间与聊天机器人的知识截止时间并非同一回事,泄露者的测试也只能算是一种启发式判断,而非精确测量。但作为OpenAI已将训练窗口向前推进的信号,它是该帖中最有力的单一数据点。
其后的检查点轨迹。
luna-lisa-alpha 并非凭空出现。其前身 mona-lisa-1 于 2026 年 8 月 9 日至 10 日夜间以匿名条目形式出现在 LMArena 的 Image Arena 上,没有署名。将其与 OpenAI 联系起来的证据是间接的,但层层递进:测试人员将其输出提交给 OpenAI 的官方图像验证工具,结果命中了 OpenAI 通过与 Gogle 合作应用的 SynthID 水印;该模型在被问及时自称 GPT;其分词器也与 GPT 系列模型匹配。“-1”后缀被解读为暂存标签,且 OpenAI 在发布前以代号测试图像检查点是有案可查的模式——gpt-image-2 本身在 2026 年 4 月 21 日发布前,就曾以 Maskingtape、Gaffertape 和 Packingtape 的名义在 Arena 上运行了约两周。
测试人员在 mona-lisa-1 上实际看到的情况与最新泄露的说法高度吻合,只是截止日期这一点除外。大多数评测者一致认为“塑料皮肤”的观感确实有所减少——更自然的纹理、毛孔、碎发、相机噪点——@WolfRiccardo 称其为“真实感上的显著改进,尤其是在光滑、合成感的皮肤方面”。中国测试者报告称在 2D/动漫和真人角色一致性方面有大幅提升。但该模型在部分地方仍会出现噪点和块状伪影,其指令遵循能力仅被评为一般,而且——对这次泄露来说很关键——它习惯于在图像中添加过多文字。最审慎的测试者 @synthwavedd 的结论是:“比 gpt-image-2 略有改进,不是大幅跳跃。”
在此背景下,luna-lisa-alpha 泄露信息中真正重要的两个形容词不是“超逼真”——那也是 mona-lisa-1 的卖点——而是“较新的知识截止日期”和“出色的文本渲染”。如果后续检查点修复了评论者批评 mona-lisa-1 的那两点,OpenAI 就是在以完全正确的顺序迭代。

继任者实际上必须跨过的门槛
mona-lisa-1 和 luna-lisa-alpha 都不在任何排行榜上,因此参考点仍然是 gpt-image-2,这是 OpenAI 在四月份发布的模型,目前也是图像竞技场上的第一名。它的排名和经济性都有记录可查。
• gpt-image-2 在 LMArena 上 — 文生图 Elo 为 1,393,图像编辑 Elo 为 1,467,Artificial Analysis Image Arena Elo 为 1,338(截至其 OrcaRouter 页面显示的 2026 年 5 月 15 日评测)。
• gpt-image-2 文本与分辨率 — 知识截止日期为2025年12月,2K输出,灵活的长宽比,以及OpenAI在发布时添加的“思考”推理模式。
• gpt-image-2 价格 — 每百万 tokens 输入 $8.00 / 输出 $30.00,通过 OrcaRouter 按提供商标价计费,零加价;p50 首 token 延迟为 10.16 秒。
从实际角度看:后继者必须击败一个已经擅长文本处理、编辑能力胜过市场上任何其他产品、且成本低到足以大规模运行的模型。仅凭"超逼真"这一点不会改变局面。更新的知识截止日期和实质性更好的图像内文本,才是真正能产生影响的两个卖点——这正是它们值得关注的原因。

什么仍然未经验证
几乎一切都是如此,而且值得精确描述这种不确定性的形态:
• OpenAI链接。luna-lisa-alpha没有mona-lisa-1所拥有的任何证据——没有水印命中,没有分词器匹配,没有Arena出处。它的谱系是从泄露者自己的框架(“上一个就是monalisa”)和检查点命名主题推断出来的,而不是来自任何技术指纹。
知识截止日期。“最近”是一个方向,而不是一个日期。在有人运行带日期的探针集之前,我们不知道截止日期是从2025年5月移到了2025年末,还是移到了2026年上半年,或者介于两者之间的某个时间。
• 文本渲染与真实感。这些说法是定性的,且来源单一。mona-lisa-1 自身关于“改进的真实感”的报道后来落定为“轻微改进”,因此早期形容词已明显倾向于夸大。
• 它最终能否成为产品还未可知。检查点经常泄露、被取消或改换名称发布。以“alpha”结尾的代号听起来像是分阶段系列中的早期候选,而非正式发布的成品。
如何处理这样的泄漏
有用的心智模型是适用于 mona-lisa-1 的那个:这是一个信号,表明某事物即将到来,而非已经在这里的事物。luna-lisa-alpha 目前无法从任何 API 调用,也没有办法将真实流量导向它。合理的做法是规划一个后继版本——并确保在其发布时,测试它无需任何成本。
这就是路由的情况。gpt-image-2 现已在 OrcaRouter 上线,每百万 token 定价 $8.00 / $30.00——这是 OpenAI 自己的标价,以零加价直通——因此,任何评估图像路线图的开发者都已经拥有一个密钥、一个兼容 OpenAI 的端点,以及自动故障转移到可用模型的能力。当真正的后继模型落地时,同样的设置让你可以在真实流量下将其与 gpt-image-2 进行 A/B 对比,而不是轻信一条推文:如果新的检查点表现不佳,故障转移会兜住它;如果它胜出,你早已知道迁移成本为零,因为切换只是一个模型字符串,而不是重新谈判。任一模型的供应商价格变动都会在发生当天生效,因为 OrcaRouter 会原封不动地传递提供商的标价。
在那之前,实实在在的东西仍然是已发布的模型。如果你今天正基于图像生成来构建产品,真正重要的决定不是该等待哪个未发布的代号,而是:当前排名第一的模型,按标价、无溢价,是否已经覆盖了你的用例。

接下来看什么
• luna-lisa-alpha 是否会出现在竞技场上。mona-lisa-1 在几天内就从匿名的 Arena 条目变成了泄露驱动的报道。如果名为 luna-lisa 的检查点出现在盲测中,单一来源的泄露就成了可相互印证的线索。
• 是否会出现水印或分词器指纹。这就是将 luna-lisa-alpha 与 OpenAI 关联起来的证据,正如它当年对 mona-lisa-1 所做的那样——或者做不到。
命名系列。OpenAI 先以磁带主题的代号推出 gpt-image-2,随后是 mona-lisa-1,现在则是 luna-lisa-alpha。“alpha” 后缀表明在正式发布之前可能还会有更多候选版本,因此预计代号列表会继续增加。
• 任何带日期的探针集。第一个进行真实截止时间测量的人会将“近期”变成一个具体数字,而正是这个数字决定了这一检查点是否算得上是有意义的进步。
客观地看:luna-lisa-alpha 只是一个测试者对某个检查点系列下一步进展的报告,而这个系列自八月初以来一直在悄然积蓄,酝酿着某种突破。其中最值得注意的说法——知识截止日期更新——也恰恰是最需要独立验证的。在那之前,留意 Arena 排名和指纹特征,把那些溢美之词都当作营销话术。如果继任者真的发布,要判断它的真实价值,方法就是把一小部分真实流量引导到它上面,与当前的排名第一做对比测试。这正是检查点的用途。
常见问题
luna-lisa-alpha 是 OpenAI 的官方模型吗?
尚未确认。唯一来源是某位爆料者的一条X帖子,而OpenAI对此未作任何回应。其被报道的行为和检查点谱系表明这可能是OpenAI的产物,但“表明”不等于“证实”——支持mona-lisa-1的SynthID和分词器证据,尚未为这一次的模型提供。
luna-lisa-alpha 什么时候发布?
目前没有日期,也没有确认该检查点会以那个名称发布。如果这种模式成立——gpt-image-2 在4月21日发布前曾以代号公开运行了大约两周——那么公开测试会先于任何发布,但那只是模式匹配,而非时间表。
我今天可以通过API使用luna-lisa-alpha吗?
不。它不在任何 API 或排行榜上。目前唯一可以实际调用的 OpenAI 图像模型是 gpt-image-2,它已在 OrcaRouter 上线,按提供商标价每百万 token 收取 $8.00 / $30.00,零加价。
