一张用于 Atria Dawn Preview 的主视觉信息图,展示四大智能体能力领域(发现、创造、交付、网络安全),以及一条 100 万上下文 · MIT 许可证 · 开放权重栏。
Engineering & Research

Atria Dawn Preview:InternLM 悄然发布 744B 参数智能体模型——代码仓库究竟说了什么

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

上海人工智能实验室的 InternLM 组织本周在 Hugging Face 上悄然发布了 Atria Dawn Preview——一个 744B 参数 MoE 智能体模型的预览版,随附 MIT 许可的权重、1M token 上下文窗口,以及一张与 DeepSeek V4 ProKimi K3Qwen3.8-MaxGLM-5.3GPT-5.6 SolClaude Opus 5 对比测量的基准表。该仓库于 2026 年 9 月 11 日上线——比本文早三天——配套的 FP8 检查点随后于 9 月 12 日发布,而厂商尚未在任何地方宣布该模型:没有博客文章,没有论文,没有定价,没有 API。今天存在的是一份内容完整的模型卡和约 1.5TB 的开放权重。这使得 Atria Dawn Preview 成为一次悄无声息的上线发布,而有趣的问题在于:这张卡让你能够核实什么,要求你凭信任接受什么,以及这是否是这家今年一直在发布 Intern-S2 和 InternLumina 系列的实验室迈向更大 Atria 家族的第一步。

卡片就是公告

由于没有发布公告,Hugging Face 的模型卡承担了全部的说明工作。它将 Atria Dawn Preview 描述为“新一代智能体模型的预览版本”,由上海人工智能实验室研发,基于 744B 参数的 MoE 基础模型训练,面向“需要持续环境理解、工具使用和多步任务完成的科研与工程场景”。其宣传语——“从研究问题到可验证结果”——指的是推动开放性问题走向可执行、可验证、可复现的成果,模型在问题分析、方案设计、工具使用、代码实现、实验执行、结果分析和故障恢复各环节中,将任务目标与环境反馈结合起来。

该卡片将这一代理式范围组织为四个能力领域,每个领域都着眼于端到端交付而非聊天:

Discovery — 检索并整理证据、开展深度研究,将研究问题转化为可执行的实验方案

创作 — 构建软件、交互式应用、游戏、数据可视化以及机器学习系统

交付 — 将文档、数据和设计需求转化为报告、演示文稿及其他结构化交付物

网络安全 — 分析安全问题、验证漏洞、应用修复,并在授权环境中重新验证

卡片上还有但未作解释的:一个网站(atria-asi.com)、一个镜像了 README 的 GitHub 组织(atria-asi),以及一个 X 账号(@AtriaASI)。"ASI" 这个后缀是唯一真正奇怪的细节——卡片上没有任何内容说明这个品牌想暗示什么,而我们不会比仓库本身读出更多含义。可知的是,这是一个独立的产品线代号,不同于该实验室全年使用的 Intern-S2 和 InternLumina 这两个名称。

Screenshot of the Hugging Face model card for internlm/Atria-Dawn-Preview showing the title, the Atria Dawn Preview branding, the architecture tag glm_moe_dsa, the MIT license, and the 'From Research Questions To Verifiable Results' description.

配置究竟说了什么

权重和配置如今已可下载,这正是“静默发布”不再只是传闻的地方。架构字符串是 GlmMoeDsaForCausalLM——与 GLM 系列所用的同一种 DSA 式稀疏 MoE 家族,其配置在 78 层中每 token 路由 256 个路由专家中的 8 个(激活参数量并未在模型卡上公布;对于这一形态的 744B MoE,它会落在数百亿的量级)。上下文窗口设为 1,048,576 个 token——整整 100 万,与该实验室近期其他发布所推动的长上下文级别相符。分词器带有图像、视频、音频和转写标记,不过聊天模板明确告知模型它不具备多模态输入能力,并且若收到媒体文件应如实说明——因此请把这些模态标签视为继承而来的管道设施,而非对视觉或音频输入能力的宣称。

权重说明了实际情况:

检查点 — 两个:BF16/F32 指令模型和 Atria-Dawn-Preview-FP8,一个 FP8 量化的指令模型

大小 — BF16 版约为 1.5TB,分布在 353 个 safetensors 分片中;FP8 版约为 756GB

许可证 — MIT,代码和权重均适用,模型卡上无限制条款——对于这种规模的实验室发布来说,宽松得非同寻常

分发 — Hugging Face 和 ModelScope,英文和中文 README,仓库中的聊天模板和生成配置

托管——卡片上未列出任何推理提供商,任何地方也未提及 API

最后一句对定位很重要:这是一次权重发布,不是服务上线。任何想现在运行 Atria Dawn Preview 的人,都必须下载约 756GB(FP8)或 1.5TB(BF16),并自行提供服务——没有厂商端点,没有定价,也没有配额页面。

仔细阅读基准表。

这张卡片附有一张 16 行的基准测试表,将 Atria Dawn Preview 与 DeepSeek V4 Pro、Kimi K3、Qwen3.8-Max、GLM-5.3、GPT-5.6 Sol 和 Claude Opus 5 在智能体、工具使用、编程和研究基准上进行对比。其中的每一个数字均由厂商报告——这些评估由该实验室自行开展或委托进行,且没有任何一项已被独立复现,因为目前尚不存在对 Atria Dawn Preview 的独立评估。截至今日,Artificial Analysis 上没有该模型的页面。因此,正确的解读是“这是厂商声称它与其他模型的对比情况”,而不是“这是它实际的对比情况”。

A scoreboard infographic for Atria Dawn Preview listing the vendor-reported benchmark highlights: BrowseComp 92.5, CyberGym 86.5, DeepSearchQA 96.0, BFCL v4 77.0, SWE-bench Pro 59.6, JobBench 50.3, with a footer noting all figures are vendor-reported on the model card with no independent scores yet.

在明确这一前提之后,亮点确实相当有意思。Atria Dawn Preview 在 BrowseComp 上以 92.5 位居所列模型之首(对比 GPT-5.6 Sol 的 92.2 和 Claude Opus 5 的 90.8),在 CyberGym 上为 86.5(领先于 DeepSeek V4 Pro 的 83.3、GLM-5.3 的 84.5 和 GPT-5.6 Sol 的 83.6),在 DeepSearchQA 上为 96.0。它还在 BFCL v4 上取得了 77.0 的强劲成绩,对比 DeepSeek V4 Pro 的 71.4 和 Kimi K3 的 69.1。薄弱之处同样很能说明问题:

Terminal-Bench 2.1 — 78.3,明显落后于 Qwen3.8-Max 的 89.3 和 Claude Opus 5 的 90.2,表明其编程智能体能力尚未达到旗舰水准

SWE-bench Pro — 59.6,领先于 DeepSeek V4 Pro(58.3),但远落后于 Claude Opus 5 的 74.7

MLE-bench Lite — 86.2,尽管有 Discovery 的卖点,仍落后于 GPT-5.6 Sol(88.9)和 Claude Opus 5(88.0)

JobBench — 50.3,是该卡片所列模型中最低的,也是其中几行之一:在这些行中,一个开源的 744B 预览版表现不及与它并列印出的闭源旗舰模型

诚实的总结是:这张模型卡声称在研究检索、基于浏览器的任务和安全验证方面具备真正的优势,而经典的编码与知识工作行则显得处于中游。一个毫不择优展示的预览,比一个在所有方面都胜出的预览更可信——但这些内容都没有得到验证,而一个如此规模、拥有如此多评估面的模型,在任何人把流水线押注其上之前,都值得接受独立审视。

它在 InternLM 系列中的位置

Atria Dawn Preview 发布之际,正值该实验室异常繁忙的一段时期。视觉与科学旗舰 Intern-S2-397B 于 9 月 13 日亮相,同属一个家族、体型更小的同门(Intern-S2、Intern-S2 Mobius)自年中以来已陆续发布,而聚焦视觉的 InternLumina-U2 也在 9 月初上线。Atria 是一个独立代号,面向通用智能体工作,而非科学或多模态专门化——并且与采用 Apache-2.0 许可、拥有自己发布生态的 Intern-S2-397B 不同,Atria Dawn Preview 悄无声息地以 MIT 许可登场。Atria 是一次性预览,还是新系列的首个成员,目前尚未确认;“Preview”后缀以及光秃秃的仓库、到处都没有路线图文字,都支持谨慎解读。

尚未知晓的部分

静默发布时,一个有用的习惯是列出仍待解决的事项。在 Atria Dawn Preview 上,这份清单很长:

一则公告——截至9月14日,实验室、官网和X账号均无任何动静;代码库最先出现,这与近期几家中国实验室的发布方式如出一辙,但"惯例如此"并不等于确认

论文或技术报告——均未提供链接;训练数据、强化学习流程以及活跃参数数量都未公开

“Atria ASI”这一品牌标识——域名和账号确实存在,卡片也将二者关联起来,但其背后究竟是哪个实体,以及这几个首字母代表什么,均未说明

独立评分 — 无;没有 Artificial Analysis 条目,没有 arena 记录,也没有任何可用于交叉核对卡片表格的内容

托管可用性 — 尚无厂商提供 API,也没有任何主流推理网关在提供该模型的服务;要运行它,唯一的办法就是自己搭建大约 756GB 到 1.5TB 的权重

服务支持——该架构属于已知的DSA-MoE系列,这类架构通常能较快获得运行时支持,但目前尚未有框架宣布支持此特定检查点

你实际上可以用它做什么

具体来说,今天有三件事是成立的。第一,你可以下载 Atria Dawn Preview——MIT 许可证同时覆盖两个检查点,而 FP8 版本让存储和推理服务的资源核算比 BF16 原版明显更容易,不过两者都需要多 GPU 才能运行。第二,你无法在任何地方调用它:没有托管端点,而这正是路由平台能发挥价值的情形。我们目前尚未路由 Atria Dawn Preview——它不在 OrcaRouter 上,本页面也不会假装相反——但同一个今天还没有 Atria 访问权限的密钥,已经能通过一个 API 访问其他 196 个模型,按提供商标价以 0% 加价透传,并在提供商之间自动故障转移。当 Atria Dawn Preview 接入某个已纳入路由的提供商时,它会在供应商价格数字更新的同一天以标价出现,这就是透传定价在实践中的含义。在此之前,该模型是一个需要下载并自行运行的项目,而评估它最安全的方式是在你控制的硬件上,用你自己的独立基准测试——而不是只听模型卡上的说法。

Screenshot of the OrcaRouter models page showing the model catalogue with 196 models across 15 providers, one API key and one bill, with input price, context length and provider filters.

接下来看什么

四个信号决定这次悄无声息的发布究竟会不会成为你真正要跟进的事。第一个是发布公告:一篇正式的发布博客或论文,本应说明其架构、训练配方,以及“Preview”究竟预览的是什么。第二个是独立评测——一个如此规模的模型配上如此自信的模型卡,其 BrowseComp 和 CyberGym 的说法就需要在中立的测试框架下得到检验,而 Artificial Analysis 上完全没有它的条目,是最显眼的空白。第三个是托管可用性:一个以 MIT 权重开放、拥有 100 万上下文窗口的 744B MoE,恰恰是那种往往会在几周内出现在推理服务商上的模型,而第一个提供它的服务商将定下使用它的实际价格。第四个是家族问题——Atria 是一次性的还是系列的一员,以及“ASI”这个品牌标识是否暗示了这家实验室接下来想把这产品线带向何方。这一切都无法从仓库中得知,而这正是关键:仓库给了我们模型,接下来两周应该会给出其余答案。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新