一張 Atria Dawn Preview 的主視覺資訊圖,展示四大代理能力領域(探索、創造、交付、資安),以及一條標示 1M 上下文 · MIT 授權 · 開放權重的橫條。
Engineering & Research

Atria Dawn 預覽:InternLM 低調推出 744B 參數的代理式模型——儲存庫實際上說了什麼

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

上海人工智慧實驗室(Shanghai AI Laboratory)旗下的 InternLM 組織本週在 Hugging Face 上悄然發布了 Atria Dawn Preview——這是一款 744B 參數 MoE 代理式模型的預覽版,隨附 MIT 授權的權重、1M token 上下文視窗,以及一張對照 DeepSeek V4 ProKimi K3Qwen3.8-MaxGLM-5.3GPT-5.6 SolClaude Opus 5 測量而成的基準測試表。該儲存庫於 2026 年 9 月 11 日上線——也就是本文發布的三天前——並於 9 月 12 日跟進發布了搭配的 FP8 檢查點,而該廠商尚未在任何地方宣布這款模型:沒有部落格文章、沒有論文、沒有定價、沒有 API。如今存在的,是一張內容完整的模型卡,以及約 1.5TB 的開放權重。這使得 Atria Dawn Preview 成為一款悄然出貨的發布,而有趣的問題在於:這張模型卡能讓你驗證什麼、要求你憑信念接受什麼,以及這是否是該實驗室邁向更大型 Atria 系列的第一步——該實驗室這一年來一直在發布 Intern-S2 與 InternLumina 系列。

這張卡片就是公告

由於沒有發布公告,Hugging Face 上的模型卡片成了唯一的發聲管道。它將 Atria Dawn Preview 描述為由上海人工智慧實驗室開發的「新一代代理式模型的預覽版本」,該模型以 744B 參數的 MoE 基礎模型訓練而成,並鎖定「需要持續環境理解、工具使用與多步驟任務完成的研究與工程情境」。其宣傳標語——「From Research Questions To Verifiable Results」——旨在將開放式問題推向可執行、可驗證、可重現的成果,模型會在問題分析、方案設計、工具使用、程式碼實作、實驗執行、結果分析與失敗復原等環節中,結合任務目標與環境回饋。

這張卡片將該代理式範疇整理成四大能力領域,每個領域都著眼於端到端交付,而非聊天:

探索 — 檢索並整理證據、深度研究、將研究問題轉化為可執行的實驗計畫

創作 — 打造軟體、互動式應用程式、遊戲、資料視覺化,以及機器學習系統

交付 — 將文件、資料與設計需求轉化為報告、簡報及其他結構化交付成果

資安 — 分析安全問題、驗證弱點、套用修正,並在授權環境中重新驗證

卡片上還有但未解釋的:一個網站(atria-asi.com)、一個 GitHub 組織(atria-asi)鏡像了 README,以及一個 X 帳號(@AtriaASI)。「ASI」後綴是唯一真正奇怪的細節——卡片上沒有任何內容說明這個品牌名稱意在暗示什麼,而我們不會從中解讀出比儲存庫本身更多的含義。可以確定的是,這是一個獨立產品線的代號,有別於該實驗室一整年來使用的 Intern-S2 與 InternLumina 名稱。

Screenshot of the Hugging Face model card for internlm/Atria-Dawn-Preview showing the title, the Atria Dawn Preview branding, the architecture tag glm_moe_dsa, the MIT license, and the 'From Research Questions To Verifiable Results' description.

設定檔實際上是怎麼說的

權重與設定檔現已可供下載,這正是低調發布不再只是傳言的分界點。架構字串為 GlmMoeDsaForCausalLM——與 GLM 系列所採用的同一套 DSA 風格稀疏 MoE 家族,其設定在 78 層中每 token 路由 256 個路由專家中的 8 個(啟用參數量並未公布在模型卡上;以這種規模的 744B MoE 而言,大約落在數百億之譜)。上下文視窗設為 1,048,576 個 token——整整 1M,符合該實驗室近期其他發布所推進的長上下文級別。分詞器帶有圖像、影片、音訊與轉錄標記,然而聊天範本明確告訴模型它不具備多模態輸入能力,若收到媒體檔案也應如此表明——因此請把這些模態標籤視為沿襲而來的管線殘留,而非對視覺或音訊輸入能力的宣稱。

權重道出了實際情況:

檢查點 — 兩個:BF16/F32 指令模型,以及 Atria-Dawn-Preview-FP8,一個 FP8 量化的指令模型

大小 — BF16 版本約 1.5TB,分散於 353 個 safetensors 分片;FP8 版本則約為 756GB

授權——MIT,程式碼與權重皆適用,且卡片上無限制條款——對這種規模的實驗室發布而言,寬鬆程度非比尋常

發佈 — Hugging Face 與 ModelScope、英文與中文 README、儲存庫中的對話模板與生成設定

代管服務 — 卡片上未列出任何推論供應商,且任何地方都未提及 API

最後一行對整體框架至關重要:這是權重發布,不是服務上線。今天任何人想跑 Atria Dawn Preview,都得自行下載約 756GB(FP8)或 1.5TB(BF16)並自己架設服務——沒有廠商端點、沒有定價、沒有配額頁面。

基準表格,請仔細閱讀

這張卡片載有一份 16 行的基準測試表,將 Atria Dawn Preview 與 DeepSeek V4 Pro、Kimi K3、Qwen3.8-Max、GLM-5.3、GPT-5.6 Sol 及 Claude Opus 5 在代理式、工具使用、程式編寫與研究等基準上進行比較。表裡的每個數字都是廠商自行提報的——這些評測由該實驗室執行或委託進行,且無一經過獨立重現,因為目前尚不存在對 Atria Dawn Preview 的獨立評估。截至今日,Artificial Analysis 並未提供該模型的頁面。因此正確的解讀是「這是廠商所說的比較結果」,而非「這就是實際的比較結果」。

A scoreboard infographic for Atria Dawn Preview listing the vendor-reported benchmark highlights: BrowseComp 92.5, CyberGym 86.5, DeepSearchQA 96.0, BFCL v4 77.0, SWE-bench Pro 59.6, JobBench 50.3, with a footer noting all figures are vendor-reported on the model card with no independent scores yet.

在釐清這項前提之後,這些亮點確實相當有意思。Atria Dawn Preview 在 BrowseComp 上以 92.5 名列榜單前茅(對比 GPT-5.6 Sol 的 92.2 與 Claude Opus 5 的 90.8),在 CyberGym 上以 86.5 領先(領先 DeepSeek V4 Pro 的 83.3、GLM-5.3 的 84.5 以及 GPT-5.6 Sol 的 83.6),並在 DeepSearchQA 上達到 96.0。它也在 BFCL v4 上取得 77.0 的強勁成績,對比 DeepSeek V4 Pro 的 71.4 與 Kimi K3 的 69.1。弱點同樣具有參考價值:

Terminal-Bench 2.1 — 78.3,遠落後於 Qwen3.8-Max 的 89.3 與 Claude Opus 5 的 90.2,顯示其程式編寫代理能力尚未達到旗艦級水準

SWE-bench Pro — 59.6,領先 DeepSeek V4 Pro(58.3),但遠遠落後於 Claude Opus 5 的 74.7

MLE-bench Lite — 86.2,儘管有 Discovery 的宣傳賣點,仍落後 GPT-5.6 Sol(88.9)與 Claude Opus 5(88.0)

JobBench — 50.3,為卡片所列模型中最低者,也是若干列之一:在這些列中,一個開放式 744B 預覽版表現不如與它並排印出的封閉旗艦

誠實的總結:這張卡聲稱在研究檢索、以瀏覽器為基礎的任務,以及安全性驗證方面具有真正的優勢,而經典的程式編寫與知識工作列則讀起來處於中段。一份不特意挑選亮點的預覽,比一份什麼都贏的預覽更可信——但這些全都未經證實,而一個如此規模、擁有這麼多評估面向的模型,值得在任何人把整條流程押在它身上之前,接受獨立檢視。

在 InternLM 系列中的定位

Atria Dawn Preview 問世之際,正值該實驗室異常忙碌的一段時期。視覺與科學領域的旗艦模型 Intern-S2-397B 於 9 月 13 日登場,同一個家族中較小的成員(Intern-S2、Intern-S2 Mobius)自年中以來便已陸續發布,而專注於視覺的 InternLumina-U2 則在 9 月初上線。Atria 是一個獨立的代號,鎖定的是通用的代理式(agentic)工作,而非科學或模多模態的專門領域——而與採用 Apache-2.0 授權、擁有自身發布生態的 Intern-S2-397B 不同,Atria Dawn Preview 低調無聲地以 MIT 授權問世。Atria 究竟是單次的預覽版本,還是新系列的第一位成員,目前尚未獲得證實;「Preview」這個後綴,加上空蕩蕩的儲存庫、任何地方都看不到藍圖說明,都支持審慎的解讀。

尚未知曉的事

低調發布時,一個有用的習慣是列出仍未解決的事項。在 Atria Dawn Preview 上,這份清單很長:

一則公告——截至9月14日,實驗室、網站或X帳號都毫無動靜;這個repo是最先出現的,而這也正是近期幾個中國實驗室發布的模式,但「它們通常怎麼走」並不代表確認

論文或技術報告 — 未附任何連結;訓練資料、RL 流程,以及活躍參數量全都未公開

「Atria ASI」品牌——該網域與帳號確實存在,且名片將兩者連結起來,但其背後的實體為何、這些首字母縮寫代表什麼,則未加以說明

獨立評分——無;沒有 Artificial Analysis 的收錄、沒有在競技場中出現,也沒有任何可與該模型卡表格相互核對的資料

託管可用性——沒有廠商 API,目前也沒有任何大型推論閘道在提供這項服務;唯一能執行它的方法,就是自己架設大約 756GB 到 1.5TB 的權重

服務支援 — 此架構屬於已知的 DSA-MoE 系列,這類架構通常能迅速獲得執行階段支援,但目前尚未針對這個特定檢查點發布任何框架支援

你實際上可以用它做什麼

具體來說,今天有三件事成立。第一,你可以下載 Atria Dawn Preview——MIT 授權涵蓋兩個檢查點,而 FP8 版本讓儲存與服務的數學計算比原本的 BF16 明顯容易許多,儘管兩者都屬於多 GPU 的方案。第二,你無法在任何地方呼叫它:沒有代管的端點,而這正是路由平台發揮價值的情況。我們目前尚未路由 Atria Dawn Preview——它不在 OrcaRouter 上,而這個頁面也沒有假裝不是如此——但那把今天還沒有 Atria 的同一把金鑰,已經透過單一 API 觸及 196 個其他模型,供應商列表價格以 0% 加價直接傳遞,並在供應商之間自動容錯移轉。當 Atria Dawn Preview 登上已路由的供應商時,它會在廠商數字更新的同一天以列表價格出現,這就是直通定價在實務上的意義。在那之前,這個模型是一個下載後自行執行的專案,而評估它最安全的方式,是在你掌控的硬體上,用你自己獨立的基準測試——而不是只憑那張顯示卡的一面之詞。

Screenshot of the OrcaRouter models page showing the model catalogue with 196 models across 15 providers, one API key and one bill, with input price, context length and provider filters.

接下來要看什麼

四個信號決定這次低調發布是否會成為你會採取行動的故事。第一個是公告:一份正式的發布文章或論文會解答架構、訓練配方,以及「Preview」是預覽什麼的。第二個是獨立評估——一個如此規模的模型,配上如此自信的模型卡,需要將其 BrowseComp 和 CyberGym 的聲稱對照中立測試框架進行檢驗,而沒有任何 Artificial Analysis 條目是最明顯的單一缺口。第三個是託管可用性:一個開放的 744B MoE,具有 MIT 授權的權重和 1M 上下文視窗,正是那種傾向於在幾週內出現在推理供應商上的特徵,而第一個提供服務的將設定使用它的實際價格。第四個是家族問題——Atria 是一次性的還是系列,以及「ASI」品牌是否預示著實驗室打算接下來將該產品線帶向何方。這些都無法從 repo 得知,而這就是重點:repo 給了我們模型,接下來兩週應該會給我們其餘部分。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新