Atria Dawn Previewのヒーローインフォグラフィック。4つのエージェント能力領域(ディスカバリー、クリエイション、デリバリー、サイバーセキュリティ)と、1Mコンテキスト・MITライセンス・オープンウェイトのバーを表示。
Engineering & Research

Atria Dawn Preview:InternLM、744Bパラメータのエージェント型モデルを静かに公開——リポジトリが実際に語っていること

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

上海AIラボのInternLM組織は今週、Hugging FaceでAtria Dawn Previewをひっそりと公開した——744BパラメータのMoEエージェントモデルのプレビューで、MITライセンスの重み、100万トークンのコンテキストウィンドウ、そしてDeepSeek V4 ProKimi K3Qwen3.8-MaxGLM-5.3GPT-5.6 SolClaude Opus 5と比較して測定されたベンチマーク表を備えている。このリポジトリは2026年9月11日に公開された——本稿の3日前である——続いて9月12日にはコンパニオンFP8チェックポイントが登場したが、ベンダーはまだこのモデルをどこでも発表していない。ブログ記事も論文も価格もAPIもない。今日存在するのは、完全に記載されたモデルカードと約1.5TBのオープンウェイトだけだ。それによりAtria Dawn Previewは静かにリリースされたものとなり、興味深いのは、このカードで何を検証できるのか、何を信じて受け入れることを求めるのか、そしてこれが、今年を通してIntern-S2とInternLuminaシリーズを送り出してきたラボから出る、より大きなAtriaファミリーへの第一歩なのかどうかだ。

そのカードが告知です

発表がないため、Hugging Faceのカードがすべてを語っている。Atria Dawn Previewについて、Shanghai AI Laboratoryが開発した「新世代のエージェント型モデルのプレビュー版」であり、744BパラメータのMoE基盤モデルで訓練され、「継続的な環境理解、ツール使用、多段階のタスク完了を必要とする研究・エンジニアリングのシナリオ」を対象としていると説明している。キャッチコピー「研究上の問いから検証可能な結果へ」は、オープンエンドな問題を、実行可能で検証可能、再現可能な成果へと導くことを意味しており、このモデルは問題分析、解決策の設計、ツール使用、コード実装、実験実行、結果分析、失敗からの回復にわたって、タスクの目的と環境からのフィードバックを組み合わせている。

このカードは、そのエージェント型の対象範囲を4つの能力領域に整理しており、それぞれはチャットではなくエンドツーエンドの提供を目的としています:

ディスカバリー — エビデンスの収集と整理、深掘りリサーチ、リサーチ課題を実行可能な実験計画に変換すること

制作 — ソフトウェア、インタラクティブなアプリケーション、ゲーム、データ可視化、機械学習システムの構築

デリバリー — 文書、データ、デザイン要件をレポート、プレゼンテーション、その他の構造化された成果物へと変換すること

サイバーセキュリティ — セキュリティ上の問題の分析、脆弱性の検証、修正の適用、および許可された環境での再検証

またカード上にあるが説明されていないもの:ウェブサイト(atria-asi.com)、READMEをミラーしているGitHub org(atria-asi)、そしてXアカウント(@AtriaASI)。「ASI」という接尾辞が唯一本当に奇妙な点だ — カードには、このブランディングが何を暗示することを意図しているのか何も書かれておらず、私たちはリポジトリ自体が読み取っている以上に、そこから深読みするつもりはない。分かっているのは、これが別個の製品ラインのコードネームであり、ラボが今年ずっと使ってきたIntern-S2やInternLuminaという名称とは別だということだ。

Screenshot of the Hugging Face model card for internlm/Atria-Dawn-Preview showing the title, the Atria Dawn Preview branding, the architecture tag glm_moe_dsa, the MIT license, and the 'From Research Questions To Verifiable Results' description.

コンフィグが実際に述べていること

重みと設定は本日ダウンロード可能になっている。静かなリリースが噂でなくなるのは、まさにここだ。アーキテクチャ文字列は GlmMoeDsaForCausalLM — GLM 系が用いているのと同じ DSA スタイルのスパース MoE ファミリーで、設定は 78 層にわたりトークンあたり 256 個のルーテッドエキスパートのうち 8 個をルーティングする(アクティブパラメータ数はモデルカードに公開されていない。この形状の 744B MoE では数百億台に収まる)。コンテキストウィンドウは 1,048,576 トークンに設定されている — 完全な 1M で、ラボが最近の他のリリースで推し進めてきた長コンテキストクラスに一致する。トークナイザーは画像、動画、音声、文字起こしのマーカーを備えているが、チャットテンプレートはモデルにマルチモーダル入力能力はないと明示的に伝え、メディアを渡された場合はそう言うように指示している — したがってモダリティタグは継承された配管として扱うべきであり、視覚や音声入力の主張ではない。

重みが実際の状況を物語っている:

チェックポイント — 2つ:BF16/F32 instructモデルと、FP8量子化されたinstructモデルであるAtria-Dawn-Preview-FP8

サイズ — BF16リリースは353個のsafetensorsシャードで合計約1.5TB、FP8リリースは約756GB

ライセンス — MIT、コードと重みの両方が対象で、モデルカードに制限条項なし — この規模のラボリリースとしては異例なほど寛容

配布 — Hugging Face と ModelScope、英語と中国語の README、リポジトリ内のチャットテンプレートと生成設定

ホスティング — カードに推論プロバイダーが一切記載されておらず、APIについてもどこにも言及されていません

その最後の行は位置づけとして重要だ。これはサービスの開始ではなく、重みのリリースだからだ。今日 Atria Dawn Preview を実行したい人は、約756GB(FP8)または1.5TB(BF16)をダウンロードして自分で配信しなければならない。ベンダーのエンドポイントも、価格設定も、クォータページもない。

ベンチマーク表を注意深く読んでください。

このカードには、Atria Dawn Preview を DeepSeek V4 Pro、Kimi K3、Qwen3.8-Max、GLM-5.3、GPT-5.6 Sol、Claude Opus 5 と、エージェント、ツール使用、コーディング、リサーチの各ベンチマークで比較する16行のベンチマーク表が載っている。表中の数値はすべてベンダー報告であり、評価を実施または委託したのはそのラボで、独立に再現されたものは一つもない。Atria Dawn Preview の独立評価はまだ存在しないからだ。本日時点で、Artificial Analysis はこのモデルのページを返さない。したがって正しい読み方は「ベンダーがこう比較されると言っている」であって、「実際にこう比較される」ではない。

A scoreboard infographic for Atria Dawn Preview listing the vendor-reported benchmark highlights: BrowseComp 92.5, CyberGym 86.5, DeepSearchQA 96.0, BFCL v4 77.0, SWE-bench Pro 59.6, JobBench 50.3, with a footer noting all figures are vendor-reported on the model card with no independent scores yet.

その注意点を明確にしたうえで、ハイライトは実に興味深い。Atria Dawn Preview は、BrowseComp では92.5で記載された分野の首位に立ち(GPT-5.6 Sol の92.2、Claude Opus 5 の90.8に対して)、CyberGym では86.5(DeepSeek V4 Pro の83.3、GLM-5.3 の84.5、GPT-5.6 Sol の83.6を上回る)、DeepSearchQA では96.0を記録している。また、BFCL v4 でも77.0という強いスコアを打ち出しており、DeepSeek V4 Pro の71.4、Kimi K3 の69.1と対比している。弱点も同じくらい示唆に富む:

Terminal-Bench 2.1 — 78.3で、Qwen3.8-Maxの89.3やClaude Opus 5の90.2には大きく後れを取っており、コーディングエージェントとしての能力はまだフラッグシップ級には達していないことをうかがわせる

SWE-bench Pro — 59.6、DeepSeek V4 Pro(58.3)を上回るものの、Claude Opus 5の74.7には远く及ばない

MLE-bench Lite — 86.2。Discovery の売り文句にもかかわらず、GPT-5.6 Sol(88.9)と Claude Opus 5(88.0)に後れを取っている

JobBench — 50.3、カードに記載されたモデルの中で最低値であり、オープンな744Bプレビューが、隣に併記されたクローズドなフラッグシップを下回るいくつかの行の一つ

正直な要約:そのカードは、研究検索、ブラウザに基づくタスク、セキュリティ検証において真の強みを主張している一方、従来型のコーディングとナレッジワークの行は中位に見える。何もいいとこ取りしないプレビューは、すべてに勝つプレビューよりも信頼できる——しかしそのいずれも検証されておらず、この規模でこれほど多くの評価対象を持つモデルは、誰かがパイプラインをそれに賭ける前に、独立した検証に値する。

InternLMのラインナップにおける位置づけ

Atria Dawn Preview は、このラボにとって異例に慌ただしい時期の真っただ中に登場した。視覚と科学のフラッグシップである Intern-S2-397B は9月13日に現れ、その同ファミリーの小型版である Intern-S2 と Intern-S2 Mobius は年央から提供されてきた。また、視覚に特化した InternLumina-U2 は9月初めに公開された。Atria は、科学やマルチモーダル特化ではなく汎用的なエージェント作業を狙った別個のコードネームだ。そして、Apache-2.0 ライセンスを採用し独自の発表エコシステムを備える Intern-S2-397B とは異なり、Atria Dawn Preview は MIT の下で大々的な告知もなく登場した。Atria が一度限りのプレビューなのか、新シリーズの最初の一員なのかは確認されていない。「Preview」という接尾辞と、どこにもロードマップの記述がない簡素なリポジトリは、慎重な解釈を支持している。

まだ分かっていないこと

静かなリリースで役に立つ習慣は、まだオープンのまま残っているものを列挙することだ。Atria Dawn Preview では、そのリストは長い:

ある告知 — 9月14日時点で、研究所からも、ウェブサイトからも、Xアカウントからも何も出ていない。最初に現れたのはリポジトリで、これは最近の中国系ラボのリリースのいくつかで見られた流れだが、「いつもの流れ」は確認にはならない

論文またはテクニカルレポート — リンクなし。学習データ、RLパイプライン、アクティブパラメータ数はいずれも未公開

「Atria ASI」のブランディング — ドメインとハンドルは存在し、カードはそれらを結びつけているが、その背後にどのような実体があるのか、また頭文字が何を表すのかは明示されていない

独立系スコア — なし。Artificial Analysis への登録もなく、アリーナへの参加もなく、カードの表と照合できるものは何もない

ホスト型での提供状況 — ベンダーAPIはなく、主要な推論ゲートウェイもまだこれを提供していないため、実行する唯一の方法は約756GB~1.5TBの重みを自分で立ち上げることです

サービング対応 — アーキテクチャは既知のDSA-MoE系譜であり、これは比較的早期にランタイム対応がなされる傾向がある種類のものですが、この特定のチェックポイントに対するフレームワーク対応は発表されていません

それで実際に何ができるか

具体的に言えば、現時点で当てはまることが3つあります。第一に、Atria Dawn Preview はダウンロードできます。MITライセンスは両方のチェックポイントを対象としており、FP8リリースはBF16のオリジナルよりもストレージとサービングの計算をかなり楽にしてくれますが、どちらにせよマルチGPU前提の話です。第二に、どこからも呼び出すことはできません。ホスト型エンドポイントは存在せず、まさにそうした状況こそ、ルーティングプラットフォームの存在価値が発揮される場面です。当社はまだ Atria Dawn Preview をルーティングしていません。OrcaRouter には搭載されておらず、このページもそうでないふりはしていません。ですが、今日 Atria を提供していない同じキーが、1つの API を通じてすでに他の196のモデルに到達でき、プロバイダーのリスト価格は0%のマークアップでパススルーされ、プロバイダー間の自動フェイルオーバーも行われます。Atria Dawn Preview がルーティング対応プロバイダーに到達すれば、ベンダーの数値が更新されたその日にリスト価格で登場します。これがパススルー価格設定の実際の意味です。それまでは、このモデルはダウンロードして実行するプロジェクトであり、それを評価する最も安全な方法は、自分で管理するハードウェア上で、独自の独立したベンチマークを用いることです。カードのうたい文句を鵜呑みにするのではなく。

Screenshot of the OrcaRouter models page showing the model catalogue with 196 models across 15 providers, one API key and one bill, with input price, context length and provider filters.

次に見るもの

4つのシグナルが、この静かなドロップがあなたの行動につながるストーリーになるかどうかを決める。第一は発表だ。正式なローンチ記事か論文であれば、アーキテクチャ、学習レシピ、そして「Preview」が何のプレビューなのかに答えるはずだ。第二は独立した評価——これほど大規模なモデルがこれほど自信に満ちたカードを伴うなら、そのBrowseCompとCyberGymの主張は中立のハーネスで検証される必要があり、Artificial Analysisのエントリが一切ないことが、最も目立つ唯一の空白だ。第三はホスト型での提供状況だ。MITの重みと1Mコンテキストウィンドウを備えたオープンな744B MoEは、まさに数週間以内に推論プロバイダー上に現れがちなプロファイルであり、最初にこれを提供する事業者が、それを使う際の実質的な価格を決めることになる。第四はファミリーに関する問い——Atriaが単発なのかシリーズなのか、そして「ASI」というブランディングが、ラボがこの系統を次にどこへ持っていくつもりなのかを示しているのかどうか。それらのどれもリポジトリからは知り得ない、そしてそれこそが要点だ。リポジトリはモデルを与えてくれた、次の2週間が残りを与えてくれるはずだ。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新