「Ling-3.1-flash vs Qwen3.8-Flash」というタイトルの編集用ヒーローカードを生成しました。サブタイトルは「同じ問いへの2つの答え:高速ティアをどう構築するか?」です。左パネルは「スケールアップして発表」という見出しで、キャプション「合計約560B · アクティブ約25B · 1Mコンテキスト」とタグ「重み:近日公開」を備えています。右パネルは「縮小してリリース」という見出しで、「合計125B · アクティブ6B · Qwen4のプレビュー」とタグ「重み:Hugging Faceで公開」を備えています。
Engineering & Research

Ling-3.1-flash対Qwen3.8-Flash:高速ティアを構築する2つの方法、出荷されるのはそのうち1つだけ

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

中国の2つのラボはこの秋、同じ問題——エージェントループ内に置けるほど十分に優れた、安価で高速なモデルをどう作るか——を検討し、正反対の答えにたどり着いた。2026年9月30日にAnt Groupが発表したLing-3.1-flashは、約5,600億パラメータのMixture-of-Expertsで、トークンあたり約250億パラメータを活性化し、コンテキストウィンドウは最大100万トークンとされ、「まもなく」オープンソース化する意向が示されている。2026年8月26日にAliba​s Qwe​nチームがリリースしたQwen3.8-Flashは、1,250億パラメータのマルチモーダルMixture-of-Expertsで、トークンあたり約60億パラメータを活性化する。重みはすでにHugging Face上でQwen3.8-Flash-Nextという名前で公開されており、QwenCloud APIで稼働するプロダクションモデルで、入力100万トークンあたり0.15ドル、出力100万トークンあたり0.47ドル、SGLangではday-0サポートがある。一方のラボは規模を拡大して発表した。もう一方は規模を縮小して出荷した。その違いは、どちらのラボが公表したどのベンチマークよりも示唆に富む。

これもまた、この比較を注意深く読む必要がある理由だ。Ling-3.1-flash には重みも、ライセンスも、モデルカードも、API 価格も、独立した評価もない。公開されている記録は、告知投稿、ベンダーのベンチマークチャート、そして Ant 自身の Ling Studio 製品内の一枠だけである。Qwen3.8-Flash にはそれらすべてが揃っており、さらに、アリババの従業員ではない人々によって使われ始めてから4週間という先行期間がある。アーキテクチャ選択の比較は公平だ。能力の比較は、まだ公平ではない。

2つの設計判断、そしてそれらがなぜ分かれるのか

Qwenの狙いは、高速層が単にフラッグシップより小さいだけでなく、構造的にそれとは異なるべきだという点にある。Qwen3.8-Flashは1250億パラメータのうち60億を活性化し、スパース性はおよそ95%で、その能力は生の広がりからではなく、計算がどこにルーティングされるかから得ている。アリババは、その基盤となるアーキテクチャが、Gated DeltaNetとQwen Sparse Attention、そしてN-gram埋め込みテーブルを組み合わせたもので、Qwen4世代の早期プレビューであると明言している。高価なモデルがその上に構築される前に、推論エンジン、量子化ツール、デプロイパターンがそれを中心に成熟できるよう、意図的に早く公開されたのだ。その結果、構造上トークンあたり安価なモデルとなっている。トークンごとに約60億パラメータ分の処理を行い、アリババが設定した価格は100万トークンあたり入力0.15ドル、出力0.47ドルだ。

Antの賭けは、発表から読み取れる限りでは、非常に長いコンテキストを備えた従来型のスケーリングに近い。Ling-3.1-flash は大きなアクティブ比率を保っている——5600億のうちトークンあたり約250億パラメータ、つまり約22分の1——そして最大100万トークンのウィンドウをうたっており、これは前世代の Ling が提供するものの4倍だ。Ling Studio アプリは、これを「汎用エージェント、検索、日常的なオフィス作業、ソフトウェア/コード開発」向けに作られたと説明している。これは高速ティアの位置づけだが、パラメータの経済性ははるかに重いモデルのそれである。同一の入力では、25Bのアクティブパラメータを通るトークンは、6Bを通るトークンの約4倍の計算コストがかかる。価格設定の決定が関与する前の話だ。

どちらのアプローチも間違いではなく、「何が低コストモデルの限界を決めるのか」という問いに対して、どちらも擁護可能な答えだ。Qwenは、限界を決めるのはスパース性と新しいアテンションスタックだと考えている。Antは、限界を決めるのはコンテキストと世界知識であり、そのための計算資源を確保できると考えている。読者にとって両者を分けるのは設計思想ではなく、届け方だ。すなわち、ダウンロードして計測できる設計か、読んで知るしかない設計かである。

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

それぞれがあなたに何のコストを強いるのか、そしてそれが実際に何を意味するのか

価格差は微妙などころではなく、僅差でもない。Qwen3.8-Flashは100万入力トークンあたり$0.15、100万出力トークンあたり$0.47、100万キャッシュ読み取りあたり$0.018で公開されている——Alibabaの発表、ベンダーの本番モデルカード、そして当社が提供するルーティング済みモデルページのいずれでも同じ数字であり、3つの情報源と突き合わせたときに0%マークアップのパススルーがどう見えるかといえば、こういうことだ。AntはLing-3.1-flashについてレートを一切公表していない——API価格も、キャッシュ割引も、比較できるものも何もない。Lingシリーズで唯一公開されている数字は前世代のもので、100万あたり入力$0.075、出力$0.22と記載されており、Qwenの入力レートのおよそ半分、出力レートの半分未満だ。新しいLingティアが旧世代と同水準の価格になるなら、紙の上ではQwen3.8-Flashを下回るだろう。だが、25Bのアクティブパラメータが示唆する計算資源に見合う水準の価格になるなら、そうはならない。どちらにせよそれは推測だ。その数字が存在しないのだから。

コンテキストは、Lingの主張が本当に大きくなる領域だ。AntはLing-3.1-flashについて最大100万トークンと謳っている。Qwen3.8-Flashは、本番APIでは1Mトークンのデフォルトコンテキストを提供し、オープンウェイトでは262,144トークンのネイティブウィンドウを備え、拡張可能だ。Lingの数値には2つの注意点があり、どちらも解消されていない。第一に、「最大1M」は仕様であり、測定値ではない——Antの外部からは誰も呼び出せないモデルについて、長コンテキスト検索の挙動を公開した者はいない。第二に、前世代のLingでも、宣伝されたウィンドウとその背後にあるアーキテクチャの説明との間にまったく同じ隔たりがあり、答えが出たのは、重み、フォーマット、コンテキスト上限がようやく公開されたときだけだった。見出しの1Mは約束だ。Qwen3.8-Flashの1Mは、Antの主張と突き合わせられる、提供済みのデフォルトだ。

なぜ「プレビュー」がこの一方で正直な言葉なのか

Alibaba自身によるQwen3.8-Flashの位置づけは、製品名で出荷されたアーキテクチャプレビューというものだ。オープンウェイトに「Next」という接尾辞が付いているのは、まさに誰もプロトタイプをチューニング済みのサービングモデルと混同しないようにするためである。この位置づけはマーケティングではなく、実際の出来事によって裏づけられてきた。SGLangはリリース当日にQwen3.8-Flash-Nextのday-0サポートを出荷し、同モデルはTransformers、vLLM、TokenSpeed向けにも設定され、その後ウェイトは量子化コミュニティ各所で取り上げられてきた。バージョンはすぐにありふれたものになった。それが出荷済みモデルの姿である。

Antの発表は、一段階早い時点で同じ形をとっている。すなわち、リリースに先立つ仕様の公開であり、モデルはまもなくオープンソース化されるという明示的な表明を伴っている。これは正当なローンチのやり方だ——Ling-3.0-flashは7月にまさにその道筋をたどり、重みは約2週間後の8月7日にMITの下で公開された。だが、今日の両プロジェクトの状況は比較できるものではなく、どれほどチャートを読み込んでもその隔たりは埋まらない。外部の人間がそれぞれに何をもたらせるかについては、具体的に述べる価値がある。

今日、Ling-3.1-flashについて独立に検証できるのは、発表が存在し9月30日付であること、パラメータ数・アクティブパラメータ数・コンテキストの数値がAnt自身のものであること、モデルがAntのLing Studio製品に登場していること、そして重み、ライセンス、モデルカードが公開されていないことだ。Qwen3.8-Flashについて独立に検証できるのは、重みがBF16とFP8でダウンロード可能であること、ライセンス条項が読めること、API価格が公開されていること、そしてAlibabaのベンチマーク主張が8月下旬以降、再現可能な状態にあることだ。2番目のリストのほうが長く、これが比較のすべてを縮図にしたものだ。

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

実際にその2つがどのように評価されるか

AntはLing-3.1-flashのベンチマークカードを公開し、それをGPT-5.6 Sol、Claude Opus 5、Kimi K3、2つのGLM変種、DeepSeek-V4.1-Flashと比較している。主要数値はGDPVal-AA v2.1で1,673 Elo、FrontierSWEで75.16、HealthBench Professionalで65.35だ。そのカードには、誰かが数値について議論する前に、2つの問題が横たわっている。1つ目は比較対象のセットだ。Antが選んだフロンティアモデルはどちらも1世代遅れている。Claude Opus 5.5とGPT-6 Solは2026年9月22日に提供開始され、現在はルーティング可能だからだ。つまりこのカードは、10月のモデルを現在のフロンティアではなく7月のフロンティアと比較している。2つ目はカード自体の脚注で、HealthBench Professionalの結果は「AQ環境」から得られたもので、モデルのヘルスケア能力は現在AQでのみ体験できると述べている。AQは公開ドキュメントでは定義されていない環境だ。評価環境が明示されていない主要スコアは、原理的にさえ再現できない。

対照的に、Qwen3.8-Flash の同種の主張は、重みがすでに公開された後に出されたもので、アリババは、能力の源泉はパラメータ数ではなくスパース率にあるという、誰でも検証できる主張に自らの立ち位置を賭けた。4週間の使用は評決ではないが、その主張がもはや異論のないものではなくなったと言えるには十分な長さだ——これはモデルにとって有用な状態である。

今日、これで実際に何をするか

開発者にとって、実務上の線引きは単純だ。Ling-3.1-flash は今週採用できるコンポーネントではない。呼び出せるエンドポイントも、ホストできる重みも、確認すべきライセンスも、予算を立てるべき価格もない。最終的なモデルがどうなるにせよ、今役に立つのはトリガーを設定することだ — 重みが公開された、ライセンスが許容的になった、FrontierSWE の独立したスコアが 75.16 の近くに達した — そして再検討する。前世代自身の歴史が示すとおり、重みは発表の2週間後に到着することがある。だからそのトリガーはすぐに発動するかもしれない。

Qwen3.8-Flash はすでに構成要素です。それはルーティングモデルとして当社のカタログ上で公開されており、プロバイダーの定価のままマークアップゼロ——ルーティングカードには入力 $0.15、出力 $0.47、キャッシュ読み取り100万件あたり $0.018 が表示されており、これは Alibaba が公表している数値と同じで、マークアップ0%ポリシーがスライドの上ではなく実際に意味するのはこういうことです。1つのキーの背後でそれは Claude Opus 5、GPT-5.6 Sol、DeepSeek-V4.1-Flash と並んでいるので、Ant が誘う比較——候補と現在のフロンティアの対決——は、2つの統合を維持する代わりに設定を2つのルートに向けるだけで実行でき、プロバイダーが週末に揺らぐときは自動フェイルオーバーが処理します。これがアーキテクチャの議論と実験の違いです。

下せる限りでの判定はこうだ。Qwenはより大胆なアーキテクチャ上の賭けに出て、それを早い段階で公開し、人々に徹底的に検証させる自信があった。Antはより重い賭けをした——より多くのパラメータ、トークンあたりのより多くのアクティブ計算、より長いコンテキスト——そして今のところ、モデルではなくチャートを公開している。そのチャートは良く見える。そのチャートは、誰もが手にしている唯一のものでもある。

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新