生成されたタイトルカードのタイトルは「Union Alpha vs Qwen3.8 Flash」、サブタイトルは「両方を実行した唯一のテストで1点差」。その下に3枚の角丸カードが並び、「Official A: 136/157 vs 137/157」「コンテキスト: 262,144 vs 1,000,000トークン」「初回トークンまでの時間: 10.00 s vs 6.62 s」と表示されている。フッターにはSMF ClearinghouseによるOfficial A、レイテンシはOrcaRouterによる過去7日間の値と表示されている。
Guides & Insights

Union Alpha vs Qwen3.8 Flash:たった1点がすべてを物語る

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Union Alpha と Qwen3.8 Flash は、両方を測定した唯一のテストで 1 点差につけている。SMF Clearinghouse Official A スイート — 157 テスト、推論オフ — では、Union Alpha が 136 点、Qwen3.8-Flash-Next のローカル実行が 137 点を記録した。これはどちらのモデルにとっても最も僅差の直接対決結果であり、同時にこの比較で最も誤解を招く数字でもある。なぜなら、2 つのエントリーは同じ条件で実行されておらず、そのうち実際に今すぐレンタルできるモデルは片方だけだからだ。

1点差が教えてくれることと教えてくれないこと

まず、それが何を確立しているかから始めよう。Union Alpha は、単純な意味でのハッタリではない——157項目の広範なテストスイートでエラーがゼロ、推論が完璧(30/30)、ツール使用も完璧(2/2)というのは、中身のないエンドポイントが生み出せるものではない。そのコーディング結果は26/30、数学は24/30で、信頼に足る領域に位置づける。そしてライティングのスコアは2/5で、汎用的な散文作業にはほど遠いことを示している。

さて、ここからが土台となる注意点です。

Qwen3.8 Flash のエントリーは、オープンウェイトのチェックポイントである Qwen3.8-Flash-Next をローカルで実行したものであり、ホスト型の Qwen3.8 Flash API ではありません。ローカルでの提供とは、独自の量子化、独自の推論スタック、独自のツール呼び出しパーサーを意味します。それらのいずれも、ホスト型エンドポイントが返す内容と一致する保証はなく、テストを実施した人々はまさにその理由で、この比較は決定的ではないと指摘しました。

1つのスイートはプロファイルではない。Official A はカテゴリごとに広いが浅い:tools は2テスト。2テストのツールカテゴリで2/2を取るのは良い兆候であり、エージェント的信頼性の証拠ではない。そして Union Alpha は、エージェント型かつコーディング向けのモデルとして明確に位置づけられている。その測定器は、主張に隣接する何かを測定している。

そしてその1点自体は、157テストのスイートのノイズの中にあります。136と137は「同じ帯域にある」と捉えるべきで、順位付けとして捉えてはいけません。

並べて表示

• コンテキストウィンドウ — Union Alpha 262,144トークン 対 Qwen3.8 Flash 1,000,000トークン提供(ネイティブ262,144、YaRNで拡張)。

• 最大出力 — Union Alpha 131,072トークン 対 Qwen3.8 Flash 131,000トークン。実質同等です。

• 入力 — Union Alpha ではテキストと画像、それに対し Qwen3.8 Flash ではテキスト、画像、動画。

• 料金 — Union Alpha のプレビュー期間中は $0 であるのに対し、Qwen3.8 Flash は入力 $0.150/M、出力 $0.470/M、キャッシュ読み取り $0.018/M、キャッシュ書き込み $0.230/M。

• 推論の制御 — Union Alpha にはなし。それに対し、Qwen3.8 Flash にはデフォルトで有効な思考モードがあり、無効化も可能。

• 初回トークンまでの時間 — Union Alpha 10.00 秒 p50 対 Qwen3.8 Flash 6.62 秒 p50。どちらも同じ7日間の期間に当社のエンドポイントで測定。生のデコード速度は、評判から想像されるほど差がない:毎秒170トークン 対 103。

• 出自 — 匿名の運営者によるもので、重みは非公開。対照的に Alibaba/Qwen は Qwen3.8-Flash-Next の重みを Hugging Face と ModelScope でオープンソース化している。

Generated two-column comparison scoreboard for Union Alpha and Qwen3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published weights, 10.00 s p50 time to first token. Qwen3.8 Flash column: context window 1,000,000 tokens served, max output 131,000 tokens, text, image and video input, $0.150 input and $0.470 output per 1M tokens, Qwen3.8-Flash-Next weights open-sourced, 6.62 s p50 time to first token. Footer reads Official A per SMF Clearinghouse with latency and errors per OrcaRouter over the last 7 days.

Qwen3.8 Flash:6Bアクティブという効率性への賭け

Qwen3.8 Flashは2026年8月26日に、オープンウェイトのQwen3.8-Flash-Nextチェックポイントのプロダクション向けマネージド版としてリリースされ、Alibabaが同時に公開しました。これは125BパラメータのMixture-of-Expertsモデルで、トークンあたり約6Bのパラメータを活性化し、さらに51BのN-gram埋め込みパラメータを持ち、Gated DeltaNetとスパースアテンション・インデクサーを組み合わせたハイブリッドアテンションに基づいています。

ベンダー側の説明はトレーニングの経済性に関するものだ。Alibabaは、その実行コストがQwen3.7-Plusの約9分の1であり、高いキャッシュヒット率を伴う100万トークンのワークロードで、プリフィルが最大7.6倍、デコードが最大4.9倍高速になると主張している。これらはベンダー公表の数値であり、独立に再現されたものではない。

そのベンチマーク表もベンダー報告によるもので、再現されていない:SWE-bench Pro 62.5、DeepSWE v1.1 58.7、SWE-bench Multilingual 81.0、NL2Repo 48.1、CoWorkBench 73.9、JobBench 55.7、RealWorldQA 88.5、LVBench 76.6、AndroidWorld 84.5。マーケティング側に引用して返す価値のある数字は Humanity's Last Exam の 35.9 で、同じ比較では Claude Opus 4.6 の 40.0 を下回っている。

自社のモデルページでは、公開ベンチマークのセクションが依然として「保留中」と表示されたままです。第三者がまだ評価を行っていないためです。一方で、私たちには自社のトラフィックがあります。初回トークンまでの中央値は6.62秒、出力レートは毎秒103トークン、そしてエラー率は4.5%です。このエラー率は注視する価値があるほど高く、ローンチ投稿ではなく稼働中のエンドポイントを測定して初めて見えてくる類の数値です。

The OrcaRouter model page for Qwen3.8 Flash, showing a 1M-token context window, 131K max output, text plus image and video input, $0.15 per million input tokens and $0.47 per million output tokens, a p50 time to first token of 6.62 s, and 2,322.0M tokens of traffic over seven days.

Union Alpha: オーナーのいないモデル

Union Alphaは2026年9月16日にサードパーティのカタログに登場し、OrcaRouterの無料プランで提供されている。名前の付いたラボも、重みも、ライセンスも、パラメータ数も、アーキテクチャに関する記述もない。そのプロバイダーフィールドには「Stealth」と記されている。

少なくともそのエンドポイントの仕様は読み取れる:262,144トークンのコンテキスト、最大出力131,072トークン、テキストと画像の入力で出力はテキストのみ、ツール呼び出し、JSON出力、temperature、top_p、max_tokens、そして推論制御は一切ない。ツール選択は事実上"auto"のみを尊重する。その無料期間は約1週間で、レート制限があり、プレビュー後の価格は発表されていないと説明されている。

主張されている「広範な汎用タスクにわたるフロンティア級の性能」という言葉は、事業者による報告であり、監査を受けていない。136/157 という Official A の結果だけが、存在する唯一の独立した測定値である。

The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

スピードの領域では、彼らは似て見えなくなる

主要なスループット数値は、あなたが期待するようにはそれらを区別しない。そして、その理由は理解する価値がある。

当社独自のルーティングテレメトリによると、過去7日間で Qwen3.8 Flash は毎秒103出力トークンでストリーミングし、初回トークンまでの時間(p50)は6.62秒、エラー率は4.5%でした。同じ方法で測定した Union Alpha は、毎秒170トークンでストリーミングします。生のデコード速度では、匿名モデルのほうがこの2つの中で高速です。

それがしないのは、起動することだ。Union Alphaのp50とp95の初回トークン到達時間はどちらも10.00秒に張り付いており、つまり全リクエストの少なくとも半数は、最初のトークンが現れるまで10秒以上待つことになる。同じ期間のエラー率は7.7%で、Qwenの約1.7倍だ。前半の各セクションが依拠している157テストのOfficial A実行は、実時間で4.6時間を要し、テストあたりのレイテンシは中央値91.9秒、平均104.8秒で、4件のテストがテストハーネスの300秒タイムアウトに達した。ローンチ日にそれを実行した独立系テスターたちは、我々のエンドポイントが示すよりもはるかに低いスループットを報告した。これは、初日の膨大な負荷を依然として吸収しているサービスに当然予想されることだ。

つまり実用的な違いはデコード速度ではない。最初のトークンが返るまでの時間と信頼性だ。Union Alpha はインタラクティブな用途には使えない——オートコンプリートも、インライン支援も、タイトなエージェントループも——なぜなら10秒の沈黙はハングと区別がつかないからだ。向いているのは非同期の作業だ。夜間バッチジョブ、長い文書の処理、オフライン評価実行——最初のトークンを待っているものは何もなく、7.7%の失敗率がリトライで吸収されるような場面だ。

Qwen3.8 Flashは毎秒103トークン、初回トークンまでの時間の中央値が6.62秒でも、速いとは言えない。正直に言えば、どちらも遅く、しかもおよそ13リクエストに1回失敗するのは、そのうち片方だけだ。

効率性の議論、そして誰がそれを唱えることを許されるのか

アリババはトレーニングコストに関する主張をしている。トレーニングにかかるコストはQwen3.7-Plusの9分の1で、トークンあたり60億のアクティブパラメータなので、提供コストが安い。それは、重みが存在し、その系譜が文書化されているモデルについての主張である。

Union Alphaの効率性をめぐる話は、明言されるというよりほのめかされている——無料で呼び出せる256Kの匿名モデルだ。無料は安価と同じではない。そのGPUの費用は誰かが払っているし、プレビューには明示された終了時期があり、運営者自身が速度のために調整していたと認めていることは、サービングの経済性がいまだ固まっていないことを示唆している。1週間は無料で、その後は価格がつけられないモデルは、効率性の主張がそのウィンドウとともに失効してしまう。

それに賭けることなく未知を試す

この特定の対決を頭に留めておく価値があるのは、それが未検証のモデルを試すための最も安価なテストだからだ。Qwen3.8 Flash は既知の存在だ。名の知られたベンダー、オープンウェイト、公表された(ベンダー色の強いものであっても)ベンチマーク、そして実際のトークン単価 $0.150/$0.470。Union Alpha は未知であり、価格はゼロで、その競争上の主張のすべては 157 件のテスト結果ひとつに依存している。

選ぶのではなく、未知のものはフェイルオーバールールの背後に置こう。OrcaRouter はプロバイダーの定価を 0% のマークアップでそのまま通し、プロバイダー間の自動フェイルオーバーをサポートしている。そのため、レート制限に達したか消えてしまった Union Alpha エンドポイントは、午前3時に失敗したジョブとして表面化するのではなく、まだ応答しているモデルにフォールスルーする。両方のモデルは同じキー上にあるので、実験にかかるのは2つ目の統合ではなく設定変更だけだ。しかも、無料ウィンドウが閉じたらルーティングを切り替えられるのだから、どちらもあなたが擁護しなければならない決定である必要はない。

評決

Qwen3.8 Flashは、その上に構築すべきモデルだ。アクティブパラメータは60億、オープンソース化された同系統の重み、100万トークンのウィンドウ、動画入力、実測毎秒103トークン、そして予測可能な公表価格を備えている。そのベンチマークはベンダー自己申告であり、エラー率は監視する価値がある。しかし、それには所有者がいて、その所有者はしっかり出荷している。

Union Alpha は測るべきモデルだ。Official A での1点差は本当に興味深い——これが何であれ、おもちゃではないことを示唆している——そして、$0 で 131K の出力上限と視覚入力付きなら、1週間あなたの注意を向ける価値がある。しかし、7.7% のエラー率の匿名オペレーターによって出された、1つのスイートにおける1点差は、乗り換える理由ではなく調査する理由である。

注目すべきは、これまでずっとこれを決着させてきたのと同じもの、つまり名前だ。このシリーズの前回のエントリーであるOx Alphaは、ZhipuのGLM-5.3-Flashとして登場してから6日後に明らかになった。Union Alphaに名前が付けば、比較は点数ではなく価格の話になる。

既知の部分は価格もドキュメントも整っています:Qwen3.8 Flash のモデルページには $0.150/$0.470 の料金、提供コンテキスト 1M トークン、出力上限 131K が示されていますが、公開ベンチマークはまだ保留中です。