「Union Alpha vs Gemini 3.8 Flash」と題され、サブタイトルが「一方にはスコアがあり、もう一方には主張がある」の生成されたタイトルカードが、次の3枚の角丸カードの上に表示されている:「Gemini 3.8 Flash:日付入りの評価表、公開価格」「Union Alpha:運営元によるベンチマークなし」「最大出力:131,072 対 65,536 トークン」。フッターには、Union Alpha の数値は未監査で、Gemini の数値は Google と Artificial Analysis によるものと記されている。
Guides & Insights

Union Alpha 対 Gemini 3.8 Flash:一方にはスコアがあり、もう一方には主張がある

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Union AlphaとGemini 3.8 Flashは、同じ売り込みを、まったく異なる2つの証明レベルで提示したものだ。Union Alphaの運営者は、それを「幅広い汎用タスクにおけるフロンティア級の性能」を備えると説明しているが、ベンチマークも、パラメータ数も、ライセンスも、名称も公表していない。Gemini 3.8 Flashは、日付入りの評価表、Artificial Analysis Intelligence Index、独立系テスターによるタスク別コスト数値、そして2027年まで続く文書化された価格表とともにリリースされた。もし両者を価格以外の何かで選ぶのなら、あなたは検証できる数字と、検証できない一文とを選んでいることになる。

肩を並べて、議論の前に

• コンテキストウィンドウ — Union Alpha 262,144トークン 対 Gemini 3.8 Flash 1,048,576トークン

• 最大出力 — 131,072トークン対65,536トークン。この点ではUnion Alphaが勝利しており、それが唯一優位に立つ構造的な軸である。

• 入力 — どちらもテキストと画像に対応していますが、Gemini 3.8 Flash はさらに動画、音声、ファイルにも対応しています。

• 料金 — Union Alphaはプレビュー期間中$0、対してGemini 3.8 Flashは入力$0.75/M、出力$3.75/M、キャッシュ入力$0.075/Mで、2027年1月1日には$1.50/$7.50に倍増します。

• 推論制御 — Union Alphaでは一切公開されていないのに対し、Gemini 3.8 Flashでは品質とコストの両方を直接左右する思考レベル

公開された評価 — Union Alpha の運営者からのものはなく、Gemini 3.8 Flash に関する日付入りの完全な表との対比。

• 来歴 — 匿名の運営者、重みなし 対 Gemini 3.8 Flash の日付入りリリースと文書化された系譜

Generated two-column comparison scoreboard for Union Alpha and Gemini 3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published evals from its operator, 10.00 s p50 time to first token. Gemini 3.8 Flash column: context window 1,048,576 tokens, max output 65,536 tokens, text, image, video and audio input, $0.75 input and $3.75 output per 1M tokens, a full dated evaluator table, 3.46 s p50 time to first token. Footer reads latency per OrcaRouter over the last 7 days with Union Alpha benchmarks unaudited.

Gemini 3.8 Flashの数字が実際に語るもの

Gemini 3.8 Flashは2026年9月2日にリリースされた——Googleにとって約6週間での3回目のFlashリリースであり、このモデルをめぐる話の多くがブレイクスルーではなく発表のケイデンスにあることを物語っている。公開された評価表は、artificialanalysis.aiとdeepmind.googleの両方にクレジットを与えているので、純粋な第三者監査ではなく、独立系とベンダーの数値が混ざったものとして読むべきだ。

• AA Coding — 76.3、これは本当に強いコーディングスコアです。

• AA Intelligence — 41.2。なお、Artificial Analysis は高推論エフォート時に Intelligence Index で別途 59 を報告しているため、この数値はエフォート設定によって大きく変動する。設定を併記しなければ、その数値は意味をなさない。

• GPQA Diamond — 95.3。この比較における単一の数値の中で、大差をつけて最高。

• HLE-Verified — 54.9、通常のHumanity's Last Examでは47.8。

• Terminal-Bench 2.1 — Google自身の表で89.4、Claude Opus 5の89.1をわずかに上回る。

• 長文コンテキストの想起 — 81.3、SciCode 56.6、tau_banking 44.9。

• 実測スループット — 直近7日間で毎秒323出力トークン、エラー率0.63%、初回トークンまでの時間の中央値3.46秒、測定トラフィック498.5Mトークン。

弱点は強みと同じくらい明確に記録されている。Terminal-Bench 4.0では、Claude Opus 5の51.8に対して19.1を記録する。OSWorld 2.0では75.4%に対して59.0%にとどまる。GDPVal-AA v2では1824に対して1545 Eloで後れを取る。Gemini 3.8 Flashは特定の作業領域では卓越しているが、最も難しい汎用エージェント評価では崖から落ちるように急落する——まさに公開された表が可視化してくれる類の形だ。

人々を引っかける価格の仕掛け

GoogleはGemini 3.7 Flashからトークンあたりの価格を据え置いた。それでも請求額は増えた。

モデルはより多くの処理を行います。推論ステップが増え、反復的なツール呼び出しも増えます。Artificial Analysisによる独立したテストでは、3.7 Flashと比較してタスクあたりの出力トークンが約30%多く、タスクあたりのコストが約40%高いことが測定されました。高い推論レベルでは、タスクあたり約$0.58となり、中程度では約$0.41、低いレベルでは約$0.24です。

予算を立てる人にとって、この比較で最も役立つのはこの点であり、しかもそれはこの2つのモデルをはるかに超えて広く当てはまる。単価とタスクあたりのコストは別の数字であり、料金ページに載るのはそのうち片方だけだ。Googleが3.7 Flashをより安価な選択肢として提供し続けているのは、この変化を暗黙のうちに認めたものだ。

代わりにUnion Alphaが提供するもの

Union Alphaは2026年9月16日にサードパーティのカタログに登場し、OrcaRouterの無料枠で動作する。これは匿名であり——ラボも、重みも、ライセンスも、知識カットオフもない——、約1週間と明言された期間のみ無料で、レート制限があり、プレビュー後の価格は発表されていない。

そのエンドポイントは、その出所がそうでなくても検証可能である:262,144トークンのコンテキスト、131,072トークンの最大出力、テキストと画像の入力とテキストのみの出力、ツール呼び出しとJSON出力、temperature、top_p、max_tokens、そしていかなる種類の推論制御もない。ツール選択は事実上「auto」のみをサポートする。

独立した測定はただ 1 つだけです。SMF Clearinghouse は推論をオフにして 157 件の Official A テストを実行し、136/157 — 86.6%、エラーゼロ、26 件中 10 位でした。推論は 30/30 で完璧、ツールは 2/2、コーディングは 26/30、数学は 24/30 でした。ライティングは 2/5 でした。

それは悪い結果ではない。単に比較可能な結果ではないだけだ。Official A は157件のテストからなる広範な汎用スイートであり、AA Coding と GPQA Diamond は、異なる難易度で異なるものを測定する別個の計器だ。136/157 を GPQA Diamond の 95.3 の隣に置いて勝者を宣言するのは、ベンダーの数値を無意味にする、まさにその種の数字のロンダリングだろう。

The OrcaRouter model page for Gemini 3.8 Flash, showing a 1M-token context window, a 65K max output, text plus image, video, file and audio input, $0.75 per million input tokens and $3.75 per million output tokens, a p50 time to first token of 3.46 s, and 498.5M tokens of traffic over seven days.The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

誰も実際には完了できないコスト比較

これは解答例で、意図的に不完全です。

月に千回実行するタスクを一つ取ってみましょう。Gemini 3.8 Flash の高推論設定では、公表されているタスクあたり約0.58ドルという数値から、月額およそ580ドルになります。これは、測定されたトークン消費量から算出された、現実的で根拠のある数値です。

Union Alpha では、同じ1000タスクが今日は$0で済む。3週間後にいくらかかるかは不明だ。プレビュー後の価格が存在しないからだ。信頼性の面でどれだけの代償を払うことになるかも不明だ。モデルはレート制限されており、フォールバックプロバイダーのない単一のエンドポイントで稼働し、誰も公開していない上限を超えた時点でHTTP 429を返すからだ。

正直に言えば、Union Alpha は利用可能な唯一のコスト比較では勝つが、それを予測する能力は失う。単発の比較評価なら、それで問題ない。予算項目となれば、それは数字ではない——URL の付いた希望である。

それぞれの居場所

Gemini 3.8 Flash は、測定可能な下限が必要なあらゆる場面に適しています。動画や音声入力を伴う長文コンテキストの文書作業、AA Coding スコア 76.3 が適切な指標となるコーディング作業、そして予算が伴うあらゆるワークロードです。なぜなら、着手前にコストを計算でき、2027年1月1日にはそれが2倍になることがわかっているからです。

Union Alphaは探索枠に入れるべきだ — 出力上限がGeminiの2倍の、視覚対応256Kモデルを、エンドポイントが消えても何の損にもならない作業で試すために。

それらを2つの統合ではなく1つのエンドポイントの背後で実行する理由は、この比較が繰り返し形を変えるからです。ルーティングDSLを使えば、2つを単一の呼び出しにまとめられます — Gemini 3.8 Flashを計測対象の経路、Union Alphaを実験用ブランチとして — 無料期間が終わるときやGoogleの導入価格が終了するときに見直したくなる決定をハードコードする代わりに。どちらの日付も遠くはなく、両方とも計算を変えるでしょう。

それを解決するものは何だろう

Gemini 3.8 Flash も載っているリーダーボード上に、Union Alpha の日付入りエントリが1件。欠けているのは、それだけだ。それまでは、擁護できる立場は「Union Alpha は Gemini 3.8 Flash と同等だ」ではなく、「Union Alpha は1週間無料で、Google が公表しているもののいずれと比較した測定も誰も行っていない」だ。これらはまったく別の文であり、現時点で正しいのは片方だけである。

ペアのうち実測された側はこちらに記載されています:Gemini 3.8 Flash モデルページには、$0.75/$3.75の料金、キャッシュ入力の90%割引、そして長文レポート作業を左右する65,536トークンの出力上限が示されています。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新