
Union Alpha 対 Gemini 3.8 Flash:一方にはスコアがあり、もう一方には主張がある
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union AlphaとGemini 3.8 Flashは、同じ売り込みを、まったく異なる2つの証明レベルで提示したものだ。Union Alphaの運営者は、それを「幅広い汎用タスクにおけるフロンティア級の性能」を備えると説明しているが、ベンチマークも、パラメータ数も、ライセンスも、名称も公表していない。Gemini 3.8 Flashは、日付入りの評価表、Artificial Analysis Intelligence Index、独立系テスターによるタスク別コスト数値、そして2027年まで続く文書化された価格表とともにリリースされた。もし両者を価格以外の何かで選ぶのなら、あなたは検証できる数字と、検証できない一文とを選んでいることになる。
肩を並べて、議論の前に
• コンテキストウィンドウ — Union Alpha 262,144トークン 対 Gemini 3.8 Flash 1,048,576トークン
• 最大出力 — 131,072トークン対65,536トークン。この点ではUnion Alphaが勝利しており、それが唯一優位に立つ構造的な軸である。
• 入力 — どちらもテキストと画像に対応していますが、Gemini 3.8 Flash はさらに動画、音声、ファイルにも対応しています。
• 料金 — Union Alphaはプレビュー期間中$0、対してGemini 3.8 Flashは入力$0.75/M、出力$3.75/M、キャッシュ入力$0.075/Mで、2027年1月1日には$1.50/$7.50に倍増します。
• 推論制御 — Union Alphaでは一切公開されていないのに対し、Gemini 3.8 Flashでは品質とコストの両方を直接左右する思考レベル
公開された評価 — Union Alpha の運営者からのものはなく、Gemini 3.8 Flash に関する日付入りの完全な表との対比。
• 来歴 — 匿名の運営者、重みなし 対 Gemini 3.8 Flash の日付入りリリースと文書化された系譜

Gemini 3.8 Flashの数字が実際に語るもの
Gemini 3.8 Flashは2026年9月2日にリリースされた——Googleにとって約6週間での3回目のFlashリリースであり、このモデルをめぐる話の多くがブレイクスルーではなく発表のケイデンスにあることを物語っている。公開された評価表は、artificialanalysis.aiとdeepmind.googleの両方にクレジットを与えているので、純粋な第三者監査ではなく、独立系とベンダーの数値が混ざったものとして読むべきだ。
• AA Coding — 76.3、これは本当に強いコーディングスコアです。
• AA Intelligence — 41.2。なお、Artificial Analysis は高推論エフォート時に Intelligence Index で別途 59 を報告しているため、この数値はエフォート設定によって大きく変動する。設定を併記しなければ、その数値は意味をなさない。
• GPQA Diamond — 95.3。この比較における単一の数値の中で、大差をつけて最高。
• HLE-Verified — 54.9、通常のHumanity's Last Examでは47.8。
• Terminal-Bench 2.1 — Google自身の表で89.4、Claude Opus 5の89.1をわずかに上回る。
• 長文コンテキストの想起 — 81.3、SciCode 56.6、tau_banking 44.9。
• 実測スループット — 直近7日間で毎秒323出力トークン、エラー率0.63%、初回トークンまでの時間の中央値3.46秒、測定トラフィック498.5Mトークン。
弱点は強みと同じくらい明確に記録されている。Terminal-Bench 4.0では、Claude Opus 5の51.8に対して19.1を記録する。OSWorld 2.0では75.4%に対して59.0%にとどまる。GDPVal-AA v2では1824に対して1545 Eloで後れを取る。Gemini 3.8 Flashは特定の作業領域では卓越しているが、最も難しい汎用エージェント評価では崖から落ちるように急落する——まさに公開された表が可視化してくれる類の形だ。
人々を引っかける価格の仕掛け
GoogleはGemini 3.7 Flashからトークンあたりの価格を据え置いた。それでも請求額は増えた。
モデルはより多くの処理を行います。推論ステップが増え、反復的なツール呼び出しも増えます。Artificial Analysisによる独立したテストでは、3.7 Flashと比較してタスクあたりの出力トークンが約30%多く、タスクあたりのコストが約40%高いことが測定されました。高い推論レベルでは、タスクあたり約$0.58となり、中程度では約$0.41、低いレベルでは約$0.24です。
予算を立てる人にとって、この比較で最も役立つのはこの点であり、しかもそれはこの2つのモデルをはるかに超えて広く当てはまる。単価とタスクあたりのコストは別の数字であり、料金ページに載るのはそのうち片方だけだ。Googleが3.7 Flashをより安価な選択肢として提供し続けているのは、この変化を暗黙のうちに認めたものだ。
代わりにUnion Alphaが提供するもの
Union Alphaは2026年9月16日にサードパーティのカタログに登場し、OrcaRouterの無料枠で動作する。これは匿名であり——ラボも、重みも、ライセンスも、知識カットオフもない——、約1週間と明言された期間のみ無料で、レート制限があり、プレビュー後の価格は発表されていない。
そのエンドポイントは、その出所がそうでなくても検証可能である:262,144トークンのコンテキスト、131,072トークンの最大出力、テキストと画像の入力とテキストのみの出力、ツール呼び出しとJSON出力、temperature、top_p、max_tokens、そしていかなる種類の推論制御もない。ツール選択は事実上「auto」のみをサポートする。
独立した測定はただ 1 つだけです。SMF Clearinghouse は推論をオフにして 157 件の Official A テストを実行し、136/157 — 86.6%、エラーゼロ、26 件中 10 位でした。推論は 30/30 で完璧、ツールは 2/2、コーディングは 26/30、数学は 24/30 でした。ライティングは 2/5 でした。
それは悪い結果ではない。単に比較可能な結果ではないだけだ。Official A は157件のテストからなる広範な汎用スイートであり、AA Coding と GPQA Diamond は、異なる難易度で異なるものを測定する別個の計器だ。136/157 を GPQA Diamond の 95.3 の隣に置いて勝者を宣言するのは、ベンダーの数値を無意味にする、まさにその種の数字のロンダリングだろう。


誰も実際には完了できないコスト比較
これは解答例で、意図的に不完全です。
月に千回実行するタスクを一つ取ってみましょう。Gemini 3.8 Flash の高推論設定では、公表されているタスクあたり約0.58ドルという数値から、月額およそ580ドルになります。これは、測定されたトークン消費量から算出された、現実的で根拠のある数値です。
Union Alpha では、同じ1000タスクが今日は$0で済む。3週間後にいくらかかるかは不明だ。プレビュー後の価格が存在しないからだ。信頼性の面でどれだけの代償を払うことになるかも不明だ。モデルはレート制限されており、フォールバックプロバイダーのない単一のエンドポイントで稼働し、誰も公開していない上限を超えた時点でHTTP 429を返すからだ。
正直に言えば、Union Alpha は利用可能な唯一のコスト比較では勝つが、それを予測する能力は失う。単発の比較評価なら、それで問題ない。予算項目となれば、それは数字ではない——URL の付いた希望である。
それぞれの居場所
Gemini 3.8 Flash は、測定可能な下限が必要なあらゆる場面に適しています。動画や音声入力を伴う長文コンテキストの文書作業、AA Coding スコア 76.3 が適切な指標となるコーディング作業、そして予算が伴うあらゆるワークロードです。なぜなら、着手前にコストを計算でき、2027年1月1日にはそれが2倍になることがわかっているからです。
Union Alphaは探索枠に入れるべきだ — 出力上限がGeminiの2倍の、視覚対応256Kモデルを、エンドポイントが消えても何の損にもならない作業で試すために。
それらを2つの統合ではなく1つのエンドポイントの背後で実行する理由は、この比較が繰り返し形を変えるからです。ルーティングDSLを使えば、2つを単一の呼び出しにまとめられます — Gemini 3.8 Flashを計測対象の経路、Union Alphaを実験用ブランチとして — 無料期間が終わるときやGoogleの導入価格が終了するときに見直したくなる決定をハードコードする代わりに。どちらの日付も遠くはなく、両方とも計算を変えるでしょう。
それを解決するものは何だろう
Gemini 3.8 Flash も載っているリーダーボード上に、Union Alpha の日付入りエントリが1件。欠けているのは、それだけだ。それまでは、擁護できる立場は「Union Alpha は Gemini 3.8 Flash と同等だ」ではなく、「Union Alpha は1週間無料で、Google が公表しているもののいずれと比較した測定も誰も行っていない」だ。これらはまったく別の文であり、現時点で正しいのは片方だけである。
ペアのうち実測された側はこちらに記載されています:Gemini 3.8 Flash モデルページには、$0.75/$3.75の料金、キャッシュ入力の90%割引、そして長文レポート作業を左右する65,536トークンの出力上限が示されています。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
