
UnbiasedのPareto 26.10プレビュー:同じモデル文字列の裏で行われた1Mコンテキストへの差し替え
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
統合は変わりません。変わるのは、その背後にあるモデルです。2026年10月1日、Unbiasedはモデル文字列 — pareto — を Pareto 26.10 Preview に移行しました。これは、コンテキストウィンドウが4倍に拡大し、ルーティング対象カタログの価格が引き下げられ、ベンダー自身が認めるとおり暫定的で最終版が未公開のベンチマークシートを伴う新リリースです。今日Paretoをその名前で呼び出すなら、あなたは26.10 Previewを呼び出していることになり、ベンダーの変更履歴も可能な限り率直な言葉でそう述べています。「Pareto 26.10 Previewは現在のParetoリリースです…モデル文字列はparetoのままです。」
その一行が、スタックに Pareto を入れている人にとってのすべてだ。これは、最初の製品と並んで投入された第二の製品ではない。名前を変えることなく、その場で置き換えられた最初の製品そのものであり、つまり、あなたが手にするバージョンは、あなたのリクエストの内容ではなく、リリースカレンダーによって決まるということだ。
10月1日に実際に何が変わったのか
四つの物事が動いたが、それらは必ずしも同じ方向を指しているわけではない。
• コンテキストウィンドウ — 9月の Pareto リリースでは 262,144 トークン、現在は 1,048,576。Unbiased 自身のドキュメントにはこの数値は一切記載されておらず、この数字はモデルの公開技術仕様に由来するもので、そこではリクエストごとの上限として示され、より小さいティアは提供されていない。
• ルーティング時の価格 — Pareto で一般に引用されるのは、入力 100万トークンあたり $2.50、出力 100万トークンあたり $7.50、キャッシュ済み入力は $0.25。26.10 Preview の価格表ではそれぞれ $0.80、$3.20、$0.03 となっており、入力料金のおよそ3分の1、出力料金の4割強にあたる。
• ベンチマークスコア — このリリースで初めて公開されたもので、ベンダー自身が暫定値と位置づけている。
• 安定版の選択肢 — 26.10 Preview はプレビュー版である。Unbiased のカタログの説明には「予告なく変更される場合がある」と記されており、予測可能な動作を必要とする人には代わりに前回のリリースを推奨している。
それ以外はすべて維持されました。最大出力は依然として131,072トークンです。入力は依然としてテキストと画像で、出力は依然としてテキストのみです。リスティングには依然としてHugging Face識別子がないため、重みは非公開のままです。そして、提供プロバイダーは依然としてちょうど1つ、すなわちUnbiased自身のみであり、リスティング内に2つ目のホストはありません。

価格こそが二度読む価値のある部分だ
Unbiased 自身のプラットフォームでは、料金表は動かなかった。モデルカードと価格ページはいずれも依然として、100万入力あたり $2.50、キャッシュ $0.25、出力 $7.50 と記載しており、これは9月リリースが示していたのと同じ3つの数字だった。そしてモデル文字列がparetoのままだったため、ベンダーの API を利用する顧客は 26.10 Preview に対してこれらの料金を支払っている。より低い数字はルーティングされたカタログ掲載のものであり、両者の差はまさに移行を決める類のものだ。
二通りの解釈が可能であり、どちらが真実かベンダーは明言していない。26.10 Preview が導入キャンペーンとして実際にその経路を通じて安く提供されているのか、それともその掲載が直接のプラットフォームとは異なる商業的条件を表しているのかのいずれかだ。Unbiased はプロモーション終了日を公表しておらず、ローンチ当日に設定された価格は確約ではない。
これが、ルーターが話の形を変える唯一の部分です。OrcaRouter はプロバイダーの定価をそのまま、マークアップ 0% で通します。そのため、ベンダーの値下げは契約サイクルを待たずに、実施されたその日のうちに当社側でも反映されます。さらに自動フェイルオーバーがあるので、来週には挙動が変わるプレビューリリースでも、コードを変更せずに差し替えられます。当社は Unbiased の Pareto 26.10 Preview を取り扱っていないため、正直に言えばこうです。この特定のモデルが必要なら、Unbiased 自身の API 経由で呼び出してください。要点はただ一つ、プレビューリリースでは価格もバージョンも変数であり、どちらもコードに固定すべきではないということです。
ベンチマークシート、元から付いているラベル付きで
Unbiasedは26.10 Previewについて4つのスコアを公表しており、それぞれにタスクあたりの実測コストが添えられ、それぞれにベンダー自身が記した注記が付いている。これらはベンダーが実施し、再現されていないものとして読むべきだ。実際そうなのだから:
• DeepSWE v1.1(エージェント型コーディング)— 69.9%、タスクあたり$0.24
• Terminal-Bench 4.0(エージェント型ターミナル利用)— 50.8%、タスクあたり$0.48
• Humanity's Last Exam、テキストのみ(専門家レベルの推論)— 49.9%、タスクあたり$0.008
• GPQA-Diamond(科学推論)— 92.4%、タスクあたり$0.004

ベンダーの言い分は、26.10 Preview が「4つのベンチマークすべてでパレートフロンティアに並ぶか、それを打ち立てている」というものだ。その主張とともに公開されている表はより具体的で、そもそも公開されていること自体が Unbiased の功績と言える。Terminal-Bench 4.0 では、GPT 6 Astra が58、Fable 5.1 が56と記載されており、どちらも Pareto の50.8を上回っている。しかも、ベンダー自身の「他のモデルの方が高スコアの箇所」セクションが直接そう述べている。DeepSWE v1.1 では、このリリースは一団の中に位置している — GLM-5.3 と Kimi K3 はそれぞれ Pareto の69.9に対して69.0と記載されている — これは実質的に同点であり、単一の実行が伴う誤差範囲が何であれ、その範囲内にある。
比較の数値には、最初の注意点よりも重要な第二の注意点がある。それらは9月21日の比較から転記されたもので、ベンダーの言葉を借りれば「独立した検証を受けていない」ものであり、個々のモデルを対象とした別個の評価で生成されたものだ。したがって、両方が同じベンチから出たものであるかのように、Paretoのタスクあたりコストの数値と対にして扱うべきではない。ベンダーは評価の詳細の中でそう述べている。この一文を飛ばした読者は、このチャートを過大に読み込むことになる。
これのいずれも独立ではない。Artificial Analysis——ほとんどのチームが価格表上の新しい名前を信頼する前に確認するボード——には、Paretoのページが一切ない。上記の数字はすべて、そのモデルを販売している企業が作成したものだ。これを和らげる唯一の点は、評価ハーネスが公開されていることだ——ベンダーが、誰でもエンドポイントを指定して実行できる再現可能な一対一比較スイートを公開しており、それが「私たちのスコアを信頼せよ」を「私たちのスコアを再実行せよ」に変える。それは実際の提案であり、検証済みの数字と同じではない。まだ誰もその再実行を公開していない。
契約書において「preview」が意味するもの
ここでは、この言葉がリリースノート以上に大きな役割を果たしている。Unbiased自身のドキュメントは、現在のアクセスを同社の規約における評価用アクセスと説明しており、商用または本番での利用には別途書面による合意が必要だと明記している。新規アカウントは、APIキーが発行される前に手作業で審査される。APIはOpenAIおよびAnthropicと互換性がある——ベースURL、キー、モデル文字列、書き換え不要——だが、文書化されている範囲はチャット補完とメッセージのみであり、ベンダーが公然と列挙している既知の欠落がある:GET /v1/modelsは実装されておらず、未知のモデル識別子も拒否されない。そのため呼び出し側は、何が利用可能かを自力で見つけるのではなく、paretoを明示的に送信しなければならない。
プレビューのラベルとプライベートベータの契約を並べて見れば、運用上の助言は自ずと見えてくる。これはルーティング層の背後で自分のワークロードに対して評価するためのモデルであり、収益トラフィックの前に置いてそのまま忘れておくものではない。そのための仕組みは地味だ。一度設定しておくフォールバックチェーンによって、週の半ばに自分の足元で変わるリリースが、インシデントではなく設定変更になる。Unbiasedは9月を、まさにこの種の問題を自社側で修正することに費やした。9月16日の変更履歴の項目には、長い非ストリーミングリクエストの約13%が120秒のタイムアウトに達しており、ゲートウェイの上限が300秒に引き上げられたことが記録されている。これはベンダーが粗削りな部分について率直に認めているということだ。また、プレビューの運用プロファイルがまだ書きかけであることを思い起こさせる。

コミットする前に注意すべきこと
3つの具体的な事柄が未解決の疑問に決着をつけるだろうし、そのそれぞれは検証可能だ。
1つ目は独立したスコアです。第三者が公開されたハーネス上で26.10 Previewを実行するまでは、GPQA-Diamondの92.4とTerminal-Benchの50.8は、ベンダー自身の取り組みに関するベンダーの主張であり、テストするかどうかを決めるには十分でも、移行するかどうかを決めるには十分ではありません。
2つ目は、プレビューが価格に与える影響です。ルーティングされたリスティングが$0.80と$3.20のままである一方、ベンダー自身のプラットフォームが$2.50と$7.50を維持しているなら、その差は、どちらの数値に基づいてコストモデルを構築するにしても、理解しておく価値のあるチャネル上の判断です。
第三は、「予告なく変更されることがあります」が実際には何を意味するのか、ということだ。1か月に2回改訂されるプレビューは、四半期の終わりに凍結されて改名されるものとは別物であり、それが最初に現れるのは変更履歴である。
これはどれも、試してみることに反対する理由にはならない。1Mトークンのマルチモーダルモデルが、1タスクあたり0.24ドルでフロンティアに迫るスコアを報告するなら、自分のプロンプトで本気の作業をひと午後かける価値があるし、その評価は、それについて論じるよりコストが低い。これが反対するのは、今週ベンチマークしたモデルが来週も得られるモデルだと思い込むことだ——ベンダー自身がプレビューと呼ぶリリースにとって、正しくある必要がある唯一の想定はそれである。
プレビューリリースは、まさに自動フェイルオーバーが想定されたケースです:自動フェイルオーバーは、週の途中で予告なく変わるモデルを、障害ではなく設定変更に変えてくれます。
