
Pareto 26.10 Preview vs Pareto:同じモデル文字列、2つの異なるモデル
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Unbiased はPareto 26.10 Previewを2026年10月1日に出荷し、以前のリリースであるParetoをその隣に並べたままにした。この二者は、フラグで選び分けるような同一ファミリーの変種ではない。ひとつのブランドの下に存在する2つのリリースであり、ベンダー自身のモデル文字列——pareto——は今や、より新しく、明示的に不安定なほうへ解決される。つまり、この比較の問いは本当のところ「どちらが優れているか」ではない。問うべきは、あなたのリクエストが実際にどちらへ届くのか、そしてその行き先が足元で変わったとき、返ってくる答えはどうなるのか、ということだ。
両者が同じ文脈で語られる唯一の場所は、モデルの公開技術仕様です。Unbiased自身のモデルカード、料金ページ、FAQは、1つの積み上げ型製品について説明しており、分割には一切触れていません。一方には詳細な公開差分があり、他方には沈黙があるというこの非対称性こそが、直接比較のための誠実な出発点です。なぜなら、以下のあらゆる数字がどこから来たのかを教えてくれるからです。
6つの次元、両側
リリースを分けるものはすべて、この6行に収まっている。左側は Pareto 26.10 Preview、右側は9月17日の Pareto リリースで、プレビューのカタログテキストが安定した選択肢と呼んでいるものだ。
• コンテキストウィンドウ — 1,048,576トークン 対 262,144トークン。書類上は4倍の余裕があり、どちらにもより小さいティアは用意されていない。
• 最大出力 — 131,072トークン 対 131,072トークン。変更なし。より大きなウィンドウは、より大きな回答をもたらさなかった。
• 入力価格(ルーティング時) — 100万あたり$0.80 対 100万あたり$2.50。その表示では、プレビューは価格のおよそ3分の1。
• 出力価格(ルーティング時) — 100万あたり$3.20 対 100万あたり$7.50。半分未満。
• キャッシュ済み入力(ルーティング時) — 100万あたり$0.03 対 100万あたり$0.25。ここでは、最も長いエージェント軌跡が最も恩恵を受ける。
• 公開ベンチマークシート — 4つのスコアがあり、明示的に「暫定」および「最終公開前に変更される可能性がある」とされている 対 公開されたベンチマーク表がまったくない。
それらの行のうち2つは、実際の業務を左右する行だ。コンテキストウィンドウは、ベンダーが自社サイトでは書かない目玉の数字であり、モデルカードではなくリスティングに載っている。そしてキャッシュ入力価格は、エージェントの上限ではなく請求額を変える数字だ。それ以外はすべて、マーケティング上の差分か、出力スコアの場合には告白である。プレビューの数値を「暫定」というラベル付きで公開するのは、もう一方のやり方より誠実であり、同時に警告でもある。

表示される価格は、どこで見るかによって異なります
2つの料金表を並べて突き合わせても一致しない——そこが、この比較で誰も説明していない部分だ。
Unbiased自身のプラットフォームは、26.10 Previewが現行リリースになった日にも、入力100万あたり$2.50、キャッシュ済み$0.25、出力$7.50を依然として掲載している。これらは9月の数字のままで、料金ページにもモデルカードにも同様に載っている。より低い方のセット — $0.80、$0.03、$3.20 — は、同じプレビュー向けのルーティング済みカタログ掲載に表示される。したがって、顧客がparetoを、ベンダーのAPIを直接通して呼び出すと、新しいモデルに対して古い料金表の金額を支払う一方、ルーティングされた掲載ではその約3分の1が提示されている。どちらも公開中だ。ベンダーはプロモーションの終了日も、両者を整合させる声明も公表していない。
それはチャネルの問題であり、プレビューリリースではタイミングの問題でもある。コストをどちらの数値でモデル化するにせよ、もう一方はいずれリリースノート1つで正しくなる。プロバイダーの定価を0%のマークアップでそのまま通すルーターは、まさにこの摩擦を取り除く——ベンダーの価格変更が次回の契約レビュー時ではなく当日に反映される——そしてここでOrcaRouterから借用する価値のある唯一の構造的な点がこれだ。当社は現時点でどちらのUnbiasedリリースも取り扱っていないため、「どこで呼び出すのか」という問いへの直接的な答えは、購入するリスティングがたまたまどちらの価格セットを採用しているかに応じた、Unbiased自身のAPIとなる。あえて明言する理由は、その差が3倍であり、プレビューは間違った方を価格設定してしまったことに気づく場所ではないからだ。
プレビューがあなたにもたらすものと、あなたが支払う代償
プレビュー自身のカタログ説明が条件を定めている。それは「予告なく変更される場合がある」とし、予測可能な挙動を必要とする人には9月リリースに戻るよう示している。これは定型文ではない——製品定義そのものだ。これを長時間のエージェントセッションの実際の形と比べれば、そのトレードオフは具体的になる。
会話を続けるエージェントはコンテキストを蓄積し、長い会話こそがプロンプトキャッシュの元を取る場面である。変わらないエンドポイントの背後でモデルが変わっているのは、それを失う典型的なパターンだ。キャッシュはトークンを生成したモデルに紐づくため、軌跡の途中で静かにバージョンが差し替わると、キャッシュしていたものが無効化され、すでに支払い済みだと思っていた作業に再課金される可能性がある。Unbiased自身のドキュメントはこの点を逆方向に論じており、切り替え型ルーターはそうでないのに対し自社のブレンドはキャッシュ安定であると位置づけている。つまりこれは、ベンダーがよく理解した上で、プレビューを出荷する代わりに単に受け入れているリスクである。これは名指しする価値がある。なぜなら、この失敗はダッシュボードでは見えないからだ。トークンは依然として課金され、回答は依然として返ってきて、数字が先週より大きいだけである。
プレビューの利点は本物で、欠点と表裏一体です。コンテキストは4倍、ルーティングされたリスティングではキャッシュ済み入力が安定版の8分の1の料金、そしてベンチマークシートが存在すること自体 — 9月のリリースには公開スコアがありませんでした。ワークロードが長コンテキストでコストに敏感なら、プレビューこそ求めるものです。そして、スタック全体を賭けずにそれを採用する方法は、意図的にピン留めすることです。プレビュー用の名前付きエンドポイント、安定版用の名前付きエンドポイント、そして 両者間のフォールバックを一度設定する。ルーティングDSLは、まさにこの形の問題のために存在します — 2つを別々のレッグとして構成し、それぞれに実トラフィックの一部を流し、リクエストログに、それぞれが実際にいくらかかったかを教えてもらいましょう。プレビューは、1行の設定で覆せる判断であるべきで、請求書で知ることになるエンドポイントの性質であってはなりません。

信頼するには安定性が十分でないパフォーマンス像
上記の数値はすべて公開リスティングに由来しており、そのリスティング自体のパフォーマンスパネルはローンチ当日の読み取り間で変動した。26.10 Preview ページのある読み取りでは、中央値レイテンシ 5.28 秒、毎秒 35 トークンが報告され、同日に公開された並列比較ビューでは、Preview が 3.54 秒、毎秒 21 トークン、9月リリースが 1.05 秒、毎秒 45 トークンと報告されていた。これらは小さな食い違いではない。単一のプロバイダーが提供する真新しいモデルは測定基盤が薄く、数時間にわたるローリングウィンドウは変動する。
正直なところ、どちらのリリースにも、計画の根拠にできるほど安定したスループットやレイテンシの数値はない。そしてプレビューの場合、それは一時的なスナップショットの問題ではなく、製品に織り込まれている。9月のリリースには少なくとも数週間分のトラフィックがある——その掲載情報には、複数日にわたる可用性が90%台後半で示されており、背後にはプロバイダーの完全な履歴がある。プレビューには数時間しかない。もし両者を選ぶ理由が、価格やコンテキストではなく速度なら、選択の根拠となる証拠はまだ存在せず、責任ある行動は、どちらのページから数値を読み取るのではなく、自分のプロンプトで測定することだ。

どちらに電話すべきか、そしてどうやって気にしなくなるか
あなたの作業が長文コンテキスト向けで、コストに敏感で、評価可能なら、プレビューを呼び出そう — エージェントのセッション、バッチ処理、つまりウィンドウが4倍、入力価格が3分の1という見返りが、週の途中での変更というリスクに見合うようなあらゆる場面だ。これは設定1行で切り替えられる試験運用として扱い、自前の数値は自分で押さえておくこと。ベンダーの数値は動くのだから。
ワークロードが本番環境向けである、レイテンシーに敏感である、あるいは予告なく変更される可能性があるモデルとして記述されることを望まないコンプライアンスレビューの対象であるなら、stable Pareto を呼び出してください。1M ウィンドウ、より安価なキャッシュ、公開スコアは諦めることになりますが、実績があり、来週も同じ意味を持つ名前のエンドポイントは維持できます。多くのチームにとって、それが要件のすべてです。
これを恒久的な分岐として扱うのは間違いだ。Unbiasedはその分割を一時的なものとして構築した — プレビューは評価され、その後吸収されるために存在する — そして重要な決断は、2つのうちどちらを選ぶかではなく、それらの間の切り替えが5分で済む変更なのか、四半期がかりのプロジェクトなのかということだ。1つのエンドポイントに1つのモデル文字列という状況では、現状はどちらでもない。それはあなたが見逃してはならない告知だ。代わりにその選択をルーティングの決定として設定すれば、呼び出すバージョンはノブになる。それはプレビューリリースがかつて本当に報いてきた唯一の姿勢だ。
