
Claude Opus 5.5とスイカテスト:Anthropicは文章を直したが、要点は依然として埋もれたまま
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ローンチ週から最も遠くまで広まったサンプルのひとつが、スイカについての短編小説だった。数百語で、ベンチマークも付いておらず、グラフもない——ただモデルに小さなものを書かせて、ほぼ正しく仕上げただけ。旗艦リリースの中心近くに置くには奇妙な成果物だが、これはベンダーがClaude Opus 5.5を2026年9月22日に出荷した際に真っ先に打ち出した対象を指している。Terminal-Bench上のもう一つの点ではなく、散文である。同社の説明は、このモデルは「Claudish」さがより少ないというものだ——定型的で、ヘッジが過剰で、前置きの長い文体を指す同社の言葉であり、Claude Opus 5が批判を招いたものであり、それ以降Claude Fable 5.1、GPT-6 AstraとGPT-5.6 Solがそれぞれ比較対象として測定されてきた、その文体だ。したがって答えるに値する問いは、そのデモが魅力的だったかどうかではない。散文が測定可能なほど改善したのか、どれだけ改善したのか、そしてどこで依然として失敗するのか、である。
Anthropicが修正したと主張しているもの

Anthropicの主張は、検証できるほど具体的だ。Opus 5.5は最も重要な情報を最初に提示し、専門用語をより少なく使い、ユーザーが指定した文章ルールを従来のOpusモデルよりも厳密に守ると同社は述べている。裏付けとなる資料はベンダーによる報告であり、再現されたものではない。Anthropicが18回中16回合格したと主張する社内ファクトチェックテストに対し、Claude Fable 5.1とClaude Opus 5はいずれも18回中0回だった。発表資料に寄せられた顧客のコメントも同じ方向を示している。RampのJohn Ruelasは「優秀な同僚が書くような」出力だと述べ、Boxは自社のワークロードで冗長さがおよそ40%減ったと報告している。
ここで切り分けるべきことが2つある。1つは、「Claudeっぽさが少ない」というのは、マーケティング上の発明ではなく、実在する、名付け可能な失敗モードだということだ。実務者たちは、4.6以降のOpus世代以来、凝縮され、構成の悪いClaudeの文章について不満を述べてきた。そしてその不満は具体的だ。前置きが多すぎる、プロンプトの繰り返しが多すぎる、読者が必要とした時点より2段落遅れて本題にたどり着く癖がある、といったものだ。2つ目は、それを修正したというAnthropic自身の数値は、まさにそれ——Anthropic自身の数値——でしかないということだ。18件中16件という数値には独立した再現がなく、「冗長性が40%減」というのは、公表された方法論ではなく、顧客の内部測定だ。
今回のリリースには、知っておく価値のある文章作成以外の変更もある。Opus 5.5は、Claude Fable 5.1に搭載されているものと同等のサイバーセキュリティ、生物学、フロンティアLLM開発のセーフガードを搭載してリリースされる最初のOpusモデルである。リクエストがそのいずれかに抵触した場合、Anthropicは、単に拒否するのではなく、そのリクエストを別のモデルへ透過的にルーティングすると述べている。
Anthropicのものではない数字

文章作成に関する主張について最も有用な独立した評価は、EveryのVibe Checkによるもので、同じプロンプトを5つのフロンティアモデルで実行し、2つの標準的な可読性指標で出力を採点した。そのプロンプトセットでは、Claude Opus 5.5がグループ内で最も読みやすいという結果になり、それが置き換えたモデルとの差こそが重要なポイントだ:
• フレッシュ・キンケイド学年レベル — Claude Opus 5.5 は 6.95、Claude Opus 5 は 7.97
• フレッシュ・リーディング・イーズ — Opus 5.5 は 68.4、Opus 5 は 61.35
• Claude Fable 5.1 — 学年レベル 7.43、リーディング・イーズ 66.09
• GPT-6 Astra — 学年レベル7.52、リーディングイーズ64.55
• GPT-5.6 Sol — 学年レベル 8.74、リーディング・イーズ 56.62
二つの指標は合わせて読むこと。なぜなら、それらは逆方向に動くからであり、そこが要点だ。より低い学年レベルとより高い読みやすさスコアは、どちらもより平易な文章を意味する。Opus 5.5 は Opus 5 より約1学年低く、Claude Fable 5.1 と GPT-6 Astra の両方より約半学年低く、GPT-5.6 Sol よりほぼ2学年低い。平たく言えば、8年生ではなく7年生の読解レベルだ。
それは確かな改善であり、同時に狭い改善でもある。これは一つの媒体によるプロンプトセットであって、固定されたタスクリストとその背後にリーダーボードを備えたベンチマークではない。進む方向性と、歩幅のおおよその大きさを教えてくれる。だが、Opus 5.5 があなたの仕事でうまく書けるかどうかまでは教えてくれないし、Every 自身の定性的なメモからも、レビュアーもそうは考えていなかったことが明らかだ。
それでもなお要点が埋もれてしまうところ
可読性の数値を生み出したのと同じレビューは、修正後も残った失敗について率直だ。エッセイの冒頭を書くよう求められると、Opus 5.5 は、レビュアーが21文で扱った内容をカバーするのに37~39文を要し、レビュアーが8語で述べた点にまるまる1段落を費やした。レビュアーの総括は、このモデルが「依然として要点を埋もれさせている」というものだ——そして、より鋭い形の不満は、段落に何が必要かを正しく診断できるのに、その後、自分自身の診断を無視した改訂を生み出してしまう、という点にある。
編集者としての出来は、書き手としてよりも悪かった。編集タスクで他のモデルと比較した順位では、Opus 5.5 は次のモデルたちに後れを取ったClaude Opus 5、GPT-5.6 Sol、GPT-6 Astra——このモデルは、どの文が先に来るべきかを見分けることよりも、読みやすい文を書き出すことのほうが得意なのだ。レビュアーの評は、引用に値する一文に落ち着いている。それはレビュー全体でもっとも有用な箇所だからだ。「私は、このモデルが生み出す文章よりも、協働者としてのこのモデルのほうが気に入っている」。
実践的な読み方は、そこから直接導かれる。それで下書きを作り、その際は高エフォート以上で行う——低エフォート設定こそ、水増しが最もひどくなる場所だ。例はそれに発明させるのではなく、自分で用意する。次に、要点を自分で冒頭へ移すか、それをやってくれる何かに下書きを渡す。Opus 5.5 が与えてくれるのは、クリーンな初稿へのより速い道と、その後の推敲パスに向けた、確かにより優れた協働相手だ。編集者を与えてくれるわけではない。
余分な言葉がもたらす代償

冗長性の問題にはコストという側面があり、執筆レビューのほとんどはそれを見過ごしている。そしてそれはローンチのナラティブと相反する。ベンダー公表値に頼らず独自の評価を実施しているArtificial Analysisは、Claude Opus 5.5をIntelligence Indexで212モデル中1位、スコア58としているが、冗長性では212モデル中95位で、このIndexの実行で2億6,000万の出力トークンを生成した(中央値は8,800万)。Intelligence Indexのタスク1件あたりの評価コストは5.98ドル、総額は8,708.20ドルだった。
それをAnthropic自身の効率性に関する主張と並べてみると、両者が明らかに一致するわけではない。ベンダーが報告している立場は、Opus 5.5はOpus 5よりトークン使用量が少なく、出力生成が30%超速いというものだ。Artificial Analysisの独立した計測では、このモデルは同種のモデルと比べて非常に冗長であることが分かった。両方は同時に真であり得る——タスクの組み合わせが違い、エフォート設定が違い、「より少ないトークン」の定義が違う——が、発表時の見せ方をトークン経済性について確立した事実として読むべきではない。価格については状況はより明確だ。入力100万トークンあたり4ドル、出力100万トークンあたり20ドルで、5ドル/25ドルから下がっており、Artificial Analysisの数値ではキャッシュ割引が95%適用されている。
出力トークン単位で支払っているなら、冗長な文章は文体の好みの問題ではない。それは明細の一行そのものだ。
すでにお持ちのものに対して実行する
実践的な部分の前に、正直な注記を一つ。Claude Opus 5.5 は当社のルートの一つではありません。当社はそれをホストしておらず、以下に記されている内容を、当社がホストしているという主張として受け取るべきではありません。Anthropic 自身の API といくつかのサードパーティプラットフォームを通じて入手できます。
現在 OrcaRouter にあるのは、それが置き換えたモデルと、その上位ティアです。 Claude Opus 5 は現在 OrcaRouter で提供されています、Claude Fable 5.1 も同様です。どちらもプロバイダーの定価で、マークアップは 0% のまま反映されています。つまり、ベンダーの価格変更は、リセラーがようやく重い腰を上げるのを待つのではなく、同日中に当社側へ反映されるということです。Opus 5.5 の文章が乗り換える価値があるか判断しようとしているなら、それは役に立つ組み合わせです。2つ目の契約やコード変更なしに、1つのキーで比較を実行できます。なぜなら両モデルは 200以上のモデルに対応する1つのAPI を通じて、同じエンドポイント上ですぐに利用できるからです。
2 つ目のモデルをループに残しておくもう 1 つの理由は、この記事が扱っている失敗モードです。要点を埋もれさせるモデルは、タスクの途中で迂回できるようにしておきたいモデルであり、自動フェイルオーバーは、まずい生成がパイプラインの停滞につながらないようにするためにまさに存在します。どちらか 1 つのモデルを選びたくない場合は、ルーティング DSL が複数を 1 回の呼び出しにまとめ、モデル融合はモデルのパネルを一緒に回答させます — これは、失敗が能力ではなく判断にある編集作業に合理的な形です。
誰が行動すべきで、誰が待つべきか
Claude Opus 5 への不満が、その書き出しを書き直さなければならないことだったなら、Opus 5.5 はその問題のおよそ1学年分を実際に修正するものであり、可読性データはその改善が雰囲気ではなく測定可能であることを示している。不満が、要点にたどり着くまでに3段落かかることだったなら、独立した証拠の中には、それが変わったと述べているものは何もない。これらは別々の不満なのに、ローンチ報道は両者を一つとして扱ってきた。
特に創作作業に関して言えば、スイカの話は、人が新しいモデルの感触を確かめたいときに、小さくて温かみがあり、気軽なプロンプトに手を伸ばすということ以外、何の証拠にもならない。それは妥当なことだ。また、まさにその設定では、要点を埋もれさせる傾向が最も見えにくい。なぜなら、誰もスイカの話に主題を期待して読んでいるわけではないからだ。読者が最初の2文で結論を必要とする文書をモデルの前に置けば、実際に抱えていた2つの問題のどちらだったのかがわかるだろう。
次に注目すべきは、このファミリーの次のモデル——Sonnet 5.5 と Haiku 5.5 はどちらも今後数週間で登場すると見られている——が、その可読性の向上を受け継ぐかどうか、そして、下書きではなく編集における可読性の数値を誰かが公表するかどうかだ。下書きの数値は簡単なほうだ。編集の数値では、Opus 5.5 は依然として競合3社に後れを取っている。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
