「Claude Sonnet 5.5 vs Kimi K3」というタイトルのヒーローカード。サブタイトルは「どちらのモデルもtemperature設定を受け付けません」。ピルには「$2 / $10 クローズド」対「$3 / $15 オープンウェイト」、「Index 56 対 44」、「どちらもtemperatureを受け付けない」と表示。フッターには Artificial Analysis v4.3.2 とベンダー価格を引用。
Guides & Insights

Claude Sonnet 5.5 vs Kimi K3:どちらのモデルもあなたの温度設定を受け付けない

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

以下は、どちらにしてもあなたのコードを壊すことになる点で2つのモデルが一致している比較です。2026年9月28日にリリースされたClaude Sonnet 5.5は、temperature、top_p、またはtop_kをデフォルト以外の値に設定するあらゆるリクエストを400エラーで拒否します。Moonshot AIから2026年7月中旬より一般提供されているKimi K3は、サンプリングパラメータを一切受け付けません — temperatureもtop_pもseedもなし — そして推論の深さを公開する唯一の手段は、reasoning_effortコントロールです。異なる2つのラボ、異なる2つのアーキテクチャ、そして共通する結論は1つ:ほとんどの統合が今も習慣で設定しているサンプリングのつまみは、両方ともなくなっています。

それは誰も書かない比較だ。誰もが書く比較は価格であり、Kimi K3は入力100万トークンあたり3ドル、出力15ドル、Claude Sonnet 5.5は2ドルと10ドルで、料金表の上ではAnthropicの明白な勝ちだ。しかしKimi K3は、ダウンロードして自社の境界内で実行できるオープンウェイトの2.8兆パラメータMixture-of-Expertsモデルであり、Claude Sonnet 5.5は4つのクラウドで利用できるクローズドモデルだ。より安価なクローズドモデルと、より高価なダウンロード可能モデルの間では、判断はトークン単価ではまったく決まらない。

それぞれが何なのかを、それぞれ1段落で

Claude Sonnet 5.5は、Anthropicの5.5世代における2番目のモデルであり、Claude Opus 5.5の登場から5日後にClaude APIへと続いて公開された。claude-sonnet-5-5としてClaude API、Amazon Bedrock、Google Cloud、Microsoft Foundryで提供され、100万トークンのコンテキストウィンドウと128Kの同期出力上限を維持し、Claude Sonnet 5の価格をそのまま踏襲している。入力$2、出力$10、キャッシュ読み取りは100万トークンあたり$0.20。適応型思考はデフォルトでhighエフォートで有効になっている。ゼロデータリテンションで利用可能で、Artificial Analysisはv4.3.2リビジョンにおいてインテリジェンス指数56を付けている — 測定対象216モデル中3位。

Two-column scoreboard for Claude Sonnet 5.5 and Kimi K3 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, closed weights on four clouds. Right column Kimi K3: input $3.00 per million, output $15.00 per million, 1M-token context, AA Intelligence Index 44, cost per Index task $2.00, open weights under the Kimi K3 License. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Kimi K3はMoonshot AIのフラッグシップである。2.8兆パラメータのMixture-of-Expertsモデルで、トークンあたり約1040億パラメータを活性化し、100万トークンのコンテキストウィンドウとネイティブな視覚理解を備える。長期的なコーディングと多段階の知識作業のために作られており、Moonshotはプログラミングエージェントのハーネス向けだと名指しで位置づけている。OpenAI APIフォーマットを話し、reasoning_effortを唯一の推論制御として公開しており、Kimi K3ライセンスの下でオープンウェイトである——これはオープンソースと同じものではなく、その違いこそ、その上に構築する前に読むべき部分だ。

料金表と、その下にある数字

見出しではなく、法案を決める次元で両者を並べて比較せよ:

• 入力価格 — Claude Sonnet 5.5 は100万あたり$2、Kimi K3 は100万あたり$3

• 出力価格 — Claude Sonnet 5.5 は100万トークンあたり10ドル、Kimi K3 は100万トークンあたり15ドル

• キャッシュ読み取り — 100万あたり$0.20 対 $0.30

• コンテキストウィンドウ — 1,000,000トークン 対 1,048,576トークン

• 重み — プロプライエタリで4つのホスト型プラットフォーム、対して Kimi K3 License の下でのオープンウェイト

• Intelligence Index — 同じ v4.3.2 リビジョンにおける Claude Sonnet 5.5 56 対 Kimi K3 44

• Intelligence Indexタスクあたりのコスト — Claude Sonnet 5.5 $7.60 対 Kimi K3 $2.00

• インデックスにおける冗長性 — Claude Sonnet 5.5 は出力トークン410M、Kimi K3 は160M

その最後のペアは、じっくり考える価値のある逆転だ。Anthropicのモデルは入力で50%安く、出力で3分の1安いのに、同じ評価を完了するには3.8倍のコストがかかる。そこに至るまでに2.6倍のトークンを使うからだ。総合スコアでも12ポイント高いので、無駄の多いモデルが何も得ていないという話ではない。これは、2枚の料金表を読んだだけではコスト特性を比較できない2つのモデルのケースであり、だからこそインデックスタスクの数値が存在する。

これらのトークン数はいずれも、あなたのトークン数にはなりません。Moonshotの自社ドキュメントによれば、K3の推論の深さはサンプリングではなくreasoning_effortによって設定されており、Claude Sonnet 5.5のeffortパラメータについても実質的に同じことが当てはまります。つまり、どちらのモデルでも、請求額を最も大きく左右する唯一のレバーは価格交渉ではなくeffort設定なのです。

Anthropic Claude Platform documentation page for Claude Sonnet 5.5 showing the summary line the best combination of speed and intelligence, the model ID claude-sonnet-5-5, a 1M-token context window, a 128K maximum output, an input price of $2 per million tokens and an output price of $10 per million tokens, with links to the What is new and Migration guide pages.

400エラーの詳細

OrcaRouter model page for kimi/kimi-k3, attributed to MoonshotAI and dated 2026-07-15, showing a 1M-token context window, text and image input, Vision, Tools, JSON and Reasoning capability tags, an input price of $3.00 and output price of $15.00 per million tokens, a p50 time to first token of 8.20 seconds, and 371.9M tokens of traffic in the last seven days.

サンプリングパラメータをどちらも受け付けないという共通点は、ここでは最も実用的な重なりです。モデルを差し替えた翌朝に表面化する不具合だからです。

Claude Sonnet 5.5 ではルールは明示的で容赦がありません。デフォルト以外の temperature、top_p または top_k は 400 を返します。次を送信すると thinking: {"type": "disabled"} は 400 を返し、between_tools を指します。これは新しく追加された最も低い thinking 設定で、low、medium、high の effort では受け入れられますが、xhigh または max では拒否されます。強制ツール使用 — tool_choice を "any" または名前付きツールに設定すると、400 を返し、メッセージ「tool_choice: type \"tool\" and \"any\" are not supported for this model」が表示されます。修正方法は auto に加えて strict tool use または structured outputs を使用することです。さらに、thinking ブロックは今やそれらを生成したモデルとアカウントに紐付けられているため、会話は Claude Sonnet 5 から Sonnet 5.5 へ推論を保ったまま移行できますが、その推論を別のモデルファミリーへ持ち出すことはできません。また、編集されたプレフィックスはリプレイを 400 に変える可能性があります。

Kimi K3では表面はより小さいものの、結果は同様です。送信すべきサンプリングパラメータは存在しないため、パラメータをハードコードしているクライアントは、すでにモデルが読み取らないパラメータを送信していることになります。代わりに、推論の深さはトップレベルのreasoning_effortフィールドです。

どちらの変更も同じ方向を指している。プロンプト制御における決定論的ノブというアプローチは、モデル側のエフォートダイヤルに置き換えられつつある。temperature 0.2 と固定シードで自己調整していたパイプラインは、これら両モデルにおいてエフォートレベルで再調整しなければならず、その再調整こそが移行作業なのだ。

ここでオープンウェイトが実際にもたらしてくれるもの

より安価でスコアの高いクローズドモデルと比較してKimi K3を検討する理由は、能力でも価格でもない。それは境界線だ。

自社インフラ内で K3 を実行するということは、プロンプト、文書、出力が、自社で管理するネットワークの外に出ることが一切ないということであり、これはベンダーとのゼロデータ保持契約とは別のコンプライアンス上の議論です。また、モデルがあなたの足元で廃止されることはないという意味もあります。Claude Sonnet 5.5 には、2027年9月28日より早くには廃止しないという Anthropic のコミットメントがありますが、ダウンロード済みのチェックポイントにはそのような日付はありません。さらに、限界費用曲線が平坦になるという意味もあります。ハードウェアの後は、トークンは無料になります。2.8兆パラメータのモデルが安価な選択肢になるのは、この構造だけです。

実際にあなたが署名しているのはライセンスです。Kimi K3はオープンウェイトであり、オープンソースではありません。Moonshotは後者の用語を使っていません。Kimi K3ライセンスはほとんどの用途には広範ですが、ローリング売上高しきい値を超えるモデル・アズ・ア・サービス事業には別途の商用契約が必要で、大規模なユーザー数または売上のしきい値を超える製品には「Kimi K3」の帰属表示が必要です。MITライセンスだと称するのはK2時代の不正確な情報で、今も流布しています。APIを呼び出すのではなく重みの上に構築するつもりなら、これは脚注ではなく法務レビューです。

そしてモデルの重みは、セルフホスティングが設備投資の判断になるほど大きい。2.8TパラメータのMoEで、アクティブパラメータが約104Bともなれば、単一サーバーでのデプロイではなく、それを立ち上げるのに必要な労力こそがこの選択肢の実質的なコストであり、出力単価の100万あたり5ドルの差をはるかに上回る。

OrcaRouterの適用範囲

これら2つを評価しているほとんどのチームは、マネージドAPIとハードウェア調達のどちらかを選ぶことを望んでいるわけではない。彼らが望むのはルーティングだ。

OrcaRouter は、200 以上のモデルを対象とした OpenAI 互換の単一エンドポイントで、プロバイダーの定価をそのまま適用しマークアップはありません。そのため、どちらか一方のベンダーで料金改定があっても、次の請求サイクルではなく当日に反映されます。Kimi K3 は 7 月からカタログに掲載されており、Moonshot 自身の料金は $3 / $15で、実測の p50 初回トークン時間は約 8 秒、過去 1 週間で約 3 億 7,190 万トークンが処理されています。Claude Sonnet 5 は — 現在も Claude API のトラフィックの大半が利用しているモデルで、実測 150 出力トークン/秒 — 6 月 30 日から Anthropic の $2 / $10 でルーティング可能。

Claude Sonnet 5.5はまだ当社のカタログにありません。それが当てはまる場合は、そう伝えて回避してください。ベンダー自身のAPIがそこへ至る手段であり、確約せずにテストする手段は、自動フェイルオーバーの背後にトラフィックの一部を流すことです。フォールバックにはClaude Sonnet 5またはKimi K3を使います。K3を検討する理由がレートではなく境界にあるなら、重みは今日ダウンロードでき、APIは暫定手段です。これはモデル比較ではなく、あなたのインフラストラクチャに関する決定です。

実際に何を購入しているかで分けた結論

作業が長いコンテキストで出力が多く、購入対象が複合指数の12ポイント分であり、ゼロデータ保持のマネージドAPIがレビューを通過する場合は、Claude Sonnet 5.5を選びましょう。トークン消費の傾向を見込んで予算を確保しましょう — Index上の410Mトークンは、K3の160Mに対して無視できない倍率です — そしてツール使用とthinkingブロックの変更には1日を見込んでおきましょう。

境界が要件となる場合、どのベンダーにも廃止できないチェックポイントを求める場合、あるいは大量のエージェント型コーディングというワークロードで、インデックスタスクあたり$2.00対$7.60が積み重なる場合には、Kimi K3を選びましょう。ホストすべき2.8Tパラメータモデルであること、そのライセンスに帰属表示条項と収益条項があること、そして総合スコアでAnthropicの階層を下回ることを受け入れましょう。

どちらの選択肢でも避けられないのは最初の段落です。どちらでもサンプリングパラメータはなくなり、それらに取って代わったコントロールが effort ダイヤルです。この2つのどちらを選んでも、それがコードに必要な変更です。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新