「TwIL-LM3-Pro vs Qwen 3.8」という見出しが付いた生成タイトルカード。サブタイトルは「カードが実際に実行した比較」、角丸の2枚のカードには「TwIL-LM3-Pro - 3.66B、ローカル、非商用」と「Qwen3.8-Max - ホスト型、100万コンテキスト、$2 / $6」と記されている。フッター行には「webAIはQwen3.8-MaxではなくQwen3-8Bに対して測定された。」とある。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

TwIL-LM3-Pro 対 Qwen 3.8:ミスマッチ、そして実際に重要な比較

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

TwIL-LM3-ProとQwen3.8-Max は同じページに置くべきものではない。その理由は、どちらか一方が優れているからではない。webAI の 3.66B 形式論理モデルについて公表された論拠が、Qwe​n モデルとの比較の上に成り立っているからであり、しかも問題の Qwe​n モデルは、見出しが名指ししているモデルではないのだ。webAI の Track A と Track B の表が測定しているのは、TwIL-LM3-Pro 対 Qwen3-8B、すなわち前世代の高密度 8B オープンウェイトモデルであり、Qwen3.8-Max にはまったく注意を払っていない。TwIL-LM3-Pro が勝つからではなく、Qwen3.8-Max が Aliba​ba のフラッグシップであるホスト型システムだからだ。報告されているパラメータ数は 2.4 兆、トークンあたり約 950 億がアクティブというスパースな mixture-of-experts モデルで、100 万トークンのマルチモーダルコンテキストウィンドウを備え、料金表は入力 100 万トークンあたり $2.00、出力 100 万トークンあたり $6.00 である。そこに 2.09 GiB のラップトップ向け GGUF を並べるのは、対決ページの体裁を装ったカテゴリー錯誤にほかならない。

では、この記事は二つのことをする。検索結果が間違っている比較を正し、そのうえで、読者がおそらく本当に抱いている問いの形に答える。つまり、フロンティアモデルがAPIを一度呼ぶだけで手に入り、形式論理のスペシャリストが自分のマシン上で動くとしたら、それぞれはいつ居場所を得るのか、という問いだ。

カードが実際に測定したモデル

関連する比較対象は Qwen3-8B であり、webAI 自身によるその要約は、二次的な記事が示唆するよりも控えめだ。TwIL-LM3-Pro のドメイン内マクロゲートは 0.5539 で、Qwen3-8B の 0.5336 に対する。そしてモデルカードには、マーケティング用ページなら削除していただろう一文が含まれている。ゲートの優位幅は 0.020 で、「レーンあたり n = 200 でのサンプリングノイズより小さく、つまりそれは勝利ではなく互角と読むべきだ」。

比較がコイントスではないところでは、strict-7 が 0.2879 対 0.2093。これは、ルーズマッチによる加点をどこにも使っていない行であり、したがってフォーマットによって作り出せない。厳密な多肢選択では 0.4100 対 0.0000。規則帰納では 0.4195 対 0.3680。そしてパラメータ比 — 3.66B 対 およそ 8B — これが「半分未満のサイズ」という主張のすべてである。

ホールドアウトスイートでは、webAIはさらに歯に衣着せぬ。「TwIL-LM3-Proはそれで首位に立っていない」と。10データセットのマクロ平均は0.7901で、自らのGraniteベースと同水準にとどまり、Qwen3-8Bの0.8493には及ばない。小さな専門モデルが、形式論理では倍の規模の汎用モデルと互角に並び、汎用能力ではそれに敗れるのは想定どおりの姿であり、そう報告することによってこそ、strict-7の数値は信頼できるものになる。

Qwen3.8-Maxとは実際には何なのか

Qwen3.8-MaxはQwen3-8Bの反復版ではありません。これはAlibabaのプレミアムティアであり、OrcaRouterのカタログページでは`qwen/qwen3.8-max`として、2026年8月3日のリリース日、100万トークンのコンテキストウィンドウ、テキスト・画像・動画の入力、テキスト出力、そして思考モード、関数呼び出し、組み込みツール、構造化出力への完全対応とともに表示されています。OpenAI互換、Anthropic互換、ネイティブの各ダッシュボードを通じて5つのリージョンで提供され、思考は`enable_thinking`パラメータで切り替えます。料金は入力100万トークンあたり$2.00、出力100万トークンあたり$6.00です。

日付付きスナップショット `qwen/qwen3.8-max-0902` は、2026年9月2日に、同じ機能と同じ料金で公開されました。これは、再現可能な実行のために挙動を固定できるようにすることを目的として特別に公開されたものです。Qwen3.8-Max を使って長期的に運用する何かを構築するのであれば、設定に入れるべきは流動的なエイリアスではなく、このスナップショット識別子です。

その説明に欠けているものに注目してほしい。ダウンロードできるパラメータ数、ライセンスファイル、そして自分で実行するための道筋がまったくない。Qwen3.8-Maxはホスト型製品である。ローンチ時の報道では、翌週にオープンウェイトを公開すると約束されたと伝えられており、techsyの枠組み——「2.4Tパラメータ、1Mコンテキスト、ウェイトはまだなし」——は、読者が前提とするのではなく検証すべき状態である。ローンチ時に報じられた約束は、公開されたチェックポイントではないからだ。

4つの次元、そしてどれも近くない

• パラメータ — TwIL-LM3-Pro は 3.66B の密(dense)モデルで全パラメータがアクティブなのに対し、Qwen3.8-Max はスパースな Mixture-of-Experts 設計で、合計 2.4T、トークンあたり約 95B がアクティブと報告されています。合計では 3 桁、アクティブでは 2 桁の差です。

• 実行環境 — TwIL-LM3-Pro は bf16 で 6.82 GiB、または 2.09 GiB の Q4_K_M GGUF としてダウンロードでき、CPU または 4 GB の VRAM で動作する。一方、Qwen3.8-Max はホスト型エンドポイントとしてのみ存在する。

• コンテキスト — TwIL-LM3-Pro 131,072トークン。Graniteベースから継承され、Qwen3.8-Maxの1,000,000トークンに対する自身の評価では8,192を超えて検証されていない。

• モダリティ — テキスト入力、テキスト出力 対 テキスト、画像、動画入力、テキスト出力。

• ライセンス — webAI Non-Commercial License ver. 1.0。収益を生む用途には別途契約が必要で、ライセンス供与すべき重みを持たないホスト型商用APIとは対照的です。

• コスト — TwIL-LM3-Pro:トークンごとの料金もホスト型エンドポイントもなし。一方、Qwen3.8-Maxは入力100万トークンあたり$2.00、出力100万トークンあたり$6.00で、キャッシュ入力の料金は100万トークンあたり約$0.25です。

3.66Bモデルが安いのは小さいからで、小さいのは一つのことしかしないからだ。Qwen3.8-Maxが高いのは、汎用的でホストされているからだ。どちらの価格も判決ではない。

質問の背後にある問い

命名の混乱を取り払ってしまえば、工学的な問いが残る。しかもそれは良い問いだ。フロンティアのホスト型モデルが形式論理について推論できるのなら、なぜわざわざ狭い専門特化モデルを動かすのか。

3つの理由が成り立つ。第一はライセンスとネットワークだ。非商用の研究グループ、エアギャップ環境、あるいは接続のないラップトップ上で実行しなければならないバッチラベリング処理は、ホスト型エンドポイントを呼び出せない。2.09 GiB の GGUF はその制約に直接応える。第二は、量に対するコスト構造である。100万件の短い入力に対する形式論理のラベリング作業は、ホスト型のフロンティアモデルではトークン単位で課金されるが、ローカルモデルでは実時間以外に何も支払わない。第三は出力の形だ。TwIL-LM3-Pro は散文ではなく機械検証可能な構造を出力するように調整されており、含意ラベルや意味解析にとっては、汎用モデルにプロンプトを与えてその答えを解析するよりも小さなパイプラインで済む。

それに対して、Qwen3.8-Maxの話は単純だ。画像と動画を見ることができ、100万トークンを保持し、文書化されたAPIを通じてツールと構造化出力を扱い、その背後には公表されたベンチマークと独立した評価がある。狭い専門特化型であることがそれを脅かすことは何もない。両者は異なる制約条件に応えているのだ。

両方を使用するスタック

実際のパイプラインと接触しても生き残るパターンは2層構成であり、それは奇抜なものではない。フロンティアのホスト型モデルが、雑然とした入力——混在したソースや長い仕様書——を読み、きれいなテキストに変換する。それがローカルの形式論理モデルに渡され、そのモデルの仕事は、ラベル、パース結果、あるいは自分自身のLeanを出力することだけだ。その2番目のモデルが保守コストに見合うかどうかの判断は、ゲートではなくstrict-7流の比較である。なぜなら、特化型モデルは、指標に寛容な採点の余地がないレーンで勝つからだ。

また、webAI 自身のカードから得る価値のある手がかりもある。パイプラインは5つの異なるベースモデルで実行され、モデルごとに変化したのはマージ係数だけであり、webAI は最も変化が小さかったものも含め、それぞれの結果を報告している。これは、単一のベンチマーク行よりも、レシピに関するより強い主張である。そして、1つのチェックポイントがたまたまうまくいったというよりも、その手法が一般化することを示す種類の証拠だ。

ここでルーティング可能なものは何で、そうでないものは何ですか?

正直なところ、2つのモデルが同じ文の中に並ぶのはここだけだ。Qwen3.8-Maxはルートである。つまり、OrcaRouterを通じて `qwen/qwen3.8-max` として提供され、プラットフォームがプロバイダーの定価を0%のマークアップでそのまま通すため、$2.00/$6.00という料金はベンダー自身のものであり、ベンダーの値下げは契約サイクルを待たずに当日から反映される。日付付きの `qwen/qwen3.8-max-0902` スナップショットも同じようにルーティング可能なので、再現可能なモデルIDを固定することは、別個のベンダー関係ではなく設定上の選択である。

TwIL-LM3-Proはルートではなく、そう示唆するのは不誠実です。非商用ライセンスで、公開されたホスト型エンドポイントはなく、現時点での利用方法はチェックポイントをダウンロードして自分で実行することです。これを中心に構築されたパイプラインに対してルーターが担うのは、周辺のテキスト処理——プロンプトの拡張、コーパスの生成、フィルタリングのパス——であり、これらは同じOpenAI互換エンドポイント上で200以上のモデルに対して動作するため、評価データを生成するモデルを、それを採点するモデルに入れ替えるのに必要なのは設定の編集だけです。しかもプロバイダーに不具合が起きたときに長いバッチを維持するための自動フェイルオーバーが付いています。

両者を組み合わせた最も擁護しやすい使い方はまさにこれだ。ルーティング可能なフロンティア層が一般的な推論と構造化抽出を担い、ダウンロード済みの専門モデルが形式論理の判断を行い、その間のすべてを単一のキーでまかなう。

どのモデルを比較するか、そしていつ

小規模な形式論理モデルを評価しているのなら、TwIL-LM3-Pro の隣に並べる価値のある Qwen は Qwen3-8B であり、webAI はすでにその比較を注意点付きで公開している。本番ワークロードをどこで動かすかを選ぶのであれば、Qwen3.8-Max はまったく別の判断だ。料金表がありダウンロードできないホスト型フロンティアシステムであり、問うべきはどちらが優れているかではなく、どの制約が効いてくるかだ。一方には接続性とライセンス、もう一方にはコンテキスト、モダリティ、スケールがある。実際のシステムの大半は、結局どちらの答えも必要になる。

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新