「AstaBrief 8B vs Qwen3-8B:Ai2のファインチューニングが自身のベースモデルに何を加えるか」のヒーロータイトルカード。共通のQwen3アーキテクチャと、SQABench-CS2の平均87.0対77.3を明示し、隅にOrcaRouterのロゴを配置。
Guides & Insights

AstaBrief 8B 対 Qwen3-8B:Ai2 のファインチューニングが自社のベースモデルに何を追加するのか

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ここにアーキテクチャの話はない。そして、それこそが要点だ。AstaBrief 8B は Qwen/Qwen3-8B のファインチューンであり、両モデルは最後のアテンションヘッドに至るまで構成を共有している。Qwen3ForCausalLM、36層、隠れサイズ4096、8個のキー・バリューヘッドを備えた32個のアテンションヘッド、151,936トークンの語彙、そして40,960トークンの位置上限だ。Ai2 の 2026-10-02 リリースと2025年4月のベースモデルを分かつものは、すべてポストトレーニングである。したがって、興味深い問いは、一般的にどちらが優れているかではない。すでに無料でダウンロードできるベースモデルの上に、特定の、潤沢な資金で行われたポストトレーニングが何をもたらすのか、そしてその見返りに何を犠牲にするのか、である。

Ai2の答えは、引用付きの複数セクションからなる統合レポートを約51秒で生成するレポートライターであり、Astaプラットフォーム内でこれが置き換えたClaude搭載パイプラインの178.5秒に対して、約3.5倍高速だ。Ai2は、追跡した指標においてレポート品質が維持されたと主張している。Qwen3-8Bの答えは、ハイブリッドな思考モードと非思考モード、100以上の言語、1年半にわたる下流利用を備えた汎用モデルである。どちらもApache-2.0だ。このトレードオフは、狭い能力+速度 対 広い能力+柔軟性であり、以下のデータがその輪郭をかなり具体的に示している。

アーキテクチャ行はノーオペレーションなので、プロンプトはノーオペレーションではありません

チェックポイントのジオメトリが同一であるため、Qwen3-8B についてあなたが持っているサービングに関する直感はすべて、そのまま AstaBrief 8B にも当てはまります。これは BF16 の dense 8B で、24GB のカードに収まり、カスタムカーネルなしで vLLM または Transformers 上でサービングでき、ベースの 40K 位置上限を継承します。どちらのモデルも長コンテキストモデルではなく、32K の学習済みウィンドウはベースとまったく同じように YaRN で拡張されます。ファインチューニングのデプロイ計画は、ベースのデプロイ計画です。これは必ずしもファインチューニングに当てはまるわけではないので、率直に言っておく価値があります。そしてそれは、あなたが評価している唯一のものが振る舞いであることを意味します。

振る舞いこそがロックインの宿る場所だ。AstaBriefのカードには、太字で警告が記されている。モデルは1つの特定のプロンプト形式に対してファインチューニングされており、その形式はAstaBrief_promptsデータセット内のsft_prompt.txtとして公開されている。またAi2によれば、別のプロンプトや対話形式を使うと、振る舞いが劣化したり一貫しなくなったりする可能性がある。そのプロンプトは、カジュアルなチャット用テンプレートではない。読めば分かるのは、厳格な契約だ——角括弧で囲まれたクエリスロット、識別子をキーにした引用文のsection_referencesブロック、参照キーを、それが支持する文の直後に置くことを要求する明示的な引用構文、モデルの知識用に指定され、別の情報源と組み合わせてはならないマーカー、そして各セクションを2文のTLDRで始めるという指示。Qwen3-8Bは、入力するものは何でも受け入れる。AstaBrief 8Bは1つの入力の形にチューニングされており、別の形を渡すと性能が低下する。

47,000件の例と6,000件の選好が何をもたらしたか

このファインチューニングは完全にポストトレーニングであり、その手法は意図的に従来型だ。教師ありファインチューニングの後にオフライン直接選好最適化を行い、強化学習は使わない。Ai2は、自社のAstaシステムを通じて投稿された実際のクエリから始め、研究に焦点を当てた90,000件のプロンプトを品質、関連性、プライバシーの観点でフィルタリングし、多段階のScholarQAパイプラインでClaude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini、GPT-4.1を使ってレポートのターゲットを生成し、47,000件の例を保持した。その後、選好段階で約6,000ペアを構築し、GPT-4.1とDeepSeek-R1が判定を行い、両者が一致したペアだけが残った。

SQABench-CS2(ユーザーが作成したコンピュータサイエンス研究の質問100件)で、ベースモデルと比較して測定した結果、それがもたらしたものは次のとおりです。ただし、すべての数値はベンダーによる報告であり、独立に再現されたものは一つもありません:

• 全体平均 — AstaBrief 8B 87.0 対 Qwen3-8B 77.3、9.7ポイントの向上。

• 原材料の再現率 — 90.2 vs 77.8。

• 引用精度 — 90.5 対 76.2

• 引用再現率 — 78.2 対 64.6

• 回答精度 — 89.0 対 90.6、ベースに対する1.6ポイントの低下。

最後の行こそが期待を形作るべきものだ。レポート品質のためのファインチューニングは、すべてを一律に改善したわけではない。段落ごとの関連性を少し犠牲にする代わりに、カバレッジと引用の根拠づけを大きく向上させた。もしあなたのタスクが何よりも関連性の高い段落を重視するなら、ベースモデルが明らかに劣る選択肢とは言えず、ファインチューニングが自動的に答えになるわけでもない。

資金では買えなかった、さらに2つのこと。AstaBrief 8Bは、DeepScholarBenchでAi2自身の代替モデルを上回る報告済みスコアがない——その53.50はAsta ScholarQAの60.25とDR-Tulu-8Bの56.26に後れを取っている——そして、その人間による検証は3人の研究者による14問で、そこではDR-Tuluが総合的な選好で勝った。専門特化モデルは、その専門モデル自身のベンチマークで汎用研究モデルに負けることがあり、Ai2はその事実を公表した。

A two-column scoreboard headed 'AstaBrief 8B vs Qwen3-8B — the scoreboard'. The AstaBrief column reads 'identity: fine-tune of Qwen3-8B', 'job: cited report writing', 'context: 40K inherited', 'prompt: one fixed format', 'licence: Apache 2.0', 'evidence: vendor-reported SQA-CS2'; the Qwen column reads 'identity: the base model', 'job: generalist, thinking modes', 'context: 40K, YaRN to 131K', 'prompt: open', 'licence: Apache 2.0', 'evidence: 11M downloads, established'. A footer reads 'AstaBrief SQA-CS2 average 87.0 vs base 77.3 per Ai2; unreproduced.'

ベースが依然として優れている点

この比較は一方向的なものではなく、そのジェネラリスト側はどうしても過小評価されやすい。

Qwen3-8B は思考モードと非思考モードのハイブリッドを備えて出荷されているため、問題がそれを要するときには推論にトークンを使い、要さないときには直接回答できる。AstaBrief 8B はワンショットのレポート作成向けに訓練されており、そうした意図的な推論動作を製品機能として一切継承していない。Qwen3-8B はまた、ベースモデルの多言語カバレッジ — 100 を超える言語 — も備えているが、AstaBrief は英語の科学技術クエリに明示的にフィルタリングされたコーパスで訓練されたため、その領域外での能力は単に未検証なのではなく不明である。

次に、指示への対応範囲です。汎用モデルが欲しくなるのは、タスクが来週には変わる場合、ツール呼び出しが必要な場合、出力スキーマがAi2のものではなく自分たちのものである場合、あるいはプロトタイピング中で最終的なプロンプトがまだわからない場合です。そして、生の来歴に関する疑問——誰かがなぜそのモデルを信頼するのかと尋ねたときに重要になる問い——について言えば、Qwen3-8Bは1,100万回以上ダウンロードされ、1年半にわたって独立に使われてきた実績があります。AstaBrief 8Bは、ローンチからまだ1週間です。

AstaBrief 8B が備えていてベースモデルには到底及ばないもの、それは引用の規律だ。引用の精度と再現率は、ファインチューニングの優位が最も大きく、学習の背景と最も整合している2つの指標である——Ai2 のデータパイプラインで最も強力な単一フィルターは引用密度、つまり少なくとも1つの引用を含む記述の割合であり、その結果得られたモデルはその優先事項を反映している。汎用モデルに、主張の裏付けを落とさず、固定のキー形式でインライン引用を確実にさせ続けるのは、あなたが書いて保守するプロンプトエンジニアリングだ。Ai2 のファインチューニングは、それをモデルのデフォルト動作にしている。

A screenshot of the Hugging Face model card for Qwen/Qwen3-8B showing the TextGeneration tag, the apache-2.0 licence line, the qwen3 tag, the 8B parameter size in BF16 and a downloads-last-month figure of 11,020,586.

Qwenシリーズは2025年4月以降、さらに進化しています。

もう一つ厄介な点があり、しかもそれは実務上の話だ。Qwen3-8Bは1年半前のモデルであり、新しいファインチューニングをそれと比べることと、実用に耐える現行モデルと比べることは同じではない。

Qwenのラインアップは現在、Qwen3.5、Qwen3.6、Qwen3.7、Qwen3.8と続いており、現行世代は何もダウンロードすることなく利用できます。Qwen3.8 27Bは当社カタログ上の稼働中ルートで、262,144トークンのコンテキストウィンドウを備え、入力100万トークンあたり$0.33、出力100万トークンあたり$2.40です。Qwen3.8 Flashは100万トークンのウィンドウを$0.15と$0.47で提供し、Qwen3 VL 8B Instructはマルチモーダル用途を131,072トークンのウィンドウで100万トークンあたり$0.18と$0.70でカバーしており、2025年10月からルーティングされています。Qwen3-8B自体は当社が提供するルートではなく、AstaBrief 8Bも同様です。どちらもダウンロードして実行するウェイトであり、正直に言えば、ベースはお客様のハードウェアに置くべきもので、最新のQwen世代はそうする必要はありません。

そうすれば、Ai2が実行できなかった評価のための第3のアームが手に入ります。AstaBrief 8Bを自前のGPUで動かし、Qwen3-8Bベースをその隣に立ち上げて報告された差分を確認し、同じハーネスをホスト型のQwen3.8モデルに向けてスケールを検証します。3つのアームはいずれもエンドポイント1つ分の距離にあり、だからこそこれは調達プロジェクトではなく構成の演習になるのです — 200以上のモデルにまたがる単一のAPI、プロバイダーの定価を0%のマークアップでそのまま通すため、ベンダーの値下げが同じ日にあなたの側でも有効になる、自動フェイルオーバー、そして複数のモデルに1つの質問を一緒に答えさせたい場合のルーティングDSL。セルフホストのアームはデータ機密性の理由からセルフホストのままにしておきます。ホスト型のものはすべて交換可能なままで、これは次のQwen世代が四半期で出荷されるときに重要になります。

どうやって決めるか

製品が引用文献の統合であり、引用の振る舞いをプロンプト側の責任ではなくモデルのデフォルトにしたいなら、AstaBrief 8Bを選びましょう。ベースモデルの構造によりサービング時の予期せぬ事態はゼロであり、Apache-2.0ライセンスと公開されたSFTおよびDPOミックスにより監査可能で、引用精度と再現率におけるその優位性はAi2の表の中で最大かつ最も説明しやすい結果です。

多様なタスクを抱えているなら、思考モードやツール、多言語対応が必要なら、まだプロンプトを試行錯誤しているなら、あるいは自分が書いていない1万6000文字の指示ブロックに縛られたくないなら、Qwen3-8B にとどまるか、現行の Qwen3.x に移行してください。ベースはカバレッジと引用の根拠づけで劣っていたのであり、関連性で劣っていたわけではありません。そして、ファインチューンが手放した何かを、ベースは保持していました。

避けるべきなのは、87.0 対 77.3 という平均値をすべての物語として扱うことだ。Ai2 自身の表は、このファインチューンが引用の規律を得るために回答精度を犠牲にしていることを示しており、同社自身のラボノートは、トレーニングと評価の大半が 2025 年に完了し、現在のフロンティアに対して再実行されていないことを記している。そして、これが改善するベースモデルは、もはやこの比較以外で選ぶような世代ではない。このファインチューンが実証的に加えるのは、出力の形である。その形が狭さに見合う価値があるかどうかは、それがあなたの製品の形に合うかどうかに完全にかかっている。