「'Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite' のヒーロータイトルカード。サブタイトルは「無料は安物ではない——既存勢力が依然として安全な選択肢」。2つのステータスカード:Ling 3.0 Tiny(AA Index 23、非常に冗長、8月14日まで無料)、Gemini 3.5 Flash-Lite(AA Index 36、~490 tok/s、$0.30 / $2.50)。OrcaRouter ロゴを右下に合成。
Guides & Insights

Ling 3.0 Tiny 対 Gemini 3.5 Flash-Lite:無料は安いわけではなく、既存勢力が依然として安全な選択肢

著者

Jim Song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

「無料」はモデル市場の語彙の中で最も高価な言葉だ。なぜなら、それは通常、誰かが値札以外の何かの代金を請求しようとしていることを意味するからだ。それが、以下の対決の裏に隠された罠である:Ling 3.0 Tiny(Ant Group InclusionAIの新しい7.9BパラメータのMoE推論モデル)とGemini 3.5 Flash-LiteGoogleの現行Geminiティアの中で最も安価で最速のもの)。Ling 3.0 Tinyは現在無料で呼び出せ、8月14日のプロモーション後は100万トークンあたり$0.06/$0.18かかる。しかし、Artificial Analysisは、56モデルのクラスでスコアを付けるだけで2億1000万の出力トークンを消費したと測定し、中央値の6300万に対して「非常に冗長」とフラグを付けた。Gemini 3.5 Flash-Liteは100万トークンあたり$0.30/$2.50と、トークンあたりのコストが5倍かかるが、独立したIntelligence Indexは36——Ling 3.0 Tinyより13ポイント高い——そして出力速度は毎秒約490トークンだ。より安い値札も、より速くしゃべる方も、より低いスコアも、すべて同じモデルである。それがこの比較のすべてであり、価格だけで新参者をデフォルトで選ぶ前に二度考えるべき理由のすべてだ。

両モデルは低価格帯に属するが、ライフサイクル上の立ち位置は異なる。Gemini 3.5 Flash-Liteは成熟した既存勢力だ。2026年7月21日にリリースされ、第三者による継続的な再測定を受け、高ボリュームでレイテンシに敏感なエージェント型ワークロードにおけるデフォルトのティアとして広く展開されている。一方、Ling 3.0 Tinyは登場から1週間で、ユーザー獲得を狙った価格設定がなされ、スコアリングは一度しか行われていない。本稿では、各モデルの実態、独立した数値が示す事実、そして「無料」という価格がこの比較において最も意味のない数字である理由を整理する。

Ling 3.0 Tiny、メーター付きの新顔

Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.

The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Screenshot of the Artificial Analysis page for Ling 3.0 Tiny, showing an Intelligence Index of 23, price $0.00 / $0.00 on the free tier, a 210M-token verbosity read versus a 63M median, and output speed listed as N/A. REUSED from the what-is-ling-3-0-tiny explainer (audited).

Gemini 3.5 Flash-Lite、現行モデル

Gemini 3.5 Flash-Lite は、Gemini 3.5 シリーズの一段下に位置する、同じ質問に対する Google の回答です。ネイティブにマルチモーダル対応(テキスト、画像、動画、音声、ファイル)の入力、テキスト出力、1Mトークンのコンテキストウィンドウ、最大64Kトークンの出力、そして設定可能な推論努力(最小、低、高)を備えており、パイプラインはリクエストごとに深さとコストを調整できます。その独立したスコアは真の世代ジャンプです。Artificial Analysis Intelligence Index 36、追跡モデル151件中12位で、Gemini 3.1 Flash-Lite の25から上昇しました。速度面では、3.5シリーズで最速のモデルです。Google は発表時に毎秒350出力トークンと明言し、AAのライブページでは追跡モデル中2位となる毎秒約490トークンと測定されています。ベンダー報告のエージェント性能数値(OSWorld-Verified 74.0%、Terminal-Bench 2.1 で54%、128Kマルチニードル検索テストで72.2%)は Google 自身のものであり、絶対的なものではなく方向性を示すものです。また、未解決の疑問が1つあります(Googleのブログではコンピューター利用が組み込みとされていますが、APIドキュメントではサポートされていない)ので、これに依存する前に確認する価値があります。

また、トークン単位で見ると、このティアにしては決して安くはない。「Lite」という名称は、ラインナップにおけるモデルの位置づけを表しているのであって、価格が下がったことを意味するわけではない。{{1}}Gemini 2.5 Flash-Liteは100万トークンあたり$0.10/$0.40、3.1 Flash-Liteは$0.25/$1.50、3.5 Flash-Liteは$0.30/$2.50で、キャッシュ入力は$0.03である。{{/1}}効率の向上はスピードとトークンの節約によるものであり、Artificial Analysis自身の測定によれば、タスクあたりの実質コストは世代を追うごとにおよそ2倍になった一方、タスクあたりの時間は半減している。

文脈の中で読まれる独立したスコアボード

2つのモデルを同じ指標に置くと、その差は歴然としている。Gemini 3.5 Flash-Liteは36、Ling 3.0 Tinyは23である。しかし、その見出し的な比較は全体像の半分にすぎない。なぜなら、この2つのモデルは同じ分野で評価されているわけではないからだ。AAは、Ling 3.0 Tinyをその小型モデルクラスの56モデル中6位に位置づけており、クラスの中央値は8である——同サイズのモデルとしては平均をはるかに上回る。Gemini 3.5 Flash-Liteは、より広い追跡対象分野全体で151モデル中12位に位置している。一方は卓越した小型モデルであり、他方はオープンプールにおける堅実な低価格モデルである。どちらの記述も真実であり、意味するところは異なる。Ling 3.0 Tinyは、そのサイズクラスにおいて、Gemini 3.5 Flash-Liteがそのティアにおいてそうであるよりも優れた価値を提供する——そして、Gemini 3.5 Flash-Liteは、同じ独立した尺度では依然として圧倒的に高性能なモデルである。

Comparison scoreboard for Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite. Left column Ling 3.0 Tiny: AA 23, $0.06 / $0.18 after promo, 210M output tokens, text-only, 256K context, speed N/A (Vercel 264 tok/s). Right column Gemini 3.5 Flash-Lite: AA 36, $0.30 / $2.50, 43M output tokens, text + image + video + audio, 1M context, ~490 tok/s (AA). Footer: 'Both models per Artificial Analysis.' OrcaRouter logo composited bottom-right.

寸法は各行に1つずつ:

• 独立スコア — Ling 3.0 Tiny AA Index 23 (#6/56、クラス中央値8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151)。

• 価格 — Ling 3.0 Tiny は無料プロモーション後、1Mあたり$0.06 / $0.18、vs Gemini 3.5 Flash-Lite は1Mあたり$0.30 / $2.50(キャッシュ入力$0.03)。

• 冗長性 — Ling 3.0 Tiny 210M はインデックス実行全体での出力トークン数が多かったのに対し、Gemini 3.5 Flash-Lite は測定されたものの、そのフラグでは冗長とは見なされなかった。

• モダリティ — Ling 3.0 Tiny(テキストのみ)vs Gemini 3.5 Flash-Lite(テキスト、画像、ビデオ、音声、ファイル入力)

• コンテキスト — Ling 3.0 Tinyでは256K、Gemini 3.5 Flash-Liteでは1M、両方とも最大出力64K。

• 速度 — Ling 3.0 Tiny は、数値を公表しているエンドポイント全体で約90〜264トークン/秒であるのに対し、Gemini 3.5 Flash-Lite は AA のライブ測定で約490トークン/秒。

速度の行が最も変動しやすいでしょう。Ling 3.0 Tinyの出力速度は本当に未確定です。Artificial AnalysisではN/Aと記載されている一方、Vercelは264トークン/秒と謳っています。Gemini 3.5 Flash-Liteの約490トークン/秒は、リリース直後の変動が収まった後に取得されたAAのライブ測定値です。レイテンシー重視のティアにとって、それは既知の数値と未解決の問題の違いです。

冗長性の経済学:なぜ無料は安くないのか

通常、この対決を左右するのは、次のような計算だ。Ling 3.0 Tinyのプロモーション終了後、同じ推論中心のタスク——たとえば入力トークン4,000、出力トークン2,000——を両モデルで実行してみよう。Ling 3.0 Tinyの請求額は(4,000 × $0.06 + 2,000 × $0.18) / 1,000,000、約$0.0006。Gemini 3.5 Flash-Liteの請求額は(4,000 × $0.30 + 2,000 × $2.50) / 1,000,000、約$0.0062。同じトークン数であれば、Ling 3.0 Tinyは10分の1のコストで済む。次に冗長性を考慮しよう。思考トークンを出力として生成する推論モデルは、同一のトークン数にはならない。あなたのワークロードでLing 3.0 Tinyの210M対63Mという冗長性比率が成り立つなら、タスクあたりの実効コストは出力側でおよそ3倍になり、10倍の優位性は3〜4倍に縮む。それでも安いことには変わりはない——だが、もはや無料ではなく、210Mという数字が示唆するほど桁違いの安さでもない。

率直に言えば、この2つのモデルは同じ品質レベルで代替できる関係にはありません。Ling 3.0 Tinyの23点は、1.3Bアクティブモデルとしては傑出したスコアです。一方、Gemini 3.5 Flash-Liteの36点は能力の次元が異なり、さらにビジョン、1Mコンテキスト、実績のある速度も備えています。その差に対して対価を支払うことになります——トークンあたりの価格は5倍、速度差を考慮するとタスクあたりのコストはさらに高くなります——しかし、それはマーケティング上の差ではなく、実際の能力差です。もしワークロードがより安価なモデルの品質で十分なら、Ling 3.0 Tinyの方がコストパフォーマンスに優れています。ワークロードがその能力を必要とするなら、価格面の優位性があっても差は埋まりません。

ルーターの腕の見せどころ

これはまさに、ルーティング層が単一モデルへのコミットメントに勝るワークロードの形状であり、ホスティングの実際がその構築方法に影響を与えます。Gemini 3.5 Flash-Lite は OrcaRouter 上でプロバイダーのリスト価格のまま利用可能です。100万トークンあたり入力 $0.30 / 出力 $2.50 で、0% マークアップでそのまま通過するため、Google の料金カードに記載された数字がそのまま当社側の数字となり、将来の値下げも同じ日に反映されます。これは、200以上の他のモデルと同じ OpenAI 互換エンドポイントの背後にあり、ベースラインプロバイダーが実行中に劣化した場合に備えて、プロバイダー間の自動フェイルオーバーを備えています。また、ルーティング DSL はプロンプトを複数のモデルに送信し、最良の回答を保持できます。

Ling 3.0 Tiny は OrcaRouter 上にはありません。独自のエンドポイントで提供されており、現在は無料です。その組み合わせは、ルーティングの論拠を弱めるどころか、むしろ強めます。有料化される前に、無料期間を利用して Ling 3.0 Tiny を自社のトラフィックに対してベンチマークしてください。そのうえで、本番パスはホステッド層に構築します — 視覚、長いコンテキスト、または安定した速度プロファイルを必要とする呼び出しには Gemini 3.5 Flash-Lite を使用し、ルーティング層は困難な少数派のために、より高価なモデルにエスカレーションできるようにしておきます。無料層は素晴らしい実験であると同時に、脆い依存関係でもあります。ホステッド層こそ、製品を構築できる基盤です。OrcaRouter 上では、両方を同じグラフ内で実行できます — Ling 3.0 Tiny は直接エンドポイント経由、Gemini 3.5 Flash-Lite はキー経由 — そして、リクエストごとにルーターに判断させることができます。

Screenshot of the OrcaRouter model page for Gemini 3.5 Flash-Lite (google/gemini-3.5-flash-lite) showing $0.30 input / $2.50 output per 1M tokens, a 1M-token context, up to 64K max output, multimodal text + image + video + file + audio input, and a p50 time-to-first-token of 819ms over the last 7 days. Fresh Edge-headless capture, audited.

評決

この2つのうちどちらかを選び、併用しないのであれば、判断は簡単に言えて、受け入れがたいものです。Ling 3.0 Tinyはコストパフォーマンスに優れ、かつ性能は劣るモデルです。登場から1週間のテキストのみの推論ティアで、サイズの割に優れたスコア、攻撃的な価格、そして未解決の速度と冗長性の問題を抱えており、今すぐ無料トライアルで評価する価値があり、8月14日から従量制になることも知っておくべきです。Gemini 3.5 Flash-Liteは、より安全な本番環境のデフォルトです。独立したスコアリングで13ポイント高く、マルチモーダル、1Mコンテキスト、確定した測定値で5倍高速、そしてそれに応じた価格設定です。能力の上限が低いモデルが考えるために3倍多く話すのであれば、無料は安くはありません。既存モデルが安全な選択肢であるのには理由があるのです。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube