
Ling 3.0 Tiny против Gemini 3.5 Flash-Lite: бесплатно — не значит дёшево, а действующий лидер по-прежнему остаётся надёжным выбором
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 586 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3055Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1653Интеллект69Кодинг60Математика
«Бесплатно» — самое дорогое слово в словаре рынка моделей, потому что обычно оно означает, что кто-то собирается выставить вам счёт за что-то помимо указанной цены. Именно эта ловушка скрыта в противостоянии междуLing 3.0 Tiny, новая MoE-модель рассуждений с 7,9 млрд параметров от Ant Group InclusionAI, и Gemini 3.5 Flash-Lite, самый дешёвый и самый быстрый текущий уровень Gemini от Google. Сейчас вызов Ling 3.0 Tiny бесплатен, а после акции 14 августа он будет стоить $0,06 / $0,18 за миллион токенов — но Artificial Analysis зафиксировала, что он сжёг 210 млн выходных токенов, чтобы набрать баллы в своём классе из 56 моделей, при медиане 63 млн, и отметила его как «очень многословного». Gemini 3.5 Flash-Lite стоит в пять раз дороже за токен — $0,30 / $2,50, однако у него независимый Intelligence Index 36 — на 13 пунктов выше, чем у Ling 3.0 Tiny, — а скорость вывода составляет около 490 токенов в секунду. Более дешёвый ценник, более быстрый говорун и более низкий балл — всё это одна и та же модель. В этом вся суть данного сравнения и вся причина дважды подумать, прежде чем по умолчанию выбирать новичка только из-за цены.
Обе модели относятся к бюджетному уровню, но находятся на разных этапах его жизненного цикла. Gemini 3.5 Flash-Lite — зрелый действующий лидер: выпущен 21 июля 2026 года, непрерывно перепроверяется независимой стороной и широко используется как стандартный уровень для высоконагруженных агентных задач, чувствительных к задержке. Ling 3.0 Tiny появился неделю назад, его цена направлена на привлечение пользователей, и он был протестирован ровно один раз. Этот материал разбирает, чем на самом деле является каждая модель, что говорят независимые показатели и почему «бесплатная» цена — наименее полезная цифра в сравнении.
Ling 3.0 Tiny, новичок с измерителем
Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.
The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Gemini 3.5 Flash-Lite, действующий лидер
Gemini 3.5 Flash-Lite — это ответ Google на тот же вопрос, выпущенный на одну ступень ниже в линейке Gemini 3.5. Он нативно мультимодален на входе — текст, изображения, видео, аудио и файлы — с выводом текста, контекстным окном на 1 млн токенов, до 64K выходных токенов и настраиваемым уровнем рассуждений (минимальный, низкий, более высокий), так что конвейер может регулировать глубину и стоимость каждого запроса. Его независимая оценка — это настоящий скачок поколений: Artificial Analysis Intelligence Index 36, 12-е место из 151 отслеживаемой модели, по сравнению с 25 у Gemini 3.1 Flash-Lite. По скорости это самая быстрая модель в серии 3.5 — Google заявил 350 выходных токенов в секунду на момент запуска, а живая страница AA измерила около 490 токенов в секунду — 2-е место среди отслеживаемых моделей. Его указанные вендором агентные показатели — 74.0% на OSWorld-Verified, 54% на Terminal-Bench 2.1, 72.2% в тесте с 128K контекстом на извлечение множественных «иголок» — являются собственными данными Google и ориентировочными, а не истиной в последней инстанции; и один открытый вопрос (computer-use указан как встроенный в блоге Google, но не поддерживается в документации API) стоит проверить, прежде чем полагаться на это.
Кроме того, в пересчете на токен эта модель недешева для своего класса. Название «Lite» описывает место модели в линейке, а не снижающуюся цену: Gemini 2.5 Flash-Lite стоил $0,10 / $0,40, 3.1 Flash-Lite — $0,25 / $1,50, а 3.5 Flash-Lite — $0,30 / $2,50 за миллион токенов, при этом кэшированный ввод стоит $0,03. Выигрыш в эффективности достигается за счет скорости и экономии токенов: собственные измерения Artificial Analysis показывают, что реальная стоимость задачи примерно удваивалась от поколения к поколению, даже несмотря на то, что время выполнения задачи сокращалось вдвое.
Независимое табло, прочитанное в контексте
Поместите обе модели на одну шкалу — и разрыв разителен: Gemini 3.5 Flash-Lite — 36, Ling 3.0 Tiny — 23. Но это броское сравнение отражает лишь половину картины, потому что модели оцениваются не в одном классе. AA ставит Ling 3.0 Tiny на 6-е место из 56 в классе крошечных моделей при медиане по классу 8 — значительно выше среднего для модели такого размера. Gemini 3.5 Flash-Lite занимает 12-е место из 151 в более широком отслеживаемом классе. Одна — исключительная крошечная модель, другая — добротная бюджетная модель в открытом пуле. Оба утверждения верны, и означают они разные вещи. Ling 3.0 Tiny даёт больше ценности для своего класса размера, чем Gemini 3.5 Flash-Lite для своего уровня, — и при этом Gemini 3.5 Flash-Lite остаётся более мощной моделью с большим отрывом по той же независимой шкале.

Размеры, по одному в строке:
• Независимая оценка — Ling 3.0 Tiny AA Index 23 (#6/56, медиана класса 8) против Gemini 3.5 Flash-Lite AA Index 36 (#12/151).
• Цена — Ling 3.0 Tiny $0.06 / $0.18 за 1M после бесплатного промо против Gemini 3.5 Flash-Lite $0.30 / $2.50 за 1M (кэшированный ввод $0.03).
• Многословность — Ling 3.0 Tiny выдал 210M выходных токенов за индексный прогон, тогда как Gemini 3.5 Flash-Lite был замерен, но не оказался многословным по этому показателю.
• Модальность — Ling 3.0 Tiny: только текст, vs Gemini 3.5 Flash-Lite: текст, изображение, видео, аудио и файловый ввод.
• Контекст — 256K на Ling 3.0 Tiny против 1M на Gemini 3.5 Flash-Lite, с максимальным выводом 64K на обоих.
• Скорость — Ling 3.0 Tiny ~90–264 tokens/s на конечных точках, опубликовавших показатель, против ~490 tokens/s у Gemini 3.5 Flash-Lite по данным живого измерения AA.
Строка скорости — та, которая, скорее всего, изменится. Скорость вывода Ling 3.0 Tiny действительно не определена: Artificial Analysis указывает её как N/A, тогда как Vercel рекламирует 264 токена в секунду. Показатель Gemini 3.5 Flash-Lite в ~490 токенов в секунду — это живое измерение AA, проведённое уже после того, как улеглась волатильность, связанная с его запуском. Для уровня, чувствительного к задержке, это разница между известной величиной и открытым вопросом.
Экономика многословия: почему бесплатное — не значит дешёвое
Вот арифметика, которая обычно и решает исход этого сравнения. Прогоните одну и ту же задачу с интенсивными рассуждениями — скажем, 4 000 входных и 2 000 выходных токенов — через обе модели после окончания промо-акции Ling 3.0 Tiny. Ling 3.0 Tiny выставляет счёт (4 000 × $0,06 + 2 000 × $0,18) / 1 000 000, то есть около $0,0006. Gemini 3.5 Flash-Lite выставляет счёт (4 000 × $0,30 + 2 000 × $2,50) / 1 000 000, то есть около $0,0062. При одинаковом количестве токенов Ling 3.0 Tiny в 10 раз дешевле. Теперь добавьте многословность: модель рассуждений, которая выдаёт токены мышления на выходе, не производит одинаковое количество токенов. Если соотношение многословности Ling 3.0 Tiny (210M против 63M) сохраняется на вашей рабочей нагрузке, эффективная стоимость задачи на выходной стороне примерно утраивается, и преимущество в 10 раз сокращается до 3–4 раз. Всё ещё дешевле — но уже не бесплатно и не в той лиге, на которую намекает цифра 210M.
Честная постановка вопроса в том, что эти две модели не взаимозаменяемы на одном уровне качества. Результат Ling 3.0 Tiny — 23 — исключительная оценка для модели с 1,3 млрд активных параметров; результат Gemini 3.5 Flash-Lite — 36 — это другая лига возможностей, плюс зрение, плюс контекст в 1M, плюс подтверждённая скорость. Вы платите за этот разрыв: цена за токен в пять раз выше, а с учётом разницы в скорости — ещё больше в пересчёте на задачу. Но это реальный разрыв в возможностях, а не маркетинговый. Если вашим задачам достаточно качества более дешёвой модели, Ling 3.0 Tiny — лучший выбор по соотношению цены и качества. Если вашим задачам нужны такие возможности, никакое ценовое преимущество не закроет этот разрыв.
Where a router earns its keep
Это как раз тот тип рабочей нагрузки, где уровень маршрутизации выгоднее, чем привязка к одной модели, и факты о хостинге важны для того, как вы строите систему. Gemini 3.5 Flash-Lite доступен на OrcaRouter по цене из прайс-листа провайдера — $0.30 за вход / $2.50 за выход за 1M — с 0% наценкой, так что число в прайс-листе Google совпадает с нашим, и любое будущее снижение цены вступает в силу в тот же день. Он работает через тот же OpenAI-совместимый endpoint, что и 200+ других моделей, с автоматическим переключением между провайдерами на случай, если основной провайдер деградирует в процессе выполнения, а routing DSL может отправить промпт сразу нескольким моделям и сохранить лучший ответ.
Ling 3.0 Tiny не входит в OrcaRouter; он обслуживается собственными эндпоинтами и сегодня бесплатен. Такая комбинация на самом деле усиливает аргумент в пользу маршрутизации, а не ослабляет его. Используйте бесплатное окно, чтобы прогнать Ling 3.0 Tiny на своём трафике, прежде чем он станет платным. Затем выстройте production-путь на хостинг-тарифе: Gemini 3.5 Flash-Lite для запросов, которым нужны зрение, длинный контекст или стабильный скоростной профиль, а маршрутизирующий слой сможет повышать уровень до более дорогой модели для сложного меньшинства запросов. Бесплатный тариф — отличный эксперимент, но хрупкая зависимость; хостинг-тариф — это то, на чём можно строить продукт. В OrcaRouter вы можете запустить оба в одном графе — Ling 3.0 Tiny через прямой эндпоинт, Gemini 3.5 Flash-Lite по ключу — и позволить роутеру решать по каждому запросу.

Вердикт
Если вы выбираете между этими двумя и не распределяете запросы между ними, решение просто сформулировать, но трудно принять. Ling 3.0 Tiny — это и более выгодная сделка, и более слабая модель: появившийся неделю назад текстовый вариант с поддержкой рассуждений, с отличным для своего размера баллом, агрессивной ценой и непроясненной картиной по скорости и многословности; его стоит немедленно опробовать в бесплатном триале, и стоит знать, что с 14 августа он перейдет на тарификацию. Gemini 3.5 Flash-Lite — более безопасный вариант по умолчанию для продакшена: по независимым оценкам на 13 баллов выше, мультимодальная, с контекстом 1M, в пять раз быстрее по устоявшимся замерам и с соответствующей ценой. Бесплатное не значит дешевое, когда модель в три раза больше говорит, чтобы думать, при более низком потолке возможностей — и действующая модель не просто так является безопасной ставкой.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
