
Inkling-Small: модель в четверть размера, которая превосходит собственный флагман, но по-прежнему отстаёт от индекса
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 за 1 млн токенов · 56 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3150Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 201 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicНОВИНКАAnthropic: Claude Opus 52026-07-2461Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2150Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1651Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1557Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0854Интеллект72Кодинг
- tencentTencent: Hy32026-07-0641Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3053Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1651Интеллект69Кодинг60Математика
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Интеллект61Кодинг61Математика
Thinking Machines Lab потратила две недели после выпуска своей первой модели с открытыми весами на создание модели примерно вчетверо меньшего размера, и по собственной системе оценок лаборатории меньшая модель побеждает.Inkling-Small показывает 80.2% на SWE-bench Verified против Inkling, у которого 77.6% на SWE-bench Verified; 89.5% на GPQA Diamond против 87.2%; 64.7% на Terminal-Bench 2.1 против 63.8%; и 31.6% на Humanity's Last Exam против 29.7% — при этом в модели 276B общих параметров с 12B активными, а не 975B с 41B. Из ключевых показателей, общих для обеих карточек моделей, флагманская 975B-модель оказывается лучшей только по одному: AIME 2026, на 1.6 пункта.
Затем Artificial Analysis прогнала обе модели независимо и оценила Inkling-Small в 40 баллов по своему Intelligence Index против 41 у Inkling — меньшая модель на балл позади. Оба этих результата реальны, и пространство между ними — самое полезное в этом запуске. Всё, что ниже, разделяет то, что Thinking Machines сообщает о собственной модели, и то, что измерил кто-то другой: цифры производителя взяты из анонса и двух карточек моделей на Hugging Face, независимые цифры — из собственных прогонов Artificial Analysis, а цифры по ценам и контексту — из живых данных конечных точек OpenRouter, проверенных в день написания этого текста. Там, где эти три источника расходятся — а по длине контекста они расходятся — мы говорим об этом, а не выбираем более лестную цифру.
Что на самом деле вышло 30 июля
Inkling-Small — это разреженный трансформер на основе смеси экспертов: всего 276B параметров, 12B активных на токен, 42 слоя, при этом каждый токен направляется к 6 из 256 экспертов плюс 2 общих эксперта, которые срабатывают на всё. Внимание чередует локальные и глобальные слои. Веса доступны на Hugging Face под лицензией Apache 2.0 без коммерческих ограничений, модель дообучается через Tinker API от Thinking Machines, и вы можете общаться с ней текстом, изображениями и аудио в Tinker Playground. Лаборатория сообщает, что модель обучалась на системах NVIDIA GB300 NVL72.

Мультимодальность здесь врождённая, а не прикрученная, и карточка необычно конкретна в описании того, как именно. Отдельного энкодера для изображений или аудио нет: аудио поступает в виде dMel-спектрограмм, изображения — в виде патчей 40×40 пикселей, пропущенных через четырёхслойный hMLP, и оба типа данных встраиваются напрямую в тот же поток токенов, что и текст. Вход — это текст, изображения и аудио; выход — только текст, что стоит указать прямо, потому что слово «мультимодальный» достаточно часто понимают как «он умеет говорить», и это может испортить день. Усилие мышления — это регулятор с пятью режимами — минимальный, низкий, средний, высокий, сверхвысокий — так что одни и те же веса можно запускать дёшево или на полную мощность.
Самая интересная часть рецепта — это пост-обучение. Inkling-Small был дистиллирован в режиме on-policy с полной версией Inkling в качестве учителя, а затем получил ещё примерно две недели обучения с подкреплением, масштабированного на агентное программирование. Этот порядок объясняет форму результатов: ученик унаследовал общую компетентность учителя, а затем получил дополнительное обучение именно по той оси, по которой теперь превосходит учителя.
Табло, опубликованное Thinking Machines
Бенчмарки вендора — это маркетинг, пока кто-то не воспроизведёт их, поэтому читайте этот раздел как заявления лаборатории, а не как проверенные данные. Тем не менее набор широкий, и он широк в направлении, нелестном для флагмана.

Помимо четырех общих чисел, карточка заполняет остальную часть картины — все собственные запуски Thinking Machines:
• Агентная работа — 1269 Elo на GDPval-AA v2, бенчмарке реалистичных экономических задач, а не головоломок.
• Диаграммы и документы — 77,4% на CharXiv RQ, доходя до 81,3%, когда модели разрешено писать и запускать Python. Этот скачок на 3,9 пункта — полезный намёк на то, что доступ к инструментам даёт больше в задачах визуального рассуждения, чем инженерия промптов.
• Vision — 74.0% на MMMU Pro, чуть выше 73.5% у Inkling.
• Аудио — 90.1% VoiceBench и 77.0% MMAU, оба показателя незначительно ниже показателей флагмана (91.4% и 77.2%). Аудио — одна из двух областей, где уменьшение явно имело свою цену.
• Безопасность — 98.4% StrongREJECT и 96.9% на безвредных запросах FORTRESS, но 71.6% на состязательных запросах FORTRESS против 78.0% у флагманской модели. Это другая цена: регресс на 6,4 пункта в состязательной устойчивости, что важнее любого выигрыша в кодировании, если модель будет размещена за публичным текстовым окном.
• Прогнозирование — 61.3 ± 0.46 по индексу Брайера на ForecastBench без доступа к поиску, и 0.1238 ± 0.0086 по шкале Брайера на Prophet Arena. Уже то, что здесь вообще указаны доверительные интервалы, — это больше дисциплины, чем демонстрирует большинство анонсов запусков.
Один пробел: в карточке флагмана указано 54,3% на SWE-bench Pro, более сложном собрате SWE-bench Verified. В карточке Inkling-Small не указан SWE-bench Pro. Учитывая, насколько заметно представлено число Verified, его отсутствие — это цифра, которую мы больше всего хотели бы увидеть заполненной.
Что вместо этого говорит независимый индекс
Artificial Analysis оценивает Inkling-Small в 40 баллов по версии 4.1 своего Индекса интеллекта, на один балл ниже Inkling с 41 баллом. Индекс представляет собой совокупность девяти оценок — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience и AA-LCR — и этот список объясняет большую часть кажущегося противоречия. Лишь две из девяти пересекаются с демонстрацией рассуждений на карточке Thinking Machines. Остальные смещены в сторону агентного использования инструментов, поиска в длинном контексте и устойчивости к галлюцинациям, и модель может выигрывать бенчмарки, которые лаборатория выбирает для публикации, но проигрывать те, которые выбирает третья сторона. Ни одна из сторон не лжёт; они измеряют разные вещи.

В мелком шрифте есть ещё одна деталь, которая важнее, чем заголовок о перевесе в один пункт: Artificial Analysis указывает запись флагмана как Inkling (xhigh) — его максимальную настройку мыслительных усилий, — тогда как в строке Inkling-Small нет суффикса уровня усилий. Так что перевес флагмана в один пункт был зафиксирован с выкрученным до упора регулятором рассуждений. Если бы выравнивание усилий хоть немного сдвинуло это сравнение, последний аргумент в пользу более крупной модели по одним лишь способностям исчез бы вместе с ним.
А вот скорость и стоимость — это то, где независимые данные совсем не близки, и здесь они отдают предпочтение небольшой модели с отрывом, которого не передаёт ни одна таблица бенчмарков:
• Скорость вывода — 133 токена в секунду против 80 у Inkling (xhigh). Artificial Analysis ставит Inkling-Small на 7-е место из 101 модели в своём классе по скорости, при медиане по классу 66.
• Время до первого токена — 1.63 с против 1.84 с. Реальное, но незначительное преимущество.
• Смешанная цена за 1 млн токенов — $0,22 против $0,72 при их взвешивании. Примерно треть стоимости, но на один индексный пункт меньше.
• Ранг интеллекта — #15 из 101, при медианном балле класса 25. Уверенно выше среднего, но далеко до переднего края.
• Многословность — и вот в чём загвоздка. Он сжёг 130M выходных токенов на прохождение индекса, при медиане 100M. Собственная сводка Artificial Analysis называет его «заметно быстрым, однако довольно многословным». Он думает примерно на 30% больше обычного, что незаметно съедает часть скидки за токен.
Небольшое примечание для сверки: поскольку любой, кто сравнивает источники, на это наткнётся — Artificial Analysis указывает общее количество параметров как 266B, тогда как в анонсе, обеих карточках модели и на OpenRouter указано 276B. Мы везде использовали 276B. Это не меняет никаких выводов, но это как раз то расхождение, о котором стоит знать, прежде чем цитировать цифру в проектном документе.
Что на самом деле можно арендовать сегодня, вопреки тому, что указано в характеристиках.
Разрыв между анонсом открытых весов и рабочим эндпоинтом — это то место, где большинство материалов о запусках перестаёт обращать внимание. Thinking Machines заявляет контекстное окно до 1M токенов, и Artificial Analysis также указывает 1M. На OpenRouter оба провайдера, которые в настоящее время предоставляют Inkling-Small, ограничивают его до 524,288 токенов — половины заявленного значения. Это не столько противоречие, сколько разница между тем, что поддерживает архитектура, и тем, что кто-либо развернул в продакшене. Для сравнения, флагманская модель Inkling действительно имеет один эндпоинт на полных 1,048,576 токенов, хотя этот же эндпоинт ограничивает генерацию до 32,768 токенов.
Остальная часть актуальной картины, считанная с данных конечных точек OpenRouter:
• Два провайдера, две цены — $0,45 за 1M входных токенов и $1,20 за 1M выходных от одного, $0,50 и $1,20 от другого. Artificial Analysis указывает собственный тариф Thinking Machines ещё ниже — $0,30 и $1,20, с кэшированным вводом по $0,06. Сторонний хостинг берёт наценку 50–67% на входные токены при тех же весах.
• Кэширование промптов — $0.10 за 1 млн кэшированных входных токенов через OpenRouter, против $0.17 для флагманской модели.
• Числовые форматы, которые вы арендуете, — не те, что были в бенчмарке — в карточке модели указаны BF16 и NVFP4. Более дешёвый endpoint использует fp8; другой вообще не указывает квантизацию. Результаты вендора в бенчмарках не замерялись на fp8-версии этих весов, а эффекты квантизации при длительных агентских прогонах — ровно то, что отрыв в 0,9 балла на Terminal-Bench не переживёт. Если воспроизводите число, отметьте, какой endpoint вы использовали.
• Покрытие функций неравномерно в зависимости от провайдера — оба эндпоинта предоставляют reasoning и reasoning_effort, так что пятиуровневый регулятор мышления работает. Но только один анонсирует tool calling и logprobs, и ни один из них пока не анонсирует response_formatпараметр структурированного вывода (JSON-режима). Флагманская модель Inkling имеет эндпоинт, который это делает. Если ваш пайплайн зависит от JSON со схемой, эта деталь аукнется в первый же день, и это ограничение провайдера, а не модели.
• Потолок завершения — 262 144 токена на эндпоинте fp8; другой не объявляет лимита.
Расчет стоимости на основе измеренного количества токенов
Цены за миллион токенов — плохой способ сравнивать модели рассуждений, потому что единственная переменная — это сколько токенов они сжигают на размышления. Artificial Analysis публикует фактические затраты, что является гораздо лучшим инструментом: прохождение Inkling-Small через полный Intelligence Index потребовало примерно 130 млн выходных токенов и обошлось в $192.37, что составляет около $0.07 за задачу по их средневзвешенному показателю.
Сравните это с тем же показателем для моделей, которые люди реально развертывают: DeepSeek V4 Flash по $0.03 за задачу, gpt-oss-120b по $0.08, Gemini 3.6 Flash по $0.56, GLM-5.2 по $0.57, Kimi K3 по $0.86, GPT-5.6 Sol по $1.23, Claude Opus 5 по $2.34, Claude Fable 5 по $3.15. Inkling-Small — вторая по дешевизне модель в этой группе и примерно в 18 раз дешевле за задачу, чем GPT-5.6 Sol, который набирает 59 против 40 у Inkling-Small.
Есть также более наглядный способ понять, почему цена упала именно там. Количество активных параметров снизилось с 41B до 12B, то есть в 3,4 раза. Цена вывода упала с $4,05 до $1,20 за миллион, то есть в 3,375 раза. Арендная цена разреженной MoE — это по сути лишь её вычислительная стоимость на токен, и Thinking Machines установила цену соответственно, а не привязываясь к бенчмаркам.
Одно практическое замечание о том, как провести это сравнение самостоятельно: Inkling-Small на сегодняшний день нет в каталоге OrcaRouter, поэтому вам пришлось бы арендовать его через его собственные эндпоинты. Закрытые модели, с которыми вы бы его сравнивали — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash и остальные из этого списка, — доступны в OrcaRouter по одному ключу с наценкой 0%, то есть вы платите цену по прайс-листу каждого провайдера, и к ней ничего не добавляется сверху. Это важно именно для модели затрат: сумма, которую вы вносите в таблицу, — это сумма, которая выставляется к оплате, и когда провайдер снижает цены, у нас это отражается в тот же день, а не после пересмотра условий. Автоматическое переключение между провайдерами закрывает вторую половину оценки, а именно когда контрольная ветвь падает в середине запуска и незаметно искажает ваши показатели.
Где оно на самом деле находится среди моделей с открытыми весами
В сравнении с флагманом Inkling-Small выглядит триумфом. В сравнении с остальными моделями это добротная open-weights модель из середины таблицы, и в освещении запуска в основном упустили это второе прочтение.
Согласно индексу Artificial Analysis Intelligence, модели, опережающие обе Inklings, включают Claude Opus 5 с результатом 61, Claude Fable 5 — 60, GPT-5.6 Sol — 59, Kimi K3 — 57, Grok 4.5 — 54, GLM-5.2 и Muse Spark 1.1 — 51, а также Gemini 3.6 Flash — 50. Это ожидаемо: это передовые системы, большинство из них закрытые, некоторые — огромные.
То, что действительно должно изменить решение, — это DeepSeek V4 Flash, который набирает 50 против 40 у Inkling-Small при 284B всего и 13B активных — практически тот же размерный класс и та же выгодная цена моделей с открытыми весами, при менее чем половине стоимости за задачу. Если вам нужна самая дешёвая работоспособная модель с открытыми весами, независимые цифры указывают туда, а не сюда. Кроме того, в отличие от Inkling-Small, она доступна через OrcaRouter, так что проверка этой альтернативы на вашей собственной нагрузке — это смена строки модели, а не закупочная процедура.
Что есть у Inkling-Small, чего нет у DeepSeek V4 Flash, так это нативная поддержка аудио и изображений в одних и тех же весах, пятиуровневый регулятор мышления и тонкая настройка Tinker от лаборатории, которая его обучала. Это реальные отличия для мультимодального агента, и это честная причина выбрать его — а не индексный балл.
Кто должен переехать, а кто должен остаться на месте
Решение чётко разделяется, что само по себе достаточно необычно, чтобы это стоило отметить.
• Переходите с Inkling на Inkling-Small, если вы запускаете агентов для написания кода.Показатели вендора говорят в пользу малой модели на SWE-bench Verified и Terminal-Bench, дополнительный агентный RL — документально подтверждённая причина, а стоит она примерно в три раза меньше и возвращает токены в 1,66 раза быстрее. Платить в 3,3 раза больше за один пункт индекса, измеренный при максимальных мыслительных усилиях, — это трудно обосновать.
• Переходите, если стоимость за задачу рассуждения является ограничивающим фактором и вас устраивает 40 в индексе. $0.07 за задачу при ставке $0.06 за миллион попаданий в кэш на собственном endpoint — агрессивная цена для модели с нативной поддержкой аудио и зрения.
• Переходите, если вы занимаетесь тонкой настройкой. Модель 276B/12B гораздо дешевле адаптировать и обслуживать, чем 975B/41B, и Tinker поддерживает обе.
• Оставайтесь на Inkling, если вам нужна длинная аудиозапись. Это самое резкое ухудшение в релизе, и оно спрятано в карточках моделей: флагманская модель рекомендует аудиоматериалы до 20 минут, а карточка Inkling-Small рекомендует менее 2 минут. Сокращение в десять раз. Если вы расшифровывали или анализировали совещания, малая модель не является полноценной заменой ни за какую цену.
• Оставайтесь, если вам нужен контекст более 512K от размещенного эндпоинта, или ответы длиннее 262K токенов. Сегодня только флагман имеет эндпоинт с полным миллионом токенов.
• Оставайтесь, если вам нужен JSON, подчиняющийся схеме, без написания собственного цикла проверки и повторных попыток, пока провайдер не предоставит response_format для маленькой модели.
• Остаёмся, если устойчивость к состязательным атакам критически важна. 71,6% против 78,0% на FORTRESS adversarial — это неверное направление для любого пользовательского продукта, и это собственная цифра лаборатории.
Три вопроса, которые освещение запуска оставило открытыми
Inkling-Small — это просто дистиллированный Inkling?
{{1}}Частично, а та часть, что не сводится к этому, и есть самая важная.{{/1}} {{2}}Дистилляция по политике, где учителем выступала Inkling, была одним из этапов пост-обучения, так что значительная доля общих способностей действительно унаследована.{{/2}} {{3}}Но это модель с самостоятельной архитектурой — 42 слоя против 66 у флагмана, с той же топологией маршрутизации: 6 активных экспертов из 256 плюс 2 общих, а значит, сами эксперты уже, а не их меньше.{{/3}} {{4}}И она получила около двух недель RL на агентном написании кода, которых учитель так и не получил.{{/4}} {{5}}Именно этот последний этап объясняет, почему дистиллированный ученик обходит своего учителя в бенчмарках по программированию, чего в противном случае не должно было бы случиться.{{/5}}
Могу ли я реально разместить это самостоятельно?
Только на серьезном железе. {{1}}276B параметров — это примерно 276ГБ весов в 8-битном формате и около 552ГБ в BF16{{/1}}, без учета KV-кэша{{2}} — в любом случае это много-GPU узел{{/2}}, а не рабочая станция. {{3}}Преимущество разреженного MoE — стоимость инференса, а не объем памяти; вы храните все 276B, а вычисляете с 12B.{{/3}} {{4}}В карточке указаны SGLang, vLLM, TokenSpeed, Unsloth и Hugging Face Transformers как поддерживаемые способы обслуживания{{/4}}, а также перечислены числовые форматы BF16 и NVFP4{{5}}. {{6}}Обратите также внимание, что оба хостируемых эндпоинта сегодня обслуживают квантованную версию{{/6}}, поэтому «та же модель», развернутая самостоятельно в BF16, не будет вести себя идентично API, с которым вы тестировали.{{7}}
Есть ли у 975B Inkling всё ещё причина для существования?
Три, и все они узкие: полный обслуживаемый контекст в 1 млн токенов, аудиовходы длиннее двух минут и лучшее поведение в плане состязательной безопасности. Примечательно, что «он умнее» — не уверенный пункт этого списка: один балл индекса при максимальных мыслительных усилиях против набора вендорских бенчмарков, в которых меньшая модель в основном выигрывает, не является аргументом о возможностях. Через две недели после запуска флагмана с 975B параметров Thinking Machines выпустила модель, которую трудно рекомендовать. Это либо необычная откровенность, либо необычная скорость, и в любом случае это хороший знак о лаборатории.
Что посмотреть дальше
Три вещи определят, как эта версия выдержит испытание временем. Появится ли эндпоинт, предоставляющий заявленный контекст 1M, — это устранило бы самое явное оставшееся преимущество флагмана. Опубликует ли кто-нибудь независимое сравнение двух моделей с сопоставимыми усилиями — единственный способ узнать, реален ли тот самый пункт индекса. И является ли 2-минутная аудиорекомендация ограничением обучения или настройкой сервинга по умолчанию — потому что если второе, самая веская причина оставаться на более крупной модели исчезает. До тех пор честное резюме таково: Thinking Machines выпустила модель, которая стоит треть цены, на две трети быстрее, лучше пишет код по собственным данным, незначительно отстаёт по независимым совокупным оценкам и явно уступает конкуренту того же размера, которого большинство публикаций не упомянули.
