Inkling-Small-1
Guides & Insights

Inkling-Small: модель в четверть размера, которая превосходит собственный флагман, но по-прежнему отстаёт от индекса

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Thinking Machines Lab потратила две недели после выпуска своей первой модели с открытыми весами на создание модели примерно вчетверо меньшего размера, и по собственной системе оценок лаборатории меньшая модель побеждает.Inkling-Small показывает 80.2% на SWE-bench Verified против Inkling, у которого 77.6% на SWE-bench Verified; 89.5% на GPQA Diamond против 87.2%; 64.7% на Terminal-Bench 2.1 против 63.8%; и 31.6% на Humanity's Last Exam против 29.7% — при этом в модели 276B общих параметров с 12B активными, а не 975B с 41B. Из ключевых показателей, общих для обеих карточек моделей, флагманская 975B-модель оказывается лучшей только по одному: AIME 2026, на 1.6 пункта.

Затем Artificial Analysis прогнала обе модели независимо и оценила Inkling-Small в 40 баллов по своему Intelligence Index против 41 у Inkling — меньшая модель на балл позади. Оба этих результата реальны, и пространство между ними — самое полезное в этом запуске. Всё, что ниже, разделяет то, что Thinking Machines сообщает о собственной модели, и то, что измерил кто-то другой: цифры производителя взяты из анонса и двух карточек моделей на Hugging Face, независимые цифры — из собственных прогонов Artificial Analysis, а цифры по ценам и контексту — из живых данных конечных точек OpenRouter, проверенных в день написания этого текста. Там, где эти три источника расходятся — а по длине контекста они расходятся — мы говорим об этом, а не выбираем более лестную цифру.

Что на самом деле вышло 30 июля

Inkling-Small — это разреженный трансформер на основе смеси экспертов: всего 276B параметров, 12B активных на токен, 42 слоя, при этом каждый токен направляется к 6 из 256 экспертов плюс 2 общих эксперта, которые срабатывают на всё. Внимание чередует локальные и глобальные слои. Веса доступны на Hugging Face под лицензией Apache 2.0 без коммерческих ограничений, модель дообучается через Tinker API от Thinking Machines, и вы можете общаться с ней текстом, изображениями и аудио в Tinker Playground. Лаборатория сообщает, что модель обучалась на системах NVIDIA GB300 NVL72.

Inkling-Small-2

Мультимодальность здесь врождённая, а не прикрученная, и карточка необычно конкретна в описании того, как именно. Отдельного энкодера для изображений или аудио нет: аудио поступает в виде dMel-спектрограмм, изображения — в виде патчей 40×40 пикселей, пропущенных через четырёхслойный hMLP, и оба типа данных встраиваются напрямую в тот же поток токенов, что и текст. Вход — это текст, изображения и аудио; выход — только текст, что стоит указать прямо, потому что слово «мультимодальный» достаточно часто понимают как «он умеет говорить», и это может испортить день. Усилие мышления — это регулятор с пятью режимами — минимальный, низкий, средний, высокий, сверхвысокий — так что одни и те же веса можно запускать дёшево или на полную мощность.

Самая интересная часть рецепта — это пост-обучение. Inkling-Small был дистиллирован в режиме on-policy с полной версией Inkling в качестве учителя, а затем получил ещё примерно две недели обучения с подкреплением, масштабированного на агентное программирование. Этот порядок объясняет форму результатов: ученик унаследовал общую компетентность учителя, а затем получил дополнительное обучение именно по той оси, по которой теперь превосходит учителя.

Табло, опубликованное Thinking Machines

Бенчмарки вендора — это маркетинг, пока кто-то не воспроизведёт их, поэтому читайте этот раздел как заявления лаборатории, а не как проверенные данные. Тем не менее набор широкий, и он широк в направлении, нелестном для флагмана.

Inkling-Small-3

Помимо четырех общих чисел, карточка заполняет остальную часть картины — все собственные запуски Thinking Machines:

Агентная работа — 1269 Elo на GDPval-AA v2, бенчмарке реалистичных экономических задач, а не головоломок.

Диаграммы и документы — 77,4% на CharXiv RQ, доходя до 81,3%, когда модели разрешено писать и запускать Python. Этот скачок на 3,9 пункта — полезный намёк на то, что доступ к инструментам даёт больше в задачах визуального рассуждения, чем инженерия промптов.

Vision — 74.0% на MMMU Pro, чуть выше 73.5% у Inkling.

Аудио — 90.1% VoiceBench и 77.0% MMAU, оба показателя незначительно ниже показателей флагмана (91.4% и 77.2%). Аудио — одна из двух областей, где уменьшение явно имело свою цену.

Безопасность — 98.4% StrongREJECT и 96.9% на безвредных запросах FORTRESS, но 71.6% на состязательных запросах FORTRESS против 78.0% у флагманской модели. Это другая цена: регресс на 6,4 пункта в состязательной устойчивости, что важнее любого выигрыша в кодировании, если модель будет размещена за публичным текстовым окном.

Прогнозирование — 61.3 ± 0.46 по индексу Брайера на ForecastBench без доступа к поиску, и 0.1238 ± 0.0086 по шкале Брайера на Prophet Arena. Уже то, что здесь вообще указаны доверительные интервалы, — это больше дисциплины, чем демонстрирует большинство анонсов запусков.

Один пробел: в карточке флагмана указано 54,3% на SWE-bench Pro, более сложном собрате SWE-bench Verified. В карточке Inkling-Small не указан SWE-bench Pro. Учитывая, насколько заметно представлено число Verified, его отсутствие — это цифра, которую мы больше всего хотели бы увидеть заполненной.

Что вместо этого говорит независимый индекс

Artificial Analysis оценивает Inkling-Small в 40 баллов по версии 4.1 своего Индекса интеллекта, на один балл ниже Inkling с 41 баллом. Индекс представляет собой совокупность девяти оценок — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience и AA-LCR — и этот список объясняет большую часть кажущегося противоречия. Лишь две из девяти пересекаются с демонстрацией рассуждений на карточке Thinking Machines. Остальные смещены в сторону агентного использования инструментов, поиска в длинном контексте и устойчивости к галлюцинациям, и модель может выигрывать бенчмарки, которые лаборатория выбирает для публикации, но проигрывать те, которые выбирает третья сторона. Ни одна из сторон не лжёт; они измеряют разные вещи.

Inkling-Small-4

В мелком шрифте есть ещё одна деталь, которая важнее, чем заголовок о перевесе в один пункт: Artificial Analysis указывает запись флагмана как Inkling (xhigh) — его максимальную настройку мыслительных усилий, — тогда как в строке Inkling-Small нет суффикса уровня усилий. Так что перевес флагмана в один пункт был зафиксирован с выкрученным до упора регулятором рассуждений. Если бы выравнивание усилий хоть немного сдвинуло это сравнение, последний аргумент в пользу более крупной модели по одним лишь способностям исчез бы вместе с ним.

А вот скорость и стоимость — это то, где независимые данные совсем не близки, и здесь они отдают предпочтение небольшой модели с отрывом, которого не передаёт ни одна таблица бенчмарков:

Скорость вывода — 133 токена в секунду против 80 у Inkling (xhigh). Artificial Analysis ставит Inkling-Small на 7-е место из 101 модели в своём классе по скорости, при медиане по классу 66.

Время до первого токена — 1.63 с против 1.84 с. Реальное, но незначительное преимущество.

Смешанная цена за 1 млн токенов — $0,22 против $0,72 при их взвешивании. Примерно треть стоимости, но на один индексный пункт меньше.

Ранг интеллекта — #15 из 101, при медианном балле класса 25. Уверенно выше среднего, но далеко до переднего края.

Многословность — и вот в чём загвоздка. Он сжёг 130M выходных токенов на прохождение индекса, при медиане 100M. Собственная сводка Artificial Analysis называет его «заметно быстрым, однако довольно многословным». Он думает примерно на 30% больше обычного, что незаметно съедает часть скидки за токен.

Небольшое примечание для сверки: поскольку любой, кто сравнивает источники, на это наткнётся — Artificial Analysis указывает общее количество параметров как 266B, тогда как в анонсе, обеих карточках модели и на OpenRouter указано 276B. Мы везде использовали 276B. Это не меняет никаких выводов, но это как раз то расхождение, о котором стоит знать, прежде чем цитировать цифру в проектном документе.

Что на самом деле можно арендовать сегодня, вопреки тому, что указано в характеристиках.

Разрыв между анонсом открытых весов и рабочим эндпоинтом — это то место, где большинство материалов о запусках перестаёт обращать внимание. Thinking Machines заявляет контекстное окно до 1M токенов, и Artificial Analysis также указывает 1M. На OpenRouter оба провайдера, которые в настоящее время предоставляют Inkling-Small, ограничивают его до 524,288 токенов — половины заявленного значения. Это не столько противоречие, сколько разница между тем, что поддерживает архитектура, и тем, что кто-либо развернул в продакшене. Для сравнения, флагманская модель Inkling действительно имеет один эндпоинт на полных 1,048,576 токенов, хотя этот же эндпоинт ограничивает генерацию до 32,768 токенов.

Остальная часть актуальной картины, считанная с данных конечных точек OpenRouter:

Два провайдера, две цены — $0,45 за 1M входных токенов и $1,20 за 1M выходных от одного, $0,50 и $1,20 от другого. Artificial Analysis указывает собственный тариф Thinking Machines ещё ниже — $0,30 и $1,20, с кэшированным вводом по $0,06. Сторонний хостинг берёт наценку 50–67% на входные токены при тех же весах.

Кэширование промптов — $0.10 за 1 млн кэшированных входных токенов через OpenRouter, против $0.17 для флагманской модели.

Числовые форматы, которые вы арендуете, — не те, что были в бенчмарке — в карточке модели указаны BF16 и NVFP4. Более дешёвый endpoint использует fp8; другой вообще не указывает квантизацию. Результаты вендора в бенчмарках не замерялись на fp8-версии этих весов, а эффекты квантизации при длительных агентских прогонах — ровно то, что отрыв в 0,9 балла на Terminal-Bench не переживёт. Если воспроизводите число, отметьте, какой endpoint вы использовали.

Покрытие функций неравномерно в зависимости от провайдера — оба эндпоинта предоставляют reasoning и reasoning_effort, так что пятиуровневый регулятор мышления работает. Но только один анонсирует tool calling и logprobs, и ни один из них пока не анонсирует response_formatпараметр структурированного вывода (JSON-режима). Флагманская модель Inkling имеет эндпоинт, который это делает. Если ваш пайплайн зависит от JSON со схемой, эта деталь аукнется в первый же день, и это ограничение провайдера, а не модели.

Потолок завершения — 262 144 токена на эндпоинте fp8; другой не объявляет лимита.

Расчет стоимости на основе измеренного количества токенов

Цены за миллион токенов — плохой способ сравнивать модели рассуждений, потому что единственная переменная — это сколько токенов они сжигают на размышления. Artificial Analysis публикует фактические затраты, что является гораздо лучшим инструментом: прохождение Inkling-Small через полный Intelligence Index потребовало примерно 130 млн выходных токенов и обошлось в $192.37, что составляет около $0.07 за задачу по их средневзвешенному показателю.

Сравните это с тем же показателем для моделей, которые люди реально развертывают: DeepSeek V4 Flash по $0.03 за задачу, gpt-oss-120b по $0.08, Gemini 3.6 Flash по $0.56, GLM-5.2 по $0.57, Kimi K3 по $0.86, GPT-5.6 Sol по $1.23, Claude Opus 5 по $2.34, Claude Fable 5 по $3.15. Inkling-Small — вторая по дешевизне модель в этой группе и примерно в 18 раз дешевле за задачу, чем GPT-5.6 Sol, который набирает 59 против 40 у Inkling-Small.

Есть также более наглядный способ понять, почему цена упала именно там. Количество активных параметров снизилось с 41B до 12B, то есть в 3,4 раза. Цена вывода упала с $4,05 до $1,20 за миллион, то есть в 3,375 раза. Арендная цена разреженной MoE — это по сути лишь её вычислительная стоимость на токен, и Thinking Machines установила цену соответственно, а не привязываясь к бенчмаркам.

Одно практическое замечание о том, как провести это сравнение самостоятельно: Inkling-Small на сегодняшний день нет в каталоге OrcaRouter, поэтому вам пришлось бы арендовать его через его собственные эндпоинты. Закрытые модели, с которыми вы бы его сравнивали — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash и остальные из этого списка, — доступны в OrcaRouter по одному ключу с наценкой 0%, то есть вы платите цену по прайс-листу каждого провайдера, и к ней ничего не добавляется сверху. Это важно именно для модели затрат: сумма, которую вы вносите в таблицу, — это сумма, которая выставляется к оплате, и когда провайдер снижает цены, у нас это отражается в тот же день, а не после пересмотра условий. Автоматическое переключение между провайдерами закрывает вторую половину оценки, а именно когда контрольная ветвь падает в середине запуска и незаметно искажает ваши показатели.

Где оно на самом деле находится среди моделей с открытыми весами

В сравнении с флагманом Inkling-Small выглядит триумфом. В сравнении с остальными моделями это добротная open-weights модель из середины таблицы, и в освещении запуска в основном упустили это второе прочтение.

Согласно индексу Artificial Analysis Intelligence, модели, опережающие обе Inklings, включают Claude Opus 5 с результатом 61, Claude Fable 5 — 60, GPT-5.6 Sol — 59, Kimi K3 — 57, Grok 4.5 — 54, GLM-5.2 и Muse Spark 1.1 — 51, а также Gemini 3.6 Flash — 50. Это ожидаемо: это передовые системы, большинство из них закрытые, некоторые — огромные.

То, что действительно должно изменить решение, — это DeepSeek V4 Flash, который набирает 50 против 40 у Inkling-Small при 284B всего и 13B активных — практически тот же размерный класс и та же выгодная цена моделей с открытыми весами, при менее чем половине стоимости за задачу. Если вам нужна самая дешёвая работоспособная модель с открытыми весами, независимые цифры указывают туда, а не сюда. Кроме того, в отличие от Inkling-Small, она доступна через OrcaRouter, так что проверка этой альтернативы на вашей собственной нагрузке — это смена строки модели, а не закупочная процедура.

Что есть у Inkling-Small, чего нет у DeepSeek V4 Flash, так это нативная поддержка аудио и изображений в одних и тех же весах, пятиуровневый регулятор мышления и тонкая настройка Tinker от лаборатории, которая его обучала. Это реальные отличия для мультимодального агента, и это честная причина выбрать его — а не индексный балл.

Кто должен переехать, а кто должен остаться на месте

Решение чётко разделяется, что само по себе достаточно необычно, чтобы это стоило отметить.

Переходите с Inkling на Inkling-Small, если вы запускаете агентов для написания кода.Показатели вендора говорят в пользу малой модели на SWE-bench Verified и Terminal-Bench, дополнительный агентный RL — документально подтверждённая причина, а стоит она примерно в три раза меньше и возвращает токены в 1,66 раза быстрее. Платить в 3,3 раза больше за один пункт индекса, измеренный при максимальных мыслительных усилиях, — это трудно обосновать.

Переходите, если стоимость за задачу рассуждения является ограничивающим фактором и вас устраивает 40 в индексе. $0.07 за задачу при ставке $0.06 за миллион попаданий в кэш на собственном endpoint — агрессивная цена для модели с нативной поддержкой аудио и зрения.

Переходите, если вы занимаетесь тонкой настройкой. Модель 276B/12B гораздо дешевле адаптировать и обслуживать, чем 975B/41B, и Tinker поддерживает обе.

Оставайтесь на Inkling, если вам нужна длинная аудиозапись. Это самое резкое ухудшение в релизе, и оно спрятано в карточках моделей: флагманская модель рекомендует аудиоматериалы до 20 минут, а карточка Inkling-Small рекомендует менее 2 минут. Сокращение в десять раз. Если вы расшифровывали или анализировали совещания, малая модель не является полноценной заменой ни за какую цену.

Оставайтесь, если вам нужен контекст более 512K от размещенного эндпоинта, или ответы длиннее 262K токенов. Сегодня только флагман имеет эндпоинт с полным миллионом токенов.

Оставайтесь, если вам нужен JSON, подчиняющийся схеме, без написания собственного цикла проверки и повторных попыток, пока провайдер не предоставит response_format для маленькой модели.

Остаёмся, если устойчивость к состязательным атакам критически важна. 71,6% против 78,0% на FORTRESS adversarial — это неверное направление для любого пользовательского продукта, и это собственная цифра лаборатории.

Три вопроса, которые освещение запуска оставило открытыми

Inkling-Small — это просто дистиллированный Inkling?

{{1}}Частично, а та часть, что не сводится к этому, и есть самая важная.{{/1}} {{2}}Дистилляция по политике, где учителем выступала Inkling, была одним из этапов пост-обучения, так что значительная доля общих способностей действительно унаследована.{{/2}} {{3}}Но это модель с самостоятельной архитектурой — 42 слоя против 66 у флагмана, с той же топологией маршрутизации: 6 активных экспертов из 256 плюс 2 общих, а значит, сами эксперты уже, а не их меньше.{{/3}} {{4}}И она получила около двух недель RL на агентном написании кода, которых учитель так и не получил.{{/4}} {{5}}Именно этот последний этап объясняет, почему дистиллированный ученик обходит своего учителя в бенчмарках по программированию, чего в противном случае не должно было бы случиться.{{/5}}

Могу ли я реально разместить это самостоятельно?

Только на серьезном железе. {{1}}276B параметров — это примерно 276ГБ весов в 8-битном формате и около 552ГБ в BF16{{/1}}, без учета KV-кэша{{2}} — в любом случае это много-GPU узел{{/2}}, а не рабочая станция. {{3}}Преимущество разреженного MoE — стоимость инференса, а не объем памяти; вы храните все 276B, а вычисляете с 12B.{{/3}} {{4}}В карточке указаны SGLang, vLLM, TokenSpeed, Unsloth и Hugging Face Transformers как поддерживаемые способы обслуживания{{/4}}, а также перечислены числовые форматы BF16 и NVFP4{{5}}. {{6}}Обратите также внимание, что оба хостируемых эндпоинта сегодня обслуживают квантованную версию{{/6}}, поэтому «та же модель», развернутая самостоятельно в BF16, не будет вести себя идентично API, с которым вы тестировали.{{7}}

Есть ли у 975B Inkling всё ещё причина для существования?

Три, и все они узкие: полный обслуживаемый контекст в 1 млн токенов, аудиовходы длиннее двух минут и лучшее поведение в плане состязательной безопасности. Примечательно, что «он умнее» — не уверенный пункт этого списка: один балл индекса при максимальных мыслительных усилиях против набора вендорских бенчмарков, в которых меньшая модель в основном выигрывает, не является аргументом о возможностях. Через две недели после запуска флагмана с 975B параметров Thinking Machines выпустила модель, которую трудно рекомендовать. Это либо необычная откровенность, либо необычная скорость, и в любом случае это хороший знак о лаборатории.

Что посмотреть дальше

Три вещи определят, как эта версия выдержит испытание временем. Появится ли эндпоинт, предоставляющий заявленный контекст 1M, — это устранило бы самое явное оставшееся преимущество флагмана. Опубликует ли кто-нибудь независимое сравнение двух моделей с сопоставимыми усилиями — единственный способ узнать, реален ли тот самый пункт индекса. И является ли 2-минутная аудиорекомендация ограничением обучения или настройкой сервинга по умолчанию — потому что если второе, самая веская причина оставаться на более крупной модели исчезает. До тех пор честное резюме таково: Thinking Machines выпустила модель, которая стоит треть цены, на две трети быстрее, лучше пишет код по собственным данным, незначительно отстаёт по независимым совокупным оценкам и явно уступает конкуренту того же размера, которого большинство публикаций не упомянули.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube