Обзор модели Inkling AI: первая модель с открытыми весами от Thinking Machines, протестированная и объясненная
Guides & Insights

Обзор модели Inkling AI: первая модель с открытыми весами от Thinking Machines, протестированная и объясненная

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Этот обзор модели Inkling AI тщательно рассматривает дебютный выпуск компании Thinking Machines Lab, стартапа, возглавляемого бывшим техническим директором OpenAI Мирой Мурати. Inkling — это модель с открытыми весами, мультимодальная архитектура Mixture-of-Experts (MoE) с окном контекста в 1 миллион токенов и регулируемым “thinking effort”. Она быстрая, дешевая в самостоятельном хостинге и создана для настройки, а не для доминирования в рейтингах. Ниже мы отделяем самостоятельно заявленные бенчмарки вендора от независимых измерений, проходим по архитектуре, показываем, как ее запустить, и точно объясняем, кому стоит (а кому не стоит) ее внедрять.

По состоянию на: 2026-07-16 — один день после запуска. Это аналитический обзор; на данный момент не существует долгосрочного практического тестирования ни одной столь новой модели, и мы помечаем каждую непроверенную цифру ниже.

Заметка для разработчиков: если вы хотите попробовать Inkling вместе с другими моделями, OrcaRouter предоставляет доступ к моделям через единую конечную точку, совместимую с OpenAI, так что вы можете сравнивать и переключаться без новых интеграций.

- TL;DR вердикт:Inkling — это действительно способная, эффективная открытая модель, которая отлично подходит для тонкой настройки и экономически эффективного развертывания, но она не является лидером передовых технологий, и её создатель открыто это признаёт. Если вам нужна настраиваемая, бесплатная основа с огромным контекстным окном, это один из самых интересных запусков 2026 года. Если вы хотите самую мощную из доступных моделей, ищите в другом месте.

- Что это: Модель рассуждений MoE с открытыми весами (Apache 2.0). Для кого: Специалисты, которые хотят дообучить и разместить модель самостоятельно, а не платить за закрытый API передовых моделей.

Основные выводы

Производитель & дата: Thinking Machines Lab; выпущен 15 июля 2026 года как первая модель лаборатории.

Архитектура: Разреженные MoE, 975B общих / 41B активных параметров, 66 слоёв, контекст до 1M токенов в весах (256K через размещенные API).

Лицензия: Apache 2.0 — полные веса на Hugging Face, бесплатно для коммерческого использования и самостоятельного хостинга.

Честное позиционирование: Компания прямо заявляет, что она «не является самой мощной моделью, доступной сегодня, закрытой или открытой».

Независимая оценка: 41/100 по индексу Artificial Analysis Intelligence — #10 из 97 моделей, и опережает несколько открытых аналогов (см. сверку ниже).

Стоимость: Веса бесплатны для самостоятельного хостинга; платный доступ начинается около $1.87 / 1M входных токенов.

Предостережение: Почти все основные показатели производительности предоставляются самими поставщиками и не проходят независимую проверку.

Кто стоит за Inkling

— Founder box. Инклинг — первая модель из Thinking Machines Lab (thinkingmachines.ai), основанная Mira Murati, ранее занимавшая должность технического директора в OpenAI. Лаборатория работала в относительной секретности до этого запуска и заняла позицию открытых весов, что контрастирует с подходом закрытых флагманов бывшего работодателя Мурати. Thinking Machines не монетизирует саму модель — доход поступает через её Tinker платформу для тонкой настройки и сторонних хостинг-партнеров. Эта бизнес-модель является ключевой для понимания Inkling: веса — это бесплатный вход, и компания зарабатывает, когда вы настраиваете или масштабируете.

Что такое Inkling?

Inkling — это большая языковая и рассуждающая модель с открытыми весами, мультимодальная, Mixture-of-Experts, анонсированная компанией Thinking Machines Lab 15 июля 2026 года и выпущенная под разрешительной Apache 2.0 лицензией с полными весами на Hugging Face.

Что делает этот запуск заметным, так это его подача. Вместо того чтобы претендовать на корону первопроходца, Thinking Machines описывает Inkling как универсальную, эффективную, настраиваемую открытую модель. В необычно откровенном признании для дня запуска компания заявляет, что Inkling «не является самой сильной моделью, доступной сегодня, ни закрытой, ни открытой». Эта честность задает тон всему этому обзору: Inkling — это инструмент, предназначенный для адаптации, самостоятельного размещения и тонкой настройки, а не трофей для бенчмарков.

Освещение в Fortune и TechCrunch повторило эту трактовку. TechCrunch утверждал, что Inkling не угрожает OpenAI, Anthropic или Google на передовом уровне, но вместо этого оказывает давление на средний уровень провайдеров открытых весов и платформ для тонкой настройки. Forbes представил стратегию открытых весов Мурати как более близкую к китайскому подходу с открытыми моделями (DeepSeek, Qwen, Kimi), чем к закрытым американским флагманам — нарратив «США против Китая» в области открытых весов, проходящий через многие комментарии к запуску.

Архитектура и характеристики

Под капотом Inkling представляет собой разреженный трансформер с ансамблем экспертов. На каждый токен активируется лишь часть его параметров, что обеспечивает эффективность инференса, несмотря на большое общее число параметров. Подробности описаны в официальной карточке модели и блоге Hugging Face.

Общее количество параметров: 975B

Активные параметры: 41B (разреженный MoE)

Слои: 66-слойный декодерный трансформер

Эксперты: 256 маршрутизируемых + 2 общих; 6 из 256 маршрутизируемых на токен (2 общих всегда активны)

Маршрутизация: Sigmoid / aux-loss-free

Внимание: Гибрид, скользящее окно 5:1 (локальное) в глобальное; 8 головок KV

Позиционное кодирование: Обучаемые относительные позиционные вложения (не RoPE)

Мультимодальность: без энкодера — аудио как dMel-спектрограммы, изображения как патчи 40×40, подаваемые напрямую

Дополнительно: Короткие свертки (SConv); слои MTP для спекулятивного декодирования

Численные форматы: BF16, MXFP8, NVFP4 (NVFP4 checkpoint для NVIDIA Blackwell)

Контекстное окно: До 1,000,000 токенов в весах (256K на размещенных API)

Меньший вариант: Inkling-Small, всего 276B / 12B активных (предварительная версия, веса еще не выпущены)

Несколько дизайнерских решений отличают Inkling от стандартного MoE:

Экспертная компоновка. С 256 маршрутизируемыми экспертами плюс 2 общими экспертами, и 6 маршрутизируемых экспертов, срабатывающих на каждый токен, общая пара действует как постоянно включенный «экспертный сток», который захватывает общие вычисления, в то время как маршрутизируемые эксперты специализируются. Сигмоидная маршрутизация без вспомогательных потерь избегает штрафного члена балансировки нагрузки, используемого во многих архитектурах MoE.

Относительные позиционные встраивания, а не RoPE. Большинство современных моделей с длинным контекстом полагаются на вращательные встраивания; Inkling вместо этого использует обученные относительные позиционные встраивания, что является необычным выбором для такого масштаба.

Мультимодальность без энкодеров. Вместо добавления отдельных энкодеров для зрения и звука, Inkling напрямую подаёт в стек трансформера 40×40 патчи изображений и dMel аудиоспектрограммы. Это упрощает конвейер и отчасти объясняет, почему модель описывается как нативно мультимодальная.

MTP для спекулятивного декодирования. Слои многотокенного предсказания (MTP) действуют как встроенный драфтер, ускоряя генерацию без отдельной модели драфтера.

Примечание редактора — добавьте визуал: Маркированная блочная диаграмма одного слоя Inkling — скользящее окно против глобального внимания (5:1), маршрутизатор экспертов 256+2 с выделенными 6 активными экспертами, SConv и головка MTP drafter.

Обучение и регулятор «мыслительного усилия»

Inkling был предварительно обучен на 45 триллионов мультимодальных токенов охватывающих текст, изображения, аудио и видео, с использованием гибридного оптимизатора (Muon для больших матричных весов, Adam для остальных) на системах NVIDIA GB300 NVL72. Пост-тренировка использовала крупномасштабное асинхронное обучение с подкреплением, масштабированное более 30M+ развертываний на двух длительных непрерывных запусках, начиная с первоначальной контролируемой тонкой настройки на синтетических данных.

Отличительной особенностью является управляемый параметр усилия рассуждения, демонстрирующий изменение примерно от 0,2 до 0,99, где более высокие значения означают больше рассуждений и больше затрат. Это позволяет операторам обменивать задержку и расходы на глубину мысли. Все приведенные ниже показатели эталонных тестов были получены при Effort = 0,99.

Управляемое мыслительное усилие: практическое руководство

В развертывании управление усилиями представлено в виде перечисления reasoning_effort с уровнямиnone / minimal / low / medium / high / xhigh / max. Нет единственно «правильной» настройки — это живой рычаг для компромисса между задержкой, стоимостью и качеством. Используйте таблицу ниже в качестве отправной карты (относительное руководство; качество эталонного уровня измерялось в верхней части диапазона):

нет / минимально. Относительная задержка & стоимость токенов: Наименьшая; Лучше всего для: Классификация, извлечение, форматирование, маршрутизация, связующий код для поиска

низкая. Относительная задержка и стоимость токенов: Низкая; Лучше всего для: Короткие вопросы и ответы, простое обобщение, пакетные задания с большим объемом

средняя. Относительная задержка и стоимость токенов: Умеренная; Лучше всего подходит для: Общий чат, черновики, большинство вызовов инструментов агента

высокая. Относительная задержка & стоимость токенов: Выше; Лучше всего для: Многошаговое рассуждение, генерация кода, анализ

xhigh / макс. Относительная задержка и стоимость токенов: Наивысшая; Лучше всего для: Сложная математика, рассуждения в стиле соревнований, паритет бенчмарков (Effort=0.99)

Вы можете запустить его локально? Оборудование и VRAM

Поскольку Inkling — это модель с 975 миллиардами параметров, «локальная» работа на практике означает много-GPU сервер, а не ноутбук. Примерные требования (согласно обзорам запуска и инструментам сообщества):

BF16 (полный). Прибл. совокупный объем видеопамяти: ~2 ТБ; Примеры конфигураций: 8× NVIDIA B300, или 16× H200

NVFP4 (квантованный). Прибл. совокупная видеопамять: ~600 ГБ; Примеры конфигураций: 4× NVIDIA B300 или 8× H200

GGUF (сообщество). Прибл. совокупный объем VRAM: Зависит от квантования; Примеры конфигураций: Сборки Unsloth GGUF существуют для меньших/квантованных объемов

Контрольная точка NVFP4, выпущенная специально для NVIDIA Blackwell, сокращает затраты памяти примерно на две трети по сравнению с BF16, что составляет разницу между узлом B300 с 8 GPU и узлом с 4 GPU. Для большинства команд это по-прежнему указывает на выбор хостинг-провайдера или арендованного GPU-узла, а не собственного оборудования. Квантования Unsloth GGUF расширяют возможности для экспериментов на более низких уровнях оборудования, но с некоторыми потерями в качестве.

Быстрый старт развертывания

Inkling предоставляет совместимый с OpenAI API, поэтому большинство существующего клиентского кода работает как замена без изменений (drop-in) с изменённым базовым URL и именем модели. Три общих пути обслуживания:

vLLM — однокомандный сервер (по умолчанию порт 8000):

vllm serve thinkingmachines/Inkling --port 8000
# затем вызовите совместимую с OpenAI конечную точку по адресу http://localhost:8000/v1

SGLang — шардирование на 8 GPU (по умолчанию порт 30000):

python -m sglang.launch_server \
  --model-path thinkingmachines/Inkling \
  --tp 8 --port 30000

Hugging Face transformers — загрузить через мультимодальный авто класс:

from transformers import AutoModelForMultimodalLM, AutoProcessor

model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# передать reasoning_effort в {none, minimal, low, medium, high, xhigh, max}

Поскольку конечная точка совместима с OpenAI, миграция существующего приложения обычно сводится к тому, чтобы указать вашему SDK новый базовый URL и настроить reasoning_effort по вкусу. Дополнительные среды выполнения при запуске включают TokenSpeed и Unsloth.

Где запустить: доступность провайдера инференса

Если вы предпочитаете не управлять GPU, несколько партнеров размещают Inkling. Варианты «Run Inkling on X» при запуске:

Tinker (Thinking Machines). Роль: Тонкая настройка; Примечания: Опции контекста 64K и 256K; скидка 50% на запуск в течение ограниченного времени (платная)

Together AI. Роль: Хостируемый инференс; Примечания: OpenAI-совместимые конечные точки

Фейерверк. Роль: Размещенный вывод; Примечания:

Modal. Роль: Хостированный инференс / безсерверный GPU; Примечания:

Databricks. Роль: Размещённый инференс; Примечания: через Unity AI Gateway

Baseten. Роль: Инференс на хостинге; Примечания:

Бенчмарки: заявления вендора vs. независимые измерения

Это самая важная часть любого честного Inkling review 2026, потому что цифры поступают из двух совершенно разных мест.

Раскрытие информации: За исключением Artificial Analysis Index, каждый приведенный ниже бенчмарк Inkling предоставлен вендором на момент запуска (Effort = 0.99, temperature 1.0) и не был независимо проверен. Конкурентные показатели получены от третьих сторон (MarkTechPost, Artificial Analysis) или перезапущены компанией Thinking Machines, и также не проверены независимо здесь. Некоторые данные содержат ограничения по прогону или подмножеству. Относитесь ко всем как к приблизительным, а не к абсолютной истине.

Баллы, указанные поставщиком самостоятельно

Согласно собственным материалам запуска Thinking Machines:

AIME 2026 (математика): 97.1%

GPQA Diamond (научные рассуждения): 87.2%

SWE-bench Verified (кодинг, только bash-среда): 77.6%

SWE-bench Pro (Публичный): 54.3%

MMMU Pro (мультимодальный): 73.3%

VoiceBench (аудио): 91.4%

MMAU (аудио): 77.2%

IFBench (следование инструкциям): 79.8%

Terminal Bench 2.1 (агентный терминал): 63.8

FORTRESS Состязательная: 78.0%

SimpleQA Проверено: 43.9%

На бумаге они выглядят убедительно, особенно показатели математического и научного мышления. Но компания протестировала Inkling в сравнении с версиями конкурентов ближайшего будущего (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) используя оценки, которые она сгенерировала самостоятельно. Эти цифры конкурентов могут не соответствовать собственным заявленным показателям соперников, поэтому прямые сравнения следует воспринимать с осторожностью.

Мульти-модельное прямое сравнение (конкуренты с открытыми весами)

Самое наглядное сравнение Inkling с другими моделями с открытым весом взято из сравнительной таблицы MarkTechPost (воспроизведена ниже, с указанием авторства MarkTechPost). Оно полезно именно потому, что помещает соперников в одну рамку:

HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%

AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%

SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%

Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%

FORTRESS (состязательный). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%

MarkTechPost. Не является независимо проверенным.

Шаблон ясен и согласуется со скромностью Thinking Machines. Inkling лидирует в FORTRESS (безопасность от состязательных атак) и превосходит Nemotron 3 Ultra по всем показателям, но он отстаёт GLM 5.2, Kimi K2.6 и DeepSeek V4 Pro в тестах HLE, SWE-bench Verified и особенно Terminal Bench 2.1 (63.8% против 82.7% у GLM 5.2). Если вашим приоритетом являются агентное программирование и терминальные задачи, ведущие китайские открытые модели сегодня впереди.

Независимое измерение (Artificial Analysis)

Для более нейтрального чтения, Artificial Analysis оценил Inkling 2026-07-15 и поместил его на 41/100 в своем Индексе Интеллекта, заняв #10 из 97 моделей. Два момента о том, как справедливо интерпретировать этот рейтинг:

Это сильное проявление открытой модели, а не общее #1. Согласно Artificial Analysis, индекс Inkling, равный 41, опережает Nemotron 3 Ultra (38), Gemma 4 31B (29) и gpt-oss-120b (24) — таким образом, среди моделей с открытыми весами он конкурентоспособен и лидирует. Но 10-е место из 97 означает, что в целом девять моделей занимают более высокие позиции, что соответствует определению «способная, но не передовая».

Эффективность — вот в чём она выделяется. Artificial Analysis отмечает высокую токен-эффективность — примерно 25 тысяч токенов для выполнения своего оценочного набора против 37–43 тысяч у сравниваемых моделей — и рейтинг Elo GDPval-AA v2 1238, опережая Kimi (1190) и DeepSeek V4 Flash (1189), плюс небольшое преимущество (+2) по AA-Omniscience.

Скорость вывода составила 72.7 токен/сек с временем первого токена 1.75 с. Вкратце: достойное место в первой десятке и действительно эффективный результат — но мы намеренно не преувеличиваем его как победу в таблице лидеров.

Мультимодальные и длинноконтекстные возможности

Inkling принимает текст (UTF-8), изображения (от 40px до 4096px через иерархический патч-энкодер) и аудио (16 кГц WAV, примерно до 20 минут, с использованием дискретного токенового кодирования). Вывод — только текст — генерация изображений и аудио отсутствует, поэтому планируйте использовать модель для понимания, а не для генерации. Видео использовалось во время предварительного обучения, но не является поддерживаемым или оцениваемым входом на момент запуска, поэтому не планируйте его использовать пока.

Главной возможностью является контекстное окно в 1 миллион токенов в опубликованных весах, что открывает двери для анализа кода целых репозиториев, синтеза длинных документов и расширенных многоэтапных сессий агентов без агрессивного разбиения на части. Обратите внимание на практический нюанс: хостируемые API предоставляют до 256K токенов, поэтому полный 1М — это функция самостоятельного хостинга на сегодняшний день. В сочетании с дизайном внимания со скользящим окном и спекулятивным декодированием история с длинным контекстом остается одним из самых практичных преимуществ Inkling.

Ценообразование, тарифы и совокупная стоимость владения

Inkling действительно открыта. Полные веса (контрольная точка BF16 плюс контрольная точка NVFP4) находятся на Hugging Face под Apache 2.0, поэтому самостоятельное развертывание не облагается роялти — вы платите только за вычисления. Thinking Machines не монетизирует саму модель; доход поступает через Tinker и сторонних хостинг-провайдеров.

Хостинговая цена за токен (по данным Artificial Analysis), по уровню контекста:

64K. Вход / 1M: $1.87; Кэшированный вход / 1M: $0.374; Выход / 1M: $4.68

256K. Вход / 1M: $3.74; Кэшированный вход / 1M: $0.748; Выход / 1M: $9.36

Отражает временную скидку 50% на запуск; точные показатели Tinker на токен находятся в документации и будут меняться.

Самостоятельное размещение против API — как думать о совокупной стоимости владения. Экономика зависит от объема и загрузки:

API (Tinker / partners): нулевая фиксированная стоимость, оплата за токен, почти мгновенный запуск. Лучше всего подходит при низком или неравномерном объеме, или при прототипировании.

Самостоятельное размещение (арендованные или собственные GPU): вы платите за узел с 4–8 GPU независимо от того, занят он или нет, но предельная стоимость токена приближается к стоимости сырой электроэнергии. Поскольку Inkling активирует только 41B параметров и является токен-эффективным (~25K против 37–43K по данным набора Artificial Analysis), пропускная способность на GPU-час является благоприятной, и тяжелые, стабильные рабочие нагрузки могут оказаться существенно дешевле, чем ценообразование за токен через API, когда узел хорошо загружен. Комментарии вокруг запуска представили самостоятельное размещение открытых весов как примерно на 40–60% дешевле, чем использование сопоставимых закрытых API в масштабе — это ориентировочное утверждение, а не проверенная цифра.

Примечание редактора — добавить визуализацию: График безубыточности — ежемесячный объем токенов (x) против общей стоимости (y) с тремя линиями: closed frontier API, Inkling hosted API и Inkling self-hosted на арендованном GPU-узле — показывающий точку пересечения, где self-hosting становится выгодным.

Безопасность, согласование и цензура

Безопасность — одна из самых сильных и отличительных сторон Inkling. На FORTRESS adversarial бенчмарке она набирает 78.0%лучший среди моделей с открытыми весами в сравнении MarkTechPost, опережая GLM 5.2 (71.3%), Kimi K2.6 (65.6%) и значительно опережая DeepSeek V4 Pro (36.0%). Thinking Machines также подчеркивает калиброванную неопределенность в выводах модели.

Репортаж VentureBeat отметил связанное свойство: устойчивость к цензуре. В сочетании с разрешительной лицензией Apache 2.0 это позиционирует Inkling как открытую модель, которую команды могут адаптировать под свои собственные политики, а не наследовать непрозрачный режим контента, навязанный поставщиком — важное соображение для регулируемых или региональных развертываний. Как и в случае с любой моделью в день запуска, на момент написания статьи независимый red-team или сторонний аудит безопасности не были опубликованы, поэтому относитесь к результату FORTRESS как к полученному от поставщика/третьей стороны, а не внешне сертифицированному.

Стоит ли настраивать Inkling?

Тонкая настройка — это, пожалуй, причина существования Inkling. Быстрая структура принятия решений:

Тонкая настройка (через Tinker или свой собственный пайплайн), если: у вас есть проприетарные данные, узкая предметная область или задача, где меньшая специализированная модель превосходит универсальную; вам нужно владеть весами; или вы хотите внедрить определенный тон, формат или политику. Опции контекста 64K/256K в Tinker и скидка при запуске снижают барьер.

Просто используйте базовую модель (самостоятельный хостинг или API), если: ваша задача является универсальной, объем небольшой, или вы еще не проверили, что дообучение улучшает вашу метрику. Инженерная настройка промптов вместе с регулятором reasoning_effort часто обеспечивает достаточный результат.

Ищите в другом месте, если: вам нужно передовое агентное программирование сегодня (GLM 5.2 и Kimi K2.6 лидируют по этим тестам) или вам требуются независимо проверенные гарантии качества.

Плюсы и минусы

Плюсы

Полностью открытые веса под Apache 2.0, безвозмездное размещение на собственном хостинге и бесплатное коммерческое использование.

Эффективный разреженный MoE (всего 41B активных) плюс высокая эффективность токенов сохраняет стоимость и скорость вывода конкурентоспособными.

Огромный 1M-токенный контекст в весах (256K через API).

Истинная мультимодальность (текстовый, графический, аудио ввод).

Регулируемый регулятор усилия рассуждений (нет → макс) для оперативного компромисса между стоимостью и качеством.

Лучший в своем классе безопасность с открытыми весами против состязательных атак (FORTRESS 78,0%, по данным MarkTechPost) и «сопротивление цензуре».

Сильная независимая позиция — топ-10 из 97 в индексе Artificial Analysis, опережая Nemotron 3 Ultra, Gemma 4 31B и gpt-oss-120b.

Минусы

Явно не передовая модель, по собственному признанию производителя.

Trails опережает открытых конкурентов (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) на агентских и программных бенчмарках (Terminal Bench 2.1, SWE-bench Verified, HLE).

Большинство бенчмарков сообщаются производителями самостоятельно и не проверяются независимыми аудиторами.

Только текстовый вывод; без генерации изображений/аудио; без видеовхода при запуске; Inkling-Small всё ещё в предварительной версии.

Для настоящего «локального» использования требуется узел с несколькими GPU (~600 ГБ видеопамяти даже в квантизированном виде).

На момент запуска не появилось никаких существенных независимых критических обзоров или обзоров безопасности/красной команды.

Кому стоит использовать Inkling?

Inkling — отличный выбор, если вы практик или команда, которая хочет владеть и настраивать свою модель, а не арендовать закрытый API. Идеальные варианты использования включают:

Команды тонкой настройки строящие доменно-специфичные модели через Tinker или собственный пайплайн.

Чувствительные к стоимости, высокообъемные развертывания, где безвозмездный самостоятельный хостинг превосходит передовое ценообразование за токен.

Долгоконтекстные нагрузки такие как помощь в работе с кодом в масштабах репозитория, анализ документов и длительные сессии агентов.

Мультимодальные приложения нуждающиеся в комбинированном понимании текста, изображений и аудио.

Чувствительные к политике развертывания желающие открытую базу с сильной безопасностью и устойчивостью к цензуре для самоориентации.

Это плохой выбор, если вам нужны абсолютно сильнейшие рассуждения или агентная производительность кодирования, нужен видеовход или генеративный вывод, или требуются независимо проверенные бенчмарки перед развертыванием.

Вердикт и итоговая оценка

Давайте прямо признаем: Inkling не является самой сильной моделью, доступной сегодня, и Thinking Machines говорит именно об этом. Читайте цинично: это низкая планка. Читайте справедливо: в этом и заключается суть — Inkling оптимизирован для другой цели, а не для того, чтобы возглавлять таблицу лидеров. Он эффективен (41B активных параметров, бюджет задач ~25K токенов), имеет открытую лицензию (Apache 2.0), безопасен по стандартам открытых весов (FORTRESS 78%) и создан для тонкой настройки и самостоятельного хостинга. Такое сочетание делает его одним из самых продуманных запусков открытых моделей 2026 года, даже несмотря на то, что он уступает GLM 5.2 и Kimi K2.6 в самых сложных агентских и кодовых бенчмарках.

Оставшиеся звёздочки — это в значительной степени самостоятельные бенчмарки и отсутствие какой-либо независимой критической оценки на столь раннем этапе. Но для своей целевой аудитории — разработчиков, которые ценят владение, настройку, контроль затрат и огромное контекстное окно выше передовых хвастовств — Inkling оправдывает ожидания.

Рейтинг: 4 из 5 для своей целевой аудитории строителей и тонких настройщиков; ниже, если вы ищете строго передовые возможности.

Часто задаваемые вопросы

Что такое Inkling и кто его создал? Inkling — это первая модель от Thinking Machines Lab, AI-стартапа под руководством Миры Мурати (бывшего технического директора OpenAI). Она была запущена 15 июля 2026 года как модель рассуждений с открытыми весами, мультимодальная на основе смеси экспертов (Mixture-of-Experts).

Является ли Inkling лучшей моделью ИИ?Нет, и компания не утверждает этого — она заявляет, что Inkling «не является самой сильной моделью, доступной сегодня, закрытой или открытой». Независимые измерения (Artificial Analysis) ставят ее на #10 место из 97 в целом, хотя она опережает несколько открытых аналогов.

Сколько параметров у Inkling, и какое контекстное окно?Всего 975B с 41B активными (разреженный MoE), на 66 слоях. Контекстное окно — до 1,000,000 токенов в выпущенных весах и до 256K на хостинговых API.

Является ли Inkling открытым исходным кодом, и какова лицензия? Веса выпущены под Apache 2.0, что разрешает коммерческое использование и самостоятельное размещение. Это «открытые веса» — полные веса модели на Hugging Face.

Бесплатно ли использовать Inkling? Веса бесплатны и не требуют отчислений для самостоятельного размещения. Тонкая настройка на Tinker и размещенный вывод через таких провайдеров, как Together AI, Fireworks, Modal, Databricks или Baseten, являются платными услугами. Доступ к размещенным моделям начинается примерно с $1.87 за 1M входных токенов (скидка на запуск с ограниченным сроком действия).

Как запустить или скачать Inkling, и какое оборудование мне нужно?Загрузите веса с Hugging Face и обслуживайте их с помощью vLLM, SGLang или transformers от Hugging Face через совместимый с OpenAI API. Ожидайте примерно ~2 ТБ агрегированной видеопамяти для BF16 (8× B300 / 16× H200) или ~600 ГБ для квантированной контрольной точки NVFP4 (4× B300 / 8× H200). Сборки GGUF от сообщества Unsloth снижают порог для экспериментов.

Как мне дообучить Inkling? Используйте Thinking Machines’ Tinker платформа, которая предлагает варианты контекста 64K и 256K и ограниченную по времени скидку 50% на запуск, или дообучите открытые веса в своем собственном пайплайне.

Что такое контролируемое мыслительное усилие? Параметр reasoning_effort (none / minimal / low / medium / high / xhigh / max), который балансирует между задержкой и затратами токенов, с одной стороны, и глубиной рассуждений — с другой. Низкое усилие подходит для классификации и извлечения; максимальное усилие подходит для сложных математических задач и соответствует конфигурации бенчмарка (Effort=0.99).

Как Inkling соотносится с Kimi, GLM, DeepSeek и Nemotron? Согласно сравнению MarkTechPost, Inkling лидирует по FORTRESS (безопасность) и в целом превосходит Nemotron 3 Ultra, но уступает GLM 5.2, Kimi K2.6 и DeepSeek V4 Pro по Terminal Bench 2.1, SWE-bench Verified и HLE. Она конкурентоспособна, но не является самой сильной открытой моделью для агентного кодирования.

Может ли Inkling обрабатывать изображения, аудио и видео?Он принимает текст, изображения (40px–4096px) и аудио (16kHz WAV, до ~20 минут) в качестве ввода. Результат — только текст, без генерации изображений или аудио. Видео использовалось при предварительном обучении, но не поддерживается как входные данные на момент запуска.

Надежны ли бенчмарк-показатели Inkling? Относитесь к ним с осторожностью. Помимо независимого Artificial Analysis Intelligence Index, основные показатели сообщаются самим вендором при запуске и не проходят независимую проверку. Данные конкурентов поступают от третьих сторон (MarkTechPost) или были пересчитаны Thinking Machines и могут не совпадать с собственными отчетами конкурентов.

Что такое Inkling-Small и что в планах?Inkling-Small — это уменьшенный вариант (276B всего / 12B активных). На момент запуска он все еще находился в предварительном доступе, веса еще не были выпущены. Основная модель уже поставляется со слоями MTP для спекулятивного декодирования.



Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube