Intern-S2-Mobius-1
Engineering & Research

Intern-S2-Mobius: 35B-модель, которая отделяет знания от рассуждений

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Команда InternLM из Шанхайской лаборатории искусственного интеллекта без лишнего шума опубликовала Intern-S2-Mobius — фундаментальную модель с открытыми весами на 35B параметров, которая делает то, чего не делает почти ни одна другая опубликованная модель: она перестаёт хранить знания внутри своих слоёв. Вместо стандартной архитектуры Transformer — где каждый слой несёт собственный feed-forward блок, наполненный заученными фактами, — Mobius выносит все эти знания в единую глобально разделяемую память (Memory) и позволяет небольшому числу модулей Reasoners многократно обращаться к ней. Заявленное преимущество — не более высокий балл в бенчмарках. Это скорость: те же ответы примерно от одной трети до одной пятой токенов рассуждения и до 4.6x пропускной способности запросов. Это руководство объясняет, чем на самом деле является Mobius, что его конфигурационный файл раскрывает такого, чего нет в карточке модели, что показывают опубликованные бенчмарки построчно — включая две строки, где он проигрывает, — где утверждение «в 4 раза быстрее» работает, а где оно исчезает, и кому на самом деле стоит обратить на это внимание.

Примечание о точности: все цифры ниже взяты из собственной карточки модели InternLM, её опубликованных показателей производительности и эффективности, руководства по развёртыванию и файлов конфигурации модели на Hugging Face. На момент написания не существует независимой сторонней оценки Intern-S2-Mobius — она не указана ни в одном независимом лидерборде, не развёрнута ни одним инференс-провайдером, а счётчик её загрузок всё ещё на нуле. Относитесь ко всем сравнительным показателям как к заявленным поставщиком, пока кто-нибудь не воспроизведёт их. Характеристики и код такой новой модели быстро меняются; проверяйте, прежде чем строить.

TL;DR. Intern-S2-Mobius — это мультимодальная фундаментальная модель с 35B параметров и лицензией Apache 2.0, непрерывно предобученная на основе Qwen3.5-35B, а затем дообученная с помощью SFT и обучения с подкреплением. Её новизна — архитектурная: дизайн Mobius-v0 заменяет привязанное к слоям feed-forward хранение знаний единой глобально общей Memory из 2 560 экспертов, к которой обращаются четыре сложенных блока Reasoner, способные доставать знания за пределами собственной глубины (обратная остаточная связь) и уточнять скрытые состояния через рекуррентную латентную итерацию перед декодированием (динамические латентные рассуждения). По собственной оценке InternLM, она превосходит базовую модель Qwen3.5-35B, на основе которой построена, на семи из девяти общих бенчмарков (в среднем 67,88 против 65,05) и разносит её на научных задачах (52,14 против 18,20), при этом генерируя цепочки рассуждений примерно в 1,5 раза короче в среднем — в 4,6 раза короче на MMLU Pro и в 5,0 раза короче на GPQA Diamond. Именно в этом сжатии цепочек и кроется выигрыш в пропускной способности: 2,9 раза при batch 16, растущий до 4,6 раза при batch 256. Подводные камни реальны: модель проигрывает на двух самых сложных бенчмарках рассуждений (HLE и UGD hard), выигрыш в пропускной способности в значительной степени исчезает на олимпиадной математике, и никто за пределами лаборатории ничего из этого не проверял.

Основные выводы

• Архитектурно-ориентированный выпуск: Mobius-v0 разделяет векторы знаний и операторы рассуждения — одна общая память из 2 560 экспертов обслуживает четыре блока Reasoner вместо 40 слоёв, каждый из которых хранит собственные знания FFN.

• Акцент на эффективности, а не на интеллекте: средняя длина выходного текста снижается примерно в 1,5 раза, а пропускная способность запросов возрастает с 2,9 раза при размере пакета 16 до 4,6 раза при размере пакета 256 по сравнению с базовой моделью Transformer.

• Она действительно превосходит свою базовую модель: 67.88 против 65.05 в среднем по общим задачам, побеждая MMLU Pro (89.05 против 85.31), AIME 2026 (95.31 против 92.08) и HMMT 2026 (85.51 против 78.50).

Но она проигрывает там, где обдумывание важнее всего: HLE 19.11 против 22.40 и UGD hard 73.02 против 78.02 — две самые сложные оценки в наборе, обе выиграны обычным трансформером.

• Научный скачок — это наибольший единичный результат: Biology-Instructions 51.40 против 3.77, Mol-Instructions 45.73 против 21.70, MolecularIQ 59.29 против 29.13.

• Открыт, но недоступен: веса Apache 2.0 на Hugging Face, ни один инференс-провайдер его не размещает, ~73 ГБ весов в bfloat16 — самостоятельный хостинг сейчас единственный способ запустить его.

Что такое Intern-S2-Mobius на самом деле

Intern-S2-Mobius — это фундаментальная модель на 35B параметров, опубликованная организацией internlm — командой Hugging Face, стоящей за серией Intern Шанхайской лаборатории искусственного интеллекта. Веса появились на Hugging Face 29 июля 2026 года, а сопутствующий репозиторий GitHub — README, руководство по развёртыванию и полный технический отчёт в формате PDF — стал общедоступным 5 августа 2026 года. Модель выпущена под лицензией Apache 2.0, которая является, пожалуй, максимально разрешительной для открытых весов: коммерческое использование, модификация и распространение разрешены.

Это не тонкая настройка. Это непрерывное предобучение с хирургическим вмешательством в архитектуру. InternLM взяла Qwen3.5-35B — модель с открытыми весами на основе смеси экспертов объёмом 35B от Alibaba, выпущенную 4 марта 2026 года, — перестроила то, как модель хранит и получает доступ к знаниям, и продолжила предобучение полученной модели, а затем поверх применила контролируемую тонкую настройку и обучение с подкреплением. Эта родословная важна для интерпретации бенчмарков: каждое сравнение, которое публикует InternLM, — это Mobius против той самой модели, из которой она выросла, что является максимально чистым абляционным тестом изменения архитектуры и к тому же, что удобно, сравнением, которое, скорее всего, окажется для неё наиболее лестным.

Модель является мультимодальной. Hugging Face классифицирует её как image-text-to-text, а конфигурация подтверждает наличие полноценного визуального энкодера и обработки видеотокенов. Судя по тому, что поставляется вместе с весами, она также нацелена непосредственно на науку — подробнее об этом ниже.

Архитектура Мёбиуса простым языком

Обычный трансформер чередует две задачи в каждом слое. Внимание перемещает информацию между токенами; сеть прямого распространения (или в модели со смесью экспертов — банк экспертных FFN) хранит знания. Поскольку FFN находится внутри слоя, доступ к хранящимся в ней знаниям возможен только на этой глубине. Факт, усвоенный на 30-м слое, не может быть использован рассуждениями, происходящими на 5-м слое. Информация движется вперёд, слой за слоем, и это единственный путь.

Мёбиус разрывает эту связь. InternLM описывает три последствия.

Разделение знания и рассуждения.Хранилище FFN, привязанное к слоям, заменяется глобально общей памятью. Вместо 40 слоёв, каждый из которых владеет своим фрагментом знаний модели, существует один пул, к которому может обращаться каждый этап рассуждения. Аргумент InternLM состоит в том, что это улучшает сжатие знаний — одни и те же факты не нужно избыточно переучивать на нескольких глубинах — и даёт каждому модулю рассуждений гораздо более широкое пространство знаний, чем могло бы предложить FFN одного слоя.

Обратное остаточное соединение. Поскольку память является общей, и мелкие, и глубокие этапы рассуждения обращаются к одному и тому же хранилищу. Доступ к знаниям больше не является строго направленным вперёд. Мелкий этап может извлечь то, что в стандартном стеке было бы доступно только на тридцать слоёв позже. Утверждение InternLM состоит в том, что это позволяет модели более гибко объединять знания на разных глубинах и, что важно, синтезировать полезную информацию за меньшее количество шагов рассуждения. Именно эта последняя фраза является всей сутью релиза.

Динамическое латентное рассуждение. Вместо того чтобы выносить каждый шаг обдумывания наружу в виде видимых токенов цепочки мыслей, Mobius уточняет свои непрерывные скрытые состояния посредством рекуррентной латентной итерации, прежде чем декодировать что-либо. Часть «мышления» происходит во внутреннем пространстве представлений модели, а не в генерируемом тексте, и объём этих внутренних вычислений распределяется динамически для каждого токена. Практический эффект в том, что модели нужно написать меньше слов, чтобы прийти к тому же выводу, — а поскольку генерация авторегрессивна и сериализована, написание меньшего количества слов — это самый прямой путь к ускорению модели рассуждений.

В целом, это модель рассуждений, которая больше думает и меньше печатает.

Intern-S2-Mobius-2

Что показывает конфигурационный файл

Карточка модели описывает архитектуру в прозе. code>config.json/code> конкретизирует её, и в нём содержится несколько чисел, которые стоит знать.

Четыре Reasoner'а поверх 40 слоёв.Текстовая конфигурация объявляет 40 скрытых слоёв, но только четыре блока. 40 слоёв организованы в четыре стадии Reasoner, которые итеративно работают с общей Memory, а не в сорок независимых блоков «знание плюс внимание».

2 560 экспертов. Это общая память, воплощённая в буквальном виде. Mobius включает 2 560 экспертов, из которых 8 активируются на каждый токен, и крошечный промежуточный размер на эксперта — 512, плюс один общий эксперт. Для понимания масштаба: его родственная модель Intern-S2-Preview использует 256 экспертов. Пул в десять раз больше, состоящий из гораздо меньших экспертов, — это именно то, как выглядит «единое глобальное хранилище знаний вместо послойных FFN», когда вы записываете это в виде конфигурации.

35B на коробке, ~36B на диске, ~3B активных. В карточке модели указано 35B; считыватель safetensors от Hugging Face сообщает о 36B параметрах; индекс весов в bfloat16 составляет 72.96 ГБ, что соответствует примерно 36.5B. Наиболее точен гайд по развёртыванию: он называет релиз 30B-A3B моделью с примерно 3B активными параметрами на токен. Как и в случае с любой разреженной MoE, вы платите за полный набор весов в памяти и получаете вычисления на уровне небольшой модели на токен.

Гибридное внимание, 3:1. Список слоёв чередует три слоя линейного внимания с одним слоем полного внимания по всей глубине — десять слоёв полного внимания из 40. Линейное внимание предотвращает взрывной рост памяти и вычислений при длинном контексте; периодические слои полного внимания сохраняют точное воспроизведение, которым чисто линейное внимание жертвует. Линейные слои используют свёрточное ядро ширины 4 и состояние SSM в float32 — теперь уже стандартный рецепт в стиле gated-delta.

Контекст 256K. Максимальные позиционные эмбеддинги — 262 144. Обратите внимание на разрыв между тем, что поддерживает архитектура, и тем, как она оценивалась: InternLM прогонял свои текстовые бенчмарки на 128K, а на MMLU Pro, SimpleQA и HLE — на 64K. Потолок в 256K — это не то же самое, что 256K подтверждённого качества.

Встроенная голова для предсказания нескольких токенов. Существует однослойный модуль MTP со своими 256 экспертами. Это не украшение — руководство по развертыванию рекомендует запускать с MTP-спекулятивным декодированием и четырьмя черновыми токенами, так что часть реальной истории о скорости — это спекулятивное декодирование, а не только архитектура.

Настоящая визуальная башня. 27-слойный визуальный энкодер со скрытой размерностью 1152, размером патча 16, пространственным объединением 2x2 и временным патчингом для видео, проецирующий в 2048-мерный текстовый поток с чередующимся мультимодальным RoPE. Изображения и видео на входе, текст на выходе.

• Другие подробности для любопытных: 16 голов внимания с размерностью головы 256, 2 головы ключ-значение (агрессивное групповое внимание запросов), стробированные выходы внимания, частичный коэффициент вращения 0,25, RoPE theta 10 миллионов и словарь из 251 392 токенов.

Бенчмарки, строка за строкой

InternLM был оценён с помощью OpenCompass, и было опубликовано единственное сравнение: Intern-S2-Mobius-35B против Qwen3.5-35B — модели, на основе которой выполнялось его продолженное предобучение. Девять общих бенчмарков, три научных.

В общих задачах Mobius выигрывает семь из девяти. MMLU Pro — широкие междисциплинарные знания с более сложными дистракторами, чем в оригинальном MMLU, — показывает 89.05 против 85.31, прирост на 3.7 пункта и самый показательный результат по знаниям в этом наборе. GPQA Diamond, вопросы по естественным наукам уровня аспирантуры, составленные так, чтобы их нельзя было загуглить, — практически ничья: 80.81 против 80.24. IMO Bench, математика олимпиадного уровня, — 81.25 против 77.50. AIME 2026, Американский пригласительный математический экзамен, — 95.31 против 92.08. HMMT 2026, математический турнир Гарварда и МТИ, — самый большой разрыв в математике: 85.51 против 78.50. AMO показывает 58.00 против 50.00. А SimpleQA — короткие фактические ответы, бенчмарк, который наиболее прямо показывает, действительно ли модель знает факты, — подскакивает с 21.39 до 28.90, что является относительным улучшением на 35% и самым веским доказательством аргумента InternLM о том, что «общая память сжимает знания лучше».

Затем два проигрыша, и именно они — самые интересные строки. UGD hard ведёт себя противоположным образом: 73,02 у Mobius против 78,02 у базовой модели — отставание в пять пунктов. И HLE — Humanity's Last Exam, самый сложный из широко используемых универсальных бенчмарков, где передовые модели всё ещё набирают 10–29 баллов, — показывает 19,11 против 22,40. Обычный Transformer выигрывает 3,3 пункта на бенчмарке, специально разработанном так, чтобы требовать максимально глубоких рассуждений.

Эта закономерность — не шум, и она не скрыта: InternLM опубликовал её. Наиболее правдоподобное прочтение состоит в том, что латентное рассуждение — это сжатие, а сжатие теряет информацию на хвосте. Интернализация обдумывания в непрерывные скрытые состояния отлично работает, когда обдумывание опирается на поиск информации или следует знакомой форме — что описывает MMLU Pro, SimpleQA и большинство олимпиадных задач по математике. На задачах, которые действительно требуют длинных, исследовательских, исправляющих ошибки цепочек рассуждений, явный след, порождаемый токен за токеном, по-прежнему, похоже, оправдывает свою цену. Общий средний показатель — 67.88 против 65.05 — это реальный выигрыш, но это среднее, за которым скрывается компромисс, а не равномерное улучшение.

Научные результаты — это различия совсем другого масштаба. Biology-Instructions вырастает с 3.77 до 51.40. Mol-Instructions, охватывающий понимание и генерацию молекул, вырастает с 21.70 до 45.73. MolecularIQ вырастает с 29.13 до 59.29. Средний показатель составляет 52.14 против 18.20. Такие цифры, как рост с 3.77 до 51.40, — это не заслуга архитектуры; это признак целенаправленного доменного обучения на задачах, выполнять которые базовую модель просто никогда не обучали. То, что Qwen3.5-35B набирает меньше 4% на Biology-Instructions, означает, что модель не понимает формат задачи, а не то, что она плоха в биологии. Воспринимайте эти три строки как «InternLM добавил научную специализацию» — это действительно ценно, и в этом весь смысл линейки Intern-S; просто не приписывайте это архитектуре Mobius.

Где «4x faster» — реальность, а где — нет.

Утверждение об эффективности — причина, по которой эта модель существует, так что оно заслуживает внимательного прочтения. Главный тезис InternLM — «почти 4-кратное сквозное ускорение инференса». Опубликованный показатель пропускной способности информативнее, чем этот заголовок, и честнее.

При измерении пропускной способности запросов в зависимости от размера батча, усреднённой по бенчмаркам, Mobius превосходит базовую модель Transformer на 2.9x при размере батча 16 и 4.6x при размере батча 256. Разрыв увеличивается с размером батча, чего и следует ожидать, когда выигрыш достигается за счёт генерации меньшего количества токенов на запрос: чем больше запросов вы упаковываете вместе, тем сильнее накапливается экономия на этапах декодирования. Заголовок «почти 4x» — это средняя точка диапазона, а не константа.

Разберём по бенчмаркам — и картина станет чётче. На MMLU Pro и GPQA Diamond, Mobius значительно быстрее при любом размере батча: кривые пропускной способности расходятся сразу и продолжают расходиться. На IMO Bench, он стабильно лидирует, но с небольшим отрывом. На AIME 2026 и HMMT 2026, базовый Transformer на самом деле быстрее при промежуточных размерах батча, и Mobius вырывается вперёд только на батче 256. На самых сложных олимпиадных задачах по математике преимущество в пропускной способности отсутствует или даже оборачивается минусом на большей части рабочего диапазона.

Почему? Потому что производительность почти идеально коррелирует со сжатием трейса. Средняя длина вывода по бенчмаркам падает примерно в 1,5 раза: с примерно 20 400 токенов до примерно 13 200. Но это среднее охватывает огромный диапазон: в 4,6 раза короче на MMLU Pro (примерно 1 100 токенов против 5 150) и в 5 раз короче на GPQA Diamond (примерно 2 600 против 12 900), тогда как лишь в 1,4 раза на IMO Bench, в 1,5 раза на AIME 2026 и в 1,2 раза на HMMT 2026. Там, где модель может сжать свои рассуждения, она летит. А там, где задача в любом случае требует 24 000 токенов выкладок, она не может, и вместо этого проявляются накладные расходы архитектуры.

Практический вывод: если ваша рабочая нагрузка похожа на поиск знаний, множественный выбор, технические вопросы и ответы или классификацию, прирост скорости будет большим и немедленным. Если ваша рабочая нагрузка — сложные математические или научные выкладки, рассчитывайте примерно на паритет и будете приятно удивлены. Любой, кто цитирует «4x faster» как универсальное свойство модели, цитирует среднее значение двух совершенно разных поведений.

Intern-S2-Mobius-3

Научный стек, скрывающийся в списке файлов

Одна из самых показательных особенностей этого релиза вообще не в карточке модели — она в списке файлов репозитория. Наряду с обычными файлами токенизаторов Intern-S2-Mobius поставляется с тремя дополнительными доменными токенизаторами: code>tokenizer_PROT.model/code> для белковых последовательностей, code>tokenizer_SMILES.model/code> для молекулярных структур в SMILES-нотации и code>tokenizer_XNA.model/code> для последовательностей нуклеиновых кислот. В репозитории также есть бесхозный NumPy-массив с сейсмическими данными.

{{1}}Выделенные токенизаторы для белков, молекул и ДНК/РНК{{/1}} — это не то, что добавляют между делом. {{2}}Они означают, что модель обучали читать эти типы последовательностей как полноценные входные данные, а не как обычный текст, в котором случайно встречаются буквы{{/2}}. {{3}}Именно это превращает 3.77 в 51.40 на Biology-Instructions{{/3}}, и это ставит {{4}}Mobius в один ряд с его собратом Intern-S2-Preview{{/4}}, который {{5}}добавил модальности временных рядов и зрения{{/5}} и, {{6}}по словам InternLM, стал первой открытой моделью с возможностью генерации кристаллических структур материалов{{/6}}.

Если вы разработчик общего профиля, это мелочь. Если вы работаете в вычислительной биологии, хемоинформатике или материаловедении, это может быть самая важная строка в этой статье: это небольшая модель с лицензией Apache-2.0, которую можно развернуть на собственном сервере и которая нативно понимает SMILES и последовательности белков.

Где его место в семействе Intern

Линейка Intern-S — это научная мультимодальная серия лаборатории Shanghai AI Laboratory. Intern-S1 задал формат. Intern-S1-Pro масштабировал его до класса триллиона параметров. Intern-S2-Preview, выпущенный незадолго до Mobius, — это ставка на эффективность: модель с общим объёмом 36B и 3B активных параметров, 256 экспертами и контекстом 262K, которая, по заявлению InternLM, соответствует модели S1-Pro триллионного класса по основным профессиональным научным задачам — примерно 30-кратное сокращение параметров при сопоставимых научных возможностях.

Intern-S2-Mobius — это третья вещь: архитектурный релиз, носящий имя Intern-S2. «v0» в Mobius-v0 играет реальную роль в этом названии — это первая публичная итерация замысла, а не зрелая линейка продуктов. Он связан с ArchSpace, открытой платформой InternLM для проверки инноваций в архитектуре LLM, чья заявленная цель — «превращать исследование архитектуры LLM в переиспользуемое знание для сообщества», с рецензированием и опубликованными результатами, включая отрицательные. Mobius — это то, как выглядит эта программа, когда предложение переходит от зонда масштаба 1B к модели на 35B, которую можно реально скачать. Полный технический отчёт поставляется с репозиторием GitHub для всех, кто хочет ознакомиться с выкладками.

Если смотреть в этом свете, два проигрыша на бенчмарках — это особенность релиза, а не повод для смущения. Это лаборатория, которая честно публикует архитектурный эксперимент, включая те места, где он показал регресс.

Как это запустить

Intern-S2-Mobius поддерживается тремя стеками инференса, и в руководстве по развертыванию приведены рабочие команды для каждого из них.

LMDeploy — рекомендуемый путь и единственный, который руководство показывает на одной GPU: обслуживание через бэкенд PyTorch, code>--trust-remote-code/code>, тензорный параллелизм 1 и спекулятивное декодирование MTP, включённое с помощью спекулятивного алгоритма qwen3_5_mtp с четырьмя черновыми токенами. vLLM показан с тензорным параллелизмом 2, парсером рассуждений qwen3, парсером вызовов инструментов qwen3_coder, автоматическим выбором инструмента и спекулятивным декодированием MTP с четырьмя спекулятивными токенами. Transformers работает для базового вывода через code>AutoModelForImageTextToText/code> с code>trust_remote_code=True/code> и bfloat16 — обратите внимание, что модель поставляется с пользовательским кодом моделирования, поэтому выполнение удалённого кода обязательно, а конфигурация рассчитана на Transformers 5.2.

Рекомендуемые параметры сэмплирования InternLM — температура 0.8, top-p 0.95, top-k 50 и min-p 0.0 — теплее, чем почти жадные настройки, которые требуются большинству моделей рассуждений, и это стоит уважать, а не переопределять по привычке.

По оборудованию: примерно 73 ГБ весов в bfloat16 плюс кэш KV и активации означают, что одного ускорителя на 80 ГБ будет впритык, а одной карты на 141 ГБ — достаточно; вероятно, именно поэтому в примере с vLLM используются два GPU, а пример LMDeploy предполагает одну большую карту. Работа с длинным контекстом поднимет требования ещё выше. Включите MTP — руководство прямо это рекомендует, и значительная часть заявленного ускорения находится именно там, а не в базовой архитектуре.

Самое важное практическое предостережение: ни один провайдер инференса в настоящее время не размещает эту модель. Панель провайдеров Hugging Face прямо говорит об этом, и счётчик загрузок всё ещё был на нуле, когда это писалось. Нет ни API-эндпоинта, ни цены за миллион токенов, ни управляемого способа попробовать модель. Самостоятельный хостинг — единственный вариант на сегодня.

Intern-S2-Mobius-4

Кому на самом деле это должно быть важно?

1. Команды, выполняющие высоконагруженные рабочие нагрузки рассуждений на основе поиска

Это тот профиль, под который создавалась архитектура. Если вы обрабатываете большие пакеты технических вопросов и ответов, анализ документов, структурированное извлечение или классификацию в формате множественного выбора через модель рассуждений, и ваш счёт в основном состоит из токенов рассуждения, которые пользователь так и не видит, то модель, которая приходит к тому же ответу за пятую часть токенов, — это прямое снижение затрат. Показатели MMLU Pro и GPQA — цепочки рассуждений в 4,6 и 5,0 раза короче при равной или лучшей точности — имеют ровно такую форму. Прежде чем верить этому, протестируйте на своём трафике, но механизм надёжен, а выгода велика.

2. Группы вычислительной науки

Нативные токенизаторы для белков, SMILES и нуклеиновых кислот, а также значительные измеренные улучшения на биологических и молекулярных бенчмарках — всё это в модели Apache 2.0, которая помещается на одном или двух GPU. Для лаборатории, которой нужно, чтобы данные оставались локально (on-premises), и которая не может отправлять молекулярные структуры в коммерческий API, такая комбинация — редкость. Линейка Intern-S постепенно шла к этому, и Mobius — самый дешёвый вход в неё на данный момент.

3. Исследователи и архитектурные обозреватели

Разделение знания и рассуждения, а также латентное рассуждение уже некоторое время являются активными направлениями исследований; лишь немногие были проверены на 35B и открыто опубликованы с сохранением случаев неудач. Если вам небезразлично, куда двинутся пост-трансформерные архитектуры дальше, технический отчёт и две проигравшие строки интереснее, чем средний балл. ArchSpace был специально создан, чтобы делать такие результаты переиспользуемыми.

Кому, по крайней мере пока, не стоит обращать внимание: тем, кто ищет продакшн-ассистента общего назначения. Нет размещённого эндпоинта, независимой оценки, инструментов экосистемы и послужного списка. Это не критика модели — это описание исследовательского релиза недельной давности.

Как это вписывается в продакшн-стек

Честно говоря, Intern-S2-Mobius сегодня — кандидат для оценки, а не модель по умолчанию. Это неразмещённый, непроверенный, созданный неделю назад исследовательский артефакт с по-настоящему интересной архитектурой и одной очень конкретной сильной стороной — токен-эффективными рассуждениями на задачах информационного поиска — а также реальной специализацией на научных данных о последовательностях.

Разумный подход — держать ваш производственный трафик на нейтральном к вендору эндпоинте вроде OrcaRouter, который даёт один OpenAI-совместимый API для множества моделей, а Mobius разворачивать отдельно на ваших собственных GPU для того узкого сегмента, где он может выиграть. Измеряйте то, что действительно важно для этой модели: не одну лишь точность, а токены, потраченные на один правильный ответ. Именно по этой оси Mobius оптимизирован, и именно эту ось игнорируют большинство оценочных стендов. Если она оправдывает себя на вашей нагрузке, у вас есть self-hosted канал, который дёшев в эксплуатации и юридически ничем не обременён. Если нет — вы потеряли день GPU-времени, а ваш производственный путь так и не сдвинулся с места.

Та же логика работает и в обратную сторону: если провайдер в конечном итоге разместит её у себя, роутер позволит A/B-тестировать новую модель против действующей, ничего не переписывая, что как раз и является правильным способом внедрения архитектуры, которую никто не тестировал независимо.

Ограничения и оговорки

Начнём с самого главного: ни одно из чисел в этой статье не имеет независимого подтверждения. Каждый бенчмарк, каждая кривая пропускной способности и каждое сравнение длины токенов получены от InternLM. Сравнение к тому же структурно благоприятно для Mobius: он оценивается только относительно той конкретной базовой модели, от которой продолжал предобучение, а не относительно актуальных передовых моделей, а дополнительный пост-тренинг SFT и RL означает, что это сравнение — не чистая абляция архитектуры, хотя его и подают как таковую. Часть прироста — заслуга Mobius; часть — просто более длительное обучение.

Регрессии реальны, и они проявляются на самых сложных задачах. Потеря 3,3 пункта на HLE и 5 пунктов на UGD hard, при этом выигрывая почти всё более лёгкое, — это целостный и слегка тревожный сигнал для модели, чья сильная сторона — эффективность рассуждений.

На практике сложности значительны. Кастомный код моделирования означает code>trust_remote_code/code> и новейшую версию Transformers. Поддерживающие его фреймворки должны быть достаточно свежими, чтобы знать, что такое code>interns2_mobius/code>, а собственное руководство InternLM предупреждает, что это эталонные конфигурации, находящиеся в активной разработке. Примерно 73 ГБ весов — это не модель для ноутбука. Нет размещённого API, нет цен, нет лимитов запросов и нет SLA — потому что нет сервиса.

Наконец, отметим, что не было опубликовано: ни результатов мультимодальных тестов, несмотря на полноценный визуальный энкодер, ни оценки длинного контекста, несмотря на потолок в 256K, ни бенчмарков по коду, ни оценки безопасности или выравнивания, ни сравнения с какой-либо моделью, кроме Qwen3.5-35B. Для универсального развертывания это большие белые пятна. Для статьи об архитектуре с приложенными весами они просто выходят за рамки — именно так и следует читать этот релиз.

Часто задаваемые вопросы

Что такое Intern-S2-Mobius?

Мультимодальная базовая модель с 35 миллиардами параметров, распространяемая под лицензией Apache 2.0, созданная командой InternLM Шанхайской лаборатории искусственного интеллекта и построенная на архитектуре Mobius-v0, которая разделяет хранение знаний и вычислительные операции рассуждения. Модель была продолжена предобучением на основе Qwen3.5-35B и дообучена с помощью SFT и обучения с подкреплением; опубликована на Hugging Face 29 июля 2026 года.

Чем отличается архитектура Mobius?

Обычные трансформеры хранят знания в блоке прямого распространения внутри каждого слоя, поэтому знания доступны только на той глубине, где они расположены. Mobius заменяет это одной глобально разделяемой памятью — 2 560 экспертов в опубликованной конфигурации, — к которой четыре блока Reasoner обращаются многократно, что обеспечивает доступ к знаниям на разных уровнях глубины и позволяет части рассуждений происходить в непрерывных скрытых состояниях, а не в виде генерируемых токенов цепочки рассуждений.

Действительно ли Intern-S2-Mobius в 4 раза быстрее?

В среднем и при больших размерах батча — в целом да: InternLM показывает в 2,9 раза более высокую пропускную способность запросов при батче 16, возрастающую до 4,6 раза при батче 256. Но результаты сильно различаются в зависимости от задачи. На MMLU Pro и GPQA Diamond выигрыш велик при любом размере батча; на олимпиадной математике AIME и HMMT базовая модель Transformer на самом деле быстрее при промежуточных размерах батча. Ускорение коррелирует с тем, насколько модель может сократить свою цепочку рассуждений.

Как это соотносится с Qwen3.5-35B?

Он выигрывает семь из девяти общих бенчмарков со средним результатом 67,88 против 65,05, включая MMLU Pro (89,05 против 85,31), AIME 2026 (95,31 против 92,08), HMMT 2026 (85,51 против 78,50) и SimpleQA (28,90 против 21,39). Он проигрывает UGD hard (73,02 против 78,02) и HLE (19,11 против 22,40). В научных задачах он далеко впереди — 52,14 в среднем против 18,20.

Можно ли использовать Intern-S2-Mobius через API?

Пока нет. Ни один провайдер инференса не предоставляет её, нет опубликованных цен, и Hugging Face не указывает варианты развёртывания. Самостоятельный хостинг с использованием LMDeploy, vLLM или Transformers — единственный способ запустить её на сегодняшний день.

Какое оборудование мне нужно для его запуска?

Веса занимают около 73 ГБ в bfloat16, так что рассчитывайте на один ускоритель класса 141 ГБ или два GPU по 80 ГБ, плюс запас для KV-кэша. В примере InternLM для LMDeploy используется тензорный параллелизм 1; в примере для vLLM — 2. Рекомендуется включить спекулятивное декодирование MTP с четырьмя черновыми токенами.

Какова длина его контекста?

Конфигурация поддерживает 262 144 токена (256K). Обратите внимание, что InternLM оценивался на 128K в большинстве текстовых бенчмарков и на 64K в MMLU Pro, SimpleQA и HLE, поэтому подтверждённое качество на полных 256K не было продемонстрировано.

Оно мультимодальное?

Да. Hugging Face классифицирует её как image-text-to-text, и в конфигурации есть 27-слойный визуальный энкодер с обработкой видеотокенов. Однако InternLM не опубликовал результатов мультимодальных бенчмарков с этим релизом, так что возможности по обработке изображений фактически не задокументированы.

Почему он поставляется с токенизаторами для белков и SMILES?

Поскольку линейка Intern-S — это семейство научных моделей. Специализированные токенизаторы для белковых последовательностей, молекулярной нотации SMILES и нуклеиновых кислот означают, что модель считывает эти форматы как нативные типы входных данных, поэтому она набирает 51,40 по Biology-Instructions, тогда как базовая модель — 3,77.

Лицензия действительно Apache 2.0?

Да — Apache 2.0, с файлом лицензии в репозитории. Коммерческое использование, модификация и распространение разрешены, что заметно более либерально, чем многие релизы с открытыми весами от крупных лабораторий.

Стоит ли использовать это в продакшене?

Пока нет. Ему одна неделя, он не развёрнут, не проверен третьей стороной, и в нём отсутствуют оценки кодирования, мультимодальности, длинного контекста и безопасности. Рассматривайте его как кандидата на оценку для эффективных по токенам рассуждений или научной работы с последовательностями, держите производственный трафик на проверенных моделях через не зависящий от вендора эндпоинт и вернитесь, когда появятся независимые показатели.

Суть

Intern-S2-Mobius — один из по-настоящему интересных релизов моделей за этот год, и почти всё это не связано с его баллами. InternLM воплотил реальную архитектурную идею — перестать привязывать знания к слоям, поместить их в общую разделяемую память и позволить модели частично мыслить в латентном пространстве, а не в токенах, — масштабировал её до 35B, корректно обучил и выложил веса под лицензией Apache 2.0 вместе с техническим отчётом и результатами, которые сложились не в его пользу. Механизм эффективности читаем, а доказательства его внутренне согласованы: трассы в среднем становятся короче в 1,5 раза и до 5 раз короче на задачах, требующих больших знаний, а пропускная способность растёт ровно в той пропорции, которую можно предсказать из этого.

Оговорки столь же очевидны. Никто за пределами Шанхайской лаборатории искусственного интеллекта не проверил ни одной цифры. Сравнение проводится с собственной базовой моделью и включает дополнительный пост-тренинг, так что это не тот чистый абляционный эксперимент, которым кажется. Ускорение в значительной степени исчезает на сложной математике. Модель проигрывает на двух самых требовательных бенчмарках рассуждений в собственной таблице. И нет возможности попробовать её без аренды GPU.

Итак: это не модель для развертывания на этой неделе, но за ней определенно стоит наблюдать, и это по-настоящему привлекательный вариант для двух конкретных аудиторий — команд, чьи расходы на reasoning в основном приходятся на токены, которые никто не читает, и научных групп, которым нужна небольшая модель с пермиссивной лицензией, нативно говорящая на языке белков и молекул. Держите производственный стек на проверенных моделях через вендор-нейтральный endpoint вроде OrcaRouter, поднимите Mobius на собственном оборудовании для этого узкого случая и измеряйте количество токенов на правильный ответ, а не только точность. Если архитектура выдержит независимую проверку, Mobius-v0 запомнится не столько как модель с 35B параметрами, сколько как номер версии перед той, которая действительно имела значение.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube