
Ling-3.0-flash-VL vs InternLumina U2: обе выпущены, но на разном кремнии
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Обе эти модели теперь реальны, их можно запустить и скачать, чего еще две недели назад не было, — и разница между ними почти никак не связана с бенчмарками. Ling-3.0-flash-VL, от лаборатории inclusionAI компании Ant Group, выложила веса BF16 и FP8 на Hugging Face в период с 4 по 8 сентября 2026 года, опубликовала вместе с ними рецепты обслуживания для SGLang и vLLM и получила независимую оценку 25 в Artificial Analysis Intelligence Index v4.3. InternLumina U2, от команды InternLM из Shanghai AI Laboratory, сначала выпустила код для инференса, а затем выложила свои обученные на Ascend веса модели на Hugging Face 10 сентября — семь шардов safetensors в ascend/ подпапке, доведя репозиторий до шестнадцати файлов.
Вся загвоздка в том, для чего были созданы эти два релиза весов. Опубликованный путь Ling-3.0-flash-VL — это путь CUDA, который уже есть у всех: узел с восемью ускорителями запускает сборку FP8, а стеки для обслуживания — те, что вы уже используете. Опубликованный чекпойнт InternLumina U2 — это версия для Ascend, и в README прямо сказано, что нужно скачивать тот чекпойнт, который соответствует тому, как вы планируете запускать инференс, — при этом чекпойнт, обученный на NVIDIA, всё ещё указан как «скоро». Две модели, выпущенные на одной неделе, и только одна из них работает на оборудовании, перед которым стоит большинство команд.
Это полезно перестраивает сравнение. Это уже не материал в духе «выпущено против вейпорвера», и любой, кто до сих пор описывает InternLumina U2 как ожидающий весов, работает по README недельной давности. Это материал о двух очень разных унифицированных визуальных дизайнах, появившихся в двух разных кремниевых экосистемах, и о том, какие части каждого релиза действительно завершены.
Что теперь содержит каждый релиз
Ling-3.0-flash-VL — это разреженная смесь экспертов на 124 млрд параметров, активирующая примерно 5,5 млрд параметров на токен, с 42-слойным гибридным стволом, в котором Kimi Delta Attention чередуется с блоками gated MLA в соотношении 5:1. Визуальный энкодер произвольного разрешения и двухслойный MLP-проектор питают этот ствол, а VideoRoPE отвечает за пространственное и временное позиционирование. Модель принимает текст, изображения и видео, а возвращает текст. И BF16 (64 шарда), и FP8 (примерно 126 ГБ; визуальная башня намеренно оставлена в более высокой точности, чем веса экспертов) опубликованы под лицензией MIT, и релиз достаточно полон, чтобы независимое сообщество бенчмарков его оценило — 25 баллов в Intelligence Index v4.3, #2 из 64 в своём размерном классе при медиане класса 8. Чего он не публикует, так это цену за токен для визуальной модели, а его примеры API содержат -rc1идентификатор, оставляющий открытым вопрос, совпадает ли обслуживаемый чекпоинт с открытыми весами.
InternLumina U2 — это разреженная смесь экспертов на 16 млрд параметров с примерно 1 млрд активных параметров, построенная на базовой модели диффузионной языковой модели LLaDA-2.0 MoE и охватывающая шесть семейств задач в одной модели: текстовые вопросы и ответы, генерация изображений по тексту, понимание изображений, редактирование изображений, понимание видео и понимание 3D. Код инференса для всего этого опубликован в открытом доступе в ветке main. Обученный на Ascend чекпоинт теперь общедоступен на Hugging Face. Согласно собственному роадмапу репозитория, пока остаются невыполненными: чекпоинт, обученный на NVIDIA, код обучения (отдельный репозиторий) и технический отчёт. В роадмапе отмечены четыре пункта и два оставлены открытыми — код инференса, веса Ascend, а также стек обучения и инференса для Ascend готовы; код обучения и технический отчёт — нет.
Одна практическая деталь находится между этими двумя абзацами. Для запуска визуальных путей U2 требуются веса токенизатора AToken по пути atoken_inference/checkpoints/atoken-sod.pt, а выпущенный драйвер ожидает каталог с разделёнными контрольными точками, в котором ресурсы модели хранятся вместе. Код настоящий и устанавливается с Python 3.11, PyTorch 2.6.0 и, на пути CUDA, flash-attn 2.7.2. Поддержка Ascend находится в отдельной ascend-npu-support ветке и требует CANN плюс соответствующую torch_npu сборку вместо инструментальной цепочки CUDA. Ничего из этого не скрыто; всё это задокументировано. Это просто более длинный путь, чем pip install и строка модели.
Два ответа на вопрос «что такое визуальный токен»
Архитектуры расходятся в чём-то более глубоком, чем количество параметров, и это расхождение — самое интересное в том, чтобы поставить эти две рядом.
Ling-3.0-flash-VL соблюдает стандартный контракт. Изображение превращается в последовательность токенов с помощью визуального энкодера и проектора, эти токены попадают в ствол трансформера, и всё работает авторегрессивно. Новизна не в том, как представлено зрение, а в том, насколько дёшево работает ствол — 5,5 млрд активных параметров на токен из 124 млрд общих, и именно поэтому модель оказывается на границе интеллекта и активных параметров. VideoRoPE даёт пространственной и временной позиции единое согласованное кодирование, так что видео не требует отдельного механизма.
InternLumina U2 меняет само представление. Она использует токенизатор AToken от Apple, в котором каждая визуальная позиция описывается с помощью восьми взаимодополняющих кодовых книг — локальной текстуры, встроенного текста, геометрии и высокочастотных деталей как отдельных потоков, а не одного сжатого вектора. Каждая кодовая книга сохраняет собственный эмбеддинг на входе, а восемь эмбеддингов для каждой позиции конкатенируются и проецируются в один токен бэкбона. На выходе предсказание — это то, что команда называет пространственно-параллельным, авторегрессионным по глубине кодовых книг: диффузионный бэкбон денойзит множество замаскированных пространственных позиций одновременно, затем многокодовокнижная авторегрессионная голова предсказывает восемь кодов для каждой позиции по порядку. Понимание и генерация проходят через один и тот же механизм — и это, собственно, и есть главное утверждение. Аргумент команды состоит в том, что одна кодовая книга ограничивает объём информации, который может нести один визуальный токен, тогда как дискретно-непрерывные гибриды разделяют понимание и генерацию между разными представлениями и путями декодирования, и что переход полностью в дискретную область с несколькими кодовыми книгами — это способ получить по-настоящему единую модель, а не два стека, сколоченных вместе.
Обе эти позиции когерентны, и они несут противоположные издержки. Представления с несколькими кодовыми книгами могут хранить более тонкие визуальные детали; они также умножают бюджет токенов на изображение на число кодовых книг и делают декодирование значительно более трудоёмким, что, по-видимому, отчасти объясняет, почему в качестве масштаба был выбран именно 16B-A1B. Разреженность Ling обеспечивает дешёвый инференс на токен; она также означает меньшую активную ёмкость на один прямой проход — и именно этот компромисс невзначай иллюстрирует медиана класса 8 по индексу интеллекта: Ling-3.0-flash-VL уверенно её превосходит с показателем 25, но по чистому рассуждению он не конкурирует с плотными фронтирными моделями.
Поверхности задач пересекаются лишь частично
Отнесение обоих к «мультимодальной модели» преувеличивает их сходство. Понимание того, где оно заканчивается, избавляет от множества неудачных сравнений при выборе.
• Входные данные — Ling-3.0-flash-VL принимает текст, изображения и видео, до 40 изображений на запрос, и возвращает текст; InternLumina U2 принимает текст, изображения, видео и 3D-ассеты и возвращает текст, сгенерированные изображения или отредактированные изображенияbr /> • Генерация изображений — Ling-3.0-flash-VL вообще не может генерировать или редактировать изображения; центральное утверждение InternLumina U2 состоит в том, что она делает и то, и другое, до 1024×1024, с использованием тех же весов, которые читают изображенияbr /> • 3D — у Ling-3.0-flash-VL нет 3D-пути; InternLumina U2 поставляется с конвейером на базе Blender, который рендерит ассеты GLB и GLTF в 64 парных вида «цвет и глубина», чтобы модель могла рассуждать на их основеbr /> • Видео — Ling-3.0-flash-VL обрабатывает видео с помощью временного кодирования VideoRoPE; InternLumina U2 сэмплирует 64 кадраbr /> • Контекст и вывод — контекстное окно Ling-3.0-flash-VL составляет 262K токенов против 256K, заявленных в её карточке модели, а максимальный объём вывода сравнительно невелик; InternLumina U2 не опубликовала ни один из этих показателейbr /> • Активные параметры — Ling-3.0-flash-VL активирует примерно 5,5B параметров на токен; InternLumina U2 активирует около 1B, что составляет одну пятую от этого
Прочитайте этот список, и вывод таков: эти две модели взаимозаменяемы ровно для одной задачи — чтения изображения и ответов на вопросы о нём — и дополняют друг друга почти во всех остальных случаях. Если вам нужна модель, которая генерирует или редактирует изображение, Ling-3.0-flash-VL не является кандидатом, и никакой бенчмарк этого не меняет. Если вам нужна одна модель, которая читает график, генерирует вариант и рассуждает над 3D-ассетом, то InternLumina U2 нацелена именно на это, а Ling-3.0-flash-VL не решает эту задачу.

Бенчмарки: одна независимая оценка против страницы вендорских цифр
Качество доказательств несопоставимо, и стоит точно объяснить, почему это так, а не просто объявлять победителя.
25 баллов Ling-3.0-flash-VL в Intelligence Index v4.3 — это сторонний прогон по опубликованному протоколу; для контекста: медиана класса составляет 8, а измеренная пропускная способность — 142,9 выходных токена в секунду против медианы среди аналогов 105,1 при времени до первого токена 2,21 секунды. Его вендорская карточка отдельно заявляет 42 по выведенному из эксплуатации v4.1.1 протоколу — это другая шкала, и его нельзя ставить рядом с 25 так, будто модель показала спад; индекс был пересмотрен в сентябре 2026 года, и оценки пересчитаны для всех. Вендор также сообщает о победе 1441 против 1440 над GPT-5.4 в Image-to-WebDev Arena под ником «linthium» — разрыв в один пункт в пределах шума Elo, к тому же по данным самого вендора.
Показатели InternLumina U2 — собственные данные лаборатории, помеченные как предварительные и частичные, при этом полные сравнительные таблицы и технический отчёт всё ещё не готовы. Теперь они представлены в таблице в README репозитория, а не в таблице лидеров бенчмарка, и их пока нельзя независимо проверить, поскольку ни одна третья сторона не опубликовала результат запуска. Как заявляет сама лаборатория:
• Понимание — ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15, MMMU-Pro 36.13, MathVision 33.22, DynaMath 56.37br /> • Видео — Video-MME 51.26, MVBench 59.74, MLVU 57.03br /> • Генерация и редактирование — GenEval 0.81, DPG 87.10, TIIF Short 84.60, TIIF Long 85.95, ImgEdit 3.83br /> • Источники — каждый показатель InternLumina U2 указан производителем и является предварительным; каждый показатель Ling-3.0-flash-VL указан производителем, за исключением Intelligence Index, который приводится по данным Artificial Analysis
Два из них заслуживают пометки. GenEval 0,81 отстаёт от 0,89 названного конкурента по собственной таблице лаборатории — редкий случай, когда вендор публикует проигрыш, и повод немного больше доверять остальной части таблицы. А ImgEdit при 3,83 бессмыслен без сопроводительной таблицы, которая является частью того, что будет содержать готовящийся технический отчёт. Рассматривайте список InternLumina U2 как результаты, которые лаборатория намерена отстаивать, а не как результаты, на основе которых можно действовать. Учтите также, что его оценки понимания и оценка по индексу Ling-3.0-flash-VL — это несопоставимые величины: одна представляет собой набор показателей вендора по конкретным задачам, другая — составной индекс третьей стороны.

Лицензия, оборудование и сколько на самом деле стоит ставка на каждое из них
Ling-3.0-flash-VL распространяется под лицензией MIT в обоих форматах точности — это примерно так чисто, как бывают открытые веса: без дополнительных условий, без ограничений по области использования, без неоднозначности в отношении коммерческого развёртывания. Сборка FP8 объёмом примерно 126 ГБ помещается в один узел из восьми ускорителей класса 80 ГБ; BF16 — примерно вдвое больше. Поддержка обслуживания уже есть в SGLang и в поддерживаемом Ant форке vLLM. Остаточный риск — коммерческий, а не юридический: Ant не публикует ставку за токен для vision-модели, бесплатный доступ в Ling Studio носит промо-характер, а не является тарифом, а Artificial Analysis указывает $0,00 за 1 млн токенов на входе и выходе только потому, что доступная ей конечная точка — бесплатная.
InternLumina U2 распространяется под Apache-2.0 в основном репозитории, и есть два исключения, которые стоит изучить: поставляемый в комплекте VeOmni/ — это каталог, который сохраняет свою вышестоящую лицензию Apache-2.0, а atoken_inference/ создан на основе ml-atoken от Apple и распространяется на исходных условиях Apple. Заявление об инфраструктуре серьёзное — она ориентирована как на GPU NVIDIA, так и на NPU Huawei Ascend, с численным согласованием на уровне операторов между бэкендами, и команда сообщает об обучении end-to-end на кластере Ascend из тысячи карт с улучшением эффективности обучения в 1,85× благодаря объединённым операторам, настроенному шардированию HSDP и градиентному чекпоинтингу. Это настоящая инженерия. Это также ортогонально тому, хороша ли модель: эффективность обучения на Ascend ничего не говорит о качестве выходных данных, а чекпоинт, существующий сегодня, — это тот, что нацелен на этот стек.
Так что практическая асимметрия не в том, открытый он или закрытый. Оба открыты, оба имеют разрешительные лицензии, и оба можно скачать уже сегодня. Она в том, что один релиз предполагает железо, которое у вас, скорее всего, есть, а другой — железо, которого у вас, скорее всего, нет. Если ваш парк — NVIDIA, Ling-3.0-flash-VL — это работа на один день, а InternLumina U2 — это ожидание. Если ваш парк — Ascend — что всё чаще встречается на китайском рынке, для которого создавалась эта модель — это уравнение полностью переворачивается, и именно у InternLumina U2 есть готовый путь, тогда как рецепты Ling-3.0-flash-VL предполагают CUDA.
Вопросы, которые люди на самом деле задают об этом сочетании
Весa InternLumina U2 уже доступны для скачивания?
Да, контрольная точка, обученная на Ascend, — это семь шардов safetensors, опубликованных в ascend/ на Hugging Face, вместе с конфигурацией, токенизатором и файлами моделирования. Контрольная точка, обученная на NVIDIA, находится в отдельной подпапке и всё ещё указана как «скоро появится», а код обучения и технический отчёт пока не опубликованы.
Ling-3.0-flash-VL строго лучше, потому что у него независимая оценка?
Нет — это лучше подтверждено доказательствами и проще запускается на обычном оборудовании, а это другое утверждение. Ling-3.0-flash-VL не может генерировать или редактировать изображения, не может обрабатывать 3D-ассеты и не имеет опубликованной цены. Если ваша задача — генерация изображений, редактирование изображений или понимание 3D, InternLumina U2 решает её, а Ling-3.0-flash-VL не решает её вообще, сколько бы бенчмарков ни было у модели Ling.
Противоречит ли 42 на карточке модели Ling-3.0-flash-VL значению 25 от Artificial Analysis?
Не напрямую. 42 измерялось по протоколу Intelligence Index v4.1.1, а 25 — по v4.3; в сентябре 2026 года индекс был пересмотрен и все результаты пересчитаны, а эти две версии построены на разных наборах оценок. Можно сказать лишь то, что 42 никогда не было независимо воспроизведено, а 25 было получено независимо.
Где можно вызвать любой из них
Ни Ling-3.0-flash-VL, ни InternLumina U2 нет в нашем каталоге моделей, и утверждать обратное — это заявление, которое читатель может проверить за десять секунд. Ling-3.0-flash-VL доступна через собственную платформу Ant, которая публикует эндпоинт, совместимый с OpenAI, и эндпоинт, совместимый с Anthropic, через бесплатный пробный доступ в Ling Studio, а также через открытые веса, если вы разворачиваете их сами. InternLumina U2 доступна через чекпоинт на Hugging Face и драйвер вывода из репозитория, на оборудовании, под которое рассчитан этот чекпоинт.
Маршрут «What we do» — это vision-модель, с которой эту пару чаще всего сравнивают на практике: DeepSeek V4 Flash Vision Exp, доступная в каталоге с окном контекста на 1 млн токенов и опубликованным тарифом, на том же OpenAI-совместимом эндпоинте, что и остальной каталог. Когда лаборатория выпускает открытые веса, слой маршрутизации обычно может предложить модель, не дожидаясь, пока собственный хостинговый сервис лаборатории стабилизируется, — что и есть практическая разница между тем, можно ли назвать цену на модель, и тем, можно ли её вызвать. Эта разница уже действует для Ling-3.0-flash-VL и пока что сугубо теоретическая для InternLumina U2, чья история выпуска — это аппаратный путь, а не вопрос хостинга.

Вердикт действительно неоднозначен, и он разделяется по аппаратному обеспечению и задачам, а не по качеству. Ling-3.0-flash-VL — это завершённый релиз: лицензия MIT, оба формата точности, сторонние оценки, приоритет CUDA, и он ограничен только пониманием. InternLumina U2 — это более амбициозный дизайн и менее завершённый релиз: опубликован чекпойнт для одного аппаратного стека, единая поверхность из шести задач, включая генерацию и 3D, и всё ещё не выпущенный технический отчёт. Если вам нужна модель компьютерного зрения на оборудовании NVIDIA на этой неделе, выбор напрашивается сам собой. Если вас интересует дизайн InternLumina U2 с несколькими кодовыми книгами, следить стоит за чекпойнтом для NVIDIA — и честная позиция до тех пор такова, что её таблица бенчмарков, включая строку, в которой она проигрывает, описывает модель, вторая половина которой ещё не выпущена.
