Сгенерированная титульная карточка для сравнения Perceptron Mk1.5 и Qwen 3.8 с заголовком «Perceptron Mk1.5 против Qwen 3.8», подзаголовком «Глаза и планировщик — не одна и та же модель» и тремя карточками: «Mk1.5: 36 864 токена, координаты на выходе», «Qwen 3.8: 2,4T MoE, индекс AA 40» и «Стык: кадры — одному, планы — другому», со сноской «Индекс Qwen 3.8 по данным Artificial Analysis».
Guides & Insights

Perceptron Mk1.5 против Qwen 3.8: роботу нужны оба, и ни один из них не является заменой

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Робот, которому нужно что-то подобрать, нуждается в двух вещах от модели, и ни одна отдельная модель в этой паре не даёт и того, и другого. Perceptron Mk1.5 возвращает геометрию: получив видеокадры, он может вернуть точку, рамку, полигон или элемент <track> с временной меткой, а его контекстное окно составляет 36 864 токена. Qwe​n 3.8 — имя, которое соответствует ядру Qwen3.8-2.4T-A95B с открытыми весами от вендора — это ризонер на смеси экспертов с 2,4 триллионами параметров и нативным окном 262K, которое расширяется до миллиона, и он работает только с текстом, поэтому вообще не может смотреть на кадры. Один — это слой восприятия, который стоит $0,15 и $1,50 за миллион токенов; другой — это ядро рассуждений, которое стоит примерно в тринадцать раз больше на входе и в четыре раза больше на выходе, и имеет независимую оценку 40 в индексе Artificial Analysis Intelligence Index, тогда как у модели восприятия вообще нет независимой оценки.

Поставленные рядом как конкурирующие продукты, они проигрывают друг другу в противоположных направлениях, и сравнение не даёт ничего пригодного. Поставленные рядом как две половины одного пайплайна, они объясняют почти каждое решение о стоимости и надёжности в embodied-стеке: где интерпретируются кадры, где составляется план и что происходит с вашим счётом, когда половина, отвечающая за рассуждения, пишет больше токенов, чем требуется для задачи.

Разделение, которое делает это сочетание осмысленным.

Perceptron Mk1.5 был выпущен 25 сентября 2026 года как преемник Perceptron Mk1, и круг его задач строго ограничен. Он принимает текст, изображения, видео и аудио, а возвращает текст плюс необязательную структурированную аннотацию — точки, ограничивающие рамки, полигоны, клипы и треки. Вывод <track> содержит как пространственное наблюдение, так и временную метку, к которой оно относится, поэтому 60-секундный клип возвращается как положения во времени, а не как одна усреднённая догадка. Поле asset_idx позволяет одному запросу адресовать несколько изображений или видео по отдельности, что необходимо для сравнения эталонного кадра с текущим кадром. Ограниченные ответы бывают двух видов — JSON Schema и регулярные выражения, и весь смысл обоих в том, что вывод является типизированным.

Qwen 3.8 — инструмент противоположного типа. Ядро 2.4T — это мелкозернистая MoE: 92 слоя, 512 экспертов на слой, из которых 10 маршрутизируемых плюс один общий, а 69 из этих 92 слоёв используют линейное внимание — именно так архитектура такого масштаба достигает длинного контекста. Сильная сторона — рассуждения по большому объёму текста: сложный многошаговый анализ, длинные выкладки, агентное планирование. А его неспособность проявляется на входной стороне. Открытое ядро работает только с текстом, и его рассуждения нельзя отключить: каждый ответ начинается с блока размышлений, хотите вы этого или нет.

Это не недостаток модели рассуждений; это недостаток модели восприятия, а Qwen 3.8 таковой не является. Поставьте их в последовательность — и картина становится очевидной: Mk1.5 отвечает на вопрос «где находится погрузчик и когда он переместился», Qwen 3.8 отвечает «учитывая это, что должен делать манипулятор». Ни на один из этих вопросов не может ответить другая модель.

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Qwen 3.8 - the scoreboard', comparing six dimensions: role in a stack (perception, frames to geometry vs reasoning, text to plans); scale (hosted perception API vs 2.4T total / 95B active MoE); context (36,864 tokens vs 262K native, to roughly 1M); input (text, image, video, audio vs text only on the open core); price ($0.15 in / $1.50 out per 1M tokens vs $2.00 in / $6.00 out); and independent score ('none yet' vs AA Index 40 of 115). Footnoted that the Qwen 3.8 index is per Artificial Analysis and that all Mk1.5 figures are vendor-reported.

Сколько стоит каждая половина — по тарифам, которые фактически применяются при выставлении счетов.

• Ввод — Perceptron Mk1.5: $0.15 за миллион токенов. Qwen 3.8: $2.00 за миллион в хостируемой сборке, которую измеряет независимый тестовый стенд, с применённой 88% скидкой на кэш, что снижает стоимость попадания в кэш примерно до $0.24.

• Вывод — Mk1.5 $1.50 за миллион. Qwen 3.8 $6.00 за миллион.

• Кэш — кэшированный ввод Mk1.5 стоит $0,0375 за миллион, ровно четверть его стандартной ставки за ввод. Скидка Qwen 3.8 рассчитывается в процентах, но она глубже — 88%, поэтому в абсолютном выражении его ставка для кэшированного ввода ниже из двух, а его ставка без кэширования более чем в десять раз превышает ставку Mk1.5.

• Стоимость за завершённую задачу — вот здесь рейтинг переворачивается. Artificial Analysis оценивает стоимость одной задачи по Intelligence Index у Qwen 3.8 в $2,16, ставя его на 32-е место из 115 в своём классе и присваивая четыре из четырёх баллов за стоимость — дёшево за завершённую задачу, несмотря на дорогие токены, потому что модель сгенерировала 170 млн выходных токенов во время прогонов индекса на фоне конкурентов, которые разглагольствуют ещё больше. У Mk1.5 нет эквивалентного показателя, опубликованного кем-либо.

• Контекст — 36 864 токена для Mk1.5 против нативных 262K для ядра Qwen, с возможностью расширения до миллиона при правильной конфигурации сервинга.

• Контроль рассуждений — Mk1.5 предоставляет reasoning_effort со значениями high, medium, low, minimal или none и по умолчанию использует high. Qwen 3.8 принудительно включает мышление, поэтому вы платите за токены мышления при каждом вызове.

Прочитайте этот список дважды, потому что по стоимости эти две модели меняются местами. В расчёте на токен Mk1.5 значительно дешевле. В расчёте на выполненную задачу по независимому бенчмарку Qwen 3.8 измеряется как дешёвый, а Mk1.5 не измерен. Эти два утверждения противоречат друг другу только в том случае, если предположить, что они выполняют одну и ту же работу, а это не так.

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning via reasoning_effort, function calling on chat completions, and constrained JSON Schema and regex responses) and the Pricing table below it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Здесь доказательства говорят об обратном

В большинстве сравнений этого выпуска сторона с открытыми весами — это та, где есть набор цифр, заявленных производителем, а закрытый API — это та, где есть страница третьей стороны. Здесь всё наоборот, и об этой перемене стоит сказать прямо, потому что она меняет то, что вы можете и чего не можете проверить.

Qwen 3.8 имеет независимые измерения. Artificial Analysis Intelligence Index ставит ядро 2.4T на 40, что соответствует 5-му месту среди 115 моделей своего класса на момент написания, со скоростью вывода 39,6 токена в секунду — 56-е место из 115, что является средним уровнем и о чём стоит знать, прежде чем кто-либо планирует интерактивный цикл вокруг него. Ревизии индекса меняются между снимками, и честный способ читать любые из этих цифр — как ориентировочные, но суть остаётся: кто-то за пределами Alibaba запустил эту модель и опубликовал число.

У Perceptron Mk1.5 такого нет. Для Mk1.5 и его предшественника нет ни записи в Artificial Analysis, ни оценки в арене, поэтому все существующие показатели возможностей были получены Perceptron и относятся к её собственной модели. Этот набор необычно конкретен, и это говорит в его пользу — 0,9433 на egocentric hand_box против 0,4467 у Gemini 3.1 Pro в собственном прогоне вендора; EgoSchema 80,40 против 81,20 у того же конкурента — небольшое отставание на широком бенчмарке понимания наряду с заявленным преимуществом в 12% на более сложном подмножестве EgoSchema с результатом 63,75; 0,647 centre-F1 и 0,628 point-HOTA на Molmo2-Track — но конкретность и независимая проверка — это разные свойства, и только второе говорит о том, что произойдёт на ваших видеозаписях.

Два предостережения при чтении таблицы Perceptron, и оба применимы к любой её цитате. Показатель LiveVQA-W, равный 56.0 при включённых инструментах, получен мажоритарным голосованием по четырём выборкам, тогда как 53.2, с которым его сопоставляют для Gemini 3.8 Flash с привязкой к Google Search, не является результатом мажоритарного голосования; сам приём законен, и он льстит показателю по сравнению с одиночным жадным проходом. А в строке tracking указан Qwen3-VL-8B со значением 0.180 centre-F1, взятым из статьи этой модели, и он стоит в том же столбце, что и измеренные значения для другого семейства чекпойнтов. Цифра из статьи в столбце измеренных значений — это не сопоставимая строка, и именно такие строки цитируют без указания происхождения.

Ядро 2.4T — это не то, что можно запросить у нас, но его архитектура — да.

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the breadcrumb Home > Models > Qwen, the model id qwen/qwen3.8-max with text, image and video input, the $2.00 and $6.00 per million token rates and the 1,000,000-token context window stated on the page, the capabilities row covering vision, tools, JSON and reasoning, and the Qwen-published benchmark section dated 2026-08-03.

Это та часть сравнения, где честный ответ расходится с тем, что можно было бы предположить по известности модели. Название Qwen 3.8 широко используется для обозначения открытого ядра, а открытое ядро — это загрузка, а не эндпоинт: 2,4 ТБ весов BF16 под специальной лицензией Alibaba Qwen3.8-Max, опубликованных в августе 2026 года. Мы его не обслуживаем, и сегодня по нашу сторону забора нет провайдера, который бы его обслуживал, — запись в каталоге существует в виде анонсированной страницы отслеживания с пометкой «пока недоступно», а не в виде действующего маршрута.

Что мы действительно предоставляем, так это флагманский API, построенный на той же архитектуре 2.4T. Он доступен как qwen/qwen3.8-max по цене $2,00 и $6,00 за миллион токенов — собственный тариф Alibaba, переданный напрямую, с ничего не добавлено за токен, с мультимодальным окном в 1M токенов — ввод текста, изображений и видео — и той же гибридной схемой внимания, что и в открытом ядре. Если вашей рассуждающей половине нужно что-то увидеть, это тот самый маршрут, и это также маршрут, на котором изменение тарифа поставщика отражается на нашей стороне в тот же день, а не в ваш следующий расчётный цикл. Наряду с ним мы предоставляем плотного собрата от Alibaba qwen/qwen3.8-27b на нашей собственной инфраструктуре по $0,33 и $2,40 за миллион, с окном в 262 144 токена и вводом текста, изображений и видео — для случаев, когда 27B-рассуждателя достаточно, а индекс 40 у 2.4T превышает потребности задачи.

Соединение двух половин без второго контракта

Практическая причина, по которой это объединение важнее аргумента о бенчмарках, заключается в том, что стек для воплощённого ИИ — это уже две модели, а стоимость интеграции третьей — то, что тихо убивает решение. Mk1.5 нет в нашем каталоге, поэтому чтобы добраться до него, нужен собственный API вендора — pip install "perceptron>=0.4.0", ключ в PERCEPTRON_API_KEY, эндпоинт api.perceptron.inc. До половины с Qwen — один ключ.

Шлюз оправдывает себя именно на стыке. Правило маршрутизации, которое отправляет каждый кадр с вопросом в модель восприятия, а каждый чисто текстовый план — в модель рассуждений, превращается в одну строку конфигурации, когда обе находятся заодним OpenAI-совместимым эндпоинтом, а автоматическое переключение при сбое означает, что инцидент у любого из провайдеров приводит к переходу на резервный вариант, а не к остановке робота. Один API, охватывающий более 200 моделей с прайс-листовыми ценами без наценки, — это ещё и самый дешёвый способ ответить на вопрос, на который эта статья ответить не может: действительно ли вашей задаче отслеживания объектов нужны координаты Mk1.5 или достаточно было бы универсальной модели зрения с гораздо большим окном и независимой оценкой. Направить часть реального трафика между кандидатами и измерять на собственных кадрах дешевле, чем любое исследование с бенчмарками, которое вы могли бы заказать.

Что с этим делать, конкретно

Если вы встраиваете восприятие в физическую систему, Perceptron Mk1.5 — единственная модель в этой паре, которая отвечает координатами, и это возможность, а не оценка: проверьте утверждение о рамке руки на собственном видео, задавайте reasoning_effort осознанно, а не полагайтесь на высокое значение по умолчанию, и планируйте бюджет с учётом окна в 36 864 токена как жёсткого ограничения, а не мягкого. Если вы строите слой рассуждений над ним, Qwen 3.8 измеряется там, где Mk1.5 — нет, и его стоимость за выполненную задачу — это показатель, на который следует ориентироваться при планировании, а не рекламная цифра $2.00, с той оговоркой, что его режим размышления нельзя отключить, поэтому задача, которой не нужна цепочка рассуждений, всё равно за неё платит.

Команды, которые ошибаются в этом, — это те, что пытаются заставить одну модель делать и то, и другое. Специалист по восприятию с 36 864 токенами не удержит операционную историю, а рассуждающая модель только для текста на 2,4 трлн параметров никогда не увидит кадр. Такое объединение — не компромисс между двумя продуктами. Это и есть реальное разделение труда, и полезный вопрос лишь в том, к какой его стороне относится каждый из ваших вызовов.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно