Qwen 3.7 Flash: центово-дешевая визуальная модель Alibaba для агентов, которые действительно смотрят на экраны.
Guides & Insights

Qwen 3.7 Flash: центово-дешевая визуальная модель Alibaba для агентов, которые действительно смотрят на экраны.

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Последние два года команда Qwen из Alibaba выпускала плотную линейку моделей практически во всех мыслимых ценовых категориях и уровнях возможностей, и 27 июля 2026 года ещё одна модель тихо появилась как коммерческая позиция в API: qwen/qwen3.7-flash. Она вышла без фанфар флагманского запуска — Alibaba не публиковала ни технического отчёта, ни набора бенчмарков, ни схемы архитектуры. Зато вместе с ней пришло описание, которое для разработчиков значит гораздо больше, чем ещё один балл в лидерборде: визуально-языковая модель рассуждений, контекстное окно на 1 миллион токенов и цена настолько низкая, что едва заметна как отдельная строка в счёте.

Эта комбинация — дешевизна, огромный контекст и нативное «видение» изображений — ставит Qwen 3.7 Flash прямо в категорию, которая стала одной из самых конкурентных и полезных во всём рынке моделей: низкозатратная мультимодальная рабочая лошадка. Это не те модели, которые выигрывают бенчмарки. Это модели, которые вызывают десять миллионов раз в день внутри агентных циклов, пайплайнов автоматизации браузера и инструментов поддержки, потому что при стоимости $0.03 за вход и $0.13 за выход на миллион токенов цена практически перестаёт быть проектным ограничением.

{{1}}Этот материал — вводный разбор{{/1}}: {{2}}что такое Qwen 3.7 Flash на самом деле{{/2}}, {{3}}что Alibaba раскрыла (и, что важно, чего не раскрыла){{/3}}, {{4}}как экономика складывается на реальной математике токенов{{/4}}, {{5}}и где её место рядом с остальным семейством Qwen — включая гораздо более крупные Qwen 3.8 и Qwen 3.7 Max — а также на фоне дешёвых мультимодальных конкурентов вроде Gemini 3.5 Flash-Lite{{/5}}. Мы также разберём, {{6}}как маршрутизирующий слой вроде OrcaRouter относится к такой модели{{/6}}: {{7}}не как к флагманской модели{{/7}}, {{8}}а как к базовому уровню, который незаметно поглощает основную часть мультимодального трафика{{/8}}.

TL;DR

Qwen 3.7 Flash — это визуально-языковая модель команды Qwen из Alibaba, указанная под идентификатором модели qwen/qwen3.7-flash с 27 июля 2026 года. Она создана для мультимодальных агентов, визуального кодирования, поиска и взаимодействия с компьютером/интерфейсом, с заявленными сильными сторонами в распознавании объектов и пространственном понимании. Она поддерживает контекстное окно на 1 000 000 токенов и стоит $0,03 за 1 млн входных токенов и $0,13 за 1 млн выходных токенов — что делает её одной из самых дешёвых моделей с поддержкой зрения. Максимальная длина выходных данных, точное количество параметров и архитектура официально не раскрыты; предположения сообщества указывают на небольшую архитектуру смеси экспертов и возможного предшественника открытой версии Qwen 3.7, но это не подтверждено. Это отдельная, меньшая и более дешёвая модель по сравнению как с Qwen 3.8 (отдельно анонсированным флагманом Alibaba с открытыми весами на 2,4 трлн параметров), так и с Qwen 3.7 Max (более крупным флагманом этого же поколения). Ни один независимый набор бенчмарков — включая Artificial Analysis — ещё не оценил её, поэтому относитесь к заявлениям о качестве как к ранним и неподтверждённым, пока не появятся данные от третьих сторон.

Основные выводы

• Qwen 3.7 Flash — это визуально-языковая модель, а не только текстовая — она предназначена для мультимодальных агентов, визуального программирования, поиска и задач компьютерного использования, а не для общего чата.

• Цена составляет $0,03 за 1 млн входных токенов и $0,13 за 1 млн выходных токенов, что примерно соответствует самому дешёвому уровню пограничных мультимодальных моделей, доступных сегодня на рынке.

• Контекстное окно составляет 1 млн токенов, что имеет большее значение для сеансов с большим количеством изображений и многошаговых агентов, чем кажется, поскольку изображения и скриншоты быстро расходуют токены.

• В примечаниях к ценам указано, что при кэшировании промптов с повторяющимся контекстом эффективная стоимость может оказаться на 60–80% ниже заявленной — а это существенный рычаг для агентных циклов, которые повторно используют один и тот же системный промпт или историю скриншотов.

• Alibaba не опубликовала максимальное количество выходных токенов, количество параметров или детали архитектуры; любые более конкретные сведения, которые вы прочитаете в других источниках, являются предположениями сообщества, а не раскрытием информации от поставщика.

• Это не Qwen 3.8 (флагманская модель с открытыми весами на 2.4T) и не Qwen 3.7 Max (более крупная закрытая флагманская модель в той же волне релиза) — невзирая на схожесть названий, это три разные модели с тремя разными задачами.

• Ни одна независимая организация по бенчмаркам, включая Artificial Analysis, на момент написания не опубликовала результаты для Qwen 3.7 Flash — качество действительно неподтвержденное вне описания вендора.

Что такое Qwen 3.7 Flash на самом деле

Отбросьте соглашение об именовании, и Qwen 3.7 Flash — это ответ Alibaba на вопрос, который сейчас задала себе каждая крупная лаборатория: как выглядит модель, если вся её задача — «обрабатывать визуальный, агентный, высоконагруженный трафик максимально дёшево, не будучи бесполезной»? Google ответил на это уровнями Gemini Flash и Flash-Lite. OpenAI — линейками mini и nano. Ответ Alibaba в этом поколении — Qwen 3.7 Flash.

Официальное описание сосредоточено на четырёх сценариях использования: мультимодальные агенты, визуальное программирование, поиск и взаимодействие с компьютером или интерфейсом. Это очень продуманный список. Это не «отлично справляется с творческим письмом» или «сильные рассуждения на задачах математической олимпиады» — это перечень задач, где модели нужно посмотреть на скриншот, веб-страницу, фрагмент пользовательского интерфейса или визуально отображённую разницу кода, а затем выполнить действие. Alibaba также выделяет распознавание объектов и пространственное понимание как особые сильные стороны, что согласуется с формулировкой использования компьютера и взаимодействия с интерфейсом: агенту, который будет нажимать кнопки, читать макеты или перемещаться по экрану, необходимо знать, где находятся объекты, а не только то, что они говорят.

Стоит прямо указать, что подразумевается под "reasoning" в данном контексте. Qwen 3.7 Flash описывается как модель визуально-языкового рассуждения, то есть ожидается, что она будет выполнять многошаговые визуальные задачи, а не просто подписывать изображение или отвечать на единичный поисковый вопрос. В этом разница между "describe this screenshot" и "here's a screenshot of a form with three validation errors — figure out what's wrong and tell me which field to fix first."

Спецификации и мультимодально-агентный фокус

Вот полный список того, что действительно подтверждено, а что нет.

Подтверждено:Производитель — команда Qwen из Alibaba. Модель указана под идентификатором qwen/qwen3.7-flash, доступна с 27 июля 2026 года. Она принимает мультимодальный ввод (зрение и язык). Контекстное окно — 1 000 000 токенов. Цена составляет $0,03 за 1 млн входных токенов и $0,13 за 1 млн выходных токенов. В примечаниях к ценам указано, что кэширование промптов при повторяющемся контексте может снизить фактическую стоимость на 60–80% по сравнению с прейскурантной ценой для рабочих нагрузок, которые повторно используют одни и те же системные инструкции или эталонные изображения между вызовами — это важная деталь для агентных циклов, которые каждый раз отправляют одну и ту же историю скриншотов или схему инструментов.

Не раскрыто:Максимальный лимит выходных токенов. Точное количество параметров. Архитектура (плотная или смесь экспертов). Состав обучающих данных. Любые собственные результаты бенчмарков.

Спекуляции сообщества (обозначьте их как таковые, потому что это всего лишь спекуляции):Учитывая название "Flash", агрессивное ценообразование и схему, которой Alibaba следовала с предыдущими поколениями Qwen, некоторые наблюдатели подозревают, что Qwen 3.7 Flash использует небольшую архитектуру смеси экспертов, оптимизированную для низкой вычислительной стоимости за токен, и что это может быть предварительная версия или этап дистилляции перед возможным выпуском Qwen 3.7 с открытыми весами, отражая то, как более ранние варианты Qwen "flash" или "turbo" иногда предшествовали более широким открытым выпускам. Ничто из этого не подтверждено Alibaba. Относитесь к этому как к обоснованному предположению, а не факту, пока официальный технический отчет или карточка модели не скажут иного.

Отсутствие опубликованного показателя максимального выходного объема заслуживает внимания для любого, кто разрабатывает под эту модель: если ваш случай использования приводит к длинным структурированным выводам (большие JSON-нагрузки, генерация многофайлового кода, длинные транскрипты), проверьте фактический выходной потолок эмпирически, прежде чем брать на себя обязательства в производстве, так как вы не можете проверить документацию на наличие числа, которого там нет.

Пример расчета стоимости: что это на самом деле стоит

Такие маленькие числа легко отмахнуться, так что давайте правильно произведём арифметические расчёты.

При $0.03 за 1M входных токенов и $0.13 за 1M выходных токенов, один вызов с 2,000 входными токенами (скриншот приличного размера плюс короткая инструкция) и 300 выходными токенами (структурированный ответ) стоит: 2,000/1,000,000 × $0.03 = $0.00006 за вход, плюс 300/1,000,000 × $0.13 = $0.000039 за выход. Итого: примерно $0.0001 за вызов — одна сотая цента.

Масштабируйте это до объема. Запустите 1 миллион таких вызовов — разумная дневная нагрузка для среднего агентного продукта, выполняющего анализ скриншотов или проверки состояния UI — и вы получите: 1,000,000 × 2,000 = 2 миллиарда входных токенов × $0.03/1M = $60, плюс 1,000,000 × 300 = 300 миллионов выходных токенов × $0.13/1M = $39. Итого: около $99 за один миллион вызовов агента компьютерного зрения. Даже до добавления кэширования промптов (которое, согласно примечаниям к описанию, может сократить это на 60-80% для рабочих нагрузок с повторяющимся контекстом), это сумма, которую большинство команд может утвердить без бюджетного совещания.

Теперь сравним более тяжелый сценарий: агент, использующий компьютер, который поддерживает текущий контекст в 50,000 токенов (скриншоты, история действий, результаты инструментов) и генерирует 500 токенов действия за шаг, выполняемый 100,000 раз в день. Стоимость ввода: 100,000 × 50,000 = 5 миллиардов токенов × $0.03/1M = $150/день. Стоимость вывода: 100,000 × 500 = 50 миллионов токенов × $0.13/1M = $6.50/день. Это примерно $156/день, или около $4,700/месяц, для довольно агрессивной рабочей нагрузки агента с длинным контекстом — и это без учета скидки на кэширование для повторяющихся частей этого контекста в 50K, что в цикле использования компьютера (один и тот же системный промпт, одинаковые определения инструментов, перекрывающееся состояние экрана) является именно тем видом нагрузки, для которой был создан промпт-кэш.

Пошаговые разборы реальных сценариев

высокообъемные задачи компьютерного зрения

Представьте себе конвейер каталогизации продуктов, которому нужно ежедневно классифицировать, тегировать и извлекать атрибуты из нескольких сотен тысяч изображений товаров — это именно та нагрузка, где стоимость за токен умножается достаточно быстро, чтобы пробить бюджет на среднеуровневой модели компьютерного зрения, но остаётся комфортно доступной при ценообразовании Qwen 3.7 Flash. Распознавание объектов и понимание пространства — две возможности, которые Alibaba явно выделяет, — напрямую соответствуют вопросам «что на этом изображении, где это находится и в каком оно состоянии».

Визуальное программирование

"Визуальное кодирование" как названный вариант использования предполагает такие рабочие процессы: подать модели снимок экрана отрисованного интерфейса вместе с кодом компонента и попросить её найти несоответствие, или взять экспорт из Figma и получить черновую реализацию. Это категория задач, которая особенно невыгодна для текстовых моделей кода — вы можете описать ошибку вёрстки словами, но модель, которая действительно видит нарушенные отступы или неправильно выровненную кнопку, диагностирует проблему быстрее и надёжнее.

Агентный / Использование компьютера

Это главный вариант использования. Агенту, управляющему компьютером, нужно смотреть на экран, понимать, на что можно нажать, принимать решение о действии и повторять — часто десятки шагов на задачу. Экономика здесь жестока для дорогих моделей: задача автоматизации браузера или рабочего стола из 30 шагов, каждый из которых несёт свежий скриншот, может набрать сотни тысяч токенов до завершения задачи. При ценообразовании передовых моделей это реальные деньги за задачу; при ценообразовании Qwen 3.7 Flash запуск тысяч таких сессий в день остаётся в пределах бюджета небольшой команды.

Визуальный поиск — сопоставление изображения с корпусом, проверка того, что полученный результат действительно соответствует эталонному фото, или привязка поискового запроса к снимку экрана того, что видит пользователь — выигрывает от той же комбинации большого контекста (для хранения нескольких изображений-кандидатов или длинного набора извлеченных документов) и низкой стоимости на один вызов (поскольку циклы поиска и проверки часто означают множество вызовов модели на один запрос пользователя, а не один).

Как получить доступ и использовать Qwen 3.7 Flash

Qwen 3.7 Flash вызывается с идентификатором модели qwen/qwen3.7-flash, и он работает с любым инструментарием, совместимым с OpenAI, — то есть существующие интеграции в стиле chat-completions или responses могут переключиться на него простой заменой имени модели, без переписывания клиентского кода. Именно здесь маршрутизирующий слой вроде OrcaRouter становится практичным, а не теоретическим: вместо того чтобы зашивать одну модель в каждый сервис, единая OpenAI-совместимая точка входа позволяет установить дешёвую, но способную мультимодальную модель в качестве уровня по умолчанию для vision- и агентного трафика, а более дорогие модели рассуждений приберечь для подмножества запросов, которые действительно в них нуждаются. Для модели, чьё ценностное предложение целиком состоит в том, что она «очень дешёвая, вполне способная, не проверенная на фронтире», такая многоуровневая маршрутизация — дёшево по умолчанию, эскалация при необходимости — пожалуй, и есть правильный способ развернуть её в продакшене, а не ставить весь пайплайн на одну непроверенную модель.

Применяется стандартное форматирование мультимодальных запросов: изображения передаются вместе с текстом в одном сообщении, большие контекстные окна для сессий с несколькими изображениями или несколькими ходами, и оплата за токены, которая аккуратно отображается в панелях использования. Проверьте практический предел длины выходных данных для вашей рабочей нагрузки, прежде чем полагаться на него, так как максимальное значение не публикуется.

Честные ограничения и неподтвержденное

Если говорить прямо о том, что здесь действительно неизвестно: на момент написания этой статьи нет независимых данных бенчмарков о Qwen 3.7 Flash от Artificial Analysis или любого другого сопоставимого оценщика. Всё, что касается его качества — насколько хорошо он на самом деле справляется с визуальным мышлением, насколько он надежен для многошаговых агентных задач, как он противостоит отвлекающим факторам в сценариях с длинным контекстом — в настоящее время подтверждается только собственным позиционированием Alibaba, а не третьей стороной, прогнавшей его через стандартизированный набор тестов. Описание вендора и независимая проверка — это не одно и то же, и читателям следует соответственно оценивать возможности этой модели, пока такая проверка не появится.

Помимо бенчмарков, Alibaba не раскрыла архитектуру, количество параметров или максимальную длину выходных данных. Теория о «малом MoE, возможном предшественнике открытой по весам Qwen 3.7», циркулирующая в сообществе, является разумным предположением, основанным на схемах именования и ценообразовании, но это лишь догадка, а не то, что Alibaba подтвердила. Если прозрачность модели (опубликованная архитектура, открытые веса, технический отчет) является требованием для вашего случая использования, Qwen 3.7 Flash в настоящее время не соответствует этому критерию — это закрытая модель, доступная только через API, с минимальной публичной документацией помимо её описания в API.

Сравнение: Qwen 3.8, Qwen 3.7 Max и дешевые конкуренты

Эта терминология сбивает с толку, поэтому стоит быть точным. Qwen 3.8 — это отдельно анонсированный Alibaba флагман с открытыми весами, построенный, по сообщениям, на архитектуре с 2,4 триллиона параметров — принципиально другая модель с иной целью: большая, открытая модель общего назначения, призванная конкурировать на переднем крае, а не дешёвый утилитарный мультимодальный уровень. Qwen 3.7 Max — это более крупный, предположительно более способный закрытый флагман в той же волне релиза «3.7» — модель, к которой обращаются, когда задача требует максимального качества независимо от стоимости. Qwen 3.7 Flash, предмет этой статьи, третья и самая дешёвая точка в этом созвездии: меньше, быстрее, значительно дешевле и ориентирована специально на мультимодально-агентные нагрузки, а не на универсальное превосходство. Не думайте, что возможности или поведение переносятся между этими тремя только потому, что две из них имеют один номер версии — это разные модели с разными задачами.

В сравнении с внешними конкурентами, ближайшим аналогом является Google Gemini 3.5 Flash-Lite, которая занимает аналогичную нишу: недорогой, мультимодальный, высокопроизводительный уровень, предназначенный именно для тех объёмов задач, которые описаны выше. Обе модели конкурируют в первую очередь по одним и тем же параметрам — цена за токен, длина контекста и мультимодальная обработка, — а не по сырым бенчмаркам рассуждений, поскольку ни одна из них не позиционируется как фронтирная модель рассуждений. Без независимых данных бенчмарков для Qwen 3.7 Flash, ответственное заявление о качестве в прямом сравнении с Gemini 3.5 Flash‑Lite невозможно; можно лишь сказать, что ценообразование Qwen 3.7 Flash конкурентоспособно на уровне или ниже этого яруса, а его окно контекста в 1M щедро для модели в этом ценовом сегменте, что и создаёт разрыв, делающий дешёвые мультимодальные уровни достойными эмпирического тестирования на собственных рабочих нагрузках, а не выбора только по цене.

Часто задаваемые вопросы

Что такое Qwen 3.7 Flash?

Это модель визуально-языковых рассуждений от команды Qwen (Alibaba), предназначенная для мультимодальных агентов, визуального кодирования, поиска и взаимодействия с компьютером/пользовательским интерфейсом, указанная под идентификатором модели qwen/qwen3.7-flash с 27 июля 2026 года.

Сколько стоит Qwen 3.7 Flash?

$0.03 за 1 миллион входных токенов и $0.13 за 1 миллион выходных токенов — среди самых дешёвых моделей с поддержкой зрения, доступных в настоящее время, при этом в описании отмечается возможность дополнительных скидок в 60–80% благодаря кэшированию запросов при повторяющемся контексте.

Что такое контекстное окно?

1,000,000 токенов.

Является ли Qwen 3.7 Flash тем же самым, что и Qwen 3.8?

Нет. Qwen 3.8 — это отдельно анонсированная флагманская модель Alibaba с открытыми весами на 2,4 триллиона параметров. Qwen 3.7 Flash — гораздо меньшая, более дешёвая, закрытая мультимодальная модель, предназначенная для других целей. Их не следует путать, несмотря на то, что обе относятся к линейке Qwen от Alibaba.

Qwen 3.7 Flash — это то же самое, что и Qwen 3.7 Max?

Нет. Qwen 3.7 Max — это более крупная флагманская модель в той же волне релиза «3.7». Qwen 3.7 Flash — это меньшая, более быстрая и гораздо более дешевая ступень, предназначенная для высоконагруженных мультимодальных и агентных задач, а не для вывода максимального качества.

Поддерживает ли Qwen 3.7 Flash изображения?

Да, это модель «зрение-язык» — она принимает мультимодальный ввод (изображение и текст) и специально ориентирована на визуальные задачи, такие как распознавание объектов, пространственное понимание, визуальное кодирование и взаимодействие с компьютером/интерфейсом.

Какая максимальная длина вывода?

Официально не объявлено Alibaba. Тот, кто создает производственную нагрузку, должен напрямую протестировать практический верхний предел производительности, а не предполагать какое-либо число.

Является ли Qwen 3.7 Flash моделью смеси экспертов?

Не подтверждено. Некоторые в сообществе предполагают, что она использует небольшую архитектуру MoE, исходя из ценообразования и схемы именования, но Alibaba не публиковала детали архитектуры, так что это остается предположением, а не фактом.

Как это соотносится с Gemini 3.5 Flash-Lite?

Оба занимают сходный недорогой, высокопроизводительный мультимодальный уровень и конкурируют в основном по цене и длине контекста, а не по сырым бенчмаркам рассуждений. Независимых данных бенчмарков для окончательного сравнения качества для Qwen 3.7 Flash пока нет.

Где я могу получить доступ к Qwen 3.7 Flash?

Используя идентификатор модели qwen/qwen3.7-flash через любой OpenAI-совместимый клиент или через маршрутизирующий слой, такой как OrcaRouter, который может установить его в качестве дешёвого мультимодального уровня по умолчанию наряду с другими моделями.

Хорош ли Qwen 3.7 Flash?

Не подтверждено независимо на момент написания — ни одна сторонняя организация по бенчмаркингу, включая Artificial Analysis, не опубликовала оценки для него. Его ценностное предложение — это цена и размер контекста, а не продемонстрированное лидерство по качеству, поэтому стоит эмпирически протестировать его на конкретной рабочей нагрузке перед принятием решения.

Суть

Qwen 3.7 Flash не пытается занять верхние строчки в рейтингах, и Alibaba не предоставила никому документацию, чтобы это проверить, даже если бы хотела. Вместо этого она стремится сделать визуальные и агентные задачи — анализ скриншотов, проверку визуального кода, циклы компьютерного управления, визуальный поиск — настолько дешёвыми, чтобы стоимость перестала быть причиной отказа от внедрения такой функции. При цене $0,03/$0,13 за миллион токенов и контексте в 1 млн токенов экономика действительно поддерживает высокообъёмный, всегда включённый мультимодальный агентный трафик так, как это могут сделать лишь немногие модели любого качества. Подвох — честность в отношении пробелов: отсутствие независимых тестов, нераскрытая архитектура или максимальная длина вывода, а также реальная неопределённость в том, как она выдерживает сравнение с устоявшимися дешёвыми конкурентами, такими как Gemini 3.5 Flash-Lite. Рассматривайте её как многообещающий и крайне доступный вариант по умолчанию для мультимодальных агентных задач, которые стоит протестировать уже сейчас, и чётко отделяйте в своём сознании от Qwen 3.8 и Qwen 3.7 Max — это совсем разные модели, решающие совершенно иные задачи.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно