Qwen3-VL 8B Thinking — малая модель визуально-языкового мышления с открытыми весами, 8B параметров, контекст 128k.
Qwen3 VL 8B Thinking — это мультимодальная языковая модель с 8 миллиардами параметров, разработанная командой Qwen в Alibaba Cloud, размещенная на OrcaRouter под провайдером qwen. Она принадлежит к…
Qwen3 VL 8B Thinking отлично справляется с визуальными вопросами и ответами, особенно когда вопрос касается нескольких объектов, пространственных отношений или текста, встроенного в изображения (например, уличные знаки, чеки). Он также может выполнять задачи по пониманию видео, такие как резюмирование короткого клипа, определение действий или ответы на вопросы о конкретных временных метках. Анализ документов — это сильный вариант использования: извлечение информации из PDF-файлов, содержащих как текст, так и диаграммы, или из отсканированных форм. Его длинное контекстное окно делает его подходящим для обработки больших документов (например, PDF-файлов объемом более 100 страниц) с редкими вставками изображений, при условии, что общий токенизированный ввод не превышает 131K.
Если ваш вариант использования основан исключительно на тексте и не включает изображения или видео, специализированная текстовая модель (например, Qwen3-8B или аналогичный по размеру вариант Llama) будет, скорее всего, более экономичной. Мультимодальные модели несут дополнительные накладные расходы на кодирование визуальных входных данных, и цена за токен для Qwen3 VL 8B Thinking ($0.18 за ввод, $2.10 за вывод на миллион токенов) может быть выше, чем у многих текстовых альтернатив. Кроме того, если ваша задача — простая классификация или извлечение из очень коротких изображений, меньшая визуально-языковая модель с более низкой задержкой и стоимостью (например, Qwen2 VL 2B) может быть достаточной без потери производительности.
Да, модель может принимать несколько изображений, перемешанных с текстом, в одном вызове API, при условии, что общее количество токенов (токены изображений плюс токены текста) не превышает окно контекста в 131 072 токена. Каждое изображение кодируется в переменное количество токенов в зависимости от его разрешения и сложности. Совместимое с OpenAI API OrcaRouter позволяет отправлять несколько URL-адресов изображений или изображений в кодировке base64 в массиве содержимого. Жесткого ограничения на количество изображений нет, кроме ограничения по контексту. Для видео вы обычно извлекаете ключевые кадры и отправляете их как отдельные изображения вместе с текстовым запросом.
Как и все мультимодальные модели, Qwen3 VL 8B Thinking может допускать галлюцинации в деталях изображений или видео, особенно при низком разрешении или неоднозначном содержимом. Она не предназначена для обработки видео в реальном времени; модель работает со статическими наборами кадров. Размер в 8B параметров означает, что она может быть менее точной в узкоспециализированных областях (например, медицинская визуализация, спутниковые снимки) по сравнению с более крупными моделями (например, 70B-100B+ мультимодальными моделями). Она не поддерживает аудиовход. Процесс размышления может увеличить длину вывода, поэтому учитывайте это при бюджете выходных токенов. Наконец, модель оптимизирована для английского языка, но может работать с другими языками с переменной эффективностью.
Конкретные бенчмарковые показатели для Qwen3 VL 8B Thinking на стандартных мультимодальных оценках (например, MMMU, MathVista, VideoMME) не были предоставлены в доступных фактах. Пользователям следует обратиться к официальной карточке модели Qwen или исследовательской статье для получения итоговых опубликованных результатов. В целом, серия Qwen3 VL показала конкурентоспособную производительность в задачах «зрение-язык» по сравнению с другими моделями с 7–8 млрд параметров. Ожидается, что вариант «Thinking» улучшит результаты на бенчмарках, требующих рассуждений, таких как визуальная цепочка рассуждений. При отсутствии публичных оценок рекомендуется протестировать модель на собственном репрезентативном наборе данных, чтобы оценить её пригодность.
Данные о задержке для этой конкретной модели на инфраструктуре OrcaRouter не были раскрыты. Как правило, мультимодальная модель с 8B параметров будет иметь более высокую задержку, чем чисто текстовая модель того же размера, из-за кодирования изображений. Ввод видео увеличивает задержку еще больше из-за дополнительной обработки кадров. На высокопроизводительных кластерах GPU (например, A100, H100) типичное время до первого токена для модели 8B составляет от нескольких сотен миллисекунд до нескольких секунд, в зависимости от длины входных данных и размера пакета. Скорость генерации выходных токенов обычно измеряется десятками токенов в секунду. Эти значения являются качественными; фактическая производительность зависит от текущего обеспечения и нагрузки OrcaRouter.
Сильные стороны: Модель обрабатывает длинные мультимодальные контексты (131 тыс. токенов), допускает большие выходные данные (до 40 тыс. токенов) и работает с тремя типами входных данных. Ее способность к рассуждению улучшает решение задач, требующих пошаговых выводов. Она имеет конкурентоспособную цену для мультимодальной модели с 8B параметрами. Ограничения: Модель не тестировалась на многих публичных рейтингах против новейших передовых моделей. Максимальная пропускная способность вывода может быть ниже, чем у меньших моделей. Она не оптимизирована для творческой генерации изображений (выводит только текст). Пользователям не следует предполагать полное отсутствие галлюцинаций при визуальных задачах. Обработка видео ограничена покадровым извлечением, а не непрерывным анализом.
Qwen3 VL 8B Thinking тарифицируется за токен по тарифу провайдера без наценки. Входные токены стоят $0.18 за 1 миллион токенов. Выходные токены стоят $2.10 за 1 миллион токенов. Нет дополнительной платы за инфраструктуру, нет базовой стоимости за запрос и нет ежемесячной подписки. Цены одинаково применяются ко всем входным модальностям (текст, изображение, видео); каждая модальность токенизируется и оплачивается по входной ставке. OrcaRouter не взимает никакой надбавки сверх указанного тарифа. Например, обработка изображения, которое токенизируется в 2,000 входных токенов, будет стоить 2,000 * ($0.18 / 1M) = $0.00036 стоимости входа. Стоимость выхода рассчитывается аналогично.
Каждое изображение кодируется в переменное количество токенов в зависимости от его размеров и уровня сжатия. Изображения с высоким разрешением могут потреблять тысячи токенов. Видео обрабатывается путем извлечения кадров (обычно один кадр за несколько секунд) и кодирования каждого кадра как изображения; таким образом, стоимость в токенах линейно масштабируется с продолжительностью видео и частотой кадров. Пользователи могут контролировать стоимость, изменяя размер изображений или уменьшая количество кадров. Отдельная плата за кодирование медиафайлов сверх стоимости токенов отсутствует. Стоимость вывода зависит только от количества сгенерированных текстовых токенов. Для длинных видео входные токены могут быстро приблизиться к лимиту в 131K, увеличивая стоимость одного запроса.
На основании предоставленной информации, скидки на пакетное использование или предоплаченные обязательства отсутствуют. На данный момент OrcaRouter не предлагает кэширование токенов, которое могло бы снизить расходы на повторяющиеся запросы или изображения. Все запросы оплачиваются за токен в реальном времени по стандартному тарифу. Если поставщик (qwen) в будущем введёт льготные ценовые уровни, OrcaRouter передаст эту экономию с нулевой наценкой. Пользователям рекомендуется следить за страницей цен OrcaRouter на предмет обновлений. Для сценариев с большими объёмами использования рассмотрите возможность прямого взаимодействия с OrcaRouter для обсуждения возможного объёмного ценообразования.
По сравнению с более крупными мультимодальными моделями (например, GPT-4V, Gemini 1.5 Pro), Qwen3 VL 8B Thinking значительно дешевле за токен: стоимость таких моделей часто составляет $2–$10+ за миллион входных токенов. Среди моделей «зрения-языка» с параметрами 7B-8B она находится в рамках типичного ценообразования (Qwen2 VL 7B стоит примерно $0.10–$0.20 за входные токены и $1–$2 за выходные). Стоимость выходных токенов ($2.10 за миллион) выше, чем у некоторых чистых текстовых моделей 8B (например, $0.20 за миллион выходных токенов), что отражает дополнительные накладные расходы на рассуждение. Если вы можете использовать модель меньшего размера (например, с 2B–4B параметров), затраты могут быть на 50–90% ниже, но с уменьшенными возможностями.
Вы вызываете Qwen3 VL 8B Thinking, отправляя POST-запрос на совместимую с OpenAI конечную точку OrcaRouter по адресу https://api.orcarouter.ai/v1/chat/completions. Установите параметр model в значение "qwen/qwen3-vl-8b-thinking". Включите ваш API-ключ в заголовок Authorization как "Bearer <key>". Тело запроса соответствует схеме чат-завершений OpenAI. Для мультимодального ввода структурируйте содержимое сообщения как массив объектов: один с типом "text" для текстового запроса и по одному с типом "image_url" для каждого изображения (с URL или данными в формате base64). Видео можно отправлять в виде нескольких записей image_url, представляющих кадры. Ответ следует стандартной структуре OpenAI, причем весь сгенерированный текст находится в массиве choices.
Все стандартные параметры завершения чата OpenAI поддерживаются: temperature (0–2, по умолчанию 1.0), top_p (0–1, по умолчанию 1.0), max_tokens (до 40960), стоп-последовательности, frequency_penalty, presence_penalty, logprobs и n (количество завершений). Модель не поддерживает потоковую передачу? OrcaRouter, вероятно, поддерживает потоковую передачу, если установлено streaming=true; проверьте документацию провайдера. Параметр tools (вызов функций) может поддерживаться, если базовый провайдер это включает; в настоящее время это не гарантируется. Системный промпт разрешён. Идентификаторы пользователей могут передаваться для мониторинга. Убедитесь, что вы остаётесь в пределах контекстного окна в 131072 токена, контролируя количество токенов перед отправкой.
Если вы currently используете ту же модель от другого API-провайдера (например, напрямую от Alibaba Cloud), переход на OrcaRouter прост: измените базовый URL на https://api.orcarouter.ai/v1, обновите строку модели на "qwen/qwen3-vl-8b-thinking" и замените API-ключ на ключ API OrcaRouter. Никаких других изменений в коде не требуется, поскольку OrcaRouter использует точно такой же интерфейс, совместимый с OpenAI. Обратите внимание, что использование токенов и ценообразование будут основываться на тарифах OrcaRouter (которые передаются без наценки). Возможно, вам потребуется настроить инструменты мониторинга затрат для отражения новых цен.
Потоковая передача доступна через API OrcaRouter. Установите параметр stream в true в вашем запросе. Ответ будет потоком Server-Sent Events (SSE) с дельтами сгенерированных токенов. Это полезно для отображения в реальном времени. Обратите внимание, что для варианта «Thinking» процесс размышления может вызывать более длительные задержки перед первым токеном, но потоковая передача всё равно будет отправлять инкрементальные токены по мере их генерации. Формат потока соответствует спецификации потоковой передачи OpenAI, с событиями типа "chat.completion.chunk". Каждый фрагмент содержит дельту с содержимым или ролью токена.
Qwen3 VL 8B Thinking является преемником Qwen2 VL 7B, с примерно таким же количеством параметров (8B против 7B), но улучшенной архитектурой для более длинного контекста (131K против 32K для Qwen2 VL 7B). Он также добавляет возможность "Thinking" для пошаговых рассуждений, которой не было в Qwen2 VL. Максимальная длина вывода увеличена с 2048 токенов (Qwen2 VL 7B) до 40960 токенов. Ценообразование для Qwen3 VL 8B Thinking немного выше за токен, чем для Qwen2 VL 7B (который стоит примерно $0.15 за ввод, $1.80 за вывод на миллион токенов), что отражает дополнительные возможности и больший контекст. Пользователям, обновляющимся, следует ожидать лучшей производительности на задачах сложных рассуждений.
GPT-4o mini — это флагманская мультимодальная модель от OpenAI с контекстным окном 128K. Она имеет значительно больше параметров (точное число неизвестно, но по оценкам >70B) и в целом демонстрирует более высокую точность на стандартных бенчмарках. Однако Qwen3 VL 8B Thinking существенно дешевле: стоимость GPT-4o mini составляет $0.15 за миллион входных токенов и $0.60 за миллион выходных токенов, что на самом деле ниже, чем у Qwen3 ($0.18 входные и $2.10 выходные)? Подождите, проверим: входные токены GPT-4o mini — $0.15, выходные — $0.60 — это дешевле, чем у Qwen3 VL 8B Thinking? Выходные токены действительно намного дешевле. Так что стоимость не ниже по всем параметрам. Но Qwen3 поддерживает видео и более длинные выходные данные (40960 против 16384 у GPT-4o mini). Контекстные окна схожи. Выбор зависит от требуемой точности и бюджета; Qwen3 — нишевое решение для очень длинных выходных данных и развертывания с открытым исходным кодом.
Llama 3.2 11B Vision — это мультимодальная модель с 11 миллиардами параметров, контекстным окном в 128K и максимальным выводом в 8K токенов. Qwen3 VL 8B Thinking имеет меньшее количество параметров, но гораздо больший максимальный вывод (40960 против 8000) и включает возможности рассуждения. Обе модели поддерживают ввод текста и изображений, но Llama 3.2 11B изначально не поддерживает видео. Цены Llama через провайдеров схожи: около $0.15–$0.20 за ввод и $0.60–$1.00 за вывод на миллион токенов, что делает Qwen3 более дорогим на выводе. Для задач, требующих очень длинного сгенерированного текста (например, написание отчётов на основе видео), Qwen3 подходит лучше. Для более коротких и чувствительных к стоимости задач предпочтительнее может быть Llama 3.2 11B.
Gemini 1.5 Flash — это быстрая и экономичная мультимодальная модель с контекстным окном в 1M (до 2M), поддерживающая изображения, видео и аудио. Она дешевле, чем Qwen3 VL 8B Thinking (Gemini Flash стоит $0.075 за ввод, $0.30 за вывод на миллион токенов) и быстрее. Однако Qwen3 VL 8B Thinking предлагает процесс рассуждения, который может улучшить логику в сложных визуальных задачах, и его максимальный вывод значительно больше (40K против 8K у Gemini Flash). Если ваше приложение требует пошагового рассуждения и длинных выводов, Qwen3 — лучший выбор. Для высокой пропускной способности и низкой задержки Gemini Flash обычно превосходит. Кроме того, Qwen3 может быть предпочтительнее, когда суверенитет данных требует самостоятельного размещения или независимого от провайдера развертывания.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Ввод / 1M токенов | $0.180 |
| Вывод / 1M токенов | $2.10 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/qwen/qwen3-vl-8b-thinkingОткрыть @misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking