Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
ЗрениеИнструментыJSONРассуждение
от Qwen · 2025-10-14

Qwen3-VL 8B Thinking — малая модель визуально-языкового мышления с открытыми весами, 8B параметров, контекст 128k.

Эндпоинты:/v1/chat/completions
конт.131.1K токенов
Макс. вывод41K
Вводtext + image + video
Выводtext
p50 TTFT5.00 s
ВХОД$0.18/ 1M токенов
ВЫХОД$2.10/ 1M токенов
p50 TTFT5.00 s7 д
p95 TTFT8.55 s7 д
ТРАФИК108.8Kтокенов / 7 д

Qwen3 VL 8B Thinking — это мультимодальная языковая модель с 8 миллиардами параметров, разработанная командой Qwen в Alibaba Cloud, размещенная на OrcaRouter под провайдером qwen. Она принадлежит к…

Что такое Qwen3 VL 8B Thinking?

Кому следует использовать эту модель?

Какие модальности оно поддерживает?

Вариант 'Thinking' отличается от стандартного Qwen3 VL тем, что он специально оптимизирован для моделирования цепочек рассуждений (Chain-of-Thought). Он способен более детально и пошагово объяснять свои логические выводы, особенно в сложных задачах, таких как математические вычисления, научные вопросы или многошаговое планирование. В то время как стандартный Qwen3 VL может давать конечный ответ быстрее, вариант 'Thinking' уделяет больше времени внутреннему анализу и явному отображению хода рассуждений, что повышает точность в задачах, требующих глубокого анализа.

Примеры кода

Вызов из любого SDK

Совместимо с OpenAI — оставьте свой SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Поддерживаемые параметры

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Цены

Ввод / 1M токенов$0.180
Вывод / 1M токенов$2.10
ВалютаUSD

Калькулятор стоимости

Токенов / месяц10MM
Доля ввода70%%
Оценка / месяц $7.56

Оценка по прайс-листу

Оценка токенов и стоимости

Токены ввода: 19Стоимость за запрос: $0.001053

Только оценка — фактическое число токенов зависит от токенизатора провайдера.

Производительность

p50 TTFT
5.00 s
Скорость вывода
64.6 tok/s
p95 TTFT
8.55 s
Частота ошибок
0%

Публичные тесты

Источник: Design Arena

Сравнение

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Ввод $/млн$0.18$0.86$0.17$0.12
Вывод $/млн$2.10$3.44$1.03$0.69
Контекст131K262K33K1.0M
Качество4/108/108/108/10
Сравнить бок о бокСравнить бок о бокСравнить бок о бокСравнить бок о бок

Больше от Qwen

FAQ

Какова стоимость за миллион токенов для Qwen3 VL 8B Thinking на OrcaRouter?
Входные токены: $0,18 на 1 миллион токенов. Выходные токены: $2,10 на 1 миллион токенов. Это тарифы провайдера, переданные без наценки.
Что такое контекстное окно и максимальное количество выходных токенов?
Окно контекста составляет 131,072 токена. Максимальное количество выходных токенов составляет 40,960 токенов.
Каковы основные сильные стороны этой модели?
Он обрабатывает три модальности ввода (текст, изображение, видео), предлагает большой контекст и длину вывода, а также включает способность к размышлению (chain-of-thought), которая улучшает производительность при выполнении сложных задач рассуждения.
Как эта модель сравнивается с Qwen2 VL 7B?
Он имеет более широкий контекст (131K против 32K), больший максимальный вывод (40K против 2K) и добавляет возможности рассуждения. Цена немного выше, но предлагает улучшенное логическое мышление и мультимодальное понимание.
Кэширует ли OrcaRouter какие-либо пользовательские данные при использовании этой модели?
OrcaRouter не сообщает о каком-либо механизме кэширования, который хранит подсказки или изображения; обработка данных следует стандартной практике API. Подробнее смотрите в политике конфиденциальности OrcaRouter.
Как вызвать эту модель через API, совместимый с OpenAI?
Отправьте POST-запрос на https://api.orcarouter.ai/v1/chat/completions с моделью "qwen/qwen3-vl-8b-thinking" и вашим API-ключом. Используйте массив content с записями text и image_url для мультимодального ввода.
Может ли модель обрабатывать видео ввод?
Да, видео принимается путем отправки извлеченных кадров в виде отдельных записей image_url. Модель не имеет встроенной поддержки видеокодеков; она работает с наборами статичных кадров.
Есть ли какие-либо ограничения на количество изображений на один запрос?
Нет, за исключением того, что общее количество токенов (включая текстовые и графические токены) должно находиться в пределах лимита контекста в 131,072. Отдельного лимита на изображения нет.
Какие языки программирования или библиотеки я могу использовать для доступа к этой модели через OrcaRouter?
Любой язык, который поддерживает HTTP-запросы и формат API OpenAI. Python с библиотекой openai, JavaScript с fetch и т.д. Просто укажите базовый URL и идентификатор модели.
Всегда ли вариант с размышлением возвращает цепочку рассуждений?
Модель внутренне использует пошаговое рассуждение перед генерацией финального ответа, но результат, который вы видите, — это полный ответ. Невозможно извлечь промежуточные токены размышления отдельно.

Встроить значок

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50через OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking в OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Карточка модели в виде данных

GET /api/public/models/qwen/qwen3-vl-8b-thinkingОткрыть
Машиночитаемо:/llms.txt/llms-full.txt