Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
비전도구JSON추론
제공 Qwen · 2025-10-14

Qwen3-VL 8B Thinking — 오픈 가중치 소형 비전-언어 추론 모델, 8B 파라미터, 128k 컨텍스트.

엔드포인트:/v1/chat/completions
컨텍스트131.1K 토큰
최대 출력41K
입력text + image + video
출력text
p50 TTFT5.00 s
입력$0.18/ 100만 토큰
출력$2.10/ 100만 토큰
p50 TTFT5.00 s7일
p95 TTFT8.55 s7일
트래픽108.8K토큰 / 7일

Qwen3 VL 8B Thinking은 알리바바 클라우드의 Qwen 팀이 개발하고 OrcaRouter에서 qwen 제공사로 호스팅되는 80억 매개변수 멀티모달 언어 모델입니다. 이 모델은 Qwen3 비전-언어 모델 제품군에 속하며, "Thinking" 접미사는 시각 및 텍스트 입력에 대한 향상된 추론 능력을 나타냅니다. 텍스트, 이미지, 비디오를 입력으로…

Qwen3 VL 8B Thinking이란 무엇인가요?

이 모델은 누가 사용해야 하나요?

어떤 모달리티를 지원하나요?

'Thinking' 변형은 표준 Qwen3 VL과 어떻게 다른가요?

코드 샘플

어떤 SDK에서도 호출

OpenAI 호환 — 쓰던 SDK 그대로

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

지원되는 매개변수

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

가격

입력 / 1M tokens$0.180
출력 / 1M tokens$2.10
통화USD

비용 계산기

월 토큰 수10MM
입력 비율70%%
월 예상 $7.56

정가 기준 추정치

토큰 및 비용 추정기

입력 토큰: 9요청당 비용: $0.001052

추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.

성능

p50 TTFT
5.00 s
출력 속도
64.6 tok/s
p95 TTFT
8.55 s
오류율
0%

공개 벤치마크

소스: Design Arena

비교

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
입력 $/100만$0.18$0.86$0.17$0.12
출력 $/100만$2.10$3.44$1.03$0.69
컨텍스트131K262K33K1.0M
품질4/108/108/108/10
나란히 비교나란히 비교나란히 비교나란히 비교

FAQ

OrcaRouter에서 Qwen3 VL 8B Thinking의 백만 토큰당 비용은 얼마인가요?
입력 토큰: 1백만 토큰당 $0.18. 출력 토큰: 1백만 토큰당 $2.10. 이는 공급업체의 요금으로, 마크업 없이 그대로 전달됩니다.
컨텍스트 윈도우와 최대 출력 토큰 수는 무엇인가요?
컨텍스트 창은 131,072개의 토큰입니다. 최대 출력 토큰은 40,960개의 토큰입니다.
이 모델의 주요 강점은 무엇인가요?
세 가지 입력 방식(텍스트, 이미지, 비디오)을 처리하고, 큰 컨텍스트와 출력 길이를 제공하며, 복잡한 추론 작업의 성능을 향상시키는 사고(chain-of-thought) 기능을 포함합니다.
이 모델은 Qwen2 VL 7B와 어떻게 비교되나요?
더 큰 컨텍스트(131K 대 32K), 더 큰 최대 출력(40K 대 2K)을 가지며 사고 능력이 추가되었습니다. 가격은 약간 높지만 향상된 추론 및 멀티모달 이해를 제공합니다.
OrcaRouter가 이 모델을 사용할 때 사용자 데이터를 캐시하나요?
OrcaRouter는 프롬프트나 이미지를 저장하는 캐싱 메커니즘을 보고하지 않습니다. 데이터 처리는 표준 API 관행을 따릅니다. 자세한 내용은 OrcaRouter의 개인정보 보호정책을 참조하세요.
이 모델을 OpenAI-compatible API를 통해 어떻게 호출하나요?
https://api.orcarouter.ai/v1/chat/completions로 POST 요청을 보내고, 모델 "qwen/qwen3-vl-8b-thinking"과 귀하의 API 키를 사용하십시오. 멀티모달 입력을 위해 텍스트와 image_url 항목으로 구성된 content 배열을 사용하십시오.
모델이 비디오 입력을 처리할 수 있나요?
네, 추출된 프레임을 별도의 image_url 항목으로 보내 비디오가 지원됩니다. 모델은 기본 비디오 코덱을 지원하지 않으며, 정적 프레임 세트에서 작동합니다.
요청당 이미지 개수에 제한이 있나요?
아니요, 단, 총 토큰 수(텍스트 및 이미지 토큰 포함)는 131,072 컨텍스트 제한 내에 있어야 합니다. 별도의 이미지 제한은 없습니다.
OrcaRouter를 통해 이 모델에 접근하려면 어떤 프로그래밍 언어나 라이브러리를 사용할 수 있나요?
HTTP 요청과 OpenAI API 형식을 지원하는 모든 언어. openai 라이브러리를 사용하는 Python, fetch를 사용하는 JavaScript 등. 기본 URL과 모델 ID만 설정하면 됩니다.
Does the thinking variant always return chain-of-thought reasoning?
모델은 내부적으로 최종 답변을 생성하기 전에 단계별 추론 과정을 거치지만, 사용자에게 표시되는 출력은 완성된 응답입니다. 중간 사고 토큰은 별도로 추출할 수 없습니다.

이 배지 임베드

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50OrcaRouter를 통해
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="OrcaRouter 의 Qwen: Qwen3 VL 8B Thinking" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

모델 카드를 데이터로

GET /api/public/models/qwen/qwen3-vl-8b-thinking열기
기계 판독 가능:/llms.txt/llms-full.txt