Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
비전도구JSON추론
제공 Qwen · 2025-10-14

Qwen3-VL 8B Thinking — 오픈 가중치 소형 비전-언어 추론 모델, 8B 파라미터, 128k 컨텍스트.

엔드포인트:/v1/chat/completions
컨텍스트131K 토큰
최대 출력40K
입력text + image + video
출력text
p50 TTFT4.45 s
입력$0.18/ 100만 토큰
출력$2.10/ 100만 토큰
p50 TTFT4.45 s7일
p95 TTFT10.00 s7일
트래픽295.6K토큰 / 7일

Qwen3 VL 8B Thinking은 알리바바 클라우드의 Qwen 팀이 개발하고 OrcaRouter에서 qwen 제공사로 호스팅되는 80억 매개변수 멀티모달 언어 모델입니다. 이 모델은 Qwen3 비전-언어 모델 제품군에 속하며, "Thinking" 접미사는 시각 및 텍스트 입력에 대한 향상된 추론 능력을 나타냅니다. 텍스트, 이미지, 비디오를 입력으로…

Qwen3 VL 8B Thinking이란 무엇인가요?

이 모델은 누가 사용해야 하나요?

어떤 모달리티를 지원하나요?

'Thinking' 변형은 표준 Qwen3 VL과 어떻게 다른가요?

코드 샘플

어떤 SDK에서도 호출

OpenAI 호환 — 쓰던 SDK 그대로

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

지원되는 매개변수

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

가격

가격
입력 / 1M tokens$0.180
출력 / 1M tokens$2.10
통화USD

비용 계산기

월 토큰 수10MM
입력 비율70%%
월 예상 $7.56

정가 기준 추정치

토큰 및 비용 추정기

입력 토큰: 9요청당 비용: $0.001052

추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.

성능

p50 TTFT
4.45 s
출력 속도
3907 tok/s
p95 TTFT
10.00 s
오류율
0%

공개 벤치마크

소스: Design Arena

커뮤니티 화제

이번 주 개발자들의 이야기

Hacker News0 회 언급 · 7일

비교

Qwen3 VL 8B ThinkingQwen3.8 MaxQwen3.8 Max (0902)qwen/qwen3-max-preview
입력 $/100만$0.18$2.00$2.00$0.86
출력 $/100만$2.10$6.00$6.00$3.44
컨텍스트131K1.0M1.0M262K
품질4/109/109/108/10
나란히 비교나란히 비교나란히 비교나란히 비교

FAQ

OrcaRouter에서 Qwen3 VL 8B Thinking의 백만 토큰당 비용은 얼마인가요?
입력 토큰: 1백만 토큰당 $0.18. 출력 토큰: 1백만 토큰당 $2.10. 이는 공급업체의 요금으로, 마크업 없이 그대로 전달됩니다.
컨텍스트 윈도우와 최대 출력 토큰 수는 무엇인가요?
컨텍스트 창은 131,072개의 토큰입니다. 최대 출력 토큰은 40,960개의 토큰입니다.
이 모델의 주요 강점은 무엇인가요?
세 가지 입력 방식(텍스트, 이미지, 비디오)을 처리하고, 큰 컨텍스트와 출력 길이를 제공하며, 복잡한 추론 작업의 성능을 향상시키는 사고(chain-of-thought) 기능을 포함합니다.
이 모델은 Qwen2 VL 7B와 어떻게 비교되나요?
더 큰 컨텍스트(131K 대 32K), 더 큰 최대 출력(40K 대 2K)을 가지며 사고 능력이 추가되었습니다. 가격은 약간 높지만 향상된 추론 및 멀티모달 이해를 제공합니다.
OrcaRouter가 이 모델을 사용할 때 사용자 데이터를 캐시하나요?
OrcaRouter는 프롬프트나 이미지를 저장하는 캐싱 메커니즘을 보고하지 않습니다. 데이터 처리는 표준 API 관행을 따릅니다. 자세한 내용은 OrcaRouter의 개인정보 보호정책을 참조하세요.
이 모델을 OpenAI-compatible API를 통해 어떻게 호출하나요?
https://api.orcarouter.ai/v1/chat/completions로 POST 요청을 보내고, 모델 "qwen/qwen3-vl-8b-thinking"과 귀하의 API 키를 사용하십시오. 멀티모달 입력을 위해 텍스트와 image_url 항목으로 구성된 content 배열을 사용하십시오.
모델이 비디오 입력을 처리할 수 있나요?
네, 추출된 프레임을 별도의 image_url 항목으로 보내 비디오가 지원됩니다. 모델은 기본 비디오 코덱을 지원하지 않으며, 정적 프레임 세트에서 작동합니다.
요청당 이미지 개수에 제한이 있나요?
아니요, 단, 총 토큰 수(텍스트 및 이미지 토큰 포함)는 131,072 컨텍스트 제한 내에 있어야 합니다. 별도의 이미지 제한은 없습니다.
OrcaRouter를 통해 이 모델에 접근하려면 어떤 프로그래밍 언어나 라이브러리를 사용할 수 있나요?
HTTP 요청과 OpenAI API 형식을 지원하는 모든 언어. openai 라이브러리를 사용하는 Python, fetch를 사용하는 JavaScript 등. 기본 URL과 모델 ID만 설정하면 됩니다.
생각 변형이 항상 사고 사슬 추론을 반환합니까?
모델은 내부적으로 최종 답변을 생성하기 전에 단계별 추론 과정을 거치지만, 사용자에게 표시되는 출력은 완성된 응답입니다. 중간 사고 토큰은 별도로 추출할 수 없습니다.

이 배지 임베드

Qwen: Qwen3 VL 8B Thinking$0.18/M in4454ms p50OrcaRouter를 통해
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="OrcaRouter 의 Qwen: Qwen3 VL 8B Thinking" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

모델 카드를 데이터로

GET /api/public/models/qwen/qwen3-vl-8b-thinking열기
기계 판독 가능:/llms.txt/llms-full.txt