Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
WizjaNarzędziaJSONRozumowanie
przez Qwen · 2025-10-14

Qwen3-VL 8B Thinking — mały model rozumowania wizyjno-językowego o otwartych wagach, 8B parametrów, 128k kontekstu.

Punkty końcowe:/v1/chat/completions
kont.131.1K tokenów
Maks. wyjście41K
Wejścietext + image + video
Wyjścietext
p50 TTFT5.00 s
WEJŚCIE$0.18/ 1M tokenów
WYJŚCIE$2.10/ 1M tokenów
p50 TTFT5.00 s7 d
p95 TTFT8.55 s7 d
RUCH108.8Ktokenów / 7 d

Qwen3 VL 8B Thinking to 8-miliardowy parametryczny multimodalny model językowy opracowany przez zespół Qwen w Alibaba Cloud, hostowany na OrcaRouter pod dostawcą qwen. Należy do rodziny modeli…

Czym jest Qwen3 VL 8B Thinking?

Kto powinien używać tego modelu?

Jakie modalności obsługuje?

Czym różni się wariant 'Thinking' od standardowego Qwen3 VL?

Przykłady kodu

Wywołuj z dowolnego SDK

Zgodne z OpenAI — zostań przy swoim SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Obsługiwane parametry

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Cennik

Wejście / 1M tokenów$0.180
Wyjście / 1M tokenów$2.10
WalutaUSD

Kalkulator kosztów

Tokeny / miesiąc10MM
Udział wejścia70%%
Szacunkowo / miesiąc $7.56

Szacunek na podstawie cennika

Kalkulator tokenów i kosztów

Tokeny wejściowe: 19Koszt na żądanie: $0.001053

Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.

Wydajność

p50 TTFT
5.00 s
Prędkość wyjścia
64.6 tok/s
p95 TTFT
8.55 s
Wskaźnik błędów
0%

Publiczne benchmarki

Źródło: Design Arena

Porównanie

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Wejście $/M$0.18$0.86$0.17$0.12
Wyjście $/M$2.10$3.44$1.03$0.69
Kontekst131K262K33K1.0M
Jakość4/108/108/108/10
Porównaj obok siebiePorównaj obok siebiePorównaj obok siebiePorównaj obok siebie

FAQ

Jaki jest koszt za milion tokenów dla Qwen3 VL 8B Thinking na OrcaRouter?
Tokeny wejściowe: 0,18 USD za 1 milion tokenów. Tokeny wyjściowe: 2,10 USD za 1 milion tokenów. Są to stawki dostawcy przekazane z zerową marżą.
Jaki jest rozmiar okna kontekstu i maksymalna liczba tokenów wyjściowych?
Okno kontekstu ma 131,072 tokenów. Maksymalna liczba tokenów wyjściowych to 40,960 tokenów.
Jakie są główne mocne strony tego modelu?
Obsługuje trzy rodzaje wejścia (tekst, obraz, wideo), oferuje duży kontekst i długość wyjścia, oraz zawiera zdolność myślenia (łańcuch myśli), która poprawia wydajność w złożonych zadaniach rozumowania.
Jak ten model wypada w porównaniu z Qwen2 VL 7B?
Posiada większy kontekst (131K vs 32K), większe maksymalne wyjście (40K vs 2K) oraz dodaje zdolności myślenia. Cena jest nieco wyższa, ale oferuje lepsze rozumowanie i wielomodalne zrozumienie.
Czy OrcaRouter przechowuje w pamięci podręcznej dane użytkownika podczas korzystania z tego modelu?
OrcaRouter nie informuje o żadnym mechanizmie buforowania, który przechowuje podpowiedzi lub obrazy; przetwarzanie danych odbywa się zgodnie ze standardowymi praktykami API. Szczegółowe informacje znajdują się w polityce prywatności OrcaRouter.
Jak wywołać ten model przez API zgodne z OpenAI?
Wyślij POST na https://api.orcarouter.ai/v1/chat/completions z modelem "qwen/qwen3-vl-8b-thinking" i swoim kluczem API. Użyj tablicy 'content' z wpisami 'text' i 'image_url' dla wejścia multimodalnego.
Czy model może przetwarzać wejście wideo?
Tak, wideo jest akceptowane poprzez wysyłanie wyodrębnionych klatek jako oddzielnych wpisów image_url. Model nie ma natywnego wsparcia dla kodeków wideo; działa na statycznych zestawach klatek.
Czy istnieje jakieś ograniczenie liczby obrazów na żądanie?
Nie, z wyjątkiem tego, że całkowita liczba tokenów (w tym tokenów tekstu i obrazów) musi mieścić się w limicie kontekstu wynoszącym 131,072. Nie ma oddzielnego limitu dla obrazów.
Jakich języków programowania lub bibliotek mogę użyć, aby uzyskać dostęp do tego modelu za pomocą OrcaRouter?
Dowolny język obsługujący żądania HTTP i format API OpenAI. Python z biblioteką openai, JavaScript z fetch itp. Wystarczy ustawić podstawowy URL i identyfikator modelu.
Czy wariant myślenia zawsze zwraca rozumowanie krok po kroku (chain-of-thought reasoning)?
Model wewnętrznie korzysta z rozumowania krok po kroku przed wygenerowaniem ostatecznej odpowiedzi, ale wynik, który widzisz, to kompletna odpowiedź. Nie można osobno wyodrębnić pośrednich tokenów myślowych.

Osadź tę odznakę

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50przez OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking w OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Karta modelu jako dane

GET /api/public/models/qwen/qwen3-vl-8b-thinkingOtwórz
Odczyt maszynowy:/llms.txt/llms-full.txt