Qwen3-VL 235B-A22B Instruct — model wizyjno-językowy o otwartych wagach, 235B łącznie / 22B aktywnych parametrów, kontekst 256k, brak trybu myślenia.
Qwen3 VL 235B A22B Instruct to wariant wizyjno-językowy serii modeli Qwen3, stworzony przez Alibaba Cloud. Wykorzystuje architekturę mieszanki ekspertów (MoE) z 235 miliardami parametrów ogółem, z…
Model doskonale radzi sobie z zadaniami, w których obrazy i tekst wchodzą w interakcję. Potrafi odpowiadać na pytania dotyczące treści obrazu, szczegółowo opisywać sceny, odczytywać tekst z dokumentów lub tablic oraz wnioskować o relacjach między obiektami na zdjęciu. Obsługuje również wiele obrazów w ramach jednej konwersacji, umożliwiając analizę porównawczą lub sekwencyjne wnioskowanie. Dostrojenie instrukcji pozwala modelowi podążać za złożonymi multimodalnymi wskazówkami, takimi jak „Wyjaśnij, dlaczego ten wykres pokazuje trend” lub „Wyodrębnij wszystkie wartości liczbowe z tej tabeli”. Te zdolności wynikają z dużego szkieletu MoE i specjalistycznego treningu wizyjno-językowego.
Jako wariant Instruct, model został dostrojony do wysokiej wierności w realizacji instrukcji użytkownika zarówno w przypadku promptów tekstowych, jak i multimodalnych. Radzi sobie w wieloetapowych dialogach, w których obrazy są wprowadzane stopniowo, utrzymuje kontekst przez kilka wymian i wykonuje instrukcje formatowania (np. wyniki w formacie JSON, punkty lub krok po kroku). Działa dobrze w zadaniach wymagających przestrzegania ograniczeń, takich jak „Odpowiadaj tylko, jeśli obraz zawiera psa”. To czyni go odpowiednim do zastosowań, w których ważne jest spójne, zgodne z regułami zachowanie.
W przypadku zadań wyłącznie tekstowych bez komponentu wizualnego model 235B MoE może być przesadą; mniejsze modele gęste lub inne warianty Qwen wyłącznie tekstowe byłyby bardziej opłacalne. Podobnie, jeśli twoje obrazy są proste (np. podstawowe logo, pojedyncze obiekty) lub potrzebujesz bardzo wysokiej przepustowości przy ograniczonym budżecie, mniejszy model wizyjny, taki jak Qwen2-VL 7B, może wystarczyć. Ten model jest najbardziej uzasadniony, gdy musisz obsługiwać złożone obrazy o wysokiej rozdzielczości, dokumenty z gęstym tekstem lub zadania wymagające głębokiego rozumowania multimodalnego. Na OrcaRouter możesz łatwo porównać ceny i przełączać identyfikatory modeli.
Nie. Qwen3 VL 235B A22B Instruct to model generacji tekstu, który akceptuje tylko obrazy jako wejście. Nie generuje obrazów, dźwięku ani żadnych innych modalności. Wyjście jest zawsze tekstem (ciągiem znaków). Jeśli potrzebujesz generowania obrazów, użyłbyś osobnego modelu. Siła tego modelu leży w rozumieniu i wnioskowaniu na podstawie wejścia wizualnego. Może na przykład opisać, jak wygląda obraz, lub odpowiedzieć na pytania na jego temat, ale nie może samodzielnie tworzyć, edytować ani przekształcać obrazów.
Raportowany wynik MMLU-Pro dla tego modelu wynosi 82,3. MMLU-Pro to ulepszona wersja benchmarku Massive Multitask Language Understanding, obejmująca 57 dziedzin z zakresu STEM, nauk humanistycznych i społecznych. Wynik 82,3 wskazuje na silną ogólną wiedzę i umiejętność rozumowania w różnych tematach. Jest to pojedyncza zagregowana wartość; wydajność może się różnić w zależności od dziedziny. Wynik ten plasuje model wśród najlepszych w swojej klasie rozmiarowej, szczególnie biorąc pod uwagę architekturę MoE, która aktywuje tylko ułamek wszystkich parametrów na zapytanie.
Mocne strony obejmują wysoką dokładność w testach wielomodalnego rozumowania, silne podążanie za instrukcjami oraz efektywność kosztową w porównaniu do gęstych modeli o podobnej całkowitej liczbie parametrów. Projekt MoE pozwala skalować pojemność bez proporcjonalnego wzrostu kosztów obliczeniowych. Ograniczenia obejmują wyższy bezwzględny koszt w porównaniu do mniejszych modeli, potencjalne zwiększenie opóźnienia ze względu na dużą liczbę parametrów ogółem (mimo że tylko 22B jest aktywnych, cały model musi być załadowany do pamięci). Może również czasami halucynować drobne szczegóły na obrazach lub zawodzić w przypadku bardzo niejednoznacznych danych wizualnych. Wydajność w konkretnych zadaniach domenowych (np. obrazowanie medyczne) nie jest gwarantowana.
Szybkość wnioskowania zależy od używanego backendu sprzętowego OrcaRouter oraz bieżącego obciążenia. Jako model MoE z 235 miliardami parametrów całkowitych wymaga znacznej ilości pamięci GPU, mimo że aktywowanych jest tylko 22 miliardy parametrów na token. Powoduje to zazwyczaj wyższe opóźnienie na żądanie w porównaniu z mniejszymi modelami gęstymi (np. 7B-70B parametrów). Przepustowość jest również uzależniona od rozmiaru paczki (batch size) i długości sekwencji. W przypadku aplikacji wrażliwych na opóźnienia rozważ użycie mniejszego modelu lub optymalizację pod kątem krótszych promptów. OrcaRouter nie zapewnia konkretnych gwarancji opóźnienia, ale dąży do responsywności na poziomie produkcyjnym.
OrcaRouter pobiera dokładnie stawkę podaną przez dostawcę: 0,40 USD za 1 milion tokenów wejściowych i 1,60 USD za 1 milion tokenów wyjściowych. Nie ma żadnej dodatkowej marży. Zarówno tokeny wejściowe, jak i wyjściowe są liczone zgodnie z zasadami tokenizacji OpenAI, które mogą się nieznacznie różnić od wewnętrznego tokenizatora modelu. Obrazy są również rozliczane jako tokeny na podstawie ich wymiarów i poziomu szczegółowości, zgodnie z polityką dostawcy. Możesz oszacować koszty, mnożąc swoje przewidywane zużycie tokenów przez te stawki.
Koszt na token jest wyższy niż w przypadku mniejszych lub gęstych modeli, ale architektura MoE zapewnia większą pojemność na aktywny parametr niż gęsty model o równoważnym rozmiarze aktywnym. W przypadku złożonych zadań multimodalnych model ten może wykonać zadanie w mniejszej liczbie tokenów lub z większą dokładnością, potencjalnie zmniejszając całkowite wydatki. Jednak w przypadku prostych zadań tańszy model obniżyłby koszty. W OrcaRouter możesz przełączać modele w locie, co pozwala na używanie tego modelu tylko wtedy, gdy jest potrzebny. Nie ma żadnych minimalnych zobowiązań miesięcznych ani ukrytych opłat.
OrcaRouter nie ujawnia obecnie szczegółowych zasad buforowania dla tego modelu. Buforowanie na poziomie tokenów może być stosowane przez dostawcę bazowego, ale nie jest gwarantowane. Nie ma wzmianek o rabatach hurtowych ani cenach warstwowych; stawki są stałe za token. Dla użytkowników o dużym wolumenie może warto skontaktować się z pomocą techniczną OrcaRouter w sprawie potencjalnych indywidualnych ustaleń. Ogólnie rzecz biorąc, ceny są przejrzyste i oparte na użyciu.
Obrazy są konwertowane na liczbę tokenów na podstawie ich rozdzielczości i ustawienia szczegółowości. Dokładny wzór jest określony przez dostawcę (Qwen) i może się różnić. Zazwyczaj obrazy o wyższej rozdzielczości zużywają więcej tokenów. OrcaRouter przekazuje tokenizację dostawcy bez zmian. Możesz kontrolować koszty poprzez zmianę rozmiaru obrazów lub użycie trybu niskiej szczegółowości, jeśli model to obsługuje. Zawsze sprawdzaj dokumentację dostawcy w celu uzyskania precyzyjnego obliczenia tokenów dla obrazów. Tokeny wejściowe dla obrazów są wliczane do stawki $0.40 za milion.
Wysyłasz żądanie POST do https://api.orcarouter.ai/v1/chat/completions z JSON payload zgodnym z OpenAI. Ustaw pole model na 'qwen/qwen3-vl-235b-a22b-instruct'. Dołącz tablicę messages, w której każda wiadomość może zawierać treść tekstową i/lub obraz. W przypadku obrazów użyj standardowego formatu treści obrazu OpenAI (URL lub base64). Uwierzytelnianie odbywa się za pomocą tokena Bearer (Twój klucz API). Przykładowe parametry: temperature, max_tokens, top_p oraz sekwencje stop działają identycznie jak w API OpenAI. Dokumentacja OrcaRouter zawiera szczegółowe informacje.
Wszystkie standardowe parametry uzupełniania czatu są obsługiwane: temperature (0–2, domyślnie 1), top_p (0–1, domyślnie 1), max_tokens (liczba tokenów wyjściowych), stop (lista ciągów), presence_penalty, frequency_penalty oraz seed dla powtarzalności. Model uwzględnia również komunikaty systemowe do ustawiania zachowania. W przypadku żądań multimodalnych dołączasz część obrazu w treści wiadomości użytkownika. Nie ma udostępnionych parametrów specyficznych dla modelu; API jest utrzymywane ogólne dla zachowania kompatybilności. Jeśli potrzebujesz kontrolować trasowanie MoE, jest to obsługiwane wewnętrznie.
Tak. Ponieważ OrcaRouter korzysta z formatu API OpenAI, migracja jest prosta. Zastąp istniejący podstawowy URL i identyfikator modelu punktem końcowym OrcaRouter oraz "qwen/qwen3-vl-235b-a22b-instruct". Upewnij się, że twój klucz API jest ważny i że masz wystarczające środki. Format wiadomości dla obrazów jest identyczny jak w OpenAI (używając typu zawartości 'image_url'). Może być konieczne dostosowanie szacunków liczby tokenów ze względu na inną tokenizację. Nie są wymagane żadne zmiany w logice aplikacji poza punktem końcowym i nazwą modelu.
Qwen3 VL 235B A22B Instruct i GPT-4V oba obsługują multimodalne wejścia. Kluczowe różnice: Qwen3 VL używa MoE z 22B aktywnymi parametrami, podczas gdy GPT-4V jest zastrzeżonym modelem gęstym o nieujawnionym rozmiarze. Ceny Qwen3 VL za pośrednictwem OrcaRouter wynoszą $0.40/$1.60 za milion tokenów, co jest znacząco niższe niż typowe stawki GPT-4V. Wyniki benchmarków nie są bezpośrednio porównywalne, ponieważ MMLU-Pro i inne testy używają różnych podzbiorów. GPT-4V ma szersze wsparcie ekosystemu, ale Qwen3 VL oferuje przewagę kosztową dla multimodalnych obciążeń o dużej przepustowości w OrcaRouter.
Claude 3.5 Sonnet to gęsty model od Anthropic z silnymi możliwościami przetwarzania tekstu i obrazu. Nie używa MoE, więc jego całkowita pojemność jest mniejsza niż łącznych parametrów Qwen3 VL, ale jego aktywna pojemność na wnioskowanie jest wyższa niż 22B. Ceny Claude 3.5 Sonnet są generalnie wyższe za token (około $3,00/$15,00 za milion tokenów). Qwen3 VL oferuje znacznie niższy koszt dla zadań multimodalnych. Jednak modele Claude mają większe okno kontekstowe (200K tokenów). Wybór zależy od budżetu, potrzebnej długości kontekstu i preferowanego dostawcy.
OrcaRouter prawdopodobnie oferuje inne modele Qwen, takie jak Qwen2.5 7B, Qwen2.5 72B lub warianty Qwen2-VL. Qwen3 VL 235B A22B Instruct jest największym multimodalnym modelem MoE w linii Qwen. W porównaniu do Qwen2-VL 72B ma więcej parametrów ogółem oraz architekturę MoE, co może zapewnić lepszą wydajność w złożonych zadaniach przy zachowaniu rozsądnych kosztów wnioskowania. Jest droższy za token niż mniejsze modele Qwen, ale może być opłacalny, jeśli zmniejszy potrzebę wielokrotnych wywołań lub wysokiego zużycia tokenów.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Wejście / 1M tokenów | $0.400 |
| Wyjście / 1M tokenów | $1.60 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructOtwórz @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct