Qwen3.5 122B-A10B — open-weight MoE multimodalny (tekst/obraz/wideo), 122B łącznie / 10B aktywnych parametrów, kontekst 32k (tryb wizji).
Qwen3.5-122B-A10B to duży model językowy z serii Qwen od Alibaba Cloud. Wykorzystuje architekturę mieszanki ekspertów (MoE), w której podczas każdego przejścia w przód aktywowanych jest tylko 10…
Na podstawie swojej architektury i wyniku benchmarku, Qwen3.5-122B-A10B wyróżnia się w zadaniach wymagających wieloetapowego rozumowania, korzystania z narzędzi i podążania za instrukcjami. Wynik τ²-Bench wynoszący 93,6 wskazuje na silną wydajność w benchmarku, który wymaga od modelu planowania i wykonywania sekwencji działań z użyciem narzędzi (np. kalkulatorów, wyszukiwarek, interpreterów kodu). To czyni go odpowiednim do budowania autonomicznych agentów, którzy muszą wchodzić w interakcje z systemami zewnętrznymi. Model obsługuje także dane multimodalne, więc zadania takie jak wnioskowanie wizualne, analiza dokumentów z osadzonymi obrazami czy streszczanie wideo mieszczą się w jego mocnych stronach. Ponadto duży limit wyjściowy pozwala mu generować szczegółowe wyjaśnienia, uzupełnienia kodu lub strukturyzowane dane w jednej odpowiedzi. Deweloperzy pracujący nad złożonymi chatbotami, asystentami kodowania lub narzędziami do analizy badawczej mogą uznać ten model za skuteczny.
Mimo że Qwen3.5-122B-A10B jest potężny, nie jest najbardziej opłacalnym wyborem w każdym przypadku użycia. Jeśli Twoje zadanie to prosta klasyfikacja, generowanie krótkiego tekstu lub proste pytanie i odpowiedź niewymagające wieloetapowego rozumowania ani multimodalnego zrozumienia, możesz uzyskać zadowalające wyniki przy użyciu mniejszego modelu, takiego jak Qwen-7B, lub modelu niemultimodalnego. Takie modele mogą być szybsze i tańsze w przeliczeniu na token. Ponadto, jeśli Twoje potrzeby kontekstowe są bardzo małe (np. mniej niż 1000 tokenów), względny narzut związany z użyciem modelu o 122B parametrach może nie być opłacalny. OrcaRouter oferuje gamę modeli o różnych cenach i charakterystykach wydajności. Możesz najpierw poeksperymentować z mniejszymi modelami i przejść na większy dopiero wtedy, gdy jakość będzie niewystarczająca. Dodatkowo, jeśli nie potrzebujesz limitu 65K tokenów na wyjście, model z krótszym wyjściem może być wystarczający.
Model ma okno kontekstowe wynoszące 32 768 tokenów i maksymalną długość odpowiedzi 65 536 tokenów, co pozwala mu obsługiwać rozbudowane łańcuchy rozumowania oraz długie instrukcje. Wysoki wynik τ²-Bench sugeruje, że model zachowuje spójność na przestrzeni wielu kroków i poprawnie realizuje złożone instrukcje obejmujące logikę warunkową, wywołania narzędzi oraz rozgałęzienia. W praktyce użytkownicy zgłaszają, że modele z serii Qwen3.5 są konkurencyjne wobec innych najnowocześniejszych modeli w zadaniach takich jak rozwiązywanie problemów matematycznych, generowanie kodu czy łamigłówki logiczne. Jednak, podobnie jak w przypadku wszystkich dużych modeli, wydajność może się pogorszyć, jeśli kontekst jest wypełniony nieistotnymi informacjami lub instrukcje są niejednoznaczne. Zaleca się inżynierię promptów, aby skutecznie kierować modelem. Model może również mieć trudności z bardzo długimi dokumentami (blisko limitu kontekstu), gdzie musi przywoływać szczegóły z początku.
Wejście multimodalne (tekst + obraz/wideo) umożliwia kilka praktycznych zastosowań. W analizie dokumentów model może odczytywać zarówno tekst, jak i osadzone wykresy, diagramy czy podpisy w pliku PDF lub obrazie. Na przykład może wyodrębniać dane ze skanowanej tabeli lub interpretować wykres. W odpowiadaniu na pytania wizualne model może odpowiadać na pytania dotyczące fotografii lub ilustracji. W analizie wideo może przetwarzać klatki, aby opisać sceny lub śledzić zmiany w czasie. Deweloperzy mogą tworzyć narzędzia dla dostępności (np. opisywanie obrazów dla osób niedowidzących) lub automatyzacji (np. analizowanie zrzutów ekranu interfejsu użytkownika). Ponieważ model jest dostępny przez OrcaRouter, te możliwości można zintegrować z istniejącymi aplikacjami za pomocą tych samych wywołań API, które są używane dla podpowiedzi tekstowych, po prostu dodając image_url lub video_url w treści wiadomości.
Jedynym opublikowanym benchmarkiem dla tego modelu jest τ²-Bench, w którym uzyskał wynik 93,6. τ²-Bench został zaprojektowany do oceny zdolności modelu do korzystania z narzędzi i wykonywania wieloetapowych zadań w symulowanym środowisku. Wynik 93,6 oznacza, że model jest w stanie poprawnie wykonać wysoki odsetek tych zadań. Dla kontekstu, wynik ten jest konkurencyjny w porównaniu z innymi najnowocześniejszymi modelami w ramach tego samego benchmarku. Należy jednak pamiętać, że wyniki benchmarków nie zawsze przekładają się na rzeczywistą wydajność, ponieważ zadania mogą różnić się stopniem trudności, a benchmark może nie obejmować wszystkich dziedzin. Użytkownicy powinni przeprowadzić własne oceny na swoich konkretnych zadaniach. W dostępnych informacjach nie podano wyników innych benchmarków (np. MMLU, HumanEval ani benchmarków multimodalnych), w związku z czym nie można porównać tego modelu na szerszym zestawie standardowych metryk.
Mocne strony: Model osiąga wysoki wynik w benchmarku użycia narzędzi, co sugeruje silne umiejętności rozumowania i podążania za instrukcjami. Jego multimodalne możliwości oraz duży limit wyjściowy czynią go wszechstronnym. Architektura MoE może zapewnić dobrą równowagę między wydajnością a efektywnością (przynajmniej w porównaniu z gęstym modelem o podobnej całkowitej liczbie parametrów). Ograniczenia: Model ma jedynie 32 768 tokenów kontekstu, co jest umiarkowaną wartością w porównaniu z niektórymi modelami oferującymi 100K lub więcej. Aktywowane parametry (10B) są stosunkowo niskie jak na model o takim całkowitym rozmiarze, co może ograniczać wydajność w bardzo złożonych zadaniach. Nie ma dostępnych informacji o opóźnieniach, przepustowości ani wymaganiach sprzętowych. Ponadto, ponieważ model jest nowy, ekosystem społeczności (np. skrypty do dostrajania, narzędzia do kwantyzacji) może być mniej rozwinięty niż w przypadku bardziej uznanych modeli. Użytkownicy powinni dokładnie przetestować model.
Brak dostępnych konkretnych wartości opóźnienia lub przepustowości dla tego modelu na OrcaRouter. Szybkość inferencji zależy od takich czynników jak długość wejścia, długość wyjścia, rozmiar partii (batch size) oraz bazowego sprzętu przydzielonego przez OrcaRouter. Modele MoE mogą charakteryzować się zmienną szybkością, ponieważ mechanizm routingu może aktywować różnych ekspertów dla różnych tokenów. Ogólnie rzecz biorąc, modele z 10B aktywowanych parametrów mogą generować wyniki z umiarkowaną prędkością na nowoczesnych procesorach graficznych (GPU), jednak całkowita liczba 122B parametrów w pamięci może prowadzić do wyższego zużycia pamięci i dłuższego czasu prefill. Jeśli niskie opóźnienie ma kluczowe znaczenie, warto przetestować model z typowymi dla siebie promptami. API OrcaRouter zwraca w nagłówkach odpowiedzi znaczniki czasu i metryki wydajności, które mogą pomóc w pomiarze szybkości. W przypadku aplikacji wrażliwych na opóźnienia rozważ użycie mniejszego modelu, jeśli pozwala na to zadanie.
Dostępne fakty obejmują tylko jeden benchmark: τ²-Bench. Powszechne benchmarki, takie jak MMLU (wiedza), HumanEval (kod), GSM8K (matematyka) czy multimodalne benchmarki, jak MMBench, nie są dostarczone. To utrudnia ocenę wydajności modelu w zadaniach niezwiązanych z narzędziami. Na przykład, jeśli aplikacja wymaga dokładności faktograficznej, chciałbyś poznać jego wydajność na MMLU. Podobnie w przypadku zadań multimodalnych, przydatne byłyby wyniki na benchmarku wnioskowania wizualnego. Brak tych wyników nie oznacza słabej wydajności, ale oznacza, że użytkownicy muszą przeprowadzić własne oceny. OrcaRouter może dostarczyć dodatkowe wyniki benchmarków na żądanie lub w dokumentacji. Dopóki nie będzie dostępnych więcej danych, zaleca się porównanie modelu jakościowo z innymi w twojej konkretnej dziedzinie.
Szczegóły cenowe dla Qwen3.5-122B-A10B na OrcaRouter nie są wyraźnie podane w dostępnych faktach. Zazwyczaj OrcaRouter pobiera opłaty za token zarówno za wejście, jak i wyjście, z oddzielnymi stawkami dla tokenów promptów i tokenów wygenerowanych. Dane multimodalne (obrazy/wideo) są rozliczane jako ekwiwalenty tokenów na podstawie liczby przetworzonych bloków obrazu lub klatek wideo. Niektórzy dostawcy oferują również obniżone stawki za trafienia w pamięci podręcznej, jeśli użytkownik powtarza ten sam prompt. Aby uzyskać dokładne ceny, użytkownicy powinni odwołać się do strony cenowej OrcaRouter lub skontaktować się z zespołem sprzedaży. Ponieważ model ten ma 122B parametrów ogółem i jest multimodalny, jego cena za token może być wyższa niż w przypadku mniejszych modeli lub modeli tylko tekstowych. Ważne jest, aby uwzględnić koszt tokenów za obrazy/wideo przy szacowaniu całkowitych wydatków na zadanie.
Używanie większego modelu, takiego jak Qwen3.5-122B-A10B, zazwyczaj wiąże się z wyższymi kosztami na token niż w przypadku mniejszych modeli. Jeśli jednak model dzięki swoim możliwościom potrafi rozwiązać zadanie w mniejszej liczbie kroków lub przy użyciu mniejszej liczby tokenów, całkowity koszt może być nadal konkurencyjny. Duży limit wyjściowy (65 536 tokenów) może być zarówno zaletą, jak i ryzykiem kosztowym: generowanie długich wyników może szybko akumulować koszty tokenów. Dodatkowo, dane wejściowe multimodalne zużywają więcej tokenów na prompt niż prompt tekstowy. Na przykład pojedynczy obraz o wysokiej rozdzielczości może kosztować setki tokenów. Jeśli Twoje zadanie nie wymaga pełnych możliwości modelu, możesz zaoszczędzić pieniądze, wybierając mniejszy model. OrcaRouter prawdopodobnie oferuje pulpity nawigacyjne dotyczące użycia i kontrolę kosztów, takie jak ustawienie maksymalnej liczby tokenów wyjściowych lub alerty budżetowe, które mogą pomóc w zarządzaniu wydatkami.
Dostępne fakty nie wspominają o żadnych zniżkach za buforowanie dla tego modelu w OrcaRouter. Wielu dostawców wnioskowania oferuje buforowanie promptów, gdzie powtarzający się tekst w promptach systemowych lub wiadomościach użytkownika jest tymczasowo przechowywany i rozliczany po niższej stawce. Jeśli OrcaRouter obsługuje buforowanie, mogłoby to obniżyć koszty dla aplikacji korzystających z długich, statycznych promptów (np. instrukcji systemowych, opisów postaci). Jednak bez konkretnej dokumentacji nie należy tego zakładać. Użytkownicy mogą sprawdzić nagłówki odpowiedzi API pod kątem wskaźników trafień bufora, jeśli buforowanie jest zaimplementowane. Aby zminimalizować koszty, można projektować prompty w taki sposób, aby unikać powtarzania tych samych długich prefiksów, oddzielając statyczne instrukcje od dynamicznej treści. Warto również rozważyć użycie krótszych okien kontekstowych lub pomijanie niepotrzebnych obrazów, gdy to możliwe.
Aby użyć Qwen3.5-122B-A10B, wyślij żądanie POST do punktu końcowego API OrcaRouter pod adresem https://api.orcarouter.ai/v1/chat/completions. Ustaw parametr model na "qwen/qwen3.5-122b-a10b". API jest w pełni kompatybilne z formatem uzupełniania czatu OpenAI, więc możesz używać tych samych bibliotek klienckich (np. biblioteki openai w Pythonie) zmieniając bazowy URL i klucz API. Treść żądania zawiera wiadomości (każda z rolą i treścią) oraz opcjonalnie parametry takie jak temperature, max_tokens, top_p itp. W przypadku danych multimodalnych użyj bloku treści z type: "image_url" dla obrazów lub specyficznej dla modelu obsługi wideo (prawdopodobnie za pomocą zakodowanych w base64 klatek lub URL). API zwróci odpowiedź JSON z wygenerowanym tekstem i metadanymi użycia (liczby tokenów). Dokumentacja OrcaRouter zawiera więcej szczegółów na temat obsługiwanych parametrów.
Model obsługuje standardowe parametry czatu: temperature (domyślnie zazwyczaj 0.7), top_p (domyślnie 0.9), max_tokens (do maksymalnego wyjścia modelu wynoszącego 65,536), presence_penalty, frequency_penalty oraz sekwencje stop. Limit okna kontekstu wynosi 32,768 tokenów, co obejmuje wszystkie wiadomości, obrazy i klatki wideo. Jeśli całkowita liczba tokenów przekroczy ten limit, API zwróci błąd lub obetnie dane wejściowe (w zależności od ustawień). Parametr max_tokens nie może przekroczyć 65,536. W przypadku żądań multimodalnych należy pamiętać, że obrazy i filmy dodają tokeny; dokładny współczynnik konwersji nie jest podany, ale filmy w wysokiej rozdzielczości lub długie mogą szybko wyczerpać okno kontekstu. OrcaRouter może również obsługiwać tryb strumieniowy, w którym odpowiedzi są przesyłane token po tokenie, co jest przydatne w aplikacjach czasu rzeczywistego. Sprawdź dokumentację API w celu uzyskania dodatkowych opcji, takich jak logprobs lub narzędzia.
Migracja jest prosta: zastąp swój bazowy URL na https://api.orcarouter.ai/v1, użyj identyfikatora modelu "qwen/qwen3.5-122b-a10b" i podaj swój klucz API OrcaRouter. Format żądania jest identyczny z API OpenAI do uzupełniania czatów. Na przykład w Pythonie z biblioteką openai możesz ustawić client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key'). Następnie wywołaj client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...). Jeśli Twoja aplikacja używa wywoływania funkcji lub narzędzi, zwróć uwagę, że model je obsługuje, ponieważ jest trenowany na τ²-Bench, który obejmuje korzystanie z narzędzi. Jednak dokładna składnia wywołania narzędzi może różnić się od tej z OpenAI; OrcaRouter prawdopodobnie obsługuje format OpenAI, ale przetestuj, aby to potwierdzić. W przypadku danych multimodalnych Twój istniejący kod, który wysyła image_url w wiadomościach, może działać, o ile model obsługuje ten format.
W rodzinie Qwen model ten plasuje się pomiędzy mniejszymi modelami gęstymi (np. Qwen-7B, Qwen-14B) a największymi modelami MoE (np. Qwen3.5-235B). W porównaniu do modeli gęstych, ten model MoE ma dostęp do większego zbioru parametrów, ale aktywuje tylko ich ułamek na token, co może umożliwić bardziej wyspecjalizowanych ekspertów. Może to prowadzić do lepszej wydajności w różnych zadaniach, zwłaszcza tych wymagających zróżnicowanej wiedzy. Jednak mniejsze modele gęste mogą być szybsze i tańsze w wąskich zadaniach. W porównaniu do większego Qwen3.5-235B, ten model prawdopodobnie ma niższą wydajność, ale jest bardziej efektywny. Obsługa multimodalna jest wspólną cechą generacji Qwen3.5; wcześniejsze wersje (Qwen2, Qwen1) były wyłącznie tekstowe. Użytkownicy powinni porównać wyniki benchmarków dla swoich konkretnych zadań, aby zdecydować, który model najlepiej odpowiada ich potrzebom.
Bezpośrednie porównania są trudne bez kompleksowych benchmarków. Qwen3.5-122B-A10B osiąga 93,6 w τ²-Bench, co jest mocnym wynikiem w zadaniach korzystania z narzędzi. Dla porównania, podobne wyniki w tym benchmarku dla innych modeli nie są podane, ale uznaje się to za zaawansowaną zdolność. Architektonicznie modele Llama są gęste i prostsze, podczas gdy modele Claude mają inne, zastrzeżone architektury. Qwen3.5 oferuje multimodalne wejście (obraz/wideo), które obsługuje Claude, ale Llama 3.2 i 3.1 są tylko tekstowe (z wyjątkiem niektórych wariantów wizyjnych). Rozmiar kontekstu 32K jest mniejszy niż 100K lub 200K w Claude, ale porównywalny z 128K w Llama 3.1? Nie do końca; nie wolno nam wymyślać liczb. Jeśli chodzi o kod i rozumowanie, wiele modeli jest konkurencyjnych. Zaletą tego modelu może być jego specyficzne dostrojenie do korzystania z narzędzi (wysoki wynik w τ²-Bench) oraz multimodalna wydajność MoE. Jednak Claude i Llama mają większe ekosystemy i większe wsparcie społeczności.
Niewiele modeli łączy multimodalne wejście, duże okno kontekstowe, duży limit wyjściowy i wysoki wynik τ²-Bench w jednym pakiecie. Seria Qwen3.5 została zaprojektowana jako wydajny model ogólnego przeznaczenia z silnymi umiejętnościami rozumowania i korzystania z narzędzi. Architektura MoE z łącznie 122B i 10B aktywnymi pozwala na przechowywanie dużej wiedzy, jednocześnie utrzymując koszty wnioskowania niższe niż w przypadku gęstego modelu 122B. Mimo to inne modele MoE, takie jak Mixtral 8x7B (łącznie 47B, aktywne 13B), mają inne kompromisy. Qwen3.5-122B-A10B ma znacznie większą całkowitą liczbę parametrów, ale mniej aktywnych parametrów na token (10B vs 13B). Obsługa multimodalna jest wyróżnikiem; Mixtral jest tylko tekstowy. W przestrzeni multimodalnych MoE istnieją modele takie jak Qwen-VL czy inne, ale często mają mniejsze okna kontekstowe. Ten model jest pozycjonowany jako silna opcja dla programistów, którzy potrzebują pojedynczego modelu do różnorodnych, multimodalnych i wymagających narzędzi zadań na OrcaRouter.
Wybierz Qwen3.5-122B-A10B, jeśli Twoja aplikacja wymaga zarówno multimodalnego rozumienia, jak i złożonego, wieloetapowego wnioskowania, a także potrzebujesz dużego limitu wyjścia do generowania długich odpowiedzi. Jest to również dobry wybór, jeśli budujesz systemy agentowe korzystające z narzędzi, biorąc pod uwagę jego wysoki wynik τ²-Bench. Jeśli Twoje zadanie jest wyłącznie tekstowe i nie wymaga dodatkowej pojemności, tańszy model, taki jak Llama 3.1 70B lub Qwen-14B, może wystarczyć. Jeśli potrzebujesz większego kontekstu (np. >100K tokenów), rozważ modele zaprojektowane specjalnie dla długiego kontekstu. Jeśli potrzebujesz niższego opóźnienia, lepszy może być mniejszy lub gęsty model. Ponieważ OrcaRouter oferuje wiele modeli, możesz przetestować kilka za pomocą tego samego API, aby znaleźć najlepsze dopasowanie do swoich celów kosztowych i jakościowych. Identyfikator modelu to qwen/qwen3.5-122b-a10b.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Poziom | Wejście / 1M tokenów | Wyjście / 1M tokenów |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| Poziom wybierany na podstawie liczby tokenów wejściowych każdego żądania | ||
Szacunek na podstawie cennika
Ceny progowe — ten szacunek używa stawek progu podstawowego.
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/qwen/qwen3.5-122b-a10bOtwórz @misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b