Migawka z 2 września 2026 roku modelu Qwen3.8 Max, flagowego multimodalnego modelu wnioskującego Alibaby: tekst + obraz + wideo na wejściu, tekst na wyjściu, kontekst 1M tokenów. Te same możliwości i ceny co model bazowy; przypnij go, aby uzyskać powtarzalne zachowanie.
Qwen3.8 Max (0902) to wpis modelu w OrcaRouter od dostawcy qwen, opublikowany z identyfikatorem modelu qwen/qwen3.8-max-0902. Notacja 0902 jest widoczna w zestawieniu, ale dostarczone fakty nie…
Model obsługuje okno kontekstowe o wielkości 1 000 000 tokenów. Jest to łączna ilość danych wejściowych, do których model może się odnieść w jednym żądaniu, w tym treść tekstowa, obrazowa i wideo zawarta w prompcie. W dostępnych faktach nie podano żadnych dalszych ograniczeń, więc praktyczne limity zależą od tego, jak OrcaRouter i dostawca egzekwują tokenizację oraz limity czasu żądań. W przypadku długiego tekstu 1 000 000 tokenów pozwala na umieszczenie w jednym prompcie wielu obszernych dokumentów, co zmniejsza potrzebę dzielenia na fragmenty lub streszczania przed wywołaniem modelu. W przypadku wideo fakty nie określają, ile tokenów jest zużywanych na sekundę, na klatkę ani na plik wideo, dlatego należy oszacować to na podstawie metadanych lub testowych wywołań. Należy również pamiętać, że rozmiar okna kontekstowego nie mówi nic o tym, jak dokładny jest model przy prompcie o długości 1 000 000 tokenów — nie dostarczono żadnych danych benchmarkowych. Jeśli aplikacja wymaga dokładnej oceny jakości przy długim kontekście, przed wdrożeniem produkcyjnym przetestuj model na próbce własnych dokumentów.
Ponieważ model przyjmuje tekst, obraz i wideo jako dane wejściowe, można go prosić o analizę materiału źródłowego łączącego te typy treści w jednym zapytaniu. Przykłady obejmują czytanie instrukcji w tekście, analizowanie obrazu oraz odwoływanie się do wideo podczas generowania odpowiedzi. Karta informacyjna dostawcy nie zawiera możliwości specyficznych dla zadań, takich jak OCR, wykrywanie obiektów czy czasowe rozumowanie wideo, więc takich zachowań nie należy zakładać. To, czego można oczekiwać od modelu, zależy głównie od jego wyszkolonych zdolności, które nie są udokumentowane w dostarczonych informacjach. Bezpiecznym podejściem jest używanie go do zadań, które wymagają odpowiedzi tekstowej na podstawie promptu o mieszanych modalnościach i które tolerują koszt przechowywania obrazów oraz wideo jako tokenów wejściowych. Jeśli obciążenie robocze obejmuje wyłącznie tekst, inny model bez obsługi obrazów i wideo na wejściu może być prostszym wyborem. Jeśli zadanie wymaga precyzyjnych operacji wideo z dokładnością do znacznika czasu, karta modelu nie daje dowodów na to, czy takie działanie jest niezawodne.
Wybór tańszego modelu ma sens, gdy zadanie nie wymaga funkcji, które definiują tę ofertę. Krótkie pytanie tekstowe nie potrzebuje kontekstu o 1 000 000 tokenów ani limitu wyjścia wynoszącego 131 072 tokeny. Przepływ pracy wykorzystujący wyłącznie tekst nie potrzebuje wejścia obrazu ani wideo. OrcaRouter wycenia ten model na 2,00 USD za 1 000 000 tokenów wejściowych i 6,00 USD za 1 000 000 tokenów wyjściowych. Jeśli tańsza alternatywa ma niższe ceny za token oraz odpowiednie wsparcie kontekstu i modalności, obniży koszty. W dostarczonych faktach nie ma benchmarków jakości ani szybkości, więc wybór tego modelu zamiast innych nie może być uzasadniony zmierzoną dokładnością; należy go uzasadnić wyraźnymi wymaganiami produktowymi: dużym kontekstem, mieszanym wejściem tekstowym/obrazowym/wideo lub długim wyjściem w jednej generacji. Ponieważ cena wejściowa dotyczy każdego tokena w kontekście, bardzo duże wywołania kontekstowe mogą kosztować więcej niż mniejsze wywołania, nawet gdy pytanie użytkownika jest krótkie, więc unikaj rozbudowywania promptów.
Dostarczone informacje o modelu Qwen3.8 Max (0902) nie zawierają wyników benchmarków, zestawów ewaluacyjnych ani danych dotyczących dokładności. Z tego powodu jakiekolwiek stwierdzenie o jakości modelu byłoby spekulacją, a OrcaRouter nie publikuje wywnioskowanych wyników. Jeśli potrzebujesz liczby do porównania kandydatów, przeprowadź własne testy na reprezentatywnych danych wejściowych, w tym na przypadkach obrazów i wideo, które zamierzasz wysyłać. Benchmark, taki jak publiczny test wiedzy, nie pokaże, jak dobrze model radzi sobie z konkretnym promptem wideo o długości 1 000 000 tokenów. Pamiętaj, że nazwa modelu, np. Max, to tylko etykieta, a nie dowód jakości. Mierzalnymi elementami tego zestawienia są okno kontekstowe, maksymalna długość wyjścia, modalności wejściowe i cena. Atrybuty te wpływają na to, czy dane obciążenie się zmieści, ale nie opisują dokładności, głębi rozumowania, podążania za instrukcjami ani zachowania pod względem bezpieczeństwa. Możliwości w tych obszarach traktuj jako niezweryfikowane, dopóki nie przeprowadzisz ewaluacji.
The model facts do not give tokens-per-second rates, time-to-first-token figures, request timeout guidance, or any other performance measurement. OrcaRouter does not claim a latency figure for this provider model. Speed will depend on the provider's serving infrastructure, the size of the input, and the amount of output requested. A 1,000,000-token input and a 131,072-token output are likely to take longer than a short request would, but the listing gives no exact relationship. Video input can also make latency worse because it has to be processed into tokens before the model can attend to it; the facts do not quantify that step. Reviewers should not assume that low per-token pricing implies fast decoding. The only speed-related decision supported by the facts is to test representative request sizes under your expected load. Do not infer real-time suitability from the context window size or the model name.
Podane mocne strony mają charakter strukturalny. Model ma okno kontekstowe o długości 1 000 000 tokenów, wysokie maksymalne wyjście wynoszące 131 072 tokenów oraz przyjmuje dane wejściowe w postaci tekstu, obrazu i wideo. Są one przydatne w zastosowaniach, które wymagają jednego wywołania modelu w celu obserwacji dużego lub mieszanego materiału przed napisaniem długiej odpowiedzi. Ograniczenia również łatwiej jest sformułować na podstawie faktów niż mocne strony. Nie opublikowano żadnych benchmarków jakości, więc dokładność, rozumowanie i bezpieczeństwo są nieudokumentowane. Brak jest osobnego wykazu danych treningowych, notatek wydania ani metodologii aktualizacji stojącej za etykietą 0902. Dane wejściowe w postaci obrazu i wideo nie gwarantują dokładnego zrozumienia wizualnego ani czasowego. Limity kontekstu i wyjścia są wartościami maksymalnymi, a nie zalecanym użyciem; bardzo duże wyjścia mogą być kosztowne — 6,00 USD za 1 000 000 tokenów wyjściowych. Żądanie wypełniające kontekst o długości 1 000 000 tokenów pochłonęłoby 2,00 USD na tokenach wejściowych, zanim wygenerowane zostanie jakiekolwiek wyjście, co stanowi istotny koszt operacyjny.
Wymienione ceny jednostkowe wynoszą 2,00 USD za każde 1 000 000 tokenów wejściowych i 6,00 USD za każde 1 000 000 tokenów wyjściowych. OrcaRouter rozlicza model według stawki dostawcy bez żadnej marży, więc podana cena to stawka dostawcy przekazywana dalej bez zmian. Tokeny wejściowe obejmują tokeny tekstu, obrazów i wideo wysłane w ramach promptu. Tokeny wyjściowe to tokeny wygenerowanej odpowiedzi. Przy tych stawkach 1 000 000 tokenów wejściowych kosztuje 2,00 USD, a 1 000 000 tokenów wyjściowych kosztuje 6,00 USD. Mniejsze żądanie kosztuje proporcjonalnie mniej: 100 000 tokenów wejściowych to koszt 0,20 USD, a 100 000 tokenów wyjściowych to koszt 0,60 USD, pod warunkiem że dostawca zmierzy właśnie takie ilości. Karta modelu nie zawiera odrębnych cen za dane wejściowe z pamięci podręcznej, żądania wsadowe ani poziomy interaktywne, więc nie należy zakładać, że takie ceny obowiązują. Dokładną liczbę rozliczanych tokenów należy dla każdego wywołania sprawdzić w odpowiedzi usage OrcaRouter lub w logach.
Gdy OrcaRouter mówi, że model jest rozliczany według stawki dostawcy z zerową marżą, oznacza to, że OrcaRouter nie dolicza własnej opłaty za token do stawki dostawcy dla tej pozycji. Ostateczna kwota za zużycie tokenów powinna być zatem oparta na podanych cenach $2.00 za wejście i $6.00 za wyjście na 1 000 000 tokenów. Nie musi to oznaczać, że na fakturze końcowej nie ma innych opłat; podatki lub opłaty na poziomie konta mogą mieć zastosowanie w zależności od ustaleń, ale w tych faktach nie udokumentowano żadnych takich opłat. Nie oznacza to również, że model jest darmowy w obsłudze, ponieważ stawka za token nadal obowiązuje. Porównując dostawców, cena pokazywana przez OrcaRouter dla tego modelu powinna wyrażać te same jednostki co w tej pozycji. Jeśli inna brama podaje inną cenę, różnica wynika ze struktury rozliczeń, a nie ze zmiany okna kontekstowego modelu.
Zarządzanie kosztami powinno zaczynać się od długości promptu. Ponieważ koszt wejścia wynosi 2,00 USD za 1 000 000 tokenów, każdy dodatkowy token zwiększa opłatę wejściową, a każdy obraz lub wideo wysłane w żądaniu jest przekształcane w tokeny według zasad niepodanych w tym zestawieniu. Przycinanie nieistotnego materiału źródłowego może obniżyć koszty. Wyjście jest trzykrotnością ceny jednostkowej wejścia, więc ograniczenie żądanej długości wyjścia również kontroluje koszty. Model z limitem 131 072 tokenów wyjściowych może generować odpowiedzi, które kosztują; przy cenie 6,00 USD za 1 000 000 tokenów wygenerowanie 131 072 tokenów wyjściowych kosztowałoby około 0,79 USD wyłącznie w tokenach wyjściowych. Wygenerowanie tak wielu tokenów nie jest automatyczne, ponieważ prompt kontroluje rozmiar odpowiedzi. Brak opublikowanej ceny cache dla tego modelu oznacza, że nie należy zakładać, że powtarzający się kontekst jest objęty zniżką. Brak cen cache lub przetwarzania wsadowego w faktach nie jest dowodem na to, że takie opcje nie istnieją; oznacza to po prostu, że nie są częścią tego zestawienia.
Qwen3.8 Max (0902) jest wystawiany przez kompatybilne z OpenAI API OrcaRouter. Ustaw bazowy adres URL klienta na https://api.orcarouter.ai/v1 i użyj dokładnego identyfikatora modelu qwen/qwen3.8-max-0902. W przypadku SDK kompatybilnego z OpenAI struktura żądania jest zasadniczo taka sama jak w każdym wywołaniu chat-completions: należy przekazać klucz API OrcaRouter, powyższy bazowy adres URL oraz identyfikator modelu w treści żądania. Nie używaj ogólnych nazw, takich jak Qwen3.8 Max czy qwen3.8; wpis na liście wymaga qwen/qwen3.8-max-0902. Tego samego identyfikatora modelu należy używać w bezpośrednich żądaniach HTTP kierowanych do bazowego adresu URL, gdzie ścieżka i payload są zgodne z kontraktem kompatybilnym z OpenAI wystawianym przez OrcaRouter. Ponieważ interfejs jest kompatybilny z OpenAI, istniejący kod napisany dla chat completions OpenAI można zwykle przenieść, zmieniając parametry base_url i model, choć szczegóły uwierzytelniania muszą odpowiadać wymaganiom OrcaRouter.
W przypadku uzupełniania czatu zgodnego z OpenAI, parametry takie jak model, wiadomości i limit tokenów wyjściowych są obsługiwane jak w innych kompatybilnych modelach. Fakty podają maksymalną liczbę tokenów wyjściowych równą 131 072, więc jeśli ustawisz limit wyjściowy, nie powinien on przekraczać 131 072; domyślny limit wyjściowy nie jest podany w faktach. Temperatura, top-p, stop i inne parametry próbkowania nie są udokumentowane w dostarczonych faktach modelu, więc postępuj zgodnie z dokumentacją API OrcaRouter i standardową semantyką parametrów OpenAI. Dla wejścia obrazów i wideo użyj multimodalnego formatu treści oczekiwanego przez API OrcaRouter; fakty nie podają przykładu. Jeśli API zwróci błąd dotyczący nieobsługiwanych nazw parametrów, sprawdź, czy Twój SDK nie wysyła starszych parametrów. Okno kontekstu wynosi 1 000 000 tokenów, więc prompt musi utrzymywać wszystkie tokeny wejściowe, w tym tokeny obrazów i wideo, poniżej tego limitu. Odpowiedzi są liczone osobno do maksimum 131 072 tokenów.
Ponieważ OrcaRouter oferuje API zgodne z OpenAI pod adresem https://api.orcarouter.ai/v1, migracja to w większości zmiana konfiguracji. Zastąp bazowy URL adresem https://api.orcarouter.ai/v1, zastąp pole klucza API kluczem OrcaRouter i ustaw model na qwen/qwen3.8-max-0902. Jeśli Twój kod używa biblioteki klienckiej zgodnej z OpenAI, zaktualizuj base_url i api_key klienta, a większość struktur wiadomości pozostaw nietkniętą, zakładając, że format multimodalny odpowiada temu modelowi. Fakty nie mówią, czy ten model obsługuje każdy parametr specyficzny dla OpenAI, więc przed migracją przejrzyj parametry wysyłane przez Twoją aplikację. Ponadto, ponieważ limit kontekstu wynosi 1 000 000, a maksymalny wynik to 131 072, dostosuj logikę obcinania żądań do tych limitów. Istniejący kod, w którym na sztywno zapisano inną maksymalną długość kontekstu, może wymagać aktualizacji. Na koniec potwierdź, że oczekiwania Twojej aplikacji dotyczące przetwarzania danych są zgodne z warunkami OrcaRouter, ponieważ same fakty o modelu nie omawiają przechowywania danych.
Główną podstawą porównania jest kontrakt wejściowy. Qwen3.8 Max (0902) akceptuje tekst, obraz i wideo, więc alternatywa obsługująca wyłącznie tekst wyeliminowałaby te modalności. Jeśli rzeczywiste obciążenie zawiera wyłącznie tekst, model tekstowy z odpowiednio dużym kontekstem jest prawdopodobnie bardziej trafnym wyborem i może mieć inne cenniki. Fakty dotyczące modelu nie obejmują porównań dokładności ani szybkości z innymi modelami, więc nie można dokonać wyboru na podstawie publicznych wskaźników jakości. Można porównać cechy strukturalne: alternatywa tekstowa może mieć mniejszy kontekst, krótszy limit danych wyjściowych lub niższą cenę wejścia. OrcaRouter wycenia ten model na 2,00 USD za wejście i 6,00 USD za wyjście na 1 000 000 tokenów. Fakt, że model obsługuje obraz i wideo na wejściu, jest użyteczny tylko wtedy, gdy te dane wejściowe są wykorzystywane. Jeśli nie są wykorzystywane, możesz płacić za zdolności multimodalne, które są nieistotne dla zadania.
Wybierz Qwen3.8 Max (0902), gdy profil zadania pasuje do wymienionych funkcji. Po pierwsze, potrzebujesz kontekstu o długości 1 000 000 tokenów, ponieważ materiału źródłowego nie można skrócić, aby zmieścił się w mniejszym oknie. Po drugie, potrzebujesz wejścia obrazu i wideo w tym samym prompcie albo spodziewasz się tych modalności w przyszłych żądaniach. Po trzecie, chcesz maksymalnego wyjścia do 131 072 tokenów. Jeśli Twoje obciążenie nie spełnia żadnego z tych wymagań, wiele korzyści z tego wpisu pozostanie niewykorzystanych. Nie wybieraj go tylko dlatego, że nazwa Max brzmi mocno; wpis nie zawiera żadnych dowodów z benchmarków. Ponieważ OrcaRouter udostępnia modele przez to samo API zgodne z OpenAI, podmiana identyfikatorów modeli jest łatwa, więc możesz przetestować ten model z innym kandydatem na własnym zadaniu. Pamiętaj tylko, że ceny wejścia i wyjścia różnią się, a dla tego modelu nie określono cenowania pamięci podręcznej.
Porównując koszty, najpierw sprowadź je do wspólnej podstawy tokenów. Model ten kosztuje 2,00 USD za 1 000 000 tokenów wejściowych i 6,00 USD za 1 000 000 tokenów wyjściowych, przy czym ceny te są przekazywane wprost od dostawcy, bez marży. Konkurencyjny model z niższą ceną za token wejściowy może w praktyce okazać się tańszy w przypadku żądania wykorzystującego pełny kontekst, ale należy również uwzględnić okno kontekstu i maksymalną długość odpowiedzi. Na przykład żądanie obejmujące 1 000 000 tokenów może w jednym wywołaniu wykorzystać pełny kontekst tego modelu; model z kontekstem 200 000 tokenów wymagałby wielu wywołań, a dodatkowe przebiegi generowania odpowiedzi lub podsumowań mogą zmienić całkowity koszt. Dostarczone dane nie zawierają obiektywnych wartości dokładności ani opóźnień, dlatego wszelkie porównania kosztu w przeliczeniu na poprawną odpowiedź muszą pochodzić z własnych testów. Sprawdź również, czy konkurencyjny model nie nakłada osobnych opłat za tokeny obrazów lub wideo, ponieważ nie zostały one tutaj opisane. W razie wątpliwości uruchom typowe obciążenie na OrcaRouter i porównaj zmierzone zużycie tokenów oraz jakość odpowiedzi, zamiast polegać wyłącznie na cenach katalogowych.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Wejście / 1M tokenów | $2.00 |
| Wyjście / 1M tokenów | $6.00 |
| Odczyt cache / 1M | $0.250 |
| Zapis cache / 1M | $2.50 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
O czym mówią programiści w tym tygodniu
GET /api/public/models/qwen/qwen3.8-max-0902Otwórz @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902