Klepsydra na pustym postumencie modelu — wagi Qwen3.8-27B nie zostały udostępnione, więc żadne darmowe API nie może istnieć.
Guides & Insights

Darmowe Qwen 3.8 27B API: Jeszcze nie — co uruchomić zamiast tego

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Nie — według stanu na 12 sierpnia 2026 r. nie ma darmowego API Qwen3.8-27B, ani płatnego. Model zapowiedziano 3 sierpnia, obiecując otwarte wagi na Hugging Face i ModelScope „w tygodniu od 10 sierpnia”, ale oficjalna organizacja Qwe​n nadal nie ma repozytorium Qwen3.8. Dopóki wagi nie zostaną udostępnione, nikt nie może hostować Qwen3.8-27B, więc „darmowość” to kwestia bezprzedmiotowa. Oto trzy drogi do darmowego dostępu, gdy wagi w końcu się pojawią (i ile każda z nich naprawdę kosztuje), a także modele, które możesz dziś uruchomić lokalnie za darmo.

Nie ma jeszcze darmowego API — wagi są bramą.

Alibaba ogłosiło rodzinę Qwen3.8 3 sierpnia 2026 roku: Qwen3.8-Max o 2,4 biliona parametrów (około 95 miliardów aktywnych parametrów, kontekst 1 miliona tokenów, wyceniony na 2 dolary za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych w Alibaba Cloud Model Studio) oraz gęsty, jednomaszynowy Qwen3.8-27B. Obie obiecano jako otwarte wagi na Hugging Face i ModelScope w tym samym tygodniu.

Ta obietnica jest już dwa dni po terminie. Sprawdziłem Hugging Face bezpośrednio 12 sierpnia: oficjalna organizacja Qwen nie ma żadnego repozytorium Qwen3.8. Repozytoria Qwen3.8-27B-GGUF, -FP8, -NVFP4A16 i -NInfer, które pojawiają się w wyszukiwarce modeli, to karty zastępcze — zero plików wag, jednocyfrowa liczba pobrań, a karty modeli dosłownie mówią „zarezerwowane przed wydaniem Qwen/Qwen3.8-27B". Nie traktuj tego jako dowodu, że model istnieje; traktuj to jak ludzi rezerwujących miejsca parkingowe.

Dwie rzeczy, których nie można zakładać. Po pierwsze, licencja: żadna nie została nazwana dla Qwen3.8-27B. Najnowsze otwarte wagi Qwen zostały wydane na licencji Tongyi Qianwen, której klauzula o 100 milionach aktywnych użytkowników miesięcznie uruchamia rozmowy o licencji komercyjnej na dużą skalę — Apache 2.0 nie jest bezpiecznym domyślnym wyborem. Po drugie, specyfikacje: Alibaba nie opublikował żadnej tabeli benchmarków, okna kontekstowego ani potwierdzonych wymagań sprzętowych dla 27B. Wszystko, co się dziś o nim powtarza, to projekcja.

Omówiliśmy listę kontrolną przed udostępnieniem — co jest potwierdzone, co jest plotką, co sprawdzić przed pobraniem — w Qwen3.8-27B Open Weights: What We Know Before the Drop. Ten artykuł jest częścią, której tamten tekst nie omówił: jak „free” będzie faktycznie działać, gdy model zostanie wydany.

Gdy opadną ciężary: trzy drogi do wolności i ile każda z nich naprawdę kosztuje

"Darmowe" nigdy nie jest darmowe. Wszystkie trzy ścieżki do darmowego Qwen3.8-27B przenoszą koszt gdzie indziej; różnica polega na tym, gdzie ląduje. 27B to model gęsty — każdy z jego ~27 miliardów parametrów jest aktywny na każdym tokenie — więc koszty poniżej dotyczą prawdziwego sprzętu, a nie marketingu.

Three routes to a free Qwen3.8-27B API after the weights drop: run it yourself, a hosted free tier, or OrcaRouter's planned free tier — and the real cost of each.

Trasa 1: Uruchom to sam — bezpłatnie w gotówce, ale wycenione w sprzęcie.

Jedyna droga, na której „darmowe” staje się dosłownie prawdą po zakupie sprzętu. Współzałożyciel Unsloth, Daniel Han, spodziewa się, że 27B będzie działać na około 17 GB VRAM w momencie premiery — to cel, a nie specyfikacja wydania. Używając zmierzonej drabiny kwantyzacji Qwen3.6-27B jako przybliżenia: Q4_K_M wypada około 16 GB, Q6_K około 21 GB, FP8 około 27 GB, a pełne BF16 około 54–56 GB. Realistyczne minimum na dziś to karta 24 GB — RTX 3090, RTX 4090 lub klasa A6000 — przy Q4.

Termin ma znaczenie: oficjalne wagi z vLLM lub SGLang zwykle działają w ciągu kilku dni od premiery, ale kwantyzacje GGUF i AWQ od społeczności są opóźnione o tydzień lub dwa, więc opcja „pobierz i uruchom” w stylu Ollamy nie pojawi się w dniu premiery. Ukryte koszty to prąd, cicha maszyna i Twój czas. Zysk to prywatność — nic nie opuszcza Twojego komputera — oraz zerowy koszt krańcowy, który narasta, jeśli używasz GPU także do innych modeli.

Trasa 2: Hostowane darmowe poziomy — darmowe w gotówce, płatne w limitach

Gdy tylko wagi się pojawią, spodziewaj się limitu ewaluacyjnego od Alibaba Cloud i darmowych warstw od zwykłych dostawców serverless. Wzorzec, którego należy się spodziewać, to ten, który Alibaba już stosuje dla Qwen3.8-Max: limit 1M tokenów dla nowych użytkowników, tylko region Singapur, ważny 90 dni, bez przenoszenia — a tokeny rozumowania są rozliczane jako wyjście, więc model, który domyślnie rozumuje, może spalić cały przydział podczas weekendowego prototypowania. To, za co naprawdę płacisz, to limity szybkości, blokada regionalna, data wygaśnięcia i przesyłanie promptów do podmiotu trzeciego. Darmowa warstwa to punkt wejścia do ewaluacji modelu, a nie miejsce jego wdrożenia.

Trasa 3: Darmowy poziom OrcaRouter — zaplanowany, nieuruchomiony

Ponieważ zapytanie wyszukiwania to dosłownie „free”, będziemy jednoznaczni: OrcaRouter planuje darmowy poziom dla Qwen3.8-27B, gdy tylko wagi zostaną wydane. Nie jest jeszcze aktywny. Nie ma żadnego endpointu do wywołania i nie zamierzam wklejać przykładu zastępczego. Ogłosimy to, gdy będzie co ogłaszać. To, co dziś hostujemy, to Qwen3.8-Max w cenie 2/6 dolarów za 1 mln tokenów bez narzutu — a 27B nie ma na platformie, ponieważ nikt nie jest w stanie go jeszcze udostępnić.

Z czego możesz teraz korzystać za darmo

Jeśli potrzebujesz „otwartego modelu klasy 27B, który mogę uruchomić bez płacenia”, nie musisz czekać. Uczciwa odpowiedź na tym samym poziomie to Qwen3.6-27B, bezpośredni poprzednik modelu, na który czekasz.

Comparison of Qwen3.6-27B and Nemotron 3.5 Lightning 30B A3B, which you can run free today, against Qwen3.8-27B, which is not yet released.

Qwen3.6-27B jest na licencji Apache 2.0, gęstym modelem 27,8B z kontekstem 262K i natywną obsługą tekstu, obrazu oraz wideo. Plik GGUF Q4_K_M waży około 16,5 GB i osiąga mniej więcej 25 tokenów na sekundę na konsumenckim GPU 24 GB (16–18 tokenów na sekundę na M4 Max). Liczby podane przez producenta w karcie modelu: SWE-Bench Verified 77,2, MMLU-Pro 86,2, AIME 2026 94,1, GPQA Diamond 87,8 i MMMU 82,9. Jeśli Qwen3.8-27B to „27B", to ten model to 27B, którego możesz dotknąć już dziś — ta sama rodzina, ta sama gęsta architektura, już otwarty.

Nemotron 3.5 Lightning 30B A3Bto inny wariant, również darmowy: wydany 11 sierpnia 2026 na licencji OpenMDW 1.1 firmy NVIDIA. To model Mixture-of-Experts o łącznie 30B parametrów, z czego aktywowanych jest ~3B, z hybrydową architekturą Mamba-2 i kontekstem do 1M — checkpointy NVFP4 mają około 21,6 GB, a Q4 GGUF około 25 GB. Wymaga karty z pamięcią 24GB+, ponieważ wszystkie 30 miliardów parametrów znajduje się w pamięci, mimo że na token aktywowanych jest tylko około 3 miliardów. Pierwsze raporty podają około 45 tokenów na sekundę na pojedynczym GPU. Jest zbudowany do warstwy wykonawczej agentów — wywoływania narzędzi, walidacji, formatowania — a nie do przełomowego rozumowania. Jeśli Twoje obciążenie to masowa, żmudna praca agentowa, może pokonać gęsty model 27B w Twoim realnym zadaniu.

A jeśli konkretnie chcesz dziś darmowego hostowanego API zamiast lokalnej instalacji, jedynym uczciwym „darmowym” jest limit Alibaba Qwen3.8-Max: 1 mln tokenów, region Singapur, 90 dni. To nie jest 27B, to przydział ewaluacyjny, a nie usługa — użyj go, aby teraz wypróbować zachowanie Qwen3.8, a potem przejdź dalej.

Kiedy ta rada jest błędna

Jeśli masz już GPU o pojemności 24 GB lub większej, to podejście „czekania na darmowe poziomy” jest dla ciebie błędne. W dniu, w którym pojawią się wagi, vLLM na oficjalnych wagach będzie twoim darmowym poziomem; czekałbyś na wygodę, której nie potrzebujesz. Wstrzymaj się około dwóch tygodni tylko wtedy, gdy konkretnie chcesz dopracowaną drabinę kwantyzacji GGUF.

Jeśli prototypujesz na podstawie kontraktu API, hostowane darmowe limity (gdy już 27B je będzie miało) mogą kosztować mniej niż Twój czas — nawet z 90-dniowym terminem ważności i blokadą regionalną, wynajęcie maszyny GPU na tydzień prototypowania jest zwykle droższą opcją.

Jeśli licencja okaże się być Tongyi Qianwen, a nie Apache, „wolne wagi” nie będą oznaczać swobody komercjalizacji powyżej progu 100 milionów MAU. Przeczytaj plik LICENSE w rzeczywistym repozytorium, zanim cokolwiek na nim zbudujesz — to najczęstszy sposób, w jaki „wolne otwarte wagi” stają się fakturą.

A jeśli Alibaba znowu przesunie termin — to już dwa dni po obiecanym terminie — każdy kolejny tydzień sprawia, że Qwen3.6-27B jest właściwym wyborem, a nie tymczasowym rozwiązaniem.

A timeline from announcement to free local run of Qwen3.8-27B.

Sedno sprawy

Nie ma darmowego API Qwen3.8-27B, ponieważ Qwen3.8-27B nie istnieje nigdzie. Gdy wagi zostaną udostępnione, trzy darmowe ścieżki to: self-hosting (płacisz sprzętem), hostowane darmowe poziomy (płacisz limitami) oraz planowany darmowy poziom OrcaRouter — który nie jest jeszcze aktywny i damy znać, gdy będzie. Dziś najbliższą darmową opcją jest Qwen3.6-27B na własnym sprzęcie. Czekanie nie kosztuje cię niczego poza brakiem 27B; uruchomienie poprzednika nie kosztuje cię niczego poza GPU, które w międzyczasie możesz wykorzystać do wszystkiego innego.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie