
API gratuita Qwen 3.8 27B: Non ancora — Cosa eseguire invece
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
No — al 12 agosto 2026 non esiste un'API gratuita per Qwen3.8-27B, e non esiste nemmeno una a pagamento. Il modello è stato annunciato il 3 agosto con pesi aperti promessi a Hugging Face e ModelScope per "la settimana del 10 agosto", ma l'organizzazione ufficiale Qwen non ha ancora alcun repository Qwen3.8. Finché i pesi non saranno rilasciati, nessuno può ospitare Qwen3.8-27B, quindi "gratuito" è un discorso senza senso. Ecco le tre strade per averlo gratuitamente una volta che i pesi arriveranno (e quanto costa davvero ciascuna), più i modelli che puoi eseguire gratis in locale già oggi.
Nessuna API gratuita per ora — i pesi sono la porta.
Alibaba ha annunciato la famiglia Qwen3.8 il 3 agosto 2026: il Qwen3.8-Max da 2,4 trilioni di parametri (circa 95 miliardi di parametri attivi, un contesto di 1 milione di token, al prezzo di $2 per milione di token di input e $6 per milione di token di output su Alibaba Cloud Model Studio) e il Qwen3.8-27B, denso e per singola macchina. Entrambi sono stati promessi con pesi aperti su Hugging Face e ModelScope nella stessa settimana.
Quella promessa è in ritardo di due giorni. Ho controllato Hugging Face direttamente il 12 agosto: l'organizzazione ufficiale Qwen non ha alcun repository Qwen3.8. I repository Qwen3.8-27B-GGUF, -FP8, -NVFP4A16 e -NInfer che compaiono nella ricerca dei modelli sono schede segnaposto — zero file dei pesi, download a una cifra, schede del modello che recitano letteralmente "riservato in vista del rilascio di Qwen/Qwen3.8-27B." Non trattarli come prova che il modello esista; trattali come persone che prenotano posti auto.
Due cose non puoi dare per scontate. Prima, la licenza: non ne è stata indicata alcuna per Qwen3.8-27B. I recenti pesi open di Qwen sono stati rilasciati con la licenza Tongyi Qianwen, la cui clausola sui 100 milioni di utenti attivi mensili fa scattare discussioni sulla licenza commerciale su larga scala — Apache 2.0 non è un default sicuro. Seconda, le specifiche: Alibaba non ha pubblicato alcuna tabella di benchmark, finestra di contesto o requisito hardware confermato per il 27B. Tutto ciò che oggi viene ripetuto su di esso è una proiezione.
Abbiamo trattato la checklist pre-rilascio — cosa è confermato, cosa è solo voce, cosa verificare prima di scaricare — in Qwen3.8-27B Open Weights: What We Know Before the Drop. Questo articolo è la parte che quel pezzo non ha coperto: come funzionerà realmente la "gratuità" una volta che il modello verrà pubblicato.
Dopo che i pesi calano: tre vie per la libertà, e quanto costa davvero ciascuna
"Gratis" non è mai gratis. Tutte e tre le strade che portano a un Qwen3.8-27B gratuito spostano il costo da qualche parte; la differenza è dove va a finire. Il 27B è un modello denso — ciascuno dei suoi ~27 miliardi di parametri è attivo su ogni token — quindi i costi seguenti riguardano hardware reale, non marketing.

Percorso 1: Gestiscilo tu stesso — gratis in contanti, a prezzo di hardware.
L'unico percorso in cui "free" diventa letteralmente vero dopo l'acquisto dell'hardware. Il cofondatore di Unsloth Daniel Han prevede che il 27B girerà in circa 17GB di VRAM al rilascio — un obiettivo, non una specifica definitiva. Utilizzando la scala di quantizzazione misurata di Qwen3.6-27B come riferimento: Q4_K_M si attesta intorno a 16GB, Q6_K intorno a 21GB, FP8 intorno a 27GB, e BF16 completo intorno a 54–56GB. Il minimo realistico oggi è una scheda da 24GB — RTX 3090, RTX 4090, o classe A6000 — a Q4.
Il tempismo conta: i pesi ufficiali con vLLM o SGLang di solito funzionano entro pochi giorni dal rilascio, ma le quantizzazioni GGUF e AWQ della community arrivano con una o due settimane di ritardo, quindi un approccio "pull and run" in stile Ollama non esisterà il giorno del rilascio. I costi nascosti sono l'energia, una macchina silenziosa e il tuo tempo. Il vantaggio è la privacy — nulla esce dal tuo computer — e un costo marginale pari a zero che si accumula se usi la GPU anche per altri modelli.
Percorso 2: Livelli gratuiti ospitati — gratuiti in denaro, pagati in limiti
Una volta che i pesi saranno rilasciati, aspettati una quota di valutazione da Alibaba Cloud e tier gratuiti dai soliti host serverless. Lo schema da aspettarsi è quello che Alibaba già applica per Qwen3.8-Max: una quota di 1 milione di token per i nuovi utenti, solo regione Singapore, valida 90 giorni, senza riporto — e i token di ragionamento vengono fatturati come output, quindi un modello che ragiona per impostazione predefinita può bruciare l'intera dotazione in un weekend di prototipazione. Quello che paghi davvero sono i limiti di frequenza, il blocco regionale, una data di scadenza e l'invio dei tuoi prompt a terze parti. Un tier gratuito è un trampolino di lancio per valutare il modello, non un posto dove distribuirlo.
Percorso 3: piano gratuito di OrcaRouter — previsto, non ancora attivo
Poiché la query di ricerca è letteralmente "free", saremo espliciti: OrcaRouter prevede un piano gratuito per Qwen3.8-27B una volta rilasciati i pesi. Non è ancora attivo. Non c'è alcun endpoint da chiamare, e non ho intenzione di incollare un esempio segnaposto. Lo annunceremo quando ci sarà qualcosa da annunciare. Ciò che oggi ospitiamo è Qwen3.8-Max a $2/$6 per 1M di token senza markup — e il 27B non è sulla piattaforma, perché nessuno può ancora servirlo.
Cosa puoi usare gratuitamente adesso
Se la tua esigenza è "un modello open da 27B che posso eseguire senza pagare", non devi aspettare. La risposta più onesta a parità di livello è Qwen3.6-27B, il diretto predecessore del modello che stai aspettando.

Qwen3.6-27B è Apache 2.0, un modello denso da 27,8B con contesto di 262K e input nativo di testo, immagini e video. Un GGUF Q4_K_M è di circa 16,5GB e gira a circa 25 token al secondo su una GPU consumer da 24GB (16–18 token al secondo su un M4 Max). Numeri riportati dal fornitore nella scheda del modello: SWE-Bench Verified 77.2, MMLU-Pro 86.2, AIME 2026 94.1, GPQA Diamond 87.8 e MMMU 82.9. Se Qwen3.8-27B è "un 27B," questo è il 27B che puoi davvero toccare oggi — stessa famiglia, stesso design denso, già aperto.
Nemotron 3.5 Lightning 30B A3B ha una forma diversa, anch'esso gratuito: rilasciato l'11 agosto 2026 con la licenza OpenMDW 1.1 di NVIDIA. È un modello Mixture-of-Experts con 30B totali e ~3B attivi, con architettura ibrida Mamba-2 e contesto fino a 1M — i checkpoint NVFP4 sono circa 21,6 GB e un GGUF Q4 circa 25 GB. Serve una scheda da 24GB+, perché tutti i 30 miliardi di parametri risiedono in memoria anche se solo circa 3 miliardi si attivano per token. I primi report lo collocano vicino a 45 token al secondo su una singola GPU. È pensato per il livello di esecuzione degli agenti — chiamate agli strumenti, validazione, formattazione — non per il ragionamento di frontiera. Se il tuo carico è lavoro di routine ad alto volume per agenti, può battere un 27B denso nel tuo lavoro reale.
E se ciò che vuoi oggi è specificamente un'API gratuita ospitata piuttosto che un'installazione locale, l'unico "gratuito" onesto è la quota di Qwen3.8-Max di Alibaba: 1 milione di token, regione di Singapore, 90 giorni. Non è il 27B, ed è un'allocazione di valutazione, non un servizio — usala per provare il comportamento di Qwen3.8 ora, poi passa oltre.
Quando questo consiglio è sbagliato
Se hai già una GPU da 24GB+, l'ottica "aspettare i livelli gratuiti" è sbagliata per te. Il giorno in cui i pesi verranno rilasciati, vLLM sui pesi ufficiali è il tuo livello gratuito; aspetteresti una comodità di cui non hai bisogno. Tieni duro per circa due settimane solo se vuoi specificamente la raffinata scala di quantizzazione GGUF.
Se stai prototipando sulla base di un contratto API, le quote gratuite ospitate (una volta che il 27B le avrà) possono costare meno del tuo tempo — anche con la scadenza di 90 giorni e il blocco regionale, noleggiare una GPU box per una settimana di prototipazione è di solito la strada più costosa.
Se la licenza risulta essere Tongyi Qianwen invece di Apache, "pesi gratuiti" non significherà che si è liberi di commercializzare oltre la soglia dei 100 milioni di MAU. Leggi il file LICENSE nel repository effettivo prima di costruire qualsiasi cosa su di esso — questo è il modo di gran lunga più comune in cui gli "open-weights gratuiti" si trasformano in una fattura.
E se Alibaba fa slittare ancora la data — siamo già due giorni oltre la finestra promessa — ogni settimana che passa rende Qwen3.6-27B la scelta giusta piuttosto che il ripiego.

Il risultato finale
Non esiste un'API gratuita di Qwen3.8-27B perché Qwen3.8-27B non esiste da nessuna parte. Quando i pesi verranno pubblicati, le tre opzioni gratuite sono l'auto-hosting (si paga in hardware), i livelli gratuiti ospitati (si paga con i limiti) e il livello gratuito previsto da OrcaRouter — che non è ancora attivo, e lo diremo quando lo sarà. Oggi, la cosa gratuita più vicina è Qwen3.6-27B sul proprio hardware. Aspettare non ti costa nulla tranne il 27B; eseguire il predecessore non ti costa nulla tranne una GPU che puoi mettere al lavoro su tutto il resto nel frattempo.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
