Una card hero che riporta il titolo Qwen3.8-27B GGUF con il sottotitolo "il quant giusto per la tua GPU", un'icona di download e chip dei file per Q4_K_M 17.1GB e UD-IQ2 9.0GB.
Guides & Insights

Qwen3.8-27B GGUF: Quale quantizzazione scaricare per la tua GPU

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Scarica il pacchetto unsloth/Qwen3.8-27B-GGUF e abbina il file alla scheda che possiedi effettivamente. Questa è l'intera risposta: una GPU da 24GB (RTX 4090 o 3090) dovrebbe scaricare Q4_K_M da 17.1GB; una GPU da 16GB dovrebbe scaricare IQ4_XS da 15.7GB (oppure Q3_K_M da 13.8GB se vuoi margine di contesto); una GPU da 12GB è limitata ai file a 2 bit, UD-IQ2_XXS da 9.0GB, ed è un compromesso da accettare consapevolmente. Qwen3.8 27B — il modello dense da 27 miliardi di parametri di Alibaba, pesi con licenza Apache 2.0 rilasciati il 13–14 agosto 2026 — gira in locale a costi insolitamente bassi perché la sua attenzione ibrida mette in cache solo 16 dei suoi 64 layer, quindi una quantizzazione a 4 bit su 24GB gestisce comodamente 32K–64K token di contesto. E il GGUF è l'unica via con costo marginale zero: nessuna API key, nessun addebito per token, nessun dato che lascia la tua macchina.

Sulle fonti: l'architettura, la finestra di contesto e la licenza sono ufficiali, dalla scheda del modello Qwen3.8 27B su Hugging Face, verificata il 15 agosto 2026. Le dimensioni GGUF provengono dai repository GGUF di unsloth e ggml-org, lo stesso giorno. Le indicazioni sulla VRAM per GPU sono la raccomandazione ufficiale di unsloth. Le stime in byte della cache KV e i valori di token al secondo sono misurati dalla community nei primi giorni dopo il rilascio, non sono specifiche del fornitore. Ogni benchmark menzionato di seguito è riportato da Ali​baba e non riprodotto in modo indipendente.

Il selettore di file, una riga per quant.

UD-IQ2_XXS — 9.0GB — l'unica soluzione comoda per una scheda da 12GB; aspettatevi una perdita di qualità visibile.

UD-Q2_K_XL — 10,7GB — schede da 12GB, con quasi nessun contesto rimasto a disposizione.

Q3_K_M — 13.8GB — schede da 16GB che vogliono margine per il contesto.

IQ4_XS — 15.7GB — schede da 16GB: la quantizzazione più grande che ci sta intera.

Q4_K_M — 17.1GB — schede da 24GB: il punto ottimale, e il file a cui questo articolo ti rimanda.

Q5_K_M — 19.8GB — 24GB, scambiando margine di contesto per un piccolo guadagno di qualità.

Q6_K — 22.9GB — entra in 24GB se lo comprimi; quasi-lossless.

Q8_0 — 29.0GB — 32GB, uno split su due schede oppure offload su CPU.

BF16 — 54,7 GB — schede server e configurazioni CPU con molta RAM; precisione di riferimento.

Due pacchetti, due dimensioni Q4_K_M: quello di unsloth è di 17.1GB; quello di ggml-org è di 19.0GB. Il pacchetto unsloth usa la quantizzazione Dynamic V3.0 (anteprima) per i suoi file UD-* ed è quello predefinito nella maggior parte delle app locali; il pacchetto ggml-org include i K-quants standard più la testa separata di previsione multi-token usata per la decodifica speculativa. Entrambe le Q4_K_M funzionano: la differenza è di poche centinaia di megabyte e del file MTP.

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

Perché questo 27B sta su schede più piccole della maggior parte

Il Qwen3.8 27B ha 64 livelli, ma solo 16 usano l'attenzione completa. Gli altri 48 usano l'attenzione lineare Gated DeltaNet, che mantiene uno stato ricorrente a dimensione fissa invece di una cache chiave-valore in crescita. La disposizione dei blocchi nella scheda del modello è 3×(Gated DeltaNet → FFN) per ogni 1×(Gated Attention → FFN) — un rapporto ibrido 3:1. L'effetto pratico: la cache KV è circa un quarto di quella necessaria a un modello denso 27B convenzionale per lo stesso contesto. Le misurazioni della community di questa settimana collocano la cache a circa 0,5 GB con contesto a 8K, 2,0 GB a 32K e 16,4 GB con la finestra nativa completa di 262K. Questo ribalta il consiglio abituale: la maggior parte del budget di VRAM va ai pesi, non al contesto, e una scheda da 24 GB può eseguire Q4_K_M con contesto da 64K a 96K senza problemi. Puoi ridurre ulteriormente la cache con il flag --cache-type-k di llama.cpp, che quantizza la cache stessa.

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

Tre insidie che ti faranno inciampare il primo giorno

Le vecchie build di llama.cpp rifiutano il file. Il GGUF registra la nuova architettura qwen35, quindi ti serve una build attuale — qualsiasi build precedente alla settimana di rilascio rifiuta di caricarlo con un errore di architettura. Prima aggiorna llama.cpp, poi scarica.

La trappola del template. Il template di chat ufficiale di Jinja avvolge ogni turno dell'assistente in un blocco think anche quando la traccia di ragionamento è vuota, il che produce blocchi annidati e cronologia troncata nelle chat multi-turno — sembra che il modello abbia dimenticato ciò che hai detto. Esegui llama.cpp con --jinja e preferisci un pacchetto che includa un chat_template.jinja corretto.

Vision richiede un file separato. Il testo funziona subito; immagini e video non fanno silenziosamente nulla a meno che non si carichi anche il proiettore mmproj, circa 0.9GB. Non è elencato nella pagina del repository GGUF di unsloth — scaricalo dal repository di base o dal pacchetto ggml-org. Se intendi inviare documenti o screenshot, aggiungi --mmproj al comando del server.

Esegui: i comandi

llama.cpp, una volta che hai una build aggiornata:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

…e aggiungi --mmproj Qwen3.8-27B-mmproj-bf16.gguf se ti serve la visione.

Ollama, se vuoi la voce in libreria: ollama pull qwen3.8:27b, poi ollama run qwen3.8:27b. LM Studio e Unsloth Desktop rilevano automaticamente il template di chat e l'offload della RAM — sono la via più semplice per un primo avvio.

Locale vs API: la vera economia

{{1}}Il GGUF è la via gratuita: costo marginale pari a zero, nessun limite di richieste, nulla lascia il tuo computer. Non è la via economica in termini assoluti — devi fornire tu la GPU da 24GB (una RTX 3090 usata o una RTX 4090 nuova, più l'elettricità), e un file a 2-bit su una scheda da 12GB è un'esperienza compromessa.{{/1}}

Il percorso API esiste perché i pesi sono sotto licenza Apache 2.0, quindi il costo marginale del servizio è vicino allo zero e chiunque può ospitarlo. Qwen3.8 27B è attivo su OrcaRouter oggi a $0.33 per milione di token di input e $2.40 per milione di output — il prezzo del fornitore applicato senza alcun ricarico — e poiché i pesi sono aperti, esiste anche un livello gratuito con limite di velocità che addebita $0 per richiesta e restituisce HTTP 429 quando si supera il limite. Un mese rappresentativo da 10 milioni di token con una quota di input del 70% costa circa $9.51 sul livello a pagamento. Se possiedi già la GPU, la soluzione locale vince sui costi; se non la possiedi, noleggiare i token conviene più che comprare una scheda per un progetto secondario.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

Quando questa raccomandazione è sbagliata

Q4_K_M su 24GB è il default, non la risposta universale. Scegli qualcos'altro quando:

Ti serve la massima qualità su un server o una workstation — Q8_0 a 29GB o BF16 a 54,7GB con offload su CPU e RAM, non un file a 4 bit.

Stai usando una scheda Blackwell RTX serie 50 — la variante NVFP4 è circa 1,5× più veloce con gli stessi 24GB di VRAM e utilizza una cache KV FP8 per un contesto più lungo. Su una 5090, NVFP4 batte qualsiasi GGUF su questo modello.

Serve il contesto completo da 262K — metti in conto una cache di circa 16GB in aggiunta ai pesi; questo porta una scheda da 24GB a Q3_K_M, oppure obbliga alla quantizzazione KV.

Fai affidamento sulla decodifica speculativa — scegli il pacchetto ggml-org, che mantiene la testa di predizione multi-token; alcune versioni quantizzate la rimuovono per risparmiare circa 0,5 GB.

Hai solo 12GB — una risposta onesta: un 27B a 2-bit è notevolmente peggiore dello stesso modello servito correttamente. Prova il piano API gratuito prima di impegnarti in una configurazione locale a 2-bit; se è abbastanza buona, il GGUF può aspettare finché l'hardware non si aggiorna.

Il risultato finale

Qwen3.8 27B è il raro 27B che sta in una scheda da 24GB senza compromessi: un download Q4_K_M da 17.1GB, una build attuale di llama.cpp e una cache KV abbastanza economica che il contesto lungo costa quasi nulla. Scarica quel file se possiedi l'hardware, ricorda che la visione richiede il mmproj separato, e aspettati la trappola del template la prima volta che una conversazione multi-turno sembra smemorata. Se non possiedi l'hardware, lo stesso modello è un'API a $0.33/$2.40 con un livello gratuito con limite di velocità, quindi non c'è motivo di eseguire un file a 2 bit di cui non sei soddisfatto. Il GGUF è il percorso gratuito; semplicemente non è più l'unico percorso.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube