Una scheda titolo per l'articolo 'Qwen3.8-27B VRAM Requirements' che mostra un chip GPU con un'etichetta di memoria di circa 17 GB e badge di quantizzazione per Q4_K_M, Q6_K e Q8_0.
Guides & Insights

Requisiti di VRAM di Qwen3.8-27B: Di quanto hardware avrai davvero bisogno

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Intorno a 17 GB di VRAM è il numero che circola per Qwen3.8-27B — Daniel Han di Unsloth ha detto che {{1}}"dovrebbe stare in circa 17 GB di VRAM al rilascio"{{/1}} — e vale la pena essere precisi su cosa questo significhi e cosa no. È una proiezione basata sul predecessore del 27B, non una specifica di Alibaba, perché il modello non è ancora stato pubblicato; il repository ufficiale era stato promesso per {{2}}la settimana del 10 agosto 2026{{/2}} e non era ancora apparso al momento della stesura. Questo articolo suddivide la questione della VRAM in ciò su cui puoi fare affidamento, ciò che è davvero incerto e come il numero varia con la quantizzazione, la finestra di contesto e il runtime.

Prima la risposta onesta

Non esiste ancora una specifica hardware ufficiale per Qwen3.8-27B. Tutto ciò che segue è estrapolato da Qwen3.6-27B, il modello a cui il 27B subentra — stesso numero di parametri, stessa probabile architettura ibrida, e la cosa più vicina a un riferimento di dimensionamento. Tratta questi numeri come un margine di pianificazione, non come un foglio di requisiti. Le prime misurazioni reali arriveranno da quantizzatori e manutentori dei framework di inferenza entro pochi giorni dal rilascio dei pesi, e sono quelli i valori a cui vincolare il tuo acquisto.

La scala quant

La quantità di VRAM di cui hai bisogno dipende quasi interamente dalla quantizzazione che esegui. Partendo dalla tabella Qwen3.6-27B misurata dalla community:

• Q4_K_M — circa 16 GB di VRAM. Il punto ideale per le schede da 24 GB, e probabile origine di quel valore "17 GB". L'impostazione predefinita della maggior parte dei team.

• Q3_K_M / IQ3 — circa 13 GB di VRAM. Si adatta a schede da 16 GB e persino da 12 GB, con un evidente calo di qualità.

• Q6_K — circa 21 GB di VRAM. Quasi senza perdite, e un adattamento stretto ma reale su una scheda da 24 GB.

• Q8_0 — circa 27–30 GB di VRAM. Per schede da 48 GB dove vuoi l'ultima goccia di qualità.

• Serving FP8 — circa 27 GB di VRAM per i pesi, motivo per cui una singola L40S è la scelta comune come GPU di inferenza.

• Piena precisione (BF16) — circa 54 GB di VRAM. Realisticamente una scheda di classe H100, e il territorio in cui la gente smette di chiamarla "locale".

La versione breve: una GPU da 24 GB è l'acquisto sicuro per questo modello, una scheda da 16 GB può farlo girare solo se accetti i quants bassi, e qualsiasi cosa con 8 GB o meno è fuori gioco a meno che il modello non si riveli drasticamente più leggero del suo predecessore.

An infographic titled 'Qwen3.8-27B - the quant ladder' listing six quantization tiers with VRAM figures: Q3_K_M ~13 GB, Q4_K_M ~16 GB, Q6_K ~21 GB, Q8_0 ~27-30 GB, FP8 serving ~27 GB, BF16 full ~54 GB, with the Q4_K_M row highlighted as the sweet spot for 24 GB cards.

La variabile che nessuno cita: lunghezza del contesto

Ogni numero sopra si riferisce a un contesto modesto. La VRAM scala con il contesto perché la cache KV deve risiedere insieme ai pesi. Su Qwen3.6-27B, un contesto di 2K occupava circa 11 GB, un contesto di 32K spingeva la stessa quantizzazione oltre 14 GB, e 128K più che raddoppiava l'impronta della cache. Se Qwen3.8-27B mantiene una grande finestra di contesto nativa — e la generazione Qwe​n è andata in quella direzione — pianifica qualche GB di margine in più rispetto alla dimensione della quantizzazione, oppure limita il contesto nella configurazione del runtime. Scegliere una lunghezza del contesto che in realtà non si usa è il modo più comune in cui i team finiscono per comprare una scheda più grande del necessario.

Il jolly ad architettura ibrida

Qwen3.6-27B era un modello ibrido: solo 16 dei suoi 65 layer usavano una cache KV tradizionale, mentre 48 usavano uno stato ricorrente fisso. Il risultato era una memoria KV circa quattro volte inferiore a quella di un modello denso della stessa dimensione — il che spiega in gran parte perché un 27B sembrava un modello per scheda da 24 GB, non da 48 GB. Se la Qwen3.8-27B mantiene il design ibrido (probabile, ma non confermato), i calcoli sulla lunghezza del contesto sopra diventano più favorevoli di quanto sembri. Il problema è il supporto runtime: una build di llama.cpp o vLLM che non implementa i layer ricorrenti riporterà un utilizzo di memoria molto più elevato. Controlla quali runtime hanno integrato il supporto prima di dare per scontato che le proiezioni reggano.

Quali GPU funzionano effettivamente

Concretamente, per le carte comuni:

• RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M comodamente, Q6_K se sei disposto a spremere. Questo è il pubblico di riferimento.

• RTX 3060 / 4060 Ti 16 GB — solo quants di livello IQ4 o Q3, con contesto modesto. Utilizzabile, non piacevole.

• Schede da 12 GB — Q3_K_M a qualità ridotta. Adatto per la sperimentazione, non per il serving.

• Apple Silicon — un Mac da 24 GB esegue gli stessi file Q4 via MLX o llama.cpp; i modelli base da 16 GB vanno in swap thrashing e sono di fatto fuori gioco, come accadeva con Qwen3.6-27B.

• 48 GB e oltre (A6000, L40S, configurazioni a doppia scheda) — serving Q8_0 o FP8 con margine reale.

An infographic titled 'Context vs VRAM' comparing the same Q4 quant at 2K context (~11 GB) versus 32K context (~14 GB+), with a tip box advising to cap context at what you actually use.

Oppure salta del tutto la GPU.

Se i conti dell'hardware non tornano per te, non è obbligato a farlo nemmeno il modello. OrcaRouter è un'unica API su oltre 200 modelli — inclusa la famiglia Qwe​n — e applica il prezzo di listino del fornitore senza alcun ricarico, quindi Qwen3.8-Max costa attualmente $2,00 per milione di token di input e $6,00 per milione di token di output, come sulla pagina prezzi del fornitore stesso. Il 27B stesso sarà un modello locale, ma quando i suoi pesi verranno rilasciati e si sarà guadagnato la fiducia della community, la stessa chiave instraderà verso qualsiasi provider lo ospiti — puoi sviluppare fin d'ora su questa generazione senza mai toccare il mercato dei rivenditori di GPU.

OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the NEW FEATURED badge, Vision and Tools capabilities, $2.00 per million input tokens and $6.00 per million output tokens, a p50 time-to-first-token of 4.84 seconds, a 1M-token context window, and OpenAI-compatible API code samples.

Il punto fondamentale per la questione hardware: prevedi 16 GB per un'esecuzione confortevole a 4 bit, 24 GB per essere al sicuro e per darti margine per il contesto e quantizzazioni superiori, e considera ogni cifra qui come provvisoria finché il repository non sarà pubblicato e non appariranno le prime misurazioni reali. La proiezione di "17 GB" è un numero di pianificazione ragionevole — semplicemente non è ancora un dato di fatto.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube