Una scheda titolo hero che riporta Qwen3.8-27B con Unsloth, con il sottotitolo 'eseguilo, quantizzalo o ottimizzalo localmente', un'icona di finestra del terminale e chip che riportano 'UD-Q4_K_XL 17.9GB' e 'Studio no-config'.
Guides & Insights

Qwen3.8-27B con Unsloth: esegui, quantizza o ottimizza localmente

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Sì: Unsloth esegue Qwen3.8 27B ed è il modo più rapido per portare il nuovo modello Apache-2.0 di Alibaba sulla tua GPU. La risposta in una riga: apri Unsloth Studio, cerca "Qwen3.8 27B", scegli UD-Q4_K_XL (17.9GB) su una scheda da 24 GB e chatta in meno di un minuto. Dietro quel clic, Unsloth ha pubblicato tre cose nella stessa settimana in cui sono stati rilasciati i pesi (13–14 agosto 2026): il pacchetto unsloth/Qwen3.8-27B-GGUF basato sulla quantizzazione Unsloth Dynamic V3.0 (anteprima), il supporto completo in Unsloth Studio e Desktop e la release v0.1.800-beta con esportazione GGUF, rilevamento imatrix e miglioramenti per l'adattamento alla VRAM. Fa anche fine-tuning del modello: Unsloth dichiara un training 2× più veloce con il 70% di VRAM in meno. Qwen3.8 27B è un modello vision-linguaggio denso da 27 miliardi di parametri la cui attenzione ibrida mantiene solo 16 dei 64 layer in piena attenzione; per questo un file a 4 bit sta su schede dove la maggior parte dei modelli 27B non ci sta.

Sulle fonti: i dati del modello sono ufficiali, provenienti dalla scheda del modello Qwen3.8 27B su Hugging Face, verificati il 15 agosto 2026. Il supporto Unsloth, le dimensioni di quantizzazione, i requisiti di VRAM e i comandi di installazione provengono dalle note di rilascio e dalla documentazione di Unsloth, lo stesso giorno. Il prezzo dell'API è quello attuale del catalogo di OrcaRouter, lo stesso giorno. Le affermazioni di Unsloth "2× più veloce, 70% meno VRAM" e "di gran lunga il modello più forte per le sue dimensioni" sono dichiarazioni del fornitore, non riprodotte in modo indipendente.

Cosa significa "Qwen3.8 + Unsloth": quattro cose diverse

Unsloth è quattro cose separate, e i risultati delle ricerche per parole chiave le confondono. Sapere quale ti serve è metà della configurazione:

unsloth/Qwen3.8-27B-GGUF — i file dei pesi quantizzati su Hugging Face, 21 quantizzazioni più un proiettore per la visione. Costruito con Dynamic V3.0 (anteprima), non con il vecchio Dynamic 2.0 (annunciato il 24 aprile 2025 e precedente a questo modello). Questa è la via "scarica un file", utilizzabile da qualsiasi build di llama.cpp.

Unsloth Studio — l'app browser che installi o esegui da un Hugging Face Space. Cerca nell'hub dei modelli, clicca su un quant, chatta con gli strumenti. Nessuna configurazione manuale di template o parametri di inferenza.

Unsloth Desktop — l'app GUI locale per macOS, Windows e Linux che include Studio e training. È qui che vive il fine-tuning "2× più veloce con il 70% di VRAM in meno".

La libreria Python unsloth — from unsloth import FastLanguageModel, l'API di fine-tuning QLoRA usata in notebook e script.

Le note di rilascio di Unsloth per la v0.1.800-beta, intitolate «Release Qwen3.8 27B», affermano che Qwen3.8 27B e il Qwen3.8-2.4T-A95B da 2,4T parametri «possono ora essere eseguiti localmente in Unsloth», che il 27B «funziona con 17GB di RAM tramite Unsloth Dynamic GGUFs» e che «puoi anche fare fine-tuning di Qwen3.8 27B in Unsloth». La stessa release aggiunge le quantizzazioni NVFP4, verifica lo spazio su disco prima delle esportazioni GGUF, rileva il reale supporto di imatrix GGUF in Studio e rende l'inferenza fino al 10% più veloce su GGUF con un limite di VRAM regolabile.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

Scegli il tuo quant in base alla VRAM, non alle vibes.

La tabella di memoria di Unsloth è in RAM totale più VRAM (o memoria unificata), ed è la guida ufficiale. Un Qwen3.8 27B a 4 bit richiede 17–19GB; una RTX 4090 da 24GB, una RTX 5080, o un Mac con memoria unificata da 24GB è il minimo realistico per una configurazione a 4 bit confortevole. Le tre scelte che coprono quasi tutti:

12GB → UD-IQ2_XXS a 9.0GB — l'unico file che entra intero; aspettati una perdita di qualità visibile. Fai questa scelta consapevolmente.

16GB → UD-Q3_K_XL a 13.4GB — il miglior file a 3 bit, secondo il selettore di Unsloth.

24GB → UD-Q4_K_XL da 17,9GB — il file a 4 bit consigliato e la risposta predefinita di questo articolo.

48–64GB → UD-Q8_K_XL a 31.5GB — quasi senza perdite su una workstation o configurazione a doppia GPU.

L'intera scala, dall'elenco dei file di unsloth/Qwen3.8-27B-GGUF e dalla documentazione di Unsloth, entrambi verificati il 15 agosto 2026: UD-Q8_K_XL 31,5GB, UD-Q6_K_XL 25,9GB, UD-Q5_K_XL 20,2GB, UD-Q4_K_XL 17,9GB, UD-Q3_K_XL 13,4GB, UD-Q2_K_XL 10,7GB, UD-IQ3_XXS 11,9GB, UD-IQ2_M 10,3GB, UD-IQ2_XXS 9,0GB. Sono presenti anche i K-quant standard (Q4_K_M 17,1GB, Q8_0 29,0GB), e il pacchetto include un proiettore di visione (mmproj-BF16, 931MB) così immagini e video funzionano se lo carichi. Unsloth chiama l'intera scala "Dynamic V3.0 (preview)" — più recente della Dynamic 2.0 che vedrai in articoli più vecchi, che è stata costruita per modelli rilasciati oltre un anno prima.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

Run it with Unsloth in tre minuti.

Il percorso in un clic: su macOS o Linux, esegui `curl -fsSL https://unsloth.ai/install.sh | sh`, poi lancia `unsloth studio -p 8888` e apri http://127.0.0.1:8888. Su Windows, esegui `irm https://unsloth.ai/install.ps1 | iex`. Se vuoi evitare del tutto l'installazione, lo Studio di Unsloth è pubblicato anche come Hugging Face Space: aprilo nel browser, cerca "Qwen3.8 27B" e scegli la quantizzazione in base alla memoria che hai. Lo Studio ottimizza automaticamente i parametri di campionamento e il chat template, scarica in RAM quando la VRAM scarseggia e rileva configurazioni multi-GPU — la parte "senza configurazione" è reale, ed è il modo più veloce per eseguire il modello di questa settimana.

L'approccio file-first, se usi già llama.cpp: scarica un quant ed eseguilo direttamente. Questi sono i comandi di Unsloth, verificati rispetto alla loro documentazione:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Quei valori di campionamento sono le impostazioni della modalità di pensiero raccomandate dalla scheda del modello. Sostituisci il glob --include con *UD-Q3_K_XL* su una scheda da 16GB, e aggiungi --mmproj puntando al mmproj-BF16.gguf del pacchetto se ti serve la visione. Un'avvertenza: llama.cpp deve essere una build aggiornata — il file registra la nuova architettura qwen35, e qualsiasi versione precedente alla settimana di rilascio rifiuta di caricarlo.

Mettilo a punto con Unsloth

Il fine-tuning è dove Unsloth si guadagna la reputazione: la libreria dichiara un addestramento 2× più veloce con il 70% di VRAM in meno rispetto ai Transformers + PEFT standard, il che rende QLoRA su un 27B fattibile su una singola scheda consumer. Il punto di ingresso per il fine-tuning è il semplice unsloth/Qwen3.8-27B repository (pagina file safetensors, 28B) piuttosto che il pacchetto GGUF. Il pattern QLoRA standard di Unsloth, applicato a questo modello:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

poi un loop trl.SFTTrainer standard sul tuo dataset. Quel frammento è il pattern QLoRA standard dalla documentazione di Unsloth — le affermazioni sui benchmark di training sono di Unsloth stesso e non qualcosa che ho riprodotto — e valgono due avvertenze: i kernel di Unsloth applicano patch ai layer del trasformatore di testo, quindi pianifica di gestire l'encoder di visione separatamente, e tieni il pacchetto unsloth alla versione corrente perché questa architettura ha solo pochi giorni e i disallineamenti di versione falliscono in modo evidente.

Cosa gestisce Unsloth Studio per te

Eseguire un GGUF a mano significa camminare sul filo del rasoio per quanto riguarda dimensione del contesto, offload della RAM e chiamate agli strumenti. Studio riduce tutto questo a impostazioni predefinite: dimensiona il contesto in base alla memoria effettivamente libera, scarica i modelli di visione inattivi per liberare VRAM per chat o training, rileva configurazioni multi-GPU e collega ricerca web, esecuzione di codice e connessioni agli agenti (Claude Code, Codex, MCP) fin da subito. La versione v0.1.800-beta ha anche migliorato gli aspetti che nella pratica creano problemi: le esportazioni GGUF ora controllano lo spazio su disco prima di iniziare una lunga fusione invece di fallire a metà, Studio rileva se il GGUF che sta esportando supporta effettivamente imatrix (così non si spreca un'esecuzione), e le protezioni di memoria non riservano più memoria GPU in eccesso. Per un modello che ha tre giorni, "no-config" sta facendo un lavoro reale.

Locale gratuito vs API a pagamento: l'economia onesta

La differenza fondamentale tra Unsloth e un'API non è la qualità — è chi possiede l'hardware. Unsloth è la via gratuita: costo marginale pari a zero per token, nulla lascia la tua macchina, nessun limite di richieste e pieno controllo dei pesi. Non è gratuito in termini assoluti: fornisci tu GPU ed elettricità, e un file a 2 bit su una scheda da 12GB è un'esperienza compromessa. Qwen3.8 27B è denso e capace di elaborare la visione, quindi in 4-bit significa 17,9GB di pesi prima del contesto; la macchina è il prezzo d'ingresso.

Il percorso API esiste perché i pesi sono Apache-2.0, quindi chiunque può ospitarli a un costo marginale quasi nullo. Qwen3.8 27B è oggi nel catalogo di OrcaRouter a $0.33 per milione di token in input e $2.40 per milione in output, il modello self-hosted sulla nostra infrastruttura — nessun prezzo del fornitore da trasferire — con una finestra di contesto di 262K token e input di testo, immagini e video. Poiché i pesi sono aperti, esiste anche un livello gratuito con limite di richieste che addebita $0 per richiesta. Un mese rappresentativo di 10 milioni di token con una quota di input del 70% ammonta a circa $9.51 nel livello a pagamento. Se possiedi già una scheda da 24GB, la soluzione locale vince sul fronte dei costi; se non la possiedi, noleggiare token a quella tariffa è meglio che comprare una scheda per un progetto secondario, e il livello gratuito è il modo onesto per testare il modello prima di investire in qualsiasi hardware.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Quando Unsloth è la risposta sbagliata

Unsloth Studio e il pacchetto GGUF sono la scelta giusta per una singola macchina. Sono la scelta sbagliata quando:

Possiedi una scheda Blackwell RTX 50-series. I quantizzati unsloth/Qwen3.8-27B-NVFP4 sono circa 1,5× più veloci di BF16 nella stessa VRAM e usano una cache KV FP8 per un contesto più lungo. Questo percorso passa attraverso vLLM o SGLang, non un GGUF e non Studio.

In produzione ti serve la finestra nativa completa da 262K o l'estensione YaRN da 1M. Un modello di visione denso con contesto lungo è pesante; la regolazione del contesto di Unsloth lo eseguirà volentieri con lunghezze inferiori, ma uno stack di servizio con una gestione KV adeguata batte un'app locale.

Stai servendo molti utenti. Unsloth è un'app locale e una libreria di fine-tuning, non un server multi-tenant. Per concorrenza, autoscaling e garanzie di uptime ti serve un endpoint ospitato.

Non hai alcuna GPU. Una risposta onesta: una 27B a 2 bit su una scheda da 12 GB è notevolmente peggiore rispetto allo stesso modello servito correttamente. Usa prima il piano API gratuito; se è sufficiente, compra l'hardware quando il caso d'uso è dimostrato.

Vuoi fare fine-tuning sul lato visione. Le accelerazioni di Unsloth riguardano gli strati del trasformatore di testo; un fine-tuning multimodale completo richiede uno stack diverso.

Il risultato finale

Qwen3.8 27B con Unsloth è un problema risolto da questa settimana: installa Studio, scegli UD-Q4_K_XL per una scheda da 24GB (UD-Q3_K_XL per 16GB, UD-IQ2_XXS per 12GB), e il modello gira senza configurazione e senza costo per token. Il percorso di fine-tuning è reale e le affermazioni sulla velocità di Unsloth sono il motivo per cui QLoRA 27B è pratico su una singola scheda. Sappi che la scala di quantizzazione è Dynamic V3.0 (anteprima), non la Dynamic 2.0 che descrivono i vecchi articoli; tieni aggiornato llama.cpp; e se non possiedi l'hardware, gli stessi pesi sono un'API da $0.33/$2.40 con un livello gratuito a velocità limitata — quindi non c'è motivo di eseguire un file a 2 bit di cui non sei soddisfatto. Il locale è la via gratuita, e per la prima volta in questa classe di peso è anche la via facile.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube