Una card di titolo per la guida al download di Qwen3.8-27B da Hugging Face, che mostra il percorso del repository Qwen/Qwen3.8-27B, un badge di licenza Apache 2.0 e i tag BF16, 55.6 GB e 18 shard safetensors.
Guides & Insights

Qwen3.8-27B su Hugging Face: il repository ufficiale, cosa contiene e come scaricarlo

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen3.8 27B è su Hugging Face all'indirizzo Qwen/Qwen3.8-27B, pubblicato dall'organizzazione Qwe​n il 14 agosto 2026 con licenza Apache 2.0. Il repository contiene 55,6 GB di safetensors BF16 distribuiti su 18 shard, oltre al tokenizer, al chat template e alla configurazione che lo accompagnano — scaricabile gratuitamente, utilizzabile liberamente in ambito commerciale e senza alcun costo per token. Due cose mettono in difficoltà gli utenti: il repository ufficiale include solo safetensors, mentre le quantizzazioni GGUF che le persone eseguono su GPU consumer si trovano in repository comunitari separati; e prima del rilascio sono apparsi repository contraffatti, quindi solo la copia dell'organizzazione Qwe​n è autentica. Questo articolo è la guida al download: cosa contiene il repository, i tre modi per scaricarlo e come verificare di aver ottenuto i pesi genuini.

I fatti in breve, verificati il 15 agosto 2026

RepoQwen/Qwen3.8-27B su Hugging Face, pubblicata dall'organizzazione Qwe​n; mirror su Qwen/Qwen3.8-27B su ModelScope.

Rilasciato — i pesi sono diventati disponibili il 14 agosto 2026; la copertura con fuso orario tra parentesi cita anche il 13 agosto, e gli articoli pre-release della settimana precedente li riportavano come in attesa.

Licenza — Apache 2.0: scarica, modifica e ridistribuisci, uso commerciale incluso.

Dimensione — 55,57 GB di safetensors distribuiti su 18 shard (2,1–3,99 GB ciascuno); la pagina del repository arrotonda il totale a 55,6 GB.

Modello — 27B parametri densi (28B se si conta l'encoder visivo), 64 layer, dimensione nascosta 5.120, vocabolario 248.320.

Attenzione — ibrido: 48 strati Gated DeltaNet (attenzione lineare) contro 16 strati Gated Attention completi, con addestramento alla predizione multi-token — è la divisione 3:1 che consente a 262.144 token di contesto nativo di girare su un 27B.

Contesto — 262.144 token nativamente, estendibile a 1.000.000 tramite lo scaling YaRN RoPE.

Input — immagine e video nativi insieme al testo; restituisce testo.

Signal — 91.917 download sul contatore mobile di 30 giorni della scheda del modello, verificato il 15 agosto 2026.

Ogni dato sopra proviene dalla pagina del modello Hugging Face, dall'albero del repository e dalla configurazione per Qwen3.8 27B, consultati il 15 agosto 2026. I punteggi benchmark indicati sulla scheda (SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3) sono riportati da Ali​baba; ad oggi nessun laboratorio indipendente li ha riprodotti.

Perché scaricarlo: la questione tra locale e API

I modelli a pesi aperti sono l'unica categoria in cui il costo marginale di eseguire un token è semplicemente il costo dell'elettricità. Nessuna licenza a pagamento, nessun prezzo per token, nessun limite di richieste e nulla esce dalla tua macchina. Qwen3.8 27B è Apache 2.0, quindi quella libertà è permanente: Ali​baba non può ritirare i pesi, rilicenziarli o farteli pagare.

Il compromesso è hardware e configurazione. I pesi completi BF16 richiedono una GPU di classe 80 GB a precisione nativa, e 55.6 GB sono un download considerevole. Se vuoi valutare il modello prima di impegnarti, la via API è più veloce: Qwen3.8 27B è servito su OrcaRouter a $0.33 per milione di token di input e $2.40 per milione di token di output di Qwe​n, passato senza ricarico — e OrcaRouter offre anche un livello gratuito con limiti di frequenza per lo stesso modello, quindi un test di fumo a costo zero non richiede alcun download. Ma l'API è una comodità, non una dipendenza — i pesi sono il prodotto, e sono gratuiti.

Cosa c'è effettivamente nel repo

Il repository non è solo pesi. È un pacchetto completo ed eseguibile: 18 shard più i file di metadati necessari a Transformers, vLLM e SGLang. Esaminandolo dall'inizio alla fine:

model-00001-of-00018.safetensors … model-00018-of-00018.safetensors — i pesi, 2,1–3,99 GB per shard, 55,57 GB in totale.

model.safetensors.index.json — mappa ogni tensor al suo shard; è ciò che un loader legge per primo.

config.json — l'architettura: 64 strati, dimensione nascosta 5.120, vocabolario 248.320 e la struttura Gated DeltaNet / Gated Attention.

tokenizer.json (12.8 MB), tokenizer_config.json, vocab.json (6.72 MB), merges.txt (3.35 MB) — il tokenizer.

chat_template.jinja — il template di chat, incluso il blocco di pensiero; llama.cpp richiede che venga passato come template jinja, altrimenti il modello ti risponde con tag di pensiero.

preprocessor_config.json e video_preprocessor_config.json — preprocessing di immagini e video.

crc32.txt — checksum per shard; verifica un download confrontandolo con questo file e un trasferimento corrotto smette di essere un mistero.

README.md (la scheda del modello da 65 kB), LICENSE (Apache 2.0), generation_config.json, .gitattributes (contrassegna i file dei pesi come Git LFS).

A repository file-table card for Qwen/Qwen3.8-27B: 18 safetensors weight shards at 2.1 to 3.99 GB each totalling 55.57 GB, plus the index, config, tokenizer files, chat template, checksum file, model card, and license with their sizes.

Una conseguenza di questo layout è rilevante per il problema del falso repository qui sotto. Una copia autentica di questo repository è pesante e completa. Un repository segnaposto con "Qwen3.8" nel nome e nient'altro che un README non è un download fallito: è un repository diverso e vuoto.

Come scaricarlo — tre modi.

Il primo metodo, huggingface-cli, è il percorso più pulito. Il modello è pubblico, quindi non è necessario il login; questo scarica tutti i 18 shard e i metadati in una cartella:

huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B

Per un trasferimento di 55,6 GB, hf_transfer è il backend che vale la pena installare — parallelizza il download e di solito riduce notevolmente i tempi:

pip install hf_transfer

HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B

Metodo due, git clone, ti dà il repository come copia di lavoro con cronologia. Richiede Git LFS:

git lfs install

git clone https://huggingface.co/Qwen/Qwen3.8-27B

Metodo tre, il browser — apri la scheda Files e scarica gli shard singolarmente. Ha senso solo quando ti serve un singolo file (ad esempio, solo config.json per ispezionare l'architettura). Per l'intero repository sono 18 download manuali più una verifica del checksum; usa una CLI.

A download-command card showing the three ways to fetch Qwen/Qwen3.8-27B: the recommended huggingface-cli download with --local-dir, the hf_transfer speed-up one-liner, and a git clone with Git LFS installed.

Quali file dovresti effettivamente scaricare

Il repository ufficiale è in safetensors BF16 — piena precisione, 55,6 GB — l'artefatto giusto se hai una GPU di classe 80 GB, o se vuoi quantizzare da solo in seguito. Non esiste un GGUF ufficiale. Le build GGUF che le persone eseguono davvero su schede consumer sono release della community: Hugging Face elenca 303 modelli quantizzati costruiti da questa base (verificato il 15 agosto 2026), e quelle a cui puntano i runbook sono le build unsloth e lmstudio-community. La scala approssimativa:

BF16 safetensors — 55.6 GB, richiede una GPU di classe 80 GB a precisione nativa.

GGUF Q8_0 — circa 29 GB, sta in una scheda da 48 GB.

GGUF Q4_K_M — circa 17 GB, la scelta standard per schede da 24 GB.

GGUF 2-bit — circa 9 GB, riesce a stare su schede da 12 GB con una perdita di qualità visibile.

Se vuoi la funzionalità di visione da una build GGUF, hai bisogno anche del file mmproj separato per il codificatore visivo, documentato in ciascuna scheda della community. Per l'analisi completa di quantizzazione e runtime — inclusa l'avvertenza sul template di chat di llama.cpp — il nostro runbook sull'esecuzione di Qwen3.8 27B in locale contiene i dettagli.

Come distinguere il vero repo da quelli falsi

Prima del rilascio dei pesi, la ricerca su Hugging Face era piena di repository "Qwen3.8" senza file di peso — card segnaposto e fork parcheggiati per intercettare chi cercava in anticipo. Alcuni sono ancora attivi. La checklist di verifica:

Controlla l'editore, non il nome. Il repository autentico si trova nell'organizzazione Qwen: Qwen/Qwen3.8-27B. Un repository chiamato Qwen3.8 27B sotto qualsiasi altro account non è la versione ufficiale, per quanto professionale possa sembrare.

Usa la collezione ufficiale. Qwen mantiene huggingface.co/collections/Qwen/qwen38; ogni repo al suo interno appartiene a loro.

Controlla il campo della licenza.La vera scheda dice Apache 2.0.

Controlla le dimensioni e la forma. Il vero repository ha 18 shard di safetensors per un totale di circa 55,6 GB, un file di checksum crc32.txt e un README da 65 kB. Zero file dei pesi significa un repository vuoto, non un download interrotto.

Considera il numero di download come un segnale, non una prova. Il repo autentico ha superato i 91.000 download in un giorno, il che ti dice dove puntano tutti gli altri. Ma anche un falso può essere scaricato; l'editore è la garanzia.

Dopo il download, verifica l'integrità: controlla il CRC32 di ogni shard rispetto a crc32.txt, oppure carica il modello con Transformers e conferma che lo state dict venga caricato senza avvisi. Questo rileva sia un trasferimento corrotto sia un modello sbagliato ricompattato.

Quando scaricare è la mossa sbagliata

Scaricare 55,6 GB non è la scelta giusta per tutti, e la versione onesta di questo articolo lo dice chiaramente.

Vuoi solo valutare il modello. La via API è più veloce — un test strutturato costa centesimi e richiede minuti, non un download e un pomeriggio di configurazione.

Non hai una GPU da circa 80 GB. Il download BF16 è l'artefatto sbagliato per te. Scegli un quant GGUF o l'API.

Ti servono benchmark verificati. Ogni cifra principale per Qwen3.8 27B è riportata da Alibaba al 15 agosto 2026. Se la tua decisione dipende da numeri che un laboratorio indipendente ha riprodotto, aspetta — i pesi saranno ancora qui.

Stai costruendo su un modello di pochi giorni. I pesi sono stati rilasciati il 14 agosto. La pagina del modello di OrcaRouter, consultata oggi, mostra un tasso di errore del 33,3% negli ultimi sette giorni e una latenza p50 del primo token di 225 ms — un modello nuovissimo sotto carico iniziale, quindi considera la telemetria iniziale come provvisoria. Chi si auto-ospita dovrebbe fissare il commit scaricato e mantenere un fallback; gli utenti API dovrebbero mantenere una regola di failover come la stessa garanzia.

The OrcaRouter model page for Qwen3.8 27B at qwen/qwen3.8-27b, showing the by-Qwen vendor label, vision-tools-JSON capability badges, a 262K-token context window, text-image-and-video input, and p50 first-token latency of 225 ms.

Vuoi un contratto di supporto. Apache 2.0 è permissiva, ma una licenza non è uno SLA. Se il tuo carico di lavoro richiede supporto del fornitore, la via dell'API ospitata è la scelta più sicura.

La conclusione

Il vero Qwen3.8 27B è su Hugging Face all'indirizzo Qwen/Qwen3.8-27B, Apache 2.0, rilasciato il 14 agosto 2026, 55,6 GB di safetensors BF16 in 18 shard. Scaricalo con huggingface-cli o git clone, verifica che l'editore sia l'organizzazione Qwen, e avrai in mano un 27B open-weights all'avanguardia che nessuno può portarti via o farti pagare. Se per il tuo caso d'uso è un impegno eccessivo, lo stesso modello è a pochi centesimi tramite API. I pesi, però, sono la cosa importante — e sono gratuiti.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube