Une carte de titre pour le guide de téléchargement Qwen3.8-27B sur Hugging Face, montrant le chemin du dépôt Qwen/Qwen3.8-27B, un badge de licence Apache 2.0, et les étiquettes BF16, 55,6 Go et 18 shards safetensors.
Guides & Insights

Qwen3.8-27B sur Hugging Face : le dépôt officiel, ce qu'il contient, et comment le télécharger

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Qwen3.8 27B est sur Hugging Face à Qwen/Qwen3.8-27B, publié par l'organisation Qwe​n le 14 août 2026 sous licence Apache 2.0. Le dépôt contient 55,6 Go de safetensors BF16 répartis sur 18 shards, ainsi que le tokenizer, le chat template et la config qui vont avec — téléchargement gratuit, utilisation commerciale gratuite, et aucun frais par jeton. Deux choses piègent les utilisateurs : le dépôt officiel ne fournit que des safetensors, tandis que les quantifications GGUF utilisées sur les GPU grand public vivent dans des dépôts communautaires séparés ; et des dépôts imitant l'original sont apparus avant la sortie, donc seule la copie de l'organisation Qwe​n est authentique. Cet article est le guide de téléchargement : ce que contient le dépôt, les trois façons de le récupérer, et comment vérifier que vous avez bien les poids authentiques.

Les faits essentiels, vérifiés le 15 août 2026.

DépôtQwen/Qwen3.8-27B sur Hugging Face, publié par l'organisation Qwe​n ; en miroir sur Qwen/Qwen3.8-27B sur ModelScope.

Publié — les poids ont été mis en ligne le 14 août 2026 ; la couverture avec fuseaux horaires cite également le 13 août, et les articles de pré-sortie de la semaine précédente les décrivaient comme en attente.

Licence — Apache 2.0 : télécharger, modifier et redistribuer, usage commercial inclus.

Taille — 55,57 Go de safetensors répartis sur 18 fragments (2,1 à 3,99 Go chacun) ; la page du dépôt arrondit le total à 55,6 Go.

Modèle — 27B paramètres denses (28B si vous comptez l'encodeur de vision), 64 couches, dimension cachée 5 120, vocabulaire 248 320.

Attention — hybride : 48 couches Gated DeltaNet (attention linéaire) contre 16 couches Gated Attention complètes, avec une prédiction multi-tokens entraînée — c'est ce ratio de 3:1 qui permet à 262 144 tokens de contexte natif de tourner sur un modèle de 27B.

Contexte — 262 144 jetons nativement, extensible à 1 000 000 via le scaling RoPE YaRN.

Entréeimage et vidéo natives avec texte ; renvoie du texte.

Signal — 91 917 téléchargements sur le compteur glissant de 30 jours de la fiche du modèle, vérifié le 15 août 2026.

Toutes les figures ci-dessus proviennent de la page du modèle Hugging Face, de l'arborescence du dépôt et de la configuration pour Qwen3.8 27B, consultées le 15 août 2026. Les scores annoncés sur la fiche (SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3) sont rapportés par Alibaba ; à ce jour, aucun laboratoire indépendant ne les a reproduits.

Pourquoi le télécharger : la question du local par rapport à l'API

Les poids ouverts sont la catégorie de modèles où le coût marginal d’exécution d’un jeton équivaut à votre facture d’électricité. Pas de frais de licence, pas de prix par jeton, pas de limite de débit, et rien ne quitte votre machine.Qwen3.8 27B est sous licence Apache 2.0, donc cette liberté est permanente : Ali​baba ne peut pas retirer les poids, les re-licencier, ni vous les facturer.

Le compromis, c'est le matériel et la configuration. Les poids BF16 complets nécessitent un GPU de classe 80 Go en précision native, et 55,6 Go représentent un téléchargement conséquent. Si vous voulez évaluer le modèle avant de vous y engager, la voie de l'API est plus rapide : Qwen3.8 27B est servi sur OrcaRouter aux tarifs de Qwe​n, répercutés sans marge : 0,33 $ par million de jetons en entrée et 2,40 $ par million de jetons en sortie — et OrcaRouter propose aussi un palier gratuit à débit limité pour le même modèle, si bien qu'un test de fumée à coût nul ne nécessite aucun téléchargement. Mais l'API est une commodité, pas une dépendance — les poids sont le produit, et ils sont gratuits.

Que contient réellement le dépôt ?

Le dépôt ne contient pas que des poids. C'est un package complet et exécutable : 18 shards plus les fichiers de métadonnées dont Transformers, vLLM et SGLang ont besoin. En le parcourant de haut en bas :

model-00001-of-00018.safetensors … model-00018-of-00018.safetensors — les poids, de 2,1 à 3,99 Go par shard, soit 55,57 Go au total.

model.safetensors.index.json — mappe chaque tenseur à son shard ; c'est ce qu'un chargeur lit en premier.

config.json — l’architecture : 64 couches, dimension cachée de 5 120, vocabulaire de 248 320, et la structure Gated DeltaNet / Gated Attention.

tokenizer.json (12.8 MB), tokenizer_config.json, vocab.json (6.72 MB), merges.txt (3.35 MB) — le tokenizer.

chat_template.jinja — le modèle de chat, y compris le bloc de réflexion ; llama.cpp nécessite qu'il soit passé comme modèle jinja, sinon le modèle vous répond avec des balises de pensée.

preprocessor_config.json et video_preprocessor_config.json — prétraitement d’images et de vidéos.

crc32.txt — sommes de contrôle par shard ; vérifiez un téléchargement à l'aide de ce fichier et un transfert corrompu cesse d'être un mystère.

README.md (la fiche de modèle de 65 kB), LICENSE (Apache 2.0), generation_config.json, .gitattributes (marque les fichiers de poids comme Git LFS).

A repository file-table card for Qwen/Qwen3.8-27B: 18 safetensors weight shards at 2.1 to 3.99 GB each totalling 55.57 GB, plus the index, config, tokenizer files, chat template, checksum file, model card, and license with their sizes.

Une conséquence de cette disposition importe pour le problème du faux dépôt ci-dessous. Une copie authentique de ce dépôt est lourde et complète. Un dépôt factice portant le nom « Qwen3.8 » et ne contenant rien d'autre qu'un README n'est pas un téléchargement qui a échoué — il s'agit d'un dépôt différent et vide.

Comment le télécharger — trois méthodes

Méthode 1, huggingface-cli, est le chemin le plus propre. Le modèle est public, donc aucune connexion n'est requise ; cela télécharge les 18 shards ainsi que les métadonnées dans un dossier :

huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B

Pour un transfert de 55,6 Go, le hf_transfer backend vaut la peine d'être installé — il parallélise le téléchargement et réduit généralement nettement le temps :

pip install hf_transfer

HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B

Deuxième méthode : git clone vous donne le dépôt en copie de travail avec l'historique. Nécessite Git LFS :

git lfs install

git clone https://huggingface.co/Qwen/Qwen3.8-27B

Troisième méthode, le navigateur — ouvrez l'onglet Fichiers et téléchargez les fragments individuellement. Ce n'est raisonnable que lorsque vous avez besoin d'un seul fichier (par exemple, juste config.json pour inspecter l'architecture). Pour le dépôt complet, il faut 18 téléchargements manuels plus une vérification de somme de contrôle ; utilisez un CLI.

A download-command card showing the three ways to fetch Qwen/Qwen3.8-27B: the recommended huggingface-cli download with --local-dir, the hf_transfer speed-up one-liner, and a git clone with Git LFS installed.

Quels fichiers vous devriez réellement télécharger

Le dépôt officiel est en safetensors BF16 — pleine précision, 55,6 Go — le bon artefact si vous disposez d’un GPU de classe 80 Go, ou si vous souhaitez quantifier vous-même plus tard. Il n’existe pas de GGUF officiel. Les builds GGUF que les gens utilisent réellement sur des cartes grand public sont des versions communautaires : Hugging Face répertorie 303 modèles quantifiés construits à partir de cette base (vérifié le 15 août 2026), et ceux vers lesquels les runbooks pointent sont les builds unsloth et lmstudio-community. L’échelle approximative :

BF16 safetensors — 55,6 Go, nécessite un GPU de classe 80 Go en précision native.

GGUF Q8_0 — environ 29 Go, tient sur une carte de 48 Go.

GGUF Q4_K_M — environ 17 Go, le choix standard pour les cartes de 24 Go.

GGUF 2-bit — environ 9 Go, se loge sur des cartes de 12 Go avec une perte de qualité visible.

Si vous souhaitez obtenir la vision à partir d'une build GGUF, vous devez également disposer du fichier mmproj séparé pour l'encodeur de vision, documenté sur chaque fiche communautaire. Pour le détail complet de la quantification et de l'exécution — y compris la mise en garde concernant le chat-template de llama.cpp — notre runbook pour l'exécution locale de Qwen3.8 27B contient les détails.

Comment distinguer le vrai repo des faux

Avant la publication des poids, la recherche Hugging Face était pleine de dépôts « Qwen3.8 » sans fichiers de poids — des cartes factices et des forks placés pour intercepter les recherches précoces. Certains sont toujours en ligne. La liste de vérification :

Vérifiez l'éditeur, pas le nom. Le véritable dépôt se trouve sous l'organisation Qwen : Qwen/Qwen3.8-27B. Un dépôt nommé Qwen3.8 27B sous un autre compte n'est pas la version officielle, aussi professionnel qu'il puisse paraître.

Utilisez la collection officielle. Qwen maintient huggingface.co/collections/Qwen/qwen38 ; chaque dépôt qui s'y trouve lui appartient.

Vérifiez le champ de licence. La vraie carte indique Apache 2.0.

Vérifiez la taille et la forme. Le vrai dépôt contient 18 shards safetensors totalisant environ 55,6 Go, un fichier de somme de contrôle crc32.txt et un README de 65 ko. Zéro fichier de poids signifie un dépôt vide, pas un téléchargement corrompu.

Traitez le nombre de téléchargements comme un signal, pas comme une preuve.Le dépôt authentique a dépassé 91 000 téléchargements en une journée, ce qui vous indique où tout le monde se tourne. Mais un faux peut aussi être téléchargé ; l’éditeur est la garantie.

Après le téléchargement, vérifiez l'intégrité : comparez le CRC32 de chaque shard avec crc32.txt, ou chargez le modèle avec Transformers et confirmez que le chargement du state dict ne produit aucun avertissement. Cela détecte à la fois un transfert corrompu et un mauvais modèle reconditionné.

Quand télécharger est la mauvaise décision

Télécharger 55,6 Go n'est pas la bonne décision pour tout le monde, et la version honnête de cet article le dit clairement.

Vous voulez simplement évaluer le modèle. La voie API est plus rapide — un test structuré coûte quelques centimes et prend quelques minutes, pas un téléchargement et un après-midi de configuration.

Vous n'avez pas de GPU proche de 80 Go. Le téléchargement BF16 est le mauvais artefact pour vous. Choisissez une quantification GGUF ou l'API.

Vous avez besoin de benchmarks vérifiés. Chaque chiffre annoncé pour Qwen3.8 27B est rapporté par Ali​baba en date du 15 août 2026. Si votre décision dépend de chiffres qu’un laboratoire indépendant a reproduits, attendez-les — les poids seront toujours là.

Vous construisez sur un modèle vieux de quelques jours. Les poids ont été publiés le 14 août. La page du modèle OrcaRouter, consultée aujourd'hui, affiche un taux d'erreur de 33,3 % sur les sept derniers jours et une latence p50 du premier jeton de 225 ms — un modèle flambant neuf sous charge précoce, traitez donc la télémétrie initiale comme provisoire. Les auto-hébergeurs devraient épingler le commit qu'ils ont téléchargé et conserver une solution de repli ; les utilisateurs de l'API devraient garder une règle de basculement comme même assurance.

The OrcaRouter model page for Qwen3.8 27B at qwen/qwen3.8-27b, showing the by-Qwen vendor label, vision-tools-JSON capability badges, a 262K-token context window, text-image-and-video input, and p50 first-token latency of 225 ms.

Vous voulez un contrat de support. Apache 2.0 est permissif, mais une licence n'est pas un SLA. Si votre charge de travail nécessite un support du fournisseur, la voie de l'API hébergée est le choix le plus sûr.

En résumé

Le véritable Qwen3.8 27B se trouve sur Hugging Face à Qwen/Qwen3.8-27B, sous licence Apache 2.0, publié le 14 août 2026, 55,6 Go de safetensors BF16 en 18 fragments. Téléchargez-le avec huggingface-cli ou git clone, vérifiez que l'éditeur est bien l'organisation Qwen, et vous disposez d'un 27B open-weights de pointe que personne ne peut vous retirer ni vous facturer. Si cela représente plus d'engagement que votre cas d'utilisation n'en nécessite, le même modèle n'est qu'à quelques centimes via l'API. Les poids sont pourtant l'essentiel — et ils sont gratuits.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube