Un carton-titre pour l'article Qwen3.8-27B sur Ollama, montrant une fenêtre de terminal minimaliste avec la commande 'ollama run qwen3.8:27b' et un curseur clignotant, trois badges indiquant 'téléchargement de 18 Go', 'Q4_K_M par défaut' et 'contexte de 262K', et la légende 'gratuit à exécuter, votre matériel'.
Guides & Insights

Qwen3.8-27B sur Ollama : une commande, quatre quants, et ce que « gratuit » coûte vraiment

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Lancez-le avec une seule commande : ollama run qwen3.8:27b. C'est là toute la réponse à la question posée par cette page. Qwen3.8 27B — Le modèle dense de 27 milliards de paramètres d'Ali​baba, dont les poids ont été publiés le 14 août 2026 sous licence Apache 2.0 — est arrivé dans la bibliothèque Ollama cette semaine, et la version par défaut est déjà un quant Q4_K_M de 18 Go tout à fait raisonnable (17 Go de poids plus un encodeur de vision de 931 Mo). Il tourne entièrement sur un GPU de 24 Go avec des longueurs de contexte normales, bascule sur le CPU si votre carte est plus petite, et ne coûte rien par jeton.

Tout ici est daté du 15 août 2026. Les spécifications proviennent de la fiche du modèle Qwen3.8 27B ; les tailles de téléchargement, les tags et les nombres de téléchargements proviennent de la page en direct de la bibliothèque Ollama ; les chiffres de référence sont rapportés par Ali​baba et n'ont pas encore de réplication indépendante. Le modèle est sorti il y a quelques jours, donc considérez tout ce qui peut changer comme provisoire.

La solution en une ligne qui fonctionne vraiment

Si vous avez déjà Ollama installé, vous n'êtes qu'à deux mots près :

ollama lancer qwen3.8:27b

Le support d'Ollama est arrivé dans la v0.32.12 — la note de version indique simplement : « Cette version ajoute le support de Qwe​n 3.8 27B. » La première exécution télécharge la version par défaut (environ 18 Go, Q4_K_M), puis vous amène dans un REPL de discussion avec le mode réflexion activé par défaut. La page de la bibliothèque répertorie la version avec les balises de capacité « vision tools thinking 27b », ce qui permet de savoir que les chemins de vision et d'appel d'outils sont intégrés dans le même téléchargement. À l'heure actuelle, la page affiche plus de 40 000 téléchargements et une liste de balises qui couvre déjà onze variantes.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

Deux variantes auxquelles vous aurez réellement recours :

• ollama run qwen3.8:27b-mlx — la version Apple Silicon, même empreinte de 18 Go, mais compilée pour Metal ; c'est celle que la note de version d'Ollama optimise spécifiquement « pour des performances maximales et une qualité de sortie adaptée aux tâches répétitives et aux agents de codage ».

• ollama run qwen3.8:27b-q8_0 — un modèle quantifié en 8 bits de 30 Go, pour quand vous avez la VRAM et voulez des poids plus proches de la pleine précision.

Ce que vous téléchargez réellement

Le nom indique 27B, mais le nombre total de paramètres est de 28B : un modèle de langue dense de 27.3B plus un encodeur visuel de 461M qui lui confère une entrée native d'images et de vidéos. Le reste des spécifications principales, directement tiré de la fiche du modèle :

• 64 couches, taille cachée 5 120, vocabulaire 248 320.

• Attention hybride : 16 couches Gated Attention complètes et 48 couches Gated DeltaNet linéaires — un mélange 3:1 à dominante linéaire, et la raison pour laquelle un modèle 27B peut conserver un contexte natif de 262 144 jetons (extensible à 1M) sans que le cache KV ne consomme un datacenter entier.

• Compréhension native des images et des vidéos — « des diagrammes et documents STEM aux vidéos de plusieurs heures » est la formulation d'Alibaba.

• Apache 2.0. Téléchargez-le, modifiez-le, vendez un produit basé dessus. Cette licence est le fait juridique sur lequel repose l’économie du reste de cet article.

La référence en pleine précision est le BF16, c'est pourquoi les étiquettes de 56 Go existent ; chaque étiquette plus petite est un arbitrage entre précision et empreinte, et c'est contre les benchmarks de la fiche du modèle que vous échangez.

Choisissez un quant, puis vérifiez votre VRAM, pas l'inverse.

Ollama vous donne onze tags, mais la décision se résume à trois tailles.

18 Go — Q4_K_M (par défaut). Tient entièrement sur une carte de 24 Go (classe RTX 4090 / 5090) avec un contexte normal, et sur des cartes de 16 Go avec un déchargement partiel sur CPU — plus lent, mais ça fonctionne. C'est la version pour « simplement l'exécuter ».

30 GB — Q8_0. Poids quasi pleine précision, nécessite environ 40 Go de VRAM pour rester entièrement sur GPU. Sur un 27B, vous devriez déjà savoir pourquoi vous voulez la fidélité supplémentaire avant de payer pour cela.

56 GB — BF16.La version de référence. Nécessite du matériel de classe H100 ou 96 Go de VRAM. Personne ne fait tourner ça sur un GPU grand public, et c'est très bien.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

Le nombre qui induit en erreur les gens, c'est le cache KV. Le téléchargement de 18 Go ne signifie pas que 18 Go de VRAM suffisent pour une session avec un contexte de 262K — avec un contexte long, le cache ajoute plusieurs gigaoctets en plus des poids, c'est pourquoi une carte de 24 Go gérera confortablement ce modèle avec un contexte de 8K à 32K, mais pas à 262K. Sur une carte à la limite, réduisez le contexte, pas la quant.

Apple Silicon est une cible de premier choix ici.

La note de version v0.32.12 d'Ollama mentionne spécifiquement macOS. Concrètement, `ollama run qwen3.8:27b-mlx` nécessite environ 18 Go de mémoire unifiée, donc un Mac de 24 Go ou plus l'exécute entièrement sur le GPU, avec de la marge pour le contexte. Il existe aussi un tag `mxfp8` MLX de 32 Go et un tag `mlx-bf16` de 56 Go pour les machines de 64 à 128 Go. Si votre Mac à puce M-series suit les annonces concernant les modèles de bureau, c'est la version que vous attendiez.

Contexte : 262K sur la fiche technique, moins une fois assis.

La fiche modèle annonce 262 144 tokens natifs, extensibles à 1M ; la page de bibliothèque d'Ollama indique la même fenêtre à 256K. Les deux sont vrais — 262 144 équivaut à 256K multiplié par 1024 — et aucun des deux ne signifie que vous devriez saisir ce nombre dans --num-ctx sur une carte de 24 Go. Le cache KV croît à peu près linéairement avec le contexte, donc sur du matériel grand public vous resterez entre 16K et 64K, pas 262K. Commencez avec la valeur par défaut d'Ollama, augmentez --num-ctx uniquement lorsqu'une tâche en a réellement besoin, et rappelez-vous que le chiffre de 1M nécessite le mécanisme d'extension ainsi que la VRAM pour l'alimenter.

Ce qui reste fragile — lisez ceci avant de parier là-dessus

Aucun benchmark indépendant pour l'instant. Chaque chiffre de la fiche modèle repose sur la parole d'Ali​baba en date du 15 août. Les gains annoncés par rapport à Qwen3.6-27B sont importants — SWE-bench Pro 61.7 contre 53.5, Terminal Bench 2.1 73.0 contre 63.4, LiveCodeBench v6 90.3 contre 83.9, GPQA Diamond 89.2 contre 87.8 — et ils semblent tous plausibles, mais aucun n'a été reproduit par un banc d'essai externe. Ne vous appuyez pas uniquement sur eux pour une décision de production.

La stack vision n'a que quelques jours. Un premier rapport de bug (ollama issue #17753) a montré que la build Q4 routait les entrées vision via le parseur Qwen3.5 et échouait sur les images ; cela a été corrigé en quelques jours dans la PR #17755, mais le chemin multimodal sur un modèle d'une semaine est exactement là où il faut tester avant de s'y fier.

La version par défaut inclut MTP. Le tag q4_K_M est également la version à prédiction multi-tokens — décodage plus rapide, et la raison pour laquelle « 18 Go » et « 27B » peuvent coexister sans contradiction.

Les étiquettes de quantification peuvent induire en erreur sur Apple. Les balises « mlx » et « nvfp4 » de 18 Go diffèrent dans la quantification — NVFP4 est un format FP4 de NVIDIA — donc sur un Mac, préférez la version -mlx standard, sauf si vous avez spécifiquement besoin d'une variante FP8/FP4 pour un GPU Blackwell.

« "Free" fait beaucoup de travail dans ce titre. »

Self-héberger un modèle 27B est gratuit par jeton, mais ce n'est pas gratuit. La formulation honnête consiste en trois options qui coûtent différentes monnaies :

Exécutez-le vous-même (Ollama). 0 $ par jeton, hors ligne, illimité, privé — et le matériel vous appartient. Un GPU de 24 Go ou un Mac de 18 Go+ est un achat conséquent, tout comme les frais d'électricité et le temps de configuration. C'est le bon choix lorsque Qwen3.8 27B devient un outil de tous les jours.

Appelez une API gratuite avec limite de débit. OrcaRouter sert Qwen3.8 27B sur sa propre infrastructure à coût nul (ID de modèle qwen/qwen3.8-27b-free, 0 $ par requête, avec limite de débit) — parce que les poids sont ouverts, il n'y a aucun coût fournisseur par jeton à répercuter. C'est le bon choix lorsque vous voulez essayer le modèle sans acheter de matériel pour tester une version vieille d'une semaine.

Appelez une API illimitée. Le même modèle sans limite de débit est à 0,33 $ par million de jetons d’entrée et 2,40 $ par million de sortie sur OrcaRouter (qwen/qwen3.8-27b, contexte 262K, entrée texte, image et vidéo). C’est le bon choix lorsque vous avez besoin d’une échelle de production et que vous ne voulez pas surveiller un GPU.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

Les mathématiques qui décident entre eux : une utilisation occasionnelle s’amortit mieux à $0 ou à $0,33/$2,40 qu’au prix d’un GPU ; une utilisation interactive quotidienne est moins chère localement ; un débit de production soutenu est le moins cher en tant qu’API que vous n’avez pas à garder en vie. Les exigences de confidentialité et hors ligne vous déplacent vers la première colonne, quoi que disent les mathématiques.

Quand cette recommandation est erronée

Vous avez vraiment besoin d'un contexte de 100K+. Le modèle peut le faire ; votre carte de 24 Go ne le peut pas. En véritable long contexte, un GPU de 40 Go+ ou une API à contexte plus long n'est pas un luxe.

Vous avez besoin de vidéo en production aujourd'hui. Le chemin de vision vient d'avoir son bug de parseur corrigé ; la vidéo en production sur un modèle multimodal vieux d'une semaine est un pari que vous ne devriez pas prendre sans solution de repli.

Vous voulez de la concurrence. Une GPU grand public ne diffuse qu'une ou deux générations à la fois. Un 27B n'est pas un serveur d'inférence.

Vous êtes sur un matériel CPU uniquement. Un 27B en 4-bit sur CPU est une démonstration lente, pas un outil. Une API est le choix honnête jusqu'à ce que vous ayez un GPU.

En résumé

Qwen3.8 27B sur Ollama est le moyen le plus simple d'exécuter un 27B de génération actuelle que quiconque ait publié à ce jour : une seule commande, une valeur par défaut de 18 Go qui tient sur une carte de 24 Go, une version Apple Silicon de premier ordre, et la liberté Apache 2.0. La quantification à choisir est presque toujours la Q4_K_M par défaut — passez à q8_0 uniquement lorsque vous pouvez mesurer la différence. Et le « gratuit » est conditionnel : si vous utilisez le modèle occasionnellement, l'API à 0 $ limitée en débit est plus libre que d'acheter du matériel ; s'il devient votre usage quotidien, la copie locale est la chose la moins chère que vous possédez. Vérifiez les chiffres avant de vous appuyer dessus — tout dans cet article était vrai le 15 août 2026, et ce modèle change de jour en jour.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube