
Qwen3.8-27B avec MLX sur Apple Silicon : Oui, ça fonctionne — Voici ce dont vous avez vraiment besoin
- obsidianNOUVEAUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 par million de tokens · 22 tok/s
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
Qwen3.8 27B fonctionne aujourd'hui sur Apple Silicon via MLX. Le tag est qwen3.8:27b-mlx dans Ollama, ajouté dans Ollama v0.32.12, et la version 4 bits se télécharge à environ 18 Go et nécessite environ 16–19 Go de mémoire unifiée — ce qui fait d'un Mac de 24 Go+ le seuil réaliste et exclut d'office un Mac de 16 Go. Les poids sont sous licence Apache 2.0, gratuits au point d'utilisation sur du matériel que vous possédez, ce qui est tout l'intérêt du modèle. La sortie d'Alibaba date de deux jours (13–14 août 2026), donc chaque chiffre ci-dessous est étiqueté : ce qui provient de la fiche technique du modèle d'Alibaba, ce que nous avons vérifié sur la page Ollama aujourd'hui, et ce qui relève d'une projection ou d'une mesure de tiers.
La fiche d'information en 30 secondes
Qwen3.8 27B est le modèle dense à 27 milliards de paramètres d'Alibaba, publié du 13 au 14 août 2026 sous licence Apache 2.0 — les poids ont été mis en ligne sur Hugging Face et ModelScope le 13, le fichier LICENSE apparaissant le lendemain matin. C'est le pendant dense et déployable du Qwen3.8-Max à 2,4 T de paramètres. D'après la fiche du modèle, tout ceci est rapporté par Alibaba et n'a pas encore été reproduit de manière indépendante :
• Taille — 27B dense, 27,78B de paramètres au total en comptant l'encodeur de vision.
• Architecture — 64 couches, taille cachée 5 120, vocabulaire 248 320.
• Attention hybride — 16 couches d’attention complète plus 48 couches linéaires Gated DeltaNet, un ratio de 3:1.
• Contexte — 262,144 tokens natifs, extensible à 1M via YaRN (Ollama répertorie le tag à 256K).
• Entrée — compréhension native des images et des vidéos en plus du texte, des documents aux vidéos d'une heure.
• Poids — 55,6 Go en BF16, tête de décodage spéculative MTP incluse.

Côté MLX, vérifié aujourd'hui : Ollama propose qwen3.8:27b-mlx — une version native MLX pour Apple Silicon avec un téléchargement 4 bits d'environ 18 Go — et les notes de version v0.32.12 mettent en avant l'optimisation pour Apple Silicon. mlx-lm, la boîte à outils Python d'Apple, prend en charge l'architecture pour la génération et la conversion, et les quantifications MLX (3/5/6 bits, plus MXFP4 et NVFP4) sont apparues dans les heures qui ont suivi la publication des poids. Le reste de cet article suppose un Mac de la série M avec 24 Go ou plus de mémoire unifiée.
Ce que MLX change en matière de mémoire
Sur Apple Silicon, il n'y a pas de VRAM séparée. MLX fonctionne sur le pool de mémoire unifiée de la série M, donc le chiffre important est la RAM totale de votre Mac moins ce que macOS et tout le reste utilisent. Un modèle qui « tient dans 17 Go » nécessite une machine avec confortablement plus que cela.
La bonne nouvelle, c'est que Qwen3.8 27B est moins coûteux à conserver que ne le laisse supposer son nombre de paramètres. Parce que seules les 16 couches de pleine attention gardent un cache KV — pas les 48 couches linéaires — le cache coûte environ 64 Ko par jeton, soit à peu près un quart de ce que paie un modèle dense classique à 64 couches. À l'autre extrémité, la fenêtre complète de 262K nécessite ~16,4 Go de cache en plus des poids, ce qui est un budget de serveur, pas un budget d'ordinateur portable.
L'échelle réaliste pour un Mac, taille de fichier plus marge de cache :
• 4-bit MLX — ~16–19 Go au total. Tient sur un Mac de 24 Go avec une fenêtre d'environ 64K–96K ; le choix par défaut raisonnable.
• MLX 6 bits — ~21–22 Go. Machines de 32 Go ; le gain de qualité par rapport au 4-bit est modeste.
• MLX 8 bits — ~27–30 Go. Machines 48 Go+ ; quasi sans perte.
• BF16 — ~55,6 Go. Uniquement les machines studio haut de gamme M-series Max et Ultra.

Sourcing : le chiffre 4 bits suit le GGUF Q4_K_M mesuré (17,1 Go, unsloth, 14 août) et le téléchargement Ollama de 18 Go ; les chiffres 8 bits et BF16 suivent la carte BF16 d'Alibaba et la lignée Qwen3.6-27B. Le chiffre du cache de 64 Ko par jeton est dérivé de l'architecture, non imprimé sur une fiche technique, et ne vaut que pour les environnements d'exécution qui ignorent le cache KV sur les couches linéaires comme le fait MLX.
Trois façons de l'exécuter, de la plus simple au plus grand contrôle.
Voie A — Ollama, la plus simple
Mettez à niveau vers Ollama 0.32.12 ou une version plus récente, puis :
• ollama pull qwen3.8:27b-mlx — télécharge la version MLX d’environ 18 Go.
• ollama run qwen3.8:27b-mlx — chat interactif avec le modèle de réflexion branché.
• ollama serve — expose l'API compatible OpenAI sur localhost:11434 pour vos applications.

Un problème connu, d'après un ticket GitHub en ligne au moment de la rédaction : qwen3.8:27b-mlx rejette le rôle « developer » sur le endpoint /v1/responses, ce qui casse ollama launch codex pour ce modèle — alors que ollama run fonctionne directement. Si vous construisez une boucle d’agent de type Codex sur la version MLX, testez le endpoint exact que vous prévoyez d’utiliser avant de fonder votre boucle dessus.
Chemin B — mlx-lm, le plus de contrôle
Le kit d'outils d'Apple. Installez-le avec pip install mlx-lm, puis soit récupérez un checkpoint MLX pré-quantifié, soit convertissez vous-même les poids officiels BF16 :
• mlx_lm.generate --model <checkpoint> — exécutez un checkpoint directement ; les quants communautaires 4-bit et 8-bit du 27B continuaient d'arriver sur mlx-community dans les jours suivant la sortie.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — conversion unique ; coûte environ un téléchargement.
• mlx_lm.server --model <checkpoint> — Serveur compatible OpenAI qui applique pour vous le modèle de chat à blocs de réflexion.
Si la quantification exacte que vous voulez n'est pas encore disponible, la conversion à partir des poids officiels est une opération rapide sur n'importe quel Mac de la série M et élimine tout doute sur ce qu'un tiers a livré.
Chemin C — LM Studio, la solution en un clic
LM Studio utilise le backend MLX sur Apple Silicon et a intégré Qwen3.8 27B dès sa sortie : recherchez le modèle, choisissez une quantification adaptée à votre RAM, et il se télécharge et s'exécute. Si vous préférez une interface graphique, c'est la voie la plus conviviale, et notre guide d'accompagnement la couvre de bout en bout — voir « How to Run Qwen3.8 27B Locally » dans les lectures connexes ci-dessous.
Le piège du modèle
Qwen3.8 27B pense par défaut, et les blocs de réflexion sont rendus par le template de chat, pas par le cœur du modèle. Les tests de tiers effectués au cours des 48 premières heures indiquent que le template officiel enveloppe chaque tour de l'assistant dans un bloc de réflexion — même les vides — et que dans les boucles d'agent multi-tours, les blocs s'imbriquent et l'historique est tronqué, ce qui ressemble à de l'amnésie. Ce n'est pas la quantification. Si un runtime fournit un template corrigé, utilisez-le ; lorsque vous construisez une boucle d'agent et n'avez pas besoin du raisonnement, désactivez la réflexion par requête — le template de chat expose un indicateur enable_thinking, et le modèle accepte un reasoning_effort de xhigh, medium ou low.
Ce que l'on ressent vraiment
Un test indépendant sur un Mac mini M4 avec 32 Go de mémoire unifiée, utilisant la version MLX en 4 bits, a mesuré environ 5 à 6 tokens/s de génération. C'est ce chiffre qui doit fixer les attentes : idéal pour la rédaction interactive, le raisonnement de longue haleine et les appels d'agent occasionnels ; pénible pour les longues boucles agentiques et les traitements par lots. L'anecdote du même testeur — une réflexion de plusieurs minutes suivie d'une petite application qui semblait correcte mais ne collait pas en réalité — rappelle utilement qu'un modèle 27B sur un ordinateur portable est un assistant compétent mais non infaillible.
La vitesse évolue avec le niveau de la puce : un Max de la série M, avec davantage de bande passante mémoire et de cœurs, tourne nettement plus vite que le M4 de base dans le mini. Mais 5 à 6 tok/s sur le modèle d’entrée de gamme est la référence honnête, et vous devriez juger tout titre du type « fonctionne sur Apple Silicon » par rapport à celle-ci.
Le contexte 262K est une fonctionnalité serveur.
La fenêtre native de 262K de Qwen3.8 27B est réellement utile — mais sur un Mac, elle est limitée par la mémoire, pas par le modèle. Avec 64 Ko de cache KV par jeton, une fenêtre de 8K coûte environ 0,5 Go, 32K environ 2 Go, 128K environ 8 Go, et la fenêtre complète de 262K environ 16,4 Go en plus des poids. Sur une machine de 24 Go fonctionnant en 4 bits, le plafond réaliste est d’environ 64K–96K jetons ; viser 128K+ nécessite une machine de 32 Go+, et la fenêtre complète nécessite une machine dont la mémoire unifiée est en grande partie occupée par le cache. Planifiez le contexte dont vous avez réellement besoin et plafonnez-le dans la configuration d’exécution — le modèle est content, et votre fichier d’échange reste tranquille.
Quand Apple Silicon est la mauvaise réponse
Suivez une autre voie si votre charge de travail correspond à l'un de ces cas :
Vous avez un Mac de 8 Go ou 16 Go. La version 4 bits nécessite déjà environ 17 Go de mémoire unifiée ; en dessous, le système swappe et le modèle devient inutilisable. C'est l'erreur de loin la plus courante, et aucun artifice de quantification n'y remédie.
• Vous avez besoin de la fenêtre complète de 262K ou de l'extension YaRN 1M. Ce budget KV est un budget serveur, pas un budget portable.
• Vous servez d'autres personnes. Un ordinateur portable ne représente qu'un seul siège ; le débit multi-utilisateurs nécessite une boîte GPU ou une API hébergée.
• Vous devez aller vite sur les longues boucles agentiques. 5 à 6 tok/s, c'est bien pour un humain qui suit, mais lent pour un sous-agent.
Le cadrage honnête : l'argumentaire de Qwen3.8 27B est qu'il est gratuit au point d'utilisation sur du matériel que vous possédez — l'opposé d'un modèle API qui facture par token. C'est exactement pour cela qu'il n'est pas dans le catalogue OrcaRouter (le catalogue route la génération précédente Qwen3.6/3.5-27B et la gamme d'API Qwen hébergée). Nous sommes le mauvais outil pour le récit du local gratuit, et c'est justement le but : lorsqu'une charge de travail dépasse un Mac, les alternatives sont un boîtier GPU, un GPU loué ou une API Qwen hébergée — pas un routeur qui se trouve porter ce 27B spécifique.
En résumé
Qwen3.8 27B sur Apple Silicon est réel, il est bon, et son champ d’application est étroit. La version 4-bit MLX tient dans un Mac de 24 Go ou plus, se télécharge sous le nom qwen3.8:27b-mlx dans Ollama, ne coûte rien par jeton, et est le premier modèle ouvert de niveau agent réellement utilisable qui tient dans un ordinateur portable. Les compromis sont la vitesse (5 à 6 tok/s sur un M4 mini) et le contexte (limitez-le bien en dessous de 262K sauf si vous avez la RAM). Si vous avez un Mac de 24 Go ou plus et une charge de travail qu’un 27B peut porter, c’est le meilleur modèle local gratuit disponible cette semaine. Si vous avez un Mac de 16 Go ou avez besoin d’un débit de production, ce n’est pas le cas — et l’alternative est une voie payante, ce qui est une décision entièrement différente.
