
Qwen3.8-27B Benchmarks: La tabella completa, con le relative avvertenze
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
Qwen3.8-27Bottiene 73.0 su Terminal-Bench 2.1, 61.7 su SWE-bench Pro, 90.3 su LiveCodeBench v6 e 84.3 su OSWorld-Verified — e ognuno di questi numeri è di Alibaba stessa. Il modello open-weights da 27 miliardi di parametri è arrivato su Hugging Face il 14 agosto 2026 con licenza Apache 2.0 e, al 15 agosto, nessuno al di fuori di Alibaba ne ha valutato indipendentemente la qualità. Questa pagina è il resoconto completo e con fonti: tutti i 25 benchmark ufficiali della scheda del modello, cosa è cambiato rispetto al predecessore Qwen3.6-27B, cosa ha misurato un test indipendente di throughput AMD e quali affermazioni dovresti considerare provvisorie.
Una guida alla lettura prima dei numeri: "ufficiale" qui indica la valutazione di Alibaba riportata sulla scheda del modello all'indirizzo Qwen/Qwen3.8-27B. È dichiarata dal fornitore e non riprodotta. "Indipendente" significa che qualcuno al di fuori del laboratorio l'ha misurata — finora questo vale solo per la velocità hardware, non per alcun punteggio di qualità. I benchmark in cui l'harness è rilevante sono segnalati inline.
Il modello, una riga per specifica
• 27B parametri densi (28B contando l'encoder visivo), 64 livelli, dimensione nascosta 5120.
• Attenzione ibrida — 48 livelli di attenzione lineare Gated DeltaNet più 16 livelli di attenzione completa, un rapporto 3:1 — che è ciò che rende conveniente eseguire una finestra di 262K token.
• 262.144 token di contesto nativo, estensibile a 1.000.000 con lo scaling YaRN.
• Input nativo di immagini e video (output di testo), pesi Apache 2.0, circa 55,6 GB in BF16.
La versione breve: questo è il modello pensato per prendere ciò che Alibaba ha imparato costruendo il Qwen3.8-Max da 2,4 trilioni di parametri e comprimerlo in qualcosa che una singola GPU possa eseguire.
La scheda di valutazione: ogni benchmark sulla scheda del modello
Tutti i punteggi riportati di seguito provengono dalla scheda modello del 14 agosto pubblicata da Alibaba, con il punteggio del modello Qwen3.6-27B sostituito tra parentesi.
Codifica. Terminal-Bench 2.1 (codifica terminale agentica) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Le esecuzioni di SWE-bench Pro e QwenSWEBench hanno usato l'harness Claude Code, come indicato in una nota a piè di pagina della scheda del modello — da tenere a mente prima di confrontarle con un modello valutato con un'harness diversa.
Agenti a lungo orizzonte e lavoro d'ufficio. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / punteggio 42.9 (10.6 / 27.3).
Ragionamento e conoscenza. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). L'HLE è valutato da GPT-4o, secondo la scheda.
Visione e utilizzo del computer.OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 con CI / 90.0 senza (85.1); BabyVision 85.6 con CI / 65.7 senza (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" è il potenziamento in fase di inferenza di Alibaba; il divario tra il suo stato attivo e quello disattivo è il singolo numero più informativo sulla scheda per capire quanto punteggio si può comprare con potenza di calcolo aggiuntiva per l'inferenza.

Cosa è effettivamente cambiato rispetto a Qwen3.6-27B
Ogni benchmark sulla scheda è salito, ma le differenze non sono uniformi — e la forma del miglioramento è la storia. I guadagni si concentrano nel coding agente e nell'uso del computer, non nel richiamo di conoscenza:
• DeepSWE 1.1 (codifica agentica) 13.3 → 42.2, circa un salto di 3x
• QwenSWEBench 49.3 → 79.0
• Punteggio Agents' Last Exam 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 e AndroidWorld 70.3 → 81.9
• BabyVision (con CI) 28.9 → 85.6 — il maggiore guadagno relativo sulla scheda
Nel frattempo, GPQA Diamond è passato da 87.8 a 89.2 e RealWorldQA da 84.1 a 85.9: miglioramenti reali ma piccoli. Non è una release “più intelligente in tutto”. È una release mirata direttamente agli agenti che leggono schermi, usano strumenti e scrivono codice in molti passaggi.

Le lacune oneste: dove perde ancora, e le avvertenze metodologiche
Contro la frontiera il quadro è lusinghiero ma non unilaterale. Dove Qwen3.8-27B e Claude Opus 4.6 Max si sovrappongono, Qwen vince nella maggior parte dei casi — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench e l'intero blocco della visione. Contro il Muse Glimmer-30B di Meta, il naturale rivale di classe locale, vince nettamente tutti gli otto benchmark sovrapposti. Ma perde ancora Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) e NL2Repo-Bench (42.3 vs 47.6) contro Claude Opus 4.6 Max. Se il tuo carico di lavoro è il ragionamento di frontiera più difficile — matematica di frontiera, domande fortemente multidisciplinari — il 27B non è ancora a quel livello.
Tre avvertenze prima di citare qualsiasi parte di tutto ciò. Primo, nulla di tutto ciò è verificato in modo indipendente; non esiste un indice Artificial Analysis né una corsa LMArena per la 27B al 15 agosto, e gli harness di Alibaba non sono quelli che useranno terze parti. Secondo, la scheda del modello usa l'harness Claude Code per SWE-bench Pro e QwenSWEBench e un giudice GPT-4o per Humanity's Last Exam — i confronti con modelli valutati su altre configurazioni sposteranno i numeri. Terzo, la corsa MathVision di Alibaba ha usato un prompt fisso mentre i concorrenti hanno ottenuto il più alto di due varianti. Nulla di tutto ciò significa che i risultati siano sbagliati; significa che sono un tetto, non un pavimento, finché qualcun altro non esegue il modello.
Cosa serve per eseguirlo
Qwen3.8-27B è un modello locale, il che cambia il significato di "prestazioni": throughput sul proprio hardware invece di un listino prezzi. I pesi BF16 sono di circa 55,6 GB; quantizzati a 4 bit, entrano in una scheda da 24 GB come una RTX 3090 o 4090. AMD ha fornito supporto Day-0 il giorno del lancio, e le sue misurazioni llama.cpp/Vulkan — agosto 2026, media di tre o più esecuzioni — lo collocano a 24,5 token/s su un Ryzen AI Max+ 395 e 51,8 token/s su una Radeon AI PRO R9700 con 32 GB, su sistemi con più di circa 24 GB di memoria grafica variabile o VRAM. I test della community sulla build FP8 su un NVIDIA GH200 hanno gestito 10 richieste concorrenti con contesto da 262K con un time-to-first-token inferiore a 10 ms. I tuoi numeri saranno diversi — quelle sono GPU di qualcun altro — ma il quadro è reale: questa è la prima release Qwen in questa classe che gira, non solo in una recensione, su una singola workstation.
Pesi liberi, o un'API a pagamento?
La decisione che questo modello impone è quella che divide il locale dall'hosted: i pesi non costano nulla, ma le tue GPU non sono gratuite. Il self-hosting significa possedere il silicio — una scheda da 24GB se accetti la quantizzazione a 4 bit e una generazione più lenta, qualcosa di più grande se vuoi l'intero contesto di 262K a piena qualità. L'alternativa hosted su OrcaRouter costa $0,33 per milione di token in input e $2,40 per milione in output, con lo stesso contesto di 262K e input di immagini e video, e un tempo al primo token p50 di 225ms misurato negli ultimi sette giorni — nessuna GPU da comprare, nessuna VRAM da sorvegliare. L'aritmetica è quella che fai sempre con i pesi aperti: il throughput di token di cui hai effettivamente bisogno moltiplicato per il tuo costo per token, contro il prezzo fisso di una scheda. A volumi elevati e sostenuti, il self-hosting vince; a volumi intermittenti o modesti, pagare $0,33/$2,40 batte l'acquisto di silicio che resta per lo più inattivo.

Il risultato finale
Qwen3.8-27B è il modello open-weights più potente che Alibaba abbia mai rilasciato in questa classe di dimensioni, stando ai numeri di Alibaba stessa: il migliore della tabella per coding agentico, uso del computer e ragionamento visivo, con una finestra di contesto di 262K e pesi Apache 2.0. La lettura corretta della scheda di valutazione è condizionale: ogni dato è dichiarato dal vendor, specifico per l'harness di test e finora non riprodotto in modo indipendente, e i modelli frontier vincono ancora nei benchmark di ragionamento più difficili. Se devi decidere se ospitarlo da solo (self-host) o chiamarlo come API, tratta la tabella dei benchmark come una promessa e i dati di throughput AMD come l'unica misurazione indipendente esistente oggi. Aggiorneremo questa pagina il giorno in cui un laboratorio indipendente pubblicherà un punteggio.
