Scheda del titolo per il riepilogo dei benchmark Qwen3.8-27B, che mostra una scheda di valutazione dei benchmark con un sigillo che riporta OPEN WEIGHTS e icone per coding, throughput, vision, contesto lungo e hardware locale, con chip che riportano 27B DENSE, 262K CONTEXT e APACHE 2.0.
Guides & Insights

Qwen3.8-27B Benchmarks: La tabella completa, con le relative avvertenze

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen3.8-27Bottiene 73.0 su Terminal-Bench 2.1, 61.7 su SWE-bench Pro, 90.3 su LiveCodeBench v6 e 84.3 su OSWorld-Verified — e ognuno di questi numeri è di Alibaba stessa. Il modello open-weights da 27 miliardi di parametri è arrivato su Hugging Face il 14 agosto 2026 con licenza Apache 2.0 e, al 15 agosto, nessuno al di fuori di Alibaba ne ha valutato indipendentemente la qualità. Questa pagina è il resoconto completo e con fonti: tutti i 25 benchmark ufficiali della scheda del modello, cosa è cambiato rispetto al predecessore Qwen3.6-27B, cosa ha misurato un test indipendente di throughput AMD e quali affermazioni dovresti considerare provvisorie.

Una guida alla lettura prima dei numeri: "ufficiale" qui indica la valutazione di Alibaba riportata sulla scheda del modello all'indirizzo Qwen/Qwen3.8-27B. È dichiarata dal fornitore e non riprodotta. "Indipendente" significa che qualcuno al di fuori del laboratorio l'ha misurata — finora questo vale solo per la velocità hardware, non per alcun punteggio di qualità. I benchmark in cui l'harness è rilevante sono segnalati inline.

Il modello, una riga per specifica

• 27B parametri densi (28B contando l'encoder visivo), 64 livelli, dimensione nascosta 5120.

• Attenzione ibrida — 48 livelli di attenzione lineare Gated DeltaNet più 16 livelli di attenzione completa, un rapporto 3:1 — che è ciò che rende conveniente eseguire una finestra di 262K token.

• 262.144 token di contesto nativo, estensibile a 1.000.000 con lo scaling YaRN.

• Input nativo di immagini e video (output di testo), pesi Apache 2.0, circa 55,6 GB in BF16.

La versione breve: questo è il modello pensato per prendere ciò che Alibaba ha imparato costruendo il Qwen3.8-Max da 2,4 trilioni di parametri e comprimerlo in qualcosa che una singola GPU possa eseguire.

La scheda di valutazione: ogni benchmark sulla scheda del modello

Tutti i punteggi riportati di seguito provengono dalla scheda modello del 14 agosto pubblicata da Alibaba, con il punteggio del modello Qwen3.6-27B sostituito tra parentesi.

Codifica. Terminal-Bench 2.1 (codifica terminale agentica) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Le esecuzioni di SWE-bench Pro e QwenSWEBench hanno usato l'harness Claude Code, come indicato in una nota a piè di pagina della scheda del modello — da tenere a mente prima di confrontarle con un modello valutato con un'harness diversa.

Agenti a lungo orizzonte e lavoro d'ufficio. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / punteggio 42.9 (10.6 / 27.3).

Ragionamento e conoscenza. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). L'HLE è valutato da GPT-4o, secondo la scheda.

Visione e utilizzo del computer.OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 con CI / 90.0 senza (85.1); BabyVision 85.6 con CI / 65.7 senza (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" è il potenziamento in fase di inferenza di Alibaba; il divario tra il suo stato attivo e quello disattivo è il singolo numero più informativo sulla scheda per capire quanto punteggio si può comprare con potenza di calcolo aggiuntiva per l'inferenza.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Cosa è effettivamente cambiato rispetto a Qwen3.6-27B

Ogni benchmark sulla scheda è salito, ma le differenze non sono uniformi — e la forma del miglioramento è la storia. I guadagni si concentrano nel coding agente e nell'uso del computer, non nel richiamo di conoscenza:

• DeepSWE 1.1 (codifica agentica) 13.3 → 42.2, circa un salto di 3x

• QwenSWEBench 49.3 → 79.0

• Punteggio Agents' Last Exam 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 e AndroidWorld 70.3 → 81.9

• BabyVision (con CI) 28.9 → 85.6 — il maggiore guadagno relativo sulla scheda

Nel frattempo, GPQA Diamond è passato da 87.8 a 89.2 e RealWorldQA da 84.1 a 85.9: miglioramenti reali ma piccoli. Non è una release “più intelligente in tutto”. È una release mirata direttamente agli agenti che leggono schermi, usano strumenti e scrivono codice in molti passaggi.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Le lacune oneste: dove perde ancora, e le avvertenze metodologiche

Contro la frontiera il quadro è lusinghiero ma non unilaterale. Dove Qwen3.8-27B e Claude Opus 4.6 Max si sovrappongono, Qwen vince nella maggior parte dei casi — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench e l'intero blocco della visione. Contro il Muse Glimmer-30B di Meta, il naturale rivale di classe locale, vince nettamente tutti gli otto benchmark sovrapposti. Ma perde ancora Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) e NL2Repo-Bench (42.3 vs 47.6) contro Claude Opus 4.6 Max. Se il tuo carico di lavoro è il ragionamento di frontiera più difficile — matematica di frontiera, domande fortemente multidisciplinari — il 27B non è ancora a quel livello.

Tre avvertenze prima di citare qualsiasi parte di tutto ciò. Primo, nulla di tutto ciò è verificato in modo indipendente; non esiste un indice Artificial Analysis né una corsa LMArena per la 27B al 15 agosto, e gli harness di Alibaba non sono quelli che useranno terze parti. Secondo, la scheda del modello usa l'harness Claude Code per SWE-bench Pro e QwenSWEBench e un giudice GPT-4o per Humanity's Last Exam — i confronti con modelli valutati su altre configurazioni sposteranno i numeri. Terzo, la corsa MathVision di Alibaba ha usato un prompt fisso mentre i concorrenti hanno ottenuto il più alto di due varianti. Nulla di tutto ciò significa che i risultati siano sbagliati; significa che sono un tetto, non un pavimento, finché qualcun altro non esegue il modello.

Cosa serve per eseguirlo

Qwen3.8-27B è un modello locale, il che cambia il significato di "prestazioni": throughput sul proprio hardware invece di un listino prezzi. I pesi BF16 sono di circa 55,6 GB; quantizzati a 4 bit, entrano in una scheda da 24 GB come una RTX 3090 o 4090. AMD ha fornito supporto Day-0 il giorno del lancio, e le sue misurazioni llama.cpp/Vulkan — agosto 2026, media di tre o più esecuzioni — lo collocano a 24,5 token/s su un Ryzen AI Max+ 395 e 51,8 token/s su una Radeon AI PRO R9700 con 32 GB, su sistemi con più di circa 24 GB di memoria grafica variabile o VRAM. I test della community sulla build FP8 su un NVIDIA GH200 hanno gestito 10 richieste concorrenti con contesto da 262K con un time-to-first-token inferiore a 10 ms. I tuoi numeri saranno diversi — quelle sono GPU di qualcun altro — ma il quadro è reale: questa è la prima release Qwen in questa classe che gira, non solo in una recensione, su una singola workstation.

Pesi liberi, o un'API a pagamento?

La decisione che questo modello impone è quella che divide il locale dall'hosted: i pesi non costano nulla, ma le tue GPU non sono gratuite. Il self-hosting significa possedere il silicio — una scheda da 24GB se accetti la quantizzazione a 4 bit e una generazione più lenta, qualcosa di più grande se vuoi l'intero contesto di 262K a piena qualità. L'alternativa hosted su OrcaRouter costa $0,33 per milione di token in input e $2,40 per milione in output, con lo stesso contesto di 262K e input di immagini e video, e un tempo al primo token p50 di 225ms misurato negli ultimi sette giorni — nessuna GPU da comprare, nessuna VRAM da sorvegliare. L'aritmetica è quella che fai sempre con i pesi aperti: il throughput di token di cui hai effettivamente bisogno moltiplicato per il tuo costo per token, contro il prezzo fisso di una scheda. A volumi elevati e sostenuti, il self-hosting vince; a volumi intermittenti o modesti, pagare $0,33/$2,40 batte l'acquisto di silicio che resta per lo più inattivo.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Il risultato finale

Qwen3.8-27B è il modello open-weights più potente che Alibaba abbia mai rilasciato in questa classe di dimensioni, stando ai numeri di Alibaba stessa: il migliore della tabella per coding agentico, uso del computer e ragionamento visivo, con una finestra di contesto di 262K e pesi Apache 2.0. La lettura corretta della scheda di valutazione è condizionale: ogni dato è dichiarato dal vendor, specifico per l'harness di test e finora non riprodotto in modo indipendente, e i modelli frontier vincono ancora nei benchmark di ragionamento più difficili. Se devi decidere se ospitarlo da solo (self-host) o chiamarlo come API, tratta la tabella dei benchmark come una promessa e i dati di throughput AMD come l'unica misurazione indipendente esistente oggi. Aggiorneremo questa pagina il giorno in cui un laboratorio indipendente pubblicherà un punteggio.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube