
Qwen3.8-27B Benchmarks: La tabella completa, con le relative avvertenze
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Qwen/Qwen3.8-27B ottiene 73.0 su Terminal-Bench 2.1, 61.7 su SWE-bench Pro, 90.3 su LiveCodeBench v6 e 84.3 su OSWorld-Verified — e ciascuno di questi numeri è di Alibaba stessa. Il modello open-weights da 27 miliardi di parametri è arrivato su Hugging Face il 14 agosto 2026 con licenza Apache 2.0 e, nelle sue prime due settimane, ha raccolto tre risultati indipendenti di terze parti: il primo posto per open-weights nel benchmark Legal Agent di Harvey, in uno studio condotto dall'azienda di legal AI Harvey e dalla società di memoria Engram; un nono posto complessivo nella classifica WebDev di Code Arena, l'unico modello della sua fascia dimensionale nella top 10, secondo l'annuncio di Alibaba del 25 agosto; e, annunciato il 26 agosto, il primo posto per open-weights nella classifica Image-to-WebDev di Arena.ai, settimo complessivo con un punteggio dichiarato di 1.574. Questa pagina è il resoconto completo e con fonti: tutti i 25 benchmark ufficiali della model card, cosa è cambiato rispetto al predecessore Qwen3.6-27B, cosa ha misurato un test indipendente di throughput di AMD, quei risultati su legal-agent e webdev-arena, e quali affermazioni dovresti ancora considerare provvisorie.
Guida alla lettura prima dei numeri: "ufficiale" qui indica la valutazione di Alibaba riportata sulla scheda del modello Qwen/Qwen3.8-27B. È dichiarata dal fornitore e non replicata. "Indipendente" significa che l'ha misurata qualcuno esterno al laboratorio — finora ciò comprende un test di throughput hardware, uno studio su agenti in ambito legale e posizionamenti su due classifiche di sviluppo web di Arena.ai, la WebDev di Code Arena e l'arena Image-to-WebDev. I benchmark in cui l'harness è rilevante sono segnalati nel testo.
Il modello, una riga per specifica
• 27B parametri densi (28B contando l'encoder visivo), 64 livelli, dimensione nascosta 5120.
• Attenzione ibrida — 48 livelli di attenzione lineare Gated DeltaNet più 16 livelli di attenzione completa, un rapporto 3:1 — che è ciò che rende conveniente eseguire una finestra di 262K token.
• 262.144 token di contesto nativo, estensibile a 1.000.000 con lo scaling YaRN.
• Input nativo di immagini e video (output di testo), pesi Apache 2.0, circa 55,6 GB in BF16.
La versione breve: questo è il modello pensato per prendere ciò che Alibaba ha imparato costruendo il Qwen3.8-Max da 2,4 trilioni di parametri e comprimerlo in qualcosa che una singola GPU possa eseguire.
La scheda di valutazione: ogni benchmark sulla scheda del modello
Tutti i punteggi riportati di seguito provengono dalla scheda modello del 14 agosto pubblicata da Alibaba, con il punteggio del modello Qwen3.6-27B sostituito tra parentesi.
Codifica. Terminal-Bench 2.1 (codifica terminale agentica) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Le esecuzioni di SWE-bench Pro e QwenSWEBench hanno usato l'harness Claude Code, come indicato in una nota a piè di pagina della scheda del modello — da tenere a mente prima di confrontarle con un modello valutato con un'harness diversa.
Agenti a lungo orizzonte e lavoro d'ufficio. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / punteggio 42.9 (10.6 / 27.3).
Ragionamento e conoscenza. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). L'HLE è valutato da GPT-4o, secondo la scheda.
Visione e utilizzo del computer.OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 con CI / 90.0 senza (85.1); BabyVision 85.6 con CI / 65.7 senza (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" è il potenziamento in fase di inferenza di Alibaba; il divario tra il suo stato attivo e quello disattivo è il singolo numero più informativo sulla scheda per capire quanto punteggio si può comprare con potenza di calcolo aggiuntiva per l'inferenza.

Cosa è effettivamente cambiato rispetto a Qwen3.6-27B
Ogni benchmark sulla scheda è salito, ma le differenze non sono uniformi — e la forma del miglioramento è la storia. I guadagni si concentrano nel coding agente e nell'uso del computer, non nel richiamo di conoscenza:
• DeepSWE 1.1 (codifica agentica) 13.3 → 42.2, circa un salto di 3x
• QwenSWEBench 49.3 → 79.0
• Punteggio Agents' Last Exam 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 e AndroidWorld 70.3 → 81.9
• BabyVision (con CI) 28.9 → 85.6 — il maggiore guadagno relativo sulla scheda
Nel frattempo, GPQA Diamond è passato da 87.8 a 89.2 e RealWorldQA da 84.1 a 85.9: miglioramenti reali ma piccoli. Non è una release “più intelligente in tutto”. È una release mirata direttamente agli agenti che leggono schermi, usano strumenti e scrivono codice in molti passaggi.

Il primo risultato indipendente: #1 open-weight sul benchmark Legal Agent di Harvey
Da quando questa pagina è stata pubblicata, lo sviluppo più importante è di natura legale, non tecnica. Alibaba ha annunciato che Qwen3.8-27B è il modello open-weight n. 1 nel benchmark Legal Agent di Harvey — un'affermazione di ranking che proviene direttamente dal fornitore, quindi da considerare come dichiarata da Alibaba. Dietro questo risultato c'è uno studio che non è di Alibaba: Harvey, l'azienda di AI legale, ed Engram, una startup di memoria per l'AI, hanno costruito uno studio legale sintetico chiamato Calderwood & Harkness a partire da oltre 100 milioni di token distribuiti su circa 10.000 documenti e 266 pratiche, per poi adattare Qwen3.8-27B a esso con memoria parametrica, note compresse e uno strumento di retrieval.
Su 250 compiti legali, il 27B adattato ha ottenuto una media del 67%, superando tutti i modelli testati nello studio — incluso Claude Opus 4.8 — e su una correttezza rigorosa del tipo tutto-o-niente ha superato Opus 4.8 con il 30% contro il 25%, a circa $0,13 per query rispetto a $1,32 per Opus 4.8. Questi dati sono riportati da Harvey/Engram e non sono ancora stati riprodotti in modo indipendente. Prima dell'addestramento sui documenti interni dello studio, lo stesso modello aveva ottenuto solo il 4,7% su domande specifiche dello studio; dopo averli studiati, il 72,6%.
Leggi il {{1}}#1{{/1}} con una grossa avvertenza: il modello che ha dominato il benchmark aveva studiato in anticipo il corpus di test, essendo stato adattato sui 100M token dell’azienda prima della valutazione. Questo lo rende una dimostrazione di ciò che il 27B può assorbire con un tuning specifico per il dominio, non un punteggio per i pesi stock Apache-2.0 su un harness neutro — e copre un solo dominio, il diritto, non la qualità generale. Ciò che invece supporta è la tesi alla base del tweet: un {{2}}27B{{/2}} abbastanza piccolo da girare su una macchina locale è abbastanza potente per un lavoro di livello professionale, una volta che ha le conoscenze giuste.
Il secondo risultato indipendente: #9 complessivo su WebDev di Code Arena
Il secondo risultato indipendente è di tipo coding, ed è il motivo per cui questa pagina è cambiata il 25 agosto. Code Arena è la classifica di sviluppo web di Arena.ai — il progetto precedentemente noto come WebDev Arena, sul sito precedentemente noto come LMArena — dove gli utenti creano app reali con coppie anonimizzate di modelli e votano quale output preferirebbero pubblicare. In quella classifica pubblica, Qwen3.8-27B si trova al #9 assoluto con un punteggio di 1595, l'unico modello della sua classe dimensionale all'interno della top 10.
Il posizionamento è la parte indipendente — si trova in una classifica di terze parti che chiunque può aprire. Il titolo che lo circonda è dichiarato da Alibaba: l'inquadramento dell'"unico modello piccolo nella top 10" e i posizionamenti associati provengono dall'annuncio del 25 agosto di Qwen. Valgono la pena di essere ripetuti con quella etichetta. Il 27B si colloca sei posizioni sotto il molto più grande Qwen3.8-Max (che l'annuncio colloca al #3 complessivo), e ben davanti al Gemma 4-31B di dimensioni simili (che lo stesso annuncio colloca al #80). Il punto non è che un 27B batta i modelli all'avanguardia nella creazione di web app; è che un modello abbastanza piccolo da girare su una singola GPU rientra nella top ten di un'arena di coding cieca i cui altri occupanti sono modelli molto più grandi.
Il terzo risultato indipendente: #1 modello open su Image-to-WebDev di Arena.ai
Il terzo risultato indipendente è arrivato il 26 agosto, ed è il più forte finora per un modello di queste dimensioni. Image-to-WebDev è la scheda gemella di WebDev di Code Arena su Arena.ai — l'arena dove a un modello viene fornito uno screenshot o altro riferimento visivo e deve trasformarlo in un'interfaccia web funzionante, con votanti umani all'oscuro che scelgono il risultato che preferirebbero pubblicare. In quella classifica pubblica, Qwen3.8-27B è al primo posto tra i modelli open e al settimo in assoluto, con un punteggio in arena riportato di 1.574.
La posizione è la parte indipendente — si trova su una classifica di terze parti che chiunque può aprire. Il titolo che la accompagna è una dichiarazione di Alibaba: l'annuncio del 26 agosto del team Qwen presenta il 27B come "alla pari con modelli 100 volte più grandi" in questo test, un confronto che la classifica non documenta. E una classifica di preferenze non è un verdetto sulla qualità del codice — i voti di Image-to-WebDev misurano quale output un essere umano preferirebbe pubblicare, non se l'HTML è sicuro, accessibile o manutenibile. Ciò che il risultato stabilisce è che un modello open-weights da 27B ora è in testa all'intero panorama open nel trasformare un'immagine in una pagina, la capacità su cui si fonda una crescente categoria di prodotti "screenshot to site".
Le lacune oneste: dove perde ancora, e le avvertenze metodologiche
Rispetto alla frontiera, il quadro è lusinghiero ma non unilaterale. Dove Qwen3.8-27B e Claude Opus 4.6 Max si sovrappongono, Qwen vince la maggioranza — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench e l'intero blocco di visione. Contro il Muse Glimmer-30B di Meta, il naturale rivale di classe locale, vince tutti e otto i benchmark sovrapposti su tutta la linea. Ma perde ancora Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) e NL2Repo-Bench (42.3 vs 47.6) contro Claude Opus 4.6 Max. Se il tuo carico di lavoro è il ragionamento di frontiera più difficile — matematica di frontiera, domande massivamente multidisciplinari — il 27B non è ancora all'altezza.
Tre avvertenze prima di citare qualunque cosa di tutto questo. Primo, la tabella della scheda del modello qui sopra è ancora interamente riportata da Alibaba — non esiste ancora un indice Artificial Analysis per la 27B. Ora ci sono tre risultati indipendenti di terze parti, ma ciascuno è limitato: la classifica Code Arena misura la creazione di web app da prompt di testo, la classifica Image-to-WebDev misura la trasformazione di uno screenshot in una pagina funzionante, entrambe giudicate con voti alla cieca su output anonimizzati, e lo studio Harvey sull'agent legale copre un singolo dominio con un modello addestrato per il test. Nessuno di essi è l'esecuzione dei pesi originali su un harness generico. Secondo, la scheda del modello usa l'harness Claude Code per SWE-bench Pro e QwenSWEBench e un giudice GPT-4o per Humanity's Last Exam — i confronti con modelli valutati su altre configurazioni sposteranno i numeri. Terzo, l'esecuzione MathVision di Alibaba ha usato un prompt fisso mentre i concorrenti hanno ottenuto la più alta di due varianti. Nulla di tutto ciò significa che i risultati siano sbagliati; significa che sono un tetto, non un pavimento, finché laboratori indipendenti non eseguiranno il modello su harness generici neutrali.
Cosa serve per eseguirlo
Qwen3.8-27B è un modello locale, il che cambia il significato di "prestazioni": throughput sul proprio hardware invece di una scheda di prezzo. I pesi BF16 sono circa 55,6 GB; quantizzati a 4 bit, entrano in una scheda da 24 GB come una RTX 3090 o 4090. AMD ha fornito supporto Day-0 il giorno del lancio, e le sue misurazioni llama.cpp/Vulkan — agosto 2026, media di tre o più esecuzioni — indicano 24,5 token/s su una Ryzen AI Max+ 395 e 51,8 token/s su una Radeon AI PRO R9700 con 32 GB, su sistemi con più di circa 24 GB di memoria grafica variabile o VRAM. I test della community sulla build FP8 su un NVIDIA GH200 hanno gestito 10 richieste concorrenti con contesto da 262K con un time-to-first-token inferiore a 10 ms. I tuoi numeri saranno diversi — quelle sono GPU di altri — ma il quadro è reale: questa è la prima release di Qwen in questa classe che gira, non solo in una recensione, su una singola workstation.
Pesi liberi, o un'API a pagamento?
La decisione che questo modello impone è quella che divide il locale dall'hosted: i pesi non costano nulla, ma le tue GPU non sono gratuite. Il self-hosting significa possedere il silicio — una scheda da 24GB se accetti la quantizzazione a 4 bit e una generazione più lenta, qualcosa di più grande se vuoi l'intero contesto di 262K a piena qualità. L'alternativa hosted su OrcaRouter costa $0,33 per milione di token in input e $2,40 per milione in output, con lo stesso contesto di 262K e input di immagini e video, e un tempo al primo token p50 di 225ms misurato negli ultimi sette giorni — nessuna GPU da comprare, nessuna VRAM da sorvegliare. L'aritmetica è quella che fai sempre con i pesi aperti: il throughput di token di cui hai effettivamente bisogno moltiplicato per il tuo costo per token, contro il prezzo fisso di una scheda. A volumi elevati e sostenuti, il self-hosting vince; a volumi intermittenti o modesti, pagare $0,33/$2,40 batte l'acquisto di silicio che resta per lo più inattivo.

Il risultato finale
Qwen3.8-27B è il modello open-weights più forte che Alibaba abbia messo in questa classe di dimensioni, secondo i numeri di Alibaba stessa: il migliore in classifica per il coding agentico, l'uso del computer e il ragionamento visivo, con una finestra di contesto di 262K e pesi Apache 2.0. La lettura corretta della scheda dei punteggi è condizionale: ogni dato riportato nella scheda del modello è dichiarato dal fornitore, specifico per l'harness, e non ancora riprodotto, e i modelli di frontiera vincono ancora i benchmark di ragionamento più difficili. Se stai decidendo se auto-ospitarlo o chiamarlo tramite API, tratta la tabella dei benchmark come la promessa, i dati di throughput AMD come la prima misurazione hardware indipendente, il risultato di Harvey legal-agent come il primo segno indipendente che le capacità del modello sopravvivono al di fuori degli harness di Alibaba stessa, e i due piazzamenti nella webdev-arena — #9 in assoluto su WebDev di Code Arena e #1 modello open su Image-to-WebDev di Arena.ai — come le prime conferme indipendenti su classifiche di coding di quella capacità. Aggiorneremo questa pagina man mano che altri laboratori indipendenti pubblicheranno punteggi.
