
Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: Il punto ottimale dei modelli densi o l'ammiraglia MoE allo stesso prezzo
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
Ecco la sorpresa al centro di questo confronto: Tencent Hy-MT2-7B, un modello denso da 7B, e Tencent Hy-MT2-30B-A3B, il modello di punta mixture-of-experts con 30 miliardi di parametri totali e circa 3 miliardi attivi, sono entrambi diventati chiamabili tramite API ospitate questa settimana — il 7B intorno al 19 agosto 2026, il 30B-A3B un giorno dopo, entrambi serviti da Tencent Cloud — allo stesso identico prezzo: $0,074 per milione di token di input e $0,295 per milione di output. La famiglia è stata rilasciata insieme come open source il 21 maggio 2026, quindi nessuno dei due modelli è nuovo; è il prezzo API identico a rendere questo confronto davvero strano. Di solito il modello più grande costa di più e si valuta il sovrapprezzo rispetto al guadagno. Qui il modello di punta non costa nulla in più per token, e la decisione si riduce a un'unica domanda: cosa, semmai, il 7B perde per essere denso e piccolo?
La sorpresa dello stesso prezzo.
The 30B-A3B's price parity is the MoE bargain doing its job. Its architecture holds 30B of stored knowledge but activates only about 3B per token, so Tencent Cloud can serve it at the same per-token rate as the 7B — same $0.074 / $0.295, same 8,192-token context, same structured-output support, same no-function-calling limitation. On the API, the "professional" model is not more expensive. The catch moves elsewhere: into memory footprint, serving complexity, and latency, where the 7B's denser, simpler design has structural advantages that a per-token price cannot express.
Specifiche a confronto
• Architettura — dense ~7B vs MoE 30B totali / ~3B attivi.
• prezzo API — $0.074 / $0.295 vs $0.074 / $0.295 per 1 milione di token (identico).
• Contesto — entrambi 8.192 token.
• Posizionamento — punto di equilibrio ottimale vs ammiraglia di livello professionale.
• FLORES-200 — 7B: 86.89 XCOMET-XXL, ≈97.9% di Gemini 3.1 Pro (Think); 30B-A3B: il miglior punteggio di traduzione generale della famiglia (dati dichiarati dal fornitore).
• confronto DeepSeek / Kimi — entrambi superano DeepSeek-V4-Pro e Kimi K2.6 in modalità di pensiero rapido, secondo quanto riportato dal fornitore.
• Ingombro — singola A100 / RTX 4090 vs pesi su scala 30B (una build quantizzata di classe 18GB su disco e più in VRAM).
• Predefiniti di inferenza — temp 0.7, top_p 0.6, top_k 20 vs temp 0.7, top_p 1.0, top_k -1.

Dove il 30B-A3B vince davvero
Tencent posiziona il 30B-A3B come il membro di fascia professionale della famiglia, e le prove pubblicate confermano questa etichetta per un tipo specifico di testo. Su materiale con forte componente di dominio — clausole legali, testi medici, documentazione tecnica — la sua linea GEMBA su DomainMTBench è la più forte della famiglia, con risultati intorno al 99% del baseline di Gemini 2.5 Pro, e il suo punteggio di traduzione generale supera quello del 7B sulla curva FLORES della famiglia stessa. Quel 27B dormiente di conoscenza extra è esattamente il tipo di capacità che emerge quando una frase contiene terminologia densa anziché prosa ordinaria: la clausola "l'indennizzo sopravvive alla risoluzione" non affatica molto un modello da 7B, ma un intero documento M&A con un glossario sì. Il 30B-A3B è anche la scelta più sicura per le coppie linguistiche dal cinese alle lingue minoritarie (tibetano, uiguro, mongolo), dove Tencent riporta i suoi numeri migliori.
Dove il 7B vince comunque
I vantaggi del 7B sono operativi e reali. Primo, il self-hosting: il 7B sta su una singola A100 o RTX 4090 e ha la più ampia copertura di framework — Transformers, vLLM, SGLang e llama.cpp via GGUF sono tutti testati. Il 30B-A3B, anche quantizzato, richiede VRAM a livello di data center e in pochi lo hanno fatto passare attraverso stack di serving in produzione. Secondo, latenza e semplicità di serving: un 7B denso è più facile da tenere caldo, e la sua configurazione di sampling consigliata è più vicina a una decodifica standard. Terzo, sull'API, il prezzo identico significa che il 7B costa esattamente lo stesso per token del modello di punta — quindi l'unico motivo per scegliere il modello più piccolo è che per testo generale pulito, il divario di qualità è troppo sottile per essere notato. Il 7B è già circa il 97,9% di Gemini 3.1 Pro (Think) su FLORES-200; i punti in più del modello di punta si trovano in cima a una curva dove ciascuno è più difficile da vedere nella pratica.
Il divario, misurato onestamente
Tutto quello che c'è nelle ultime due sezioni è la valutazione di Tencent stessa, e il modo onesto di leggerla è che i due modelli sono abbastanza vicini nella traduzione ordinaria da lasciare che sia il tuo corpus a decidere. Sul testo pulito generico, il punteggio del 7B pari a circa il 97,9% di Gemini significa che il margine del modello di punta si misura in piccole frazioni di XCOMET — reale in una classifica, difficile da percepire in un ticket di supporto. Su testi di dominio densi e coppie linguistiche minoritarie, i vantaggi dichiarati di GEMBA e FLORES del modello di punta sono esattamente dove un traduttore professionista (umano o modello) si guadagna da vivere, e dove una ritraduzione è più costosa. Non esiste alcun benchmark indipendente per nessuno dei due modelli al momento in cui scriviamo; l'unica cosa su cui entrambe le schede dei fornitori concordano è che ciascuna dimensione supera DeepSeek-V4-Pro e Kimi K2.6 nella modalità di pensiero rapido della famiglia.

Instradare la famiglia
Nessuno dei due modelli è nel catalogo di OrcaRouter al momento in cui scrivo, quindi entrambi vengono serviti tramite il cloud di Tencent e diverse piattaforme di terze parti. La lezione sul routing resta comunque quella pratica. Poiché i prezzi delle API sono identici, questo è un caso da manuale per il routing del carico di lavoro piuttosto che per una scelta singola: inviare la fetta di traduzione generale ad alto volume al 7B e quella densa e ricca di dominio al 30B-A3B, con failover automatico così che un picco di latenza sull'endpoint MoE non blocchi mai la pipeline. Questo è il pattern che il DSL di routing di OrcaRouter compone tra i 200+ modelli che abbiamo in catalogo — smistamento ponderato per costo, prezzo di listino del provider trasmesso con markup allo 0% — e si adatta a questa famiglia meglio che alla maggior parte delle altre, perché il fornitore ha fissato i prezzi dei due livelli in modo da rendere la suddivisione economicamente neutra.
Il verdetto
A parità di prezzi API, la risposta predefinita è la 7B: stesso costo per token, più semplice da auto-ospitare e a un soffio dal modello più grande sui testi generici. Scegli la 30B-A3B quando il corpus è professionalmente denso — traduzione legale, medica, tecnica o in lingue minoritarie — dove il vantaggio dichiarato del modello di punta sul dominio giustifica l'ingombro maggiore e la latenza. E se il tuo carico di lavoro è un mix di entrambi, non scegliere: instrada la parte generica alla 7B e quella complessa al modello di punta. Non è un compromesso tra i due; è l'unico modo per ottenere entrambi al prezzo fissato da Tencent.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
