
Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: Der dichte Sweet Spot oder das MoE-Flaggschiff zum gleichen Preis
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
Hier ist die Überraschung im Zentrum dieses Vergleichs: Tencent Hy-MT2-7B, ein dichtes 7B-Modell, und Tencent Hy-MT2-30B-A3B, das Mixture-of-Experts-Flaggschiff mit insgesamt 30 Milliarden Parametern und rund 3 Milliarden aktiven Parametern, wurden beide in dieser Woche über gehostete APIs ansprechbar – das 7B etwa am 19. August 2026, das 30B-A3B einen Tag später, beide von Tencent Cloud bereitgestellt – zum exakt gleichen Preis: $0.074 pro Million Input-Token und $0.295 pro Million Output-Token. Die Familie wurde gemeinsam am 21. Mai 2026 als Open Source veröffentlicht, keines der Modelle ist also neu; der identische API-Preis ist es, der diesen Vergleich wirklich seltsam macht. Normalerweise kostet das größere Modell mehr, und man wägt die Prämie gegen den Nutzen ab. Hier kostet das Flaggschiff pro Token nicht mehr, und die Entscheidung schrumpft auf eine einzige Frage: Was, wenn überhaupt, gibt das 7B dadurch auf, dass es dicht und klein ist?
Die Überraschung zum gleichen Preis
Die Preisparität des 30B-A3B ist das MoE-Schnäppchen, das seinen Zweck erfüllt. Seine Architektur speichert 30B an Wissen, aktiviert aber nur etwa 3B pro Token, sodass Tencent Cloud es zum gleichen Preis pro Token anbieten kann wie das 7B — gleiche $0,074 / $0,295, gleicher 8.192-Token-Kontext, gleiche Unterstützung für strukturierte Ausgaben, gleiche Einschränkung: keine Funktionsaufrufe. In der API ist das „Professional“-Modell nicht teurer. Der Haken verlagert sich woandershin: auf Speicherbedarf, Serving-Komplexität und Latenz, wo das dichtere, einfachere Design des 7B strukturelle Vorteile hat, die ein Preis pro Token nicht ausdrücken kann.
Technische Daten im Vergleich
• Architektur — dicht ~7B vs. MoE 30B gesamt / ~3B aktiv.
• API-Preis — $0.074 / $0.295 vs. $0.074 / $0.295 pro 1M Token (identisch).
• Kontext — beide 8.192 Tokens.
• Positionierung — ausgewogener Sweet Spot vs. Profi-Flaggschiff.
• FLORES-200 — 7B: 86,89 XCOMET-XXL, ≈97,9 % von Gemini 3.1 Pro (Think); 30B-A3B: das beste allgemeine Übersetzungsergebnis der Modellfamilie (vom Anbieter gemeldete Zahlen).
• DeepSeek / Kimi Vergleich — beide übertreffen DeepSeek-V4-Pro und Kimi K2.6 im Fast-Thinking-Modus, laut Herstellerangaben.
• Speicherbedarf — eine einzelne A100 / RTX 4090 im Vergleich zu Gewichten im 30B-Maßstab (ein quantisierter Build der 18-GB-Klasse auf der Festplatte und mehr im VRAM).
• Inferenz-Standardwerte — temp 0.7, top_p 0.6, top_k 20 gegenüber temp 0.7, top_p 1.0, top_k -1.

Wo das 30B-A3B tatsächlich gewinnt
Tencent positioniert das 30B-A3B als das professionelle Mitglied der Familie, und die veröffentlichten Belege stützen diese Bezeichnung für eine bestimmte Art von Text. Bei domainlastigem Material – juristischen Klauseln, medizinischen Texten, technischer Dokumentation – ist seine GEMBA-Linie auf DomainMTBench die stärkste der Familie, mit einem berichteten Wert von etwa 99 % der Gemini-2.5-Pro-Baseline, und sein allgemeiner Übersetzungswert übertrifft den des 7B auf der familieneigenen FLORES-Kurve. Diese ruhenden 27B an zusätzlichem Wissen sind genau die Art von Kapazität, die sich zeigt, wenn ein Satz dichte Terminologie statt gewöhnlicher Prosa enthält: Eine Vertragsklausel wie „indemnification shall survive termination“ fordert ein 7B-Modell kaum heraus, aber ein vollständiges M&A-Dokument mit einem Glossar eben schon. Das 30B-A3B ist auch die sicherste Wahl für Sprachpaare vom Chinesischen in Minderheitensprachen (Tibetisch, Uigurisch, Mongolisch), wo Tencent seine besten Werte meldet.
Wo die 7B trotzdem gewinnt
Die Vorteile der 7B sind operativer Natur, und sie sind real. Erstens Self-Hosting: Die 7B passt auf eine einzelne A100 oder RTX 4090 und hat die breiteste Framework-Abdeckung – Transformers, vLLM, SGLang und llama.cpp über GGUF werden alle genutzt. Die 30B-A3B verlangt selbst quantisiert VRAM im Rechenzentrumsmaßstab, und nur wenige haben sie durch produktive Serving-Stacks laufen lassen. Zweitens Latenz und Serving-Einfachheit: Eine dichte 7B ist leichter heiß zu halten, und ihr empfohlenes Sampling liegt näher an einem Standard-Decode. Drittens: Bei der API bedeutet der identische Preis, dass die 7B pro Token exakt so viel kostet wie das Flaggschiff – der einzige Grund, das kleinere Modell zu nehmen, ist also, dass der Qualitätsunterschied bei sauberen allgemeinen Texten zu gering ist, um ihn zu bemerken. Die 7B erreicht bereits etwa 97,9 % von Gemini 3.1 Pro (Think) bei FLORES-200; die Extrapunkte des Flaggschiffs liegen auf einer Kurve, bei der jeder weitere Punkt in der Praxis schwerer zu sehen ist.
Die Lücke, ehrlich gemessen
Alles in den letzten beiden Abschnitten ist Tencents eigene Bewertung, und die ehrliche Lesart ist, dass die beiden Modelle bei gewöhnlichen Übersetzungen so nahe beieinanderliegen, dass Ihr Korpus den Ausschlag gibt. Bei allgemeinen, sauberen Texten erreicht der 7B rund 97,9 % des Gemini-Werts – der Vorsprung des Flaggschiffs wird also in kleinen XCOMET-Bruchteilen gemessen: real in einer Rangliste, im Support-Ticket aber kaum zu spüren. Bei dichten Fachtexten und Minderheitensprachpaaren liegen die gemeldeten GEMBA- und FLORES-Vorsprünge des Flaggschiffs genau dort, wo sich ein professioneller Übersetzer (Mensch oder Modell) bezahlt macht und wo eine Neutübersetzung am teuersten ist. Zum Zeitpunkt dieses Texts gibt es für keines der beiden Modelle einen unabhängigen Benchmark; das Einzige, worin beide Datenblätter übereinstimmen, ist, dass jede Größe DeepSeek-V4-Pro und Kimi K2.6 im Fast-Thinking-Modus der Familie schlägt.

Die Familie weiterleiten
Keines der beiden Modelle ist derzeit in OrcaRouters Katalog gelistet, daher werden beide über Tencents eigene Cloud und mehrere Drittanbieter-Plattformen angeboten. Die Lektion zum Routing bleibt dennoch die praxisrelevante. Da die API-Preise identisch sind, ist das ein Paradebeispiel für Workload-Routing anstatt der Festlegung auf ein einzelnes Modell: Senden Sie den mengenintensiven Anteil für allgemeine Übersetzungen an die 7B und den dichten, domänenintensiven Anteil an die 30B-A3B, mit automatischem Failover, damit ein Latenzanstieg am MoE-Endpunkt die Pipeline niemals zum Stillstand bringt. Genau dieses Muster setzt OrcaRouters Routing-DSL bei den über 200 Modellen um, die wir führen — kostengewichtete Verteilung, wobei der Listenpreis des jeweiligen Anbieters mit 0 % Aufschlag durchgereicht wird — und es passt besser zu dieser Modellfamilie als zu den meisten anderen, weil der Anbieter die beiden Preisstufen so kalkuliert hat, dass die Aufteilung wirtschaftlich neutral ist.
Das Urteil
Bei identischen API-Preisen ist die 7B die Standardwahl: gleiche Kosten pro Token, einfacher selbst zu hosten und bei allgemeinem Text punktgleich. Greifen Sie zur 30B-A3B, wenn das Korpus fachlich dicht ist – juristische, medizinische, technische oder Minderheitensprachen-Übersetzung –, wo der berichtete Domänenvorteil des Flaggschiffs den größeren Fußabdruck und die Latenz rechtfertigt. Und wenn Ihre Arbeitslast eine Mischung aus beidem ist, treffen Sie keine Wahl: Leiten Sie den allgemeinen Teil an die 7B und den schwierigen Teil an das Flaggschiff. Das ist kein Kompromiss zwischen den beiden; es ist der einzige Weg, beide zum Preis zu bekommen, den Tencent festgelegt hat.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
