Eine Hero-Titelkarte für „Tencent Hy-MT2-7B vs. Tencent Hy-MT2-30B-A3B“ mit dem Untertitel „Der dichte Sweet Spot oder das MoE-Flaggschiff zum gleichen Preis“, die zwei Modellstapel-Symbole mit einem Gleichheitszeichen dazwischen und zwei identische Preisschild-Chips mit der Aufschrift $0,074 / $0,295 zeigt, mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: Der dichte Sweet Spot oder das MoE-Flaggschiff zum gleichen Preis

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Hier ist die Überraschung im Zentrum dieses Vergleichs: Tencent Hy-MT2-7B, ein dichtes 7B-Modell, und Tencent Hy-MT2-30B-A3B, das Mixture-of-Experts-Flaggschiff mit insgesamt 30 Milliarden Parametern und rund 3 Milliarden aktiven Parametern, wurden beide in dieser Woche über gehostete APIs ansprechbar – das 7B etwa am 19. August 2026, das 30B-A3B einen Tag später, beide von Tencent Cloud bereitgestellt – zum exakt gleichen Preis: $0.074 pro Million Input-Token und $0.295 pro Million Output-Token. Die Familie wurde gemeinsam am 21. Mai 2026 als Open Source veröffentlicht, keines der Modelle ist also neu; der identische API-Preis ist es, der diesen Vergleich wirklich seltsam macht. Normalerweise kostet das größere Modell mehr, und man wägt die Prämie gegen den Nutzen ab. Hier kostet das Flaggschiff pro Token nicht mehr, und die Entscheidung schrumpft auf eine einzige Frage: Was, wenn überhaupt, gibt das 7B dadurch auf, dass es dicht und klein ist?

Die Überraschung zum gleichen Preis

Die Preisparität des 30B-A3B ist das MoE-Schnäppchen, das seinen Zweck erfüllt. Seine Architektur speichert 30B an Wissen, aktiviert aber nur etwa 3B pro Token, sodass Tencent Cloud es zum gleichen Preis pro Token anbieten kann wie das 7B — gleiche $0,074 / $0,295, gleicher 8.192-Token-Kontext, gleiche Unterstützung für strukturierte Ausgaben, gleiche Einschränkung: keine Funktionsaufrufe. In der API ist das „Professional“-Modell nicht teurer. Der Haken verlagert sich woandershin: auf Speicherbedarf, Serving-Komplexität und Latenz, wo das dichtere, einfachere Design des 7B strukturelle Vorteile hat, die ein Preis pro Token nicht ausdrücken kann.

Technische Daten im Vergleich

Architektur — dicht ~7B vs. MoE 30B gesamt / ~3B aktiv.

API-Preis — $0.074 / $0.295 vs. $0.074 / $0.295 pro 1M Token (identisch).

Kontext — beide 8.192 Tokens.

Positionierung — ausgewogener Sweet Spot vs. Profi-Flaggschiff.

FLORES-200 — 7B: 86,89 XCOMET-XXL, ≈97,9 % von Gemini 3.1 Pro (Think); 30B-A3B: das beste allgemeine Übersetzungsergebnis der Modellfamilie (vom Anbieter gemeldete Zahlen).

Deep​Seek / K​imi Vergleich — beide übertreffen DeepSeek-V4-Pro und Kimi K2.6 im Fast-Thinking-Modus, laut Herstellerangaben.

Speicherbedarf — eine einzelne A100 / RTX 4090 im Vergleich zu Gewichten im 30B-Maßstab (ein quantisierter Build der 18-GB-Klasse auf der Festplatte und mehr im VRAM).

Inferenz-Standardwerte — temp 0.7, top_p 0.6, top_k 20 gegenüber temp 0.7, top_p 1.0, top_k -1.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B — the scoreboard'. Left column Hy-MT2-7B: Architecture dense 7B; API price $0.074 / $0.295; FLORES-200 86.89; Context 8,192; Footprint single GPU; Role balanced sweet spot. Right column Hy-MT2-30B-A3B: Architecture MoE 30B / 3B active; API price $0.074 / $0.295; FLORES-200 tops the family; Context 8,192; Footprint data-center VRAM; Role professional-grade. Footer: Prices identical as listed Aug 2026; figures vendor-reported.

Wo das 30B-A3B tatsächlich gewinnt

Tencent positioniert das 30B-A3B als das professionelle Mitglied der Familie, und die veröffentlichten Belege stützen diese Bezeichnung für eine bestimmte Art von Text. Bei domainlastigem Material – juristischen Klauseln, medizinischen Texten, technischer Dokumentation – ist seine GEMBA-Linie auf DomainMTBench die stärkste der Familie, mit einem berichteten Wert von etwa 99 % der Gemini-2.5-Pro-Baseline, und sein allgemeiner Übersetzungswert übertrifft den des 7B auf der familieneigenen FLORES-Kurve. Diese ruhenden 27B an zusätzlichem Wissen sind genau die Art von Kapazität, die sich zeigt, wenn ein Satz dichte Terminologie statt gewöhnlicher Prosa enthält: Eine Vertragsklausel wie „indemnification shall survive termination“ fordert ein 7B-Modell kaum heraus, aber ein vollständiges M&A-Dokument mit einem Glossar eben schon. Das 30B-A3B ist auch die sicherste Wahl für Sprachpaare vom Chinesischen in Minderheitensprachen (Tibetisch, Uigurisch, Mongolisch), wo Tencent seine besten Werte meldet.

Wo die 7B trotzdem gewinnt

Die Vorteile der 7B sind operativer Natur, und sie sind real. Erstens Self-Hosting: Die 7B passt auf eine einzelne A100 oder RTX 4090 und hat die breiteste Framework-Abdeckung – Transformers, vLLM, SGLang und llama.cpp über GGUF werden alle genutzt. Die 30B-A3B verlangt selbst quantisiert VRAM im Rechenzentrumsmaßstab, und nur wenige haben sie durch produktive Serving-Stacks laufen lassen. Zweitens Latenz und Serving-Einfachheit: Eine dichte 7B ist leichter heiß zu halten, und ihr empfohlenes Sampling liegt näher an einem Standard-Decode. Drittens: Bei der API bedeutet der identische Preis, dass die 7B pro Token exakt so viel kostet wie das Flaggschiff – der einzige Grund, das kleinere Modell zu nehmen, ist also, dass der Qualitätsunterschied bei sauberen allgemeinen Texten zu gering ist, um ihn zu bemerken. Die 7B erreicht bereits etwa 97,9 % von Gemini 3.1 Pro (Think) bei FLORES-200; die Extrapunkte des Flaggschiffs liegen auf einer Kurve, bei der jeder weitere Punkt in der Praxis schwerer zu sehen ist.

Die Lücke, ehrlich gemessen

Alles in den letzten beiden Abschnitten ist Tencents eigene Bewertung, und die ehrliche Lesart ist, dass die beiden Modelle bei gewöhnlichen Übersetzungen so nahe beieinanderliegen, dass Ihr Korpus den Ausschlag gibt. Bei allgemeinen, sauberen Texten erreicht der 7B rund 97,9 % des Gemini-Werts – der Vorsprung des Flaggschiffs wird also in kleinen XCOMET-Bruchteilen gemessen: real in einer Rangliste, im Support-Ticket aber kaum zu spüren. Bei dichten Fachtexten und Minderheitensprachpaaren liegen die gemeldeten GEMBA- und FLORES-Vorsprünge des Flaggschiffs genau dort, wo sich ein professioneller Übersetzer (Mensch oder Modell) bezahlt macht und wo eine Neutübersetzung am teuersten ist. Zum Zeitpunkt dieses Texts gibt es für keines der beiden Modelle einen unabhängigen Benchmark; das Einzige, worin beide Datenblätter übereinstimmen, ist, dass jede Größe DeepSeek-V4-Pro und Kimi K2.6 im Fast-Thinking-Modus der Familie schlägt.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-30B-A3B (captured August 23 2026) showing the MoE architecture (30B total / 3B active), Apache-2.0 license, and the professional-grade positioning.

Die Familie weiterleiten

Keines der beiden Modelle ist derzeit in OrcaRouters Katalog gelistet, daher werden beide über Tencents eigene Cloud und mehrere Drittanbieter-Plattformen angeboten. Die Lektion zum Routing bleibt dennoch die praxisrelevante. Da die API-Preise identisch sind, ist das ein Paradebeispiel für Workload-Routing anstatt der Festlegung auf ein einzelnes Modell: Senden Sie den mengenintensiven Anteil für allgemeine Übersetzungen an die 7B und den dichten, domänenintensiven Anteil an die 30B-A3B, mit automatischem Failover, damit ein Latenzanstieg am MoE-Endpunkt die Pipeline niemals zum Stillstand bringt. Genau dieses Muster setzt OrcaRouters Routing-DSL bei den über 200 Modellen um, die wir führen — kostengewichtete Verteilung, wobei der Listenpreis des jeweiligen Anbieters mit 0 % Aufschlag durchgereicht wird — und es passt besser zu dieser Modellfamilie als zu den meisten anderen, weil der Anbieter die beiden Preisstufen so kalkuliert hat, dass die Aufteilung wirtschaftlich neutral ist.

Das Urteil

Bei identischen API-Preisen ist die 7B die Standardwahl: gleiche Kosten pro Token, einfacher selbst zu hosten und bei allgemeinem Text punktgleich. Greifen Sie zur 30B-A3B, wenn das Korpus fachlich dicht ist – juristische, medizinische, technische oder Minderheitensprachen-Übersetzung –, wo der berichtete Domänenvorteil des Flaggschiffs den größeren Fußabdruck und die Latenz rechtfertigt. Und wenn Ihre Arbeitslast eine Mischung aus beidem ist, treffen Sie keine Wahl: Leiten Sie den allgemeinen Teil an die 7B und den schwierigen Teil an das Flaggschiff. Das ist kein Kompromiss zwischen den beiden; es ist der einzige Weg, beide zum Preis zu bekommen, den Tencent festgelegt hat.

A generated infographic titled 'Same price, different model' with two identical cards both labelled '$0.074 / $0.295 per 1M tokens': one 'Dense 7B — simpler to serve, near-flagship on clean text', the other 'MoE 30B-A3B — 30B knowledge, 3B active, professional domains', with the footer 'The MoE bargain: bigger model, same per-token cost.'

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube