Karta tytułowa hero dla 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B' z podtytułem 'Gęsty złoty środek czy flagowy MoE w tej samej cenie', pokazująca dwie ikony stosów modeli ze znakiem równości między nimi oraz dwa identyczne chipy cenowe oznaczone $0.074 / $0.295, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: Dense Sweet Spot czy flagowiec MoE w tej samej cenie?

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Oto zaskoczenie w sercu tego zestawienia: Tencent Hy-MT2-7B, gęsty model 7B, oraz Tencent Hy-MT2-30B-A3B, flagowy model mieszaniny ekspertów z 30 miliardami parametrów łącznie i około 3 miliardami aktywnych, oba stały się dostępne przez hostowane API w tym tygodniu — 7B około 19 sierpnia 2026 roku, a 30B-A3B dzień później, oba obsługiwane przez Tencent Cloud — w dokładnie tej samej cenie: 0,074 USD za milion tokenów wejściowych i 0,295 USD za milion tokenów wyjściowych. Rodzina została udostępniona jako open-source razem 21 maja 2026 roku, więc żaden z modeli nie jest nowością; to identyczna cena API czyni to porównanie naprawdę dziwnym. Zwykle większy model kosztuje więcej i trzeba rozważyć dopłatę w kontekście zysku. Tutaj flagowy model nie kosztuje ani grosza więcej za token, a decyzja sprowadza się do jednego pytania: co, jeśli w ogóle cokolwiek, traci model 7B, będąc gęstym i małym?

Zaskoczenie tą samą ceną

Równość cenowa modelu 30B-A3B to dowód, że okazja MoE spełnia swoje zadanie. Jego architektura przechowuje 30B wiedzy, ale aktywuje tylko około 3B na token, dzięki czemu Tencent Cloud może go udostępniać w tej samej stawce za token co 7B — te same $0.074 / $0.295, ten sam kontekst 8192 tokenów, to samo wsparcie dla wyjścia strukturalnego i ten sam brak możliwości wywoływania funkcji. W API model „professional” nie jest droższy. Haczyk przenosi się gdzie indziej: do zajętości pamięci, złożoności serwowania i opóźnień, gdzie gęstszy i prostszy design 7B ma strukturalne przewagi, których cena za token nie jest w stanie wyrazić.

Specyfikacje obok siebie

Architektura — gęsty ~7B vs MoE 30B łącznie / ~3B aktywnych.

Cena API — $0.074 / $0.295 w porównaniu z $0.074 / $0.295 za 1M tokenów (identyczna).

Kontekst — oba po 8 192 tokeny.

Pozycjonowanie — wyważony złoty środek kontra profesjonalny flagowiec.

FLORES-200 — 7B: 86,89 XCOMET-XXL, ≈97,9% wyniku Gemini 3.1 Pro (Think); 30B-A3B: najlepszy wynik rodziny w tłumaczeniu ogólnym (dane podane przez producenta).

Porównanie Deep​Seek / K​imi — oba pokonują DeepSeek-V4-Pro i Kimi K2.6 w trybie szybkiego myślenia, według producenta.

Zajętość — pojedynczy A100 / RTX 4090 vs wagi o skali 30B (skwantowana wersja klasy 18 GB na dysku i więcej w VRAM).

Domyślne ustawienia inferencji — temp 0.7, top_p 0.6, top_k 20 vs temp 0.7, top_p 1.0, top_k -1.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B — the scoreboard'. Left column Hy-MT2-7B: Architecture dense 7B; API price $0.074 / $0.295; FLORES-200 86.89; Context 8,192; Footprint single GPU; Role balanced sweet spot. Right column Hy-MT2-30B-A3B: Architecture MoE 30B / 3B active; API price $0.074 / $0.295; FLORES-200 tops the family; Context 8,192; Footprint data-center VRAM; Role professional-grade. Footer: Prices identical as listed Aug 2026; figures vendor-reported.

Gdzie 30B-A3B faktycznie wygrywa

Tencent pozycjonuje model 30B-A3B jako członka rodziny klasy profesjonalnej, a publikowane przez niego dowody potwierdzają tę etykietę w przypadku określonego rodzaju tekstu. W materiałach o dużej specjalistycznej gęstości — klauzulach prawnych, tekstach medycznych, dokumentacji technicznej — jego linia GEMBA na DomainMTBench jest najmocniejsza w rodzinie, osiągając około 99% poziomu bazowego Gemini 2.5 Pro, a wynik tłumaczenia ogólnego przewyższa model 7B na własnej krzywej FLORES rodziny. Te uśpione 27B dodatkowej wiedzy to dokładnie ten rodzaj zdolności, który ujawnia się, gdy zdanie niesie gęstą terminologię, a nie zwykłą prozę: klauzula umowy „zobowiązanie do odszkodowania pozostaje w mocy po rozwiązaniu umowy” nie obciąża zbytnio modelu 7B, ale pełny dokument M&A ze słownikiem pojęć już tak. Model 30B-A3B to również najbezpieczniejszy wybór dla par językowych z chińskiego na języki mniejszościowe (tybetański, ujgurski, mongolski), gdzie Tencent raportuje swoje najlepsze wyniki.

Gdzie 7B i tak wygrywa

Zalety 7B mają charakter operacyjny i są realne. Po pierwsze, self-hosting: 7B mieści się na pojedynczym A100 lub RTX 4090 i ma najszersze pokrycie frameworków — Transformers, vLLM, SGLang oraz llama.cpp przez GGUF wszystkie są wykorzystywane. 30B-A3B, nawet skwantowany, wymaga pamięci VRAM w skali centrum danych i mniej osób przepuściło go przez produkcyjne stacki serwujące. Po drugie, latencja i prostota serwowania: gęsty 7B łatwiej utrzymać w gotowości, a jego zalecane próbkowanie jest bliższe standardowemu dekodowaniu. Po trzecie, w API identyczna cena oznacza, że 7B kosztuje dokładnie tyle samo za token co model flagowy — więc jedynym powodem, by wybrać mniejszy model, jest to, że przy czystym tekście ogólnym różnica jakości jest zbyt mała, by ją zauważyć. 7B osiąga już około 97,9% wyniku Gemini 3.1 Pro (Think) na FLORES-200; dodatkowe punkty modelu flagowego znajdują się na krzywej, gdzie każdy kolejny jest trudniejszy do zauważenia w praktyce.

Luka, uczciwie zmierzona

Wszystko w dwóch ostatnich sekcjach to własna ocena Tencentu, a uczciwy sposób jej odczytania jest taki: oba modele są na tyle zbliżone w zwykłym tłumaczeniu, że o wyborze decyduje Twój korpus. W przypadku ogólnego czystego tekstu wynik ~97,9% względem Gemini dla modelu 7B oznacza, że przewaga flagowca mierzy się w niewielkich ułamkach XCOMET — realna na liście rankingowej, ale trudna do odczucia w zgłoszeniu do wsparcia. W gęstych tekstach specjalistycznych i parach języków mniejszościowych deklarowane przewagi flagowca w GEMBA i FLORES są dokładnie tam, gdzie profesjonalny tłumacz (człowiek lub model) zarabia na swoje utrzymanie i gdzie ponowne tłumaczenie jest najdroższe. W chwili pisania tego tekstu nie istnieje niezależny benchmark dla żadnego z tych modeli; jedyną rzeczą, co do której obie karty od dostawców są zgodne, jest to, że każdy rozmiar pokonuje DeepSeek-V4-Pro i Kimi K2.6 w trybie szybkiego myślenia tej rodziny.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-30B-A3B (captured August 23 2026) showing the MoE architecture (30B total / 3B active), Apache-2.0 license, and the professional-grade positioning.

Kierowanie rodziną

Żaden z tych modeli nie znajduje się w katalogu OrcaRouter w chwili pisania tego tekstu, więc oba są udostępniane przez chmurę Tencenta oraz kilka platform zewnętrznych. Najbardziej praktyczna lekcja pozostaje jednak ta o routingu. Ponieważ ceny API są identyczne, to podręcznikowy przypadek routingu obciążenia, a nie wyboru pojedynczego modelu: wyślij wysokowolumenowy segment tłumaczeń ogólnych do modelu 7B, a gęsty, specjalistyczny segment do 30B-A3B, z automatycznym przełączaniem awaryjnym, aby skok opóźnień na punkcie końcowym MoE nigdy nie zatrzymywał potoku. Taki właśnie wzorzec komponuje DSL routingu OrcaRouter wśród ponad 200 modeli, które mamy w ofercie — przydział zadań ważony kosztami, cena katalogowa dostawcy przekazywana dalej z zerową marżą — i pasuje on do tej rodziny lepiej niż do większości innych, ponieważ dostawca wycenił oba poziomy tak, aby podział był ekonomicznie neutralny.

Werdykt

Przy identycznych cenach API, domyślną odpowiedzią jest 7B: ten sam koszt za token, prostsze samodzielne hostowanie i niemal identyczna jakość w ogólnym tekście. Wybierz 30B-A3B, gdy korpus jest profesjonalnie gęsty — prawniczy, medyczny, techniczny lub tłumaczenia z języków mniejszościowych — gdzie deklarowana przewaga domenowa flagowego modelu jest warta większego rozmiaru i opóźnienia. A jeśli Twoje obciążenie to mieszanka obu, nie wybieraj: skieruj ogólną część do 7B, a trudną do flagowego modelu. To nie jest kompromis między nimi; to jedyny sposób, aby uzyskać oba w cenie ustalonej przez Tencent.

A generated infographic titled 'Same price, different model' with two identical cards both labelled '$0.074 / $0.295 per 1M tokens': one 'Dense 7B — simpler to serve, near-flagship on clean text', the other 'MoE 30B-A3B — 30B knowledge, 3B active, professional domains', with the footer 'The MoE bargain: bigger model, same per-token cost.'

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube