การ์ดไตเติลหลักสำหรับ 'Tencent Hy-MT2-7B เทียบกับ Tencent Hy-MT2-30B-A3B' พร้อมคำบรรยายใต้หัวเรื่องว่า 'จุดหวานแบบ Dense หรือเรือธงแบบ MoE ในราคาเดียวกัน' แสดงไอคอนสแตกโมเดลสองตัวที่มีเครื่องหมายเท่ากับอยู่ระหว่างกลาง และแท็กป้ายราคาที่เหมือนกันสองอันระบุ $0.074 / $0.295 พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Tencent Hy-MT2-7B เทียบกับ Tencent Hy-MT2-30B-A3B: จุดหวานแบบ Dense หรือเรือธง MoE ในราคาเดียวกัน

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

นี่คือสิ่งที่น่าประหลาดใจใจกลางของการเปรียบเทียบครั้งนี้: Tencent Hy-MT2-7B ซึ่งเป็นโมเดล 7B แบบ dense และ Tencent Hy-MT2-30B-A3B ซึ่งเป็นเรือธงแบบ mixture-of-experts ที่มีพารามิเตอร์รวม 30 พันล้านและใช้งานจริงประมาณ 3 พันล้าน ต่างก็เปิดให้เรียกผ่าน hosted API ในสัปดาห์นี้ — 7B ราววันที่ 19 สิงหาคม 2026 และ 30B-A3B ในวันถัดมา โดยทั้งคู่ให้บริการโดย Tencent Cloud — ในราคาที่เท่ากันเป๊ะ: $0.074 ต่อล้าน input tokens และ $0.295 ต่อล้าน output tokens ครอบครัวโมเดลนี้เปิดเป็นโอเพนซอร์สพร้อมกันเมื่อวันที่ 21 พฤษภาคม 2026 ดังนั้นทั้งสองโมเดลจึงไม่ใช่ของใหม่ ราคา API ที่เหมือนกันนี่แหละที่ทำให้การเปรียบเทียบนี้แปลกประหลาดจริง ๆ โดยปกติแล้วโมเดลใหญ่จะแพงกว่า และคุณต้องชั่งน้ำหนักส่วนต่างราคากับประโยชน์ที่ได้ แต่ที่นี่เรือธงไม่มีค่าใช้จ่ายเพิ่มต่อ token และการตัดสินใจก็เหลือเพียงคำถามเดียว: โมเดล 7B เสียอะไรไปบ้างจากการเป็น dense และเล็ก?

เซอร์ไพรส์ราคาเท่ากัน

ความเท่าเทียมด้านราคาของ 30B-A3B คือดีลแบบ MoE ที่ทำงานได้ตามหน้าที่ สถาปัตยกรรมของมันเก็บความรู้ 30B แต่เปิดใช้งานเพียงประมาณ 3B ต่อโทเคน ดังนั้น Tencent Cloud จึงให้บริการในอัตราต่อโทเคนเดียวกันกับรุ่น 7B — ราคา $0.074 / $0.295 เท่ากัน บริบท 8,192 โทเคนเท่ากัน รองรับ structured-output เท่ากัน และมีข้อจำกัดไม่รองรับ function-calling เหมือนกัน บน API โมเดล "professional" ไม่ได้แพงกว่า จุดที่ต้องแลกย้ายไปที่อื่น: ในเรื่องพื้นที่หน่วยความจำ ความซับซ้อนในการให้บริการ และเวลาแฝง ซึ่งการออกแบบที่หนาแน่นและเรียบง่ายกว่าของ 7B มีข้อได้เปรียบเชิงโครงสร้างที่ราคาต่อโทเคนไม่สามารถสื่อออกมาได้

สเปก, เคียงข้างกัน

สถาปัตยกรรม — dense ~7B เทียบกับ MoE รวม 30B / ใช้งาน ~3B.

ราคา API — $0.074 / $0.295 เทียบกับ $0.074 / $0.295 ต่อ 1M โทเค็น (เหมือนกัน)

บริบท — ทั้ง 8,192 โทเค็น

การวางตำแหน่ง — จุดสมดุลที่ลงตัว เทียบกับเรือธงระดับมืออาชีพ

FLORES-200 — 7B: 86.89 XCOMET-XXL, ≈97.9% ของ Gemini 3.1 Pro (Think); 30B-A3B: คะแนนการแปลทั่วไปที่ดีที่สุดของตระกูลนี้ (ตัวเลขที่รายงานโดยผู้ให้บริการ)

การเปรียบเทียบ Deep​Seek / K​imi — ทั้งคู่ทำได้ดีกว่า DeepSeek-V4-Pro และ Kimi K2.6 ในโหมดคิดเร็ว ตามรายงานของผู้จำหน่าย

พื้นที่ — รันบน A100 / RTX 4090 ตัวเดียว เทียบกับน้ำหนักโมเดลระดับ 30B (บิลด์แบบควอนไทซ์ระดับ 18GB บนดิสก์ และมากกว่าใน VRAM)

ค่าเริ่มต้นการอนุมาน — temp 0.7, top_p 0.6, top_k 20 เทียบกับ temp 0.7, top_p 1.0, top_k -1.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B — the scoreboard'. Left column Hy-MT2-7B: Architecture dense 7B; API price $0.074 / $0.295; FLORES-200 86.89; Context 8,192; Footprint single GPU; Role balanced sweet spot. Right column Hy-MT2-30B-A3B: Architecture MoE 30B / 3B active; API price $0.074 / $0.295; FLORES-200 tops the family; Context 8,192; Footprint data-center VRAM; Role professional-grade. Footer: Prices identical as listed Aug 2026; figures vendor-reported.

จุดที่ 30B-A3B ชนะจริงๆ

Tencent วางตำแหน่ง 30B-A3B ให้เป็นสมาชิกระดับมืออาชีพของตระกูล และหลักฐานที่เผยแพร่ออกมาสนับสนุนฉลากดังกล่าวสำหรับข้อความเฉพาะประเภทหนึ่ง บนเนื้อหาที่เต็มไปด้วยศัพท์เฉพาะ — ข้อกำหนดทางกฎหมาย ข้อความทางการแพทย์ เอกสารทางเทคนิค — ค่า GEMBA บน DomainMTBench ของมันแข็งแกร่งที่สุดในตระกูล โดยรายงานอยู่ที่ประมาณ 99% ของเส้นฐาน Gemini 2.5 Pro และคะแนนการแปลทั่วไปของมันสูงกว่ารุ่น 7B บนเส้นโค้ง FLORES ของตระกูลเอง ความรู้พิเศษ 27B ที่แฝงอยู่นั้นเป็นความจุแบบที่แสดงผลเมื่อประโยคมีศัพท์เทคนิคหนาแน่น ไม่ใช่ร้อยแก้วธรรมดา: ข้อความในสัญญาที่ว่า "การชดใช้ค่าเสียหายจะยังคงมีผลหลังสิ้นสุดสัญญา" ไม่ได้สร้างภาระให้โมเดล 7B มากนัก แต่เอกสาร M&A เต็มรูปแบบที่มีคำศัพท์เฉพาะทางน่ะสิที่สร้างภาระ 30B-A3B ยังเป็นตัวเลือกที่ปลอดภัยที่สุดสำหรับคู่ภาษา Chinese-to-minority-language (ทิเบต อุยกูร์ มองโกเลีย) ซึ่ง Tencent รายงานว่ามีตัวเลขที่ดีที่สุด

ที่ 7B ชนะอยู่ดี

ข้อดีของ 7B นั้นเป็นเรื่องเชิงปฏิบัติการ และมันเป็นจริง ประการแรก การโฮสต์ด้วยตัวเอง: 7B รันได้บน A100 หรือ RTX 4090 เพียงตัวเดียว และครอบคลุมเฟรมเวิร์กได้กว้างที่สุด — Transformers, vLLM, SGLang และ llama.cpp ผ่าน GGUF ล้วนถูกใช้งานจริง ในขณะที่ 30B-A3B ถึงแม้จะทำ quantization แล้ว ก็ยังต้องการ VRAM ระดับดาต้าเซ็นเตอร์ และมีคนจำนวนน้อยกว่าที่นำไปผ่านระบบ serving ระดับโปรดักชัน ประการที่สอง เรื่อง latency และความเรียบง่ายในการ serving: โมเดล 7B แบบ dense รักษาความพร้อมใช้งานได้ง่ายกว่า และค่า sampling ที่แนะนำนั้นใกล้เคียงกับการ decode แบบมาตรฐานมากกว่า ประการที่สาม ทางฝั่ง API ราคาที่เท่ากันหมายความว่า 7B มีต้นทุนต่อโทเคนเท่ากับรุ่นเรือธงเป๊ะ ๆ ดังนั้นเหตุผลเดียวที่จะเลือกโมเดลเล็กกว่าคือ สำหรับข้อความทั่วไปที่สะอาด ช่องว่างของคุณภาพนั้นบางเกินกว่าจะสังเกตเห็นได้ 7B ทำได้ประมาณ 97.9% ของ Gemini 3.1 Pro (Think) บนชุดข้อมูล FLORES-200 แล้ว ส่วนคะแนนเพิ่มเติมของรุ่นเรือธงนั้นอยู่บนเส้นโค้งที่แต่ละคะแนนยิ่งยากจะเห็นผลในทางปฏิบัติ

ช่องว่างที่วัดอย่างตรงไปตรงมา

ทุกอย่างในสองส่วนสุดท้ายคือการประเมินของ Tencent เอง และวิธีอ่านอย่างตรงไปตรงมาคือ โมเดลทั้งสองตัวใกล้เคียงกันมากพอในการแปลทั่วไป จนคลังข้อมูลของคุณเป็นตัวตัดสิน สำหรับข้อความสะอาดทั่วไป คะแนน ~97.9% ของ Gemini ของรุ่น 7B หมายความว่าส่วนต่างของรุ่นเรือธงวัดกันเป็นเศษส่วน XCOMET เล็กๆ — จริงบนลีดเดอร์บอร์ด แต่ยากจะรู้สึกได้ในตั๋วซัพพอร์ต สำหรับข้อความเฉพาะทางเนื้อแน่นและคู่ภาษาชนกลุ่มน้อย จุดนำที่รายงานใน GEMBA และ FLORES ของรุ่นเรือธงคือจุดที่นักแปลมืออาชีพ (มนุษย์หรือโมเดล) คุ้มค่ากับค่าตัว และเป็นจุดที่การแปลซ้ำแพงที่สุด ในขณะที่เขียนนี้ ยังไม่มีเบนช์มาร์กอิสระสำหรับโมเดลทั้งสองตัว สิ่งเดียวที่การ์ดข้อมูลของผู้ขายทั้งสองเห็นพ้องตรงกันคือ โมเดลทุกรุ่นชนะ DeepSeek-V4-Pro และ Kimi K2.6 ในโหมดคิดเร็วของตระกูลนี้

A screenshot of the Hugging Face model card for tencent/Hy-MT2-30B-A3B (captured August 23 2026) showing the MoE architecture (30B total / 3B active), Apache-2.0 license, and the professional-grade positioning.

การกำหนดเส้นทางของครอบครัว

ในขณะที่เขียนบทความนี้ ทั้งสองโมเดลยังไม่มีในแคตตาล็อกของ OrcaRouter ดังนั้นทั้งคู่จึงให้บริการผ่านคลาวด์ของ Tencent เองและแพลตฟอร์มบุคคลที่สามหลายแห่ง บทเรียนด้านการจัดเส้นทางยังคงใช้ได้จริง เนื่องจากราคา API เท่ากัน นี่จึงเป็นกรณีตัวอย่างคลาสสิกของการจัดเส้นทางตามปริมาณงาน มากกว่าการเลือกโมเดลเพียงตัวเดียว: ส่งส่วนงานแปลทั่วไปปริมาณสูงไปยัง 7B และส่งส่วนงานเฉพาะด้านที่หนาแน่นไปยัง 30B-A3B พร้อม failover อัตโนมัติ เพื่อให้ความหน่วงที่พุ่งสูงบน MoE endpoint ไม่ทำให้ไปป์ไลน์หยุดชะงัก นี่คือรูปแบบที่ routing DSL ของ OrcaRouter ประกอบขึ้นจากโมเดล 200+ ตัวที่เรามี — การจัดส่งแบบถ่วงน้ำหนักต้นทุน ราคารายการของผู้ให้บริการส่งผ่านด้วยมาร์กอัป 0% — และมันเหมาะกับตระกูลโมเดลนี้มากกว่าโมเดลอื่นส่วนใหญ่ เพราะผู้ให้บริการตั้งราคาทั้งสองระดับให้การแบ่งงานมีความเป็นกลางทางเศรษฐกิจ

คำตัดสิน

ที่ราคา API ที่เหมือนกัน คำตอบเริ่มต้นคือ 7B: ต้นทุนต่อโทเค็นเท่ากัน โฮสต์เองง่ายกว่า และใกล้เคียงมากในข้อความทั่วไป เลือก 30B-A3B เมื่อคลังข้อมูลมีความหนาแน่นระดับมืออาชีพ เช่น กฎหมาย การแพทย์ เทคนิค หรือการแปลภาษาชนกลุ่มน้อย ซึ่งข้อได้เปรียบด้านโดเมนที่รายงานของรุ่นเรือธงนั้นคุ้มค่ากับขนาดที่ใหญ่กว่าและความหน่วง และหากปริมาณงานของคุณเป็นการผสมทั้งสองแบบ อย่าเลือก: แยกส่วนทั่วไปไปที่ 7B และส่วนยากไปที่รุ่นเรือธง นั่นไม่ใช่การประนีประนอมระหว่างสองแบบ; มันเป็นวิธีเดียวที่จะได้ทั้งสองแบบในราคาที่ Tencent กำหนด

A generated infographic titled 'Same price, different model' with two identical cards both labelled '$0.074 / $0.295 per 1M tokens': one 'Dense 7B — simpler to serve, near-flagship on clean text', the other 'MoE 30B-A3B — 30B knowledge, 3B active, professional domains', with the footer 'The MoE bargain: bigger model, same per-token cost.'

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube