
Tencent Hy-MT2-7B เทียบกับ Tencent Hy-MT2-30B-A3B: จุดหวานแบบ Dense หรือเรือธง MoE ในราคาเดียวกัน
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
นี่คือสิ่งที่น่าประหลาดใจใจกลางของการเปรียบเทียบครั้งนี้: Tencent Hy-MT2-7B ซึ่งเป็นโมเดล 7B แบบ dense และ Tencent Hy-MT2-30B-A3B ซึ่งเป็นเรือธงแบบ mixture-of-experts ที่มีพารามิเตอร์รวม 30 พันล้านและใช้งานจริงประมาณ 3 พันล้าน ต่างก็เปิดให้เรียกผ่าน hosted API ในสัปดาห์นี้ — 7B ราววันที่ 19 สิงหาคม 2026 และ 30B-A3B ในวันถัดมา โดยทั้งคู่ให้บริการโดย Tencent Cloud — ในราคาที่เท่ากันเป๊ะ: $0.074 ต่อล้าน input tokens และ $0.295 ต่อล้าน output tokens ครอบครัวโมเดลนี้เปิดเป็นโอเพนซอร์สพร้อมกันเมื่อวันที่ 21 พฤษภาคม 2026 ดังนั้นทั้งสองโมเดลจึงไม่ใช่ของใหม่ ราคา API ที่เหมือนกันนี่แหละที่ทำให้การเปรียบเทียบนี้แปลกประหลาดจริง ๆ โดยปกติแล้วโมเดลใหญ่จะแพงกว่า และคุณต้องชั่งน้ำหนักส่วนต่างราคากับประโยชน์ที่ได้ แต่ที่นี่เรือธงไม่มีค่าใช้จ่ายเพิ่มต่อ token และการตัดสินใจก็เหลือเพียงคำถามเดียว: โมเดล 7B เสียอะไรไปบ้างจากการเป็น dense และเล็ก?
เซอร์ไพรส์ราคาเท่ากัน
ความเท่าเทียมด้านราคาของ 30B-A3B คือดีลแบบ MoE ที่ทำงานได้ตามหน้าที่ สถาปัตยกรรมของมันเก็บความรู้ 30B แต่เปิดใช้งานเพียงประมาณ 3B ต่อโทเคน ดังนั้น Tencent Cloud จึงให้บริการในอัตราต่อโทเคนเดียวกันกับรุ่น 7B — ราคา $0.074 / $0.295 เท่ากัน บริบท 8,192 โทเคนเท่ากัน รองรับ structured-output เท่ากัน และมีข้อจำกัดไม่รองรับ function-calling เหมือนกัน บน API โมเดล "professional" ไม่ได้แพงกว่า จุดที่ต้องแลกย้ายไปที่อื่น: ในเรื่องพื้นที่หน่วยความจำ ความซับซ้อนในการให้บริการ และเวลาแฝง ซึ่งการออกแบบที่หนาแน่นและเรียบง่ายกว่าของ 7B มีข้อได้เปรียบเชิงโครงสร้างที่ราคาต่อโทเคนไม่สามารถสื่อออกมาได้
สเปก, เคียงข้างกัน
• สถาปัตยกรรม — dense ~7B เทียบกับ MoE รวม 30B / ใช้งาน ~3B.
• ราคา API — $0.074 / $0.295 เทียบกับ $0.074 / $0.295 ต่อ 1M โทเค็น (เหมือนกัน)
• บริบท — ทั้ง 8,192 โทเค็น
• การวางตำแหน่ง — จุดสมดุลที่ลงตัว เทียบกับเรือธงระดับมืออาชีพ
• FLORES-200 — 7B: 86.89 XCOMET-XXL, ≈97.9% ของ Gemini 3.1 Pro (Think); 30B-A3B: คะแนนการแปลทั่วไปที่ดีที่สุดของตระกูลนี้ (ตัวเลขที่รายงานโดยผู้ให้บริการ)
• การเปรียบเทียบ DeepSeek / Kimi — ทั้งคู่ทำได้ดีกว่า DeepSeek-V4-Pro และ Kimi K2.6 ในโหมดคิดเร็ว ตามรายงานของผู้จำหน่าย
• พื้นที่ — รันบน A100 / RTX 4090 ตัวเดียว เทียบกับน้ำหนักโมเดลระดับ 30B (บิลด์แบบควอนไทซ์ระดับ 18GB บนดิสก์ และมากกว่าใน VRAM)
• ค่าเริ่มต้นการอนุมาน — temp 0.7, top_p 0.6, top_k 20 เทียบกับ temp 0.7, top_p 1.0, top_k -1.

จุดที่ 30B-A3B ชนะจริงๆ
Tencent วางตำแหน่ง 30B-A3B ให้เป็นสมาชิกระดับมืออาชีพของตระกูล และหลักฐานที่เผยแพร่ออกมาสนับสนุนฉลากดังกล่าวสำหรับข้อความเฉพาะประเภทหนึ่ง บนเนื้อหาที่เต็มไปด้วยศัพท์เฉพาะ — ข้อกำหนดทางกฎหมาย ข้อความทางการแพทย์ เอกสารทางเทคนิค — ค่า GEMBA บน DomainMTBench ของมันแข็งแกร่งที่สุดในตระกูล โดยรายงานอยู่ที่ประมาณ 99% ของเส้นฐาน Gemini 2.5 Pro และคะแนนการแปลทั่วไปของมันสูงกว่ารุ่น 7B บนเส้นโค้ง FLORES ของตระกูลเอง ความรู้พิเศษ 27B ที่แฝงอยู่นั้นเป็นความจุแบบที่แสดงผลเมื่อประโยคมีศัพท์เทคนิคหนาแน่น ไม่ใช่ร้อยแก้วธรรมดา: ข้อความในสัญญาที่ว่า "การชดใช้ค่าเสียหายจะยังคงมีผลหลังสิ้นสุดสัญญา" ไม่ได้สร้างภาระให้โมเดล 7B มากนัก แต่เอกสาร M&A เต็มรูปแบบที่มีคำศัพท์เฉพาะทางน่ะสิที่สร้างภาระ 30B-A3B ยังเป็นตัวเลือกที่ปลอดภัยที่สุดสำหรับคู่ภาษา Chinese-to-minority-language (ทิเบต อุยกูร์ มองโกเลีย) ซึ่ง Tencent รายงานว่ามีตัวเลขที่ดีที่สุด
ที่ 7B ชนะอยู่ดี
ข้อดีของ 7B นั้นเป็นเรื่องเชิงปฏิบัติการ และมันเป็นจริง ประการแรก การโฮสต์ด้วยตัวเอง: 7B รันได้บน A100 หรือ RTX 4090 เพียงตัวเดียว และครอบคลุมเฟรมเวิร์กได้กว้างที่สุด — Transformers, vLLM, SGLang และ llama.cpp ผ่าน GGUF ล้วนถูกใช้งานจริง ในขณะที่ 30B-A3B ถึงแม้จะทำ quantization แล้ว ก็ยังต้องการ VRAM ระดับดาต้าเซ็นเตอร์ และมีคนจำนวนน้อยกว่าที่นำไปผ่านระบบ serving ระดับโปรดักชัน ประการที่สอง เรื่อง latency และความเรียบง่ายในการ serving: โมเดล 7B แบบ dense รักษาความพร้อมใช้งานได้ง่ายกว่า และค่า sampling ที่แนะนำนั้นใกล้เคียงกับการ decode แบบมาตรฐานมากกว่า ประการที่สาม ทางฝั่ง API ราคาที่เท่ากันหมายความว่า 7B มีต้นทุนต่อโทเคนเท่ากับรุ่นเรือธงเป๊ะ ๆ ดังนั้นเหตุผลเดียวที่จะเลือกโมเดลเล็กกว่าคือ สำหรับข้อความทั่วไปที่สะอาด ช่องว่างของคุณภาพนั้นบางเกินกว่าจะสังเกตเห็นได้ 7B ทำได้ประมาณ 97.9% ของ Gemini 3.1 Pro (Think) บนชุดข้อมูล FLORES-200 แล้ว ส่วนคะแนนเพิ่มเติมของรุ่นเรือธงนั้นอยู่บนเส้นโค้งที่แต่ละคะแนนยิ่งยากจะเห็นผลในทางปฏิบัติ
ช่องว่างที่วัดอย่างตรงไปตรงมา
ทุกอย่างในสองส่วนสุดท้ายคือการประเมินของ Tencent เอง และวิธีอ่านอย่างตรงไปตรงมาคือ โมเดลทั้งสองตัวใกล้เคียงกันมากพอในการแปลทั่วไป จนคลังข้อมูลของคุณเป็นตัวตัดสิน สำหรับข้อความสะอาดทั่วไป คะแนน ~97.9% ของ Gemini ของรุ่น 7B หมายความว่าส่วนต่างของรุ่นเรือธงวัดกันเป็นเศษส่วน XCOMET เล็กๆ — จริงบนลีดเดอร์บอร์ด แต่ยากจะรู้สึกได้ในตั๋วซัพพอร์ต สำหรับข้อความเฉพาะทางเนื้อแน่นและคู่ภาษาชนกลุ่มน้อย จุดนำที่รายงานใน GEMBA และ FLORES ของรุ่นเรือธงคือจุดที่นักแปลมืออาชีพ (มนุษย์หรือโมเดล) คุ้มค่ากับค่าตัว และเป็นจุดที่การแปลซ้ำแพงที่สุด ในขณะที่เขียนนี้ ยังไม่มีเบนช์มาร์กอิสระสำหรับโมเดลทั้งสองตัว สิ่งเดียวที่การ์ดข้อมูลของผู้ขายทั้งสองเห็นพ้องตรงกันคือ โมเดลทุกรุ่นชนะ DeepSeek-V4-Pro และ Kimi K2.6 ในโหมดคิดเร็วของตระกูลนี้

การกำหนดเส้นทางของครอบครัว
ในขณะที่เขียนบทความนี้ ทั้งสองโมเดลยังไม่มีในแคตตาล็อกของ OrcaRouter ดังนั้นทั้งคู่จึงให้บริการผ่านคลาวด์ของ Tencent เองและแพลตฟอร์มบุคคลที่สามหลายแห่ง บทเรียนด้านการจัดเส้นทางยังคงใช้ได้จริง เนื่องจากราคา API เท่ากัน นี่จึงเป็นกรณีตัวอย่างคลาสสิกของการจัดเส้นทางตามปริมาณงาน มากกว่าการเลือกโมเดลเพียงตัวเดียว: ส่งส่วนงานแปลทั่วไปปริมาณสูงไปยัง 7B และส่งส่วนงานเฉพาะด้านที่หนาแน่นไปยัง 30B-A3B พร้อม failover อัตโนมัติ เพื่อให้ความหน่วงที่พุ่งสูงบน MoE endpoint ไม่ทำให้ไปป์ไลน์หยุดชะงัก นี่คือรูปแบบที่ routing DSL ของ OrcaRouter ประกอบขึ้นจากโมเดล 200+ ตัวที่เรามี — การจัดส่งแบบถ่วงน้ำหนักต้นทุน ราคารายการของผู้ให้บริการส่งผ่านด้วยมาร์กอัป 0% — และมันเหมาะกับตระกูลโมเดลนี้มากกว่าโมเดลอื่นส่วนใหญ่ เพราะผู้ให้บริการตั้งราคาทั้งสองระดับให้การแบ่งงานมีความเป็นกลางทางเศรษฐกิจ
คำตัดสิน
ที่ราคา API ที่เหมือนกัน คำตอบเริ่มต้นคือ 7B: ต้นทุนต่อโทเค็นเท่ากัน โฮสต์เองง่ายกว่า และใกล้เคียงมากในข้อความทั่วไป เลือก 30B-A3B เมื่อคลังข้อมูลมีความหนาแน่นระดับมืออาชีพ เช่น กฎหมาย การแพทย์ เทคนิค หรือการแปลภาษาชนกลุ่มน้อย ซึ่งข้อได้เปรียบด้านโดเมนที่รายงานของรุ่นเรือธงนั้นคุ้มค่ากับขนาดที่ใหญ่กว่าและความหน่วง และหากปริมาณงานของคุณเป็นการผสมทั้งสองแบบ อย่าเลือก: แยกส่วนทั่วไปไปที่ 7B และส่วนยากไปที่รุ่นเรือธง นั่นไม่ใช่การประนีประนอมระหว่างสองแบบ; มันเป็นวิธีเดียวที่จะได้ทั้งสองแบบในราคาที่ Tencent กำหนด

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
