การ์ดหลักที่มีหัวข้อ "North Small Translate 1.0 vs Hy-MT2" พร้อมคำโปรยย่อย "นักแปล MoE สองตัว ช่องว่างหลักฐานหนึ่งจุด" เหนือการ์ดสองใบ: North Small Translate 1.0 (MoE 218B / ใช้งานจริง 25B, ตัวเลข WMT26 หนึ่งรายการที่ไม่ระบุชื่อ) และ Hy-MT2-30B-A3B (MoE 30B / ใช้งานจริง 3B, เปเปอร์, เบนช์มาร์ก, Apache 2.0)
Guides & Insights

North Small Translate 1.0 vs Hy-MT2: นักแปล MoE สองตัว หนึ่งช่องว่างทางหลักฐาน

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ทั้งสองตระกูลนี้ถูกสร้างขึ้นบนเดิมพันเดียวกัน — นั่นคือเครือข่าย sparse mixture-of-experts ที่ผ่านการ post-train สำหรับงานแปลจะเอาชนะโมเดลอเนกประสงค์ที่ถูกสั่งให้แปล — และทั้งคู่ก็มาถึงจุดนั้นจากทิศทางที่ตรงกันข้ามกัน Hy-MT2 ซึ่งเป็นตระกูลโมเดลแปลสามขนาดของ Tencent Hunyuan ที่มี Hy-MT2-30B-A3B MoE เป็นหัวหอก ถูกเปิดโอเพนซอร์สเมื่อวันที่ 21 พฤษภาคม 2026 ภายใต้สัญญาอนุญาต Apache 2.0 พร้อมรายงานทางเทคนิค benchmark แบบโอเพนซอร์ส และตารางเปรียบเทียบแบบเต็ม North Small Translate 1.0 นักแปลแบบ MoE ขนาด 218,000 ล้านพารามิเตอร์ เปิดใช้งาน 25,000 ล้านพารามิเตอร์ของ Cohere ถูกบันทึกไว้ในบันทึกการเปิดตัว (release note) ลงวันที่ 9 กันยายน 2026 และหลักฐานด้านคุณภาพของมันมีเพียงตัวเลขเดียวโดยไม่มีตัวชี้วัดใด ๆ กำกับอยู่ สถาปัตยกรรมคล้องกัน แต่เอกสารไม่คล้องกัน และความแตกต่างนั้นคือสิ่งที่ควรทำความเข้าใจให้มากที่สุดก่อนจะเลือกอันใดอันหนึ่ง

หนึ่งตระกูล สามขนาด เทียบกับหนึ่งโมเดลขนาดใหญ่

Hy-MT2 ไม่ใช่โมเดลเดียว แต่เป็นกลุ่มโมเดลที่ครอบคลุมตั้งแต่โมเดลแบบ dense ขนาด 1.8B สำหรับการทำงานบนอุปกรณ์, โมเดลแบบ dense ขนาด 7B สำหรับ GPU เดียว และ 30B-A3B MoE ในฐานะเรือธงที่มีพารามิเตอร์ 3 พันล้านตัวทำงานต่อโทเคน ทั้งสามโมเดลอยู่ภายใต้ Apache 2.0 ไม่มีข้อจำกัดการเข้าถึง และเผยแพร่พร้อมกับควอนไทเซชัน FP8, GGUF, 2-bit และ 1.25-bit รวมถึงเบนช์มาร์กการทำตามคำสั่ง IFMTBench และบทความประกอบ Tencent รายงานว่าตระกูลโมเดลนี้แปลได้ใน 33 ภาษา บวกกับภาษาชนกลุ่มน้อยและภาษาถิ่นอีกห้าแบบ

North Small Translate 1.0 เป็นเพียงจุดเดียวในสเปซของขนาด และเป็นจุดที่ใหญ่ด้วย: พารามิเตอร์รวม 218B, แอคทีฟ 25B, ผู้เชี่ยวชาญ 128 ตัว โดยเปิดใช้งานแปดตัวต่อโทเคน บวกกับผู้เชี่ยวชาญแบบแชร์ และแอตเทนชันสลับกันในอัตราส่วน 3:1 ระหว่างเลเยอร์แบบสไลซิงวินโดว์ (วินโดว์ 4,096, RoPE) กับเลเยอร์แบบโกลบอลที่ไม่มี positional embeddings วินโดว์ของมันคือ 16K ขาเข้า และ 16K ขาออก ครอบคลุมภาษาอังกฤษบวกอีก 49 ภาษา โดยมีภาษาอาหรับมาตรฐานสมัยใหม่ เยอรมัน ฝรั่งเศส ญี่ปุ่น เกาหลี รัสเซีย และยูเครนถูกกำหนดให้เป็นระดับหนึ่ง ที่น่าสังเกตคือ รูปทรงนี้ไม่ใช่ของใหม่ — Command A+ ของ Cohere จากเดือนพฤษภาคม 2026 ใช้การตั้งค่า 218B/25B แบบเดียวกัน ซึ่งทำให้สิ่งนี้เป็นการโพสต์เทรนที่เชี่ยวชาญด้านการแปลของแกนกลางที่มีอยู่เดิม มากกว่าจะเป็นสถาปัตยกรรมใหม่

พารามิเตอร์ — North Small Translate 1.0: 218B ทั้งหมด / ใช้งาน 25B เทียบกับ Hy-MT2-30B-A3B: 30B ทั้งหมด / ใช้งาน 3B โดยมีพี่น้องแบบ dense ขนาด 1.8B และ 7B

บริบท — อินพุต 16K และเอาต์พุต 16K เทียบกับหน้าต่างทำงาน 8K โดยคอนฟิกโฆษณาว่ารองรับได้ถึง 262,144 ตำแหน่ง

ภาษา — 50 (อังกฤษ + 49) เทียบกับ 33 บวก 5 ภาษาชนกลุ่มน้อยและภาษาถิ่น

สัญญาอนุญาต — CC BY-NC 4.0 ใช้เชิงพาณิชย์ได้ผ่าน Model Vault เทียบกับ Apache 2.0 ไม่มีการปิดกั้นการเข้าถึง

หลักฐานที่เผยแพร่ — ตัวเลข WMT26 หนึ่งรายการที่ไม่เปิดเผยชื่อ ซึ่งรายงานโดยผู้ขาย เทียบกับรายงานทางเทคนิค เบนช์มาร์กแบบเปิด และผลลัพธ์ที่ระบุชื่อบน FLORES-200, WMT25 GEMBA และ XCOMET-XXL

การให้บริการ — vLLM ที่ใช้ cohere_melody>=0.9.0 แนะนำให้ใช้ greedy decoding เมื่อเทียบกับ transformers, vLLM, SGLang และ llama.cpp

ประกาศ — 9 กันยายน 2026 (น้ำหนักถูกจำกัดการเข้าถึงบน Hugging Face ตั้งแต่วันที่ 14 สิงหาคม) เทียบกับ 21 พฤษภาคม 2026

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-30B-A3B across six rows: Parameters 218B MoE / 25B active vs 30B MoE / 3B active; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Evidence one unnamed WMT26 figure vs FLORES-200 93.85 and GEMBA 84.34; Technical report none published vs arXiv paper and IFMTBench. Footer notes all figures are vendor-reported by Tencent and Cohere and none is independently reproduced.

ช่องว่างของหลักฐานต่างหากคือเรื่องจริง

การเปิดตัวของ Tencent มาพร้อมหลักฐานยืนยัน มีบทความบน arXiv, เบนช์มาร์กที่บริษัทเขียนขึ้นและเปิดซอร์สโดยเฉพาะเพื่อวัดการทำตามคำสั่งด้านการแปล และตารางผลลัพธ์ที่ระบุชื่อคู่แข่งของบริษัท FLORES-200 English-to-X จัดให้ 30B-A3B อยู่ที่ 93.85 เมื่อเทียบกับ Gemini 3.1 Pro ที่ 94.42 และ GPT-5.5 ที่ 94.16 ตัวชี้วัด GEMBA ยุค WMT25 ให้คะแนนมันที่ 84.34 — ซึ่งเป็นคะแนนสูงสุดในการเปรียบเทียบของ Tencent เอง นำหน้า GPT-5.5 ที่ 83.41 และ 83.29 ในสองโหมดของมัน, Gemini 3.1 Pro ที่ 82.23, DeepSeek-V4-Pro ที่ 81.99 และ Kimi K2.6 ที่ 81.68 XCOMET-XXL จัดให้อยู่ที่ 62.89 ตามหลังรุ่น 7B ในตระกูลเดียวกันของมันเอง บน IFMTBench มันทำได้ 85.7% ในการทำตามคำสั่งโดยรวม โดยมีคะแนนย่อย 91.94% ซึ่งห่างจาก Gemini 3.1 Pro เพียงหนึ่งในร้อยของจุด และคะแนนย่อยแยกต่างหาก 85.55% ที่มันนำหน้าโมเดล Gemini 3.1 Pro อย่างชัดเจน

ทุก ๆ รายการเหล่านั้นล้วนเป็นการวัดของ Tencent เอง และไม่มีรายการใดที่ได้รับการทำซ้ำโดยอิสระเลย แต่ทว่ารายการเหล่านั้นมีชื่อเรียกขาน มีความสามารถในการเปรียบเทียบกันได้ และสามารถพิสูจน์หักล้างได้ — ผู้อ่านรู้ชัดเจนว่าต้องรันการทดสอบใดเพื่อโต้แย้ง

บันทึกการเปิดตัวของ Cohere ให้ตัวเลขมาเพียงตัวเดียว: WMT26 83.60 ซึ่งเพิ่มขึ้นเป็น 84.36 ภายใต้สิ่งที่ Cohere เรียกว่าเวิร์กโฟลว์การแปลแบบหลายรอบที่ใช้เอเจนต์ (agentic multi-pass translation workflow) ไม่มีการระบุชื่อเมตริกใด ๆ ไม่ว่าจะในโมเดลการ์ดหรือในเอกสาร และยังไม่มีการเผยแพร่หน้าผลลัพธ์ WMT26 สำหรับโมเดลนี้ คลังข้อมูลฝึก จำนวนโทเคน และไปป์ไลน์ข้อมูลล้วนไม่ถูกเปิดเผย ในขณะที่รายงานทางเทคนิคปี 2025 ของ Command A Translate ได้อธิบายเทคนิคการกรองตามความยากไว้อย่างละเอียด ทั้งหมดนั้นไม่ใช่หลักฐานว่าโมเดลแย่ลง แต่เป็นหลักฐานว่ามีหลักฐานน้อยลง ซึ่งเป็นคนละเรื่อง และสำคัญไม่แพ้กันเมื่อคุณกำลังตัดสินใจว่าจะนำอะไรไปใช้ในโปรดักชัน

มาตรวัดร่วมซึ่งในความเป็นจริงไม่มีฝ่ายใดได้เผยแพร่

มีจุดเชื่อมโยงที่แท้จริงเพียงจุดเดียวระหว่างทั้งสอง และมันคุ้มค่ากับหนึ่งย่อหน้า เพราะเป็นเพียงจุดเดียวที่การเปรียบเทียบอย่างเป็นธรรมจะเกิดขึ้นได้ Tencent เป็นพันธมิตร WMT26 โดยสนับสนุนงานแปลคำบรรยายวิดีโอพร้อมรางวัลที่ได้รับทุนจาก Hunyuan ตัวเลขที่เผยแพร่เพียงตัวเดียวของ Cohere เป็นตัวเลขจาก WMT26 ดังนั้นทั้งสององค์กรจึงอยู่ในรอบการประเมินปี 2026 เดียวกัน และเมตริกเดียวที่การเปรียบเทียบแบบตรงหน้าตรงตาจะชี้ขาดได้ ก็คือเมตริกเดียวที่เพียงหนึ่งในสององค์กรเท่านั้นที่เผยแพร่สิ่งใดๆ ออกมา — และเผยแพร่โดยไม่ได้ระบุชื่อเมตริกนั้น

นั่นคือช่องว่างที่ต้องจับตา หาก Cohere ระบุชื่อเมตริกให้กับ 83.60 หรือหากหน้า結果 WMT26 มีระบบ North Small Translate การเปรียบเทียบก็จะกลายเป็นของจริง จนถึงตอนนั้น การนำตัวเลข FLORES-200 และ GEMBA ของ Tencent มาตั้งเทียบกับตัวเลข WMT26 ที่ไม่มีป้ายกำกับของ Cohere จะเป็นการกุข้อมูลขึ้นมาโดยแต่งให้ดูเหมือนการวิเคราะห์

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

สิทธิ์การใช้งานและการปรับใช้

Hy-MT2 อยู่ภายใต้ Apache 2.0 โดยไม่มีการกั้นการเข้าถึง: ใช้เชิงพาณิชย์ ปรับแต่งละเอียด สร้างงานดัดแปลง และเผยแพร่ต่อ ทั้งหมดโดยไม่ต้องมีการเจรจาใด ๆ ส่วน North Small Translate 1.0 อยู่ภายใต้ CC BY-NC 4.0 ใช้งานฟรีสำหรับการใช้งานที่ไม่ใช่เชิงพาณิชย์ โดยการปรับใช้เชิงพาณิชย์ต้องผ่าน Model Vault ของ Cohere ในราคาที่ไม่เปิดเผย สำหรับสิ่งใดก็ตามที่ส่งถึงลูกค้า ความแตกต่างนี้ชี้ขาดการตัดสินใจก่อนที่จะได้อ่านผลเบนช์มาร์กด้วยซ้ำ

ด้านฮาร์ดแวร์ก็เป็นไปในรูปแบบเดียวกันแต่กลับกัน Hy-MT2 ครอบคลุมตั้งแต่บิลด์ควอนไทซ์ขนาด 440MB ที่รันบนโทรศัพท์มือถือ ไปจนถึง 30B-A3B ซึ่งพารามิเตอร์ที่ทำงานจริง 3 พันล้านตัวช่วยให้การคำนวณต่อโทเค็นอยู่ในระดับไม่สูงนักเมื่อเทียบกับระดับคุณภาพของมัน รันไทม์รองรับ transformers, vLLM, SGLang และ llama.cpp North Small Translate 1.0 เผยแพร่ฮาร์ดแวร์ขั้นต่ำสำหรับแต่ละเช็กพอยต์ — B200 สี่ตัวหรือ H100 แปดตัวสำหรับ BF16, B200 สองตัวหรือ H100 สี่ตัวสำหรับ FP8, B200 หนึ่งตัวหรือ H100 สองตัวสำหรับ NVFP4 W4A16 — และแนะนำให้ใช้การถอดรหัสแบบ greedy เพื่อให้ตรงกับการใช้งานในโปรดักชัน ข้อได้เปรียบที่ชดเชยของ Cohere คือโมเดลรันบนระดับฟรีของ Chat V2 API โดยไม่มีค่าใช้จ่ายสำหรับคีย์ทดลองและคีย์โปรดักชันจนกว่าจะถึงขีดจำกัดอัตราการใช้งาน ดังนั้นการประเมินโมเดลนี้จึงไม่มีค่าใช้จ่ายใด ๆ

คุณควรสลับหรือไม่ และสลับไปเป็นอะไร

คำถามเรื่องการเปลี่ยนนั้นไม่สมมาตรอย่างแท้จริงในกรณีนี้ การย้ายจาก Hy-MT2 ไปยัง North Small Translate 1.0 ไม่ใช่การอัปเกรดประสิทธิภาพที่คุณสามารถให้เหตุผลได้ในตอนนี้ — มันคือการเดิมพันบนโมเดลที่มีคำกล่าวอ้างสาธารณะเพียงตัวเลขเดียว เมื่อเทียบกับตระกูลที่มีรายงานตีพิมพ์และสัญญาอนุญาตที่นำไปใช้งานได้ สิ่งที่คุ้มค่าที่จะทำคือการประเมิน: โมเดล Cohere เรียกใช้ได้ฟรี ครอบคลุมห้าสิบภาษารวมถึงกลุ่มภาษายุโรปที่กว้างขึ้น และให้เอาต์พุต 16K ต่อครั้ง ซึ่งหน้าต่างการทำงาน 8K ของ Hy-MT2 ไม่มี

การประเมินแบบนั้นคือกรณีที่เลเยอร์จัดเส้นทางพิสูจน์คุณค่าของตัวเอง เพราะคำตอบที่ตรงไปตรงมาสำหรับสแต็กหลายภาษาส่วนใหญ่ก็คือโมเดลทั้งสองยังคงอยู่OrcaRouter นำแคตตาล็อกโมเดลมากกว่า 200 รายการมารวมไว้หลังคีย์เดียว ดังนั้นการลองโมเดลแปลตัวที่สองจึงเป็นแค่การเปลี่ยนการตั้งค่า ไม่ใช่สัญญากับผู้ขายรายที่สองหรือการแก้โค้ด — คุณเพียงชี้ไคลเอนต์ที่รองรับ OpenAI ตัวเดิมไปที่ model id อีกตัว แล้วเปรียบเทียบกับข้อความของคุณเอง ราคาตามรายการของผู้ให้บริการถูกส่งผ่านที่มาร์กอัป 0% ดังนั้นเมื่อราคาโฮสต์เปลี่ยน ฝั่งเราก็อัปเดตให้ทันทีในวันเดียวกัน โดยไม่มีการบวกส่วนต่างซ้อนเพิ่ม และเชนเฟลโอเวอร์ช่วยให้ระบบโปรดักชันยังทำงานบนโมเดลที่ใช้งานได้ดีอยู่แล้ว ในระหว่างที่โมเดลใหม่กำลังถูกประเมิน ทั้ง North Small Translate 1.0 และ Hy-MT2 ยังไม่มีอยู่ในแคตตาล็อกของเราในวันนี้ ดังนั้นนี่จึงไม่ใช่คำแนะนำให้ซื้อตัวใดตัวหนึ่งจากเรา — แต่เป็นข้อโต้แย้งว่าไม่ควรตัดสินใจแบบฝังตายตัวก่อนที่คุณจะได้รันการทดสอบ

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

คำตัดสิน

Hy-MT2 ของ Tencent เป็นตัวเลือกที่ปลอดภัยกว่า และเมื่อพิจารณาจากหลักฐานแล้วก็ไม่ใกล้เคียงกันเลย: Apache 2.0, สามขนาด, งานวิจัยหนึ่งฉบับ, เบนช์มาร์กแบบเปิด, ชุดการประเมินที่มีชื่อสี่ชุด และความร่วมมือ WMT26 North Small Translate 1.0 ของ Cohere เป็นตัวที่น่าสนใจกว่า — 218 พันล้านพารามิเตอร์ของ MoE เฉพาะการแปลที่อยู่เบื้องหลังหน้าต่างเอาต์พุต 16K และห้าสิบภาษา, ระดับการประเมินฟรี, และ 83.60 ที่ไม่มีใครนอก Cohere ได้ตรวจสอบ

ถ้าคุณต้องตัดสินใจภายในไตรมาสนี้ ให้เลือกตระกูลที่มีหลักฐานให้ตรวจสอบ ถ้าคุณมีคลังข้อมูลและมีเวลาสักหนึ่งสัปดาห์ ลองป้อนข้อมูลบางส่วนผ่านแพ็กเกจฟรี แล้วดูว่า 83.60 ที่ Cohere ไม่ยอมระบุชื่อนั้นมีความหมายอะไรกับเอกสารของคุณหรือไม่ — เพราะนั่นเป็นคำถามที่ตารางของเจ้าของผลิตภัณฑ์รายใดก็ตอบให้คุณไม่ได้ และตัวเลขเดียวที่ Cohere เลือกจะเผยแพร่ ก็คือตัวเลขที่บริษัทเลือกจะไม่ระบุชื่อนั่นเอง