การ์ด Hero ที่มีหัวข้อ "North Small Translate 1.0 vs Hy-MT2-7B" พร้อมคำโปรยย่อย "GPU ตัวเดียวสู้กับ B200 สองตัว" เหนือการ์ดอีกสองใบ: North Small Translate 1.0 (218B MoE / 25B active, CC BY-NC 4.0) และ Hy-MT2-7B (8B dense, VRAM ประมาณ 16GB, Apache 2.0)
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-7B: หนึ่ง GPU ปะทะสอง B200

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การเทียบเคียงที่สูสีที่สุดในการแปลแบบโอเพนซอร์สในตอนนี้อาจเป็นคู่ที่ชัดเจนน้อยที่สุดด้วยก็ได้ Hy-MT2-7B เป็นโมเดลลูกคนกลางในตระกูลการแปลของ Tencent Hunyuan เปิดซอร์สภายใต้ Apache 2.0 เมื่อวันที่ 21 พฤษภาคม 2026 และรันบน RTX 4090 หรือ A100 เพียงตัวเดียวโดยใช้ VRAM ประมาณ 16GB North Small Translate 1.0 เป็นโมเดลแปลแบบ sparse mixture-of-experts ขนาด 218 พันล้านพารามิเตอร์ของ Cohere ซึ่งมีเอกสารระบุไว้ในบันทึกการเปิดตัวของบริษัทเมื่อวันที่ 9 กันยายน 2026 โดยมีการติดตั้งใช้งานขั้นต่ำเป็น B200 สองตัวที่ FP8 หรือ B200 หนึ่งตัวในรูปแบบ NVFP4 W4A16 ทั้งคู่เป็นผู้เชี่ยวชาญด้านการแปล ทั้งคู่เป็นรุ่นปัจจุบัน หนึ่งในนั้นคุณสามารถให้บริการได้จากเวิร์กสเตชัน และข้อเท็จจริงเพียงข้อนี้ทำให้ต้องมองการเปรียบเทียบทั้งหมดใหม่ — เพราะไม่มีเบนช์มาร์กที่ทั้งคู่จะอยากถูกตัดสินบนเงื่อนไขที่เท่าเทียมกันมากที่สุด

เริ่มจากซองจดหมาย ไม่ใช่คะแนน

ต้นทุนการปรับใช้เป็นมิติที่ตัดสินการผสานรวมจริงส่วนใหญ่ และในจุดนี้ สองโมเดลไม่ได้ใกล้เคียงกันเลย Hy-MT2-7B เป็นโมเดลแบบ dense ในตระกูล HunYuanDenseV1 ที่มีพารามิเตอร์ประมาณแปดพันล้านตัว พร้อมบิลด์ FP8 และ GGUF ที่เผยแพร่แล้ว รวมถึงเวอร์ชัน MLX 8-bit จากชุมชนสำหรับ Apple silicon บันทึกการปรับใช้ของ Tencent ระบุว่า transformers 5.6.0 หรือใหม่กว่า, vLLM, SGLang และ llama.cpp เป็นรันไทม์ที่รองรับ และคำแนะนำด้านการอนุมานจำกัดการสร้างไว้ที่ 8,192 โทเคน แม้ว่าการกำหนดค่าจะโฆษณาว่ารองรับตำแหน่งได้สูงสุดถึง 262,144 ตำแหน่ง GPU สำหรับผู้บริโภคหรือเวิร์กสเตชันสมัยใหม่เพียงตัวเดียวก็เพียงพอ

North Small Translate 1.0 จัดอยู่ในประเภทที่แตกต่างออกไปโดยสิ้นเชิง พารามิเตอร์รวม 218B โดยมี 25B ที่ใช้งานอยู่ แบ่งออกเป็น 128 ผู้เชี่ยวชาญ โดยเปิดใช้งานแปดตัวต่อโทเคน บวกกับผู้เชี่ยวชาญที่ใช้ร่วมกัน และ Cohere เผยแพร่ฮาร์ดแวร์ขั้นต่ำสำหรับเช็กพอยต์ทั้งสามแบบ: B200 จำนวนสี่ตัว หรือ H100 จำนวนแปดตัว สำหรับ BF16, B200 จำนวนสองตัว หรือ H100 จำนวนสี่ตัว สำหรับ FP8, B200 จำนวนหนึ่งตัว หรือ H100 จำนวนสองตัว สำหรับบิลด์ NVFP4 W4A16 การให้บริการทำงานผ่าน vLLM ด้วย cohere_melody>=0.9.0 และ Cohere แนะนำให้ใช้ greedy decoding เพื่อให้ตรงกับโปรดักชัน เอาต์พุตมี <|START_TEXT|> และ <|END_TEXT|> เครื่องหมายที่ไม่ได้ลงทะเบียนเป็นโทเคนพิเศษ

โครงสร้าง — North Small Translate 1.0: รวม 218B / ใช้งาน 25B แบบ sparse MoE, ผู้เชี่ยวชาญ 128 ตัว เทียบกับ Hy-MT2-7B: แบบ dense ประมาณ 8B

บริบท — อินพุต 16K และเอาต์พุต 16K เทียบกับหน้าต่างทำงาน 8K โดยคอนฟิกโฆษณาว่ารองรับได้ถึง 262,144 ตำแหน่ง

ฮาร์ดแวร์ขั้นต่ำ — 1×B200 ที่ W4A16, 2×B200 หรือ 4×H100 ที่ FP8 เมื่อเทียบกับ GPU ระดับ RTX 4090 เพียงตัวเดียวในหน่วยความจำ ~16GB

รูปแบบที่เผยแพร่ — BF16, FP8, NVFP4 W4A16 เทียบกับ base, FP8, GGUF และ MLX 8-bit จากชุมชน

ภาษา — 50 (อังกฤษ + 49) เทียบกับ 33 ภาษา บวกกับ 5 ภาษาของชนกลุ่มน้อยและภาษาถิ่น

สัญญาอนุญาต — CC BY-NC 4.0 ใช้เชิงพาณิชย์ได้ผ่าน Model Vault เทียบกับ Apache 2.0 ไม่มีการปิดกั้นการเข้าถึง

คุณภาพที่รายงาน — WMT26 83.60, ไม่ระบุชื่อเมตริก, ข้อมูลที่ผู้ขายรายงานเทียบกับตารางผู้ขายที่ระบุชื่อบน FLORES-200, WMT25 GEMBA, XCOMET-XXL และ IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

ปัญหาเกณฑ์มาตรฐาน

นี่คือแก่นที่ตรงไปตรงมาของการเปรียบเทียบนี้: เราไม่สามารถจัดอันดับสองโมเดลนี้เทียบกันได้ และใครก็ตามที่บอกคุณเป็นอย่างอื่นกำลังกุตัวเลขขึ้นมา Tencent เผยแพร่การประเมินที่มีชื่อเรียกสี่รายการ ในงานแปล FLORES-200 จากอังกฤษเป็น X โมเดล 7B ทำได้ 93.52 ตามหลัง 94.42 ของ Gemini 3.1 Pro และ 94.16 ของ GPT-5.5 แต่ใกล้พอจนมีนัยสำคัญ บนเมตริก GEMBA ที่ใกล้เคียง WMT25 มันได้ 82.24 เทียบกับ 84.34 ของ 30B-A3B และ 83.41 ของ GPT-5.5 บน XCOMET-XXL มันนำทุกอย่างในตารางเปรียบเทียบของ Tencent ด้วยคะแนน 63.86 — นำหน้า Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro และ Kimi K2.6 บนคะแนนการปฏิบัติตามคำสั่งของ IFMTBench มันอยู่ที่ 83.14% ทั้งหมดนี้เป็นตัวเลขของ Tencent เอง ไม่มีการทำซ้ำอย่างเป็นอิสระแม้แต่รายการเดียว และยังมากกว่าสิ่งที่ Cohere เสนอไว้มาก

Cohere เผยแพร่ตัวเลขเพียงค่าเดียว: คะแนน WMT26 ที่ 83.60 ซึ่งเพิ่มขึ้นเป็น 84.36 ภายใต้เวิร์กโฟลว์แบบหลายรอบที่ใช้เอเจนต์ ไม่มีการระบุชื่อเมตริกไว้บนการ์ดโมเดลหรือในบันทึกการเปิดตัว และยังไม่มีการเผยแพร่หน้าผลลัพธ์ WMT26 สำหรับโมเดลนี้ ความไม่สมมาตรนี้ไม่ใช่หลักฐานว่าโมเดลของ Cohere อ่อนกว่าหรือแข็งกว่า นั่นหมายความว่าการเปรียบเทียบที่ผู้อ่านต้องการมากที่สุด — การทดสอบเดียวกัน เมตริกเดียวกัน ทั้งสองโมเดล — ไม่สามารถทำได้จากหลักฐานสาธารณะ และช่วงห่างสี่จุดภายในตัวเลขสองค่าของ Cohere เอง (83.60 ถึง 84.36) ก็ใหญ่กว่าช่องว่างส่วนใหญ่ในตารางของ Tencent แล้ว

ภาษาและเอกสารฉบับยาว

North Small Translate 1.0 ครอบคลุม 50 ภาษาและตัวแปรท้องถิ่น โดยกำหนดให้ภาษาอาหรับมาตรฐานสมัยใหม่ เยอรมัน ฝรั่งเศส ญี่ปุ่น เกาหลี รัสเซีย และยูเครน อยู่ในระดับหนึ่ง และรับเข้าและส่งออก 16,000 โทเค็นทั้งสองด้าน Hy-MT2-7B ครอบคลุม 33 ภาษา บวกกับภาษาและถิ่นของชนกลุ่มน้อยอีก 5 ภาษา รวมถึงทิเบต อุยกูร์ และกวางตุ้ง ไม่มีรายการใดที่ครอบคลุมอีกรายการทั้งหมด — Tencent ครอบคลุมกวางตุ้งและอุยกูร์ ส่วน Cohere ครอบคลุมชุดภาษาท้องถิ่นในยุโรปที่กว้างกว่า — ดังนั้นการติดตั้งใช้งานหลายภาษาอาจพบว่าจำเป็นต้องมีทั้งสองระบบด้วยเหตุผลด้านความครอบคลุมเพียงอย่างเดียว

หน้าต่างเอาต์พุตคือความแตกต่างที่เงียบกว่า เอาต์พุตหนึ่งหมื่นหกพันโทเคนหมายถึงเอกสารขั้นตอนฉบับเต็มในรอบเดียว โดยคำศัพท์และระดับภาษาสอดคล้องกันตลอดทั้งฉบับ เพราะโมเดลได้เห็นทั้งหมด หน้าต่างขนาด 8K ทำเช่นนั้นไม่ได้ และวิธีเลี่ยงแบบแปลทีละประโยคก็ทำให้ปัญหาความสอดคล้องข้ามช่วงข้อความหวนกลับมาพอดี ซึ่งเป็นปัญหาที่เกณฑ์วัดการปฏิบัติตามคำสั่งสำหรับงานแปลอย่าง IFMTBench ถูกสร้างขึ้นมาเพื่อวัด

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

ใบอนุญาตอีกครั้งชี้ขาดมากกว่าตาราง

North Small Translate 1.0 อยู่ภายใต้สัญญาอนุญาต CC BY-NC 4.0 น้ำหนักโมเดลใช้ฟรีสำหรับงานที่ไม่ใช่เชิงพาณิชย์ ส่วนการปรับใช้เชิงพาณิชย์ต้องดำเนินการผ่าน Cohere's Model Vault ภายใต้สัญญาอนุญาตแบบซื้อ ซึ่งไม่มีราคาเผยแพร่ต่อสาธารณะ Hy-MT2-7B อยู่ภายใต้ Apache 2.0 และไม่มีการจำกัดการเข้าถึง — การใช้งานเชิงพาณิชย์ การปรับแต่งละเอียด และงานดัดแปลง ได้รับอนุญาตทั้งหมดโดยไม่ต้องเจรจาใด ๆ สำหรับผลิตภัณฑ์เชิงพาณิชย์ ลำดับการดำเนินการนั้นชัดเจนในตัว: Hy-MT2-7B พร้อมปรับใช้ได้ตั้งแต่วันนี้ และโมเดลของ Cohere สามารถประเมินได้ตั้งแต่วันนี้ และไม่มีแถวผลเบนช์มาร์กใดเปลี่ยนแปลงลำดับดังกล่าว

ข้อได้เปรียบที่ชดเชยของ Cohere คือระดับฟรี North Small Translate 1.0 ทำงานบนระดับฟรีของ Chat V2 โดยไม่มีค่าใช้จ่ายทั้งคีย์ทดลองและคีย์โปรดักชันจนกว่าจะถึงขีดจำกัดอัตรา ดังนั้นการประเมินจึงมีค่าใช้จ่ายเพียงเวลาเท่านั้น Hy-MT2-7B มี API เชิงพาณิชย์แบบโฮสต์ — Tencent ตั้งราคาระดับโฮสต์ของตระกูลนี้ไว้ที่ประมาณ $0.044 ต่อล้านโทเคนอินพุต และ $0.177 ต่อล้านโทเคนเอาต์พุต — และการโฮสต์เองบน GPU ของคุณเองคือเส้นทางฟรีอย่างแท้จริง

สิ่งที่ "multi-pass" จริง ๆ แล้วสื่อถึง

การตัดสินใจของ Cohere ที่จะเผยแพร่ทั้ง 83.60 และ 84.36 ถือเป็นรายละเอียดที่ให้ข้อมูลมากที่สุดในบันทึกการเปิดตัวของบริษัท เพราะมันบอกว่าบริษัทเชื่อว่าเวิร์กโฟลว์ชนะการเรียกใช้งานเพียงครั้งเดียว นั่นคือเดิมพันแบบเดียวกับที่ Tencent ทำด้วยกลไกที่ต่างออกไป: 30B-A3B เรือธงของบริษัทชนะบน GEMBA และ XCOMET ขณะที่ Gemini 3.1 Pro ชนะบน FLORES-200 ซึ่งหมายความว่าระบบที่ดีที่สุดไม่ใช่โมเดลเดียวแต่เป็นคณะผู้ตัดสิน การหลอมรวมโมเดลของ OrcaRouter รันหลายโมเดลเป็นคณะและประสานคำตอบของพวกมันภายในครั้งเดียว ซึ่งเป็นเวอร์ชันระดับแพลตฟอร์มของแนวคิดการประมวลผลหลายรอบที่ทั้งสองผู้ขายกำลังไล่ตาม — และมันทำงานร่วมกับฝั่งการจัดเส้นทางได้ด้วย โดยที่ คีย์เดียวครอบคลุมแคตตาล็อกโมเดลมากกว่า 200 รายการในราคาตามที่ผู้ให้บริการประกาศ โดยบวกเพิ่ม 0% ดังนั้นการเปลี่ยนแปลงราคาของผู้ขายจึงตกมาถึงฝั่งเราในวันเดียวกัน แทนที่จะเป็นตอนต่อสัญญาครั้งถัดไป

กรอบความคิดนี้ยังช่วยแก้ปัญหาด้านหลักฐานที่บทความนี้เปิดประเด็นไว้ด้วย เมื่อผู้ขายสองรายเผยแพร่ผลการวัดที่ไม่ทับซ้อนกัน และไม่มีฝ่ายใดเลยที่มีการประเมินจากบุคคลที่สาม วิธีเลือกก็ไม่ใช่การเชื่อตารางใดตารางหนึ่ง แต่คือการรันทั้งสองตัวกับเอกสารของคุณเอง แล้วปล่อยให้ความไม่ตรงกันปรากฏขึ้นบนข้อความจริง ซึ่งนั่นคือสิ่งที่ panel และ failover chain มีไว้เพื่อทำ именно

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

อันไหน และเมื่อไหร่

หากคุณต้องการโมเดลแปลภาษาที่รันบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว ในผลิตภัณฑ์เชิงพาณิชย์ โดยไม่ต้องหารือเรื่องสิทธิ์การใช้งาน Hy-MT2-7B ชนะด้วยความได้เปรียบของเงื่อนไขการใช้งานเพียงอย่างเดียว — และผลลัพธ์ที่ผู้ขายเผยแพร่ แม้จะยังไม่มีการทำซ้ำ อย่างน้อยก็มีการระบุชื่อ เปรียบเทียบได้ และใกล้เคียงกับระดับแนวหน้า หากคุณกำลังแปลเอกสารยาวเป็นภาษาทั้งห้าสิบภาษาของ Cohere ต้องการเอาต์พุตที่สอดคล้องกัน 16K ต่อรอบ และมีงบประมาณสำหรับ B200 สองตัว หรือยินดีที่จะรันการประเมินบนฟรีเทียร์ของ Cohere ก่อนตัดสินใจ North Small Translate 1.0 คือโมเดลที่มีความสามารถมากกว่าในทุกแกนที่เปิดเผย

สิ่งที่ทั้งสองโมเดลไม่ได้ทำก็คือทำให้การทดสอบหมดความจำเป็นไป Cohere มอบตัวเลขไร้ชื่อให้คุณหนึ่งตัว พร้อมวิธีตรวจสอบมันแบบฟรี ๆ ส่วน Tencent มอบตารางให้คุณหนึ่งตารางและการดาวน์โหลดขนาดเท่า GPU ตัวเลข 83.60 คือคำสัญญา ไม่ใช่ผลลัพธ์ — และที่เดียวที่คำสัญญานั้นจะได้รับการพิสูจน์ก็คือบนชุดข้อมูลของคุณเอง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube