
North Small Translate 1.0 vs Hy-MT2-7B: หนึ่ง GPU ปะทะสอง B200
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 ต่อ 1 ล้านโทเค็น
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
การเทียบเคียงที่สูสีที่สุดในการแปลแบบโอเพนซอร์สในตอนนี้อาจเป็นคู่ที่ชัดเจนน้อยที่สุดด้วยก็ได้ Hy-MT2-7B เป็นโมเดลลูกคนกลางในตระกูลการแปลของ Tencent Hunyuan เปิดซอร์สภายใต้ Apache 2.0 เมื่อวันที่ 21 พฤษภาคม 2026 และรันบน RTX 4090 หรือ A100 เพียงตัวเดียวโดยใช้ VRAM ประมาณ 16GB North Small Translate 1.0 เป็นโมเดลแปลแบบ sparse mixture-of-experts ขนาด 218 พันล้านพารามิเตอร์ของ Cohere ซึ่งมีเอกสารระบุไว้ในบันทึกการเปิดตัวของบริษัทเมื่อวันที่ 9 กันยายน 2026 โดยมีการติดตั้งใช้งานขั้นต่ำเป็น B200 สองตัวที่ FP8 หรือ B200 หนึ่งตัวในรูปแบบ NVFP4 W4A16 ทั้งคู่เป็นผู้เชี่ยวชาญด้านการแปล ทั้งคู่เป็นรุ่นปัจจุบัน หนึ่งในนั้นคุณสามารถให้บริการได้จากเวิร์กสเตชัน และข้อเท็จจริงเพียงข้อนี้ทำให้ต้องมองการเปรียบเทียบทั้งหมดใหม่ — เพราะไม่มีเบนช์มาร์กที่ทั้งคู่จะอยากถูกตัดสินบนเงื่อนไขที่เท่าเทียมกันมากที่สุด
เริ่มจากซองจดหมาย ไม่ใช่คะแนน
ต้นทุนการปรับใช้เป็นมิติที่ตัดสินการผสานรวมจริงส่วนใหญ่ และในจุดนี้ สองโมเดลไม่ได้ใกล้เคียงกันเลย Hy-MT2-7B เป็นโมเดลแบบ dense ในตระกูล HunYuanDenseV1 ที่มีพารามิเตอร์ประมาณแปดพันล้านตัว พร้อมบิลด์ FP8 และ GGUF ที่เผยแพร่แล้ว รวมถึงเวอร์ชัน MLX 8-bit จากชุมชนสำหรับ Apple silicon บันทึกการปรับใช้ของ Tencent ระบุว่า transformers 5.6.0 หรือใหม่กว่า, vLLM, SGLang และ llama.cpp เป็นรันไทม์ที่รองรับ และคำแนะนำด้านการอนุมานจำกัดการสร้างไว้ที่ 8,192 โทเคน แม้ว่าการกำหนดค่าจะโฆษณาว่ารองรับตำแหน่งได้สูงสุดถึง 262,144 ตำแหน่ง GPU สำหรับผู้บริโภคหรือเวิร์กสเตชันสมัยใหม่เพียงตัวเดียวก็เพียงพอ
North Small Translate 1.0 จัดอยู่ในประเภทที่แตกต่างออกไปโดยสิ้นเชิง พารามิเตอร์รวม 218B โดยมี 25B ที่ใช้งานอยู่ แบ่งออกเป็น 128 ผู้เชี่ยวชาญ โดยเปิดใช้งานแปดตัวต่อโทเคน บวกกับผู้เชี่ยวชาญที่ใช้ร่วมกัน และ Cohere เผยแพร่ฮาร์ดแวร์ขั้นต่ำสำหรับเช็กพอยต์ทั้งสามแบบ: B200 จำนวนสี่ตัว หรือ H100 จำนวนแปดตัว สำหรับ BF16, B200 จำนวนสองตัว หรือ H100 จำนวนสี่ตัว สำหรับ FP8, B200 จำนวนหนึ่งตัว หรือ H100 จำนวนสองตัว สำหรับบิลด์ NVFP4 W4A16 การให้บริการทำงานผ่าน vLLM ด้วย cohere_melody>=0.9.0 และ Cohere แนะนำให้ใช้ greedy decoding เพื่อให้ตรงกับโปรดักชัน เอาต์พุตมี <|START_TEXT|> และ <|END_TEXT|> เครื่องหมายที่ไม่ได้ลงทะเบียนเป็นโทเคนพิเศษ
• โครงสร้าง — North Small Translate 1.0: รวม 218B / ใช้งาน 25B แบบ sparse MoE, ผู้เชี่ยวชาญ 128 ตัว เทียบกับ Hy-MT2-7B: แบบ dense ประมาณ 8B
• บริบท — อินพุต 16K และเอาต์พุต 16K เทียบกับหน้าต่างทำงาน 8K โดยคอนฟิกโฆษณาว่ารองรับได้ถึง 262,144 ตำแหน่ง
• ฮาร์ดแวร์ขั้นต่ำ — 1×B200 ที่ W4A16, 2×B200 หรือ 4×H100 ที่ FP8 เมื่อเทียบกับ GPU ระดับ RTX 4090 เพียงตัวเดียวในหน่วยความจำ ~16GB
• รูปแบบที่เผยแพร่ — BF16, FP8, NVFP4 W4A16 เทียบกับ base, FP8, GGUF และ MLX 8-bit จากชุมชน
• ภาษา — 50 (อังกฤษ + 49) เทียบกับ 33 ภาษา บวกกับ 5 ภาษาของชนกลุ่มน้อยและภาษาถิ่น
• สัญญาอนุญาต — CC BY-NC 4.0 ใช้เชิงพาณิชย์ได้ผ่าน Model Vault เทียบกับ Apache 2.0 ไม่มีการปิดกั้นการเข้าถึง
• คุณภาพที่รายงาน — WMT26 83.60, ไม่ระบุชื่อเมตริก, ข้อมูลที่ผู้ขายรายงานเทียบกับตารางผู้ขายที่ระบุชื่อบน FLORES-200, WMT25 GEMBA, XCOMET-XXL และ IFMTBench

ปัญหาเกณฑ์มาตรฐาน
นี่คือแก่นที่ตรงไปตรงมาของการเปรียบเทียบนี้: เราไม่สามารถจัดอันดับสองโมเดลนี้เทียบกันได้ และใครก็ตามที่บอกคุณเป็นอย่างอื่นกำลังกุตัวเลขขึ้นมา Tencent เผยแพร่การประเมินที่มีชื่อเรียกสี่รายการ ในงานแปล FLORES-200 จากอังกฤษเป็น X โมเดล 7B ทำได้ 93.52 ตามหลัง 94.42 ของ Gemini 3.1 Pro และ 94.16 ของ GPT-5.5 แต่ใกล้พอจนมีนัยสำคัญ บนเมตริก GEMBA ที่ใกล้เคียง WMT25 มันได้ 82.24 เทียบกับ 84.34 ของ 30B-A3B และ 83.41 ของ GPT-5.5 บน XCOMET-XXL มันนำทุกอย่างในตารางเปรียบเทียบของ Tencent ด้วยคะแนน 63.86 — นำหน้า Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro และ Kimi K2.6 บนคะแนนการปฏิบัติตามคำสั่งของ IFMTBench มันอยู่ที่ 83.14% ทั้งหมดนี้เป็นตัวเลขของ Tencent เอง ไม่มีการทำซ้ำอย่างเป็นอิสระแม้แต่รายการเดียว และยังมากกว่าสิ่งที่ Cohere เสนอไว้มาก
Cohere เผยแพร่ตัวเลขเพียงค่าเดียว: คะแนน WMT26 ที่ 83.60 ซึ่งเพิ่มขึ้นเป็น 84.36 ภายใต้เวิร์กโฟลว์แบบหลายรอบที่ใช้เอเจนต์ ไม่มีการระบุชื่อเมตริกไว้บนการ์ดโมเดลหรือในบันทึกการเปิดตัว และยังไม่มีการเผยแพร่หน้าผลลัพธ์ WMT26 สำหรับโมเดลนี้ ความไม่สมมาตรนี้ไม่ใช่หลักฐานว่าโมเดลของ Cohere อ่อนกว่าหรือแข็งกว่า นั่นหมายความว่าการเปรียบเทียบที่ผู้อ่านต้องการมากที่สุด — การทดสอบเดียวกัน เมตริกเดียวกัน ทั้งสองโมเดล — ไม่สามารถทำได้จากหลักฐานสาธารณะ และช่วงห่างสี่จุดภายในตัวเลขสองค่าของ Cohere เอง (83.60 ถึง 84.36) ก็ใหญ่กว่าช่องว่างส่วนใหญ่ในตารางของ Tencent แล้ว
ภาษาและเอกสารฉบับยาว
North Small Translate 1.0 ครอบคลุม 50 ภาษาและตัวแปรท้องถิ่น โดยกำหนดให้ภาษาอาหรับมาตรฐานสมัยใหม่ เยอรมัน ฝรั่งเศส ญี่ปุ่น เกาหลี รัสเซีย และยูเครน อยู่ในระดับหนึ่ง และรับเข้าและส่งออก 16,000 โทเค็นทั้งสองด้าน Hy-MT2-7B ครอบคลุม 33 ภาษา บวกกับภาษาและถิ่นของชนกลุ่มน้อยอีก 5 ภาษา รวมถึงทิเบต อุยกูร์ และกวางตุ้ง ไม่มีรายการใดที่ครอบคลุมอีกรายการทั้งหมด — Tencent ครอบคลุมกวางตุ้งและอุยกูร์ ส่วน Cohere ครอบคลุมชุดภาษาท้องถิ่นในยุโรปที่กว้างกว่า — ดังนั้นการติดตั้งใช้งานหลายภาษาอาจพบว่าจำเป็นต้องมีทั้งสองระบบด้วยเหตุผลด้านความครอบคลุมเพียงอย่างเดียว
หน้าต่างเอาต์พุตคือความแตกต่างที่เงียบกว่า เอาต์พุตหนึ่งหมื่นหกพันโทเคนหมายถึงเอกสารขั้นตอนฉบับเต็มในรอบเดียว โดยคำศัพท์และระดับภาษาสอดคล้องกันตลอดทั้งฉบับ เพราะโมเดลได้เห็นทั้งหมด หน้าต่างขนาด 8K ทำเช่นนั้นไม่ได้ และวิธีเลี่ยงแบบแปลทีละประโยคก็ทำให้ปัญหาความสอดคล้องข้ามช่วงข้อความหวนกลับมาพอดี ซึ่งเป็นปัญหาที่เกณฑ์วัดการปฏิบัติตามคำสั่งสำหรับงานแปลอย่าง IFMTBench ถูกสร้างขึ้นมาเพื่อวัด

ใบอนุญาตอีกครั้งชี้ขาดมากกว่าตาราง
North Small Translate 1.0 อยู่ภายใต้สัญญาอนุญาต CC BY-NC 4.0 น้ำหนักโมเดลใช้ฟรีสำหรับงานที่ไม่ใช่เชิงพาณิชย์ ส่วนการปรับใช้เชิงพาณิชย์ต้องดำเนินการผ่าน Cohere's Model Vault ภายใต้สัญญาอนุญาตแบบซื้อ ซึ่งไม่มีราคาเผยแพร่ต่อสาธารณะ Hy-MT2-7B อยู่ภายใต้ Apache 2.0 และไม่มีการจำกัดการเข้าถึง — การใช้งานเชิงพาณิชย์ การปรับแต่งละเอียด และงานดัดแปลง ได้รับอนุญาตทั้งหมดโดยไม่ต้องเจรจาใด ๆ สำหรับผลิตภัณฑ์เชิงพาณิชย์ ลำดับการดำเนินการนั้นชัดเจนในตัว: Hy-MT2-7B พร้อมปรับใช้ได้ตั้งแต่วันนี้ และโมเดลของ Cohere สามารถประเมินได้ตั้งแต่วันนี้ และไม่มีแถวผลเบนช์มาร์กใดเปลี่ยนแปลงลำดับดังกล่าว
ข้อได้เปรียบที่ชดเชยของ Cohere คือระดับฟรี North Small Translate 1.0 ทำงานบนระดับฟรีของ Chat V2 โดยไม่มีค่าใช้จ่ายทั้งคีย์ทดลองและคีย์โปรดักชันจนกว่าจะถึงขีดจำกัดอัตรา ดังนั้นการประเมินจึงมีค่าใช้จ่ายเพียงเวลาเท่านั้น Hy-MT2-7B มี API เชิงพาณิชย์แบบโฮสต์ — Tencent ตั้งราคาระดับโฮสต์ของตระกูลนี้ไว้ที่ประมาณ $0.044 ต่อล้านโทเคนอินพุต และ $0.177 ต่อล้านโทเคนเอาต์พุต — และการโฮสต์เองบน GPU ของคุณเองคือเส้นทางฟรีอย่างแท้จริง
สิ่งที่ "multi-pass" จริง ๆ แล้วสื่อถึง
การตัดสินใจของ Cohere ที่จะเผยแพร่ทั้ง 83.60 และ 84.36 ถือเป็นรายละเอียดที่ให้ข้อมูลมากที่สุดในบันทึกการเปิดตัวของบริษัท เพราะมันบอกว่าบริษัทเชื่อว่าเวิร์กโฟลว์ชนะการเรียกใช้งานเพียงครั้งเดียว นั่นคือเดิมพันแบบเดียวกับที่ Tencent ทำด้วยกลไกที่ต่างออกไป: 30B-A3B เรือธงของบริษัทชนะบน GEMBA และ XCOMET ขณะที่ Gemini 3.1 Pro ชนะบน FLORES-200 ซึ่งหมายความว่าระบบที่ดีที่สุดไม่ใช่โมเดลเดียวแต่เป็นคณะผู้ตัดสิน การหลอมรวมโมเดลของ OrcaRouter รันหลายโมเดลเป็นคณะและประสานคำตอบของพวกมันภายในครั้งเดียว ซึ่งเป็นเวอร์ชันระดับแพลตฟอร์มของแนวคิดการประมวลผลหลายรอบที่ทั้งสองผู้ขายกำลังไล่ตาม — และมันทำงานร่วมกับฝั่งการจัดเส้นทางได้ด้วย โดยที่ คีย์เดียวครอบคลุมแคตตาล็อกโมเดลมากกว่า 200 รายการในราคาตามที่ผู้ให้บริการประกาศ โดยบวกเพิ่ม 0% ดังนั้นการเปลี่ยนแปลงราคาของผู้ขายจึงตกมาถึงฝั่งเราในวันเดียวกัน แทนที่จะเป็นตอนต่อสัญญาครั้งถัดไป
กรอบความคิดนี้ยังช่วยแก้ปัญหาด้านหลักฐานที่บทความนี้เปิดประเด็นไว้ด้วย เมื่อผู้ขายสองรายเผยแพร่ผลการวัดที่ไม่ทับซ้อนกัน และไม่มีฝ่ายใดเลยที่มีการประเมินจากบุคคลที่สาม วิธีเลือกก็ไม่ใช่การเชื่อตารางใดตารางหนึ่ง แต่คือการรันทั้งสองตัวกับเอกสารของคุณเอง แล้วปล่อยให้ความไม่ตรงกันปรากฏขึ้นบนข้อความจริง ซึ่งนั่นคือสิ่งที่ panel และ failover chain มีไว้เพื่อทำ именно

อันไหน และเมื่อไหร่
หากคุณต้องการโมเดลแปลภาษาที่รันบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว ในผลิตภัณฑ์เชิงพาณิชย์ โดยไม่ต้องหารือเรื่องสิทธิ์การใช้งาน Hy-MT2-7B ชนะด้วยความได้เปรียบของเงื่อนไขการใช้งานเพียงอย่างเดียว — และผลลัพธ์ที่ผู้ขายเผยแพร่ แม้จะยังไม่มีการทำซ้ำ อย่างน้อยก็มีการระบุชื่อ เปรียบเทียบได้ และใกล้เคียงกับระดับแนวหน้า หากคุณกำลังแปลเอกสารยาวเป็นภาษาทั้งห้าสิบภาษาของ Cohere ต้องการเอาต์พุตที่สอดคล้องกัน 16K ต่อรอบ และมีงบประมาณสำหรับ B200 สองตัว หรือยินดีที่จะรันการประเมินบนฟรีเทียร์ของ Cohere ก่อนตัดสินใจ North Small Translate 1.0 คือโมเดลที่มีความสามารถมากกว่าในทุกแกนที่เปิดเผย
สิ่งที่ทั้งสองโมเดลไม่ได้ทำก็คือทำให้การทดสอบหมดความจำเป็นไป Cohere มอบตัวเลขไร้ชื่อให้คุณหนึ่งตัว พร้อมวิธีตรวจสอบมันแบบฟรี ๆ ส่วน Tencent มอบตารางให้คุณหนึ่งตารางและการดาวน์โหลดขนาดเท่า GPU ตัวเลข 83.60 คือคำสัญญา ไม่ใช่ผลลัพธ์ — และที่เดียวที่คำสัญญานั้นจะได้รับการพิสูจน์ก็คือบนชุดข้อมูลของคุณเอง
