
North Small Translate 1.0 กับ Hy-MT2-1.8B: โมเดล 218GB เทียบกับ 440MB
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 ต่อ 1 ล้านโทเค็น
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
หนึ่งในสองตัวนี้ใส่ลงในโทรศัพท์ได้ Hy-MT2-1.8B โมเดลแปลภาษาบนอุปกรณ์ของ Tencent Hunyuan ที่เปิดซอร์สภายใต้ Apache 2.0 เมื่อวันที่ 21 พฤษภาคม 2026 ย่อขนาดเหลือ 440 เมกะไบต์ภายใต้การควอนไทซ์ 1.25 บิตของ AngelSlim และรันบนชิปโทรศัพท์ของ Apple, Qualcomm และ MediaTek North Small Translate 1.0 โมเดล mixture-of-experts ขนาด 218 พันล้านพารามิเตอร์ที่ Cohere บันทึกไว้ในเอกสาร release notes เมื่อวันที่ 9 กันยายน 2026 มาพร้อมชุดน้ำหนัก FP8 ขนาดราว 218 กิกะไบต์ และต้องใช้ B200 อย่างน้อยสองตัว นั่นคือปริมาณพื้นที่จัดเก็บราวห้าร้อยเท่าสำหรับหนึ่งในนั้น และคำถามที่น่าสนใจไม่ใช่ว่าตัวไหนดีกว่า — แต่คือแต่ละตัวมีไว้ทำอะไรกันแน่ และไลเซนส์ตัวไหนที่ให้คุณนำไปปล่อยได้
ความแตกต่างของขนาดไม่ใช่ความแตกต่างของคุณภาพ
การตีความ 218B เทียบกับ 1.8B ว่าเป็นอันดับความสามารถแบบตรงไปตรงมานั้นเป็นเรื่องที่ชวนให้ทำ แต่ก็ไม่ใช่เช่นนั้น ด้วยเหตุผลสองประการ ประการแรก North Small Translate 1.0 เป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์เพียง 25 พันล้านตัวที่ทำงานต่อโทเคน ดังนั้นปริมาณการประมวลผลต่อโทเคนจึงอยู่คนละระดับกับจำนวนพารามิเตอร์ ประการที่สองคือ โมเดลทั้งสองถูกปรับให้เหมาะกับวัตถุประสงค์ที่แตกต่างกัน: 1.8B ของ Tencent ถูกสร้างให้เล็กพอที่จะรันแบบออฟไลน์บนมือถือได้ และโมเดลของ Cohere ถูกสร้างให้เก็บเอกสารทั้งฉบับไว้ในบริบทและแปลเอกสารนั้นเป็นหน่วยเดียวกัน
ความแตกต่างนี้เห็นได้ชัดในหน้าต่างบริบท การกำหนดค่าของ Hy-MT2-1.8B ระบุว่ารองรับได้ถึง 262,144 ตำแหน่ง แต่แนวทางการอนุมานของ Tencent เองจำกัดการสร้างไว้ที่ 8,192 โทเคน — หน้าต่างการทำงานจริงคือ 8K ส่วน North Small Translate 1.0 ระบุว่าอินพุต 16K และเอาต์พุต 16K ซึ่งเป็นสองเท่าของหน้าต่างอินพุต และที่สำคัญยิ่งกว่านั้นคือเอาต์พุตเต็ม 16K หากงานที่คุณทำคือคู่มือบริการ งบเอาต์พุตนั้นคือหัวใจสำคัญ หากงานที่คุณทำคือข้อความแชท มันก็ไม่เกี่ยวข้องเลย
• พารามิเตอร์ทั้งหมด — North Small Translate 1.0: 218B MoE, 25B active เทียบกับ Hy-MT2-1.8B: 1.8B dense
• บริบท — อินพุต 16K และเอาต์พุต 16K เทียบกับหน้าต่างการทำงาน 8K (คอนฟิกโฆษณาว่ารองรับได้ถึง 262,144 ตำแหน่ง; คำแนะนำของ Tencent ระบุว่า 8,192)
• ภาษา — 50 (อังกฤษ + 49) เทียบกับ 33 ภาษา บวกกับ 5 ภาษาของชนกลุ่มน้อยและภาษาถิ่น
• สัญญาอนุญาต — CC BY-NC 4.0 ใช้เชิงพาณิชย์ได้ผ่าน Model Vault เทียบกับ Apache 2.0 ไม่มีการปิดกั้นการเข้าถึง
• ขนาดพื้นที่แบบควอนไทซ์ — FP8 ~218GB, NVFP4 W4A16 ~109GB เทียบกับ 440MB ที่ 1.25-bit ทั้ง FP8 และ GGUF ก็เผยแพร่แล้วเช่นกัน
• ฮาร์ดแวร์ขั้นต่ำ — 2×B200 หรือ 4×H100 ที่ FP8 เทียบกับมือถือ

สิ่งที่ Tencent เปิดตัวจริง ๆ ใน 1.8B
1.8B เป็นสมาชิกที่เล็กที่สุดในตระกูลสามโมเดล — 1.8B, 7B และ 30B-A3B MoE เรือธง — ซึ่งเปิดตัวพร้อมกันทั้งหมด พร้อมกับ benchmark คู่กันชื่อ IFMTBench ที่วัดความสามารถในการทำตามคำสั่งในงานแปล มากกว่าคุณภาพการแปลแบบดิบ ๆ Tencent ปล่อยการควอนไทซ์แบบ FP8, GGUF, 2-bit และ 1.25-bit มาพร้อมกับ weights ฐาน และเวอร์ชัน 1.25-bit คือเวอร์ชันที่ให้ตัวเลข 440MB พร้อมกับคำอ้างว่ามีความเร็ว inference เพิ่มขึ้น 1.5 เท่าเมื่อเทียบกับรุ่นก่อนหน้าอย่าง Hy-MT1.5 การเสิร์ฟรองรับผ่าน transformers 5.6.0 ขึ้นไป, vLLM, SGLang และ llama.cpp โดยเส้นทาง GGUF ต้องพึ่งพาเคอร์เนล STQ ที่ถูกนำเข้าใน llama.cpp แล้ว ค่าที่แนะนำสำหรับการสุ่มคือ temperature 0.7, top_p 0.6, top_k 20, repetition penalty 1.05 และไม่มี system prompt เริ่มต้น — ซึ่งตรงกันข้ามกับแนวทางของ Cohere
อีกทั้งยังเป็นโมเดลที่มีการนำไปใช้อย่างเห็นได้ชัด ต่างจาก North Small Translate 1.0 รีพอยทอรีของ Hugging Face ถูกดาวน์โหลดมากกว่า 23,000 ครั้ง และมีผู้กดถูกใจราว 1,200 ครั้ง ส่วนรีพอยทอรีหลักของ Cohere แสดง 26 ดาวน์โหลดและไม่มีไลก์เลย ณ เวลาที่เขียนข้อความนี้
สัญญาอนุญาตคือความแตกต่างที่ชัดเจนกว่า
นี่คือส่วนที่ควรเป็นตัวตัดสินการนำไปใช้งานจริงได้มากกว่าตาราง benchmark เสียอีก Hy-MT2-1.8B ใช้สัญญาอนุญาต Apache 2.0 โดยไม่มีข้อจำกัดการเข้าถึง — การใช้งานเชิงพาณิชย์ การ fine-tune งานดัดแปลง และการเผยแพร่ซ้ำ ล้วนได้รับอนุญาตทั้งหมด North Small Translate 1.0 ใช้ CC BY-NC 4.0: น้ำหนักโมเดลใช้ฟรีสำหรับการใช้งานที่ไม่ใช่เชิงพาณิชย์ และการนำไปใช้งานเชิงพาณิชย์ต้องซื้อสัญญาอนุญาตผ่าน Model Vault ของ Cohere ซึ่งไม่มีการประกาศราคาไว้
พูดตรง ๆ ก็คือ: ถ้าคุณกำลังสร้างผลิตภัณฑ์ โมเดลของ Tencent คือโมเดลที่คุณส่งมอบได้วันนี้โดยไม่ต้องมีการหารือ และโมเดลของ Cohere คือโมเดลที่คุณทำได้เพียงประเมินเท่านั้น ความไม่สมมาตรนั้นไม่ได้ทำให้โมเดล Cohere แย่ลง แต่ทำให้ลำดับการดำเนินการเปลี่ยนไป — คุณประเมินของ Cohere และคุณนำของ Tencent ไปใช้งานได้
หลักฐานด้านคุณภาพไม่สมมาตร และทั้งสองฝ่ายเป็นข้อมูลที่ผู้ขายรายงานเอง
ไม่มีโมเดลใดมีงานประเมินที่เป็นอิสระรองรับอยู่เบื้องหลัง ดังนั้นให้ถือว่าตัวเลขทุกตัวตรงนี้เป็นคำกล่าวอ้างของผู้พัฒนาเอง ความแตกต่างอยู่ที่ว่าผู้พัฒนาแต่ละรายเปิดเผยข้อมูลไว้มากแค่ไหน Tencent เผยแพร่ตารางเปรียบเทียบแบบครบถ้วนและรายงานทางเทคนิค: ในงานแปลอังกฤษเป็นภาษาอื่น (English-to-X) ของ FLORES-200 นั้น Hy-MT2-1.8B ทำได้ 90.00 เทียบกับ 94.42 ของ Gemini 3.1 Pro และ 94.16 ของ GPT-5.5 — ตามหลังโมเดลระดับแนวหน้าอยู่เล็กน้อย แต่ห่างเพียงไม่กี่คะแนน จากโมเดลที่ใส่ในโทรศัพท์ได้ ในคะแนนการปฏิบัติตามคำสั่งโดยรวมของ IFMTBench นั้นรุ่น 1.8B อยู่ที่ 69.36% ตามหลังรุ่นพี่น้องในตระกูลเดียวกันอย่าง 30B-A3B ที่ 85.7% และ Gemini 3.1 Pro ที่ 89.08% ค่อนข้างมาก ซึ่งเป็นการตีความข้อแลกเปลี่ยนนี้อย่างตรงไปตรงมา: โมเดลจิ๋วปฏิบัติตามคำสั่งด้านการจัดรูปแบบและคำศัพท์ได้ไม่น่าเชื่อถือเท่ากับความสามารถในการแปลของมันเลย
Cohere เผยแพร่ตัวเลขเพียงตัวเดียว — คะแนน WMT26 ที่ 83.60 ซึ่งเพิ่มขึ้นเป็น 84.36 ด้วยเวิร์กโฟลว์แบบหลายรอบที่ขับเคลื่อนด้วยเอเจนต์ — โดยไม่มีชื่อเมตริกกำกับ และไม่มีหน้าผลลัพธ์ WMT26 ให้ตรวจสอบเทียบได้ นั่นไม่ใช่การเปรียบเทียบที่เราสามารถทำได้ ตัวเลขที่ไม่มีชื่อเพียงตัวเดียวไม่อาจนำไปวางเทียบกับตารางของเกณฑ์มาตรฐานที่มีชื่อได้ และการแสร้งทำเป็นอย่างอื่นจะเป็นสิ่งที่ทำให้เข้าใจผิดมากที่สุดที่บทความนี้ทำได้

จุดถ่วงดุลของ Tencent ก็คือ ตัวเลขของบริษัทมาจากแหล่งที่ผู้อ่านสามารถตรวจสอบได้ ที่เก็บโค้ด Hy-MT2 เผยแพร่ภาพรวมของตระกูลโมเดล ขนาดโมเดลทั้งสามแบบ และรันไทม์ที่แต่ละแบบรองรับ ควบคู่ไปกับตารางเกณฑ์มาตรฐาน ซึ่งนั่นเองคือสิ่งที่ทำให้ตัวเลขของ FLORES-200 และ IFMTBench สามารถตรวจสอบได้เลย และเป็นสิ่งที่ทำให้ตัวเลขเดียวที่ไร้ชื่อของ Cohere ดูโดดเด่นขึ้นมาเมื่อเทียบกัน

แต่ละอันมีค่าใช้จ่ายในการโทรเท่าไร
โมเดล 1.8B ของ Tencent มี API เชิงพาณิชย์แบบโฮสต์ที่เปิดตัวในเดือนสิงหาคม 2026 ราคาประมาณ $0.044 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $0.177 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน — ถูกในเชิงตัวเลขสัมบูรณ์ และคิดราคาตามจำนวนโทเคน โมเดลของ Cohere ทำงานบนแพ็กเกจฟรีของ Chat V2 ใช้ฟรีสำหรับคีย์ทดลองและคีย์โปรดักชันจนกว่าจะถึงขีดจำกัดอัตรา ดังนั้นต้นทุนการประเมินจึงเป็นศูนย์ แต่ต้นทุนการใช้งานจริงคือสัญญาที่คุณต้องเจรจา การโฮสต์เองพลิกการคำนวณทั้งหมด: 440MB บนมือถือ เทียบกับ B200 สองตัว ซึ่งเป็นความแตกต่างที่วัดกันเป็นอันดับของขนาด ไม่ใช่เป็นเปอร์เซ็นต์
เหตุผลที่ช่องว่างนั้นควรค่าแก่การกล่าวถึงในบทความเกี่ยวกับแพลตฟอร์มการกำหนดเส้นทาง ก็คือระดับราคาถูกกับระดับราคาแพงไม่ใช่คู่แข่งกัน — พวกมันคือสองตำแหน่งในลำดับการไล่ระดับ และการไล่ระดับคือสิ่งที่เราเตอร์ถูกออกแบบมาเพื่อทำ OrcaRouter ส่งต่อราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายลดราคา endpoint การแปลแบบโฮสต์ ฝั่งเราจึงมีผลทันทีในวันเดียวกัน โดยไม่มีส่วนต่างของตัวแทนจำหน่ายให้ต้องเจรจาใหม่ และเชน failover ทำให้โมเดลขนาดเล็กสามารถรองรับทราฟฟิกส่วนใหญ่ไว้ได้ ขณะที่โมเดลที่หนักกว่าจะรับช่วงคำขอที่โมเดลเล็กจัดการไม่ได้ ลองใช้ตัวที่ถูกก่อน แล้วยกระดับเมื่อเจอเคสยาก ๆ และให้ชั้นการกำหนดเส้นทางเป็นที่เก็บนโยบายแทนโค้ดแอปพลิเคชันของคุณ
คุณควรเลือกอันไหน
หากการแปลของคุณเกิดขึ้นบนอุปกรณ์ แบบออฟไลน์ ภายใต้งบประมาณพื้นที่จัดเก็บต่อเมกะไบต์ หรือภายในผลิตภัณฑ์เชิงพาณิชย์ที่ไม่มีความกระหายที่จะเจรจาเรื่องใบอนุญาต Hy-MT2-1.8B คือคำตอบ และ North Small Translate 1.0 ก็ไม่ได้อยู่ในข่ายพิจารณา หากหน่วยของงานของคุณคือเอกสารยาวในหนึ่งในห้าสิบภาษาที่ Cohere รองรับ หากคุณต้องการเอาต์พุต 16K ในรอบเดียว และหากใบอนุญาตเชิงพาณิชย์เป็นสิ่งที่องค์กรของคุณยินดีจ่ายเพื่อซื้อ โมเดลของ Cohere ก็คือเครื่องจักรที่มีความสามารถมากกว่าในทุกมิติที่เปิดเผย โดยมีข้อแม้ว่าคุณภาพของมันนั้นขึ้นอยู่กับตัวเลขเพียงตัวเดียวที่ยังไม่มีการทำซ้ำ
และสำหรับทีมส่วนใหญ่ คำตอบที่ตรงไปตรงมาคือทั้งสองอย่าง ตามลำดับนั้น: โมเดล 440MB ทำงานประจำด้วยต้นทุนต่ำจนแทบไม่นับ โมเดล 218B จัดการเอกสารที่สำคัญ และการตัดสินใจว่าคำขอใดควรไปที่ใดเป็นกฎการกำหนดเส้นทาง มากกว่าจะเป็นการเขียนใหม่ ช่องว่างระหว่างสองโมเดลนี้ไม่ใช่ช่องว่างที่ต้องปิด มันคือสเปกตรัมที่ต้องนำมาใช้
