การ์ด Hero ที่มีหัวข้อ "North Small Translate 1.0 vs Hy-MT2-1.8B" พร้อมคำบรรยายใต้หัวข้อ "โมเดลขนาด 218GB เทียบกับ 440MB" โดยอยู่เหนือการ์ดสองใบ: North Small Translate 1.0 (218B MoE, ขั้นต่ำ 2x B200) และ Hy-MT2-1.8B (1.8B dense, 440MB, รันบนมือถือ) พร้อมไอคอนโครงร่างโทรศัพท์
Guides & Insights

North Small Translate 1.0 กับ Hy-MT2-1.8B: โมเดล 218GB เทียบกับ 440MB

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

หนึ่งในสองตัวนี้ใส่ลงในโทรศัพท์ได้ Hy-MT2-1.8B โมเดลแปลภาษาบนอุปกรณ์ของ Tencent Hunyuan ที่เปิดซอร์สภายใต้ Apache 2.0 เมื่อวันที่ 21 พฤษภาคม 2026 ย่อขนาดเหลือ 440 เมกะไบต์ภายใต้การควอนไทซ์ 1.25 บิตของ AngelSlim และรันบนชิปโทรศัพท์ของ Apple, Qualcomm และ MediaTek North Small Translate 1.0 โมเดล mixture-of-experts ขนาด 218 พันล้านพารามิเตอร์ที่ Cohere บันทึกไว้ในเอกสาร release notes เมื่อวันที่ 9 กันยายน 2026 มาพร้อมชุดน้ำหนัก FP8 ขนาดราว 218 กิกะไบต์ และต้องใช้ B200 อย่างน้อยสองตัว นั่นคือปริมาณพื้นที่จัดเก็บราวห้าร้อยเท่าสำหรับหนึ่งในนั้น และคำถามที่น่าสนใจไม่ใช่ว่าตัวไหนดีกว่า — แต่คือแต่ละตัวมีไว้ทำอะไรกันแน่ และไลเซนส์ตัวไหนที่ให้คุณนำไปปล่อยได้

ความแตกต่างของขนาดไม่ใช่ความแตกต่างของคุณภาพ

การตีความ 218B เทียบกับ 1.8B ว่าเป็นอันดับความสามารถแบบตรงไปตรงมานั้นเป็นเรื่องที่ชวนให้ทำ แต่ก็ไม่ใช่เช่นนั้น ด้วยเหตุผลสองประการ ประการแรก North Small Translate 1.0 เป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์เพียง 25 พันล้านตัวที่ทำงานต่อโทเคน ดังนั้นปริมาณการประมวลผลต่อโทเคนจึงอยู่คนละระดับกับจำนวนพารามิเตอร์ ประการที่สองคือ โมเดลทั้งสองถูกปรับให้เหมาะกับวัตถุประสงค์ที่แตกต่างกัน: 1.8B ของ Tencent ถูกสร้างให้เล็กพอที่จะรันแบบออฟไลน์บนมือถือได้ และโมเดลของ Cohere ถูกสร้างให้เก็บเอกสารทั้งฉบับไว้ในบริบทและแปลเอกสารนั้นเป็นหน่วยเดียวกัน

ความแตกต่างนี้เห็นได้ชัดในหน้าต่างบริบท การกำหนดค่าของ Hy-MT2-1.8B ระบุว่ารองรับได้ถึง 262,144 ตำแหน่ง แต่แนวทางการอนุมานของ Tencent เองจำกัดการสร้างไว้ที่ 8,192 โทเคน — หน้าต่างการทำงานจริงคือ 8K ส่วน North Small Translate 1.0 ระบุว่าอินพุต 16K และเอาต์พุต 16K ซึ่งเป็นสองเท่าของหน้าต่างอินพุต และที่สำคัญยิ่งกว่านั้นคือเอาต์พุตเต็ม 16K หากงานที่คุณทำคือคู่มือบริการ งบเอาต์พุตนั้นคือหัวใจสำคัญ หากงานที่คุณทำคือข้อความแชท มันก็ไม่เกี่ยวข้องเลย

พารามิเตอร์ทั้งหมด — North Small Translate 1.0: 218B MoE, 25B active เทียบกับ Hy-MT2-1.8B: 1.8B dense

บริบท — อินพุต 16K และเอาต์พุต 16K เทียบกับหน้าต่างการทำงาน 8K (คอนฟิกโฆษณาว่ารองรับได้ถึง 262,144 ตำแหน่ง; คำแนะนำของ Tencent ระบุว่า 8,192)

ภาษา — 50 (อังกฤษ + 49) เทียบกับ 33 ภาษา บวกกับ 5 ภาษาของชนกลุ่มน้อยและภาษาถิ่น

สัญญาอนุญาต — CC BY-NC 4.0 ใช้เชิงพาณิชย์ได้ผ่าน Model Vault เทียบกับ Apache 2.0 ไม่มีการปิดกั้นการเข้าถึง

ขนาดพื้นที่แบบควอนไทซ์ — FP8 ~218GB, NVFP4 W4A16 ~109GB เทียบกับ 440MB ที่ 1.25-bit ทั้ง FP8 และ GGUF ก็เผยแพร่แล้วเช่นกัน

ฮาร์ดแวร์ขั้นต่ำ — 2×B200 หรือ 4×H100 ที่ FP8 เทียบกับมือถือ

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-1.8B across six rows: Parameters 218B MoE / 25B active vs 1.8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Footprint about 218GB at FP8 vs 440MB at 1.25-bit; Minimum hardware 2x B200 vs a handset. Footer notes Hy-MT2 figures are vendor-reported by Tencent and Cohere's WMT26 83.60 is unaudited with an unnamed metric.

สิ่งที่ Tencent เปิดตัวจริง ๆ ใน 1.8B

1.8B เป็นสมาชิกที่เล็กที่สุดในตระกูลสามโมเดล — 1.8B, 7B และ 30B-A3B MoE เรือธง — ซึ่งเปิดตัวพร้อมกันทั้งหมด พร้อมกับ benchmark คู่กันชื่อ IFMTBench ที่วัดความสามารถในการทำตามคำสั่งในงานแปล มากกว่าคุณภาพการแปลแบบดิบ ๆ Tencent ปล่อยการควอนไทซ์แบบ FP8, GGUF, 2-bit และ 1.25-bit มาพร้อมกับ weights ฐาน และเวอร์ชัน 1.25-bit คือเวอร์ชันที่ให้ตัวเลข 440MB พร้อมกับคำอ้างว่ามีความเร็ว inference เพิ่มขึ้น 1.5 เท่าเมื่อเทียบกับรุ่นก่อนหน้าอย่าง Hy-MT1.5 การเสิร์ฟรองรับผ่าน transformers 5.6.0 ขึ้นไป, vLLM, SGLang และ llama.cpp โดยเส้นทาง GGUF ต้องพึ่งพาเคอร์เนล STQ ที่ถูกนำเข้าใน llama.cpp แล้ว ค่าที่แนะนำสำหรับการสุ่มคือ temperature 0.7, top_p 0.6, top_k 20, repetition penalty 1.05 และไม่มี system prompt เริ่มต้น — ซึ่งตรงกันข้ามกับแนวทางของ Cohere

อีกทั้งยังเป็นโมเดลที่มีการนำไปใช้อย่างเห็นได้ชัด ต่างจาก North Small Translate 1.0 รีพอยทอรีของ Hugging Face ถูกดาวน์โหลดมากกว่า 23,000 ครั้ง และมีผู้กดถูกใจราว 1,200 ครั้ง ส่วนรีพอยทอรีหลักของ Cohere แสดง 26 ดาวน์โหลดและไม่มีไลก์เลย ณ เวลาที่เขียนข้อความนี้

สัญญาอนุญาตคือความแตกต่างที่ชัดเจนกว่า

นี่คือส่วนที่ควรเป็นตัวตัดสินการนำไปใช้งานจริงได้มากกว่าตาราง benchmark เสียอีก Hy-MT2-1.8B ใช้สัญญาอนุญาต Apache 2.0 โดยไม่มีข้อจำกัดการเข้าถึง — การใช้งานเชิงพาณิชย์ การ fine-tune งานดัดแปลง และการเผยแพร่ซ้ำ ล้วนได้รับอนุญาตทั้งหมด North Small Translate 1.0 ใช้ CC BY-NC 4.0: น้ำหนักโมเดลใช้ฟรีสำหรับการใช้งานที่ไม่ใช่เชิงพาณิชย์ และการนำไปใช้งานเชิงพาณิชย์ต้องซื้อสัญญาอนุญาตผ่าน Model Vault ของ Cohere ซึ่งไม่มีการประกาศราคาไว้

พูดตรง ๆ ก็คือ: ถ้าคุณกำลังสร้างผลิตภัณฑ์ โมเดลของ Tencent คือโมเดลที่คุณส่งมอบได้วันนี้โดยไม่ต้องมีการหารือ และโมเดลของ Cohere คือโมเดลที่คุณทำได้เพียงประเมินเท่านั้น ความไม่สมมาตรนั้นไม่ได้ทำให้โมเดล Cohere แย่ลง แต่ทำให้ลำดับการดำเนินการเปลี่ยนไป — คุณประเมินของ Cohere และคุณนำของ Tencent ไปใช้งานได้

หลักฐานด้านคุณภาพไม่สมมาตร และทั้งสองฝ่ายเป็นข้อมูลที่ผู้ขายรายงานเอง

ไม่มีโมเดลใดมีงานประเมินที่เป็นอิสระรองรับอยู่เบื้องหลัง ดังนั้นให้ถือว่าตัวเลขทุกตัวตรงนี้เป็นคำกล่าวอ้างของผู้พัฒนาเอง ความแตกต่างอยู่ที่ว่าผู้พัฒนาแต่ละรายเปิดเผยข้อมูลไว้มากแค่ไหน Tencent เผยแพร่ตารางเปรียบเทียบแบบครบถ้วนและรายงานทางเทคนิค: ในงานแปลอังกฤษเป็นภาษาอื่น (English-to-X) ของ FLORES-200 นั้น Hy-MT2-1.8B ทำได้ 90.00 เทียบกับ 94.42 ของ Gemini 3.1 Pro และ 94.16 ของ GPT-5.5 — ตามหลังโมเดลระดับแนวหน้าอยู่เล็กน้อย แต่ห่างเพียงไม่กี่คะแนน จากโมเดลที่ใส่ในโทรศัพท์ได้ ในคะแนนการปฏิบัติตามคำสั่งโดยรวมของ IFMTBench นั้นรุ่น 1.8B อยู่ที่ 69.36% ตามหลังรุ่นพี่น้องในตระกูลเดียวกันอย่าง 30B-A3B ที่ 85.7% และ Gemini 3.1 Pro ที่ 89.08% ค่อนข้างมาก ซึ่งเป็นการตีความข้อแลกเปลี่ยนนี้อย่างตรงไปตรงมา: โมเดลจิ๋วปฏิบัติตามคำสั่งด้านการจัดรูปแบบและคำศัพท์ได้ไม่น่าเชื่อถือเท่ากับความสามารถในการแปลของมันเลย

Cohere เผยแพร่ตัวเลขเพียงตัวเดียว — คะแนน WMT26 ที่ 83.60 ซึ่งเพิ่มขึ้นเป็น 84.36 ด้วยเวิร์กโฟลว์แบบหลายรอบที่ขับเคลื่อนด้วยเอเจนต์ — โดยไม่มีชื่อเมตริกกำกับ และไม่มีหน้าผลลัพธ์ WMT26 ให้ตรวจสอบเทียบได้ นั่นไม่ใช่การเปรียบเทียบที่เราสามารถทำได้ ตัวเลขที่ไม่มีชื่อเพียงตัวเดียวไม่อาจนำไปวางเทียบกับตารางของเกณฑ์มาตรฐานที่มีชื่อได้ และการแสร้งทำเป็นอย่างอื่นจะเป็นสิ่งที่ทำให้เข้าใจผิดมากที่สุดที่บทความนี้ทำได้

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

จุดถ่วงดุลของ Tencent ก็คือ ตัวเลขของบริษัทมาจากแหล่งที่ผู้อ่านสามารถตรวจสอบได้ ที่เก็บโค้ด Hy-MT2 เผยแพร่ภาพรวมของตระกูลโมเดล ขนาดโมเดลทั้งสามแบบ และรันไทม์ที่แต่ละแบบรองรับ ควบคู่ไปกับตารางเกณฑ์มาตรฐาน ซึ่งนั่นเองคือสิ่งที่ทำให้ตัวเลขของ FLORES-200 และ IFMTBench สามารถตรวจสอบได้เลย และเป็นสิ่งที่ทำให้ตัวเลขเดียวที่ไร้ชื่อของ Cohere ดูโดดเด่นขึ้นมาเมื่อเทียบกัน

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

แต่ละอันมีค่าใช้จ่ายในการโทรเท่าไร

โมเดล 1.8B ของ Tencent มี API เชิงพาณิชย์แบบโฮสต์ที่เปิดตัวในเดือนสิงหาคม 2026 ราคาประมาณ $0.044 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $0.177 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน — ถูกในเชิงตัวเลขสัมบูรณ์ และคิดราคาตามจำนวนโทเคน โมเดลของ Cohere ทำงานบนแพ็กเกจฟรีของ Chat V2 ใช้ฟรีสำหรับคีย์ทดลองและคีย์โปรดักชันจนกว่าจะถึงขีดจำกัดอัตรา ดังนั้นต้นทุนการประเมินจึงเป็นศูนย์ แต่ต้นทุนการใช้งานจริงคือสัญญาที่คุณต้องเจรจา การโฮสต์เองพลิกการคำนวณทั้งหมด: 440MB บนมือถือ เทียบกับ B200 สองตัว ซึ่งเป็นความแตกต่างที่วัดกันเป็นอันดับของขนาด ไม่ใช่เป็นเปอร์เซ็นต์

เหตุผลที่ช่องว่างนั้นควรค่าแก่การกล่าวถึงในบทความเกี่ยวกับแพลตฟอร์มการกำหนดเส้นทาง ก็คือระดับราคาถูกกับระดับราคาแพงไม่ใช่คู่แข่งกัน — พวกมันคือสองตำแหน่งในลำดับการไล่ระดับ และการไล่ระดับคือสิ่งที่เราเตอร์ถูกออกแบบมาเพื่อทำ OrcaRouter ส่งต่อราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายลดราคา endpoint การแปลแบบโฮสต์ ฝั่งเราจึงมีผลทันทีในวันเดียวกัน โดยไม่มีส่วนต่างของตัวแทนจำหน่ายให้ต้องเจรจาใหม่ และเชน failover ทำให้โมเดลขนาดเล็กสามารถรองรับทราฟฟิกส่วนใหญ่ไว้ได้ ขณะที่โมเดลที่หนักกว่าจะรับช่วงคำขอที่โมเดลเล็กจัดการไม่ได้ ลองใช้ตัวที่ถูกก่อน แล้วยกระดับเมื่อเจอเคสยาก ๆ และให้ชั้นการกำหนดเส้นทางเป็นที่เก็บนโยบายแทนโค้ดแอปพลิเคชันของคุณ

คุณควรเลือกอันไหน

หากการแปลของคุณเกิดขึ้นบนอุปกรณ์ แบบออฟไลน์ ภายใต้งบประมาณพื้นที่จัดเก็บต่อเมกะไบต์ หรือภายในผลิตภัณฑ์เชิงพาณิชย์ที่ไม่มีความกระหายที่จะเจรจาเรื่องใบอนุญาต Hy-MT2-1.8B คือคำตอบ และ North Small Translate 1.0 ก็ไม่ได้อยู่ในข่ายพิจารณา หากหน่วยของงานของคุณคือเอกสารยาวในหนึ่งในห้าสิบภาษาที่ Cohere รองรับ หากคุณต้องการเอาต์พุต 16K ในรอบเดียว และหากใบอนุญาตเชิงพาณิชย์เป็นสิ่งที่องค์กรของคุณยินดีจ่ายเพื่อซื้อ โมเดลของ Cohere ก็คือเครื่องจักรที่มีความสามารถมากกว่าในทุกมิติที่เปิดเผย โดยมีข้อแม้ว่าคุณภาพของมันนั้นขึ้นอยู่กับตัวเลขเพียงตัวเดียวที่ยังไม่มีการทำซ้ำ

และสำหรับทีมส่วนใหญ่ คำตอบที่ตรงไปตรงมาคือทั้งสองอย่าง ตามลำดับนั้น: โมเดล 440MB ทำงานประจำด้วยต้นทุนต่ำจนแทบไม่นับ โมเดล 218B จัดการเอกสารที่สำคัญ และการตัดสินใจว่าคำขอใดควรไปที่ใดเป็นกฎการกำหนดเส้นทาง มากกว่าจะเป็นการเขียนใหม่ ช่องว่างระหว่างสองโมเดลนี้ไม่ใช่ช่องว่างที่ต้องปิด มันคือสเปกตรัมที่ต้องนำมาใช้