การ์ด Hero สำหรับการจับคู่ที่มีหัวข้อ "North Small Translate 1.0 vs NLLB-200" พร้อมคำบรรยายใต้หัวข้อ "50 ภาษาต่อ 200" โดยอยู่เหนือการ์ดสองใบ: North Small Translate 1.0 (218B MoE / 25B active, 2026, บริบท 16K) และ NLLB-200 (54.5B MoE เรือธง, 2022, 200 ภาษา)
Guides & Insights

North Small Translate 1.0 vs NLLB-200: 50 ภาษาเทียบกับ 200

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

โมเดลใหม่กว่านั้นครอบคลุมเพียงหนึ่งในสี่ของจำนวนภาษา North Small Translate 1.0 ซึ่ง Cohere บันทึกไว้ในบันทึกการเปิดตัวเมื่อวันที่ 9 กันยายน 2026 แปลระหว่างภาษาอังกฤษกับอีก 49 ภาษา NLLB-200 ตระกูล No Language Left Behind ที่ Meta เปิดตัวในเดือนกรกฎาคม 2022 ครอบคลุมถึง 200 ภาษา ถ้าจำนวนภาษาเป็นการเปรียบเทียบทั้งหมด นี่คงเป็นบทความสั้น ๆ แต่ไม่ใช่เช่นนั้น โมเดลทั้งสองเป็นเครื่องจักรคนละแบบที่สร้างขึ้นเพื่องานคนละอย่าง และช่องว่างสี่ปีระหว่างทั้งสองก็ปรากฏให้เห็นในแบบที่ไม่เกี่ยวกับจำนวนภาษาที่อยู่ในรายการเลย ต่อไปนี้คือสิ่งที่แต่ละตัวทำได้ดีจริง ๆ ค่าใช้จ่ายในการรัน และสัญญาอนุญาตจะพาคุณไปทางไหน

ตัวเลขความครอบคลุมน่ะ พูดตามตรงเลย

สองร้อยเทียบกับห้าสิบเป็นเรื่องจริง และมันเป็นเหตุผลเดียวที่ถูกอ้างถึงมากที่สุดในการเก็บ NLLB-200 ไว้ในสแตก Meta ฝึกมันด้วยคู่ประโยคมากกว่า 18 พันล้านคู่ โดยเน้นอย่างชัดเจนที่ภาษาทรัพยากรต่ำ และมันแปลโดยตรงระหว่างคู่ภาษาใด ๆ แทนที่จะหมุนผ่านภาษาอังกฤษ ซึ่งเป็นทางเลือกในการออกแบบที่สำคัญอย่างมหาศาลสำหรับ เช่น เบงกาลีเป็นทมิฬ ที่ระบบซึ่งหมุนผ่านภาษาอังกฤษจะสูญเสียคุณภาพถึงสองครั้ง

สิ่งที่ตัวเลขนี้ปิดบังไว้ก็คือ ส่วนที่ทับซ้อนกันระหว่างสองรายการคือส่วนที่มีประโยชน์เชิงพาณิชย์ ห้าสิบภาษาของ North Small Translate 1.0 ได้แก่ เยอรมัน ฝรั่งเศส สเปน โปรตุเกส อิตาลี ดัตช์ โปแลนด์ เช็ก ญี่ปุ่น เกาหลี จีนตัวย่อและจีนตัวเต็ม อาหรับ ฮิบรู ฮินดี เบงกาลี ทมิฬ เตลูกู ไทย ตุรกี เวียดนาม อินโดนีเซีย มาเลย์ รัสเซีย และยูเครน — ภาษาที่คิดเป็นสัดส่วนปริมาณการแปลระดับองค์กรส่วนใหญ่ล้นเหลือ NLLB-200 ครอบคลุมทั้งหมดนั้นด้วย บวกอีกประมาณ 150 ภาษาที่ North Small Translate 1.0 ไม่แตะเลย ดังนั้น คำถามจึงไม่ใช่ว่ารายการใดยาวกว่า แต่คือว่าทราฟฟิกของคุณมีภาษาที่มีเพียงหนึ่งในสองตัวรองรับหรือไม่

เครื่องจักรสองเครื่องที่แตกต่างกัน

ช่องว่างทางสถาปัตยกรรมคือส่วนที่กำหนดว่าคุณสร้างอะไรได้บ้าง เช็กพอยต์ที่เผยแพร่ขนาดใหญ่ที่สุดของ NLLB-200 เป็นโมเดล mixture-of-experts แบบ sparsely gated ที่มีพารามิเตอร์ราว 54.5 พันล้านตัว และโมเดลพี่น้องแบบ dense ของมันมีขนาด 3.3B, 1.3B และลดหลั่นลงไปถึงโมเดลกลั่นขนาด 600M ทั้งหมดเป็นโมเดล encoder-decoder แบบ sequence-to-sequence ในสายตระกูล M2M-100: คุณส่งส่วนข้อความต้นทางให้โทเคไนเซอร์ แล้วมันจะคืนส่วนข้อความที่แปลแล้ว ไม่มีเทมเพลตแชต ไม่มีพรอมป์ระบบ ไม่มีโครงสร้างแบบหลายรอบสนทนา และเช็กพอยต์ที่เผยแพร่นั้นสร้างขึ้นโดยเน้นการแปลระดับเซกเมนต์: การ์ดโมเดลของ Meta เองระบุว่าโมเดลนี้ถูกฝึกด้วยความยาวอินพุตไม่เกิน 512 โทเค็น และเตือนว่าลำดับที่ยาวกว่านั้นจะทำให้คุณภาพแย่ลง งบรวมของโทเคไนเซอร์สำหรับต้นทางและปลายทางคือ 1,024 โทเค็น การ์ดของ NLLB-200 ยังอธิบายว่าเป็นโมเดลวิจัยที่ไม่ได้เผยแพร่สำหรับการปรับใช้ในโปรดักชัน และระบุว่าไม่ได้มีไว้สำหรับการแปลเอกสาร — ความแตกต่างนี้เองที่แยกมันออกจากสิ่งที่ Cohere สร้างได้อย่างชัดเจนที่สุด

North Small Translate 1.0 มีรูปร่างตรงกันข้าม มันเป็น MoE แบบ sparse ที่มีเฉพาะ decoder มีพารามิเตอร์รวม 218 พันล้านตัว และเปิดใช้งาน 25 พันล้านตัวต่อโทเคน มีผู้เชี่ยวชาญ 128 ตัว โดยเปิดใช้งาน 8 ตัวพร้อมกับผู้เชี่ยวชาญที่แชร์ร่วม และมี attention ที่สลับระหว่างเลเยอร์แบบหน้าต่างเลื่อน (หน้าต่าง 4,096, RoPE) กับเลเยอร์ global attention ที่ไม่มีการฝังตำแหน่ง มันทำงานอยู่เบื้องหลังเทมเพลตแชทที่มีคำสั่งระบบเริ่มต้น และหน้าต่างของมันคือ 16K โทเคนของอินพุตและ 16K โทเคนของเอาต์พุต งบประมาณเอาต์พุตนั้นคือสัญญาณบอก: นี่คือโมเดลที่สร้างขึ้นมาเพื่อรับเอกสารและส่งเอกสารกลับคืน ไม่ใช่โมเดลที่สร้างขึ้นมาเพื่อรับประโยค

พารามิเตอร์ทั้งหมด — North Small Translate 1.0: 218B MoE (25B ที่ใช้งานจริง) เทียบกับ NLLB-200: 54.5B MoE ระดับเรือธง, 600M–3.3B แบบ dense

สถาปัตยกรรม — โมเดล MoE แบบ causal ที่ใช้เฉพาะ decoder พร้อมเทมเพลตแชท เทียบกับโมเดล seq2seq แบบ encoder-decoder ที่ไม่มีเทมเพลตแชท

บริบท — อินพุต 16K และเอาต์พุต 16K เทียบกับระดับเซกเมนต์ งบประมาณโทเค็นไนเซอร์ 1,024 โทเค็นรวมกัน

ภาษา — 50 (อังกฤษ + 49) เทียบกับ 200

คู่โดยตรง — การจัดระดับที่เน้นภาษาอังกฤษเป็นศูนย์กลาง เทียบกับการแปลแบบภาษาใดก็ได้ไปยังภาษาใดก็ได้โดยไม่ต้องผ่านภาษาอังกฤษ

สัญญาอนุญาต — CC BY-NC 4.0 กับ CC BY-NC 4.0

ใช้ทรัพยากรน้อยที่สุด — 1×B200 ที่ W4A16, 2×B200 ที่ FP8 เทียบกับ VRAM ~37GB ที่ 4-bit สำหรับรุ่น 54B ส่วน 600M รันได้ทุกที่

ประกาศ — 9 กันยายน 2026 (น้ำหนักโมเดลถูกจำกัดการเข้าถึงบน Hugging Face ตั้งแต่วันที่ 14 สิงหาคม) เทียบกับกรกฎาคม 2022

Two-column scoreboard comparing North Small Translate 1.0 and NLLB-200 across six rows: Parameters 218B MoE / 25B active vs 54.5B MoE flagship; Context 16K in / 16K out vs segment-level, 1,024 tokens; Languages 50 vs 200; Direct pairs English-centric tiering vs any-to-any no pivot; License CC BY-NC 4.0 vs CC BY-NC 4.0; Minimum hardware 1x B200 at W4A16 vs 600M distilled, any GPU.

NLLB-200 ยังคงเป็นเจ้าของอะไร

สามเรื่อง และมันไม่ใช่เรื่องของอารมณ์ อย่างแรกคือหางยาว: ถ้าคุณต้องการภาษาโอโรโม ภาษาทิกรินยา หรือภาษาใดก็ตามในราว 150 ภาษาที่อยู่นอกลิสต์ของ North Small Translate 1.0 การตัดสินใจก็เกิดขึ้นแล้ว อย่างที่สองคือฟุตพรินต์ที่ปลายเล็ก — เช็กพอยต์ 600M ที่กลั่นแล้วมียอดดาวน์โหลดถึง 1.4 ล้านครั้ง และรันบนฮาร์ดแวร์ที่โหลดเวตของ Cohere ยังไม่ขึ้นด้วยซ้ำ ซึ่งทำให้มันเป็นเพียงตัวเดียวในสองตัวนี้ที่เข้ากับการติดตั้งแบบ air-gapped หรือ edge ได้โดยไม่ต้องใช้เทคนิคควอนไทเซชัน อย่างที่สามคือความ成熟: NLLB-200 มีเครื่องมือ โฟร์กควอนไทเซชัน และเรื่องเล่าจากการใช้งานจริงในโปรดักชันเป็นเวลาสี่ปีหนุนหลังอยู่ รวมทั้งมีบทความใน Nature ที่ผ่านการ peer-reviewed เมื่อเดือนมิถุนายน 2024 ที่อธิบายว่ามันถูกสร้างขึ้นมาอย่างไร ส่วน Cohere เผยแพร่เพียงรีลีสโน้ต

ข้อแลกเปลี่ยนในทางกลับกันก็เป็นรูปธรรมไม่แพ้กัน การ์ดโมเดลของ NLLB-200 ระบุว่าเป็นโมเดลสำหรับงานวิจัยที่ไม่ได้เปิดตัวสำหรับการนำไปใช้งานในโปรดักชัน และเช็กพอยต์เรือธงขนาด 54B ของมันก็เป็นของหนัก โดยต้องใช้พื้นที่จัดเก็บราว 350GB และใช้ VRAM ประมาณ 108–120GB เพื่อให้บริการแบบไม่บีบอัด Meta ไม่ได้ขาย endpoint ของ NLLB แบบโฮสต์ การรันมันในระดับสเกลจึงเป็นปัญหาของคุณ และมันเป็นปัญหาจริง ๆ

กับดักการออกใบอนุญาตทั้งสองฝ่าย

นี่คือส่วนที่ทำให้หลายคนประหลาดใจ เพราะโมเดลทั้งสองใช้สัญญาอนุญาตเดียวกัน และไม่ใช่ฉบับที่ทีมส่วนใหญ่คาดคิด ทั้ง NLLB-200 และ North Small Translate 1.0 เผยแพร่ภายใต้ Creative Commons Attribution-NonCommercial 4.0 ทั้งคู่ไม่สามารถใช้ในผลิตภัณฑ์เชิงพาณิชย์ตามที่เผยแพร่ได้ ข้อจำกัดการไม่ใช้เชิงพาณิชย์ของ NLLB-200 ก่อข้อถกเถียงมากพอจนมีโครงการชุมชนชื่อ Open-NLLB เกิดขึ้นโดยเฉพาะเพื่อพยายามสร้างอนุพันธ์ที่ใช้เชิงพาณิชย์ได้ ซึ่งชนเข้ากับสัญญาอนุญาตที่มันderiveมาโดยตรง แนวทางของ Cohere ชัดเจนกว่า: ซื้อสัญญาอนุญาตเชิงพาณิชย์และดีพลอยผ่าน Model Vault โดยมีค่าน้ำหนัก FP8 ฟรีบน Hugging Face สำหรับงานที่ไม่ใช่เชิงพาณิชย์เท่านั้น

มีความไม่สมมาตรอยู่หนึ่งอย่างที่น่าชี้ให้เห็น Cohere ให้บริการ North Small Translate 1.0 บนระดับฟรีของ Chat V2 API โดยไม่เสียค่าใช้จ่ายสำหรับคีย์ทดลองและคีย์โปรดักชันจนกว่าจะถึงขีดจำกัดอัตรา — ดังนั้นคุณจึงสามารถประเมินผลจริงได้โดยไม่มีค่าใช้จ่าย และลงนามในสัญญาก็ต่อเมื่อคุณนำไปใช้งานจริงเท่านั้น ส่วน NLLB-200 ให้เพียงน้ำหนักโมเดลและไม่มีอะไรอื่น

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

การติดตั้งใช้งานอันใดอันหนึ่ง

North Small Translate 1.0 เปิดให้ใช้งานในสามเช็กพอยต์ — BF16, FP8 และ NVFP4 W4A16 — พร้อมฮาร์ดแวร์ขั้นต่ำที่เผยแพร่ไว้สำหรับแต่ละแบบ: B200 สี่ตัว หรือ H100 แปดตัวสำหรับ BF16, B200 สองตัว หรือ H100 สี่ตัวสำหรับ FP8 และ B200 ตัวเดียว หรือ H100 สองตัวสำหรับ W4A16 การให้บริการดำเนินการผ่าน vLLM ด้วย cohere_melody>=0.9.0 และ Cohere แนะนำให้ใช้ greedy decoding ซึ่งตรงกับการกำหนดค่าโปรดักชันของบริษัท เอาต์พุตจะถูกห่อด้วยเครื่องหมาย <|START_TEXT|> และ <|END_TEXT|> ที่ไม่ได้ลงทะเบียนเป็นโทเคนพิเศษ ดังนั้นการตั้งค่า skip_special_tokens=True แบบตรง ๆ จะทำให้เครื่องหมายเหล่านี้ยังคงอยู่ในเอาต์พุตของคุณ

NLLB-200 ถูกนำไปใช้งานผ่านเส้นทางมาตรฐานของ transformers หรือ fairseq โดยมีความยืดหยุ่นต่อฮาร์ดแวร์ขนาดเล็กได้กว้างกว่ามาก เนื่องจากเช็กพอยต์แบบกลั่นขนาด 600M และ 1.3B เป็นตัวที่คนส่วนใหญ่รันจริง ส่วน 54B MoE เป็นตัวที่ต้องวางแผน

คำถามเรื่องเส้นทางที่การจับคู่นี้เป็นตัวแทนจริง ๆ

ทั้ง North Small Translate 1.0 และ NLLB-200 ต่างก็ไม่มีอยู่ในแค็ตตาล็อกของ OrcaRouterในวันนี้ ดังนั้นนี่จึงไม่ใช่บทความเกี่ยวกับการเลือกตัวใดตัวหนึ่งจากชั้นวางของเรา แต่อย่างไรก็ยังคุ้มที่จะระบุรูปร่างของปัญหานี้ไว้ เพราะ "โมเดลหนึ่งสำหรับภาษาระดับแถวหน้า อีกโมเดลหนึ่งสำหรับภาษากลุ่มหางยาว" คือ นโยบายการจัดเส้นทาง และนโยบายการจัดเส้นทางก็เป็นสิ่งที่ควรอยู่ในคอนฟิกูเรชันมากกว่าในโค้ดแอปพลิเคชัน DSL การจัดเส้นทางของ OrcaRouter แสดงสิ่งนี้ได้อย่างชัดเจนในรูปของ YAML บวกกฎ CEL ดังนั้นกฎระดับคู่ภาษาจึงสามารถส่งคู่ภาษายุโรปไปยังโมเดลหนึ่ง และถอยกลับไปใช้โมเดลอื่นเมื่อคู่ภาษานั้นไม่ได้รับการรองรับ ส่วนเชนการสลับเมื่อเกิดข้อขัดข้อง (failover chains) ก็หมายความว่าอัปสตรีมที่เริ่มส่งคืนข้อผิดพลาดจะไม่กลายเป็นการหยุดให้บริการของคุณ นั่นคือคีย์เดียวและการเชื่อมต่อเพียงครั้งเดียว ครอบคลุมแค็ตตาล็อกที่มีมากกว่า 200 โมเดลในราคาตามรายการของผู้ให้บริการ โดยมีมาร์กอัป 0% แทนที่จะต้องทำสัญญากับผู้ขายรายที่สองสำหรับทุกโมเดลแปลที่คุณตัดสินใจจะลอง

Screenshot of the facebook/nllb-200-distilled-600M model card on Hugging Face showing the cc-by-nc-4.0 license tag and 196 languages tag, 1,420,772 downloads last month and 970 likes, the model tree with 152 adapters, 380 finetunes and 29 quantizations, and the Intended Use section describing NLLB-200 as a research model for single sentence translation among 200 languages that is not released for production deployment and was trained with input lengths not exceeding 512 tokens.

อันไหนที่คุณควรเลือกใช้

ถ้ากลยุทธ์เนื้อหาของคุณเกี่ยวข้องกับภาษาที่อยู่นอกเหนือจากห้าสิบภาษาของ Cohere ให้ใช้ NLLB-200 ต่อไปและถือว่าตกลงกันแล้ว — ความทันสมัยเชิงสถาปัตยกรรมไม่ว่าจะมากเพียงใดก็ชดเชยภาษาที่ขาดหายไปไม่ได้ หากคุณกำลังทำการแปลระดับองค์กรเป็นภาษาต่างๆ ที่ Cohere ระบุไว้ ให้ทำงานในระดับเอกสารมากกว่าระดับประโยค และยินดีซื้อใบอนุญาตเชิงพาณิชย์ North Small Translate 1.0 เป็นโมเดลที่มีความสามารถมากกว่าในทุกมิติที่เอกสารเปิดเผย โดยมีข้อแม้สำคัญว่าหลักฐานด้านคุณภาพเพียงอย่างเดียวของมันคือตัวเลขจากผู้ขายที่ยังไม่ถูกทำซ้ำ หากคุณกำลังสร้างต้นแบบและไม่มีงบประมาณ แพ็กเกจฟรีของ Cohere ทำให้การประเมินนั้นแทบไม่มีค่าใช้จ่าย ซึ่งเป็นจุดเริ่มต้นที่ดีกว่าของ NLLB-200 ที่ค่าใช้จ่ายในการหาคำตอบคือการเช่า GPU

วิธีที่มีประโยชน์ในการยึดข้อเท็จจริงทั้งสองไว้พร้อมกัน: NLLB-200 เป็นโมเดลที่เข้าถึงภาษาที่ไม่มีโมเดลอื่นเข้าถึงได้ และถูกสร้างขึ้นในปี 2022 สำหรับการแปลระดับประโยคเพื่อการวิจัย North Small Translate 1.0 เป็นโมเดลที่รองรับภาษาน้อยกว่าแต่ทำได้ดีกว่า และถูกสร้างขึ้นในปี 2026 สำหรับเอกสาร การเลือกระหว่างทั้งสองไม่ใช่การตัดสินคุณภาพจริง ๆ แต่เป็นคำถามเกี่ยวกับภาษาที่คุณต้องใช้งานจริง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube