
North Small Translate 1.0 vs NLLB-200: 50 lingue contro 200
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M di token
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Il modello più recente copre un quarto delle lingue. North Small Translate 1.0, che Cohere ha documentato nelle sue note di rilascio il 9 settembre 2026, traduce tra l'inglese e altre 49 lingue. NLLB-200, la famiglia No Language Left Behind che Meta ha rilasciato nel luglio 2022, ne copre 200. Se il numero di lingue fosse l'intero confronto, questo sarebbe un articolo breve, ma non lo è: i due modelli sono macchine diverse, costruite per lavori diversi, e i quattro anni di distanza tra loro si manifestano in modi che non hanno nulla a che fare con quante lingue compaiono in un elenco. Quello che segue è ciò per cui ciascuno è realmente valido, quanto costa eseguirli e dove ti porta la licenza.
Il numero di copertura, sinceramente
Duecento contro cinquanta è reale ed è la ragione più citata per tenere NLLB-200 in uno stack. Meta lo ha addestrato su più di 18 miliardi di coppie di frasi con un'enfasi esplicita sulle lingue a basse risorse, e traduce direttamente tra qualsiasi coppia anziché passare attraverso l'inglese — una scelta progettuale che conta enormemente per, ad esempio, dal bengalese al tamil, dove un sistema con pivot inglese perde qualità due volte.
Ciò che il numero nasconde è che la sovrapposizione tra le due liste è la parte commercialmente utile. Le cinquanta lingue di North Small Translate 1.0 includono tedesco, francese, spagnolo, portoghese, italiano, olandese, polacco, ceco, giapponese, coreano, cinese semplificato e tradizionale, arabo, ebraico, hindi, bengalese, tamil, telugu, thailandese, turco, vietnamita, indonesiano, malese, russo e ucraino — le lingue che rappresentano la stragrande maggioranza del volume di localizzazione aziendale. NLLB-200 copre anche tutte quelle, più circa altre 150 che North Small Translate 1.0 non tocca affatto. Quindi la domanda non è quale lista sia più lunga. È se il tuo traffico include lingue che solo uno dei due supporta.
Due macchine diverse
Il divario architetturale è la parte che determina ciò che puoi costruire. Il checkpoint più grande rilasciato di NLLB-200 è un modello mixture-of-experts con gating sparso di circa 54,5 miliardi di parametri, e i suoi fratelli densi vanno da 3,3B a 1,3B, fino a un modello distillato da 600M. Tutti sono modelli encoder-decoder sequence-to-sequence della linea M2M-100: passi al tokenizzatore un segmento di origine e questo restituisce un segmento tradotto. Non esiste alcun template di chat, alcun prompt di sistema, alcuna struttura multi-turno, e i checkpoint rilasciati sono costruiti attorno alla traduzione a livello di segmento: la scheda del modello di Meta stessa dichiara che il modello è stato addestrato con lunghezze di input non superiori a 512 token e avverte che sequenze più lunghe degradano. Il budget combinato del tokenizzatore per origine e destinazione è di 1.024 token. La scheda di NLLB-200 lo descrive inoltre come un modello di ricerca non rilasciato per la distribuzione in produzione e osserva che non è destinato alla traduzione di documenti: la distinzione che più nettamente lo separa da ciò che ha costruito Cohere.
North Small Translate 1.0 ha la forma opposta. È un MoE sparso decoder-only con 218 miliardi di parametri totali e 25 miliardi attivi per token, 128 esperti con otto attivi più esperti condivisi, e un'attenzione che alterna layer a finestra scorrevole (finestra 4.096, RoPE) con layer di attenzione globale che non portano embedding posizionali. Funziona dietro un template di chat con un'istruzione di sistema predefinita, e la sua finestra è di 16K token in input e 16K token in output. Quel budget di output è l'indizio rivelatore: questo è un modello costruito per ricevere un documento e farsi restituire un documento, non un modello costruito per ricevere una frase.
• Parametri totali — North Small Translate 1.0: 218B MoE (25B attivi) vs NLLB-200: 54,5B MoE di punta, 600M–3,3B dense
• Architettura — MoE causale decoder-only con chat template vs seq2seq encoder-decoder senza chat template
• Contesto — 16K in ingresso e 16K in uscita rispetto a livello di segmento, budget del tokenizer di 1.024 token combinati
• Lingue — 50 (inglese + 49) vs 200
• Coppie dirette — classificazione a livelli incentrata sull'inglese vs any-to-any senza un pivot inglese
• Licenza — CC BY-NC 4.0 vs CC BY-NC 4.0
• Ingombro minimo — 1×B200 in W4A16, 2×B200 in FP8 rispetto a ~37GB di VRAM a 4 bit per il 54B, il 600M gira ovunque
• Annunciato — 9 settembre 2026 (pesi con accesso limitato su Hugging Face dal 14 agosto) vs luglio 2022

Ciò che NLLB-200 possiede ancora
Tre cose, e non sono sentimentali. La prima è la coda lunga: se ti servono l'oromo, il tigrino o una qualsiasi delle circa 150 lingue al di fuori dell'elenco di North Small Translate 1.0, la decisione è già presa. La seconda è l'impronta all'estremità piccola: il checkpoint distillato da 600M ha raggiunto 1,4 milioni di download e gira su hardware che non riuscirebbe nemmeno a caricare i pesi di Cohere, il che lo rende l'unico dei due che entra in un deployment air-gapped o edge senza trucchi di quantizzazione. La terza è la maturità: NLLB-200 ha quattro anni di strumenti, fork di quantizzazione e storie di produzione alle spalle, più un articolo su Nature sottoposto a revisione paritaria del giugno 2024 che descrive come è stato costruito. Cohere ha pubblicato una nota di rilascio.
Il compromesso nella direzione opposta è altrettanto concreto. La scheda del modello di NLLB-200 lo descrive come un modello di ricerca che non è stato rilasciato per l'implementazione in produzione, e il suo checkpoint di punta da 54B è un peso massimo: circa 350 GB di archiviazione e nell'ordine di 108–120 GB di VRAM per servirlo non compresso. Meta non vende un endpoint NLLB ospitato. Eseguirlo su larga scala è un tuo problema, ed è un problema reale.
La trappola delle licenze da entrambe le parti
Questa è la parte che sorprende le persone, perché i due modelli hanno la stessa licenza e non è quella che la maggior parte dei team presume. Sia NLLB-200 sia North Small Translate 1.0 sono distribuiti con licenza Creative Commons Attribution-NonCommercial 4.0. Nessuno dei due è utilizzabile in un prodotto commerciale nella versione pubblicata. La restrizione non commerciale di NLLB-200 è stata così contestata che esiste un progetto comunitario chiamato Open-NLLB appositamente per provare a realizzare un derivato utilizzabile commercialmente, cosa che si scontra direttamente con la licenza da cui deriva. La strada di Cohere è più pulita: acquistare una licenza commerciale e distribuire tramite Model Vault, con i pesi FP8 gratuiti su Hugging Face solo per lavoro non commerciale.
C'è un'asimmetria che vale la pena segnalare. Cohere esegue North Small Translate 1.0 sul livello gratuito della sua API Chat V2, gratis per le chiavi di prova e di produzione finché non si raggiungono i limiti di frequenza — così puoi fare una valutazione reale a costo zero e firmare qualcosa solo se vai in produzione. NLLB-200 ti dà i pesi e nient'altro.

Distribuendo uno dei due
North Small Translate 1.0 è disponibile in tre checkpoint — BF16, FP8 e NVFP4 W4A16 — con requisiti hardware minimi pubblicati per ciascuno: quattro B200 o otto H100 per BF16, due B200 o quattro H100 per FP8 e un singolo B200 o due H100 per W4A16. Il serving avviene tramite vLLM con cohere_melody>=0.9.0, e Cohere consiglia la decodifica greedy, in linea con la propria configurazione di produzione. L'output viene racchiuso tra i marker <|START_TEXT|> e <|END_TEXT|> che non sono registrati come token speciali, quindi un ingenuo skip_special_tokens=True li lascerà nel tuo output.
NLLB-200 si distribuisce attraverso i percorsi standard di transformers o fairseq con una tolleranza molto più ampia per hardware di piccole dimensioni, dato che i checkpoint distillati da 600M e 1,3B sono quelli che la maggior parte delle persone esegue effettivamente. Il MoE da 54B è quello che richiede pianificazione.
La questione di routing che questo confronto in realtà rappresenta
Né North Small Translate 1.0 né NLLB-200 sono nel catalogo di OrcaRouter oggi, quindi questo non è un articolo su come sceglierne uno dal nostro scaffale. Vale comunque la pena definire la forma del problema, perché "un modello per le lingue di primo livello, un altro per la coda lunga" è una politica di routing — e una politica di routing è il tipo di cosa che dovrebbe risiedere nella configurazione anziché nel codice dell'applicazione. Il DSL di routing di OrcaRouter esprime esattamente questo come YAML più regole CEL, così una regola per coppie di lingue può inviare le coppie europee a un modello e ripiegare su un altro quando una coppia non è supportata, e le catene di failover fanno sì che un upstream che inizia a restituire errori non diventi il tuo disservizio. Questa è una sola chiave e una sola integrazione su un catalogo di oltre 200 modelli al prezzo di listino del provider con ricarico dello 0%, anziché un secondo contratto con un fornitore per ogni modello di traduzione che decidi di provare.

Quale dovresti scegliere
Se la tua strategia di contenuti tocca lingue al di fuori delle cinquanta lingue di Cohere, mantieni NLLB-200 e considera la cosa assodata: nessuna quantità di modernità architetturale compensa una lingua mancante. Se stai facendo localizzazione enterprise nelle lingue elencate da Cohere, lavori all'interno di un documento anziché di una frase e sei disposto ad acquistare una licenza commerciale, North Small Translate 1.0 è il modello più capace su ogni dimensione divulgata dalla documentazione, con l'importante avvertenza che la sua unica prova di qualità è un dato del fornitore non riprodotto. Se stai facendo prototipazione e non hai budget, il piano gratuito di Cohere rende quella valutazione quasi gratuita, il che è una posizione di partenza migliore di quella di NLLB-200, dove il prezzo per scoprirlo è il noleggio di una GPU.
Il modo utile per tenere a mente entrambi i fatti contemporaneamente: NLLB-200 è il modello che raggiunge le lingue che nessun altro raggiunge, ed è stato creato nel 2022 per la traduzione di ricerca a livello di frase. North Small Translate 1.0 è il modello che gestisce meno lingue, ma meglio, ed è stato creato nel 2026 per i documenti. Scegliere tra i due non è davvero un giudizio sulla qualità. È una questione di quali lingue distribuisci effettivamente.
