
Kolibri vs Intern-Decision 4B: ตัวหนึ่งเขียนเอกสาร แต่อีกตัวปฏิเสธที่จะเขียนอะไรเลย
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 217 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
สิ่งที่มีประโยชน์ที่สุดที่ควรสังเกตเกี่ยวกับKolibriและIntern-Decision-4Bก็คือ พวกมันไม่ใช่สิ่งประเภทเดียวกัน และการมองสิ่งนี้เป็นการเปรียบเทียบแบบโมเดลต่อโมเดลจะเป็นการผิดหมวดหมู่ Kolibri เป็นโมเดลภาษาชนิด mixture-of-experts ขนาด 78.1 พันล้านพารามิเตอร์ของ Aleph Alpha เปิดตัวเมื่อวันที่ 3 ตุลาคม 2026 ซึ่งเปิดใช้งานพารามิเตอร์ 3.46 พันล้านตัวต่อโทเคน และเขียนข้อความภาษาเยอรมันกับอังกฤษ Intern-Decision-4B เป็นโมเดลตัดสินใจเชิงโครงสร้างแบบหลายรูปแบบขนาด 4.54 พันล้านพารามิเตอร์จากทีม InternLM อัปโหลดขึ้น Hugging Face เมื่อวันที่ 26 กันยายน 2026 โดยการ์ดของมันระบุไว้อย่างตรงไปตรงมาว่ามัน "ไม่เรียก generate() หรือสุ่มข้อความอิสระ" เลย ตัวหนึ่งผลิตร้อยแก้ว อีกตัวหนึ่งผลิตการแจกแจงความน่าจะเป็นเหนือตัวเลือกที่คุณให้มา ในการส่งผ่านไปข้างหน้า (forward pass) เพียงครั้งเดียว และไม่มีความสามารถในการเขียนประโยคใดๆ พวกมันกลายเป็นคู่แข่งกันเพียงในสถานการณ์แคบๆ เพียงหนึ่งเดียวเท่านั้น และการรู้ให้แน่ชัดว่าสถานการณ์นั้นคืออะไรกลับกลายเป็นสิ่งที่มีประโยชน์ที่สุดในการเปิดตัวทั้งสองครั้ง
สองการเปิดตัว สองข้อกล่าวอ้างสั้น ๆ ที่แตกต่างกันโดยสิ้นเชิง
สเปกการ์ดของ Kolibri เป็นข้อกำหนดของโมเดลภาษาขนาดใหญ่แบบ sparse: 50 เลเยอร์ ทุกเลเยอร์เป็น mixture-of-experts, ผู้เชี่ยวชาญ 384 ตัวต่อเลเยอร์ โดยมี 1 ตัวแบบ shared และ 6 ตัวแบบ routed, บริบทเนทีฟ 262,144 โทเคนที่ตรวจสอบรับรองถึง 1,048,576, ระดับความพยายามในการให้เหตุผล 4 ระดับ, การเรียกใช้เครื่องมือแบบ Hermes พร้อม parser vLLM ที่ให้มาด้วย, น้ำหนัก FP8 ในบล็อกขนาด 128×128 และเงื่อนไข Apache 2.0 การฝึกของมันใช้ 20 ล้านล้านโทเคนบน NVIDIA B200 จำนวน 768 ตัว เป็นเวลา 21 วัน — 392,000 GPU-ชั่วโมง ที่รายงานไว้ 6.4×10²³ FLOPs และประมาณ 9.5×10² MWh รวมโอเวอร์เฮดของศูนย์ข้อมูล แต่ไม่รวม supervised fine-tuning และ reinforcement learning การกำหนดค่าการเสิร์ฟขั้นต่ำของการ์ดนี้คือการ์ด A100 80 GB สองใบ, H100 SXM5 สองตัว, H200 หนึ่งตัว, B200 หนึ่งตัว หรือ B300 หนึ่งตัว และขนาดหน่วยความจำ FP8 อยู่ที่ประมาณ 78 GB มันเป็นชิ้นส่วนโครงสร้างพื้นฐานที่จริงจัง และมันตอบคำถามด้วยการสร้างข้อความ
Intern-Decision-4B เป็นวัตถุอีกประเภทที่ตรงกันข้าม และการ์ดก็พูดตรงไปตรงมาอย่างน่าสดชื่นเกี่ยวกับเรื่องนี้ มันเป็นไฟน์จูนของ Qwen3.5-4B ซึ่ง vision tower และ projector ถูกแช่แข็ง และมีเพียง language backbone เท่านั้นที่ถูกเทรน คุณป้อนสถานะ สคีมาของคำถามที่มีชื่อกำกับ และไม่บังคับว่าสูงสุดถึงแปดภาพให้มัน แล้วมันจะคืนค่าการแจกแจงเหนือคำตอบที่เป็นไปได้สำหรับทุกคำถามในคราวเดียว กลไกนี้ไม่ธรรมดาและควรอธิบายให้แม่นยำ ตัวเลือกจะถูกแมปเป็นสัญลักษณ์โทเคนเดียวที่ครอบคลุม A ถึง Z, a ถึง z และ 0 ถึง 9 — 62 ตัวเลือก ดังนั้นสูงสุด 62 ตัวเลือกต่อคำถาม — พรอมต์ถูกเรนเดอร์โดยมี placeholder หนึ่งตัวต่อหนึ่งฟิลด์ และโมเดลอ่าน logits ณ ตำแหน่งที่อยู่ก่อนหน้า placeholder แต่ละตัวทันที Softmax ทำงานบน logits ของสัญลักษณ์ที่อนุญาตเฉพาะของฟิลด์นั้นเท่านั้น อุณหภูมิเฉพาะของ checkpoint จะปรับเทียบผลลัพธ์ และสัญลักษณ์เหล่านั้นจะแมปกลับไปยังค่าตัวเลือกเดิมของคุณเป็น JSON ที่มีชนิดข้อมูล ไม่มีลูปถอดรหัส ไม่มีการสุ่ม และไม่มีข้อความร้อยเรียง
• เอาต์พุต — Kolibri: ข้อความภาษาเยอรมันหรือภาษาอังกฤษที่สร้างขึ้นอย่างอิสระ, การเรียกใช้เครื่องมือ, ร่องรอยการให้เหตุผล. Intern-Decision-4B: คำตอบ JSON ที่มีชนิดข้อมูลพร้อมความน่าจะเป็นต่อตัวเลือก
• พารามิเตอร์ — Kolibri: 78,103,074,560 ทั้งหมด, 3,457,573,120 ที่ใช้งานอยู่. Intern-Decision-4B: 4.54 พันล้าน กระจายอยู่ทั่วสี่ shard ของ safetensors ในรูปแบบ bfloat16 พร้อมกับ vision tower ที่ถูก freeze ไว้
• อินพุต — Kolibri: ข้อความเท่านั้น Intern-Decision-4B: ข้อความพร้อมรูปภาพสูงสุด 8 รูป
• ความจุคำถาม — Intern-Decision-4B: สูงสุด 62 ตัวเลือกต่อฟิลด์ ในการส่งผ่านไปข้างหน้าหนึ่งครั้ง โดยมีประเภทคำถามแบบ 'choice', 'score' และ 'noul' (ใช่/ไม่ใช่) Kolibri: ไม่จำกัดในทางหลักการ แต่ในทางปฏิบัติทำทีละโทเค็น
• ภาษา — Kolibri: เยอรมันและอังกฤษโดยโครงสร้าง Intern-Decision-4B: ตามที่ Qwen3.5-4B มีมาให้ พร้อมชุดการประเมินที่เผยแพร่ทั้งหมดเป็นภาษาอังกฤษ
• ความหน่วง — Intern-Decision-4B: ค่าเฉลี่ย 44.16 ms, ค่ามัธยฐาน 44.03 ms และ P95 44.60 ms ต่อคิวรีบน RTX 4090 หนึ่งตัว ตามการวัดของตัวมันเอง Kolibri: ไม่มีตัวเลขต่อคิวรีที่เผยแพร่เลยแม้แต่ค่าเดียว
• สัญญาอนุญาต — ทั้งคู่ใช้ Apache 2.0; Intern-Decision-4B มาพร้อมกับไฟล์สัญญาอนุญาตของ Qwen ที่ยังคงถูกเก็บรักษาไว้ควบคู่กัน

ทำไมถึงมี scorer ขนาด 4B อยู่เลย
เหตุผลสนับสนุน Intern-Decision-4B ไม่ใช่ว่ามันมีขนาดเล็ก แต่คือการถามโมเดลเจเนอเรทีฟขนาดใหญ่เพื่อขอค่าความน่าจะเป็น ไม่เหมือนกับการวัดค่าความน่าจะเป็นนั้น และความแตกต่างนี้สามารถวัดได้
ตาราง benchmark ของการ์ดนี้เองนำเสนอข้อโต้แย้งด้วยการเปิดเผยข้อมูลของตัวเองในระดับที่ผิดปกติ ในชุดทดสอบความแม่นยำเจ็ดชุด Intern-Decision-4B ได้ค่าเฉลี่ย 90.02 เทียบกับ 88.74 ของ baseline ที่แข็งแกร่งที่สุดที่มันนำมาเปรียบเทียบด้วย ซึ่งเป็นโมเดลชื่อ Jev แต่ความแม่นยำเป็นครึ่งที่ไม่น่าสนใจ ตารางยังรายงาน Brier score และ expected calibration error และตรงนั้นภาพกลับเข้มงวดกว่า 4B ทำได้ Brier 0.347 และ ECE 0.065 เทียบกับ 0.358 และ 0.095 ของ Jev โมเดลพี่น้องขนาดเล็กกว่าคือจุดที่เรื่องราวการคาลิเบรตกลายเป็นข้อมูลที่ให้ insight จริงๆ Intern-Decision-2B ได้ค่าเฉลี่ย 84.68 นำหน้า 0.8B ที่ 79.38 อย่างชัดเจน — แต่ ECE 0.100 ของมันกลับแย่กว่า 0.066 ของ 0.8B และแย่กว่า 0.065 ของ 4B โดยมี Brier 0.437 เทียบกับ 0.530 ของ 0.8B โมเดลที่แม่นยำที่สุดในสองโมเดลเล็กกลับซื่อสัตย์น้อยที่สุดเกี่ยวกับความมั่นใจของตัวเอง หากคุณเคยสันนิษฐานว่าการคาลิเบรตดีขึ้นตามความแม่นยำ หรือตามจำนวนพารามิเตอร์ ตารางนั้นคือตัวอย่างโต้แย้งในทั้งสองกรณี
การวินิจฉัยแยกส่วนที่สองครอบคลุม 96 กรณีที่สร้างขึ้นด้วยการแจกแจงอ้างอิงแบบแม่นตรง แทนที่จะเป็นฮาร์ดเลเบลที่ได้จากการสุ่ม — การดึงแบบสุ่ม เหตุการณ์ประกอบ ประวัติแบบมีเงื่อนไข ปริศนาความน่าจะเป็น ความคลาดเคลื่อนของโมเดล 4B บนการทดลองนำร่องนั้นลดลงจาก 0.628 เหลือ 0.550 บนเมตริกที่รายงาน ขณะที่โมเดลเปรียบเทียบอยู่ที่ 0.595 การ์ดระบุไว้อย่างชัดเจนว่าการทดลองนำร่องนี้ไม่ได้ถูกใช้เพื่อปรับหรือเลือกอุณหภูมิที่เผยแพร่ อุณหภูมิ 1.992418 ของ 4B ถูกปรับแยกต่างหากบนชุดคาลิเบรชัน ทีม InternLM ยังได้ส่งเบนช์มาร์กเองเข้าไปในที่เก็บ GitHub ด้วย — ตัวสร้างแบบดีเทอร์มินิสติก ข้อมูลอ้างอิง และตัวให้คะแนนแบบออฟไลน์ — ซึ่งหมายความว่าข้ออ้างเรื่องคาลิเบรชันเป็นแบบที่หายากที่บุคคลที่สามสามารถรันซ้ำได้จริง แทนที่จะต้องเชื่อโดยศรัทธา
ไม่มีสิ่งใดในรีลีสของ Kolibri ที่มีสิ่งที่เทียบเท่าได้ ตารางเปรียบเทียบของมันรายงานความแม่นยำในงานครอบคลุมโมเดลสิบสี่ตัวบนฮาร์เนสของผู้ขายรายเดียว และความแม่นยำคือสิ่งที่สามารถใช้วัดโมเดลเชิงสร้างได้ ไม่มีตัวเลขการปรับเทียบ ไม่มี Brier หรือ ECE ที่ใดในเอกสารนี้ และไม่มีวิธีถามมันถึง "ความน่าจะเป็นที่ข้อสัญญานี้สามารถบังคับใช้ได้" โดยไม่ต้องสุ่มประโยคขึ้นมาหนึ่งประโยคแล้วอ่านมัน
ตะเข็บเดียวที่พวกเขาพบกันจริง ๆ
พอวางสองตัวไว้เคียงกันในไปป์ไลน์จริง รูปทรงก็จะปรากฏชัด กระบวนการทำงานเอกสารภาษาเยอรมันต้องใช้ทั้งสองส่วน และไม่มีเครื่องมือใดที่ครอบคลุมอีกส่วนหนึ่งได้
Kolibri คือครึ่งที่อ่านและเขียน ทีมที่มีสัญญาภาษาเยอรมันหรือเอกสารทางเทคนิคจะได้หน้าต่างเนทีฟขนาด 262,144 โทเคน แคช KV แบบ FP8 โทเคไนเซอร์สองภาษาที่ Aleph Alpha รายงานว่าอยู่ที่ 4.90 ไบต์เฉลี่ยต่อโทเคนบนข้อความเว็บภาษาเยอรมัน และการเรียกใช้เครื่องมือของ Hermes — ซึ่งก็คือโมเดลที่สามารถสรุปเอกสารที่ยื่น ร่างคำตอบ และขับเคลื่อนลูปเครื่องมือ สิ่งที่มันทำไม่ได้คือบอกคุณถึงความมั่นใจของตัวมันเองในแบบที่คุณตรวจสอบได้ เพราะทุกอย่างที่มันส่งออกมาเป็นสตริงที่ถูกสุ่มตัวอย่าง
Intern-Decision-4B คือครึ่งที่ทำหน้าที่ตัดสินใจ เมื่อได้รับข้อความภาษาเยอรมันหนึ่งหน้าและชุดตัวเลือกที่กำหนดไว้ มันจะคืนค่าการแจกแจงที่ปรับเทียบแล้วภายใน 44 มิลลิวินาทีบน GPU สำหรับผู้ใช้ทั่วไปหนึ่งตัว โดยไม่มีขั้นตอนการสร้าง จึงไม่มีความแปรปรวนจากการสุ่มเลยแม้แต่น้อย สิ่งที่มันทำไม่ได้คือการสร้างข้อความภาษาเยอรมันตั้งแต่แรก และชุดการประเมินที่เผยแพร่ของมันเป็นภาษาอังกฤษ — พฤติกรรมภาษาเยอรมันของมันสืบทอดมาจากฐาน Qwen3.5-4B แทนที่จะได้รับการฝึกมา ซึ่งเป็นข้อจำกัดจริงสำหรับการนำไปใช้งานกับภาษาเยอรมัน และเป็นข้อจำกัดที่ยังไม่มีใครประเมิน
ดังนั้นคำตอบทางวิศวกรรมที่ตรงไปตรงมาสำหรับเวิร์กโฟลว์ภาษาเยอรมันที่มีการกำกับดูแลก็คือ สิ่งเหล่านี้เป็นสองขั้นตอนของไปป์ไลน์เดียว ไม่ใช่สองตัวเลือกสำหรับหนึ่งช่อง คำถามในทางปฏิบัติคือแต่ละตัวรันที่ไหน Kolibri ต้องใช้ H100s สองตัวหรือ B200 หนึ่งตัว และหน่วยความจำประมาณ 78 GB Intern-Decision-4B ต้องใช้ RTX 4090 หนึ่งตัว และรันคิวรีได้ในเวลาไม่ถึง 45 มิลลิวินาที ความไม่สมดุลของต้นทุนอยู่ที่ประมาณสองลำดับขนาดบนฮาร์ดแวร์ และมันชี้ไปที่การออกแบบซึ่งตัวให้คะแนนขนาดเล็กรันอย่างต่อเนื่องกับทุกเคส และตัวสร้างขนาดใหญ่จะถูกเรียกใช้เฉพาะเมื่อเคสนั้นต้องการข้อความร้อยเรียงจริง ๆ นั่นเป็นรูปแบบที่ถูกกว่าและเป็นมิตรต่อการตรวจสอบมากกว่าการส่งทุกเคสผ่านโมเดล 78B เพื่อให้ได้คำตอบที่คุณจะต้องตีความในภายหลัง

ความเป็นจริงด้านโฮสติ้งของทั้งสอง และเลเยอร์นี้มีไว้เพื่ออะไร
ไม่มีโมเดลไหนเลยที่ให้บริการเป็น API แบบโฮสต์ และเราได้ตรวจสอบจริงแทนที่จะคาดเดาเอาเอง Intern-Decision-4B ไม่มีเอนด์พอยต์ของผู้ให้บริการ; สิ่งที่เผยแพร่ออกมาคือเวต ที่เก็บ GitHub และ Hugging Face Space ยอดดาวน์โหลดและยอดไลก์ของมันขยับตั้งแต่กลางสัปดาห์ ซึ่งบอกได้ว่าผู้คนกำลังเริ่มนำไปใช้ แต่ก็ยังไม่มีเส้นทางแบบเสียค่าใช้จ่ายที่เรียกใช้งานได้ ณ ที่ใดก็ตามที่เราจะกล้าเอ่ยถึง
Kolibri เช่นเดียวกันไม่มี Aleph Alpha API SKU — การเปิดตัวครั้งนี้ประกอบด้วยเวต รายงานทางเทคนิค และอิมเมจคอนเทนเนอร์ที่ ghcr.io/aleph-alpha/aleph-alpha-inference และมันไม่ได้อยู่บน OrcaRouter: เราไล่ตรวจสอบแคตตาล็อกด้วยการสะกดคำนำหน้าผู้ให้บริการและชื่อโมเดลทุกรูปแบบ แล้วผลลัพธ์คือไม่พบ ซึ่งเราขอพูดตามนี้มากกว่าจะทำให้เข้าใจเป็นอย่างอื่น
สิ่งที่ชั้นจัดเส้นทาง (routing layer) เปลี่ยนแปลงในที่นี้ไม่ใช่การเข้าถึงโมเดลสองตัวนี้ แต่เป็นเศรษฐศาสตร์ของการตัดสินใจว่าจะซื้อฮาร์ดแวร์สำหรับตัวใดตัวหนึ่งหรือไม่ การทดสอบก่อนซื้อที่ตรงไปตรงมาสำหรับครึ่งที่เป็นงานสร้าง (generative) คือการรันเวิร์กโหลดกับระดับ mixture-of-experts ขนาดเล็กที่ถูกจัดเส้นทางไว้แล้ว — คือรุ่น Gemma 4 26B-A4B ในราคา $0.06 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $0.33 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน พร้อมหน้าต่าง 262,144 โทเคน และรองรับอินพุตทั้งข้อความ รูปภาพ และวิดีโอ — ด้วย คีย์ที่เข้ากันได้กับ OpenAI หนึ่งคีย์ ในราคาตามที่ผู้ให้บริการระบุไว้ โดยไม่มีอะไรเพิ่มเติม แล้วดูว่าเวิร์กโหลดเอกสารภาษาเยอรมันนั้นต้องการพารามิเตอร์ 78 พันล้านตัวจริงหรือไม่ก่อนจะสั่งซื้อ GPU ครึ่งที่เป็นการตัดสินใจไม่มีทางลัดเช่นนั้น เพราะพฤติกรรมแบบการแจกแจงที่ปรับเทียบแล้วคือหัวใจทั้งหมดของโมเดลนี้ และไม่มีระดับที่ถูกจัดเส้นทางใดทำสิ่งนั้นได้ แต่นั่นเองก็คือข้อค้นพบ: มันบอกคุณว่าตัวให้คะแนน 4B คือส่วนที่คุณจะโฮสต์เองจริง ๆ และตัวสร้างคือส่วนที่คุ้มค่าจะทดสอบซ้ำกับสิ่งที่คุณเช่าใช้ได้ในบ่ายนี้
อะไรจะยุติเรื่องนี้ได้
การวัดสองอย่าง และยังไม่มีทั้งสองอย่าง
ตัวแรกคือ Intern-Decision-4B เมื่อใช้อินพุตภาษาเยอรมัน ชุดทดสอบที่เผยแพร่ทุกชุดเป็นภาษาอังกฤษ และโมเดลนี้เป็นไฟน์จูนจากฐานแบบหลายภาษา ดังนั้นการคาลิเบรตภาษาเยอรมันของมันจึงไม่เป็นที่ทราบ — และการคาลิเบรตก็เป็นคุณสมบัติที่ไม่ได้ถ่ายโอนข้ามภาษาไปฟรี ๆ พอดี เวอร์ชันภาษาเยอรมันของไพลอตการกระจาย 96 เคสจะเป็นชิ้นงานชิ้นเดียวที่ให้ข้อมูลได้มากที่สุดที่ใคร ๆ ก็สามารถเผยแพร่เกี่ยวกับโมเดลนี้ได้
ข้อที่สองคือต้นทุนต่อการตัดสินใจของ Kolibri ข้อกล่าวอ้างด้านเศรษฐศาสตร์การให้บริการของมันคือพรมแดนพาเรโต (Pareto frontier) ระหว่างคุณภาพกับจำนวนโทเค็นที่ถอดรหัสได้ต่อวินาทีต่อ GPU และไม่มีหน้า Artificial Analysis สำหรับ Kolibri และไม่มีการทำซ้ำฮาร์เนสโดยบุคคลที่สาม จนกว่าจะมีใครรันมัน “พารามิเตอร์ 78 พันล้านตัว” ก็เป็นเพียงสเปกมากกว่าจะเป็นต้นทุน และเหตุผลในการคงตัวให้คะแนนที่มีความหน่วง 44 มิลลิวินาทีไว้ด้านหน้ามัน ก็ยังเป็นข้อโต้แย้งเชิงออกแบบมากกว่าข้อที่วัดได้
จนถึงตอนนั้น วิธีที่ถูกต้องในการอ่านการจับคู่นี้ไม่ใช่การมองว่าเป็นการแข่งขัน Intern-Decision-4B เป็นรุ่นเปิดตัวที่น่าสนใจในเชิงเทคนิคมากกว่าระหว่างสองรุ่นนี้ เพราะเอาต์พุตแบบมีโครงสร้างที่ตระหนักถึงการคาลิเบรต (calibration-aware) เป็นความสามารถที่แทบไม่มีโมเดลเชิงสร้างใดมีให้ และการ์ดของมันช่วยให้คุณตรวจสอบข้อกล่าวอ้างนั้นได้ Kolibri เป็นรุ่นเปิดตัวที่ส่งผลกระทบมากกว่า เพราะการที่แล็บจากยุโรปเปิดตัวโมเดล Apache 2.0 ที่มีพารามิเตอร์ 78 พันล้าน พร้อมทั้งเผยแพร่ไปป์ไลน์ข้อมูลควบคู่กันไป ถือเป็นเหตุการณ์ในห่วงโซ่อุปทานมากกว่าเป็นเหตุการณ์ของโมเดล ทั้งสองไม่ได้แทนที่กัน ทีมที่ต้องการทั้งสองควรวางแผนสำหรับทั้งสอง และกำหนดขนาดฮาร์ดแวร์ให้สอดคล้องกัน และฮาร์เนสที่ล้อมรอบทั้งสองนั้นคือจุดที่ความพยายามทางวิศวกรรมไปลงจริง ๆ

