การ์ดชื่อเรื่องหลักที่มีข้อความว่า 'Kolibri vs Intern-Decision 4B' เป็นตัวหนาขนาดใหญ่ โดยมีข้อความบรรทัดเล็กกว่าเพียงบรรทัดเดียวด้านล่างว่า 'ข้อความที่สร้างขึ้นเทียบกับการแจกแจงความน่าจะเป็นที่ปรับเทียบแล้ว' และไอคอนเส้นแบนขนาดเล็กสองอันวางเคียงข้างกัน — รูปนกฮัมมิงเบิร์ดทางซ้ายและแผนภูมิเส้นโค้งรูประฆังขนาดเล็กทางขวา — คั่นด้วยเส้นแบ่งแนวตั้งแบบบาง วางอยู่บนพื้นหลังสีขาวที่มีแอ็กเซนต์ไล่ระดับสีฟ้าและสีฟ้าไซแอนแบบนุ่มนวล และโลโก้ OrcaRouter ที่มุมล่างขวา
Guides & Insights

Kolibri vs Intern-Decision 4B: ตัวหนึ่งเขียนเอกสาร แต่อีกตัวปฏิเสธที่จะเขียนอะไรเลย

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สิ่งที่มีประโยชน์ที่สุดที่ควรสังเกตเกี่ยวกับKolibriและIntern-Decision-4Bก็คือ พวกมันไม่ใช่สิ่งประเภทเดียวกัน และการมองสิ่งนี้เป็นการเปรียบเทียบแบบโมเดลต่อโมเดลจะเป็นการผิดหมวดหมู่ Kolibri เป็นโมเดลภาษาชนิด mixture-of-experts ขนาด 78.1 พันล้านพารามิเตอร์ของ Aleph Alpha เปิดตัวเมื่อวันที่ 3 ตุลาคม 2026 ซึ่งเปิดใช้งานพารามิเตอร์ 3.46 พันล้านตัวต่อโทเคน และเขียนข้อความภาษาเยอรมันกับอังกฤษ Intern-Decision-4B เป็นโมเดลตัดสินใจเชิงโครงสร้างแบบหลายรูปแบบขนาด 4.54 พันล้านพารามิเตอร์จากทีม InternLM อัปโหลดขึ้น Hugging Face เมื่อวันที่ 26 กันยายน 2026 โดยการ์ดของมันระบุไว้อย่างตรงไปตรงมาว่ามัน "ไม่เรียก generate() หรือสุ่มข้อความอิสระ" เลย ตัวหนึ่งผลิตร้อยแก้ว อีกตัวหนึ่งผลิตการแจกแจงความน่าจะเป็นเหนือตัวเลือกที่คุณให้มา ในการส่งผ่านไปข้างหน้า (forward pass) เพียงครั้งเดียว และไม่มีความสามารถในการเขียนประโยคใดๆ พวกมันกลายเป็นคู่แข่งกันเพียงในสถานการณ์แคบๆ เพียงหนึ่งเดียวเท่านั้น และการรู้ให้แน่ชัดว่าสถานการณ์นั้นคืออะไรกลับกลายเป็นสิ่งที่มีประโยชน์ที่สุดในการเปิดตัวทั้งสองครั้ง

สองการเปิดตัว สองข้อกล่าวอ้างสั้น ๆ ที่แตกต่างกันโดยสิ้นเชิง

สเปกการ์ดของ Kolibri เป็นข้อกำหนดของโมเดลภาษาขนาดใหญ่แบบ sparse: 50 เลเยอร์ ทุกเลเยอร์เป็น mixture-of-experts, ผู้เชี่ยวชาญ 384 ตัวต่อเลเยอร์ โดยมี 1 ตัวแบบ shared และ 6 ตัวแบบ routed, บริบทเนทีฟ 262,144 โทเคนที่ตรวจสอบรับรองถึง 1,048,576, ระดับความพยายามในการให้เหตุผล 4 ระดับ, การเรียกใช้เครื่องมือแบบ Hermes พร้อม parser vLLM ที่ให้มาด้วย, น้ำหนัก FP8 ในบล็อกขนาด 128×128 และเงื่อนไข Apache 2.0 การฝึกของมันใช้ 20 ล้านล้านโทเคนบน NVIDIA B200 จำนวน 768 ตัว เป็นเวลา 21 วัน — 392,000 GPU-ชั่วโมง ที่รายงานไว้ 6.4×10²³ FLOPs และประมาณ 9.5×10² MWh รวมโอเวอร์เฮดของศูนย์ข้อมูล แต่ไม่รวม supervised fine-tuning และ reinforcement learning การกำหนดค่าการเสิร์ฟขั้นต่ำของการ์ดนี้คือการ์ด A100 80 GB สองใบ, H100 SXM5 สองตัว, H200 หนึ่งตัว, B200 หนึ่งตัว หรือ B300 หนึ่งตัว และขนาดหน่วยความจำ FP8 อยู่ที่ประมาณ 78 GB มันเป็นชิ้นส่วนโครงสร้างพื้นฐานที่จริงจัง และมันตอบคำถามด้วยการสร้างข้อความ

Intern-Decision-4B เป็นวัตถุอีกประเภทที่ตรงกันข้าม และการ์ดก็พูดตรงไปตรงมาอย่างน่าสดชื่นเกี่ยวกับเรื่องนี้ มันเป็นไฟน์จูนของ Qwen3.5-4B ซึ่ง vision tower และ projector ถูกแช่แข็ง และมีเพียง language backbone เท่านั้นที่ถูกเทรน คุณป้อนสถานะ สคีมาของคำถามที่มีชื่อกำกับ และไม่บังคับว่าสูงสุดถึงแปดภาพให้มัน แล้วมันจะคืนค่าการแจกแจงเหนือคำตอบที่เป็นไปได้สำหรับทุกคำถามในคราวเดียว กลไกนี้ไม่ธรรมดาและควรอธิบายให้แม่นยำ ตัวเลือกจะถูกแมปเป็นสัญลักษณ์โทเคนเดียวที่ครอบคลุม A ถึง Z, a ถึง z และ 0 ถึง 9 — 62 ตัวเลือก ดังนั้นสูงสุด 62 ตัวเลือกต่อคำถาม — พรอมต์ถูกเรนเดอร์โดยมี placeholder หนึ่งตัวต่อหนึ่งฟิลด์ และโมเดลอ่าน logits ณ ตำแหน่งที่อยู่ก่อนหน้า placeholder แต่ละตัวทันที Softmax ทำงานบน logits ของสัญลักษณ์ที่อนุญาตเฉพาะของฟิลด์นั้นเท่านั้น อุณหภูมิเฉพาะของ checkpoint จะปรับเทียบผลลัพธ์ และสัญลักษณ์เหล่านั้นจะแมปกลับไปยังค่าตัวเลือกเดิมของคุณเป็น JSON ที่มีชนิดข้อมูล ไม่มีลูปถอดรหัส ไม่มีการสุ่ม และไม่มีข้อความร้อยเรียง

• เอาต์พุต — Kolibri: ข้อความภาษาเยอรมันหรือภาษาอังกฤษที่สร้างขึ้นอย่างอิสระ, การเรียกใช้เครื่องมือ, ร่องรอยการให้เหตุผล. Intern-Decision-4B: คำตอบ JSON ที่มีชนิดข้อมูลพร้อมความน่าจะเป็นต่อตัวเลือก

• พารามิเตอร์ — Kolibri: 78,103,074,560 ทั้งหมด, 3,457,573,120 ที่ใช้งานอยู่. Intern-Decision-4B: 4.54 พันล้าน กระจายอยู่ทั่วสี่ shard ของ safetensors ในรูปแบบ bfloat16 พร้อมกับ vision tower ที่ถูก freeze ไว้

• อินพุต — Kolibri: ข้อความเท่านั้น Intern-Decision-4B: ข้อความพร้อมรูปภาพสูงสุด 8 รูป

• ความจุคำถาม — Intern-Decision-4B: สูงสุด 62 ตัวเลือกต่อฟิลด์ ในการส่งผ่านไปข้างหน้าหนึ่งครั้ง โดยมีประเภทคำถามแบบ 'choice', 'score' และ 'noul' (ใช่/ไม่ใช่) Kolibri: ไม่จำกัดในทางหลักการ แต่ในทางปฏิบัติทำทีละโทเค็น

• ภาษา — Kolibri: เยอรมันและอังกฤษโดยโครงสร้าง Intern-Decision-4B: ตามที่ Qwen3.5-4B มีมาให้ พร้อมชุดการประเมินที่เผยแพร่ทั้งหมดเป็นภาษาอังกฤษ

• ความหน่วง — Intern-Decision-4B: ค่าเฉลี่ย 44.16 ms, ค่ามัธยฐาน 44.03 ms และ P95 44.60 ms ต่อคิวรีบน RTX 4090 หนึ่งตัว ตามการวัดของตัวมันเอง Kolibri: ไม่มีตัวเลขต่อคิวรีที่เผยแพร่เลยแม้แต่ค่าเดียว

• สัญญาอนุญาต — ทั้งคู่ใช้ Apache 2.0; Intern-Decision-4B มาพร้อมกับไฟล์สัญญาอนุญาตของ Qwen ที่ยังคงถูกเก็บรักษาไว้ควบคู่กัน

A two-column comparison scoreboard titled 'Kolibri vs Intern-Decision 4B'. Left column Kolibri: Output freely generated text, Parameters 78.1B MoE / 3.46B active, Input text only, Context 262,144 native / 1M validated, Latency none published, Licence Apache 2.0. Right column Intern-Decision 4B: Output typed JSON with a probability per option, Parameters 4.54B bfloat16 with a frozen vision tower, Input text plus up to eight images, Options up to 62 per field in one forward pass, Latency 44.16 ms mean on one RTX 4090, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; Intern-Decision 4B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

ทำไมถึงมี scorer ขนาด 4B อยู่เลย

เหตุผลสนับสนุน Intern-Decision-4B ไม่ใช่ว่ามันมีขนาดเล็ก แต่คือการถามโมเดลเจเนอเรทีฟขนาดใหญ่เพื่อขอค่าความน่าจะเป็น ไม่เหมือนกับการวัดค่าความน่าจะเป็นนั้น และความแตกต่างนี้สามารถวัดได้

ตาราง benchmark ของการ์ดนี้เองนำเสนอข้อโต้แย้งด้วยการเปิดเผยข้อมูลของตัวเองในระดับที่ผิดปกติ ในชุดทดสอบความแม่นยำเจ็ดชุด Intern-Decision-4B ได้ค่าเฉลี่ย 90.02 เทียบกับ 88.74 ของ baseline ที่แข็งแกร่งที่สุดที่มันนำมาเปรียบเทียบด้วย ซึ่งเป็นโมเดลชื่อ Jev แต่ความแม่นยำเป็นครึ่งที่ไม่น่าสนใจ ตารางยังรายงาน Brier score และ expected calibration error และตรงนั้นภาพกลับเข้มงวดกว่า 4B ทำได้ Brier 0.347 และ ECE 0.065 เทียบกับ 0.358 และ 0.095 ของ Jev โมเดลพี่น้องขนาดเล็กกว่าคือจุดที่เรื่องราวการคาลิเบรตกลายเป็นข้อมูลที่ให้ insight จริงๆ Intern-Decision-2B ได้ค่าเฉลี่ย 84.68 นำหน้า 0.8B ที่ 79.38 อย่างชัดเจน — แต่ ECE 0.100 ของมันกลับแย่กว่า 0.066 ของ 0.8B และแย่กว่า 0.065 ของ 4B โดยมี Brier 0.437 เทียบกับ 0.530 ของ 0.8B โมเดลที่แม่นยำที่สุดในสองโมเดลเล็กกลับซื่อสัตย์น้อยที่สุดเกี่ยวกับความมั่นใจของตัวเอง หากคุณเคยสันนิษฐานว่าการคาลิเบรตดีขึ้นตามความแม่นยำ หรือตามจำนวนพารามิเตอร์ ตารางนั้นคือตัวอย่างโต้แย้งในทั้งสองกรณี

การวินิจฉัยแยกส่วนที่สองครอบคลุม 96 กรณีที่สร้างขึ้นด้วยการแจกแจงอ้างอิงแบบแม่นตรง แทนที่จะเป็นฮาร์ดเลเบลที่ได้จากการสุ่ม — การดึงแบบสุ่ม เหตุการณ์ประกอบ ประวัติแบบมีเงื่อนไข ปริศนาความน่าจะเป็น ความคลาดเคลื่อนของโมเดล 4B บนการทดลองนำร่องนั้นลดลงจาก 0.628 เหลือ 0.550 บนเมตริกที่รายงาน ขณะที่โมเดลเปรียบเทียบอยู่ที่ 0.595 การ์ดระบุไว้อย่างชัดเจนว่าการทดลองนำร่องนี้ไม่ได้ถูกใช้เพื่อปรับหรือเลือกอุณหภูมิที่เผยแพร่ อุณหภูมิ 1.992418 ของ 4B ถูกปรับแยกต่างหากบนชุดคาลิเบรชัน ทีม InternLM ยังได้ส่งเบนช์มาร์กเองเข้าไปในที่เก็บ GitHub ด้วย — ตัวสร้างแบบดีเทอร์มินิสติก ข้อมูลอ้างอิง และตัวให้คะแนนแบบออฟไลน์ — ซึ่งหมายความว่าข้ออ้างเรื่องคาลิเบรชันเป็นแบบที่หายากที่บุคคลที่สามสามารถรันซ้ำได้จริง แทนที่จะต้องเชื่อโดยศรัทธา

ไม่มีสิ่งใดในรีลีสของ Kolibri ที่มีสิ่งที่เทียบเท่าได้ ตารางเปรียบเทียบของมันรายงานความแม่นยำในงานครอบคลุมโมเดลสิบสี่ตัวบนฮาร์เนสของผู้ขายรายเดียว และความแม่นยำคือสิ่งที่สามารถใช้วัดโมเดลเชิงสร้างได้ ไม่มีตัวเลขการปรับเทียบ ไม่มี Brier หรือ ECE ที่ใดในเอกสารนี้ และไม่มีวิธีถามมันถึง "ความน่าจะเป็นที่ข้อสัญญานี้สามารถบังคับใช้ได้" โดยไม่ต้องสุ่มประโยคขึ้นมาหนึ่งประโยคแล้วอ่านมัน

ตะเข็บเดียวที่พวกเขาพบกันจริง ๆ

พอวางสองตัวไว้เคียงกันในไปป์ไลน์จริง รูปทรงก็จะปรากฏชัด กระบวนการทำงานเอกสารภาษาเยอรมันต้องใช้ทั้งสองส่วน และไม่มีเครื่องมือใดที่ครอบคลุมอีกส่วนหนึ่งได้

Kolibri คือครึ่งที่อ่านและเขียน ทีมที่มีสัญญาภาษาเยอรมันหรือเอกสารทางเทคนิคจะได้หน้าต่างเนทีฟขนาด 262,144 โทเคน แคช KV แบบ FP8 โทเคไนเซอร์สองภาษาที่ Aleph Alpha รายงานว่าอยู่ที่ 4.90 ไบต์เฉลี่ยต่อโทเคนบนข้อความเว็บภาษาเยอรมัน และการเรียกใช้เครื่องมือของ Hermes — ซึ่งก็คือโมเดลที่สามารถสรุปเอกสารที่ยื่น ร่างคำตอบ และขับเคลื่อนลูปเครื่องมือ สิ่งที่มันทำไม่ได้คือบอกคุณถึงความมั่นใจของตัวมันเองในแบบที่คุณตรวจสอบได้ เพราะทุกอย่างที่มันส่งออกมาเป็นสตริงที่ถูกสุ่มตัวอย่าง

Intern-Decision-4B คือครึ่งที่ทำหน้าที่ตัดสินใจ เมื่อได้รับข้อความภาษาเยอรมันหนึ่งหน้าและชุดตัวเลือกที่กำหนดไว้ มันจะคืนค่าการแจกแจงที่ปรับเทียบแล้วภายใน 44 มิลลิวินาทีบน GPU สำหรับผู้ใช้ทั่วไปหนึ่งตัว โดยไม่มีขั้นตอนการสร้าง จึงไม่มีความแปรปรวนจากการสุ่มเลยแม้แต่น้อย สิ่งที่มันทำไม่ได้คือการสร้างข้อความภาษาเยอรมันตั้งแต่แรก และชุดการประเมินที่เผยแพร่ของมันเป็นภาษาอังกฤษ — พฤติกรรมภาษาเยอรมันของมันสืบทอดมาจากฐาน Qwen3.5-4B แทนที่จะได้รับการฝึกมา ซึ่งเป็นข้อจำกัดจริงสำหรับการนำไปใช้งานกับภาษาเยอรมัน และเป็นข้อจำกัดที่ยังไม่มีใครประเมิน

ดังนั้นคำตอบทางวิศวกรรมที่ตรงไปตรงมาสำหรับเวิร์กโฟลว์ภาษาเยอรมันที่มีการกำกับดูแลก็คือ สิ่งเหล่านี้เป็นสองขั้นตอนของไปป์ไลน์เดียว ไม่ใช่สองตัวเลือกสำหรับหนึ่งช่อง คำถามในทางปฏิบัติคือแต่ละตัวรันที่ไหน Kolibri ต้องใช้ H100s สองตัวหรือ B200 หนึ่งตัว และหน่วยความจำประมาณ 78 GB Intern-Decision-4B ต้องใช้ RTX 4090 หนึ่งตัว และรันคิวรีได้ในเวลาไม่ถึง 45 มิลลิวินาที ความไม่สมดุลของต้นทุนอยู่ที่ประมาณสองลำดับขนาดบนฮาร์ดแวร์ และมันชี้ไปที่การออกแบบซึ่งตัวให้คะแนนขนาดเล็กรันอย่างต่อเนื่องกับทุกเคส และตัวสร้างขนาดใหญ่จะถูกเรียกใช้เฉพาะเมื่อเคสนั้นต้องการข้อความร้อยเรียงจริง ๆ นั่นเป็นรูปแบบที่ถูกกว่าและเป็นมิตรต่อการตรวจสอบมากกว่าการส่งทุกเคสผ่านโมเดล 78B เพื่อให้ได้คำตอบที่คุณจะต้องตีความในภายหลัง

A screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the card header, the description of it as a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution in one forward pass, and the numbered 'How inference works' steps mapping each question's options to single-token symbols.

ความเป็นจริงด้านโฮสติ้งของทั้งสอง และเลเยอร์นี้มีไว้เพื่ออะไร

ไม่มีโมเดลไหนเลยที่ให้บริการเป็น API แบบโฮสต์ และเราได้ตรวจสอบจริงแทนที่จะคาดเดาเอาเอง Intern-Decision-4B ไม่มีเอนด์พอยต์ของผู้ให้บริการ; สิ่งที่เผยแพร่ออกมาคือเวต ที่เก็บ GitHub และ Hugging Face Space ยอดดาวน์โหลดและยอดไลก์ของมันขยับตั้งแต่กลางสัปดาห์ ซึ่งบอกได้ว่าผู้คนกำลังเริ่มนำไปใช้ แต่ก็ยังไม่มีเส้นทางแบบเสียค่าใช้จ่ายที่เรียกใช้งานได้ ณ ที่ใดก็ตามที่เราจะกล้าเอ่ยถึง

Kolibri เช่นเดียวกันไม่มี Aleph Alpha API SKU — การเปิดตัวครั้งนี้ประกอบด้วยเวต รายงานทางเทคนิค และอิมเมจคอนเทนเนอร์ที่ ghcr.io/aleph-alpha/aleph-alpha-inference และมันไม่ได้อยู่บน OrcaRouter: เราไล่ตรวจสอบแคตตาล็อกด้วยการสะกดคำนำหน้าผู้ให้บริการและชื่อโมเดลทุกรูปแบบ แล้วผลลัพธ์คือไม่พบ ซึ่งเราขอพูดตามนี้มากกว่าจะทำให้เข้าใจเป็นอย่างอื่น

สิ่งที่ชั้นจัดเส้นทาง (routing layer) เปลี่ยนแปลงในที่นี้ไม่ใช่การเข้าถึงโมเดลสองตัวนี้ แต่เป็นเศรษฐศาสตร์ของการตัดสินใจว่าจะซื้อฮาร์ดแวร์สำหรับตัวใดตัวหนึ่งหรือไม่ การทดสอบก่อนซื้อที่ตรงไปตรงมาสำหรับครึ่งที่เป็นงานสร้าง (generative) คือการรันเวิร์กโหลดกับระดับ mixture-of-experts ขนาดเล็กที่ถูกจัดเส้นทางไว้แล้ว — คือรุ่น Gemma 4 26B-A4B ในราคา $0.06 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $0.33 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน พร้อมหน้าต่าง 262,144 โทเคน และรองรับอินพุตทั้งข้อความ รูปภาพ และวิดีโอ — ด้วย คีย์ที่เข้ากันได้กับ OpenAI หนึ่งคีย์ ในราคาตามที่ผู้ให้บริการระบุไว้ โดยไม่มีอะไรเพิ่มเติม แล้วดูว่าเวิร์กโหลดเอกสารภาษาเยอรมันนั้นต้องการพารามิเตอร์ 78 พันล้านตัวจริงหรือไม่ก่อนจะสั่งซื้อ GPU ครึ่งที่เป็นการตัดสินใจไม่มีทางลัดเช่นนั้น เพราะพฤติกรรมแบบการแจกแจงที่ปรับเทียบแล้วคือหัวใจทั้งหมดของโมเดลนี้ และไม่มีระดับที่ถูกจัดเส้นทางใดทำสิ่งนั้นได้ แต่นั่นเองก็คือข้อค้นพบ: มันบอกคุณว่าตัวให้คะแนน 4B คือส่วนที่คุณจะโฮสต์เองจริง ๆ และตัวสร้างคือส่วนที่คุ้มค่าจะทดสอบซ้ำกับสิ่งที่คุณเช่าใช้ได้ในบ่ายนี้

อะไรจะยุติเรื่องนี้ได้

การวัดสองอย่าง และยังไม่มีทั้งสองอย่าง

ตัวแรกคือ Intern-Decision-4B เมื่อใช้อินพุตภาษาเยอรมัน ชุดทดสอบที่เผยแพร่ทุกชุดเป็นภาษาอังกฤษ และโมเดลนี้เป็นไฟน์จูนจากฐานแบบหลายภาษา ดังนั้นการคาลิเบรตภาษาเยอรมันของมันจึงไม่เป็นที่ทราบ — และการคาลิเบรตก็เป็นคุณสมบัติที่ไม่ได้ถ่ายโอนข้ามภาษาไปฟรี ๆ พอดี เวอร์ชันภาษาเยอรมันของไพลอตการกระจาย 96 เคสจะเป็นชิ้นงานชิ้นเดียวที่ให้ข้อมูลได้มากที่สุดที่ใคร ๆ ก็สามารถเผยแพร่เกี่ยวกับโมเดลนี้ได้

ข้อที่สองคือต้นทุนต่อการตัดสินใจของ Kolibri ข้อกล่าวอ้างด้านเศรษฐศาสตร์การให้บริการของมันคือพรมแดนพาเรโต (Pareto frontier) ระหว่างคุณภาพกับจำนวนโทเค็นที่ถอดรหัสได้ต่อวินาทีต่อ GPU และไม่มีหน้า Artificial Analysis สำหรับ Kolibri และไม่มีการทำซ้ำฮาร์เนสโดยบุคคลที่สาม จนกว่าจะมีใครรันมัน “พารามิเตอร์ 78 พันล้านตัว” ก็เป็นเพียงสเปกมากกว่าจะเป็นต้นทุน และเหตุผลในการคงตัวให้คะแนนที่มีความหน่วง 44 มิลลิวินาทีไว้ด้านหน้ามัน ก็ยังเป็นข้อโต้แย้งเชิงออกแบบมากกว่าข้อที่วัดได้

จนถึงตอนนั้น วิธีที่ถูกต้องในการอ่านการจับคู่นี้ไม่ใช่การมองว่าเป็นการแข่งขัน Intern-Decision-4B เป็นรุ่นเปิดตัวที่น่าสนใจในเชิงเทคนิคมากกว่าระหว่างสองรุ่นนี้ เพราะเอาต์พุตแบบมีโครงสร้างที่ตระหนักถึงการคาลิเบรต (calibration-aware) เป็นความสามารถที่แทบไม่มีโมเดลเชิงสร้างใดมีให้ และการ์ดของมันช่วยให้คุณตรวจสอบข้อกล่าวอ้างนั้นได้ Kolibri เป็นรุ่นเปิดตัวที่ส่งผลกระทบมากกว่า เพราะการที่แล็บจากยุโรปเปิดตัวโมเดล Apache 2.0 ที่มีพารามิเตอร์ 78 พันล้าน พร้อมทั้งเผยแพร่ไปป์ไลน์ข้อมูลควบคู่กันไป ถือเป็นเหตุการณ์ในห่วงโซ่อุปทานมากกว่าเป็นเหตุการณ์ของโมเดล ทั้งสองไม่ได้แทนที่กัน ทีมที่ต้องการทั้งสองควรวางแผนสำหรับทั้งสอง และกำหนดขนาดฮาร์ดแวร์ให้สอดคล้องกัน และฮาร์เนสที่ล้อมรอบทั้งสองนั้นคือจุดที่ความพยายามทางวิศวกรรมไปลงจริง ๆ

A screenshot of the InternLM 'Intern Large Models' organisation page on Hugging Face, showing the organisation header, its stated affiliation with Shanghai AI Laboratory, and a recent-activity feed listing models published within the last hour.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube