
Intern-Decision-4B vs Laya: สองโมเดลที่ปฏิเสธที่จะเขียนคำตอบ ขนาดต่างกันถึงสิบเท่า
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 592 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
ในบัตรโมเดล Intern-Decision-4B มีแถวหนึ่งที่เขียนว่า "Laya — 57.77" ใครก็ตามที่เคยอ่านเอกสารของ Laya เองจะรู้จักความหมายของตัวเลขนั้น: convaiinnovations/layaเป็นโมเดลตัดสินใจแบบไม่ใช่ออโตเรเกรสซีฟที่มีพารามิเตอร์ 421 ล้านตัว และ 57.77 คือค่าเฉลี่ยที่ได้เมื่อถูกใช้แบบ zero-shot บนเบนช์มาร์กของคนอื่น การ์ดของมันเองบอกสิ่งเดียวกันอย่างตรงไปตรงมามากกว่า — เช็คพอยต์พื้นฐานตั้งอยู่ ต่ำกว่าเกณฑ์พื้นฐานของคลาสส่วนใหญ่บนเบนช์มาร์ก typed-decisions โดยอยู่ที่ 0.362 เทียบกับ 0.461 ในขณะเดียวกัน internlm/Intern-Decision-4Bเป็นโมเดลที่มีพารามิเตอร์ 4.54 พันล้านตัวที่สร้างขึ้นสำหรับงานเดียวกันเป๊ะ: รับสถานะและชุดคำถามที่มีชนิด จากนั้นรัน forward pass หนึ่งครั้ง คืนค่าความน่าจะเป็นที่ปรับเทียบแล้ว ไม่สร้างโทเค็นเลย เดิมพันสถาปัตยกรรมเดียวกัน รูปร่างเอาต์พุตเดียวกัน สัญญาอนุญาต Apache-2.0 เดียวกัน พารามิเตอร์มากกว่าสิบเท่า — และหนึ่งในนั้นเป็นฐานสำหรับการปรับแต่งละเอียด ในขณะที่อีกตัวอ้างว่าเป็นเครื่องยนต์ zero-shot ที่สมบูรณ์แบบ
พวกเขาเห็นตรงกันในข้อสมมติฐาน ซึ่งเป็นส่วนที่หาได้ยาก
การ์ดทั้งสองให้เหตุผลแบบเดียวกัน และน่าจะกล่าวไว้เพราะอุตสาหกรรมส่วนใหญ่ให้เหตุผลตรงกันข้าม หากปัญหาของคุณคือการเลือกจากชุดคำตอบที่ทราบอยู่แล้ว การสร้างข้อความร้อยเรียงคือการดำเนินการที่ผิด: คุณจ่ายสำหรับโทเค็นที่ทิ้งไป คุณต้องมีตัวแยกวิเคราะห์ และคุณได้คำอธิบายที่คุณไม่ได้ขอ แทนที่จะเป็นความน่าจะเป็นที่คุณตั้งเกณฑ์ได้ การ์ดของ Laya ระบุว่า "มันไม่สร้างข้อความ จึงไม่มีอะไรต้องแยกวิเคราะห์และไม่มีอะไรต้องหลอน" การ์ดของ Intern-Decision-4B บอกว่า API ของมัน "ทำการให้คะแนนแคนดิเดตแบบมีโครงสร้าง. มันไม่เรียก generate() หรือสุ่มข้อความอิสระ."
กลไกเหล่านี้แตกต่างกันในทางที่ให้ความรู้ Laya ป้อนคำถามที่มีชนิดไปยัง classifier head และคืนคำตอบที่มีชนิดพร้อมความน่าจะเป็นที่ปรับเทียบแล้วในการ forward pass เพียงครั้งเดียว โดยมี routing layer ที่ตรวจจับอักษรและภาษาได้ภายในเวลาไม่ถึงครึ่งมิลลิวินาทีก่อนการ pass นั้น Intern-Decision-4B จับคู่ตัวเลือกของแต่ละคำถามกับสัญลักษณ์โทเคนเดี่ยว เรนเดอร์โครงร่าง JSON ของผู้ช่วยโดยมี placeholder หนึ่งตัวต่อฟิลด์ อ่าน logits ที่อยู่ก่อนหน้า placeholder แต่ละตัวโดยทันที และทำ softmax เฉพาะสัญลักษณ์ที่อนุญาตของฟิลด์นั้นเท่านั้น ของ Laya เป็นปัญหาการจำแนกประเภท ส่วนของ InternLM เป็นปัญหาการทำนายโทเคนถัดไปที่มันไม่ยอมให้กลายเป็นปัญหาการสร้าง

ช่องว่างของขนาด และสิ่งที่มันให้
การให้โมเดลสองตัวทำงานเดียวกันที่ขนาด 421M และ 4.54B พารามิเตอร์ ให้ผลลัพธ์ที่คุณน่าจะคาดไว้ แล้วก็มีเรื่องเซอร์ไพรส์ตามมา
ส่วนที่คาดการณ์คือความสามารถในคำถามยาก Intern-Decision-4B มีค่าเฉลี่ย 90.02 จากชุดการประเมินเจ็ดชุด โดยมีคะแนน Brier 0.347 และค่าความคลาดเคลื่อนการปรับเทียบที่คาดไว้ 0.065 ในการวัดของ InternLM เอง และใช้เวลาเฉลี่ย 44.16 มิลลิวินาทีต่อการสอบถามบน RTX 4090 ตัวเดียว เช็คพอยต์ภาษาอังกฤษพื้นฐานของ Laya มีความแม่นยำ 0.362 บนเกณฑ์มาตรฐาน typed-decisions ที่มีการตัดสินใจ 2,000 ครั้ง ซึ่งการ์ดของมันเองระบุว่าต่ำกว่าเส้นคลาสส่วนใหญ่ 0.461 และสูงกว่าเส้นฐานสุ่ม 0.318 เพียงเล็กน้อย เมื่อเช็คพอยต์เดียวกันถูกไฟน์จูนบนชุดฝึกของเกณฑ์มาตรฐานนั้นเอง ตัวเลขก็กระโดดไปที่ 0.766 การ์ดของ Laya สรุปเองว่า: "Laya เป็นฐานที่เร็วสำหรับการปรับให้เชี่ยวชาญ ไม่ใช่เครื่องยนต์ตัดสินใจแบบ zero-shot"
สิ่งที่น่าประหลาดใจคือโมเดลที่เล็กกว่าชนะในสองมิติอย่างเด็ดขาด ความเร็ว: Laya ตอบคำถามได้ 103 ถึง 332 ข้อต่อวินาทีเมื่อรันแบบแบตช์บน T4 ตัวเดียว และการ์ดของมันระบุว่าเร็วกว่า TypeSafe Jev ราวหกถึงแปดเท่า เมื่ออ้างอิงกับค่ามัธยฐาน p50 ที่วัดอย่างอิสระที่ 236–276 ms ซึ่งมันยกมา พารามิเตอร์ที่มากกว่าสิบเท่าไม่ได้ให้อัตราการประมวลผลมากกว่าสิบเท่าในทางกลับกัน — 44.16 ms ของ Intern-Decision-4B เป็นค่าต่อหนึ่งคิวรีบน 4090 โดยไม่มีการเปิดเผยข้อมูลเรื่องการแบตช์ และด้านภาษา: Laya รายงานว่ามี 45 จาก 51 ภาษาที่ทดสอบซึ่งใช้งานได้ โดยมีอัตราสูงกว่าการสุ่มมากกว่าสามเท่า โดยมีคะแนนแบบ routed 0.451 บน MASSIVE intent ในสิบสามภาษาที่ไม่ใช่ภาษาอังกฤษ เทียบกับ 0.306 สำหรับ checkpoint ภาษาอังกฤษเท่านั้นของมัน Intern-Decision-4B ไม่ได้กล่าวอ้างเรื่องหลายภาษาเลย
สกอร์บอร์ด
• พารามิเตอร์ — 4.54B BF16 สำหรับ Intern-Decision-4B ประกอบด้วย text tower, vision tower และ projector; 421M สำหรับ Laya ซึ่งเป็นสแต็กแบบ encoder-class ที่กะทัดรัดเพียงตัวเดียว
• เพดานอินพุต — 8,192 โทเค็นสำหรับทั้งคู่ และทั้งคู่จะปฏิเสธแทนที่จะตัดทอน โปรดทราบว่า 8,192 ของ Laya ใช้กับเช็กพอยต์แบบหลายภาษา ซึ่งค่าเริ่มต้นที่จัดส่งมาคือ 1,024
• Multiplicity — Intern-Decision-4B รับคำถามได้ 1 ถึง 16 ข้อ และสูงสุด 62 ตัวเลือกต่อข้อ และ 62 ไม่ใช่ตัวเลขที่กำหนดขึ้นมาลอย ๆ: มันคือจำนวนสัญลักษณ์แบบโทเคนเดียวที่สัญญาการอนุมานของมันสามารถรองรับได้พอดี. Laya ก็รับคำถามหลายข้อที่มีการระบุชนิดเช่นกัน แต่การ์ดของมันระบุถึงการล่มสลายอย่างรวดเร็วเมื่อเกินประมาณ 50 ตัวเลือก โดยคำถามที่มี 77 ป้ายกำกับจะได้งบเพียงสามหรือสี่โทเคนต่อป้ายกำกับ และความแม่นยำลดลงเหลือ 0.425
• รูปภาพ — สูงสุดแปดภาพสำหรับ Intern-Decision-4B โดยนับรวมกับงบประมาณ 8,192 โทเคน; Laya ไม่รองรับมัลติโมดัล
• การปรับเทียบ — Intern-Decision-4B มาพร้อมค่า temperature ที่ฟิตได้ 1.99241824 ซึ่งเลือกโดยการลด NLL ให้ต่ำสุดจาก 1,728 กรณี และรายงานค่า ECE 0.065 บนชุดทดสอบของตัวเอง; ส่วน Laya มาพร้อมความมั่นใจเกินจริง และการ์ดของมันระบุว่าการฟิต temperature ใหม่หนึ่งค่าต่อประเภทคำถามและจำนวนตัวเลือก ทำให้ค่าเฉลี่ย ECE เปลี่ยนจาก 0.466 เป็น 0.081
• ท่าทีแบบ zero-shot — เช็กพอยต์ที่เสร็จสมบูรณ์ซึ่งอ้างว่ามีค่าเฉลี่ย 90.02 เมื่อเทียบกับฐานที่มีการบันทึกไว้ซึ่งได้คะแนนต่ำกว่าเส้นของคลาสส่วนใหญ่
• ความหน่วง — ค่าเฉลี่ย 44.16 ms, ค่ามัธยฐาน 44.03 ms บน RTX 4090 หนึ่งตัว เทียบกับ 103 ถึง 332 คำถามต่อวินาทีเมื่อประมวลผลแบบแบตช์บน T4 หนึ่งตัว
• ภาษา — ไม่มีคำกล่าวอ้างที่เผยแพร่คัดค้านว่า 45 จาก 51 ภาษาสามารถใช้งานได้เมื่อกำหนดเส้นทาง
• สัญญาอนุญาต — Apache-2.0 โดยคงสัญญาอนุญาต Qwen ต้นทางไว้ เทียบกับ Apache-2.0 ที่ระบุอย่างชัดเจนสำหรับการใช้งานเชิงพาณิชย์

การ์ดสองใบ สองแนวคิดเรื่องการเปิดเผยที่ต่างกันสุดขั้ว
นี่คือจุดที่การเปรียบเทียบเลิกเป็นเพียงตารางสเปกและกลายเป็นการใช้วิจารณญาณตัดสินใจ เพราะผู้ขายทั้งสองรายนำเสนอโมเดลของตนในสไตล์ที่ตรงกันข้าม
การ์ดของ Laya เผยแพร่ความล้มเหลวของตัวเองอย่างละเอียด โดยรายงานว่า checkpoint ภาษาอังกฤษทำคะแนนความแม่นยำ 0.000 บนภาษาเขมรที่ความมั่นใจ 0.952 — มั่นใจทั้งที่ผิด ซึ่งทำให้การใช้ความมั่นใจเป็นเกณฑ์ตัดสินไร้ประโยชน์ตรงนั้น โดยรายงานว่า action.act_probability ไม่มีสัญญาณที่ใช้ประโยชน์ได้ โดยอ่านค่า 1.0 สำหรับแทบทุกอินพุต ด้วย AUROC 0.30 จาก 396 การตัดสินใจที่มีป้ายกำกับ และบอกให้คุณใช้ความมั่นใจเป็นเกณฑ์แทน ซึ่งไปถึง 0.77 บนรายการเดียวกัน มันระบุคำถามแบบคะแนนเชิงอันดับว่าเป็น "องค์ประกอบพื้นฐานที่อ่อนแอที่สุด" โดยอ้างอิง 0.372 บน SST-5 การ์ดที่บอกคุณว่าผลลัพธ์ใดของตัวเองควรเพิกเฉยกำลังทำสิ่งที่ผู้ขายส่วนใหญ่ไม่พยายามทำ
การ์ดของ Intern-Decision-4B เผยแพร่ตารางที่สะอาดและไม่มีกรณีล้มเหลว ข้อควรระวังของมันเป็นของจริงและมีนัยสำคัญ — ส่วนการปรับเทียบระบุอย่างชัดเจนผิดปกติว่า คอลัมน์ "before" ในไพลอตของมันไม่ใช่สิ่งที่ผู้ใช้จะได้เห็น และป้ายกำกับชุดทดสอบไม่ได้ถูกใช้ในการเลือกอุณหภูมิ — แต่ส่วนการประเมินผลมีชัยชนะเจ็ดครั้งและไม่มีการยอมรับข้อบกพร่อง มันยังมีแถวสำหรับระบบคู่แข่งห้าระบบที่ InternLM รันบนฮาร์เนสของ InternLM รวมถึงแถว Laya ที่ขึ้นต้นบทความนี้ นั่นไม่ใช่ตัวเลขของโครงการเหล่านั้นเอง และการอ่านว่าเป็นเช่นนั้นจะเป็นความผิดพลาด
แนวทางการจัดหาหลักฐานสำหรับการจับคู่นี้มีความไม่สมมาตรในลักษณะที่เอื้อต่อโมเดลที่เล็กกว่า: หลักฐานของ Laya รวมถึงข้อบกพร่องที่ตัวมันเองบันทึกไว้ และหลักฐานของ Intern-Decision-4B ยังไม่เคยผ่านชุดทดสอบที่ผู้เขียนไม่ได้เลือกเอง
แต่ละอันเข้ากับรูปแบบของปัญหาแบบใด
เมื่อพิจารณาสถานะสั้น ๆ ที่มีโครงสร้างเป็นภาษาอังกฤษ ชุดคำตอบแบบปิด และความจำเป็นในการได้ค่าความน่าจะเป็นที่น่าเชื่อถือ Intern-Decision-4B เป็นวัตถุที่มีความสามารถมากกว่าเมื่อดูตามสเปก และเป็นตัวที่แพงกว่าในทางปฏิบัติ — safetensors 4 shard, PyTorch 2.9.1 และ Transformers 5.14.1 บน Python 3.12, เอนจินที่รันค้างอยู่ และ wrapper ที่คุณต้องเขียนเองถ้าต้องการ HTTP endpoint เมื่อพิจารณาการตัดสินใจด้าน routing หรือ guardrail ที่มีปริมาณงานสูงในหลายสิบภาษา ซึ่ง throughput เป็นข้อจำกัดชี้ขาด Laya จึงเป็นรูปแบบที่ลงตัวกว่า: pip install laya, โมเดลขนาด 421M และการ์ดที่บอกคุณไว้แล้วว่าต้อง fine-tune ก่อนจะเชื่อค่าความน่าจะเป็น
สิ่งหนึ่งที่การ์ดทั้งสองเห็นตรงกันคือ ไม่ควรเชื่อถือโมเดลใดเลยแบบ zero-shot โดยไม่ตรวจสอบ calibration กับข้อมูลของคุณเอง — Laya เพราะ checkpoint ฐานของมันแทบจะเท่ากับการเดาสุ่มในประเภทการตัดสินใจที่ไม่คุ้นเคย และ Intern-Decision-4B เพราะค่า ECE 0.065 ของมันมาจากชุดทดสอบที่ผู้เขียนของมันเองประกอบขึ้น
สิ่งที่เราเตอร์เปลี่ยนแปลงและไม่เปลี่ยนแปลงที่นี่
ไม่มีโมเดลใดในสองโมเดลนี้อยู่ในแค็ตตาล็อกของ OrcaRouter และควรพูดให้ชัดเจนแทนที่จะบอกเป็นนัยเป็นอย่างอื่น: หน้าโมเดลของเราส่งคืน 404 สำหรับทั้ง Intern-Decision-4B และ Laya และทั้งคู่ก็ไม่ใช่เส้นทางที่คุณสามารถเรียกใช้ได้ในวันนี้ สิ่งที่เรื่องนี้หมายถึงต่อทั้งสองโปรเจกต์ไม่เหมือนกัน สัญญาอนุญาต Apache-2.0 ของ Laya พร้อมแท็กการใช้งานเชิงพาณิชย์หมายความว่าอุปสรรคอยู่ที่การแพ็กเกจเพียงอย่างเดียว — มันเป็นแพ็กเกจ Python ภายในเครื่องที่มีขนาดเล็ก ซึ่งเป็นสิ่งที่อาจให้บริการได้อย่างสมเหตุสมผล อุปสรรคของ Intern-Decision-4B ก็คือการแพ็กเกจเช่นกัน แต่เวต BF16 จำนวน 4.54B และเพดานการปฏิเสธที่ 8,192 โทเค็นของมันทำให้มันเป็นคอมโพเนนต์มากกว่าบริการ
จุดที่ OrcaRouter ช่วยได้จริงอยู่ที่อีกฟากหนึ่งของการตัดสินใจ หากปัญหาการตัดสินใจแบบมีโครงสร้างของคุณยังต้องมีขั้นตอนการให้เหตุผลอยู่ดี โมเดลทั่วไปที่ทำได้นั้นอยู่ในคีย์เดียวที่ครอบคลุมกว่า 200 โมเดลโดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยบวกเพิ่ม 0% และการสลับสำรองอัตโนมัติระหว่างผู้ให้บริการ — ดังนั้นโมเดลที่คุณจับคู่กับตัวให้คะแนนจึงอยู่ห่างออกไปเพียงปลายทางเดียว ไม่ใช่สัญญาอีกฉบับหนึ่ง
เวอร์ชันสั้น
สองโครงการนี้ได้ข้อสรุปเดียวกันเกี่ยวกับว่าการตัดสินใจควรทำอย่างไร แล้วหลังจากนั้นก็แตกต่างกันในแทบทุกเรื่องอื่น ๆ Laya วางเดิมพันว่า 421M พารามิเตอร์ การจัดเส้นทางภาษาอย่างรัดกุม และความซื่อสัตย์อย่างไม่ปรานีต่อข้อบกพร่องของตัวเอง จะทำให้โมเดลฐานที่เร็วกลายเป็นผู้เชี่ยวชาญเฉพาะทาง Intern-Decision-4B วางเดิมพันว่าพารามิเตอร์ที่มากกว่าสิบเท่า และสัญญาการให้คะแนนแบบโทเคนเดียวที่ออกแบบมาอย่างพิถีพิถัน จะทำให้ได้เอนจิน zero-shot ที่สมบูรณ์ การทดลองชี้ขาดคือการทดลองที่ทั้งสองยังไม่เคยทำต่อสาธารณะ: หยิบชุดการตัดสินใจที่มีคำตอบซึ่งคำนวณได้มา รันทั้งสอง แล้วตรวจดูว่าความน่าจะเป็นเหล่านั้นมีความหมายใด ๆ หรือไม่ Laya ได้เผยแพร่การทดลองนั้นเพียงครึ่งเดียว และแสดงให้เห็นว่ามันล้มเหลวตรงจุดใด Intern-Decision-4B ยังไม่ได้เผยแพร่มันเลยแม้แต่น้อย

