
Intern-Decision-2B vs Laya: 2.2 พันล้านพารามิเตอร์ กับ 421 ล้าน ทั้งคู่ปฏิเสธที่จะเขียนคำตอบ
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 584 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
internlm/Intern-Decision-2B และ convaiinnovations/laya เป็นสองโมเดลที่คล้ายกันที่สุดในกลุ่มเฉพาะเล็ก ๆ ของโมเดลสำหรับการตัดสินใจ และข้อเท็จจริงที่มีประโยชน์ที่สุดเกี่ยวกับการเปรียบเทียบนี้คือทั้งสองไปถึงจุดนั้นได้ด้วยเส้นทางที่ตรงกันข้าม เช็กพอยต์ขนาด 2,213,241,664 พารามิเตอร์ของ InternLM อ่านค่าลอจิตที่ตำแหน่งคงที่ก่อนตัวแทน (placeholder) และไม่เคยเรียก generate() เช็กพอยต์ขนาด 421 ล้านพารามิเตอร์ของ Convai ป้อนคำถามแบบมีชนิดข้อมูลไปยังหัวตัดสินใจ (decision head) ที่วางอยู่บนแบ็กโบน ModernBERT-large และคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วในการส่งผ่านไปข้างหน้าครั้งเดียว ทั้งสองไม่ได้เขียนโทเคนใด ๆ ทั้งคู่สัญญาว่าจะให้ความน่าจะเป็น ทั้งคู่จำกัดอินพุตไว้ที่ประมาณแปดพันโทเคน และตัวที่เล็กกว่านั้นเล็กกว่าห้าเท่าและได้รับความนิยมมากกว่าประมาณหนึ่งพันเท่า สิ่งที่แยกทั้งสองออกจากกันไม่ใช่ความสามารถมากนัก แต่เป็นการจัดแพ็กเกจ และช่องว่างด้านแพ็กเกจเป็นตัวกำหนดการซื้อสำหรับผู้อ่านส่วนใหญ่
Intern-Decision-2B ปรากฏบน Hugging Face เมื่อเวลา 05:36 UTC ของวันที่ 26 กันยายน 2026 เป็นขนาดกลางจากทั้งหมดสามขนาดที่ InternLM อัปโหลดภายในสี่สิบวินาทีโดยไม่มีการประกาศใด ๆ โดยผ่านการปรับแต่งละเอียดจาก Qwen/Qwen3.5-2B ภายใต้สัญญาอนุญาต Apache-2.0 Laya ถูกผลักขึ้นครั้งแรกเมื่อวันที่ 18 กันยายน 2026 และนับตั้งแต่นั้นก็สะสมไลก์ได้ราว 3,700 ไลก์ แพ็กเกจ pip เซิร์ฟเวอร์ HTTP ที่เข้ากันได้กับ Jev การผสานรวมกับ ONNX และ LangChain และโน้ตบุ๊กสำหรับการปรับแต่งละเอียด ความแตกต่างของระดับความสมบูรณ์แบบคือประเด็นของบทความนี้
ข้อสมมติฐานที่พวกเขาใช้ร่วมกัน และกลไกที่แตกต่างกัน
การ์ดทั้งสองให้เหตุผลว่า หากปัญหาของคุณคือการเลือกจากบรรดาคำตอบที่รู้อยู่แล้ว การสร้างข้อความร้อยเรียงก็เป็นปฏิบัติการที่ผิด ถ้อยคำของ Laya คือ “มันไม่เคยสร้างข้อความ ดังนั้นจึงไม่มีอะไรให้แยกวิเคราะห์ และไม่มีอะไรให้หลอน” ส่วนข้อโต้แย้งของ Intern-Decision-2B คือ API ของมัน “ทำการให้คะแนนตัวเลือกแบบมีโครงสร้าง โดยไม่เรียก generate() หรือสุ่มข้อความอิสระ”
กลไกคือจุดที่พวกมันแยกออกจากกัน
Laya เป็นตัวแยกประเภท เอนโคเดอร์ ModernBERT-large (395M, bidirectional, fully fine-tuned) ป้อนเข้าสู่ decision head ที่ฝึกจากศูนย์ — สองเลเยอร์ transformer, ตัวให้คะแนน option-marker และ head สำหรับ act/escalate — รวมทั้งหมด 421M ออปชันใช้ token budget คงที่ร่วมกัน (head_max_len, 192 โทเคนบน checkpoint ภาษาอังกฤษ, 256 บน multilingual) และเราเตอร์ตรวจจับสคริปต์และภาษาได้ในเวลาไม่ถึงครึ่งมิลลิวินาทีก่อนการประมวลผลรอบนั้น
Intern-Decision-2B เป็นโมเดลทำนายโทเคนถัดไปที่ถูกห้ามไม่ให้กลายเป็นตัวสร้าง มันจับคู่ตัวเลือกของแต่ละคำถามกับสัญลักษณ์แบบโทเคนเดี่ยว A–Z, a–z, 0–9; สร้างโครงร่าง JSON ของผู้ช่วยแบบเต็มโดยมีตัวยึดตำแหน่ง <decision> หนึ่งตัวต่อหนึ่งฟิลด์; รัน causal forward pass หนึ่งครั้ง; อ่าน logits ก่อนถึงตัวยึดตำแหน่งแต่ละตัวทันที; ทำ softmax เหนือสัญลักษณ์ที่ถูกต้องของฟิลด์นั้น; และใช้ค่า temperature ที่ปรับ拟合แล้วเท่ากับ 2.100509348278 ภายใต้เป็น Qwen3_5ForConditionalGeneration มาตรฐาน — 24 เลเยอร์, เลเยอร์ linear-attention สามชั้นต่อ full-attention หนึ่งชั้น, เลเยอร์ multi-token-prediction ที่คงไว้, เพดาน embedding ที่รองรับ 262,144 ตำแหน่ง — บวกกับ vision tower และ projector
ผลที่ตามมาในทางปฏิบัติของความแตกต่างนี้คือความจุต่อตัวเลือก งบประมาณแบบคงที่ต่อตัวเลือกของ Laya collapses เมื่อเจอพื้นที่ป้ายกำกับที่กว้าง เอกสารของตัวเองระบุว่าคำถามที่มี 77 ป้ายกำกับได้คะแนน 0.425 เทียบกับ TypeSafe Jev ที่ได้ 0.870 ในงานเดียวกัน เพราะ 77 ตัวเลือกได้รับโทเคนเพียงประมาณสามถึงสี่โทเคนต่อตัวเลือก ส่วน Intern-Decision-2B รองรับได้ถึง 62 ตัวเลือกต่อคำถาม และสูงสุดสิบหกคำถาม โดย 62 ไม่ใช่ความชอบส่วนตัว แต่เป็นจำนวนที่แน่นอนของสัญลักษณ์แบบโทเคนเดียวที่สัญญาของมันสามารถรองรับได้ ทั้งสองแบบไม่สบายใจเมื่อเกินหลักสิบตัวเลือก แต่รูปแบบของความล้มเหลวนั้นต่างกัน

สกอร์บอร์ด

• พารามิเตอร์ — Intern-Decision-2B 2,213,241,664 ใน BF16 พร้อม vision tower และ projector ประมาณ 4.46 GB บนดิสก์; Laya 421M เป็นไฟล์ safetensors ขนาด 842 MB ไฟล์เดียว พร้อมเช็คพอยต์หลายภาษาขนาด 644 MB แยกต่างหาก
• เพดานอินพุต — 8,192 โทเค็นสำหรับทั้งสอง โดยทั้งคู่จะปฏิเสธแทนที่จะตัดทอน; โปรดทราบว่า 8,192 ของ Laya ใช้กับ laya-multilingual และต้องตั้งค่า max_len=8192 เนื่องจากค่าเริ่มต้นที่จัดส่งมาคือ 1,024
• รูปภาพ — สูงสุดแปดรูปสำหรับ Intern-Decision-2B นับรวมในงบโทเค็นเดียวกัน ไม่มีเส้นทางมัลติโมดัลสำหรับ Laya
• ความเร็ว — ค่าเฉลี่ย 33.28 ms, P50 33.15 ms, P95 33.55 ms ต่อคำขอ บน RTX 4090 หนึ่งการ์ด สำหรับ Intern-Decision-2B; Laya รายงานว่าประมาณ 33 ms ต่อคำขอ และ 103–332 คำถามต่อวินาทีเมื่อประมวลผลเป็นชุดบน T4 ตัวเดียว
• ภาษา — Intern-Decision-2B ไม่มีข้ออ้างเรื่องหลายภาษาเลย; Laya จัดเส้นทางครอบคลุมกว่า 100 ภาษา โดยรายงานว่า 45 จาก 51 ภาษาที่ใช้ทดสอบ benchmark สามารถใช้งานได้ดีกว่าการสุ่มเกินสามเท่า และได้ 0.451 บน MASSIVE intent ในสิบสามภาษาที่ไม่ใช่ภาษาอังกฤษ เทียบกับ 0.306 สำหรับ checkpoint ภาษาอังกฤษเท่านั้นของตน
• ความแม่นยำแบบ zero-shot — Intern-Decision-2B ทำได้ 84.68 โดยเฉลี่ยจากชุดทดสอบของผู้ขายเจ็ดชุด โดยมี Brier 0.437 และ ECE 0.100 ซึ่งทั้งหมดยังไม่ถูกทำซ้ำให้ยืนยันได้; checkpoint ภาษาอังกฤษฐานของ Laya ทำได้ 0.362 บน benchmark typed-decisions จำนวน 2,000 การตัดสินใจ ซึ่งการ์ดของโมเดลเองระบุว่าต่ำกว่าเส้น majority-class ที่ 0.461
• การแพ็กเกจ — จุดตรวจสอบ (checkpoint), ไฟล์ inference.py และที่เก็บ GitHub สาธารณะที่เพิ่งเปิดใหม่พร้อมโค้ดสำหรับการฝึกและการประเมินผล เทียบกับ pip install laya, เซิร์ฟเวอร์ HTTP ที่เข้ากันได้กับ Jev, เส้นทางเร็วของ ONNX Runtime และ TileLang, การผสานรวมกับ MCP และ LangChain และโน้ตบุ๊ก fine-tuning ที่รันบน GPU ระดับฟรี
การเปรียบเทียบที่เป็นธรรมที่สุดไม่ใช่การเปรียบเทียบที่สเปกชีตกำหนดขึ้น
การวาง 84.68 ไว้ข้าง ๆ 0.362 นั้นแทบจะเข้าข่ายไม่ซื่อสัตย์ และควรค่าแก่การอธิบายว่าทำไม แทนที่จะปล่อยให้ตัวเลขนั้นพูดแทนตัวเอง
ค่า 0.362 ของ Laya เป็นเช็คพอยต์ฐานที่วัดแบบ zero-shot บนเบนช์มาร์กที่มันไม่ได้ถูกปรับแต่งมาเพื่อ การ์ดของมันเองสรุปไว้อย่างชัดเจนว่า "Laya เป็นฐานที่เร็วสำหรับการปรับให้เชี่ยวชาญเฉพาะทาง ไม่ใช่เครื่องยนต์ตัดสินใจแบบ zero-shot" เมื่อปรับแต่งบนชุดฝึกของเบนช์มาร์กนั้นเอง มันทำได้ 0.766 ทะลุเพดานครูที่ 0.735 และเอาชนะ 0.727 ที่เผยแพร่ของ TypeSafe Jev บนการตัดสินใจชุดเดียวกัน ขณะที่ 84.68 ของ Intern-Decision-2B เป็นค่าเฉลี่ยจากเจ็ดชุดของผู้ขาย ซึ่งชุดทดสอบไม่ใช่ชุดเดียวกับที่ Laya อ้างอิง ผลิตโดยแล็บที่สร้างโมเดลนี้ โดยไม่มีบุคคลที่สามรายใดรันมันเลย — เช็คพอยต์มีหนึ่งไลก์และศูนย์ดาวน์โหลด การนำผลลัพธ์ที่ปรับแต่งแล้วไปเทียบกับผลลัพธ์แบบ zero-shot หรือนำค่าเฉลี่ยของผู้ขายไปเทียบกับบอร์ดอิสระ ไม่ถือเป็นการเปรียบเทียบ มันคือการวัดสองอย่างที่ต่างกันซึ่งใช้แบบตัวอักษรร่วมกัน
สิ่งที่เทียบกันได้จริง ๆ คือ ทั้งคู่มีขนาดเล็ก ทั้งคู่มีต้นทุนการรันต่ำ และทั้งคู่ไม่สามารถไฟน์จูนให้เข้ากับโดเมนของคุณได้ รีพอซิทอรีที่ InternLM เผยแพร่เมื่อเช้านี้ทำให้ส่วนหลังนี้ง่ายขึ้นอย่างมีนัยสำคัญเมื่อเทียบกับเมื่อวาน เพราะมันมาพร้อมกับตัวเรียกใช้การฝึก ออบเจกทีฟแบบ masked-next-token ชุดข้อมูลที่ผ่านการตรวจสอบด้วยแฮชซึ่งประกอบด้วยแถวทดสอบ 10,751 แถวจากเจ็ดชุดทดสอบ และสคริปต์การปรับค่าอุณหภูมิและรีเพลย์ แล็บที่เผยแพร่ตัวสร้างการคาลิเบรตแบบดีเทอร์มินิสติก และยืนยันว่าการรีเพลย์ไม่เปลี่ยนการตัดสินใจแม้แต่รายการเดียว กำลังเชิญชวนการปรับตัวแบบที่การ์ดของ Laya แนะนำไว้พอดี
คุณจะเรียกอันใดอันหนึ่งจริง ๆ ว่าอย่างไร
ทั้งสองโมเดลไม่ได้อยู่บน OrcaRouter หน้าโมเดลของ OrcaRouter สำหรับ Intern-Decision-2B ส่งคืน 404 และไม่มีเส้นทางของ Laya เช่นกัน ไม่มีสิ่งใดในนี้เป็นการอ้างว่ามีให้ใช้งาน Intern-Decision-2B หมายถึงการดาวน์โหลด checkpoint และรันเอนจินที่บันเดิลมาให้บน GPU ของคุณเอง Laya หมายถึง pip install laya และหากคุณต้องการอินเทอร์เฟซที่เข้ากันได้กับ Jev ก็ให้ใช้ laya-serve บน POST /v1/systemone
คำถามในแบบฉบับ Orchestrator ที่ซ่อนอยู่เบื้องหลังก็คือ คุณต้องการพื้นผิวการปฏิบัติการที่สองสำหรับ scorer หรือไม่ Laya ถูกออกแบบมาให้ฝังตัวได้ — รูปร่างของ request และ response เหมือนกับ TypeSafe Jev ทุกประการ ไคลเอนต์ที่มีอยู่เดิมจึงเพียงเปลี่ยน base URL เท่านั้น ไม่ต้องแก้อย่างอื่น Intern-Decision-2B ถูกออกแบบมาให้ทำซ้ำได้ และในปัจจุบันต้องใช้เวลางานเตรียมสภาพแวดล้อมราวหนึ่งวันก่อนที่การตัดสินใจครั้งแรกจะส่งผลกลับมา หากการตัดสินใจแบบ closed-set ที่คุณกำลังทำอยู่มีรูปร่างใกล้เคียงกับตัวใดตัวหนึ่งในสองตัวนี้ ทางเลือกแบบโฮสต์ที่การ์ดทั้งสองใบวัด benchmark เทียบด้วยก็คือ TypeSafe Jev 1.13 ซึ่งมีเส้นทางให้ใช้จริง: $0.042 ต่อล้าน input token, context 65K และ P50 time-to-first-token ที่ 178 ms เข้าถึงได้ด้วยคีย์เดียวกับโมเดลอื่นอีกกว่า 200 ตัว โดย ราคาตามรายการของผู้ให้บริการส่งผ่านด้วยมาร์กอัป 0%.

จุดที่แต่ละอันชนะ
Laya ชนะในทุกด้านของการดำเนินงาน แพ็กเกจ pip เทียบกับการดาวน์โหลดเช็กพอยต์ เราเตอร์ที่รองรับกว่าหนึ่งร้อยภาษาเทียบกับอีกฝ่ายที่ไม่มีการอ้างความสามารถหลายภาษา อัตราส่งผ่านแบบเป็นชุดที่วัดได้หลายร้อยคำถามต่อวินาทีเทียบกับตัวเลขต่อคำขอที่ไม่มีแนวทางเรื่องการประมวลผลเป็นชุด สองปีของความแข็งแกร่งของระบบนิเวศ — ONNX, TileLang, LangChain, MCP — เทียบกับรีโพซิทอรีที่เปิดสาธารณะได้เพียงสองชั่วโมง
Intern-Decision-2B ชนะในสามเรื่องที่จำเพาะ มันรับภาพได้ ซึ่ง Laya ไม่ทำ มันไม่มีภาระหนี้จากการปรับแต่งละเอียด: 84.68 ของมันเป็นคำกล่าวอ้างจากผู้ขายแบบ zero-shot ในขณะที่ 0.766 ที่เป็นจุดเด่นของ Laya นั้นเป็นของ checkpoint ที่ปรับแต่งละเอียดบนส่วนข้อมูลฝึกของ benchmark เอง และมันมีเอกสารประกอบพร้อมชุดทำซ้ำ — ชุดประเมินที่ตรวจสอบได้และสแต็กการฝึกแบบสาธารณะ — ซึ่งมีค่ามากกว่าการมีชื่อบน leaderboard สำหรับใครก็ตามที่ต้องอธิบายโมเดลให้คนอื่นฟัง
การเสมอกันคือสมมติฐานตั้งต้น ทั้งคู่ไม่ยอมสร้างข้อความ ทั้งคู่ให้ค่าความน่าจะเป็นที่คุณตั้งเกณฑ์ตัดได้ และทั้งคู่ยังอยู่ต่ำกว่าความยาวอินพุตที่เอกสารจริงส่วนใหญ่อยู่ ถ้าสถานะของคุณคือตั๋ว อีเมล หรือแบบฟอร์ม ตัวไหนก็ใช้ได้ และ Laya จะพาคุณไปถึงจุดนั้นได้เร็วกว่า ถ้าสถานะของคุณมีภาพหน้าจอแนบมา หรือองค์กรของคุณต้องการให้การทำซ้ำนั้นตรวจสอบย้อนหลังได้ checkpoint กลางของ InternLM คือตัวที่ตอบข้อโต้แย้งเฉพาะเจาะจงนั้น และจากตัวเลขของ InternLM เอง มันเป็นตัวที่ปรับเทียบได้แย่ที่สุดในสามพี่น้องของมัน โดยมี ECE 0.100 เทียบกับ 0.066 และ 0.065 ดังนั้นจงปรับ temperature ของคุณเองก่อนที่จะเชื่อความมั่นใจที่มันรายงาน
