การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งอ่านว่า 'Intern-Decision-2B vs Laya' มีคำบรรยายใต้ภาพว่า '2.21B เทียบกับ 421M ทั้งคู่ไม่เขียนโทเค็น' พร้อมป้าย 'ตัวหนึ่งส่งแพ็กเกจ pip' และ 'อีกตัวหนึ่งส่งชุดรีโปรดักชัน' โดยมีโลโก้ OrcaRouter วางซ้อนอยู่ในมุม
Guides & Insights

Intern-Decision-2B vs Laya: 2.2 พันล้านพารามิเตอร์ กับ 421 ล้าน ทั้งคู่ปฏิเสธที่จะเขียนคำตอบ

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

internlm/Intern-Decision-2B และ convaiinnovations/laya เป็นสองโมเดลที่คล้ายกันที่สุดในกลุ่มเฉพาะเล็ก ๆ ของโมเดลสำหรับการตัดสินใจ และข้อเท็จจริงที่มีประโยชน์ที่สุดเกี่ยวกับการเปรียบเทียบนี้คือทั้งสองไปถึงจุดนั้นได้ด้วยเส้นทางที่ตรงกันข้าม เช็กพอยต์ขนาด 2,213,241,664 พารามิเตอร์ของ InternLM อ่านค่าลอจิตที่ตำแหน่งคงที่ก่อนตัวแทน (placeholder) และไม่เคยเรียก generate() เช็กพอยต์ขนาด 421 ล้านพารามิเตอร์ของ Convai ป้อนคำถามแบบมีชนิดข้อมูลไปยังหัวตัดสินใจ (decision head) ที่วางอยู่บนแบ็กโบน ModernBERT-large และคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วในการส่งผ่านไปข้างหน้าครั้งเดียว ทั้งสองไม่ได้เขียนโทเคนใด ๆ ทั้งคู่สัญญาว่าจะให้ความน่าจะเป็น ทั้งคู่จำกัดอินพุตไว้ที่ประมาณแปดพันโทเคน และตัวที่เล็กกว่านั้นเล็กกว่าห้าเท่าและได้รับความนิยมมากกว่าประมาณหนึ่งพันเท่า สิ่งที่แยกทั้งสองออกจากกันไม่ใช่ความสามารถมากนัก แต่เป็นการจัดแพ็กเกจ และช่องว่างด้านแพ็กเกจเป็นตัวกำหนดการซื้อสำหรับผู้อ่านส่วนใหญ่

Intern-Decision-2B ปรากฏบน Hugging Face เมื่อเวลา 05:36 UTC ของวันที่ 26 กันยายน 2026 เป็นขนาดกลางจากทั้งหมดสามขนาดที่ InternLM อัปโหลดภายในสี่สิบวินาทีโดยไม่มีการประกาศใด ๆ โดยผ่านการปรับแต่งละเอียดจาก Qwen/Qwen3.5-2B ภายใต้สัญญาอนุญาต Apache-2.0 Laya ถูกผลักขึ้นครั้งแรกเมื่อวันที่ 18 กันยายน 2026 และนับตั้งแต่นั้นก็สะสมไลก์ได้ราว 3,700 ไลก์ แพ็กเกจ pip เซิร์ฟเวอร์ HTTP ที่เข้ากันได้กับ Jev การผสานรวมกับ ONNX และ LangChain และโน้ตบุ๊กสำหรับการปรับแต่งละเอียด ความแตกต่างของระดับความสมบูรณ์แบบคือประเด็นของบทความนี้

ข้อสมมติฐานที่พวกเขาใช้ร่วมกัน และกลไกที่แตกต่างกัน

การ์ดทั้งสองให้เหตุผลว่า หากปัญหาของคุณคือการเลือกจากบรรดาคำตอบที่รู้อยู่แล้ว การสร้างข้อความร้อยเรียงก็เป็นปฏิบัติการที่ผิด ถ้อยคำของ Laya คือ “มันไม่เคยสร้างข้อความ ดังนั้นจึงไม่มีอะไรให้แยกวิเคราะห์ และไม่มีอะไรให้หลอน” ส่วนข้อโต้แย้งของ Intern-Decision-2B คือ API ของมัน “ทำการให้คะแนนตัวเลือกแบบมีโครงสร้าง โดยไม่เรียก generate() หรือสุ่มข้อความอิสระ”

กลไกคือจุดที่พวกมันแยกออกจากกัน

Laya เป็นตัวแยกประเภท เอนโคเดอร์ ModernBERT-large (395M, bidirectional, fully fine-tuned) ป้อนเข้าสู่ decision head ที่ฝึกจากศูนย์ — สองเลเยอร์ transformer, ตัวให้คะแนน option-marker และ head สำหรับ act/escalate — รวมทั้งหมด 421M ออปชันใช้ token budget คงที่ร่วมกัน (head_max_len, 192 โทเคนบน checkpoint ภาษาอังกฤษ, 256 บน multilingual) และเราเตอร์ตรวจจับสคริปต์และภาษาได้ในเวลาไม่ถึงครึ่งมิลลิวินาทีก่อนการประมวลผลรอบนั้น

Intern-Decision-2B เป็นโมเดลทำนายโทเคนถัดไปที่ถูกห้ามไม่ให้กลายเป็นตัวสร้าง มันจับคู่ตัวเลือกของแต่ละคำถามกับสัญลักษณ์แบบโทเคนเดี่ยว A–Z, a–z, 0–9; สร้างโครงร่าง JSON ของผู้ช่วยแบบเต็มโดยมีตัวยึดตำแหน่ง <decision> หนึ่งตัวต่อหนึ่งฟิลด์; รัน causal forward pass หนึ่งครั้ง; อ่าน logits ก่อนถึงตัวยึดตำแหน่งแต่ละตัวทันที; ทำ softmax เหนือสัญลักษณ์ที่ถูกต้องของฟิลด์นั้น; และใช้ค่า temperature ที่ปรับ拟合แล้วเท่ากับ 2.100509348278 ภายใต้เป็น Qwen3_5ForConditionalGeneration มาตรฐาน — 24 เลเยอร์, เลเยอร์ linear-attention สามชั้นต่อ full-attention หนึ่งชั้น, เลเยอร์ multi-token-prediction ที่คงไว้, เพดาน embedding ที่รองรับ 262,144 ตำแหน่ง — บวกกับ vision tower และ projector

ผลที่ตามมาในทางปฏิบัติของความแตกต่างนี้คือความจุต่อตัวเลือก งบประมาณแบบคงที่ต่อตัวเลือกของ Laya collapses เมื่อเจอพื้นที่ป้ายกำกับที่กว้าง เอกสารของตัวเองระบุว่าคำถามที่มี 77 ป้ายกำกับได้คะแนน 0.425 เทียบกับ TypeSafe Jev ที่ได้ 0.870 ในงานเดียวกัน เพราะ 77 ตัวเลือกได้รับโทเคนเพียงประมาณสามถึงสี่โทเคนต่อตัวเลือก ส่วน Intern-Decision-2B รองรับได้ถึง 62 ตัวเลือกต่อคำถาม และสูงสุดสิบหกคำถาม โดย 62 ไม่ใช่ความชอบส่วนตัว แต่เป็นจำนวนที่แน่นอนของสัญลักษณ์แบบโทเคนเดียวที่สัญญาของมันสามารถรองรับได้ ทั้งสองแบบไม่สบายใจเมื่อเกินหลักสิบตัวเลือก แต่รูปแบบของความล้มเหลวนั้นต่างกัน

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

สกอร์บอร์ด

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• พารามิเตอร์ — Intern-Decision-2B 2,213,241,664 ใน BF16 พร้อม vision tower และ projector ประมาณ 4.46 GB บนดิสก์; Laya 421M เป็นไฟล์ safetensors ขนาด 842 MB ไฟล์เดียว พร้อมเช็คพอยต์หลายภาษาขนาด 644 MB แยกต่างหาก

• เพดานอินพุต — 8,192 โทเค็นสำหรับทั้งสอง โดยทั้งคู่จะปฏิเสธแทนที่จะตัดทอน; โปรดทราบว่า 8,192 ของ Laya ใช้กับ laya-multilingual และต้องตั้งค่า max_len=8192 เนื่องจากค่าเริ่มต้นที่จัดส่งมาคือ 1,024

• รูปภาพ — สูงสุดแปดรูปสำหรับ Intern-Decision-2B นับรวมในงบโทเค็นเดียวกัน ไม่มีเส้นทางมัลติโมดัลสำหรับ Laya

• ความเร็ว — ค่าเฉลี่ย 33.28 ms, P50 33.15 ms, P95 33.55 ms ต่อคำขอ บน RTX 4090 หนึ่งการ์ด สำหรับ Intern-Decision-2B; Laya รายงานว่าประมาณ 33 ms ต่อคำขอ และ 103–332 คำถามต่อวินาทีเมื่อประมวลผลเป็นชุดบน T4 ตัวเดียว

• ภาษา — Intern-Decision-2B ไม่มีข้ออ้างเรื่องหลายภาษาเลย; Laya จัดเส้นทางครอบคลุมกว่า 100 ภาษา โดยรายงานว่า 45 จาก 51 ภาษาที่ใช้ทดสอบ benchmark สามารถใช้งานได้ดีกว่าการสุ่มเกินสามเท่า และได้ 0.451 บน MASSIVE intent ในสิบสามภาษาที่ไม่ใช่ภาษาอังกฤษ เทียบกับ 0.306 สำหรับ checkpoint ภาษาอังกฤษเท่านั้นของตน

• ความแม่นยำแบบ zero-shot — Intern-Decision-2B ทำได้ 84.68 โดยเฉลี่ยจากชุดทดสอบของผู้ขายเจ็ดชุด โดยมี Brier 0.437 และ ECE 0.100 ซึ่งทั้งหมดยังไม่ถูกทำซ้ำให้ยืนยันได้; checkpoint ภาษาอังกฤษฐานของ Laya ทำได้ 0.362 บน benchmark typed-decisions จำนวน 2,000 การตัดสินใจ ซึ่งการ์ดของโมเดลเองระบุว่าต่ำกว่าเส้น majority-class ที่ 0.461

• การแพ็กเกจ — จุดตรวจสอบ (checkpoint), ไฟล์ inference.py และที่เก็บ GitHub สาธารณะที่เพิ่งเปิดใหม่พร้อมโค้ดสำหรับการฝึกและการประเมินผล เทียบกับ pip install laya, เซิร์ฟเวอร์ HTTP ที่เข้ากันได้กับ Jev, เส้นทางเร็วของ ONNX Runtime และ TileLang, การผสานรวมกับ MCP และ LangChain และโน้ตบุ๊ก fine-tuning ที่รันบน GPU ระดับฟรี

การเปรียบเทียบที่เป็นธรรมที่สุดไม่ใช่การเปรียบเทียบที่สเปกชีตกำหนดขึ้น

การวาง 84.68 ไว้ข้าง ๆ 0.362 นั้นแทบจะเข้าข่ายไม่ซื่อสัตย์ และควรค่าแก่การอธิบายว่าทำไม แทนที่จะปล่อยให้ตัวเลขนั้นพูดแทนตัวเอง

ค่า 0.362 ของ Laya เป็นเช็คพอยต์ฐานที่วัดแบบ zero-shot บนเบนช์มาร์กที่มันไม่ได้ถูกปรับแต่งมาเพื่อ การ์ดของมันเองสรุปไว้อย่างชัดเจนว่า "Laya เป็นฐานที่เร็วสำหรับการปรับให้เชี่ยวชาญเฉพาะทาง ไม่ใช่เครื่องยนต์ตัดสินใจแบบ zero-shot" เมื่อปรับแต่งบนชุดฝึกของเบนช์มาร์กนั้นเอง มันทำได้ 0.766 ทะลุเพดานครูที่ 0.735 และเอาชนะ 0.727 ที่เผยแพร่ของ TypeSafe Jev บนการตัดสินใจชุดเดียวกัน ขณะที่ 84.68 ของ Intern-Decision-2B เป็นค่าเฉลี่ยจากเจ็ดชุดของผู้ขาย ซึ่งชุดทดสอบไม่ใช่ชุดเดียวกับที่ Laya อ้างอิง ผลิตโดยแล็บที่สร้างโมเดลนี้ โดยไม่มีบุคคลที่สามรายใดรันมันเลย — เช็คพอยต์มีหนึ่งไลก์และศูนย์ดาวน์โหลด การนำผลลัพธ์ที่ปรับแต่งแล้วไปเทียบกับผลลัพธ์แบบ zero-shot หรือนำค่าเฉลี่ยของผู้ขายไปเทียบกับบอร์ดอิสระ ไม่ถือเป็นการเปรียบเทียบ มันคือการวัดสองอย่างที่ต่างกันซึ่งใช้แบบตัวอักษรร่วมกัน

สิ่งที่เทียบกันได้จริง ๆ คือ ทั้งคู่มีขนาดเล็ก ทั้งคู่มีต้นทุนการรันต่ำ และทั้งคู่ไม่สามารถไฟน์จูนให้เข้ากับโดเมนของคุณได้ รีพอซิทอรีที่ InternLM เผยแพร่เมื่อเช้านี้ทำให้ส่วนหลังนี้ง่ายขึ้นอย่างมีนัยสำคัญเมื่อเทียบกับเมื่อวาน เพราะมันมาพร้อมกับตัวเรียกใช้การฝึก ออบเจกทีฟแบบ masked-next-token ชุดข้อมูลที่ผ่านการตรวจสอบด้วยแฮชซึ่งประกอบด้วยแถวทดสอบ 10,751 แถวจากเจ็ดชุดทดสอบ และสคริปต์การปรับค่าอุณหภูมิและรีเพลย์ แล็บที่เผยแพร่ตัวสร้างการคาลิเบรตแบบดีเทอร์มินิสติก และยืนยันว่าการรีเพลย์ไม่เปลี่ยนการตัดสินใจแม้แต่รายการเดียว กำลังเชิญชวนการปรับตัวแบบที่การ์ดของ Laya แนะนำไว้พอดี

คุณจะเรียกอันใดอันหนึ่งจริง ๆ ว่าอย่างไร

ทั้งสองโมเดลไม่ได้อยู่บน OrcaRouter หน้าโมเดลของ OrcaRouter สำหรับ Intern-Decision-2B ส่งคืน 404 และไม่มีเส้นทางของ Laya เช่นกัน ไม่มีสิ่งใดในนี้เป็นการอ้างว่ามีให้ใช้งาน Intern-Decision-2B หมายถึงการดาวน์โหลด checkpoint และรันเอนจินที่บันเดิลมาให้บน GPU ของคุณเอง Laya หมายถึง pip install laya และหากคุณต้องการอินเทอร์เฟซที่เข้ากันได้กับ Jev ก็ให้ใช้ laya-serve บน POST /v1/systemone

คำถามในแบบฉบับ Orchestrator ที่ซ่อนอยู่เบื้องหลังก็คือ คุณต้องการพื้นผิวการปฏิบัติการที่สองสำหรับ scorer หรือไม่ Laya ถูกออกแบบมาให้ฝังตัวได้ — รูปร่างของ request และ response เหมือนกับ TypeSafe Jev ทุกประการ ไคลเอนต์ที่มีอยู่เดิมจึงเพียงเปลี่ยน base URL เท่านั้น ไม่ต้องแก้อย่างอื่น Intern-Decision-2B ถูกออกแบบมาให้ทำซ้ำได้ และในปัจจุบันต้องใช้เวลางานเตรียมสภาพแวดล้อมราวหนึ่งวันก่อนที่การตัดสินใจครั้งแรกจะส่งผลกลับมา หากการตัดสินใจแบบ closed-set ที่คุณกำลังทำอยู่มีรูปร่างใกล้เคียงกับตัวใดตัวหนึ่งในสองตัวนี้ ทางเลือกแบบโฮสต์ที่การ์ดทั้งสองใบวัด benchmark เทียบด้วยก็คือ TypeSafe Jev 1.13 ซึ่งมีเส้นทางให้ใช้จริง: $0.042 ต่อล้าน input token, context 65K และ P50 time-to-first-token ที่ 178 ms เข้าถึงได้ด้วยคีย์เดียวกับโมเดลอื่นอีกกว่า 200 ตัว โดย ราคาตามรายการของผู้ให้บริการส่งผ่านด้วยมาร์กอัป 0%.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

จุดที่แต่ละอันชนะ

Laya ชนะในทุกด้านของการดำเนินงาน แพ็กเกจ pip เทียบกับการดาวน์โหลดเช็กพอยต์ เราเตอร์ที่รองรับกว่าหนึ่งร้อยภาษาเทียบกับอีกฝ่ายที่ไม่มีการอ้างความสามารถหลายภาษา อัตราส่งผ่านแบบเป็นชุดที่วัดได้หลายร้อยคำถามต่อวินาทีเทียบกับตัวเลขต่อคำขอที่ไม่มีแนวทางเรื่องการประมวลผลเป็นชุด สองปีของความแข็งแกร่งของระบบนิเวศ — ONNX, TileLang, LangChain, MCP — เทียบกับรีโพซิทอรีที่เปิดสาธารณะได้เพียงสองชั่วโมง

Intern-Decision-2B ชนะในสามเรื่องที่จำเพาะ มันรับภาพได้ ซึ่ง Laya ไม่ทำ มันไม่มีภาระหนี้จากการปรับแต่งละเอียด: 84.68 ของมันเป็นคำกล่าวอ้างจากผู้ขายแบบ zero-shot ในขณะที่ 0.766 ที่เป็นจุดเด่นของ Laya นั้นเป็นของ checkpoint ที่ปรับแต่งละเอียดบนส่วนข้อมูลฝึกของ benchmark เอง และมันมีเอกสารประกอบพร้อมชุดทำซ้ำ — ชุดประเมินที่ตรวจสอบได้และสแต็กการฝึกแบบสาธารณะ — ซึ่งมีค่ามากกว่าการมีชื่อบน leaderboard สำหรับใครก็ตามที่ต้องอธิบายโมเดลให้คนอื่นฟัง

การเสมอกันคือสมมติฐานตั้งต้น ทั้งคู่ไม่ยอมสร้างข้อความ ทั้งคู่ให้ค่าความน่าจะเป็นที่คุณตั้งเกณฑ์ตัดได้ และทั้งคู่ยังอยู่ต่ำกว่าความยาวอินพุตที่เอกสารจริงส่วนใหญ่อยู่ ถ้าสถานะของคุณคือตั๋ว อีเมล หรือแบบฟอร์ม ตัวไหนก็ใช้ได้ และ Laya จะพาคุณไปถึงจุดนั้นได้เร็วกว่า ถ้าสถานะของคุณมีภาพหน้าจอแนบมา หรือองค์กรของคุณต้องการให้การทำซ้ำนั้นตรวจสอบย้อนหลังได้ checkpoint กลางของ InternLM คือตัวที่ตอบข้อโต้แย้งเฉพาะเจาะจงนั้น และจากตัวเลขของ InternLM เอง มันเป็นตัวที่ปรับเทียบได้แย่ที่สุดในสามพี่น้องของมัน โดยมี ECE 0.100 เทียบกับ 0.066 และ 0.065 ดังนั้นจงปรับ temperature ของคุณเองก่อนที่จะเชื่อความมั่นใจที่มันรายงาน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube