สร้างการ์ดชื่อเรื่องสำหรับ RSI-Jev vs Laya ที่มีข้อความว่า 'โมเดลการตัดสินใจแบบเปิดสองแบบ เดิมพันที่ตรงข้ามกัน' โดยการ์ดด้านซ้ายมีป้ายกำกับว่า 'RSI-Jev v6.1-VL' พร้อมไอคอน brain-cog และข้อความ '4.69B พารามิเตอร์, zero-shot' การ์ดด้านขวามีป้ายกำกับว่า 'Laya' พร้อมไอคอน feather และข้อความ '421M พารามิเตอร์, ปรับจูนมัน' มีเส้นแบ่งแนวตั้งแบบบางระหว่างการ์ดทั้งสอง และคำบรรยายว่า 'ทั้งคู่เป็น Apache-2.0 ไม่มีตัวไหนถูกโฮสต์ให้คุณ' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

RSI-Jev vs Laya: โมเดลการตัดสินใจแบบเปิดสองแบบ เดิมพันที่สวนทางกัน

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.

เดิมพันแรกเกี่ยวกับขนาด เช็คพอยต์ภาษาอังกฤษของ Laya คือ ModernBERT-large ที่ 421M พารามิเตอร์พร้อมบริบท 512 โทเคน และเช็คพอยต์หลายภาษาของมันคือ mmBERT-base ที่ 322M พร้อมหน้าต่าง 1,024 โทเคนที่ไปถึง 8,192 เมื่อตั้งค่าเอนโคเดอร์แบบกว้าง RSI-Jev v6.1-VL รัน tower Qwen3.5-4B-Base ทั้งตัว — 4.69B พารามิเตอร์ โดย 3.57B อยู่ใน 32 เลเยอร์ถอดรหัส บวกกับ vision tower และ decision head สามตัวที่เลเยอร์ 16, 20 และ 32 Laya เป็นโมเดลที่คุณสามารถโหลดล่วงหน้าได้สามตัวในไม่กี่กิกะไบต์; RSI-Jev เป็นเช็คพอยต์ bf16 ขนาด 9.7 GB เดิมพันที่สองต่อเนื่องจากเดิมพันแรก: Laya แทบไม่ใช้ทรัพยากรเลยต่อการเรียกใช้ และคาดหวังให้คุณสอนโดเมนของคุณให้มัน ในขณะที่ RSI-Jev ใช้พารามิเตอร์ 4.5 พันล้านตัวเพื่อพยายามตอบคำถามของคุณโดยไม่ต้องฝึกฝนใดๆ เลย

แต่ละอย่างจริงๆ แล้วใช้ทำอะไร

การ์ดโมเดลของ Laya เองมีประโยคที่อธิบายการเปรียบเทียบนี้ได้ดีกว่านักวิจารณ์คนใดจะทำได้: "Laya เป็นฐานที่ปรับแต่งเฉพาะทางได้อย่างรวดเร็ว ไม่ใช่เครื่องยนต์ตัดสินใจแบบ zero-shot" บนเบนช์มาร์ก typed-decisions ซึ่งมี 2,000 การตัดสินใจในสี่เวิร์กโฟลว์ checkpoint ภาษาอังกฤษแบบ base ได้คะแนน 0.362 เทียบกับ 0.318 สำหรับการเดาแบบสุ่ม และ 0.461 สำหรับการเลือกคลาสส่วนใหญ่เสมอ บนการตัดสินใจชุดเดียวกัน checkpoint ที่ Convai ไฟน์จูนบนชุดฝึกของเบนช์มาร์กนั้นเองได้คะแนน 0.766 ซึ่งทะลุเพดานความสอดคล้องกับครูที่ 0.735 ช่องว่างนั้นคือตัวผลิตภัณฑ์: Laya เป็นเอนโคเดอร์ขนาด 421M ที่คุณไฟน์จูนบนอนุกรมวิธานแคบ ๆ และ Convai มาพร้อมโน้ตบุ๊ก Kaggle ที่รันวงจรทั้งหมด ตั้งแต่สร้างชุดข้อมูล ฝึก ฟิตอุณหภูมิการคาลิเบรต ประเมินผล บน T4 ฟรีสองตัว

RSI-Jev เป็นอีกหนึ่งดีล รีลีส v6.1-VL ของมันได้คะแนน 50.98 บน Decision Index 0.3 สาธารณะของตัวเอง ซึ่งเป็นการรัน 140,178 คำขอด้วยการกำหนดค่าเริ่มต้น และบนกระดานของโปรเจกต์ ณ วันที่ 2026-10-06 นั้นเสมอกับโมเดล 4B ที่ดีที่สุดบนกระดานนั้น และอยู่ในอันดับที่ 27 จาก 113 โดยรวม ชุดเบนช์มาร์กสิบห้ารายการของมันได้ 0.793 และชุดที่กันไว้ (held-out set) ได้ 0.729 นี่เป็นตัวเลข zero-shot — แม้ว่าทางโปรเจกต์จะระบุอย่างรอบคอบว่า สิบจากสิบห้าเบนช์มาร์กมีส่วนสนับสนุนข้อมูลการฝึกในรูปแบบใดรูปแบบหนึ่ง ดังนั้น "zero-shot" จึงใช้กับการค้นหาของรีลีสนี้ ไม่ใช่กับทุกตัวเลขบนหน้านั้น สิ่งที่ตัวเลขเหล่านี้ให้คุณได้จริง ๆ คือโมเดลที่ตอบคำถามเกี่ยวกับเอกสารที่คุณไม่เคยให้มันดู และไม่จำเป็นต้องรันฝึกก่อน

• ขนาด — Laya 421M ภาษาอังกฤษ / 322M หลายภาษา เทียบกับ RSI-Jev 4.69B โดยรันทั้งทาวเวอร์ Qwen3.5-4B-Base

• ความแม่นยำแบบ zero-shot — Laya 0.362 บน typed-decisions ซึ่งต่ำกว่า baseline เสียงข้างมากที่ 0.461 เมื่อเทียบกับ RSI-Jev 50.98 บน Decision Index 0.3 ของตัวเอง และเทียบเท่ากับรายการ 4B ที่ดีที่สุดในหมวดนั้น

• ความแม่นยำหลังการปรับละเอียด — Laya 0.766 ด้วยเช็กพอยต์ที่ฝึกบนชุดแบ่งของเบนช์มาร์กเอง เทียบกับตัวเลขของ RSI-Jev ซึ่งเป็นระดับการเปิดตัว ไม่ใช่ระดับต่อโดเมน

• ภาษา — Laya ใช้ได้ 45 จาก 51 ภาษา สูงกว่าการสุ่มถึงสามเท่าสำหรับการจัดเส้นทางฝั่งเซิร์ฟเวอร์ เมื่อเทียบกับข้อความที่เน้นภาษาอังกฤษของ RSI-Jev

• โมดัลิตี — Laya ข้อความเท่านั้น เทียบกับ RSI-Jev ข้อความพร้อมรูปภาพสูงสุดสี่รูปต่อคำขอ

• บริบท — Laya 512 โทเค็นสำหรับภาษาอังกฤษ, 1,024 สำหรับหลายภาษา และสูงสุด 8,192 สำหรับเอกสารยาว เทียบกับ RSI-Jev 32,768 โทเค็น โดยปฏิเสธแทนที่จะตัดทอน

• ความหน่วง — Laya 32.8 ms p50 บน T4, 7.2 ms ต่อคำถามที่แบตช์ 10 เทียบกับ RSI-Jev 22.5 ms ที่ระดับความพยายาม ต่ำ และประมาณ 40 ms ที่ความลึกเต็ม บน H200

หน้าผาจำนวนตัวเลือกคือความแตกต่างที่คมชัดที่สุด

โมเดลทั้งสองกำหนดพื้นที่คำตอบ ณ เวลาที่มีคำขอ ดังนั้นสคีมาใหม่จึงไม่ต้องฝึกใหม่ — นั่นคือข้อได้เปรียบเชิงโครงสร้างที่ทั้งตระกูลนี้มีร่วมกัน แต่ทั้งสองจัดสรรพื้นที่คำตอบต่างกัน และความแตกต่างนั้นปรากฏชัดในงานที่ enterprise routing มักเจอพอดี Laya ให้คะแนนทุกตัวเลือกที่ masked token ของตัวเอง และตัวเลือกต่างๆ ใช้ร่วมกันในงบประมาณ head แบบคงที่: 192 โทเคนบน checkpoint ภาษาอังกฤษ และ 256 บน multilingual บน Banking77 ซึ่งมี 77 เจตนา (intents) คิดออกมาได้ราวสามหรือสี่โทเคนต่อป้ายกำกับ และความแม่นยำลดลงเหลือ 0.425 การ์ดของ Convai เองก็บันทึกจุดที่ประสิทธิภาพดิ่งลงนี้ไว้ และเสนอวิธีแก้ — เพิ่ม head_max_len เป็น 512 และเพิ่ม context เป็น 1,024 หรือมากกว่า เพื่อให้แต่ละป้ายกำกับมีที่ว่าง หรือแบ่งชุดตัวเลือกขนาดใหญ่ออกเป็นตัวเลือกสองขั้นแบบ coarse-to-fine

เส้นทางการให้บริการของ RSI-Jev รองรับตัวเลือกได้ถึง 5,120 ตัวเลือกต่อคำถาม นั่นไม่ใช่การเปรียบเทียบแบบเทียบเคียงตรง ๆ กับค่า 0.425 ของ Laya — ทั้งสองถูกวัดบนฮาร์เนสที่ต่างกัน และเพดานจำนวนตัวเลือกเป็นข้อจำกัดด้านการกำหนดค่า ไม่ใช่คะแนน มันเป็นข้อความที่บอกว่าโมเดลใดจะไม่ล้มเมื่ออนุกรมวิธานของคุณมีหนึ่งร้อยรายการ ถ้าคำถามแบบเลือกของคุณคือ "การเรียกเก็บเงิน / ทางเทคนิค / ฝ่ายขาย / อื่น ๆ" ทั้งสองแบบก็ใช้ได้ ถ้าเป็นป้ายเจตนาราวร้อยกว่าป้าย หนึ่งในสองตัวนี้ต้องปรับจูนก่อนจึงจะใช้งานได้ และอีกตัวไม่ต้อง

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

ความหน่วง ประเด็นเรื่องภาษา และรูปภาพ

คำกล่าวอ้างเรื่องความหน่วงของ Laya เป็นสิ่งที่ถูกพูดถึงเสียงดังที่สุด และเป็นเรื่องจริง: 32.8 มิลลิวินาทีที่ p50 สำหรับคำถามเดียวบน Tesla T4, 72.3 มิลลิวินาทีสำหรับแบตช์สิบคำถาม และ 337 มิลลิวินาทีสำหรับห้าสิบคำถาม — 103 ถึง 332 คำถามต่อวินาทีบน GPU ระดับกลาง ๆ เพียงตัวเดียว ตัวเลขของ RSI-Jev เอง ซึ่งวัดบน H200 อยู่ที่ 22.5 มิลลิวินาทีที่ระดับความพยายาม ต่ำ, 26.8 มิลลิวินาทีที่ ปานกลาง, 39.9 มิลลิวินาทีโดยค่าเริ่มต้น และ 40.4 มิลลิวินาทีที่ความลึกเต็มที่ ตัวเลขเหล่านี้อยู่ในระดับเดียวกัน และทั้งคู่เป็นการรันฟอร์เวิร์ดพาสแบบโลคัล ไม่ใช่การเรียกผ่านเครือข่าย ซึ่งเป็นการเปรียบเทียบที่สำคัญจริง ๆ เมื่อไม่มีปลายทางแบบโฮสต์มาเกี่ยวข้อง สังเกตว่าทั้งสองใช้เวลานั้นทำอะไร: RSI-Jev สามารถจงใจหยุดที่เลเยอร์ 16 เพื่อซื้อเวลา 22.5 มิลลิวินาทีนั้น และรันทั้ง 32 เลเยอร์เมื่อคำถามยาก ส่วน Laya ไม่มีปุ่มปรับแบบนั้น — มันรันเอนโคดเดอร์ (ขนาดเล็ก) ทั้งตัวเสมอ

เรื่องราวด้านภาษาเป็นไปในทางตรงกันข้ามและเป็นตัวชี้ขาดสำหรับใครก็ตามที่ไม่ได้ใช้ภาษาอังกฤษ Laya มาพร้อมเราเตอร์ที่ตรวจจับอักษรได้ในเวลาไม่ถึงหนึ่งมิลลิวินาที และส่งต่อไปยังเช็คพอยต์หลายภาษา และตารางที่เผยแพร่ของมันแสดงให้เห็นว่า 45 จาก 51 ภาษาสามารถใช้งานได้สูงกว่าสามเท่าของการสุ่ม เทียบกับ 23 สำหรับเช็คพอยต์ภาษาอังกฤษเพียงอย่างเดียว การ์ดของมันยังซื่อสัตย์เกี่ยวกับเหตุผลว่าทำไมเรื่องนี้จึงสำคัญ: เช็คพอยต์ภาษาอังกฤษล้มเหลวบนอักษรที่ไม่ใช่ละติน — ภาษาเขมรได้ความแม่นยำ 0.000 ที่ความเชื่อมั่น 0.952 — ดังนั้นการควบคุมด้วยความเชื่อมั่นไม่สามารถช่วยเส้นทางที่ผิดได้ RSI-Jev ไม่มีเรื่องราวด้านภาษาแบบนี้; มันเป็นโมเดลข้อความที่เน้นภาษาอังกฤษซึ่งบังเอิญอ่านภาพได้

ภาพคือด้านที่กลับกัน RSI-Jev รับภาพหนึ่งถึงสี่ภาพต่อคำขอในรูปแบบ URL ข้อมูล base64 และทำคะแนนได้ 0.834 บนชุดภาพที่แยกไว้ทดสอบของตนในรุ่นนี้ ส่วนเช็กพอยต์ที่ Laya เผยแพร่นั้นเป็นตัวจำแนกข้อความ และแม้ว่าพอร์ตจากชุมชนอย่าง laya-visionจะมีอยู่บน Hub แต่ก็ไม่ใช่ผลิตภัณฑ์ของผู้พัฒนาเอง หากการตัดสินใจของคุณ是关于รูปถ่าย แผนภูมิ หรือภาพหน้าจอ นั่นคือคอลัมน์ของโมเดลหนึ่ง ไม่ใช่ของอีกโมเดลหนึ่ง

ทั้งสองยังไม่ได้รับการทดสอบประสิทธิภาพเทียบกับอีกฝ่าย

นี่คือส่วนที่การเปรียบเทียบทีละสเปกปิดบังไว้อย่างเงียบ ๆ: ไม่มีการเทียบแบบตัวต่อตัวระหว่างสองโมเดลนี้ สิ่งที่มีอยู่คือการเทียบแบบตัวต่อตัวระหว่างแต่ละโมเดลกับโมเดลปิดตัวเดียวกัน — TypeSafe's Jev 1.13 — และไม่มีโมเดลใดที่สามารถนำมาวางเทียบข้างกันได้

Convai เผยแพร่ผลมาหนึ่งชุด: ใน typed-decisions Jev 1.13.0 ได้ 0.727 เทียบกับค่า routed ของ Laya ที่ 0.766; ใน Banking77 Jev ได้ 0.870 เทียบกับ 0.425 ของ Laya; ในด้านการสอบเทียบ Jev ได้ 0.246 เทียบกับ 0.081 ของ Laya หลังการแก้ไขอุณหภูมิ Convai ระบุข้อจำกัดของตัวเองไว้ในตารางเดียวกัน — ตัวเลขของ Jev เป็นผลที่เผยแพร่โดยบุคคลที่สาม พวกเขาไม่เคยมีสิทธิ์เข้าถึง API เพื่อวัดค่านั้น และขนาดตัวอย่างกับพรอมต์ก็แตกต่างกัน การเปรียบเทียบของ RSI-Jev คือ Decision Index ซึ่งเป็นกระดานสาธารณะของ RSI-Jev เอง และไม่มีรายการ Jev อยู่เลย ดังนั้นตัวเลขภายนอกเพียงชุดเดียวที่เกี่ยวข้องกับทั้งสองโมเดลนี้มาจากชุดทดสอบที่สร้างโดยฝ่ายที่ขายโมเดลเหล่านี้ และการตีความตัวเลขใดตัวหนึ่งข้างต้นอย่างสมเหตุสมผลคือ "นี่คือสิ่งที่ผู้ผลิตวัดได้ บนงานของผู้ผลิตเอง"

สิ่งที่ทั้งสองโปรเจกต์ทำได้ดี และหาได้ยาก คือการเปิดเผยจุดอ่อนของตัวเอง RSI-Jev ระบุชื่อแหล่งภาพที่ไม่ใช่เชิงพาณิชย์ทั้งห้าแหล่งซึ่งอยู่เบื้องหลังการเปิดตัวด้านวิชันของตน และบอกอย่างตรงไปตรงมาว่าการที่เวตซึ่งฝึกบนภาพเหล่านั้นจะสืบทอดเงื่อนไขเหล่านั้นมาด้วยหรือไม่นั้นยังไม่เป็นข้อยุติ รายงานว่ามีการถดถอยของคาลิเบรชันในรีลีสใหม่ล่าสุดของตน และระบุว่าเกณฑ์การออกเริ่มต้นของตนยังไม่ได้รับการยืนยัน Laya เปิดเผยว่าเช็กพอยต์ฐานของตนอยู่ต่ำกว่าเส้นฐาน majority ว่าคำถามแบบออร์ดินัล score เป็น primitive ที่อ่อนแอที่สุดของตน และว่า noul ของตนสามารถทำตามป้ายตัวเลือกของตัวเองแทนที่จะเป็นสถานะ และว่าหนึ่งในฟิลด์การตอบกลับของตนไม่มีสัญญาณที่ใช้งานได้ ความซื่อตรงนั้นคือสิ่งที่คุ้มค่าที่สุดที่จะสืบทอดจากทั้งสองโปรเจกต์: ตรวจสอบค่าความเชื่อมั่นในเคสที่มีป้ายกำกับของคุณเองก่อนที่คุณจะนำระบบอัตโนมัติไปใช้กับค่านั้น

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

สัญญาที่พวกเขาคัดลอกนั้นอยู่ที่ไหนจริงๆ

โมเดลทั้งสองนี้มีอยู่ก็เพราะรูปแบบการรับส่งข้อมูลแบบหนึ่งคุ้มค่าที่จะลอกเลียนแบบ Jev ของ TypeSafe นิยามรูปร่างของคำขอ — สถานะ คำถาม และพริมิทีฟที่มีชนิดข้อมูลสามตัว — รวมถึงรูปร่างของคำตอบ และทั้ง Laya และ RSI-Jev ต่างก็ทำตามนั้น เพื่อให้ไคลเอนต์ที่มีอยู่เดิมใช้งานได้เพียงแค่เปลี่ยน base URL โมเดลอ้างอิงนั้น typesafe/jev-1.13คือหนึ่งในสามโมเดลที่เราให้บริการ: มันอยู่ในแค็ตตาล็อกของเราบนเอดพอยต์ systemone โดยเฉพาะ เป็นการ POST ไปที่ /v1/systemone แบบไม่สตรีม กับบริบท 65,536 โทเคน ในราคา $0.042 ต่อโทเคนอินพุตหนึ่งล้านโทเคน โดยคิดค่าเอาต์พุตเป็นศูนย์ ทั้ง Laya และ RSI-Jev ไม่ได้อยู่ในแค็ตตาล็อกของเรา — ทั้งคู่เป็นไฟล์ดาวน์โหลด และนั่นคือจุดประสงค์ของมัน

เวอร์ชันที่ใช้ได้จริงของเรื่องนั้นสำคัญกว่าการเปรียบเทียบเสียอีก เลเยอร์การตัดสินใจแทบไม่เคยอยู่ลำพังในสแต็ก พวกมันอยู่ข้างๆ โมเดลเชิงสร้างที่เขียนคำตอบ สรุป หรือโค้ด การมีสัญญาอ้างอิงบนคีย์เดียวกับโมเดลอื่นอีก 200+ ตัว ที่ ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยมีมาร์กอัป 0% หมายความว่าการเปลี่ยนแปลงอัตราค่าบริการของผู้ขายมาถึงคุณภายในวันเดียวกัน และการสลับไปใช้ตัวสำรองอัตโนมัติหมายความว่าครึ่งที่เป็นโมเดลเชิงสร้างของคู่นั้นไม่ใช่จุดล้มเหลวจุดเดียว ขณะที่คุณพิจารณาว่าครึ่งการตัดสินใจราคาถูกนั้นดีพอหรือไม่ หากคุณตัดสินว่าเอนโคเดอร์ 421M ที่โฮสต์เองหรือเช็กพอยต์ 4.69B เป็นทางเลือกที่ถูกต้อง คุณก็ยังต้องการให้สัญญาที่มันสื่อสารด้วยนั้นเข้าถึงได้จากที่เดียวกัน — และหากคุณไม่อยากรันทั้งสองอย่าง โมเดลที่ทั้งคู่ลอกแบบมาก็อยู่ห่างแค่คำขอเดียว

ควรดาวน์โหลดอันไหน

เลือก Laya หากคุณมีข้อมูลที่มีป้ายกำกับ มีแท็กซอนอมีที่ไม่ค่อยเปลี่ยนแปลง และมีส่วนผสมภาษาที่ไม่ใช่ภาษาอังกฤษเท่านั้น มันเล็กพอที่จะรันหลายตัว เร็วพอที่จะวางไว้หน้าก่อนทุกคำขอ และออกแบบมาตั้งแต่ต้นให้ไฟน์จูนได้ — คะแนนไฟน์จูน 0.766 เทียบกับ 0.362 แบบ zero-shot คือข้อโต้แย้งทั้งหมด เผื่องบประมาณสำหรับการรันฝึก การติดป้ายกำกับ และการรีฟิตอุณหภูมิตามประเภทคำถาม ซึ่งทำให้ความคลาดเคลื่อนการคาลิเบรตของมันลดจาก 0.466 เหลือ 0.081 และเก็บชุดตัวเลือกให้ต่ำกว่าประมาณยี่สิบป้ายกำกับ หรือเพิ่มงบประมาณของเฮดก่อนที่คุณจะเชื่อถือการจำแนกขนาดใหญ่

เลือก RSI-Jev v6.1-VL หากคุณต้องการให้การตัดสินใจทำงานได้โดยไม่ต้องฝึกอบรมก่อน หากคำถามของคุณบางครั้งเกี่ยวกับรูปภาพ หากชุดตัวเลือกของคุณมีขนาดใหญ่ หรือหากคุณต้องการแลกความหน่วงกับความลึกต่อคำขอ คาดว่าจะต้องรันเช็คพอยต์ขนาด 9.7 GB แทนที่จะเป็น 400M คาดว่าจะเป็นโปรเจกต์ที่เผยแพร่แปดเวอร์ชันในสิบสามวันและอาจเผยแพร่อีกในขณะที่คุณกำลังประเมินอันนี้ และคาดว่าจะต้องตรวจสอบการปรับเทียบด้วยตัวเอง — การ์ดของเวอร์ชันนี้เองบอกว่ามันแย่ลง ไม่ดีขึ้น

ไม่ว่าคุณจะเลือกอันไหน สองสิ่งเดียวกันก็ยังเป็นจริง ทั้งสองโมเดลไม่ได้สร้างข้อความ ดังนั้นทั้งคู่จึงล้มเหลวโดยการส่งออกฟิลด์ที่ผิดรูปแบบไม่ได้ ทั้งคู่คืนค่าความน่าจะเป็น และความน่าจะเป็นคือส่วนที่ต้องได้รับการตรวจสอบยืนยันสำหรับการนำไปใช้แต่ละครั้ง มากกว่าจะหยิบมาจากการ์ด และทั้งคู่ได้ย้ายคำถามที่น่าสนใจของชั้นการตัดสินใจจาก "API ของใคร" ไปเป็น "น้ำหนักของใคร" — ซึ่งเป็นคำถามที่ดีกว่าที่ควรถาม และเป็นคำถามที่คู่นี้ตอบแตกต่างกันอย่างมาก

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL vs Laya - the scoreboard', six rows across both columns: size, '4.69B parameters' against '421M English / 322M multilingual'; zero-shot, '50.98 Decision Index' against '0.362 typed-decisions'; fine-tuned, 'Not per-domain' against '0.766 on its own split'; languages, 'English-centric' against '45 of 51 usable'; modality, 'Text + up to 4 images' against 'Text only'; and latency, '~23-40 ms on an H200' against '32.8 ms p50 on a T4'. A footer reads 'Both vendor-reported; neither has been benchmarked against the other.'
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube