การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับการเปรียบเทียบ Decision 3.0 กับ Intern-Decision-4B โดยมีคำบรรยายใต้ชื่อว่า 'ฐาน Qwen3.5-4B เดียวกัน สองคำตอบที่แตกต่างกัน' พร้อมชิปที่อ่านว่า '26 ก.ย. เทียบกับ 10 ต.ค.' 'วิดีโอเทียบกับรูปภาพเท่านั้น' 'Brier เผยแพร่แล้วเทียบกับยังไม่เผยแพร่' และส่วนท้ายที่อ่านว่า 'ตัวเลขของ Decision 3.0 เป็นของ vLLM-SR เอง ตัวเลขของ Intern-Decision-4B เป็นของ InternLM เอง ไม่มีการทำซ้ำอย่างอิสระ' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Engineering & Research

Decision 3.0 กับ Intern-Decision-4B: สองทีมไฟน์จูนโมเดลเดียวกัน และเห็นต่างกันในทุกเรื่องอื่น

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วาง d3-mini ซึ่งเป็นสมาชิกขนาด 4B ของ Decision 3.0 ไว้ข้าง ๆ Intern-Decision-4B แล้วสิ่งแรกที่คุณสังเกตเห็นไม่ใช่ความแตกต่าง ทั้งคู่เป็น fine-tune ของเช็กพอยต์ฐานเดียวกัน Qwen3.5-4B ทั้งคู่ถูกระบุว่ามี 4.54 พันล้านพารามิเตอร์ ทั้งคู่รับสถานะ, สคีมาของคำถามที่มีชื่อ และชุดคำตอบที่เป็นตัวเลือก แล้วคืนค่าความน่าจะเป็นที่สอบเทียบแล้วต่อตัวเลือก โดยไม่สร้างโทเคน ทั้งคู่เป็น Apache-2.0 ทั้งคู่เปิดตัวโดยไม่มีการประกาศ — InternLM อัปโหลดเช็กพอยต์สามรายการในสี่สิบวินาทีเมื่อวันที่ 26 กันยายน 2026 และตระกูล Decision 3.0 ของ vLLM-SR ขึ้นบน Hugging Face เมื่อวันที่ 10 ตุลาคม 2026 โดยมีข่าวเผยแพร่ผ่านบัญชี X ของโปรเจกต์ vLLM เท่านั้น

ทุกอย่างหลังจากนั้นคือข้อเห็นไม่ตรงกัน พวกเขาเห็นไม่ตรงกันว่าจะอ่านค่าความน่าจะเป็นออกจากโมเดลได้อย่างไร วิดีโอนับเป็นอินพุตหรือไม่ คำขอหนึ่งรายการยาวได้แค่ไหน และ — อย่างรุนแรงที่สุด — ว่าทีมยินดีจะเผยแพร่ตัวเลขที่บอกว่าความมั่นใจของตัวเองนั้นเชื่อถือได้หรือไม่ บทความนี้ว่าด้วยข้อเห็นไม่ตรงกันทั้งสี่ข้อนี้และแต่ละข้อมีต้นทุนต่อคุณอย่างไร ไม่ใช่ว่าโมเดลใด "ดีกว่า" เพราะทั้งสองไม่ได้ถูกวัดด้วยมาตราเดียวกัน และไม่สามารถนำมาจัดอันดับเทียบกันได้หากไม่ลงมือทำงานที่ผู้ขายทั้งสองรายยังไม่ได้ทำ

ความบังเอิญที่ควรค่าแก่การทำความเข้าใจก่อน

การที่ห้องแล็บสองแห่งเลือกใช้แบ็กโบน 4B เดียวกันภายในสองสัปดาห์ไม่ใช่เรื่องน่าแปลกทั้งหมด — Qwen3.5-4B เป็นฐานที่สมเหตุสมผลสำหรับโมเดลเอาต์พุตแบบมีโครงสร้าง และเห็นได้ชัดว่าทั้งสองทีมเลือกใช้มันเพราะมันเล็กพอที่จะรันได้อย่างประหยัดและแข็งแกร่งพอที่จะอ่านคำสั่ง สิ่งที่น่าแปลกคือพวกเขามาถึงจำนวนพารามิเตอร์เท่ากันถึงสี่เลขนัยสำคัญ สิ่งนี้บอกว่าการปรับแต่งละเอียดยังคงสถาปัตยกรรมไว้ และไม่มีฝ่ายใดเพิ่มวิชันทาวเวอร์แยกต่างหากที่ใหญ่พอจะเปลี่ยนยอดรวม ทั้งสองฝ่ายรวมความสามารถมัลติโมดัลไว้ในเวตชุดเดียวกัน

ส่วนที่น่าสนใจคือการอ่านผลลัพธ์ ทั้งสองโมเดลตอบคำถามเหมือนกันโดยหลักการ — คือให้คะแนนคำตอบที่เป็นตัวเลือกแทนที่จะสร้างคำตอบขึ้นมา — และมีกลไกที่แตกต่างกันโดยสิ้นเชิง:

• Intern-Decision-4B — จับคู่ทุกตัวเลือกกับสัญลักษณ์โทเคนเดียว (A–Z, จากนั้น a–z, จากนั้น 0–9), เรนเดอร์โครงร่าง JSON ลงในพรอมป์โดยมีตัวแทนชั่วคราวหนึ่งตัวต่อฟิลด์, และรัน causal forward pass หนึ่งครั้ง โดยอ่านค่า logits ณ ตำแหน่งก่อนหน้าตัวแทนชั่วคราวแต่ละตัวโดยทันที กลไกนี้ได้รับการบันทึกไว้ทีละขั้นตอนบนโมเดลการ์ดของมัน รวมถึงขั้นตอน softmax และ temperature ที่แน่นอน

• d3-mini — มาพร้อมสถาปัตยกรรมแบบกำหนดเองใน modeling_d3.py โดยมี readout head แยกต่างหากอยู่ในไฟล์ readout.safetensorsของตัวเอง, มี decision_config.jsonที่ประกาศค่า noncausal_full_attention และการทำ last-token pooling รวมถึงการแมป token-to-code ที่กำหนดไว้ในคอนฟิกแทนที่จะอธิบายด้วยคำบรรยาย

ไม่มีวิธีใดดีกว่าอย่างชัดเจน เส้นทาง InternLM มีข้อได้เปรียบตรงที่มันทำงานบนคลาสโมเดล Hugging Face มาตรฐานที่มีลำดับตัวเลขซึ่งมีเอกสารกำกับ — คุณสามารถตรวจสอบการทำงานของมันได้ เส้นทาง vLLM-SR มีข้อได้เปรียบตรงที่ readout เป็น head ที่ผ่านการฝึกมาแล้ว แทนที่จะเป็นการฉายภาพของ token embedding ที่มีอยู่ ซึ่งเป็นการปรับให้เข้ากับข้อมูลได้อย่างอิสระมากกว่า และข้อเสียคือคุณต้อง trust_remote_code=True และรันโค้ดของพวกเขาเพื่อทำอะไรก็ตาม

ขีดจำกัดที่แต่ละรายเผยแพร่

นี่คือจุดที่ความชอบที่แท้จริงเริ่มก่อตัวขึ้น เพราะการ์ดใบหนึ่งระบุเจาะจงกว่าอีกใบมากว่ามันจะใช้ไม่ได้ตรงไหน

• เพดานอินพุต — Intern-Decision-4B: 8,192 โทเค็นตามค่าเริ่มต้น และคำขอที่เกินกว่านั้นจะถูกปฏิเสธทันที ไม่มีการตัดทอน โดยเพดานถูกกำหนดโดยอาร์กิวเมนต์ของคอนสตรักเตอร์ d3-mini: max_length คือ null ในคอนฟิกที่จัดส่ง และไม่มีโควตาโทเค็นปรากฏอยู่ที่ใดบนการ์ด

• จำนวนคำถามต่อคำขอ — Intern-Decision-4B: 1 ถึง 16 โดยระบุจำนวนตัวเลือกสูงสุดไว้ที่ 62 ตัวเลือกในคำถามใดคำถามหนึ่ง d3-mini: ไม่มีการระบุขีดจำกัด; การ์ดระบุเพียงว่าคำถามจะได้รับคำตอบพร้อมกัน โดยแต่ละข้อมาจาก forward pass ของตัวเอง

• รูปภาพ — Intern-Decision-4B: สูงสุดแปดภาพต่อคำขอ โดยเรียงตามรายการที่คุณระบุ พร้อมตัวประมวลผลเช็กพอยต์ที่จัดการการปรับขนาดและการขยายโทเค็น d3-mini: หลายภาพต่อคำขอในรูปแบบพาธ, URL, รูปภาพ PIL หรือ data URL แบบ base64 โดยแต่ละภาพอ่านที่ความละเอียดสูงสุด 1.6 เมกะพิกเซล และทุกคำถามจะเห็นทุกภาพ

• วิดีโอ — Intern-Decision-4B: ไม่มี. d3-mini: วิดีโอหลายรายการ อ่านที่ 2 เฟรมต่อวินาที จำกัดไว้ที่ 32 เฟรมกระจายทั่วคลิป และ 0.2 เมกะพิกเซลต่อเฟรม

เพดานอินพุตคือเส้นแบ่งที่จะตัดสินเรื่องนี้สำหรับคนส่วนใหญ่ งบประมาณ 8,192 โทเคนที่ต้องแบ่งใช้ระหว่างสถานะ คำสั่งในคำถาม และคำอธิบายแคนดิเดต ถือเป็นข้อจำกัดที่แท้จริงต่องานให้คะแนนเอกสารและการจัดเส้นทางบริบทแบบยาวที่โมเดลเหล่านี้ถูกขายมาเพื่อทำงานนี้ และ InternLM สมควรได้รับคำชื่นชมที่บอกเรื่องนี้อย่างตรงไปตรงมา แทนที่จะปล่อยให้ต้องไปค้นพบเอง ส่วนการที่ vLLM-SR ไม่ระบุไว้กลับเป็นตรงกันข้าม: ไม่ใช่ขีดจำกัดที่ซ่อนอยู่ แต่เป็นขีดจำกัดที่ไม่รู้ และต่อให้อ่านรีพอซิทอรีมากแค่ไหนก็ไม่ช่วยให้กระจ่าง

การปรับเทียบคือจุดแบ่งที่แท้จริง

โมเดลการตัดสินใจทุกตัวให้สัญญาเดียวกัน: ตัวเลขที่มันคืนค่าคือความน่าจะเป็น และเกณฑ์ที่ตั้งไว้เทียบกับค่านั้นมีความหมาย แทบไม่มีโมเดลใดพิสูจน์เรื่องนี้ได้ นี่คือจุดที่สองรุ่นแตกต่างกันมากที่สุด และความแตกต่างนี้ไปในทิศทางตรงกันข้ามกับที่คุณน่าจะเดาจากวันที่เปิดตัว

Intern-Decision-4B เผยแพร่บนการ์ดของตัวเองว่ามีคะแนน Brier 0.347 และค่าความคลาดเคลื่อนการสอบเทียบที่คาดหวัง 0.065 ในค่าเฉลี่ยจากเจ็ด benchmark โดยมีอุณหภูมิที่ฟิตได้ 1.99241824 ซึ่งได้มาจากการลด NLL ให้ต่ำสุดบนเคสสอบเทียบที่กำหนดไว้ 1,728 เคส และเคสตรวจสอบแยกต่างหาก 1,693 เคส มีข้อความระบุชัดเจนว่าป้ายกำกับของชุดทดสอบไม่ได้ถูกใช้ในการเลือกอุณหภูมินั้น และมีการวินิจฉัย 96 เคสที่แสดงว่าการสอบเทียบของมันเปลี่ยนจาก 0.628 Brier / 0.213 ECE ก่อนทำ temperature scaling เป็น 0.550 / 0.089 หลังทำ นอกจากนี้ยังระบุค่าเริ่มต้น และกล่าวว่าการสอบเทียบเป็นแบบแยกตาม checkpoint ดังนั้นการใช้ขนาดอื่นกับโมดูลนี้จะไม่ตรงกัน

Decision 3.0 เผยแพร่ดัชนีความแม่นยำและข้ออ้างเรื่องความครอบคลุม — คำขอสาธารณะทั้ง 140,178 รายการได้รับคำตอบ ไม่มีรายการใดที่ขาดการสนับสนุน — และไม่มีตัวเลขการคาลิเบรตเลยแม้แต่ค่าเดียว ไม่มีคะแนน Brier ไม่มี ECE ไม่มีค่าอุณหภูมิที่ระบุ ณ จุดตรวจสอบใด ๆ จากทั้งหมดหกจุด อุณหภูมิในเวอร์ชันที่ d3 จัดส่งมา decision_config.jsonเป็น 1.0 ซึ่งก็คือฟังก์ชันเอกลักษณ์ และอาจเป็นหรือไม่เป็นค่าที่ได้จากการฟิตก็ได้ ตัวไฟล์ไม่ได้ระบุไว้

อ่านพาดหัวดัชนีทั้งสองข้างเคียงกัน แล้วความไม่สมมาตรก็ยิ่งแย่ลง การ์ดของ d3-mini รายงานคะแนน Jev Decision Index 0.3 public-suite ที่ 54.90 ซึ่งอธิบายว่าวัดด้วยชุดทางการบนเวตที่เผยแพร่ ขณะที่แถวเปรียบเทียบบนบอร์ดเดียวกันถูกอธิบายว่าเป็นข้อมูลบอร์ดสด Intern-Decision-4B รายงานค่าเฉลี่ย 90.02 จากเจ็ดเบนช์มาร์กของตัวเอง ตัวเลขสองตัวนั้นไม่ได้อยู่บนสเกลเดียวกัน ไม่ได้ใช้งานเดียวกัน และการนำมาใส่ประโยคเดียวเพื่อเปรียบเทียบจะเป็นการไม่ซื่อสัตย์ สิ่งที่เทียบกันได้คือการเปิดเผยข้อมูล การ์ดหนึ่งบอกคุณว่าค่าความเชื่อมั่นของมันผิดพลาดแค่ไหน ส่วนอีกการ์ดไม่รู้หรือไม่ยอมบอก

A generated two-column scoreboard headed 'Decision 3.0 d3-mini vs Intern-Decision-4B - the scoreboard'. The left column for d3-mini reads: base model Qwen3.5-4B fine-tuned, 4.54B parameters; input ceiling not stated on the card; video input yes, up to 32 frames at 2 fps; calibration figures none published; reported score Jev Decision Index 0.3 public suite 54.90; latency median 17.5 ms text and 96.2 ms image. The right column for Intern-Decision-4B reads: base model Qwen3.5-4B fine-tuned, 4.54B parameters; input ceiling 8,192 tokens, rejected not truncated; video input none, images only up to eight; calibration Brier 0.347, ECE 0.065 and temperature 1.99241824; reported score 90.02 seven-benchmark average; latency mean 44.16 ms and median 44.03 ms on one RTX 4090. A footer reads 'd3-mini figures are vLLM-SR's own; Intern-Decision-4B figures are InternLM's own; neither is independently reproduced.'

ความหน่วง และเหตุใดชุดมิลลิวินาทีสองชุดจึงไม่สามารถเปรียบเทียบกันได้เช่นกัน

การ์ดทั้งสองใบเปิดเผยค่าความหน่วงต่อคำขอ และการรับค่าดังกล่าวตามที่ปรากฏก็ถือเป็นความผิดพลาด ด้วยเหตุผลเดียวกับที่ตัวเลขความแม่นยำนั้นเปรียบเทียบกันไม่ได้

• Intern-Decision-4B — ค่าเฉลี่ย 44.16 ms, ค่ามัธยฐาน 44.03 ms, p95 44.60 ms วัดบน RTX 4090 เพียงตัวเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง โดยระบุว่า ขึ้นอยู่กับปริมาณงานและฮาร์ดแวร์

• d3-mini — ค่ามัธยฐาน 17.5 มิลลิวินาทีสำหรับข้อความ, 96.2 มิลลิวินาทีเมื่อมีรูปภาพ, 371.5 มิลลิวินาทีเมื่อมีวิดีโอความยาว 10 วินาที บน AMD Instinct MI325X หนึ่งตัว โดยทำทีละหนึ่งคำขอ

มีสองสิ่งที่ทำให้สิ่งเหล่านี้ไม่อาจนำมาเปรียบเทียบกันได้ สิ่งแรกคือฮาร์ดแวร์และเส้นทางของซอฟต์แวร์: 4090 เทียบกับ MI325X, การทำ forward pass ของ Hugging Face แบบมาตรฐาน เทียบกับการใช้งาน attention แบบกำหนดเองที่มีเคอร์เนลแบบ masked-layer ซึ่งเข้าถึงได้ผ่าน flash-linear-attention ส่วนสิ่งที่สองคือเวิร์กโหลด: ตัวเลขของ InternLM ถูกอธิบายว่าเป็นแบบ end-to-end ต่อหนึ่ง query บนส่วนผสมที่ไม่ระบุชัดเจน ขณะที่ของ vLLM-SR แยกออกมาตามรูปแบบอินพุต ดังนั้นการเปรียบเทียบแบบข้อความล้วนจึงเป็นเส้นเดียวที่เทียบกันได้แบบชนิดต่อชนิด และแม้แต่เส้นนั้นก็ยังข้ามผู้ผลิต GPU สองราย

ตัวเลขที่ต้องนำมาจากการ์ดทั้งสองไม่ใช่การจัดอันดับ แต่เป็นรูปร่าง โมเดลการตัดสินใจถูกเรียกใช้ซ้ำ ๆ ภายในเวิร์กโฟลว์ — บันทึกการสนับสนุนอาจต้องมีปลายทาง การตรวจสอบการคืนเงิน การตัดสินใจยกระดับ และคะแนนความสำคัญ สี่คำถาม และชุดบันทึก 128 รายการทำให้เกิด 512 การตัดสินใจ ที่ปริมาณเท่านั้น 17 ms และ 44 ms ต่างก็หายไปเมื่อเทียบกับค่าใช้จ่ายของโมเดลเจเนอเรทีฟที่อยู่ปลายน้ำ ตัวเลขที่ขึ้นอยู่กับรูปแบบคือสิ่งที่ต้องจับตา เพราะคำขอรูปภาพหรือวิดีโอมีค่าใช้จ่ายระหว่างห้าถึงยี่สิบเท่าของคำขอข้อความตามตัวเลขของ d3-mini เอง และการตัดสินใจของคุณกำลังทำบนภาพหน้าจอที่คุณได้นำเข้าโปรไฟล์ต้นทุนที่การปรับใช้โมเดลการตัดสินใจส่วนใหญ่ไม่มี

จะเลือกอันไหนจริงๆ ดี

หากการตัดสินใจที่คุณต้องทำนั้นขึ้นอยู่กับวิดีโอ ก็ไม่ต้องเปรียบเทียบกันให้เสียเวลาและไม่ต้องวิเคราะห์ใด ๆ: Decision 3.0 อ่านวิดีโอได้ ส่วน Intern-Decision-4B อ่านไม่ได้ นั่นคือคำตอบทั้งหมดสำหรับทุกอย่างที่เกี่ยวข้องกับการบันทึกหน้าจอ คลิปจากกล้อง หรือลำดับเฟรม และมันคือช่องว่างของความสามารถที่เพียงพอจะพิสูจน์เหตุผลการมีอยู่ของตระกูลใหม่นี้ได้ด้วยตัวมันเอง

ถ้าอินพุตของคุณเป็นข้อความและรูปภาพเป็นครั้งคราว การเลือกจะขึ้นอยู่กับสองสิ่ง และไม่มีสิ่งใดในสองสิ่งนั้นที่เป็นลีดเดอร์บอร์ด

เลือกใช้ Intern-Decision-4B เมื่อคุณต้องให้เหตุผลเกี่ยวกับค่าเกณฑ์ (threshold) มันเป็นเพียงหนึ่งเดียวในสองตัวนี้ที่บอกคุณว่า 0.9 หมายถึงเก้าครั้งจากสิบหรือไม่ ระบุค่า temperature ของตัวเอง บอกว่าค่า temperature นั้นถูกฟิตกับกรณีใด และบันทึกวิธีอนุมานของมันเป็นขั้นตอนสั้น ๆ ที่มีหมายเลขกำกับ ซึ่งคุณสามารถนำไป implement ใหม่กับคลาสโมเดลมาตรฐานได้ สำหรับ scorer ที่ทำหน้าที่นำหน้าการดำเนินการอัตโนมัติ นั่นคือคุณสมบัติที่สำคัญ และหายากกว่าคะแนนความแม่นยำ

เลือกใช้ Decision 3.0 เมื่อคุณต้องการช่วงรุ่นหรือมอดาลิตี เช็กพอยต์หกจุดตั้งแต่ 0.59B ถึง 26.09B หมายความว่ารูปแบบคำขอเดียวกันสามารถให้บริการได้โดยโมเดลเอดจ์ที่ใช้เวลา 6.7 ms และโมเดลขนาด 27B และตระกูลนี้ใช้อินเทอร์เฟซเดียวกัน ดังนั้นการย้ายระหว่างระดับจึงเป็นการเปลี่ยนการตั้งค่าแทนที่จะเป็นการเขียนใหม่ ข้อควรระวังคือคุณกำลังเชื่อถืองบอินพุตที่ไม่ได้ระบุไว้และคำกล่าวอ้างการสอบเทียบที่ไม่ได้ตรวจสอบ และโมเดลที่ใหญ่ที่สุดในตระกูลคือรุ่นที่ผู้ขายวัดหมายเลขดัชนีบนฮาร์เนสของตัวเอง

ทั้งสองไม่ใช่ค่าเริ่มต้นที่ปลอดภัยในวันนี้ เช็คพอยต์ที่ถูกดาวน์โหลดมากที่สุดของ d3 อยู่บน Hugging Face ประมาณหนึ่งวันแล้ว; Intern-Decision-4B เปิดให้ใช้งานมาสองสัปดาห์แล้วและมียอดดาวน์โหลดประมาณ 3,200 ครั้งและถูกกดถูกใจ 83 ครั้ง ซึ่งเป็นความสนใจแต่ไม่ใช่ทราฟฟิกโปรดักชัน ทั้งสองถูกพอที่จะทดสอบ และไม่มีงานประเมินจากบุคคลที่สามรองรับอยู่เบื้องหลัง หากคุณกำลังจะวางตัวให้คะแนนไว้ข้างหน้าสิ่งที่ใช้จ่ายเงิน สิ่งที่ถูกต้องคือการรันทั้งสองกับเคสที่มีป้ายกำกับของคุณเอง และเปรียบเทียบเส้นโค้งการสอบเทียบ ไม่ใช่แถวดัชนี

A screenshot of the Intern-Decision-4B model card on Hugging Face. The header shows 83 likes, 1.34k followers and tags for Image-Text-to-Text, Transformers, Safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational under an Apache-2.0 licence, with the model size listed as 5B parameters in F32 or BF16 and the base model pinned to Qwen/Qwen3.5-4B. A section titled 'How inference works' lists five numbered steps: map each question's options to single-token symbols A to Z then a to z then 0 to 9; render the state, decision schema and a JSON skeleton with one decision placeholder per field; run one causal forward pass and read logits immediately before each placeholder; take a softmax over the allowed candidate-symbol logits and apply the checkpoint's probability calibration; and map symbols back to the original option values. It states that the API never calls generate() and samples no free-form text. A benchmark results table below carries Jevbench Easy, Jevbench Original, Jevbench Hard, Typed Decision, ToolACE, AG News and WildJailBreak columns for the Jev, Laya, Semif and Kev rows. The sidebar reports 3,179 downloads last month.

จุดที่เราเตอร์ลงตัว ตามจริงแล้ว

OrcaRouter ไม่ได้ให้บริการโมเดลทั้งสองนี้เช็กพอยต์ของ Decision 3.0 เป็นเส้นทางการประมวลผลอนุมานด้วย Python แบบโลคัลในรีโพซิทอรี Hugging Face โดยไม่มี HTTP endpoint ที่เผยแพร่ไว้ และ Intern-Decision-4B มาในรูปแบบคลาสDecisionEngineที่คุณต้องสร้างอินสแตนซ์เอง ทั้งสองอย่างไม่ใช่สิ่งที่เราสามารถจัดเส้นทางให้ได้ในวันนี้ และไม่ควรตีความส่วนใดของบทความนี้ว่าเป็นการอ้างถึงความพร้อมให้บริการ

สิ่งที่เรามีให้บริการคือเวอร์ชันโฮสต์ในตระกูลเดียวกัน typesafe/jev-1.13อยู่ในแคตตาล็อกของเรา ให้บริการผ่าน POST /v1/systemone — เป็นสัญญาแบบ state-and-named-questions เดียวกันกับที่โมเดลโอเพนทั้งสองตัวข้างต้นใช้งาน — ในราคา $0.042 ต่อโทเคนอินพุตหนึ่งล้านโทเคน โดยไม่คิดค่าคอมพลีชัน เพราะมันไม่สร้างคอมพลีชันเลยมันอยู่เคียงข้างโมเดลอื่นอีกกว่า 200 ตัว และนั่นคือประเด็นในทางปฏิบัติสำหรับใครก็ตามที่เปรียบเทียบสองตัวนี้: ตัวให้คะแนนเป็นส่วนที่ถูกของลูป และโมเดลที่ลงมือทำตามการตัดสินใจเป็นส่วนที่แพง การส่งทั้งสองผ่านคีย์เดียว พร้อมการสลับไปยังผู้ให้บริการรายอื่นอัตโนมัติเมื่อผู้ให้บริการมีปัญหา และราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยบวกเพิ่ม 0%หมายความว่าการประเมินโมเดลสำหรับตัดสินใจไม่จำเป็นต้องเซ็นสัญญาฉบับที่สอง หรือเขียนจุดเรียกใช้งานใหม่เมื่อคุณสลับแบ็กเอนด์ หากคุณกำลังอยู่ระหว่างการประเมิน — ซึ่งเป็นสถานะของโมเดลทั้งสองตัวนี้ในตอนนี้ — นั่นคือส่วนที่คุ้มค่าจะตั้งค่าไว้ก่อนที่คุณจะตัดสินใจเลือกตัวใดตัวหนึ่ง

A screenshot of the OrcaRouter model page for Jev 1.13. The header reads 'Jev 1.13', by TypeSafe, dated 2026-09-24, tagged NEW, with a specification panel reading 65K tokens of context, text input, text output and a p50 time-to-first-token of 176 ms, and the endpoint listed as /v1/systemone. The description says it is TypeSafe's structured decision and evaluation model, given a state and a set of named questions (noul / choice / score), returning a structured answer for each, served via POST /v1/systemone, non-streaming, up to about 64K input tokens, text in and structured JSON out. The metric strip reads input /bin/bash.04 per 1M tokens, no output price, p50 TTFT 176 ms, p95 TTFT 423 ms and 59.3M tokens of traffic over 7 days. Buttons read 'Get the Jev 1.13 API' and 'Try in playground', and a code sample shows a POST to https://api.orcarouter.ai/v1/systemone with the model typesafe/jev-1.13 and a state plus noul, choice and score questions.

คำถามที่เปิดอยู่

การ์ดทั้งสองใบไม่เห็นด้วยกันเกี่ยวกับสิ่งที่ผู้เขียนโมเดลพึงมีต่อผู้อ่าน และความไม่เห็นด้วยนั้นน่าสนใจกว่าตัวโมเดลเอง InternLM เผยแพร่ค่า temperature และเคสที่ใช้ฟิตโมเดล จากนั้นเผยแพร่ผลการวินิจฉัยที่แสดงว่าการคาลิเบรชันดีขึ้นเพียงใด vLLM-SR เผยแพร่แฮชไฟล์ ปักหมุด revision ฐาน ระบุเป้าหมายฮาร์ดแวร์ที่ต้องการ อ้างเรื่องความครอบคลุม — งานด้านที่มาที่แท้จริง — และไม่มีตัวเลขการคาลิเบรชันเลยแม้แต่ตัวเดียว

การทดสอบว่ารีลีสใดจะเติบโตเต็มที่ ไม่ใช่ว่าตัวไหนชนะบอร์ด แต่คือว่าเช็กพอยต์ Decision ครั้งถัดไปจะถูกปล่อยออกมาพร้อมคะแนน Brier ติดอยู่หรือไม่ และการอัปโหลดครั้งถัดไปของ InternLM จะไปถึงวิดีโอหรือไม่ ทั้งสองอย่างมองเห็นได้จากภายนอก ทั้งสองอย่างตรวจสอบได้ในราคาถูก และยังไม่มีอย่างใดเกิดขึ้นเลย

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube