การ์ดชื่อเรื่องแบบฮีโรที่อ่านว่า 'Intern-Decision-0.8B vs MathForm 8B' พร้อมคำโปรย 'หนึ่งในสองตัวนี้ตรวจงานของตัวเองได้' ติดป้ายว่า 'เอาต์พุต Lean 4 ที่ตรวจสอบโดยคอมไพเลอร์' และ 'ความมั่นใจที่รายงานเองเท่านั้น' โดยมีโลโก้ OrcaRouter ประกอบอยู่ที่มุม
Guides & Insights

Intern-Decision-0.8B vs MathForm 8B: หนึ่งในเหล่านี้สามารถตรวจงานของตัวเองได้

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

คำถามที่มีประโยชน์ที่สุดที่คุณถามเกี่ยวกับโมเดลผู้เชี่ยวชาญขนาดเล็กใด ๆ ได้ก็คือ ใครเป็นคนตรวจสอบมัน Intern-Decision-0.8B และ MathForm 8B ต่างก็มีอยู่เพราะโมเดลทั่วไปถูกปรับละเอียดให้กลายเป็นโมเดลเฉพาะทาง ทั้งคู่เป็นอนุพันธ์ภายใต้ Apache-2.0 ของน้ำหนัก Qwen และทั้งคู่ถูกนำขึ้น Hugging Face โดยไม่มีแคมเปญการตลาด — แต่พวกมันอยู่คนละฝั่งของเส้นแบ่งที่กำหนดว่าคุณจะนำไปใช้งานอย่างไร MathForm 8B คือโมเดล autoformalization ขนาด 8B ของ OpenBMB เปิดตัวเมื่อวันที่ 14 สิงหาคม 2026 ซึ่งแปลคณิตศาสตร์ภาษาธรรมชาติเป็น Lean 4 และส่งผลลัพธ์ให้คอมไพเลอร์ ซึ่งจะยอมรับหรือไม่ยอมรับก็ได้ Intern-Decision-0.8B คือหัวตัดสินใจขนาด 852,985,920 พารามิเตอร์ของ InternLM อัปโหลดเมื่อวันที่ 26 กันยายน 2026 ซึ่งคืนค่าการแจกแจงความน่าจะเป็นที่ปรับเทียบแล้วเหนือตัวเลือกที่คุณระบุไว้ล่วงหน้า — และไม่มีอะไรในโลกที่ตรวจสอบอย่างอิสระได้ว่าป้ายกำกับที่มันคืนมานั้นถูกต้องหรือไม่ หนึ่งในโมเดลเหล่านี้สร้างเอาต์พุตพร้อมข้อพิสูจน์ อีกตัวสร้างเอาต์พุตพร้อมคะแนนความเชื่อมั่น และความแตกต่างในสิ่งที่คุณทำได้กับสองสิ่งนั้นคือเนื้อหาทั้งหมดของบทความนี้

การวางกรอบเช่นนั้นยังอธิบายด้วยว่าเหตุใดช่องว่างขนาด — 8B เทียบกับ 0.8B ซึ่งต่างกันถึงสิบเท่า — จึงเป็นตัวเลขที่น่าสนใจน้อยที่สุดในการเปรียบเทียบนี้ ไม่มีโมเดลใดพยายามเก่งในสิ่งที่อีกโมเดลทำ และการประเมินของโมเดลใดก็ไม่ได้บอกอะไรเกี่ยวกับอีกโมเดลเลย สิ่งที่ทั้งคู่มีร่วมกันคือรูปแบบการเปิดตัวและสายตระกูล Qwen และทั้งสองสิ่งนั้นสำคัญน้อยกว่าคำถามเรื่องการตรวจสอบยืนยัน

แต่ละอย่างจริงๆ แล้วคืออะไร

MathForm 8B เป็นผลงานที่เผยแพร่ของสูตรสองขั้นตอนที่อธิบายไว้ในบทความ MathForm: การขยายขนาดการทำให้เป็นทางการทางคณิตศาสตร์อัตโนมัติด้วยการดึงความรู้และการปรับปรุงโดยใช้การตรวจสอบเป็นแนวทาง (arXiv 2608.14221) ตัววางแผนการดึงข้อมูลจะดึงคำจำกัดความที่เกี่ยวข้องและการทำให้เป็นทางการที่มีอยู่แล้วจาก Mathlib ก่อนที่ตัวสร้างจะทำงาน จากนั้นข้อความที่สร้างขึ้นจะถูกแก้ไขโดยใช้การวินิจฉัยของคอมไพเลอร์และข้อเสนอแนะเกี่ยวกับความสอดคล้องเชิงความหมาย คลังข้อมูลที่ได้ ชื่อ FormalVerse มีตัวอย่าง Lean 4 ที่ผ่านการตรวจสอบแล้วประมาณ 367,000 ตัวอย่าง และ MathForm 8B ได้รับการฝึกบนคลังข้อมูลนี้ผ่านการปรับละเอียดแบบมีผู้สอน ตามด้วยการเรียนรู้แบบเสริมกำลังโดยใช้การคอมไพล์ Lean และสัญญาณความสอดคล้องเชิงความหมายเป็นรางวัล เป็นโมเดลข้อความล้วนที่อิงจาก Qwen3-8B ให้บริการผ่าน Transformers, vLLM หรือ SGLang ด้วย API ที่เข้ากันได้กับ OpenAI โดยมีความยาวบริบทที่แนะนำ 16,384 โทเค็น และงบประมาณการสร้างสูงสุด 16,384 โทเค็น ไปป์ไลน์การประเมิน ไฟล์เกณฑ์มาตรฐาน และสคริปต์ Pass@k ของมันทั้งหมดอยู่ในที่เก็บ GitHub ของ OpenBMB และชุดข้อมูลการฝึกเป็นสาธารณะ

Intern-Decision-0.8B เป็นอาร์ติแฟกต์ที่ส่งมอบของสูตรที่ยังไม่มีใครอธิบาย การ์ดโมเดลระบุว่ามันเป็น "โมเดลการตัดสินใจแบบมีโครงสร้างมัลติโมดัลที่ไฟน์จูนจาก Qwen3.5-0.8B" และจบเพียงเท่านั้น — ไม่มีคำอธิบายข้อมูล ไม่มีขั้นตอนการฝึก ไม่มีเปเปอร์ ไม่มีที่เก็บโค้ด สิ่งที่มันจัดทำเอกสารไว้อย่างละเอียดคือสัญญาการอนุมาน เอนจินที่มาพร้อมกันจะแมปตัวเลือกของแต่ละคำถามไปยังสัญลักษณ์แบบโทเคนเดียว เรนเดอร์โครงร่างที่มี <decision> หนึ่งตัวเป็นตัวยึดตำแหน่งต่อฟิลด์ รัน causal forward pass หนึ่งครั้ง อ่านค่าลอจิทที่ตำแหน่งก่อนตัวยึดตำแหน่งแต่ละตัว ทำ softmax เฉพาะสัญลักษณ์ที่อนุญาตของฟิลด์นั้น ใช้การคาลิเบรตที่ฟิตไว้ และแมปสัญลักษณ์กลับไปยังค่าตัวเลือกของคุณ ไม่มีการเรียก generate() และไม่มีการสุ่มตัวอย่างที่ใดในเส้นทางนี้ มันรับข้อความพร้อมภาพได้สูงสุดแปดภาพ รองรับคำถามหนึ่งถึงสิบหกข้อ โดยแต่ละข้อมีตัวเลือกได้สูงสุด 62 ตัวเลือก และปฏิเสธอินพุตที่เกิน 8,192 โทเคน แทนที่จะตัดทอน อุณหภูมิคาลิเบรตเริ่มต้นคือ 2.747760550703 ซึ่งฟิตต่อเช็กพอยต์โดยการลด NLL ให้ต่ำสุดจาก 1,728 เคส

ลองอ่านสองย่อหน้านั้นเทียบกันดู แล้วจะเห็นความไม่สมดุลได้อย่างชัดเจน MathForm 8B มาพร้อมบทความวิจัย ชุดข้อมูล ไปป์ไลน์การประเมิน และรีโพซิทอรี ส่วน Intern-Decision-0.8B มาพร้อมคำอธิบาย API และตารางเปรียบเทียบประสิทธิภาพ

ความไม่สมมาตรของการตรวจสอบ ซึ่งนั่นต่างหากคือประเด็นที่แท้จริง

ผลลัพธ์ของ MathForm 8B สามารถถูกตรวจสอบได้ด้วยสิ่งอื่นที่ไม่ใช่มนุษย์ โดยมันส่งออกเป็น Lean 4 และ Lean 4 นั้นจะคอมไพล์ผ่านหรือไม่ผ่านเท่านั้น ตัวเลขของ OpenBMB ถูกรายงานภายใต้สองเงื่อนไขด้วยเหตุผลนี้เอง นั่นคือ Pass@8 ที่ 88.06% ภายใต้ Syntax Check ซึ่งหมายความว่าเอาต์พุตคอมไพล์ผ่าน และ 72.37% ภายใต้ Consistency Check ซึ่งหมายความว่ามันคอมไพล์ผ่านและการตรวจสอบความสอดคล้องเชิงความหมายก็เห็นตรงกันว่าข้อความเชิงรูปแบบ (formal statement) มีความหมายตรงกับที่ข้อความแบบไม่เป็นทางการกล่าวไว้ ทั้งสองตัวเลขเป็นค่าเฉลี่ยจากหก benchmark และงานวิจัยยังรายงานอัตราการผ่าน CC ที่ 63% บน FATE-H และ 37% บนชุดย่อย FATE-X ที่ยากกว่า โดยอ้างว่าตัวเลขนี้สูงกว่า autoformalizer เฉพาะทางขนาด 32B เหล่านี้เป็นตัวเลขที่ผู้ขายรายงานเอง — OpenBMB เป็นผู้รัน — แต่คุณสมบัติที่สำคัญนั้นเป็นเชิงโครงสร้าง ไม่ใช่เชิงสถิติ ระบบปลายทางที่นำเอาต์พุตของ MathForm 8B ไปใช้สามารถปฏิเสธการแปลงเป็นรูปแบบที่ไม่ดีได้โดยไม่ต้องให้โมเดลมาตัดสิน ตัวคอมไพเลอร์คือผู้ชี้ขาด

Intern-Decision-0.8B มีสัญญาประเภท (type contract) และไม่มี oracle รูปร่างของเอาต์พุตถูกรับประกันไว้ — ฟิลด์ที่ประกาศเป็น choice จะคืนการแจกแจงความน่าจะเป็นเหนือค่าตัวเลือกที่คุณระบุไว้ ส่วนฟิลด์ที่ประกาศเป็น score จะคืนค่าคาดหวังถ่วงน้ำหนักด้วยความน่าจะเป็นตามเกณฑ์ (rubric) ของคุณ และฟิลด์ที่ประกาศเป็น noul จะคืนค่าความน่าจะเป็นของการตอบว่าใช่ ไม่มีสิ่งใดนอกตัวโมเดลที่บอกคุณได้ว่า argmax นั้นถูกต้องหรือไม่ ค่าความเชื่อมั่นคือการประมาณการของโมเดลเองเกี่ยวกับความถูกต้องของตัวเอง และงานด้านการปรับเทียบ (calibration) ของการ์ดนั้นเป็นความพยายามอย่างจริงใจที่จะทำให้การประมาณการนั้นมีความหมาย — อุณหภูมิที่ฟิตขึ้นมา (fitted temperature) ซึ่งรักษา argmax ไว้พร้อมกับทำให้ความน่าจะเป็นคมชัดขึ้นหรือนุ่มนวลลง และตรวจสอบความถูกต้องบนเคสที่กันไว้ (held-out) — แต่คำตอบผิดที่ปรับเทียบมาอย่างดีก็ยังคงเป็นคำตอบที่ผิด หากไปป์ไลน์ของคุณจำเป็นต้องรู้ว่าป้ายกำกับ (label) นั้นถูกต้องหรือไม่ คุณต้องมีข้อมูลที่มีป้ายกำกับ และคุณต้องวัดมันด้วยตัวเอง

นั่นไม่ใช่ข้อบกพร่องเฉพาะของ Intern-Decision-0.8B เพียงอย่างเดียว มันเป็นสภาพของตัวจำแนกทุกตัว และเป็นปัญหาที่ยังไม่ได้แก้ในหมวดหมู่ทั้งหมดของโมเดลการตัดสินใจ ซึ่งรวมถึง Jev ของ TypeSafe และ Laya ของ Convai การพูดให้ชัดเจนเป็นเรื่องที่ควรทำ เพราะตาราง benchmark ที่มีคอลัมน์คะแนน Brier อาจทำให้เกิดภาพว่าการปรับเทียบคือการตรวจสอบยืนยัน ซึ่งไม่ใช่ การปรับเทียบบอกคุณว่า เมื่อโมเดลนี้บอกว่า 80% มันถูกประมาณ 80% ของเวลาโดยเฉลี่ยทั่วการแจกแจงที่ประเมิน ซึ่งมีประโยชน์จริงสำหรับการกำหนดเกณฑ์และการคำนวณมูลค่าคาดหวัง และไม่ใช่การรับประกันความถูกต้องเป็นรายรายการ

กระดานคะแนน ในแถวที่ทั้งสองโมเดลมี

• พารามิเตอร์ — Intern-Decision-0.8B: 852,985,920 กระจายอยู่บน language shard ขนาด 1.50 GB, vision shard ขนาด 176 MB และ projector ขนาด 25 MB. MathForm 8B: 8B แบบ dense โดยอิงจาก Qwen3-8B.

• โมเดลฐาน — Intern-Decision-0.8B: Qwen3.5-0.8B เปิดตัวเมื่อเดือนกุมภาพันธ์ 2026 MathForm 8B: Qwen3-8B

• งาน — Intern-Decision-0.8B: การตัดสินใจแบบมีชนิดข้อมูลบนสคีมาที่คุณเขียนเอง — แบบเลือก, แบบคะแนน, แบบไบนารี. MathForm 8B: การแปลงคณิตศาสตร์ภาษาธรรมชาติเป็นรูปแบบทางการใน Lean 4.

• เอาต์พุต — Intern-Decision-0.8B: การแจกแจงแบบคาลิเบรตพร้อมค่า argmax ต่อฟิลด์ ไม่มีการสร้างข้อความ MathForm 8B: สร้างซอร์สโค้ด Lean 4 ซึ่งโดยทั่วไปจะยาว

• การตรวจสอบ — Intern-Decision-0.8B: ไม่มีจากภายนอก; ความเชื่อมั่นเป็นการรายงานด้วยตนเอง MathForm 8B: คอมไพเลอร์ Lean 4 พร้อมการตรวจสอบความสอดคล้องเชิงความหมาย

• หลักฐานที่เผยแพร่ — Intern-Decision-0.8B: ตาราง benchmark ของผู้จำหน่ายครอบคลุมเจ็ด benchmark ไม่มีการทำซ้ำ ไม่มีบทความวิชาการ MathForm 8B: บทความวิชาการ ชุดข้อมูลสาธารณะประมาณ 367,000 ตัวอย่าง ไปป์ไลน์การประเมินและ repository ดำเนินการโดยผู้จำหน่าย

• สัญญาอนุญาต — ทั้งคู่ใช้ Apache 2.0 และ Intern-Decision-0.8B ยังมีไฟล์สัญญาอนุญาต Qwen ที่เก็บรักษาไว้สำหรับน้ำหนักต้นทางของมันด้วย

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

ต้นทุนและเวลาแฝงไม่สามารถนำมาเปรียบเทียบกันได้ และนั่นไม่ใช่การเลี่ยงคำตอบ

InternLM วัดค่าเฉลี่ยของ Intern-Decision-0.8B ได้ที่ 33.98 ms และ p95 ที่ 37.50 ms ต่อคิวรี บน RTX 4090 ตัวเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง โดยรุ่นพี่น้องขนาด 2B ทำค่าเฉลี่ยได้ 33.28 ms การ์ดของ MathForm 8B เองแนะนำให้ใช้โทเคนใหม่สูงสุด 16,384 โทเคนต่อการทำฟอร์แมลไลเซชันหนึ่งครั้ง ที่ temperature 0.6 และ top_p 0.95 การวัดสองค่านั้นไม่ใช่ปริมาณเดียวกัน อย่างหนึ่งคือ forward pass เพียงครั้งเดียวบนพรอมป์ต์ ส่วนอีกอย่างคือการสร้างแบบ autoregressive ที่สามารถรันได้หลายพันโทเคน การนำงบประมาณการทำฟอร์แมลไลเซชันมาคูณเทียบกับการตัดสินใจที่ 34 ms ไม่ได้บอกอะไรเกี่ยวกับประสิทธิภาพเชิงสัมพัทธ์ เพราะโมเดลไม่ได้ทำงานในปริมาณที่เท่ากัน — ตัวหนึ่งอ่านและให้คะแนน ส่วนอีกตัวอ่านและเขียนสคริปต์พิสูจน์ หาก throughput คือข้อจำกัดของคุณ ข้อเท็จจริงที่เกี่ยวข้องก็เรียบง่ายกว่าการเทียบอัตราส่วน MathForm 8B ทำฟอร์แมลไลเซชันหนึ่งข้อความต่อการสร้างหนึ่งครั้ง และด้วย 16K โทเคนต่อเอาต์พุตบนโมเดล dense ขนาด 8B นั่นจึงเป็นภาระงานที่ทำให้ GPU ทำงานเต็มกำลัง และเป็นตัวเลือกที่เหมาะกับการทำแบตช์ผ่าน vLLM หรือ SGLang ซึ่ง OpenBMB มีเอกสารประกอบไว้ทั้งคู่ Intern-Decision-0.8B ตอบคำถามสิบหกข้อที่ครอบคลุมทั้งเรกคอร์ดในการรันครั้งเดียว ดังนั้นหน่วยของงานจึงเป็นเรกคอร์ดไม่ใช่ฟิลด์ และงบประมาณของเรกคอร์ดคือเพดานอินพุต 8,192 โทเคน — ซึ่งมาถึงเร็วกว่าที่ผู้อ่านอาจคาด เมื่อคุณกำลังอัดสถานะยาว สคีมาที่ครบถ้วน และรูปภาพสูงสุดแปดรูปเข้าไป

ที่ซึ่งแต่ละอย่างคือเครื่องมือที่เหมาะสม

MathForm 8B เหมาะกับไปป์ไลน์ที่คอขวดคือการตรวจสอบคณิตศาสตร์โดยมนุษย์ การทำให้เป็นรูปแบบอัตโนมัติมีอยู่เพราะการเขียน Lean ช้ากว่าการอ่านมัน และเพราะข้อความที่เครื่องตรวจสอบได้คือสิ่งที่ผู้ช่วยพิสูจน์จะโจมตีต่อไปได้ คุณสมบัติที่ทำให้มันน่าเชื่อถือ — ผลลัพธ์ที่ผ่านการตรวจสอบโดยคอมไพเลอร์ — ก็เป็นคุณสมบัติที่ทำให้มันแคบเช่นกัน: มันทำให้เป็นรูปแบบ ไม่ได้พิสูจน์ และการ์ดระบุชัดเจนว่าการตรวจสอบการคอมไพล์ต้องมี Kimina Lean Server ที่ทำงานอยู่ และการทดลองใช้ Lean 4.21.0 ใครก็ตามที่นำมันไปใช้ก็คือรับสแตกนั้นไปด้วย เช่นเดียวกับโมเดลน้ำหนักเปิดใด ๆ ที่เพิ่งเปิดตัวได้ไม่กี่วันหรือไม่กี่สัปดาห์ การชี้เส้นทางทดสอบมาที่มันแล้วถอยกลับไปใช้โมเดลที่พิสูจน์แล้วเมื่อมันหยุดชะงัก คือวิธีประเมินความเสี่ยงต่ำ ซึ่งนั่นคือสิ่งที่ เกตเวย์ที่มีการสลับสำรองอัตโนมัติข้ามสายโซ่สำรอง มีไว้เพื่อ — การลองใหม่ที่เกิดขึ้นก่อนการตอบกลับจะเริ่มต้น ดังนั้นการทำให้เป็นรูปแบบที่หยุดชะงักจึงไม่มีทางไปถึงผู้เรียกของคุณ

Intern-Decision-0.8B เหมาะกับที่ใดก็ตามที่มีชุดคำตอบแบบปิดอยู่แล้ว และค่าใช้จ่ายในการสร้างข้อความเพื่อกู้คืนคำตอบนั้นกลับมาเป็นความสิ้นเปลืองเปล่าๆ การคัดแยก การจัดเส้นทาง การให้คะแนนตามเกณฑ์ และการตัดสินระเบียนหนึ่งๆ เทียบกับนโยบายที่เป็นลายลักษณ์อักษร — กรณีที่กำลังใช้โมเดลเชิงสร้างเป็นวิธีราคาแพงในการเลือกจากรายการ ข้อดีของมันคือ มันเป็นแบบกำหนดได้แน่นอน มันคืนค่าความน่าจะเป็นที่ใช้งานได้แทนที่จะเป็นสตริงที่คุณต้องแยกวิเคราะห์เอง และด้วยขนาด 1.73 GB บนดิสก์ มันทำงานได้สบายๆ ต่ำกว่าต้นทุนหน่วยความจำของเบราว์เซอร์บนแล็ปท็อป ข้อเสียของมันคือ เอกสารหยุดอยู่แค่ระดับผิว API ไม่มีใครนอก InternLM เผยแพร่ผลลัพธ์สำหรับมัน และคอลัมน์ benchmark เพียงคอลัมน์เดียวที่บ่งชี้ถึงปัญหาด้านความปลอดภัย — คะแนน WildJailBreak ที่ 64.48 เทียบกับ 96.29 ของ Jev — ก็ไม่มีคำอธิบาย อย่านำมันไปวางไว้หน้าข้อมูลนำเข้าแบบปรปักษ์โดยไม่รันการทดสอบนั้นด้วยตัวคุณเอง

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

ทั้งสองโมเดลมีสายสัมพันธ์ที่ควรค่าแก่การกล่าวถึง เพราะมันเปลี่ยนความหมายของสิ่งที่ "open" มอบให้คุณ แต่ละโมเดลเป็นการไฟน์จูนจากเช็กพอยต์ Qwen และแต่ละตัวคงสัญญาอนุญาตจากต้นทางไว้อย่างถูกต้อง: MathForm 8B ภายใต้ Apache 2.0 โดยระบุแหล่งที่มาของ Qwen3-8B ไว้ในรีโพซิทอรี, Intern-Decision-0.8B ภายใต้ Apache 2.0 พร้อมกับ LICENSE-QWEN ซึ่งเป็นไฟล์แยกต่างหากในรีโพซิทอรี ทั้งสองไม่มีเกณฑ์รายได้หรือข้อจำกัดขอบเขตการใช้งาน — ต่างจาก LFM Open License v1.0 ของ Liquid AI ซึ่งกำหนดสิทธิ์ทางการค้าโดยมีเงื่อนไขว่าหน่วยงานของคุณต้องมีรายได้ต่อปีต่ำกว่า 10 ล้านดอลลาร์ หากคุณกำลังพัฒนาในเชิงพาณิชย์ นั่นคือความแตกต่างที่แยกสองรุ่นนี้ออกจากบางส่วนของระบบนิเวศโมเดลขนาดเล็ก และมันใช้กับทั้งสองอย่างเท่าเทียมกัน

ถ้าคุณต้องการชั้นการตัดสินใจโดยไม่มีจุดตรวจสอบที่ไม่มีเอกสารกำกับ

ช่องว่างระหว่าง "หัวตัดสินใจเป็นรูปแบบที่เหมาะสมสำหรับปัญหานี้" กับ "หัวตัดสินใจตัวนี้คือสิ่งที่คุณสามารถปกป้องต่อผู้ตรวจทานได้" คือสิ่งที่ทางเลือกแบบโฮสต์เข้ามาปิดJev 1.13 ของ TypeSafe คือโมเดลที่ InternLM ใช้เป็นตัวเปรียบเทียบตระกูลของตนบน Jevbench บน Typed Decision และบน ToolACE และมันสามารถเรียกใช้ได้วันนี้ผ่านเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI ในราคา $0.042 ต่อโทเคนอินพุตหนึ่งล้านโทเคน โดยคิดค่าเอาต์พุตเป็นศูนย์ — อัตราที่ผู้ขายเผยแพร่ ส่งผ่านโดยไม่คิดมาร์กอัป แทนที่จะถูกบวกมาร์กอัประหว่างทาง สำหรับผู้อ่านที่ต้องการวัดว่าหัวตัดสินใจช่วยได้จริงหรือไม่ก่อนตัดสินใจเลือก checkpoint ขนาด 0.8B ที่มี repository หายไป นั่นคือการทดลองแรกที่ต้นทุนต่ำ และการประเมินจากบุคคลที่สามของ Jev เองก็มอบประวัติผลงานที่บันทึกไว้ให้มัน ซึ่ง Intern-Decision-0.8B ยังไม่มี

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

คำตอบสั้น ๆ

สองสิ่งนี้ไม่ใช่ทางเลือกแทนกัน MathForm 8B เป็นผู้เชี่ยวชาญเฉพาะทางที่ผลลัพธ์สามารถให้โปรแกรมตรวจสอบได้ โดยมุ่งเป้าไปที่งานที่การตรวจสอบเป็นส่วนที่ยาก และมาพร้อมกับเปเปอร์ ชุดข้อมูล และชุดเครื่องมือประเมินผลเพื่อพิสูจน์ข้อกล่าวอ้าง Intern-Decision-0.8B เป็นผู้เชี่ยวชาญเฉพาะทางที่ผลลัพธ์มีเพียงคุณเท่านั้นที่ตรวจสอบได้ โดยมุ่งเป้าไปที่งานที่คำตอบถูกเขียนไว้แล้ว และส่วนที่ยากคือการไปให้ถึงคำตอบเหล่านั้นอย่างรวดเร็วและประหยัด และมาพร้อมกับโมดูล inference และตารางหนึ่งตาราง หากคุณต้องการการทำให้เป็นรูปนัย สิ่งที่ต้องพิจารณามีเพียงหนึ่งเดียวในสองสิ่งนี้ หากคุณต้องการป้ายกำกับ และคุณพร้อมที่จะสร้าง ground truth เพื่อตรวจสอบกับมัน 0.8B คือดาวน์โหลดที่น่าสนใจกว่า — เร็ว deterministic, Apache 2.0, และเล็กพอที่ค่าใช้จ่ายในการค้นหาว่ามันดีพอหรือไม่จะเป็นแค่เวลาหนึ่งบ่ายมากกว่าจะเป็นรายการงบประมาณ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube