
Decision 3.0 กับ Intern-Decision-4B: สองทีมไฟน์จูนโมเดลเดียวกัน และเห็นต่างกันในทุกเรื่องอื่น
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 71 tok/s
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
วาง d3-mini ซึ่งเป็นสมาชิกขนาด 4B ของ Decision 3.0 ไว้ข้าง ๆ Intern-Decision-4B แล้วสิ่งแรกที่คุณสังเกตเห็นไม่ใช่ความแตกต่าง ทั้งคู่เป็น fine-tune ของเช็กพอยต์ฐานเดียวกัน Qwen3.5-4B ทั้งคู่ถูกระบุว่ามี 4.54 พันล้านพารามิเตอร์ ทั้งคู่รับสถานะ, สคีมาของคำถามที่มีชื่อ และชุดคำตอบที่เป็นตัวเลือก แล้วคืนค่าความน่าจะเป็นที่สอบเทียบแล้วต่อตัวเลือก โดยไม่สร้างโทเคน ทั้งคู่เป็น Apache-2.0 ทั้งคู่เปิดตัวโดยไม่มีการประกาศ — InternLM อัปโหลดเช็กพอยต์สามรายการในสี่สิบวินาทีเมื่อวันที่ 26 กันยายน 2026 และตระกูล Decision 3.0 ของ vLLM-SR ขึ้นบน Hugging Face เมื่อวันที่ 10 ตุลาคม 2026 โดยมีข่าวเผยแพร่ผ่านบัญชี X ของโปรเจกต์ vLLM เท่านั้น
ทุกอย่างหลังจากนั้นคือข้อเห็นไม่ตรงกัน พวกเขาเห็นไม่ตรงกันว่าจะอ่านค่าความน่าจะเป็นออกจากโมเดลได้อย่างไร วิดีโอนับเป็นอินพุตหรือไม่ คำขอหนึ่งรายการยาวได้แค่ไหน และ — อย่างรุนแรงที่สุด — ว่าทีมยินดีจะเผยแพร่ตัวเลขที่บอกว่าความมั่นใจของตัวเองนั้นเชื่อถือได้หรือไม่ บทความนี้ว่าด้วยข้อเห็นไม่ตรงกันทั้งสี่ข้อนี้และแต่ละข้อมีต้นทุนต่อคุณอย่างไร ไม่ใช่ว่าโมเดลใด "ดีกว่า" เพราะทั้งสองไม่ได้ถูกวัดด้วยมาตราเดียวกัน และไม่สามารถนำมาจัดอันดับเทียบกันได้หากไม่ลงมือทำงานที่ผู้ขายทั้งสองรายยังไม่ได้ทำ
ความบังเอิญที่ควรค่าแก่การทำความเข้าใจก่อน
การที่ห้องแล็บสองแห่งเลือกใช้แบ็กโบน 4B เดียวกันภายในสองสัปดาห์ไม่ใช่เรื่องน่าแปลกทั้งหมด — Qwen3.5-4B เป็นฐานที่สมเหตุสมผลสำหรับโมเดลเอาต์พุตแบบมีโครงสร้าง และเห็นได้ชัดว่าทั้งสองทีมเลือกใช้มันเพราะมันเล็กพอที่จะรันได้อย่างประหยัดและแข็งแกร่งพอที่จะอ่านคำสั่ง สิ่งที่น่าแปลกคือพวกเขามาถึงจำนวนพารามิเตอร์เท่ากันถึงสี่เลขนัยสำคัญ สิ่งนี้บอกว่าการปรับแต่งละเอียดยังคงสถาปัตยกรรมไว้ และไม่มีฝ่ายใดเพิ่มวิชันทาวเวอร์แยกต่างหากที่ใหญ่พอจะเปลี่ยนยอดรวม ทั้งสองฝ่ายรวมความสามารถมัลติโมดัลไว้ในเวตชุดเดียวกัน
ส่วนที่น่าสนใจคือการอ่านผลลัพธ์ ทั้งสองโมเดลตอบคำถามเหมือนกันโดยหลักการ — คือให้คะแนนคำตอบที่เป็นตัวเลือกแทนที่จะสร้างคำตอบขึ้นมา — และมีกลไกที่แตกต่างกันโดยสิ้นเชิง:
• Intern-Decision-4B — จับคู่ทุกตัวเลือกกับสัญลักษณ์โทเคนเดียว (A–Z, จากนั้น a–z, จากนั้น 0–9), เรนเดอร์โครงร่าง JSON ลงในพรอมป์โดยมีตัวแทนชั่วคราวหนึ่งตัวต่อฟิลด์, และรัน causal forward pass หนึ่งครั้ง โดยอ่านค่า logits ณ ตำแหน่งก่อนหน้าตัวแทนชั่วคราวแต่ละตัวโดยทันที กลไกนี้ได้รับการบันทึกไว้ทีละขั้นตอนบนโมเดลการ์ดของมัน รวมถึงขั้นตอน softmax และ temperature ที่แน่นอน
• d3-mini — มาพร้อมสถาปัตยกรรมแบบกำหนดเองใน modeling_d3.py โดยมี readout head แยกต่างหากอยู่ในไฟล์ readout.safetensorsของตัวเอง, มี decision_config.jsonที่ประกาศค่า noncausal_full_attention และการทำ last-token pooling รวมถึงการแมป token-to-code ที่กำหนดไว้ในคอนฟิกแทนที่จะอธิบายด้วยคำบรรยาย
ไม่มีวิธีใดดีกว่าอย่างชัดเจน เส้นทาง InternLM มีข้อได้เปรียบตรงที่มันทำงานบนคลาสโมเดล Hugging Face มาตรฐานที่มีลำดับตัวเลขซึ่งมีเอกสารกำกับ — คุณสามารถตรวจสอบการทำงานของมันได้ เส้นทาง vLLM-SR มีข้อได้เปรียบตรงที่ readout เป็น head ที่ผ่านการฝึกมาแล้ว แทนที่จะเป็นการฉายภาพของ token embedding ที่มีอยู่ ซึ่งเป็นการปรับให้เข้ากับข้อมูลได้อย่างอิสระมากกว่า และข้อเสียคือคุณต้อง trust_remote_code=True และรันโค้ดของพวกเขาเพื่อทำอะไรก็ตาม
ขีดจำกัดที่แต่ละรายเผยแพร่
นี่คือจุดที่ความชอบที่แท้จริงเริ่มก่อตัวขึ้น เพราะการ์ดใบหนึ่งระบุเจาะจงกว่าอีกใบมากว่ามันจะใช้ไม่ได้ตรงไหน
• เพดานอินพุต — Intern-Decision-4B: 8,192 โทเค็นตามค่าเริ่มต้น และคำขอที่เกินกว่านั้นจะถูกปฏิเสธทันที ไม่มีการตัดทอน โดยเพดานถูกกำหนดโดยอาร์กิวเมนต์ของคอนสตรักเตอร์ d3-mini: max_length คือ null ในคอนฟิกที่จัดส่ง และไม่มีโควตาโทเค็นปรากฏอยู่ที่ใดบนการ์ด
• จำนวนคำถามต่อคำขอ — Intern-Decision-4B: 1 ถึง 16 โดยระบุจำนวนตัวเลือกสูงสุดไว้ที่ 62 ตัวเลือกในคำถามใดคำถามหนึ่ง d3-mini: ไม่มีการระบุขีดจำกัด; การ์ดระบุเพียงว่าคำถามจะได้รับคำตอบพร้อมกัน โดยแต่ละข้อมาจาก forward pass ของตัวเอง
• รูปภาพ — Intern-Decision-4B: สูงสุดแปดภาพต่อคำขอ โดยเรียงตามรายการที่คุณระบุ พร้อมตัวประมวลผลเช็กพอยต์ที่จัดการการปรับขนาดและการขยายโทเค็น d3-mini: หลายภาพต่อคำขอในรูปแบบพาธ, URL, รูปภาพ PIL หรือ data URL แบบ base64 โดยแต่ละภาพอ่านที่ความละเอียดสูงสุด 1.6 เมกะพิกเซล และทุกคำถามจะเห็นทุกภาพ
• วิดีโอ — Intern-Decision-4B: ไม่มี. d3-mini: วิดีโอหลายรายการ อ่านที่ 2 เฟรมต่อวินาที จำกัดไว้ที่ 32 เฟรมกระจายทั่วคลิป และ 0.2 เมกะพิกเซลต่อเฟรม
เพดานอินพุตคือเส้นแบ่งที่จะตัดสินเรื่องนี้สำหรับคนส่วนใหญ่ งบประมาณ 8,192 โทเคนที่ต้องแบ่งใช้ระหว่างสถานะ คำสั่งในคำถาม และคำอธิบายแคนดิเดต ถือเป็นข้อจำกัดที่แท้จริงต่องานให้คะแนนเอกสารและการจัดเส้นทางบริบทแบบยาวที่โมเดลเหล่านี้ถูกขายมาเพื่อทำงานนี้ และ InternLM สมควรได้รับคำชื่นชมที่บอกเรื่องนี้อย่างตรงไปตรงมา แทนที่จะปล่อยให้ต้องไปค้นพบเอง ส่วนการที่ vLLM-SR ไม่ระบุไว้กลับเป็นตรงกันข้าม: ไม่ใช่ขีดจำกัดที่ซ่อนอยู่ แต่เป็นขีดจำกัดที่ไม่รู้ และต่อให้อ่านรีพอซิทอรีมากแค่ไหนก็ไม่ช่วยให้กระจ่าง
การปรับเทียบคือจุดแบ่งที่แท้จริง
โมเดลการตัดสินใจทุกตัวให้สัญญาเดียวกัน: ตัวเลขที่มันคืนค่าคือความน่าจะเป็น และเกณฑ์ที่ตั้งไว้เทียบกับค่านั้นมีความหมาย แทบไม่มีโมเดลใดพิสูจน์เรื่องนี้ได้ นี่คือจุดที่สองรุ่นแตกต่างกันมากที่สุด และความแตกต่างนี้ไปในทิศทางตรงกันข้ามกับที่คุณน่าจะเดาจากวันที่เปิดตัว
Intern-Decision-4B เผยแพร่บนการ์ดของตัวเองว่ามีคะแนน Brier 0.347 และค่าความคลาดเคลื่อนการสอบเทียบที่คาดหวัง 0.065 ในค่าเฉลี่ยจากเจ็ด benchmark โดยมีอุณหภูมิที่ฟิตได้ 1.99241824 ซึ่งได้มาจากการลด NLL ให้ต่ำสุดบนเคสสอบเทียบที่กำหนดไว้ 1,728 เคส และเคสตรวจสอบแยกต่างหาก 1,693 เคส มีข้อความระบุชัดเจนว่าป้ายกำกับของชุดทดสอบไม่ได้ถูกใช้ในการเลือกอุณหภูมินั้น และมีการวินิจฉัย 96 เคสที่แสดงว่าการสอบเทียบของมันเปลี่ยนจาก 0.628 Brier / 0.213 ECE ก่อนทำ temperature scaling เป็น 0.550 / 0.089 หลังทำ นอกจากนี้ยังระบุค่าเริ่มต้น และกล่าวว่าการสอบเทียบเป็นแบบแยกตาม checkpoint ดังนั้นการใช้ขนาดอื่นกับโมดูลนี้จะไม่ตรงกัน
Decision 3.0 เผยแพร่ดัชนีความแม่นยำและข้ออ้างเรื่องความครอบคลุม — คำขอสาธารณะทั้ง 140,178 รายการได้รับคำตอบ ไม่มีรายการใดที่ขาดการสนับสนุน — และไม่มีตัวเลขการคาลิเบรตเลยแม้แต่ค่าเดียว ไม่มีคะแนน Brier ไม่มี ECE ไม่มีค่าอุณหภูมิที่ระบุ ณ จุดตรวจสอบใด ๆ จากทั้งหมดหกจุด อุณหภูมิในเวอร์ชันที่ d3 จัดส่งมา decision_config.jsonเป็น 1.0 ซึ่งก็คือฟังก์ชันเอกลักษณ์ และอาจเป็นหรือไม่เป็นค่าที่ได้จากการฟิตก็ได้ ตัวไฟล์ไม่ได้ระบุไว้
อ่านพาดหัวดัชนีทั้งสองข้างเคียงกัน แล้วความไม่สมมาตรก็ยิ่งแย่ลง การ์ดของ d3-mini รายงานคะแนน Jev Decision Index 0.3 public-suite ที่ 54.90 ซึ่งอธิบายว่าวัดด้วยชุดทางการบนเวตที่เผยแพร่ ขณะที่แถวเปรียบเทียบบนบอร์ดเดียวกันถูกอธิบายว่าเป็นข้อมูลบอร์ดสด Intern-Decision-4B รายงานค่าเฉลี่ย 90.02 จากเจ็ดเบนช์มาร์กของตัวเอง ตัวเลขสองตัวนั้นไม่ได้อยู่บนสเกลเดียวกัน ไม่ได้ใช้งานเดียวกัน และการนำมาใส่ประโยคเดียวเพื่อเปรียบเทียบจะเป็นการไม่ซื่อสัตย์ สิ่งที่เทียบกันได้คือการเปิดเผยข้อมูล การ์ดหนึ่งบอกคุณว่าค่าความเชื่อมั่นของมันผิดพลาดแค่ไหน ส่วนอีกการ์ดไม่รู้หรือไม่ยอมบอก

ความหน่วง และเหตุใดชุดมิลลิวินาทีสองชุดจึงไม่สามารถเปรียบเทียบกันได้เช่นกัน
การ์ดทั้งสองใบเปิดเผยค่าความหน่วงต่อคำขอ และการรับค่าดังกล่าวตามที่ปรากฏก็ถือเป็นความผิดพลาด ด้วยเหตุผลเดียวกับที่ตัวเลขความแม่นยำนั้นเปรียบเทียบกันไม่ได้
• Intern-Decision-4B — ค่าเฉลี่ย 44.16 ms, ค่ามัธยฐาน 44.03 ms, p95 44.60 ms วัดบน RTX 4090 เพียงตัวเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง โดยระบุว่า ขึ้นอยู่กับปริมาณงานและฮาร์ดแวร์
• d3-mini — ค่ามัธยฐาน 17.5 มิลลิวินาทีสำหรับข้อความ, 96.2 มิลลิวินาทีเมื่อมีรูปภาพ, 371.5 มิลลิวินาทีเมื่อมีวิดีโอความยาว 10 วินาที บน AMD Instinct MI325X หนึ่งตัว โดยทำทีละหนึ่งคำขอ
มีสองสิ่งที่ทำให้สิ่งเหล่านี้ไม่อาจนำมาเปรียบเทียบกันได้ สิ่งแรกคือฮาร์ดแวร์และเส้นทางของซอฟต์แวร์: 4090 เทียบกับ MI325X, การทำ forward pass ของ Hugging Face แบบมาตรฐาน เทียบกับการใช้งาน attention แบบกำหนดเองที่มีเคอร์เนลแบบ masked-layer ซึ่งเข้าถึงได้ผ่าน flash-linear-attention ส่วนสิ่งที่สองคือเวิร์กโหลด: ตัวเลขของ InternLM ถูกอธิบายว่าเป็นแบบ end-to-end ต่อหนึ่ง query บนส่วนผสมที่ไม่ระบุชัดเจน ขณะที่ของ vLLM-SR แยกออกมาตามรูปแบบอินพุต ดังนั้นการเปรียบเทียบแบบข้อความล้วนจึงเป็นเส้นเดียวที่เทียบกันได้แบบชนิดต่อชนิด และแม้แต่เส้นนั้นก็ยังข้ามผู้ผลิต GPU สองราย
ตัวเลขที่ต้องนำมาจากการ์ดทั้งสองไม่ใช่การจัดอันดับ แต่เป็นรูปร่าง โมเดลการตัดสินใจถูกเรียกใช้ซ้ำ ๆ ภายในเวิร์กโฟลว์ — บันทึกการสนับสนุนอาจต้องมีปลายทาง การตรวจสอบการคืนเงิน การตัดสินใจยกระดับ และคะแนนความสำคัญ สี่คำถาม และชุดบันทึก 128 รายการทำให้เกิด 512 การตัดสินใจ ที่ปริมาณเท่านั้น 17 ms และ 44 ms ต่างก็หายไปเมื่อเทียบกับค่าใช้จ่ายของโมเดลเจเนอเรทีฟที่อยู่ปลายน้ำ ตัวเลขที่ขึ้นอยู่กับรูปแบบคือสิ่งที่ต้องจับตา เพราะคำขอรูปภาพหรือวิดีโอมีค่าใช้จ่ายระหว่างห้าถึงยี่สิบเท่าของคำขอข้อความตามตัวเลขของ d3-mini เอง และการตัดสินใจของคุณกำลังทำบนภาพหน้าจอที่คุณได้นำเข้าโปรไฟล์ต้นทุนที่การปรับใช้โมเดลการตัดสินใจส่วนใหญ่ไม่มี
จะเลือกอันไหนจริงๆ ดี
หากการตัดสินใจที่คุณต้องทำนั้นขึ้นอยู่กับวิดีโอ ก็ไม่ต้องเปรียบเทียบกันให้เสียเวลาและไม่ต้องวิเคราะห์ใด ๆ: Decision 3.0 อ่านวิดีโอได้ ส่วน Intern-Decision-4B อ่านไม่ได้ นั่นคือคำตอบทั้งหมดสำหรับทุกอย่างที่เกี่ยวข้องกับการบันทึกหน้าจอ คลิปจากกล้อง หรือลำดับเฟรม และมันคือช่องว่างของความสามารถที่เพียงพอจะพิสูจน์เหตุผลการมีอยู่ของตระกูลใหม่นี้ได้ด้วยตัวมันเอง
ถ้าอินพุตของคุณเป็นข้อความและรูปภาพเป็นครั้งคราว การเลือกจะขึ้นอยู่กับสองสิ่ง และไม่มีสิ่งใดในสองสิ่งนั้นที่เป็นลีดเดอร์บอร์ด
เลือกใช้ Intern-Decision-4B เมื่อคุณต้องให้เหตุผลเกี่ยวกับค่าเกณฑ์ (threshold) มันเป็นเพียงหนึ่งเดียวในสองตัวนี้ที่บอกคุณว่า 0.9 หมายถึงเก้าครั้งจากสิบหรือไม่ ระบุค่า temperature ของตัวเอง บอกว่าค่า temperature นั้นถูกฟิตกับกรณีใด และบันทึกวิธีอนุมานของมันเป็นขั้นตอนสั้น ๆ ที่มีหมายเลขกำกับ ซึ่งคุณสามารถนำไป implement ใหม่กับคลาสโมเดลมาตรฐานได้ สำหรับ scorer ที่ทำหน้าที่นำหน้าการดำเนินการอัตโนมัติ นั่นคือคุณสมบัติที่สำคัญ และหายากกว่าคะแนนความแม่นยำ
เลือกใช้ Decision 3.0 เมื่อคุณต้องการช่วงรุ่นหรือมอดาลิตี เช็กพอยต์หกจุดตั้งแต่ 0.59B ถึง 26.09B หมายความว่ารูปแบบคำขอเดียวกันสามารถให้บริการได้โดยโมเดลเอดจ์ที่ใช้เวลา 6.7 ms และโมเดลขนาด 27B และตระกูลนี้ใช้อินเทอร์เฟซเดียวกัน ดังนั้นการย้ายระหว่างระดับจึงเป็นการเปลี่ยนการตั้งค่าแทนที่จะเป็นการเขียนใหม่ ข้อควรระวังคือคุณกำลังเชื่อถืองบอินพุตที่ไม่ได้ระบุไว้และคำกล่าวอ้างการสอบเทียบที่ไม่ได้ตรวจสอบ และโมเดลที่ใหญ่ที่สุดในตระกูลคือรุ่นที่ผู้ขายวัดหมายเลขดัชนีบนฮาร์เนสของตัวเอง
ทั้งสองไม่ใช่ค่าเริ่มต้นที่ปลอดภัยในวันนี้ เช็คพอยต์ที่ถูกดาวน์โหลดมากที่สุดของ d3 อยู่บน Hugging Face ประมาณหนึ่งวันแล้ว; Intern-Decision-4B เปิดให้ใช้งานมาสองสัปดาห์แล้วและมียอดดาวน์โหลดประมาณ 3,200 ครั้งและถูกกดถูกใจ 83 ครั้ง ซึ่งเป็นความสนใจแต่ไม่ใช่ทราฟฟิกโปรดักชัน ทั้งสองถูกพอที่จะทดสอบ และไม่มีงานประเมินจากบุคคลที่สามรองรับอยู่เบื้องหลัง หากคุณกำลังจะวางตัวให้คะแนนไว้ข้างหน้าสิ่งที่ใช้จ่ายเงิน สิ่งที่ถูกต้องคือการรันทั้งสองกับเคสที่มีป้ายกำกับของคุณเอง และเปรียบเทียบเส้นโค้งการสอบเทียบ ไม่ใช่แถวดัชนี

จุดที่เราเตอร์ลงตัว ตามจริงแล้ว
OrcaRouter ไม่ได้ให้บริการโมเดลทั้งสองนี้เช็กพอยต์ของ Decision 3.0 เป็นเส้นทางการประมวลผลอนุมานด้วย Python แบบโลคัลในรีโพซิทอรี Hugging Face โดยไม่มี HTTP endpoint ที่เผยแพร่ไว้ และ Intern-Decision-4B มาในรูปแบบคลาสDecisionEngineที่คุณต้องสร้างอินสแตนซ์เอง ทั้งสองอย่างไม่ใช่สิ่งที่เราสามารถจัดเส้นทางให้ได้ในวันนี้ และไม่ควรตีความส่วนใดของบทความนี้ว่าเป็นการอ้างถึงความพร้อมให้บริการ
สิ่งที่เรามีให้บริการคือเวอร์ชันโฮสต์ในตระกูลเดียวกัน typesafe/jev-1.13อยู่ในแคตตาล็อกของเรา ให้บริการผ่าน POST /v1/systemone — เป็นสัญญาแบบ state-and-named-questions เดียวกันกับที่โมเดลโอเพนทั้งสองตัวข้างต้นใช้งาน — ในราคา $0.042 ต่อโทเคนอินพุตหนึ่งล้านโทเคน โดยไม่คิดค่าคอมพลีชัน เพราะมันไม่สร้างคอมพลีชันเลยมันอยู่เคียงข้างโมเดลอื่นอีกกว่า 200 ตัว และนั่นคือประเด็นในทางปฏิบัติสำหรับใครก็ตามที่เปรียบเทียบสองตัวนี้: ตัวให้คะแนนเป็นส่วนที่ถูกของลูป และโมเดลที่ลงมือทำตามการตัดสินใจเป็นส่วนที่แพง การส่งทั้งสองผ่านคีย์เดียว พร้อมการสลับไปยังผู้ให้บริการรายอื่นอัตโนมัติเมื่อผู้ให้บริการมีปัญหา และราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยบวกเพิ่ม 0%หมายความว่าการประเมินโมเดลสำหรับตัดสินใจไม่จำเป็นต้องเซ็นสัญญาฉบับที่สอง หรือเขียนจุดเรียกใช้งานใหม่เมื่อคุณสลับแบ็กเอนด์ หากคุณกำลังอยู่ระหว่างการประเมิน — ซึ่งเป็นสถานะของโมเดลทั้งสองตัวนี้ในตอนนี้ — นั่นคือส่วนที่คุ้มค่าจะตั้งค่าไว้ก่อนที่คุณจะตัดสินใจเลือกตัวใดตัวหนึ่ง

คำถามที่เปิดอยู่
การ์ดทั้งสองใบไม่เห็นด้วยกันเกี่ยวกับสิ่งที่ผู้เขียนโมเดลพึงมีต่อผู้อ่าน และความไม่เห็นด้วยนั้นน่าสนใจกว่าตัวโมเดลเอง InternLM เผยแพร่ค่า temperature และเคสที่ใช้ฟิตโมเดล จากนั้นเผยแพร่ผลการวินิจฉัยที่แสดงว่าการคาลิเบรชันดีขึ้นเพียงใด vLLM-SR เผยแพร่แฮชไฟล์ ปักหมุด revision ฐาน ระบุเป้าหมายฮาร์ดแวร์ที่ต้องการ อ้างเรื่องความครอบคลุม — งานด้านที่มาที่แท้จริง — และไม่มีตัวเลขการคาลิเบรชันเลยแม้แต่ตัวเดียว
การทดสอบว่ารีลีสใดจะเติบโตเต็มที่ ไม่ใช่ว่าตัวไหนชนะบอร์ด แต่คือว่าเช็กพอยต์ Decision ครั้งถัดไปจะถูกปล่อยออกมาพร้อมคะแนน Brier ติดอยู่หรือไม่ และการอัปโหลดครั้งถัดไปของ InternLM จะไปถึงวิดีโอหรือไม่ ทั้งสองอย่างมองเห็นได้จากภายนอก ทั้งสองอย่างตรวจสอบได้ในราคาถูก และยังไม่มีอย่างใดเกิดขึ้นเลย
