การ์ดชื่อเรื่องสำหรับบทความเปรียบเทียบที่ขึ้นว่า Intern-Decision-4B vs Qwen 3.8 คำโปรยว่า ฟอร์เวิร์ดพาส 44 มิลลิวินาที เทียบกับพารามิเตอร์ 2.4 ล้านล้าน พร้อมไอคอนเส้นแบบแบนสามไอคอนที่สื่อถึงตัวให้คะแนนขนาดเล็กที่รวดเร็ว โมเดลให้เหตุผลขนาดใหญ่ และการเปรียบเทียบต้นทุน
Engineering & Research

Intern-Decision-4B กับ Qwen 3.8: การส่งผ่านไปข้างหน้า 44 มิลลิวินาที เทียบกับพารามิเตอร์ 2.4 ล้านล้านตัว

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

InternLM เผยแพร่ Intern-Decision-4B บน Hugging Face เมื่อเช้าวันที่ 26 กันยายน 2026 — ไม่มีโพสต์เปิดตัว ไม่มีบล็อก ลิงก์ GitHub บนการ์ดโมเดลของตัวเองที่คืนค่า 404 และเดโม Space ที่คืนค่า 401 น้ำหนักเป็นของจริงและดาวน์โหลดได้ แต่ประกาศไม่มีอยู่ และโมเดลที่อยู่ข้างใต้พวกมันคือไฟน์จูนของ Qwen3.5-4B ซึ่งเป็นสิ่งที่ทำให้การเปรียบเทียบกับเรือธงที่โฮสต์ไว้มีค่ามากกว่าสเปกชีต สองสิ่งนี้ไม่ใช่คู่แข่ง พวกมันเป็นสองปลายทางของไปป์ไลน์เดียว และคำถามทั้งหมดคือเส้นแบ่งระหว่างพวกมันอยู่ตรงไหน แกนกลางที่แท้จริงคือโมเดล 2.4 ล้านล้านพารามิเตอร์ที่ผู้พัฒนเผยแพร่ในเดือนสิงหาคม และตอนนี้ให้บริการในชื่อ Qwen3.8-Max คิดค่าบริการที่ $2.00 และ $6.00 ต่อล้านโทเค็น; Intern-Decision-4B เป็นการสร้างใหม่แบบ 4.54 พันล้านพารามิเตอร์ของโมเดลฐานอายุเจ็ดเดือนนั้น ซึ่งไม่ปล่อยโทเค็นเลย ตอบคำถามที่มีชนิดได้ถึงสิบหกข้อในฟอร์เวิร์ดพาสครั้งเดียว และไม่มีค่าใช้จ่ายต่อการเรียกใช้เพราะไม่มีเอาต์พุตให้คิดค่าบริการ

คำตอบแบบบรรทัดเดียว: หากงานของคุณคือการตัดสินใจที่มีชุดคำตอบปิดตายตัว Intern-Decision-4B จะเร็วกว่าประมาณห้าสิบเท่าต่อการตัดสินใจหนึ่งครั้ง และมีต้นทุนต่ำกว่าในเชิงโครงสร้าง และจะไม่มีโมเดลระดับแนวหน้าใดเอาชนะมันได้ในแกนแคบ ๆ นั้น หากงานของคุณเป็นอย่างอื่น — การให้เหตุผล บริบทยาว การใช้เครื่องมือ อะไรก็ตามที่คำตอบยังไม่ได้ถูกแจกแจงไว้ในพรอมป์ตของคุณอยู่แล้ว — Qwen 3.8 ไม่ได้แค่ดีกว่าเท่านั้น แต่เป็นเพียงหนึ่งเดียวในสองตัวนี้ที่ทำงานนั้นได้เลย ทุกอย่างด้านล่างนี้是关于การระบุเส้นแบ่งนั้นให้แม่นยำ

อะไรที่ได้รับการยืนยันจริง ๆ และอะไรที่ยังไม่ได้รับการยืนยัน

เริ่มจากหลักฐานก่อน เพราะการวางกรอบเรื่องนี้สำคัญ ไม่มีประกาศจากผู้พัฒนาใด ๆ สำหรับ Intern-Decision-4B ไม่มีข่าวประชาสัมพันธ์ ไม่มีบทความ ไม่มีคำอธิบายรีโพซิทอรีให้อ่าน สิ่งที่มีอยู่ในวันนี้คือรีโพซิทอรี Hugging Face ที่เผยแพร่เมื่อเช้านี้ภายใต้องค์กร internlm — Intern Large Models กลุ่มของ Shanghai AI Laboratory — ซึ่งใช้สัญญาอนุญาต Apache 2.0 พร้อมกับสัญญาอนุญาต Qwen ต้นทางที่เก็บรักษาไว้เคียงข้างในชื่อ LICENSE-QWEN มีเช็กพอยต์พี่น้องสองตัวปรากฏขึ้นห่างกันภายในสี่สิบวินาที: Intern-Decision-0.8B ที่ 853 ล้านพารามิเตอร์ และ Intern-Decision-2B ที่ 2.21 พันล้าน ทั้งสามตัวมีแท็กเดียวกัน — การตัดสินใจ, มัลติโมดัล, การทำนายแบบมีโครงสร้าง — และทั้งสามตัวอยู่ภายใต้คอลเลกชันโมเดลเดียวที่ยังไม่สามารถเข้าถึงได้แบบสาธารณะ

สิ่งที่ยังไม่ได้รับการยืนยัน: นี่คือรุ่นที่เผยแพร่เสร็จสมบูรณ์แล้วหรือเป็นการปล่อยก่อนกำหนด รีโพซิทอรีถูกสร้างเมื่อ 05:36 UTC และถูกแก้ไขอีกครั้งก่อน 08:00 UTC ในวันเดียวกัน และกิจกรรมสาธารณะเพิ่มเติมบนเช็กพอยต์ที่อยู่ในกลุ่มเดียวกันยังคงดำเนินต่อไปหลัง 09:00 InternLM ยังไม่ได้ระบุว่าแผนการนำไปใช้งานที่ตั้งใจไว้คืออะไร ยังไม่ได้เผยแพร่รีโพซิทอรีที่ลิงก์ไปถึง และยังไม่ได้ระบุว่าจะมีเอนด์พอยต์แบบโฮสต์ตามมาหรือไม่ ให้ถือว่าตัวเลข benchmark ทุกตัวในบทความนี้เป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่มีการทำซ้ำ — เพราะ ณ เวลาที่เขียนนี้ ไม่มีข้อความอื่นใดเลยเกี่ยวกับโมเดลนี้ถูกเขียนขึ้นที่ใดเลย เส้นทางการค้นหาสามเส้นทางที่แยกจากกันไม่ให้ผลลัพธ์ใด ๆ เกี่ยวกับชื่อนี้

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

เดิมพันเชิงสถาปัตยกรรม: ตัวให้คะแนน ไม่ใช่ตัวสร้าง

ประโยคที่สำคัญที่สุดในเอกสารของ Intern-Decision-4B เองคือประโยคปฏิเสธ: เส้นทางการอนุมาน "ไม่เรียก generate() หรือสุ่มข้อความแบบอิสระ" นั่นไม่ใช่รายละเอียดการอิมพลีเมนต์ แต่มันคือการออกแบบทั้งหมด และเป็นสิ่งที่ทำให้สิ่งนี้แตกต่างจากการเรียกใช้ Qwen3.8-Max ด้วย JSON schema แล้วหวังว่าวงเล็บปีกกาจะปิด

นี่คือกลไกอย่างที่การ์ดอธิบายไว้ คุณป้อนสถานะที่ใช้ร่วมกัน สคีมาของคำถามที่ตั้งชื่อไว้ และรูปภาพไม่เกินแปดรูป (เป็นทางเลือก) ให้กับโมเดล คำถามแต่ละข้อเป็นหนึ่งในสามประเภท: choice (เลือกหนึ่งจากชุดตัวเลือกที่มีลำดับ), score (ให้คะแนนบนมาตรวัดเชิงอันดับ โดยคืนค่าเป็นค่าคาดหวังถ่วงน้ำหนักด้วยความน่าจะเป็น) หรือ noul (ไบนารี ไม่/ใช่) พร้อมต์ระบบ สถานะ สคีมา และโครงร่าง JSON ของผู้ช่วยแบบสมบูรณ์จะถูกเรนเดอร์โดยมีที่ยึดตำแหน่งหนึ่งอันต่อหนึ่งฟิลด์ จากนั้น — และนี่คือกลเม็ด — โมเดลจะรัน causal forward pass เพียงครั้งเดียว และอ่านค่า logits ณ ตำแหน่งที่อยู่ก่อนหน้าตัวยึดตำแหน่งแต่ละอันทันที จากนั้นทำ softmax เฉพาะเหนือสัญลักษณ์ตัวเลือกที่ฟิลด์นั้นอนุญาต นำการปรับเทียบของเช็กพอยต์มาใช้ และแมปสัญลักษณ์กลับไปเป็นค่าตัวเลือกดั้งเดิมของคุณ

ผลที่ตามมานั้นเป็นรูปธรรม เพราะพื้นที่คำตอบของแต่ละฟิลด์ถูกประกอบขึ้นต่อคำขอ แทนที่จะถูกฝังตายตัวไว้ใน vocabulary head สคีมาที่คุณคิดขึ้นบ่ายนี้จึงไม่ต้องฝึกใหม่ — เพิ่มคำถาม ตัวเลือกก็กลายเป็นสัญลักษณ์ตัวเลือกสำหรับฟิลด์นั้น เพราะไม่มีลูปถอดรหัส จึงไม่มีโทเคนเอาต์พุต ไม่มีเครื่องหมายปีกกาที่ต้องลืม และไม่มีตรรกะการลองใหม่รอบ JSON ที่ผิดรูปแบบ และเพราะคำถามทั้งหมดถูกให้คะแนนจากการอ่านสถานะครั้งเดียวกัน คำถามสิบหกข้อจึงมีต้นทุนเป็น forward pass เพียงหนึ่งครั้ง ไม่ใช่สิบหกครั้ง

ขีดจำกัดก็ชัดเจนเป็นรูปธรรมไม่แพ้กัน และการ์ดก็ระบุไว้อย่างไม่มีการเลี่ยง หนึ่งถึงสิบหกคำถาม สูงสุด 62 ตัวเลือกต่อคำถาม สูงสุดแปดภาพ ค่าสูงสุดเริ่มต้นที่ 8,192 โทเคน — และอินพุตที่เกินกว่านั้นจะถูกปฏิเสธโดยไม่มีการตัดทอนอนุประโยคสุดท้ายนั้นเป็นการตัดสินใจเชิงออกแบบที่ควรค่าแก่การครุ่นคิด: การตัดทอนแบบเงียบคือวิธีที่ตัวจำแนกตอบคำถามที่แตกต่างจากคำถามที่คุณถามอย่างเงียบ ๆ และ InternLM เลือกที่จะล้มเหลวอย่างเสียงดังแทน มันเป็นการตัดสินใจที่ถูกต้อง และมันเป็นกับดักในการปฏิบัติงาน เพราะตั๋วแบบยาวบวกสคีมาบวกภาพจะเกิน 8,192 เร็วกว่าที่คุณคาด และไม่มีเส้นทางที่ราบรื่น — คุณจะเจอข้อผิดพลาด

จุดที่ Intern-Decision-4B ชนะ และไม่ได้สูสีเลย

สองแกน และทั้งสองเป็นเรื่องเชิงโครงสร้างมากกว่าการเพิ่มทีละน้อย

• ความหน่วงต่อการตัดสินใจ — ค่าเฉลี่ย 44.16 ms, มัธยฐาน 44.03 ms, 44.60 ms ที่ p95 วัดบน RTX 4090 ตัวเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง เมื่อเทียบกับ Qwen3.8-Max ซึ่งหน้าต่างเจ็ดวันแบบเรียลไทม์บน playground ของเราแสดงค่า p50 ที่ 2,474 ms และ p95 ที่ 9,789 ms ที่ 55.4 โทเคนเอาต์พุตต่อวินาที นั่นคิดเป็นประมาณ 56 เท่าที่มัธยฐาน และการเปรียบเทียบนี้ไม่ได้ไม่ยุติธรรมเท่าใดนัก หากแต่เป็นการเปรียบเทียบระหว่างการดำเนินการที่แตกต่างกันสองอย่าง: โมเดลหนึ่งจำแนกประเภท อีกโมเดลให้เหตุผลแล้วจึงเขียน ช่องว่างนี้มีอยู่จริง และเหตุผลของมันก็เช่นกัน

• ต้นทุนต่อการตัดสินใจ — และอันนี้เป็นเลขคณิต ไม่ใช่ความเห็น ลองนึกถึงการเรียกใช้คัดแยกงานสนับสนุนที่สมจริง: โทเค็นอินพุต 800 โทเค็นสำหรับ state และ schema และโทเค็นเอาต์พุต 150 โทเค็นสำหรับ JSON แบบมีโครงสร้าง บน Qwen3.8-Max นั่นคือ 800 × $2.00/M บวก 150 × $6.00/M หรือประมาณ $0.0025 ต่อการตัดสินใจ ก่อนจะนับโทเค็นการให้เหตุผลแม้แต่โทเค็นเดียว — และ Qwen3.8-Max เป็นโมเดลที่ให้เหตุผล ดังนั้นฝั่งเอาต์พุตจึงเล็กแบบมองในแง่ดี หนึ่งล้านการตัดสินใจมีค่าใช้จ่ายประมาณ $2,500 หนึ่งล้านการตัดสินใจเดียวกันบน Intern-Decision-4B มีค่าโทเค็นเป็นศูนย์ และใช้เวลา RTX 4090 ประมาณ 12.3 ชั่วโมง Intern-Decision-4B ไม่มีราคาเอาต์พุต เพราะมันไม่มีเอาต์พุต

ข้อแลกเปลี่ยนนี้ตรงไปตรงมาและชัดเจน: 4B ต้องใช้ GPU ที่คุณเป็นเจ้าของหรือเช่า มันครอบครอง GPU นั้น และมันทำได้เพียงสิ่งเดียวเท่านั้น แต่ถ้าสิ่งเดียวนั้นคือสิ่งที่ผลิตภัณฑ์ของคุณทำหลายล้านครั้งต่อวัน การคำนวณข้างต้นก็คือเหตุผลทางธุรกิจทั้งหมด และไม่ว่าความสามารถของโมเดลระดับแนวหน้าจะมีมากเพียงใดก็ไม่เปลี่ยนสิ่งนั้น

ตัวเลขที่ Qwen 3.8 ไม่เผยแพร่: การสอบเทียบ

นี่คือปัจจัยสร้างความแตกต่างแบบเงียบ ๆ และเป็นสิ่งหนึ่งที่การเปรียบเทียบส่วนใหญ่จะมองข้าม เพราะมันไม่ได้ดูเหมือนเกณฑ์มาตรฐาน

Intern-Decision-4B ส่งคืนการแจกแจงเหนือค่าของตัวเลือกคุณ ไม่ใช่แค่ป้ายกำกับ — พร้อมทั้งค่าความเชื่อมั่น และสำหรับคำถามnoul ความน่าจะเป็นของการตอบว่าใช่ที่ผ่านการคาลิเบรตแล้ว InternLM รายงานคะแนน Brier ที่ 0.347 และค่าความคลาดเคลื่อนคาลิเบรชันที่คาดหวังที่ 0.065 ทั่วชุดของตัวเอง และแนบอุณหภูมิที่ฟิตไว้ในเช็กพอยต์: 1.99241824 โดยฟิตแยกต่างหากสำหรับขนาดนี้ผ่านการลด negative log-likelihood ให้ต่ำสุดบน 1,728 กรณีคาลิเบรชันที่กำหนดไว้ พร้อมด้วย 1,693 กรณีตรวจสอบที่กันไว้ ไม่ได้ใช้ป้ายกำกับของชุดทดสอบในการเลือกค่านี้ มีการวินิจฉัยชุดที่สองที่เป็นอิสระจำนวน 96 กรณีในโมเดลการ์ด โดยใช้การแจกแจงอ้างอิงแบบแม่นตรงแทนป้ายกำกับที่สุ่มมา และแสดงให้เห็นว่า Brier/ECE โดยรวมเปลี่ยนจาก 0.628 / 0.213 ก่อนคาลิเบรชัน เป็น 0.550 / 0.089 หลังคาลิเบรชัน — ขั้นตอนคาลิเบรชันลดความคลาดเคลื่อนที่คาดหวังลงมากกว่าครึ่งอย่างชัดเจน

ตอนนี้ลองหาตัวเลขเดียวกันทางฝั่ง Qwen 3.8 ดูสิ มันไม่มีอยู่ตรงนั้น Alibaba เผยแพร่คะแนน Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking และ long-context recall ซึ่งล้วนเป็นตัวชี้วัดความสามารถทั้งสิ้น Alibaba ไม่เผยแพร่ตัวชี้วัดการปรับเทียบสำหรับสมาชิกใด ๆ ในตระกูล Qwen 3.8 เพราะความมั่นใจของโมเดลเจเนอเรทีฟไม่ใช่ปริมาณที่ผู้ขายส่งมอบมาให้ หากระบบของคุณต้องการความน่าจะเป็นที่ใช้กำหนดเกณฑ์ตัดสินหรือใช้จัดเส้นทาง แทนที่จะเป็นคำตอบที่ต้องเชื่อใจ ความแตกต่างนั้นไม่ใช่เรื่องของระดับความมากน้อย โมเดลหนึ่งให้ตัวเลขพร้อมอัตราความผิดพลาดที่มีการบันทึกเอกสารไว้ ส่วนอีกโมเดลให้ข้อความ และคุณต้องสร้างการประเมินความมั่นใจของคุณเองขึ้นมาครอบมัน

ในจุดที่ Qwen 3.8 ชนะ และไม่ใช่แบบสูสีเลยด้วย

พอวางสองอย่างนี้เทียบกันในเรื่องสิ่งที่อาจถูกขอให้ทำ เส้นแบ่งก็จะไม่ละเอียดอ่อนอีกต่อไป

• บริบท — Qwen3.8-Max มีหน้าต่างบริบทขนาด 1,000,000 โทเคน ส่วน Intern-Decision-4B จะปฏิเสธทุกอย่างที่เกิน 8,192 นั่นคิดเป็น 122 เท่า และไม่มีทางหลีกเลี่ยงได้ เพราะเพดานอินพุตถูกบังคับใช้จริง แทนที่จะตัดทอน

• รูปแบบอินพุต — Qwen3.8-Max รับข้อความ รูปภาพ และวิดีโอ ส่วน Intern-Decision-4B รับข้อความและรูปภาพ สูงสุดแปดรูป และโทเคนของรูปภาพจะนับรวมกับงบประมาณ 8,192 เดียวกัน

• การให้เหตุผลและเครื่องมือ — Qwen3.8-Max มีการใช้เครื่องมือ โหมด JSON และการให้เหตุผลอยู่ในขีดความสามารถที่ประกาศไว้ และมีคะแนน Artificial Analysis Intelligence Index ที่ 45.4 เป็นอันดับที่ 15 จาก 145 โมเดลที่ถูกจัดอันดับ โดยมีคะแนน AA Coding ที่ 76.2 อยู่ในอันดับที่ 9 จาก 138 ตัวเลขเหล่านี้เป็นตัวเลขอิสระที่เผยแพร่โดย Artificial Analysis ไม่ใช่คำกล่าวอ้างของผู้ขาย Intern-Decision-4B ไม่มีรายการใน Artificial Analysis ไม่มีคะแนนอิสระใด ๆ และไม่มีความสามารถในการให้เหตุผล วางแผน หรือเรียกใช้งานสิ่งใด

• เอาต์พุตแบบเปิดกว้าง — Qwen3.8-Max เขียนได้ ส่วน Intern-Decision-4B ไม่สามารถสร้างย่อหน้า เหตุผลประกอบ หรือแผนได้ มันทำได้เพียงให้คะแนนตัวเลือกที่คุณคิดจะระบุไว้แล้วเท่านั้น

น่าจดบันทึกไว้ในฝั่ง open-weights ด้วยเช่นกัน: หากคุณต้องการตัวคอร์ Qwen 3.8 เอง ไม่ใช่เส้นทางแบบ hosted แล้ว Qwen3.8-27B คือพี่น้องแบบ dense — 27.8 พันล้านพารามิเตอร์, Apache 2.0, คอนเท็กซ์ 262,144 โทเคน และประมาณ $0.33 / $2.40 ต่อล้านโทเคนในที่ที่ให้บริการ มันทำคะแนนได้ 33.7 บน AA Intelligence Index มันยังมีขนาดใหญ่กว่า Intern-Decision-4B ราวหนึ่งลำดับขนาด ยังเป็นแบบ generative และยังคงเป็นเครื่องมือที่ผิดสำหรับการตัดสินใจแบบ closed-set ในปริมาณมาก — แต่มันคือตัวเลือกตรงกลางที่ซื่อสัตย์ และเป็นตัวเดียวในสามตัวที่ทั้งถูกจริงและเก่งจริงพร้อมกันในคราวเดียว

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

อ่านตาราง benchmark ของ InternLM เองอย่างตรงไปตรงมา

การ์ดของ Intern-Decision-4B มีตารางเปรียบเทียบอยู่ และสิ่งที่ขาดหายไปจากตารางนั้นให้ข้อมูลได้มากกว่าสิ่งที่มีอยู่ในตารางเสียอีก แถวต่าง ๆ ได้แก่ Jev, Laya, SemIf, Kev, JevK5 และ 0.8B กับ 2B ของ InternLM เอง ทุกรายการล้วนเป็นรายการของ System One หรือโมเดลตัดสินใจอีกรายการหนึ่ง — Jev จาก TypeSafe AI, Laya จาก Convai Innovations และอีกสามรายการ ตัวเลขทุกตัวเป็นข้อมูลที่ผู้ขายรายงานบนฮาร์เนสของ InternLM เอง ไม่มีโมเดลระดับแนวหน้าในตารางเลยแม้แต่ตัวเดียว

นั่นไม่ใช่การมองข้าม มันคือขอบเขตของข้อกล่าวอ้างตามจริง ค่าเฉลี่ยหลักของ Intern-Decision-4B ที่ 90.02 จากเจ็ดชุดทดสอบ — Jevbench-Easy 100.00, Jevbench-Original 98.61, Jevbench-Hard 73.87, Typed Decision 80.55, ToolACE 96.45, AG News 90.82, WildJailBreak 89.86 — เป็นข้อกล่าวอ้างว่าจะเป็นผู้นำในหมวดหมู่โมเดลเพื่อการตัดสินใจ ซึ่งเป็นเช่นนั้นจริงในตารางนี้ โดยเอาชนะค่า 88.74 ของ Jev และค่า 57.77 ของ Laya ไม่ใช่ข้อกล่าวอ้างว่าจะแข่งขันกับ Qwen 3.8 และ InternLM ไม่ได้กล่าวอ้างเช่นนั้นที่ไหนเลย การ์ดโมเดลถูกจำกัดขอบเขตไว้ที่หมวดหมู่ของตัวเอง และการตีความชัยชนะในหมวดหมู่ให้เป็นชัยชนะด้านความสามารถคือความผิดพลาดที่ส่วนนี้มีอยู่เพื่อป้องกัน

ข้อควรระวังอีกสองประการ ตัวเลขความหน่วง — ค่าเฉลี่ย 44 มิลลิวินาทีบน 4090 — เป็นการวัดโดยผู้จำหน่าย ขึ้นอยู่กับภาระงานและฮาร์ดแวร์ และการทำ forward pass บน GPU ตัวเดียวไม่ใช่การวัดแบบเดียวกับการเรียก API ที่โฮสต์ไว้ซึ่งรวมการไปกลับผ่านเครือข่ายและการเข้าคิว และการนำร่องคาลิเบรชันมี 96 เคส เป็นการวินิจฉัย ไม่ใช่การวัดประสิทธิภาพ และการ์ดระบุไว้เช่นนั้น

คำถามเรื่องการนำไปใช้งาน ซึ่งเป็นทางแยกที่แท้จริง

ลืมเรื่องเบนช์มาร์กไปสักครู่ แล้วถามว่าจริง ๆ แล้วแต่ละอย่างเรียกร้องอะไรจากคุณในเชิงปฏิบัติ

Intern-Decision-4B มีขนาดประมาณ 9.1 GB บนดิสก์ที่ bf16 — สองแชร์ดภาษาที่ 4.26 GB และ 4.15 GB, วิชันทาวเวอร์ 612 MB และโปรเจกเตอร์ 54 MB มันโหลดผ่าน 16 KB inference.py ที่แนบมาในรีโพซิทอรีเอง โดยมี DecisionEngine คลาสที่คุณสร้างอินสแตนซ์ครั้งเดียวแล้วนำกลับมาใช้ซ้ำ ป้อน Python dict หนึ่งตัวเข้า รับ response dict หนึ่งตัวออก โดยต้องใช้ Python 3.12+ มันทำงานที่ 44 ms บน 4090 และรุ่นน้อง 0.8B นั้นเล็กพอที่จะให้เหตุผลบนเครื่องที่น้อยกว่ามาก แต่โมดูลคืออินเทอร์เฟซ — ไม่มีเซิร์ฟเวอร์ ไม่มีเอนด์พอยต์ที่เข้ากันได้กับ OpenAI และไม่มี API ที่โฮสต์ คุณกำลังสร้างบริการขึ้นมาครอบมัน และหากคุณต้องการสองตัวสำหรับ failover คุณก็ต้องสร้างส่วนนั้นด้วยเช่นกัน

ด้าน generative ของไปป์ไลน์เดียวกันเป็นการตัดสินใจที่แตกต่างออกไปโดยสิ้นเชิง และนั่นคือสิ่งที่เราเตอร์มีไว้เพื่อจริง ๆ Qwen3.8-Max และ Qwen3.8-27B ต่างก็เรียกใช้ได้บน OrcaRouter ภายใต้คีย์ที่เข้ากันได้กับ OpenAI คีย์เดียวกัน ในราคา ราคาตามรายการของผู้ให้บริการ โดยคิดกำไร 0% และส่งผ่านตรง — ดังนั้นเมื่อ Alibaba ปรับราคา Qwen ฝั่งเราก็อัปเดตทันทีในวันเดียวกัน ไม่ต้องรอรอบบิลถัดไป Intern-Decision-4B ไม่ใช่หนึ่งในเส้นทางของเรา และจะไม่เป็นจนกว่า InternLM จะโฮสต์มันที่ไหนสักแห่ง เราไม่คิดจะแกล้งทำเป็นอย่างอื่น สิ่งที่เราครอบคลุมคือครึ่งหนึ่งของไปป์ไลน์นี้ที่เป็นการเรียกผ่านเครือข่าย: คีย์เดียวสำหรับโมเดลกว่า 200 ตัว, การสลับสำรองอัตโนมัติหาก Qwen3.8-Max ทำงานเสื่อมลง — อัตราความผิดพลาดเจ็ดวันแบบเรียลไทม์ของมันอยู่ที่ 1.78% — และความสามารถในการทดสอบ A/B สองเทียร์ของ Qwen 3.8 เทียบกันในเส้นทางการร้องขอเดียวกันก่อนที่คุณจะตัดสินใจเลือกอันใดอันหนึ่ง

แพตเทิร์นไหนที่ควรค่าแก่การนำไปใช้ รันตัวให้คะแนนในเครื่อง เพราะมันถูกและเร็ว และทำงานแคบ ๆ อย่างหนึ่งได้ดี ส่วนขั้นตอนการให้เหตุผลให้จัดเส้นทางไปที่ผู้ให้บริการ เพราะนั่นคือจุดที่การเปลี่ยนผู้ขาย การตัดราคา และการล่มเกิดขึ้นจริง

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

อันไหนที่คุณควรเลือกจริง ๆ

เลือก Intern-Decision-4B หากการตัดสินใจของคุณเป็นแบบ closed-set คำตอบของคุณสามารถแจกแจงได้ครบทั้งหมดในพรอมต์ คุณต้องรันการตัดสินใจแบบเดิมในปริมาณมาก และคุณให้ความสำคัญกับความน่าจะเป็นพอ ๆ กับป้ายกำกับ การจัดเส้นทางตั๋ว การกลั่นกรองเนื้อหาตามอนุกรมวิธานที่กำหนดไว้ตายตัว การสกัดข้อมูลแบบมีโครงสร้างลงในสคีมาที่คุณควบคุมเอง เกณฑ์การให้คะแนน ประตูแบบไบนารี — อะไรก็ตามที่มนุษย์สามารถเขียนรายการตัวเลือกไว้ล่วงหน้าได้ พารามิเตอร์ 4.54 พันล้านตัวนั้นซื่อตรงเกี่ยวกับเพดานความสามารถ การ์ดของโมเดลเองแสดงให้เห็นว่า 4B ได้ 73.87 บน Jevbench-Hard เทียบกับ 100.00 บน Easy ดังนั้นยิ่งรูปแบบการตัดสินใจยากขึ้นเท่าใด โมเดลเล็กก็ยิ่งต้องยอมสละมากขึ้นเท่านั้น

เลือก Qwen 3.8 — หมายถึง Qwen3.8-Max หากคุณต้องการคอร์ที่โฮสต์ไว้ให้ หรือ Qwen3.8-27B หากคุณต้องการเวตที่คุณถือไว้เองได้ — หากคำตอบไม่สามารถแจกแจงล่วงหน้าได้ หากอินพุตยาวกว่า 8,192 โทเค็น หากคุณต้องการเหตุผลประกอบที่แสดงให้มนุษย์ดูได้ หากคุณต้องการการเรียกใช้เครื่องมือ หรือหากคุณต้องการวิดีโอ นอกจากนี้ยังเลือกมันได้หากคุณเพียงไม่ต้องการดูแล GPU: เวลาใช้งาน 4090 จำนวน 12.3 ชั่วโมงต่อการตัดสินใจหนึ่งล้านครั้งนั้นถูกก็ต่อเมื่อคุณมี 4090 อยู่แล้วและมีอย่างอื่นให้ทำกับมันในอีก 363 วัน

เลือกทั้งคู่ หากไปป์ไลน์ของคุณมีรูปร่างแบบที่ไปป์ไลน์ส่วนใหญ่เป็นจริง ๆ — ตัวจำแนกแบบเซตปิดราคาถูกอยู่ด้านหน้า และโมเดลระดับแนวหน้าอยู่ด้านหลังสำหรับเคสที่ตัวจำแนกไม่แน่ใจ นั่นคือการกำหนดค่าที่ความเชื่อมั่นที่ปรับเทียบแล้วของ Intern-Decision-4B ถูกสร้างมาเพื่อ และนั่นคือเหตุผลที่ตัวเลข ECE ข้างต้นสำคัญกว่าค่าเฉลี่ยพาดหัว

ดูอะไรดี

สามคำถามเปิดที่ทั้งหมดตอบได้ภายในไม่กี่วัน InternLM จะเผยแพร่ GitHub repository ที่การ์ดของตัวเองลิงก์ไปถึงหรือไม่ — ซึ่งตอนนี้เป็น 404 — พร้อมกับคำอธิบายการเทรนหรือไม่ จะมีประกาศตามหลังเวตหรือไม่ ซึ่งจะเปลี่ยนการ push เงียบ ๆ ให้กลายเป็น release ที่มีเอกสารกำกับหรือไม่ และมีสิ่งใดที่เป็นอิสระสามารถทำซ้ำค่าเฉลี่ย 90.02 หรือ Brier 0.347 บนฮาร์ดแวร์ที่ไม่ใช่ของ InternLM ได้หรือไม่

มีสิ่งที่ไม่สอดคล้องกันเล็กน้อยหนึ่งอย่างที่ควรสังเกตระหว่างที่คุณรอ เพราะมันเป็นเรื่องประเภทที่สำคัญเมื่อคุณกำลังประเมินขนาดการติดตั้งใช้งาน โมเดลนี้มีชื่อว่า 4B จำนวนพารามิเตอร์คือ 4,539,265,536 — 4.54 พันล้าน รุ่นพี่น้อง 0.8B มี 853 ล้าน และรุ่นพี่น้อง 2B มี 2.21 พันล้าน ทั้งคู่ปัดขึ้นหรือลงเพียงนิดเดียว มีเพียง 4B เท่านั้นที่ปัดลงมากกว่าครึ่งพันล้าน มันไม่ใช่ปัญหา มันเป็นเครื่องเตือนใจว่าในการเปิดตัวที่ยังไม่ประกาศ เอกสารคือสเปกเดียวที่คุณมี และแม้แต่เอกสารก็ยังถูกแก้ไขอยู่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube