การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Intern-Decision-4B vs ContextPilot-8B' มีคำบรรยายใต้ภาพว่า 'ตัวหนึ่งปฏิเสธบริบทแบบยาว อีกตัวจัดการมันได้' พร้อมชิปสามอันที่ระบุข้อความว่า 'ไม่มีการประเมินอิสระสำหรับทั้งคู่' 'ทั้งคู่เปิดตัวโดยไม่มีการประกาศ' และ 'วันนี้ทั้งคู่ยังไม่สามารถ route ได้' โลโก้ OrcaRouter ถูกคอมโพสิตอยู่ที่มุมขวาล่าง
Engineering & Research

Intern-Decision-4B vs ContextPilot-8B: โมเดลที่ย่อบริบทให้เล็กลง กับโมเดลที่จัดการมัน

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เลือกยาพิษของคุณ: internlm/Intern-Decision-4Bปฏิเสธที่จะอ่านเกิน 8,192 โทเคน และ tencent/ContextPilot-8Bถูกสร้างขึ้นมาโดยเฉพาะเพื่ออยู่รอดกับบริบทที่เติบโตอย่างไม่มีขอบเขต พวกมันอยู่ในคลาสขนาดเดียวกัน ทั้งคู่เป็น fine-tune ของฐาน Qwe​n และทั้งคู่เปิดตัวบน Hub โดยไม่มีการประกาศจากผู้ขายและไม่มีการประเมินโดยอิสระใด ๆ — ContextPilot-8B เมื่อวันที่ 27 สิงหาคม 2026, Intern-Decision-4B เมื่อวันที่ 26 กันยายน 2026 — และพวกมันแก้ปัญหาที่ตรงกันข้าม Intern-Decision-4B เป็นโมเดลตัดสินใจแบบมีโครงสร้างขนาด 4.5 พันล้านพารามิเตอร์ที่รัน forward pass ครั้งเดียว อ่าน logits และคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วสำหรับทุกคำถามที่คุณถาม; มันไม่เคยเขียนโทเคนแม้แต่ตัวเดียว ContextPilot-8B เป็นตัวสร้างข้อความขนาด 8.19 พันล้านพารามิเตอร์ที่ถูกฝึกให้วางแผน จดจำ และออฟโหลดบริบทการทำงานของตัวเองระหว่างการรันเอเจนต์ที่ยาวนาน การเปรียบเทียบพวกมันไม่ใช่คำถามเรื่องเบนช์มาร์กจริง ๆ มันเป็นคำถามว่าคุณอยากให้โมเดลกลืนครึ่งไหนของปัญหาของคุณมากกว่ากัน

อย่างแรก สิ่งที่พวกเขามีร่วมกันอย่างแท้จริง

ไม่มีโมเดลใดเลยที่มีตัวเลขแม้แต่ตัวเดียวที่คนนอกแล็บของตัวเองยืนยันแล้ว นั่นเป็นเรื่องผิดปกติพอที่จะต้องกล่าวไว้ก่อนสิ่งอื่นใด เพราะการเปรียบเทียบส่วนใหญ่ในบล็อกนี้อย่างน้อยก็สามารถอาศัยลีดเดอร์บอร์ดอิสระสำหรับฝ่ายใดฝ่ายหนึ่งได้

Intern-Decision-4B เผยแพร่ตารางการประเมินฉบับเต็มบนการ์ดของตน — ค่าเฉลี่ย 90.02 จากเจ็ดชุด คะแนน Brier 0.347 และค่าความคลาดเคลื่อนในการสอบเทียบที่คาดหวัง 0.065 — ทั้งหมดนี้วัดโดย InternLM บนฮาร์เนสของ InternLM เอง ContextPilot-8B ไม่ได้เผยแพร่ตารางใดเลย การ์ดของมันระบุว่าเฟรมเวิร์กนี้ "มีประสิทธิภาพเหนือกว่าเบสไลน์ที่มีอยู่อย่างสม่ำเสมอในโมเดลฐานและเบนช์มาร์กต่างๆ" และชี้ไปที่บทความและไปป์ไลน์การประเมินสำหรับรายละเอียด ดังนั้นสำหรับการจับคู่นี้ บรรทัดการระบุแหล่งที่มาที่ซื่อตรงจึงสั้น: ฝ่ายหนึ่งเป็นข้อมูลที่ผู้ขายรายงานและยังไม่ถูกทำซ้ำ อีกฝ่ายเป็นคำกล่าวอ้างของผู้ขายและยังไม่ได้รับการเผยแพร่ และไม่มีสิ่งใดในหน้านี้ที่เป็นอิสระ

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

เดิมพันสองข้อนี้ พูดกันตรง ๆ

การเดิมพันของ Intern-Decision-4B คือส่วนที่ยากของการตัดสินใจไม่ใช่การให้เหตุผล แต่เป็นการตัดสินใจเลือก ให้สถานะ สคีมาของคำถามที่มีชื่อ และรูปภาพสูงสุดแปดรูปแก่มัน และมันจะคืนค่าการกระจายตัวเหนือสตริงตัวเลือกของคุณเอง ขั้นตอนการอนุมานเป็นแบบดีเทอร์มินิสติกและมีรูปร่างคงที่: จับคู่ตัวเลือกกับสัญลักษณ์โทเค็นเดียว สร้างโครงร่าง JSON ของผู้ช่วยที่มีตัวยึดตำแหน่งหนึ่งตัวต่อฟิลด์ เรียกใช้ causal forward pass หนึ่งครั้ง อ่านค่าลอจิตทันทีก่อนตัวยึดตำแหน่งแต่ละตัว ทำ softmax เฉพาะผู้สมัครของฟิลด์นั้น ใช้ค่าอุณหภูมิที่ปรับให้พอดี ไม่มีลูปการถอดรหัส ดังนั้นจึงไม่มีตัวแยกวิเคราะห์และไม่มีพื้นผิวการหลอนแบบข้อความอิสระ ราคาของการเดิมพันนั้นคือเพดานอินพุตแบบตายตัว — การ์ดกล่าวว่าอินพุตที่สูงกว่า DecisionEngine(max_length=8192) จะถูก "ปฏิเสธโดยไม่มีการตัดทอน".

ContextPilot-8B เป็นภาพสะท้อน: ปล่อยให้เอเจนต์สร้างโทเค็นต่อไป แต่สอนให้มันแก้ไขสิ่งที่มันกำลังสร้าง มันเพิ่มการวางแผน บริบทยาวแบบมีโครงสร้าง การดึงข้อมูล และบริบทแบบซอฟต์ออกจากชุดเครื่องมือของเอเจนต์ และฝึกเช็กพอยต์ด้วยสูตร RL ที่สุ่มตัวอย่างกิ่งก้านบนการตัดสินใจแก้ไขบริบทที่มีความสำคัญ และกำหนดเครดิตในระดับการกระทำแทนที่จะเป็นระดับวิถี การ์ดนี้พูดตรงไปตรงมาเกี่ยวกับผลที่ตามมาในแง่การแพ็กเกจ: การโหลดเช็กพอยต์ไม่ได้ให้การจัดการบริบทแก่คุณ คำจำกัดความของเครื่องมือ รันไทม์ของเอเจนต์ และไปป์ไลน์การประเมินผลนั้นอยู่ที่อื่น และต้องนำมาด้วย

สกอร์บอร์ด แยกเป็นมิติทีละด้าน

• เอาต์พุต — Intern-Decision-4B ไม่ปล่อยข้อความใดๆ ออกมาเลย มีเพียงความน่าจะเป็นเหนือค่าตัวเลือกของคุณ; ContextPilot-8B สร้างผลลัพธ์ตามปกติ และคำตอบของมันเป็นข้อความร้อยแก้วและการเรียกใช้เครื่องมือที่คุณต้องแยกวิเคราะห์

• เพดานอินพุต — Intern-Decision-4B ปฏิเสธทุกอย่างที่เกิน 8,192 โทเคน; ContextPilot-8B สืบทอดขีดจำกัดตำแหน่ง 40,960 โทเคนของ Qwen3-8B และถูกออกแบบให้ทำงานต่อไปได้ขณะที่บริบทที่มีประสิทธิภาพขยายเพิ่มขึ้น

• พารามิเตอร์ — 4.54B BF16 สำหรับ Intern-Decision-4B กระจายอยู่ทั่ว text tower, vision tower และ projector; 8.19B BF16 สำหรับ ContextPilot-8B ซึ่งเป็นโมเดลภาษาเชิงสาเหตุ Qwen3 แบบ dense ธรรมดา

• ความหน่วง — Intern-Decision-4B ทำงานที่ค่าเฉลี่ย 44.16 ms และ 44.60 ms ที่ P95 บน RTX 4090 ใบเดียว ตามการ์ดของตัวเอง; ContextPilot-8B ไม่เผยแพร่ตัวเลขความหน่วง และต้นทุนของมันแตกต่างโดยพื้นฐาน เพราะมันสร้างโทเค็นแทนที่จะให้คะแนนโทเค็นเหล่านั้น

• รูปภาพ — Intern-Decision-4B รองรับได้สูงสุดแปดภาพ และโทเค็นรูปภาพนับรวมกับเพดาน 8,192; การ์ดของ ContextPilot-8B ระบุว่าเป็นเช็กพอยต์สำหรับการสร้างข้อความที่ไม่มีเส้นทางมัลติโมดัล

• สัญญาอนุญาต — Intern-Decision-4B ใช้สัญญาอนุญาต Apache-2.0 โดยมีสัญญาอนุญาต Qwen ต้นทางเก็บรักษาไว้เคียงข้างกัน; สัญญาอนุญาตของ ContextPilot-8B ขึ้นต้นด้วยข้อ 0 ว่า "จัดให้ใช้ได้เฉพาะเพื่อวัตถุประสงค์ในการวิจัยและพัฒนาทางวิทยาศาสตร์เท่านั้น คุณจะต้องไม่นำไปใช้เพื่อวัตถุประสงค์อื่นใด"

• หลักฐานที่ตีพิมพ์ — ด้านหนึ่งเป็นตารางเจ็ดชุดพร้อมการวินิจฉัยการสอบเทียบ; อีกด้านหนึ่งเป็นบทคัดย่อของบทความและตัวชี้ไปยังคลังการประเมิน

• ประวัติผลงาน — ทั้งคู่เงียบ Intern-Decision-4B มีไลก์ 1 ครั้งและดาวน์โหลด 0 ครั้งตั้งแต่ 26 กันยายน 2026; ContextPilot-8B มี 11 ไลก์และดาวน์โหลดราวหนึ่งพันครั้งตั้งแต่ 27 สิงหาคม 2026 ซึ่งได้รับความสนใจมากกว่า แต่ก็ยังไม่มีการประเมินจากบุคคลที่สาม

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

จุดที่แต่ละอันพังจริง ๆ

โหมดความล้มเหลวของ Intern-Decision-4B เป็นเชิงโครงสร้าง และควรอธิบายให้เป็นรูปธรรม หากหลักฐานสำหรับการตัดสินใจไม่พอดีใน 8,192 โทเค็น โมเดลจะไม่เสื่อมประสิทธิภาพอย่างนุ่มนวล — มันจะปฏิเสธคำขอ นั่นเป็นทางเลือกทางวิศวกรรมที่สมเหตุสมผล และเข้ากันได้แย่มากกับภาระงานที่ ContextPilot-8B ถูกสร้างขึ้นมาเพื่อรองรับโดยเฉพาะ การตั้งค่าของการ์ดเองทำให้ความตึงเครียดชัดเจนขึ้น: text tower ภายใต้ wrapper ประกาศขีดจำกัดตำแหน่ง 262,144 โทเค็น แบ็กโบนสามารถจัดการกับโทเค็นได้ถึงสองแสนห้าหมื่น และ wrapper ที่เผยแพร่จะไม่ยอมรับเกินแปดพัน

โหมดความล้มเหลวของ ContextPilot-8B คือมันไม่ใช่สิ่งที่ยกมาใช้แทนได้ทันทีกับอะไรทั้งนั้น มันเป็นเช็กพอยต์ที่อยู่ภายในเฟรมเวิร์ก และพฤติกรรมต่าง ๆ อยู่ที่เฟรมเวิร์กนั้น ถ้าดึงเวตออกมาโดยไม่มีนิยามเครื่องมือและรันไทม์ของเอเจนต์ สิ่งที่ได้ก็คือ Qwen3-8B ที่ผ่านการไฟน์จูน ซึ่งความสามารถอันเป็นเอกลักษณ์ของมันไม่ทำงาน เมื่อรวมกับมาตรา 0 ของสัญญาอนุญาต คำตอบในทางปฏิบัติสำหรับการนำไปใช้งานเชิงพาณิชย์ก็คือ คุณไม่สามารถใช้มันได้เลยในสภาพที่ส่งมอบมา ซึ่งยังหมายความว่ามันไม่ใช่เส้นทางที่เป็นตัวเลือกสำหรับเรา ทั้งตอนนี้หรือในเร็ว ๆ นี้

การดีพลอยแต่ละรายการ หากคุณกำลังจะดำเนินการ

Intern-Decision-4B ต้องการ GPU เล็ก ๆ และไม่ต้องมี serving stack ที่เรียกได้ว่าสมชื่อ: ติดตั้ง PyTorch 2.9.1 และ Transformers 5.14.1 บน Python 3.12 โหลดสี่ shard ครั้งเดียว เก็บ engine ไว้ในหน่วยความจำตลอด และให้คะแนน เนื่องจาก forward pass มีรูปร่างคงที่ P50 และ P95 จึงห่างกันไม่เกินหกในสิบของมิลลิวินาที ดังนั้นการวางแผน capacity จึงเป็นเรื่องของ concurrency มากกว่า tail latency ส่วนที่ยุ่งยากคือมันมาในรูปแบบคลาส Python ที่ import ได้ ไม่ใช่บริการ HTTP ดังนั้นการนำมันไปไว้หน้าผู้เรียกในโปรดักชันจึงหมายความว่าคุณต้องห่อมันเอง

ContextPilot-8B ต้องการการดูแลแบบตรงกันข้าม: เส้นทางการให้บริการจริง ตัวรันเครื่องมือ แหล่งเก็บหน่วยความจำ และสภาพแวดล้อมแบบ rollout ที่รองรับการแตกแขนง หากคุณตั้งใจจะฝึกใหม่หรือประเมินมันตามที่ออกแบบไว้ นี่ไม่ใช่โมเดลที่คุณลองใช้ในบ่ายเดียว แต่มันคือกรอบงานวิจัยที่คุณต้องนำมาใช้

เราเตอร์ช่วยตรงนี้ได้ไหม

บางส่วน และเวอร์ชันที่ตรงไปตรงมาก็แคบกว่าที่เคยเป็น OrcaRouter ไม่ได้ระบุ Intern-Decision-4B, ContextPilot-8B หรือเช็กพอยต์สำหรับให้คะแนนการตัดสินใจใด ๆ ที่เทียบเคียงได้ในแคตตาล็อกของตน — หน้าโมเดลของเราทั้งสองตัวขึ้น 404 และไม่มีสิ่งใดในบทความนี้ที่ควรถูกตีความเป็นข้ออ้างเรื่องความพร้อมใช้งาน สิ่งที่เอนด์พอยต์แบบรวมศูนย์มอบให้คุณจริง ๆ คือความสามารถในการวางการทดลองที่ล้มเหลวไว้หลังทางเลือกสำรอง: คีย์เดียวครอบคลุมโมเดลกว่า 200 ตัว ราคาตามรายการของผู้ให้บริการส่งต่อโดยบวกเพิ่ม 0% และ การสลับไปใช้ระบบสำรองอัตโนมัติ เพื่อให้ตัวให้คะแนนที่คุณยังอยู่ระหว่างการประเมินไม่กลายเป็นจุดล้มเหลวจุดเดียว นั่นเป็นประโยชน์จริงสำหรับฝั่ง Intern-Decision ของการเปรียบเทียบนี้ ซึ่งโมเดลทำงานได้อย่างประหยัดและในเครื่องจริง ๆ สำหรับ ContextPilot-8B เรื่องนี้ไม่มีความหมาย เพราะสัญญาอนุญาตสำหรับการวิจัยและพัฒนาเท่านั้นปิดกั้นเส้นทางเชิงพาณิชย์ไม่ว่าเราเตอร์ใดจะรองรับอะไรก็ตาม

งั้นอันไหนล่ะ

ถ้าคำถามของคุณมีชุดคำตอบแบบปิด มาพร้อมกับหลักฐานแนบมา และต้องการความน่าจะเป็นมากกว่าคำอธิบาย Intern-Decision-4B เป็นตัวที่น่าสนใจกว่า — ราคาถูก มีรูปแบบตายตัว คาลิเบรตโดยการออกแบบ และซื่อสัตย์เกี่ยวกับอินพุตที่มันจะไม่ยอมรับ ถ้าปัญหาของคุณคือหลักฐานไม่หยุดไหลมา ตัวให้คะแนนการตัดสินใจใดๆ ก็ไม่ช่วยคุณ และ ContextPilot-8B ตั้งเป้าไปที่เป้าหมายที่ถูกต้อง โดยมีข้อแม้ว่าคุณกำลังรับเอากรอบงานและใบอนุญาตวิจัยมากกว่าเป็นโมเดล

สิ่งที่ทำให้เรื่องนี้ได้ข้อยุติคือการทดสอบที่ทั้งสองผู้ขายยังไม่ได้ทำ: ยื่นโจทย์การตัดสินใจแบบสั้นและมีโครงสร้างแบบเดียวกันให้ทั้งคู่ โดยคำตอบสามารถคำนวณได้จากสถานะ แล้วดูว่าค่าเฉลี่ย 90.02 ของตัวให้คะแนนจะยังคงใช้ได้นอกชุดทดสอบของตัวเองหรือไม่ จนกว่าจะมีใครทำเช่นนั้น การตีความที่ถูกต้องของการจับคู่นี้ก็คือ สองโมเดลไม่ได้แข่งขันกันในตำแหน่งเดียวกันเลย

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube