การ์ดชื่อเรื่องหลักสำหรับ AstaBrief 8B กับ ContextPilot 8B: สองคำตอบต่อโมเดลฐาน 8B เดียวกัน โดยระบุฐาน Qwen3-8B ที่ใช้ร่วมกันและงานสองอย่างที่ตรงกันข้าม พร้อมโลโก้ OrcaRouter ที่มุม
Guides & Insights

AstaBrief 8B กับ ContextPilot 8B: สองคำตอบต่อโมเดลฐาน 8B เดียวกัน

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วาง AstaBrief 8B และ ContextPilot 8B ไว้บนสเปกชีตเดียวกัน แล้วหกแถวแรกจะเหมือนกันทุกประการ ทั้งคู่เป็นเช็กพอยต์แบบ dense 8B ที่ผ่านการ fine-tune จาก Qwen/Qwen3-8B ทั้งคู่สืบทอดสถาปัตยกรรมเดียวกัน — 36 เลเยอร์, ขนาด hidden 4096, 32 หัวความสนใจพร้อม 8 หัว key-value, คำศัพท์ 151,936 โทเคน และเพดานตำแหน่ง 40,960 โทเคนของโมเดลฐาน ไม่มีตัวใดเป็นสถาปัตยกรรมใหม่ และไม่มีตัวใดพยายามเป็นเช่นนั้น พวกมันคือสองแล็บที่นำน้ำหนักฐานที่แช่แข็งชุดเดียวกันมาใช้ แล้วสอนงานที่แตกต่างกันสองงานให้กับมัน และงานทั้งสองชี้ไปที่ปลายคนละด้านของเอเจนต์วิจัยระยะยาว: AstaBrief 8B เขียนรายงานฉบับสมบูรณ์ที่อ้างอิงแล้ว และ ContextPilot 8B รักษาบริบทการทำงานของเอเจนต์ไม่ให้ยุบตัวในขณะที่มันรวบรวมเนื้อหา

นั่นคือการเปรียบเทียบทั้งหมดในบรรทัดเดียว และนั่นก็เป็นเหตุผลว่าทำไมสิ่งนี้จึงไม่ใช่การเปรียบเทียบแบบตัวต่อตัวที่คุณควรอ่านเป็นแบบผู้ชนะได้ทั้งหมด ในเรื่องสัญญาอนุญาต หลักฐาน และข้อกำหนดด้านรันไทม์ โมเดลทั้งสองแตกต่างกันโดยสิ้นเชิง และความแตกต่างนี้ให้ข้อมูลมากกว่าคะแนนใด ๆ ที่ทั้งสองห้องแล็บเผยแพร่

เรขาคณิตของเช็คพอยต์เดียวกัน แต่มีการสืบทอดที่แตกต่างกันสองแบบ

เริ่มจากสิ่งที่แชร์กันจริง ๆ ก่อน เพราะมันเป็นตัวกำหนดขอบเขตของทุกอย่างที่เหลือ AstaBrief 8B ของ Ai2 และ ContextPilot 8B ของ Tencent ต่างประกาศว่าใช้ Qwen3-8B เป็นฐาน และทั้งคู่มีพารามิเตอร์ประมาณ 8 พันล้านตัว รีพозиториของ ContextPilot 8B บันทึกน้ำหนัก BF16 ไว้ 16.38 GB กระจายในไฟล์ safetensors สี่แชร์ด ซึ่งเป็นน้ำหนักที่โมเดล dense ขนาด 8B ควรมี เพดานบริบทเป็นของโมเดลฐาน ไม่เปลี่ยนแปลงในทั้งสอง: 40,960 ตำแหน่งในคอนฟิก เทรนที่ 32K และขยายได้ด้วย YaRN ไม่มีโมเดลใดเป็นโมเดลบริบทยาว AstaBrief 8B ไม่จำเป็นต้องเป็นเช่นนั้น เพราะมันได้รับข้อความตัดตอนมาให้แทนที่จะเป็นคลังข้อความทั้งชุด ส่วน ContextPilot 8B จงใจไม่เป็นเช่นนั้น เพราะแนวคิดหลักของมันคือทำให้หน้าต่างขนาดเล็กทำงานหนักขึ้น

สิ่งที่แต่ละแล็บเปลี่ยนแปลงไปคือเป้าหมายในการเทรน และเป้าหมายเหล่านั้นแทบจะแตกต่างกันไม่ได้มากไปกว่านี้อีกแล้ว

• วิธีการหลังการฝึก — AstaBrief 8B: การปรับละเอียดแบบมีผู้สอน จากนั้นการปรับให้เหมาะสมตามความชอบโดยตรงแบบออฟไลน์, ตัวอย่าง SFT 47K และคู่ความชอบประมาณ 6K, บน H100s แปดตัว

• วิธีการหลังการฝึก — ContextPilot 8B: การเรียนรู้แบบเสริมกำลังบนกรอบการจัดการบริบทเชิงรุก โดยมีการผสานเวกเตอร์งานจากการรัน SFT เฉพาะทางสามครั้งซึ่งซ้อนทับลงบนฐานมาตรฐาน

• งานนี้ — AstaBrief 8B: เขียนรายงานหลายส่วนพร้อมการอ้างอิงแทรกในเนื้อหาจากคำถามและข้อความตัดตอนจากวรรณกรรมที่ดึงมา ในครั้งเดียว

• งานนี้ — ContextPilot 8B: วางแผน เก็บความทรงจำระยะยาว ดึงข้อมูลจากดัชนี และถ่ายโอนบริบทที่เอเจนต์ยังไม่จำเป็นต้องใช้ออกไป ในขณะที่ยังคงใช้เหตุผลและเรียกใช้เครื่องมือ

• รันไทม์ — AstaBrief 8B: การให้บริการแบบมาตรฐานด้วย vLLM หรือ Transformers พร้อมรูปแบบพรอมป์ต์ที่แนะนำจากชุดข้อมูล AstaBrief_prompts

• Runtime — ContextPilot 8B: รันไทม์เอเจนต์ของ Tencent คำนิยามเครื่องมือ และไปป์ไลน์การประเมินจากรีโพซิทอรี Tencent/ContextPilot เช็กพอยต์เพียงอย่างเดียวไม่ใช่เอเจนต์ที่ทำงานได้

• สัญญาอนุญาต — AstaBrief 8B: Apache-2.0. ContextPilot 8B: ข้อความ Apache-2.0 แบบกำหนดเอง โดยมีข้อ 0 เพิ่มเติมซึ่งจำกัดการใช้เฉพาะเพื่อการวิจัยและพัฒนา

• หลักฐาน — AstaBrief 8B: ตารางเกณฑ์มาตรฐานที่ผู้ขายรายงานเอง พร้อมตัวเลขการใช้งานจริงในช่วงเริ่มต้นจากแพลตฟอร์ม Asta ของ Ai2 ContextPilot 8B: ข้อกล่าวอ้างในบทความ arXiv ที่ได้รับการตอบรับให้ตีพิมพ์ใน main track ของ EMNLP 2026; การ์ดโมเดลไม่มีตัวเลขใด ๆ และไม่มีบุคคลที่สามรายใดทำซ้ำผลเหล่านั้นได้

สองแถวในรายการนั้นมีน้ำหนักมากกว่าแถวที่เหลือ แถวเรื่องสัญญาอนุญาตเป็นตัวตัดสินว่าคุณจะนำโมเดลไปใส่ในผลิตภัณฑ์ได้หรือไม่ตั้งแต่แรก ข้อกำหนด Apache-2.0 ของ AstaBrief 8B อนุญาตให้ใช้เชิงพาณิชย์ ส่วนข้อกำหนดเพิ่มเติมของ ContextPilot 8B ไม่ได้อนุญาต แถวเรื่องรันไทม์เป็นตัวตัดสินว่าคุณต้องรับเอาส่วนไหนของแล็บมาพร้อมกับน้ำหนักโมเดลมากแค่ไหน AstaBrief 8B เป็นเช็กพอยต์ที่คุณหยิบไปวางในสแตกการเสิร์ฟที่มีอยู่แล้วได้ ContextPilot 8B เป็นส่วนประกอบของเฟรมเวิร์ก และส่วนที่ทำให้เฟรมเวิร์กทำงานได้ — ข้อตกลงของเครื่องมือ ตรรกะการโรลเอาต์ และการจัดสรรเครดิต — อยู่ในโค้ดของ Tencent ไม่ใช่ในแชร์ดที่คุณดาวน์โหลด

A two-column scoreboard headed 'AstaBrief 8B vs ContextPilot 8B — the scoreboard'. The AstaBrief column reads base model Qwen3-8B, job 'write the cited report', post-training 'SFT then DPO', context 40K inherited, licence Apache 2.0, evidence 'vendor tables only'; the ContextPilot column reads base model Qwen3-8B, job 'manage agent context', post-training 'RL plus task-vector merge', context 40K inherited, licence 'research-only clause', evidence 'paper claims only'. A footer reads 'Both vendor-reported, unreproduced; no independent scores yet.'

ที่แต่ละสิ่งได้รับตำแหน่งของมันมาอย่างสมเหตุสมผลจริง ๆ

วิธีที่มีประโยชน์ในการเปรียบเทียบทั้งสองก็คือมองว่ามันเป็นเอเจนต์ย่อยที่อยู่เคียงข้างกันในไปป์ไลน์ที่ทั้งสองแล็บต่างกำลังมุ่งเข้าหากันจากทิศทางตรงกันข้าม

เอเจนต์สังเคราะห์วรรณกรรมมีชั้นการค้นคืน ชั้นบริบท และชั้นการสร้าง ContextPilot 8B มุ่งแก้ที่ชั้นบริบท โดยมอบความสามารถในการวางแผนให้เอเจนต์ หน่วยความจำระยะยาวแบบมีโครงสร้างพร้อมการเขียน/อัปเดต/อ่านบันทึก การค้นคืนจากดัชนี และการออฟโหลดบริบทแบบซอฟต์ เพื่อให้หน้าต่างบริบทขนาดพอประมาณยังใช้งานได้ตลอดทราเจกทอรีที่ยาว ข้อโต้แย้งของบทความคือโมเดลแก้ไขบริบทก่อนหน้านี้มีจุดอ่อนร่วมกันสามประการ และกรอบงานนี้จัดการกับจุดอ่อนเหล่านั้นพร้อมกัน ได้แก่ ชุดเครื่องมือที่กว้างขึ้น partial rollout ที่คำนึงถึงบริบทซึ่งมุ่งการสำรวจไปยังการแก้ไขที่เปลี่ยนแปลงทราเจกทอรีจริง ๆ และการกำหนดเครดิตแบบละเอียด เป้าหมายการประเมินคือ QA บริบทยาวและการค้นหาเชิงลึก: InfBench, NovelQA, LongMemEval, BrowseComp+ ตามที่เราอ่านรีโพซิทอรีมาก่อนหน้านี้

AstaBrief 8B โจมตีชั้นการสร้าง และสมมติว่าปัญหาบริบทได้รับการแก้ไขแล้วในต้นทาง มันไม่ดึงข้อมูล สรุปข้อความ จัดกลุ่มธีม หรือตัดสินใจว่าจะเก็บหลักฐานใดไว้ Ai2 ได้นำทั้งหมดนั้นออกจากงานของโมเดล และฝึกให้มันเขียนรายงานในรอบเดียวจากข้อความที่เลือกมาโดยคนอื่น การเดิมพันคือว่าโครงสร้างที่มีราคาแพงไม่ใช่ที่ที่คุณภาพอยู่: Ai2 รายงานว่าการเขียนใหม่ในรอบเดียวเทียบเท่ากับไปป์ไลน์หลายขั้นตอนที่ขับเคลื่อนด้วย Claude ในเมตริกที่ติดตาม ขณะที่ลดเวลาการสร้างไปป์ไลน์ทั้งหมดจาก 178.5 วินาที เหลือ 51.1 วินาที

เมื่อนำมารวมกัน โมเดลทั้งสองอธิบายการแบ่งงานที่ห้องแล็บใดก็อาจร่างขึ้นมาได้ โมเดลหนึ่งรักษาชุดทำงานให้เล็กและทำให้หลักฐานไหลเวียนต่อเนื่อง อีกโมเดลเปลี่ยนหลักฐานที่หลงเหลือให้เป็นร้อยแก้วพร้อมการอ้างอิงแนบท้าย รูปแบบความล้มเหลวทั้งสองเสริมกันมากกว่าจะทับซ้อนกัน ตัวจัดการบริบทที่ตัดข้อความยกมาผิดชิ้นจะทำให้พิษต่อนักเขียนที่ดี และนักเขียนที่ดีที่ได้รับข้อความยกมาที่แย่จะสร้างรายงานที่ลื่นไหลแต่เกี่ยวกับเรื่องผิด

ความเสริมนี้เป็นเหตุผลให้มองแต่ละส่วนเป็นคอมโพเนนต์ที่สลับเปลี่ยนได้ มากกว่าจะเป็นข้อผูกมัดระยะยาว ถ้าคุณสร้างครึ่งที่เป็นบริบทด้วย ContextPilot 8B ครึ่งที่สร้างรายงานควรอยู่หลังอินเทอร์เฟซที่ไม่สนใจว่าเบื้องหลังเป็นโมเดลใด — AstaBrief 8B ที่โฮสต์เองในด้านหนึ่ง โมเดล frontier แบบโฮสต์ในอีกด้านหนึ่ง และความสามารถในการย้ายไปมาระหว่างกันโดยไม่ต้องเขียนไปป์ไลน์ใหม่ การรันทั้งสองส่วนผ่านปลายทางเดียวคือสิ่งที่ทำให้มันเป็นการเปลี่ยนแปลงการตั้งค่าแทนที่จะเป็นการย้ายระบบ: API เดียวครอบคลุมโมเดลกว่า 200 รายการ โดยส่งผ่านราคาตามรายการของผู้ให้บริการที่บวกกำไร 0% การสลับอัตโนมัติเมื่อผู้ให้บริการมีประสิทธิภาพลดลงและ DSL สำหรับการกำหนดเส้นทางเมื่อคุณต้องการประกอบหลายโมเดลไว้ในการเรียกครั้งเดียว ตัวเขียนที่โฮสต์เองยังคงโฮสต์เอง เพราะนั่นคือส่วนที่มีเรื่องความอ่อนไหวของข้อมูล ทุกอย่างรอบๆ ยังคงกำหนดเส้นทางได้ เพราะนั่นคือจุดที่ความยืดหยุ่นมีต้นทุนต่ำ

A screenshot of the Hugging Face model card for Tencent/ContextPilot-8B showing the TextGeneration tag, the 'other' licence line, the qwen3, context-management, tool-use and agent tags, the arXiv identifier 2608.28476 and the model title 'ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL'.

สภาพที่ตรงไปตรงมาของหลักฐาน

ทั้งสองโมเดลไม่มีกระดานคะแนนที่เป็นอิสระ และห้องแล็บทั้งสองแห่งก็ไม่ได้วัดสิ่งเดียวกันด้วยซ้ำ

• AstaBrief 8B, ค่าเฉลี่ย SQABench-CS2 (ตามที่ผู้ขายรายงาน): 87.0 บนชุดทดสอบ เทียบกับ 83.7 สำหรับเช็กพอยต์ SFT ของตัวเอง และ 77.3 สำหรับ Qwen3-8B ฐาน

• AstaBrief 8B, DeepScholarBench (ตามที่ผู้ขายรายงาน): 53.50 เป็นรอง Asta ScholarQA ของ Ai2 เองที่ 60.25 และ DR-Tulu-8B ที่ 56.26

• AstaBrief 8B อัตราการชนะแบบจับคู่เมื่อเทียบกับไปป์ไลน์ที่ขับเคลื่อนด้วย Claude ของ Ai2 (ตามที่ผู้ขายรายงาน): 55% บน SQABench-CS2 ชุดพัฒนา, 72% บนชุดทดสอบ

• ContextPilot 8B: ตัวเลขมีอยู่เฉพาะในเปเปอร์เท่านั้น บนแบบทดสอบ long-context QA และ deep-search; ไม่มีตัวเลขบนการ์ดโมเดล และไม่มีการทำซ้ำโดยบุคคลที่สาม

ข้อควรระวังหนึ่งประการใช้กับคอลัมน์ AstaBrief ทั้งหมด และ Ai2 ระบุไว้ในบล็อกเองว่า การฝึกและการประเมินส่วนใหญ่เสร็จสิ้นในปี 2025 ดังนั้นโมเดลที่นำมาเปรียบเทียบจึงสะท้อนระดับแนวหน้า ณ เวลานั้น และแล็บยังไม่ได้รันการประเมินซ้ำกับโมเดลระดับแนวหน้าในปัจจุบัน โปรดอ่านเปอร์เซ็นต์เหล่านั้นเป็นหลักฐานเกี่ยวกับการตัดสินใจด้านการออกแบบ ณ จุดหนึ่งของเวลา ไม่ใช่การจัดอันดับในปัจจุบัน ตัวเลขของ ContextPilot 8B มีข้อควรระวังตามปกติของงานวิจัย — ชุดแบบทดสอบมาตรฐานที่เลือกเอง ฮาร์เนสที่รันเอง ไม่มีการทำซ้ำภายนอก Tencent

ข้อแม้ประการที่สองนั้นเฉพาะกับ AstaBrief 8B และเป็นเรื่องที่สะดุดได้ง่ายในทางปฏิบัติ การ์ดของมันเตือนว่าเช็กพอยต์นี้ถูกปรับละเอียดให้เข้ากับรูปแบบพรอมป์ตเพียงรูปแบบเดียว ซึ่งเผยแพร่เป็นไฟล์ชุดข้อมูล และรูปแบบอื่น ๆ อาจทำให้พฤติกรรมเสื่อมลงได้ ถ้าคุณวัดประสิทธิภาพมันด้วยฮาร์เนสแชตทั่วไป คุณกำลังวัดฮาร์เนสของคุณพอ ๆ กับวัดตัวโมเดล

คุณอยากได้อันไหน

เลือก AstaBrief 8B เมื่อสิ่งที่ต้องส่งมอบคือตัวเอกสาร มันใช้สัญญาอนุญาต Apache-2.0 ทำงานบน GPU ตัวเดียวในระดับ 8B BF16 ไม่ต้องมีกรอบเอเจนต์ใดๆ ล้อมรอบ และถูกฝึกมาโดยเฉพาะสำหรับผลลัพธ์เพียงอย่างเดียว นั่นคือรายงานที่อ้างอิงหลักฐานซึ่งมีคนอื่นเก็บรวบรวมมาให้ สัญญาอนุญาตเชิงพาณิชย์คือปัจจัยชี้ขาดสำหรับทีมส่วนใหญ่ และท่าทีแบบโอเพนรีโปของ Ai2 เอง — ทั้งน้ำหนักโมเดล ส่วนผสม SFT ส่วนผสม DPO และรูปแบบพรอมป์ต์ที่เผยแพร่ทั้งหมด — คือสิ่งที่ทำให้มันตรวจสอบได้ ไม่ใช่แค่ฟรีเฉยๆ

เลือก ContextPilot 8B เมื่อสิ่งที่ต้องส่งมอบคือเส้นทางการทำงานที่ใช้งานได้ และปัญหาของคุณคือเอเจนต์ลืมหรือจมอยู่กับข้อมูล ใบอนุญาตแบบใช้เพื่อการวิจัยเท่านั้นทำให้มันถูกตัดออกจากการพิจารณาสำหรับการใช้งานจริงในบริษัทส่วนใหญ่ และข้อกำหนดด้านรันไทม์หมายความว่าคุณกำลังนำเฟรมเวิร์กของ Tencent มาใช้ ไม่ใช่แค่โมเดล หากคุณกำลังศึกษาการจัดการบริบทเชิงรุกในฐานะเทคนิค มันเป็นจุดเริ่มต้นที่มีเอกสารอธิบายไว้อย่างดี หากคุณต้องนำไปใช้งานจริง มันไม่ใช่

และหากคุณต้องการความสามารถทั้งสองอย่าง คำตอบก็ไม่ใช่โมเดลใดโมเดลหนึ่งโดยลำพัง — แต่คือคู่นี้ที่เชื่อมต่อกันโดยออกแบบให้แต่ละตัวสามารถถูกแทนที่ได้ สิ่งหนึ่งที่การเปรียบเทียบนี้ไม่ควรให้ผลออกมาคือผู้ชนะเพียงรายเดียว เพราะเช็กพอยต์ทั้งสองไม่ได้แข่งขันกันเพื่อตำแหน่งเดียวกันในระบบ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube