
AstaBrief 8B กับ ContextPilot 8B: สองคำตอบต่อโมเดลฐาน 8B เดียวกัน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 220 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
วาง AstaBrief 8B และ ContextPilot 8B ไว้บนสเปกชีตเดียวกัน แล้วหกแถวแรกจะเหมือนกันทุกประการ ทั้งคู่เป็นเช็กพอยต์แบบ dense 8B ที่ผ่านการ fine-tune จาก Qwen/Qwen3-8B ทั้งคู่สืบทอดสถาปัตยกรรมเดียวกัน — 36 เลเยอร์, ขนาด hidden 4096, 32 หัวความสนใจพร้อม 8 หัว key-value, คำศัพท์ 151,936 โทเคน และเพดานตำแหน่ง 40,960 โทเคนของโมเดลฐาน ไม่มีตัวใดเป็นสถาปัตยกรรมใหม่ และไม่มีตัวใดพยายามเป็นเช่นนั้น พวกมันคือสองแล็บที่นำน้ำหนักฐานที่แช่แข็งชุดเดียวกันมาใช้ แล้วสอนงานที่แตกต่างกันสองงานให้กับมัน และงานทั้งสองชี้ไปที่ปลายคนละด้านของเอเจนต์วิจัยระยะยาว: AstaBrief 8B เขียนรายงานฉบับสมบูรณ์ที่อ้างอิงแล้ว และ ContextPilot 8B รักษาบริบทการทำงานของเอเจนต์ไม่ให้ยุบตัวในขณะที่มันรวบรวมเนื้อหา
นั่นคือการเปรียบเทียบทั้งหมดในบรรทัดเดียว และนั่นก็เป็นเหตุผลว่าทำไมสิ่งนี้จึงไม่ใช่การเปรียบเทียบแบบตัวต่อตัวที่คุณควรอ่านเป็นแบบผู้ชนะได้ทั้งหมด ในเรื่องสัญญาอนุญาต หลักฐาน และข้อกำหนดด้านรันไทม์ โมเดลทั้งสองแตกต่างกันโดยสิ้นเชิง และความแตกต่างนี้ให้ข้อมูลมากกว่าคะแนนใด ๆ ที่ทั้งสองห้องแล็บเผยแพร่
เรขาคณิตของเช็คพอยต์เดียวกัน แต่มีการสืบทอดที่แตกต่างกันสองแบบ
เริ่มจากสิ่งที่แชร์กันจริง ๆ ก่อน เพราะมันเป็นตัวกำหนดขอบเขตของทุกอย่างที่เหลือ AstaBrief 8B ของ Ai2 และ ContextPilot 8B ของ Tencent ต่างประกาศว่าใช้ Qwen3-8B เป็นฐาน และทั้งคู่มีพารามิเตอร์ประมาณ 8 พันล้านตัว รีพозиториของ ContextPilot 8B บันทึกน้ำหนัก BF16 ไว้ 16.38 GB กระจายในไฟล์ safetensors สี่แชร์ด ซึ่งเป็นน้ำหนักที่โมเดล dense ขนาด 8B ควรมี เพดานบริบทเป็นของโมเดลฐาน ไม่เปลี่ยนแปลงในทั้งสอง: 40,960 ตำแหน่งในคอนฟิก เทรนที่ 32K และขยายได้ด้วย YaRN ไม่มีโมเดลใดเป็นโมเดลบริบทยาว AstaBrief 8B ไม่จำเป็นต้องเป็นเช่นนั้น เพราะมันได้รับข้อความตัดตอนมาให้แทนที่จะเป็นคลังข้อความทั้งชุด ส่วน ContextPilot 8B จงใจไม่เป็นเช่นนั้น เพราะแนวคิดหลักของมันคือทำให้หน้าต่างขนาดเล็กทำงานหนักขึ้น
สิ่งที่แต่ละแล็บเปลี่ยนแปลงไปคือเป้าหมายในการเทรน และเป้าหมายเหล่านั้นแทบจะแตกต่างกันไม่ได้มากไปกว่านี้อีกแล้ว
• วิธีการหลังการฝึก — AstaBrief 8B: การปรับละเอียดแบบมีผู้สอน จากนั้นการปรับให้เหมาะสมตามความชอบโดยตรงแบบออฟไลน์, ตัวอย่าง SFT 47K และคู่ความชอบประมาณ 6K, บน H100s แปดตัว
• วิธีการหลังการฝึก — ContextPilot 8B: การเรียนรู้แบบเสริมกำลังบนกรอบการจัดการบริบทเชิงรุก โดยมีการผสานเวกเตอร์งานจากการรัน SFT เฉพาะทางสามครั้งซึ่งซ้อนทับลงบนฐานมาตรฐาน
• งานนี้ — AstaBrief 8B: เขียนรายงานหลายส่วนพร้อมการอ้างอิงแทรกในเนื้อหาจากคำถามและข้อความตัดตอนจากวรรณกรรมที่ดึงมา ในครั้งเดียว
• งานนี้ — ContextPilot 8B: วางแผน เก็บความทรงจำระยะยาว ดึงข้อมูลจากดัชนี และถ่ายโอนบริบทที่เอเจนต์ยังไม่จำเป็นต้องใช้ออกไป ในขณะที่ยังคงใช้เหตุผลและเรียกใช้เครื่องมือ
• รันไทม์ — AstaBrief 8B: การให้บริการแบบมาตรฐานด้วย vLLM หรือ Transformers พร้อมรูปแบบพรอมป์ต์ที่แนะนำจากชุดข้อมูล AstaBrief_prompts
• Runtime — ContextPilot 8B: รันไทม์เอเจนต์ของ Tencent คำนิยามเครื่องมือ และไปป์ไลน์การประเมินจากรีโพซิทอรี Tencent/ContextPilot เช็กพอยต์เพียงอย่างเดียวไม่ใช่เอเจนต์ที่ทำงานได้
• สัญญาอนุญาต — AstaBrief 8B: Apache-2.0. ContextPilot 8B: ข้อความ Apache-2.0 แบบกำหนดเอง โดยมีข้อ 0 เพิ่มเติมซึ่งจำกัดการใช้เฉพาะเพื่อการวิจัยและพัฒนา
• หลักฐาน — AstaBrief 8B: ตารางเกณฑ์มาตรฐานที่ผู้ขายรายงานเอง พร้อมตัวเลขการใช้งานจริงในช่วงเริ่มต้นจากแพลตฟอร์ม Asta ของ Ai2 ContextPilot 8B: ข้อกล่าวอ้างในบทความ arXiv ที่ได้รับการตอบรับให้ตีพิมพ์ใน main track ของ EMNLP 2026; การ์ดโมเดลไม่มีตัวเลขใด ๆ และไม่มีบุคคลที่สามรายใดทำซ้ำผลเหล่านั้นได้
สองแถวในรายการนั้นมีน้ำหนักมากกว่าแถวที่เหลือ แถวเรื่องสัญญาอนุญาตเป็นตัวตัดสินว่าคุณจะนำโมเดลไปใส่ในผลิตภัณฑ์ได้หรือไม่ตั้งแต่แรก ข้อกำหนด Apache-2.0 ของ AstaBrief 8B อนุญาตให้ใช้เชิงพาณิชย์ ส่วนข้อกำหนดเพิ่มเติมของ ContextPilot 8B ไม่ได้อนุญาต แถวเรื่องรันไทม์เป็นตัวตัดสินว่าคุณต้องรับเอาส่วนไหนของแล็บมาพร้อมกับน้ำหนักโมเดลมากแค่ไหน AstaBrief 8B เป็นเช็กพอยต์ที่คุณหยิบไปวางในสแตกการเสิร์ฟที่มีอยู่แล้วได้ ContextPilot 8B เป็นส่วนประกอบของเฟรมเวิร์ก และส่วนที่ทำให้เฟรมเวิร์กทำงานได้ — ข้อตกลงของเครื่องมือ ตรรกะการโรลเอาต์ และการจัดสรรเครดิต — อยู่ในโค้ดของ Tencent ไม่ใช่ในแชร์ดที่คุณดาวน์โหลด

ที่แต่ละสิ่งได้รับตำแหน่งของมันมาอย่างสมเหตุสมผลจริง ๆ
วิธีที่มีประโยชน์ในการเปรียบเทียบทั้งสองก็คือมองว่ามันเป็นเอเจนต์ย่อยที่อยู่เคียงข้างกันในไปป์ไลน์ที่ทั้งสองแล็บต่างกำลังมุ่งเข้าหากันจากทิศทางตรงกันข้าม
เอเจนต์สังเคราะห์วรรณกรรมมีชั้นการค้นคืน ชั้นบริบท และชั้นการสร้าง ContextPilot 8B มุ่งแก้ที่ชั้นบริบท โดยมอบความสามารถในการวางแผนให้เอเจนต์ หน่วยความจำระยะยาวแบบมีโครงสร้างพร้อมการเขียน/อัปเดต/อ่านบันทึก การค้นคืนจากดัชนี และการออฟโหลดบริบทแบบซอฟต์ เพื่อให้หน้าต่างบริบทขนาดพอประมาณยังใช้งานได้ตลอดทราเจกทอรีที่ยาว ข้อโต้แย้งของบทความคือโมเดลแก้ไขบริบทก่อนหน้านี้มีจุดอ่อนร่วมกันสามประการ และกรอบงานนี้จัดการกับจุดอ่อนเหล่านั้นพร้อมกัน ได้แก่ ชุดเครื่องมือที่กว้างขึ้น partial rollout ที่คำนึงถึงบริบทซึ่งมุ่งการสำรวจไปยังการแก้ไขที่เปลี่ยนแปลงทราเจกทอรีจริง ๆ และการกำหนดเครดิตแบบละเอียด เป้าหมายการประเมินคือ QA บริบทยาวและการค้นหาเชิงลึก: InfBench, NovelQA, LongMemEval, BrowseComp+ ตามที่เราอ่านรีโพซิทอรีมาก่อนหน้านี้
AstaBrief 8B โจมตีชั้นการสร้าง และสมมติว่าปัญหาบริบทได้รับการแก้ไขแล้วในต้นทาง มันไม่ดึงข้อมูล สรุปข้อความ จัดกลุ่มธีม หรือตัดสินใจว่าจะเก็บหลักฐานใดไว้ Ai2 ได้นำทั้งหมดนั้นออกจากงานของโมเดล และฝึกให้มันเขียนรายงานในรอบเดียวจากข้อความที่เลือกมาโดยคนอื่น การเดิมพันคือว่าโครงสร้างที่มีราคาแพงไม่ใช่ที่ที่คุณภาพอยู่: Ai2 รายงานว่าการเขียนใหม่ในรอบเดียวเทียบเท่ากับไปป์ไลน์หลายขั้นตอนที่ขับเคลื่อนด้วย Claude ในเมตริกที่ติดตาม ขณะที่ลดเวลาการสร้างไปป์ไลน์ทั้งหมดจาก 178.5 วินาที เหลือ 51.1 วินาที
เมื่อนำมารวมกัน โมเดลทั้งสองอธิบายการแบ่งงานที่ห้องแล็บใดก็อาจร่างขึ้นมาได้ โมเดลหนึ่งรักษาชุดทำงานให้เล็กและทำให้หลักฐานไหลเวียนต่อเนื่อง อีกโมเดลเปลี่ยนหลักฐานที่หลงเหลือให้เป็นร้อยแก้วพร้อมการอ้างอิงแนบท้าย รูปแบบความล้มเหลวทั้งสองเสริมกันมากกว่าจะทับซ้อนกัน ตัวจัดการบริบทที่ตัดข้อความยกมาผิดชิ้นจะทำให้พิษต่อนักเขียนที่ดี และนักเขียนที่ดีที่ได้รับข้อความยกมาที่แย่จะสร้างรายงานที่ลื่นไหลแต่เกี่ยวกับเรื่องผิด
ความเสริมนี้เป็นเหตุผลให้มองแต่ละส่วนเป็นคอมโพเนนต์ที่สลับเปลี่ยนได้ มากกว่าจะเป็นข้อผูกมัดระยะยาว ถ้าคุณสร้างครึ่งที่เป็นบริบทด้วย ContextPilot 8B ครึ่งที่สร้างรายงานควรอยู่หลังอินเทอร์เฟซที่ไม่สนใจว่าเบื้องหลังเป็นโมเดลใด — AstaBrief 8B ที่โฮสต์เองในด้านหนึ่ง โมเดล frontier แบบโฮสต์ในอีกด้านหนึ่ง และความสามารถในการย้ายไปมาระหว่างกันโดยไม่ต้องเขียนไปป์ไลน์ใหม่ การรันทั้งสองส่วนผ่านปลายทางเดียวคือสิ่งที่ทำให้มันเป็นการเปลี่ยนแปลงการตั้งค่าแทนที่จะเป็นการย้ายระบบ: API เดียวครอบคลุมโมเดลกว่า 200 รายการ โดยส่งผ่านราคาตามรายการของผู้ให้บริการที่บวกกำไร 0% การสลับอัตโนมัติเมื่อผู้ให้บริการมีประสิทธิภาพลดลงและ DSL สำหรับการกำหนดเส้นทางเมื่อคุณต้องการประกอบหลายโมเดลไว้ในการเรียกครั้งเดียว ตัวเขียนที่โฮสต์เองยังคงโฮสต์เอง เพราะนั่นคือส่วนที่มีเรื่องความอ่อนไหวของข้อมูล ทุกอย่างรอบๆ ยังคงกำหนดเส้นทางได้ เพราะนั่นคือจุดที่ความยืดหยุ่นมีต้นทุนต่ำ

สภาพที่ตรงไปตรงมาของหลักฐาน
ทั้งสองโมเดลไม่มีกระดานคะแนนที่เป็นอิสระ และห้องแล็บทั้งสองแห่งก็ไม่ได้วัดสิ่งเดียวกันด้วยซ้ำ
• AstaBrief 8B, ค่าเฉลี่ย SQABench-CS2 (ตามที่ผู้ขายรายงาน): 87.0 บนชุดทดสอบ เทียบกับ 83.7 สำหรับเช็กพอยต์ SFT ของตัวเอง และ 77.3 สำหรับ Qwen3-8B ฐาน
• AstaBrief 8B, DeepScholarBench (ตามที่ผู้ขายรายงาน): 53.50 เป็นรอง Asta ScholarQA ของ Ai2 เองที่ 60.25 และ DR-Tulu-8B ที่ 56.26
• AstaBrief 8B อัตราการชนะแบบจับคู่เมื่อเทียบกับไปป์ไลน์ที่ขับเคลื่อนด้วย Claude ของ Ai2 (ตามที่ผู้ขายรายงาน): 55% บน SQABench-CS2 ชุดพัฒนา, 72% บนชุดทดสอบ
• ContextPilot 8B: ตัวเลขมีอยู่เฉพาะในเปเปอร์เท่านั้น บนแบบทดสอบ long-context QA และ deep-search; ไม่มีตัวเลขบนการ์ดโมเดล และไม่มีการทำซ้ำโดยบุคคลที่สาม
ข้อควรระวังหนึ่งประการใช้กับคอลัมน์ AstaBrief ทั้งหมด และ Ai2 ระบุไว้ในบล็อกเองว่า การฝึกและการประเมินส่วนใหญ่เสร็จสิ้นในปี 2025 ดังนั้นโมเดลที่นำมาเปรียบเทียบจึงสะท้อนระดับแนวหน้า ณ เวลานั้น และแล็บยังไม่ได้รันการประเมินซ้ำกับโมเดลระดับแนวหน้าในปัจจุบัน โปรดอ่านเปอร์เซ็นต์เหล่านั้นเป็นหลักฐานเกี่ยวกับการตัดสินใจด้านการออกแบบ ณ จุดหนึ่งของเวลา ไม่ใช่การจัดอันดับในปัจจุบัน ตัวเลขของ ContextPilot 8B มีข้อควรระวังตามปกติของงานวิจัย — ชุดแบบทดสอบมาตรฐานที่เลือกเอง ฮาร์เนสที่รันเอง ไม่มีการทำซ้ำภายนอก Tencent
ข้อแม้ประการที่สองนั้นเฉพาะกับ AstaBrief 8B และเป็นเรื่องที่สะดุดได้ง่ายในทางปฏิบัติ การ์ดของมันเตือนว่าเช็กพอยต์นี้ถูกปรับละเอียดให้เข้ากับรูปแบบพรอมป์ตเพียงรูปแบบเดียว ซึ่งเผยแพร่เป็นไฟล์ชุดข้อมูล และรูปแบบอื่น ๆ อาจทำให้พฤติกรรมเสื่อมลงได้ ถ้าคุณวัดประสิทธิภาพมันด้วยฮาร์เนสแชตทั่วไป คุณกำลังวัดฮาร์เนสของคุณพอ ๆ กับวัดตัวโมเดล
คุณอยากได้อันไหน
เลือก AstaBrief 8B เมื่อสิ่งที่ต้องส่งมอบคือตัวเอกสาร มันใช้สัญญาอนุญาต Apache-2.0 ทำงานบน GPU ตัวเดียวในระดับ 8B BF16 ไม่ต้องมีกรอบเอเจนต์ใดๆ ล้อมรอบ และถูกฝึกมาโดยเฉพาะสำหรับผลลัพธ์เพียงอย่างเดียว นั่นคือรายงานที่อ้างอิงหลักฐานซึ่งมีคนอื่นเก็บรวบรวมมาให้ สัญญาอนุญาตเชิงพาณิชย์คือปัจจัยชี้ขาดสำหรับทีมส่วนใหญ่ และท่าทีแบบโอเพนรีโปของ Ai2 เอง — ทั้งน้ำหนักโมเดล ส่วนผสม SFT ส่วนผสม DPO และรูปแบบพรอมป์ต์ที่เผยแพร่ทั้งหมด — คือสิ่งที่ทำให้มันตรวจสอบได้ ไม่ใช่แค่ฟรีเฉยๆ
เลือก ContextPilot 8B เมื่อสิ่งที่ต้องส่งมอบคือเส้นทางการทำงานที่ใช้งานได้ และปัญหาของคุณคือเอเจนต์ลืมหรือจมอยู่กับข้อมูล ใบอนุญาตแบบใช้เพื่อการวิจัยเท่านั้นทำให้มันถูกตัดออกจากการพิจารณาสำหรับการใช้งานจริงในบริษัทส่วนใหญ่ และข้อกำหนดด้านรันไทม์หมายความว่าคุณกำลังนำเฟรมเวิร์กของ Tencent มาใช้ ไม่ใช่แค่โมเดล หากคุณกำลังศึกษาการจัดการบริบทเชิงรุกในฐานะเทคนิค มันเป็นจุดเริ่มต้นที่มีเอกสารอธิบายไว้อย่างดี หากคุณต้องนำไปใช้งานจริง มันไม่ใช่
และหากคุณต้องการความสามารถทั้งสองอย่าง คำตอบก็ไม่ใช่โมเดลใดโมเดลหนึ่งโดยลำพัง — แต่คือคู่นี้ที่เชื่อมต่อกันโดยออกแบบให้แต่ละตัวสามารถถูกแทนที่ได้ สิ่งหนึ่งที่การเปรียบเทียบนี้ไม่ควรให้ผลออกมาคือผู้ชนะเพียงรายเดียว เพราะเช็กพอยต์ทั้งสองไม่ได้แข่งขันกันเพื่อตำแหน่งเดียวกันในระบบ
