
ContextPilot-14B คือเอเจนต์โอเพนเวตเงียบๆ ของ Tencent ที่จัดการบริบทของตัวเอง
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
tencent/ContextPilot-14B เป็นโมเดลฟายจูนแบบเปิดน้ำหนักขนาด 15 พันล้านพารามิเตอร์ ซึ่งดัดแปลงจาก Qwen3-14B ปรากฏบน Hugging Face เมื่อวันที่ 27 สิงหาคม 2026 โดยไม่มีการประกาศใดๆ ทั้งสิ้น น้ำหนักถูกอัปโหลดขึ้น กระดาษวิจัย "ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL" (arXiv 2608.28476, ได้รับการยอมรับให้ตีพิมพ์ใน EMNLP 2026) ถูกเผยแพร่ในวันถัดมา ส่วนโค้ดสำหรับฝึกและประเมินผลตามมาบน GitHub นั่นคือทั้งหมดของการเปิดตัว มันเป็นเรือธงของตระกูลสามเช็คพอยต์ ได้แก่ ContextPilot-14B, ContextPilot-8B และ ContextPilot-E4B ซึ่งถูกสร้างขึ้นเพื่อทำสิ่งที่โมเดลเปิดน้ำหนักส่วนใหญ่ไม่พยายามทำ นั่นคือการตัดสินใจทีละเทิร์นว่าโมเดลควรเก็บอะไร จดจำอะไร และผลักอะไรออกจากบริบททำงานของตัวเอง ขณะที่มันให้เหตุผลและเรียกใช้เครื่องมือ
ก่อนอื่น มีข้อควรระวังอย่างหนึ่ง: เมื่อค้นหา "ContextPilot" ผลลัพธ์แรกๆ จะอธิบายถึงโปรเจกต์อื่นที่ไม่เกี่ยวข้องกัน ซึ่งเป็นระบบปรับแต่งการอนุมานแบบ long-context จากมหาวิทยาลัยเอดินบะระ ที่ใช้ชื่อ ContextPilot เช่นกัน โดยระบบนี้จะนำ cached context มาใช้ซ้ำข้ามการเรียกใช้งานเพื่อลดต้นทุน prefill ชื่อเดียวกันแต่เป็นคนละสิ่งกันโดยสิ้นเชิง บทความนี้พูดถึงเฟรมเวิร์กสำหรับเทรนเอเจนต์ของ Tencent และการสับสนระหว่างสองสิ่งนี้จะทำให้คุณไปที่ repo ผิด กระดาษวิชาการผิด และชุดข้อกล่าวอ้างที่ผิด
สิ่งที่ปล่อยออกมาแล้ว และสิ่งที่ทราบได้ในตอนนี้
พื้นผิวการเผยแพร่คือคลังพื้นที่เก็บข้อมูลของ Hugging Face สามแห่งภายใต้องค์กร tencent ซึ่งสร้างขึ้นห่างกันไม่เกินหนึ่งวัน รุ่นเรือธง tencent/ContextPilot-14B เป็น checkpoint แบบ BF16 ที่มีพารามิเตอร์ประมาณ 15B สร้างจาก Qwen/Qwen3-14B ส่วน tencent/ContextPilot-8B เป็นเวอร์ชันของ Qwen3-8B และ tencent/ContextPilot-E4B เป็นสมาชิกขนาดกะทัดรัดที่สร้างจากโครงหลัก Gemma4-E4B-it โมเดลการ์ดของรุ่น 14B ระบุการแบ่งหน้าที่ไว้ชัดเจน: การโหลด checkpoint เพียงอย่างเดียวไม่ได้ทำอะไรเลย — "คำจำกัดความของเครื่องมือ ตัวรันไทม์ของเอเจนต์ และไปป์ไลน์การประเมินผลถูกจัดเตรียมไว้ในคลังพื้นที่เก็บข้อมูล ContextPilot" ดังนั้นน้ำหนัก (weights) จะกลายเป็นเอเจนต์ก็ต่อเมื่อนำไปรันร่วมกับโค้ดเท่านั้น

หน้า repository ด้านบนคือทั้งหมดที่เปิดเผยต่อสาธารณะของการปล่อยเวอร์ชันนี้ในตอนนี้: โมเดลการ์ด ไฟล์ลิขสิทธิ์ และลิงก์ไปยังบทความและโค้ด ไม่มีบล็อกโพสต์เปิดตัว ไม่มีข่าวประชาสัมพันธ์ และไม่มีหน้าราคาบนเว็บไซต์ของผู้ขาย ณ เวลาที่เขียน
GitHub repository นั้นชื่อ Tencent/ContextPilot คือที่ที่สาระสำคัญทั้งหมดอยู่ มันประกอบด้วยไดเรกทอรี train ซึ่งมีการ implement reinforcement learning บนพื้นฐานของ verl — พร้อมด้วย recipes สำหรับทั้ง checkpoint Qwen3-8B และ Qwen3-14B — และไดเรกทอรี infer ซึ่งมีสคริปต์สำหรับประเมินผลและ data loaders สำหรับ benchmark บริบทระยะยาวสี่ตัว ได้แก่ InfBench, NovelQA, LongMemEval และ BrowseComp+ นอกจากนี้ยังมี live demo URL อยู่บน model card ด้วย ณ เวลาที่เขียนข้อความนี้ repository เพิ่งมีอายุได้สองวัน มีดาวเพียงหยิบมือและไม่มีการ fork เลย ดังนั้นทุกอย่างเกี่ยวกับมันควรอ่านว่าเพิ่งถูกสร้างขึ้นใหม่ ยังไม่ผ่านการพิสูจน์จากการใช้งานจริง
สิ่งที่ ContextPilot สอนให้เอเจนต์ทำ
โจทย์ปัญหาของบทความนี้คือรูปแบบความล้มเหลวหลักของเอเจนต์ในมุมมองระยะยาว: ในการดึงข้อมูล การเรียกใช้เครื่องมือ และการให้เหตุผลหลายๆ เทิร์น บริบทการทำงานของเอเจนต์จะขยายเติบโตอย่างไร้ขีดจำกัด ต้นทุน prefill สูงขึ้น และโมเดลก็จมอยู่กับประวัติของตัวเอง ความพยายามในช่วงแรกมอบเครื่องมือแก้ไขเพียงไม่กี่อย่างให้โมเดล ได้แก่ การค้นหา การลบ และการสรุปความ ซึ่งบทความชี้ว่าเครื่องมือเหล่านี้อ่อนแอเกินไป: ไม่มีแผนในภาพรวม ไม่มีความทรงจำที่อยู่รอดข้ามเทิร์น ไม่มีวิธีบีบอัดแทนการทำลาย
คำตอบของ ContextPilot คือชุดเครื่องมือที่มีส่วนเพิ่มเติมสามส่วน ได้แก่ เครื่องมือวางแผนที่ตัดสินใจว่าจะเก็บสิ่งใดไว้ก่อนที่เอเจนต์จะลงมือทำงาน คลังความจำระยะยาวที่เก็บรักษาข้อมูลให้คงอยู่ข้ามบริบทการทำงาน และกลไกการโอนย้ายแบบนุ่มนวลที่ย้ายบริบทที่มีประโยชน์น้อยออกจากหน้าต่างที่ใช้งานอยู่แทนที่จะลบทิ้ง เพื่อให้สามารถดึงกลับมาใช้ได้เมื่อจำเป็น ในด้านการฝึก บทความนี้นำเสนอเทคนิค RL สองเทคนิคที่เฉพาะเจาะจงกับการแก้ไขบริบท ได้แก่ การโรลเอาต์บางส่วนที่คำนึงถึงบริบท (context-aware partial rollout) ซึ่งแตกกิ่งของวิถี (trajectory) เฉพาะในช่วงเวลาที่การแก้ไขเปลี่ยนแปลงสถานะจริงเท่านั้น และการจัดสรรเครดิตแบบละเอียด (fine-grained credit assignment) ซึ่งให้รางวัลแก่การแก้ไขเฉพาะที่ส่งผลจริง แทนที่จะกระจายรางวัลสุดท้ายไปทั่วทุกการแก้ไข ทั้งสองเทคนิคเป็นความพยายามแก้ปัญหาพื้นฐานเดียวกัน นั่นคือ การแก้ไขบริบทมีผลกระทบที่แตกต่างกัน และการปฏิบัติต่อการแก้ไขทั้งหมดอย่างสม่ำเสมอจะทำให้สัญญาณ RL สูญเปล่า
ข้อความพาดหัวอ้างว่า "ประสิทธิภาพที่แข็งแกร่งขึ้นด้วยบริบทการทำงานที่กะทัดรัดยิ่งขึ้น" ตัวเลขการประเมินสนับสนุนครึ่งหลังเป็นอย่างน้อย: โมเดล ContextPilot ทำงานภายในหน้าต่างบริบท 32K ในขณะที่ backbone Qwen3-14B ที่ไม่ได้ปรับจูนถูกประเมินที่ 128K และ checkpoint ของ ContextPilot ยังคงได้คะแนนสูงกว่าในชุดทดสอบบริบทระยะยาวของบทความเอง
กระดานคะแนนที่ระบุอย่างตรงไปตรงมา
ตัวเลขทุกตัวในส่วนนี้รายงานโดยผู้พัฒนาจากเอกสาร (arXiv 2608.28476) และไม่เคยถูกตรวจสอบซ้ำอย่างเป็นอิสระ — ไม่มีบุคคลที่สามนำ tencent/ContextPilot-14B ไปรันบนชุดทดสอบสาธารณะ และโค้ดสำหรับการประเมินก็เพิ่งถูกเขียนขึ้นได้ไม่กี่วัน เอกสารรายงานค่าเฉลี่ยจากการรันสามครั้งบนเกณฑ์มาตรฐานสี่ชุด ได้แก่ NovelQA, ∞Bench (แบบเลือกตอบภาษาอังกฤษ), LongMemEval-S และ BrowseComp+
• tencent/ContextPilot-14B (หลัง SFT): 84.28 / 79.04 / 65.93 / 53.13 — ค่าเฉลี่ย 70.60
• tencent/ContextPilot-14B (+ RL): 84.81 / 81.08 / 67.40 / 55.50 — ค่าเฉลี่ย 72.20 การผ่าน RL มีค่าประมาณ 1.6 จุดโดยเฉลี่ย และกำไรที่มากที่สุดเกิดขึ้นในเกณฑ์วัดที่ยากที่สุดคือ BrowseComp+ (+2.4)
• การเปรียบเทียบที่ให้ความหมายกับตัวเลขเหล่านั้น: Qwen3-14B ที่ไม่ได้รับการปรับจูนและไม่มีเครื่องมือบริบท ประเมินที่บริบท 128K ได้ค่าเฉลี่ย 53.26 — ต่ำกว่ารุ่นที่ปรับจูนด้วย RL ซึ่งใช้บริบทเพียงหนึ่งในสี่เกือบ 19 จุด StateLM-14B-RL ซึ่งเป็นเส้นฐานการจัดการบริบทที่แข็งแกร่งที่สุดก่อนหน้า มีค่าเฉลี่ย 70.11 ดังนั้น ContextPilot-14B-RL จึงนำอยู่ประมาณ 2.1 จุด
• การค้นหาเชิงลึกเป็นการประเมินครั้งที่สองที่แยกออกไป บน WebExplorer-8B เอเจนต์ของ ContextPilot ทำค่าเฉลี่ยได้ 50.10 ใน BrowseComp, BrowseComp-ZH, GAIA และ xBench-DeepSearch เทียบกับ 49.09 ของ SUPO ซึ่งเป็นเบสไลน์ที่แข็งแกร่ง ส่วนบน WebSailor-7B ทำได้ 38.32 เทียบกับ 36.31 ของ SUPO
การอ้างสิทธิ์ด้านประสิทธิภาพเป็นสิ่งที่น่าสนใจที่สุดและยากที่สุดในการตรวจสอบ: บน BrowseComp อินพุตของเอเจนต์พื้นฐาน (baseline) เพิ่มขึ้นเกือบเป็นเส้นตรงจนถึงประมาณ 30K โทเคน ในขณะที่เอเจนต์ ContextPilot-8B คงที่อยู่ที่ประมาณ 8K–10K โทเคนต่อเทิร์น บริบทการทำงานที่กะทัดรัดคือแก่นของบทความนี้ และตัวเลขนี้คือหลักฐานโดยตรงที่สนับสนุนแนวคิดดังกล่าว

การ์ดด้านบนแสดงค่าเฉลี่ยที่รายงานของจุดตรวจสอบทั้งสามไว้เคียงข้างกัน โปรดถือว่าตัวเลขทุกตัวเป็นข้อกล่าวอ้างจากบทความ ไม่ใช่ผลลัพธ์ที่ผ่านการตรวจสอบ
ใบอนุญาตคือส่วนที่เปลี่ยนแปลงแผนของคุณ
นี่คือข้อเท็จจริงที่บทความส่วนใหญ่จะปิดบัง แต่คุณไม่ควร น้ำหนัก (weights) ถูกเปิดเป็น "โอเพน" แต่สัญญาอนุญาตไม่ใช่ Apache-2.0 — เป็นสัญญาอนุญาตแบบกำหนดเอง "License Terms of ContextPilot-14B" ซึ่งลอกข้อความ Apache มาและเพิ่ม Section 0 ที่ระบุว่าโมเดล "ถูกเผยแพร่เพื่อวัตถุประสงค์ของการวิจัยและพัฒนาทางวิทยาศาสตร์เท่านั้น" และ "จะไม่" ถูกใช้เพื่อวัตถุประสงค์อื่นใด ในภาษาที่เข้าใจง่าย นี่คือสัญญาอนุญาตสำหรับการวิจัยเท่านั้น: คุณสามารถปรับแต่งละเอียด (fine-tune) และศึกษาโมเดลได้ แต่ไม่สามารถนำไปใช้ในผลิตภัณฑ์ ให้บริการเชิงพาณิชย์ หรือใช้เป็นแกนหลักของบริการแบบเก็บเงิน หากไม่มีข้อตกลงแยกต่างหากกับ Tencent โมเดลฐาน Qwen3-14B ใช้สัญญาอนุญาต Apache-2.0; การปรับแต่งละเอียดของ ContextPilot เพิ่มข้อจำกัดซ้อนทับลงไป โมเดลพี่น้องขนาด 8B และ E4B ต่างมีไฟล์สัญญาอนุญาตของตัวเอง และควรอ่านตามเงื่อนไขของแต่ละโมเดล
ใบอนุญาตสำหรับการวิจัยเท่านั้นยังอธิบายถึงการไม่มีเส้นทางโฮสต์ (hosted route) ด้วย ผู้ให้บริการอนุมานรายใดในปัจจุบันก็ไม่ให้บริการ tencent/ContextPilot-14B เป็น API และใบอนุญาตที่จำกัดเฉพาะการวิจัยก็เป็นเหตุผลสำคัญที่ไม่มีเราเตอร์เชิงพาณิชย์รายใด — รวมถึง OrcaRouter — จะจัดให้มีรายการนี้จนกว่า Tencent จะเปลี่ยนเงื่อนไข สำหรับใครก็ตามที่ต้องการรันตอนนี้ นั่นหมายถึงการโฮสต์ด้วยตนเองเพื่อการวิจัย: โมเดลที่ปรับแต่งละเอียดจะให้บริการผ่าน vLLM หรือ SGLang พร้อมเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ซึ่งเป็นวิธีที่ไปป์ไลน์อนุมานของบทความวิจัยใช้ขับเคลื่อนมันโดยตรง
สิ่งที่ได้รับการยืนยันแล้ว และสิ่งที่ยังไม่ได้รับการยืนยัน
ยืนยันจากตัวที่เก็บโค้ดเอง: checkpoint ทั้งสามมีอยู่และดาวน์โหลดได้; บทความมีอยู่ ลงวันที่ 28 สิงหาคม 2026 และได้รับการตอบรับในสายหลัก (main-track) ของ EMNLP 2026; สูตรการฝึกเป็นของจริงและเฉพาะเจาะจง (verl, Qwen3-8B และ Qwen3-14B); ไปป์ไลน์การประเมินครอบคลุม benchmark ทั้งสี่ที่ระบุชื่อ; และข้อความใบอนุญาตเป็นแบบใช้เพื่อการวิจัยเท่านั้น
ยังไม่ได้รับการยืนยัน: การประกาศหรือโพสต์เปิดตัวใดๆ จาก Tencent (ยังไม่มี ณ เวลาที่เขียน); การตั้งราคาหรือ API แบบโฮสต์ใดๆ; การรันเกณฑ์มาตรฐานอิสระใดๆ; การทำซ้ำตัวเลข deep-search หรือ long-context โดยบุคคลที่สามใดๆ; และจำนวนพารามิเตอร์ที่แน่นอนและงบประมาณการฝึกสำหรับตัวแปร E4B ซึ่งรายงานอธิบายว่าเป็นสมาชิกขนาดกะทัดรัดที่สร้างบน Gemma4-E4B-it ชุดเกณฑ์มาตรฐานก็ควรอ่านด้วยความสงสัยเช่นกัน — BrowseComp+ ที่ค่าเฉลี่ยโทเคนอินพุต 552K เป็นการทดสอบความเครียดที่แตกต่างอย่างมากจาก NovelQA ที่ค่าเฉลี่ย 119K และค่าเฉลี่ยของรายงานก็กลบการกระจายที่กว้าง

หน้าแลนดิงเพจของเอกสารด้านบนเป็นแหล่งอ้างอิงหลักสำหรับทุกข้อความในกระดานคะแนน — และการที่ไม่มีการอ้างอิงจากบุคคลที่สามก็คือคอลัมน์ "ยังไม่ได้รับการยืนยัน" นั่นเอง
สิ่งที่ควรดูต่อไป
การพัฒนาสามประการจะเปลี่ยนภาพรวม โดยเรียงตามลำดับความสำคัญ {{1}}ประการแรก ใบอนุญาตเชิงพาณิชย์หรือการประกาศอย่างเป็นทางการ — นั่นคือความแตกต่างระหว่างชิ้นงานวิจัยกับโมเดลที่นำไปใช้งานได้จริง และเป็นการตัดสินใจของ Tencent โดยสิ้นเชิง{{/1}} {{2}}ประการที่สอง การประเมินอิสระครั้งแรก: ชุดทดสอบ long-context และตัวเลข deep-search ต่างก็ทำซ้ำได้จากโค้ดและน้ำหนักที่เปิดเผยต่อสาธารณะ ดังนั้นการรันโดยบุคคลที่สามน่าจะเสร็จภายในไม่กี่สัปดาห์หากผลลัพธ์ยังคงเป็นจริง{{/2}} {{3}}ประการที่สาม สัญญาณใด ๆ ที่แนวทางนี้หลุดเข้าไปในโมเดลการผลิตของ Tencent — ตระกูลโมเดล Hunyuan คือตัวเลือกที่ชัดเจน — ซึ่งจะบอกคุณได้ว่าการจัดการบริบทเชิงรุกเป็นเพียงงานวิจัยเฉพาะทางหรือทิศทางที่วงการกำลังจะทำตาม{{/3}}
สำหรับนักพัฒนา จุดยืนที่ตรงไปตรงมาในระยะใกล้นี้คือ: จับตาดูมัน ประเมินมัน และยังอย่าสร้างผลิตภัณฑ์บนมัน เช็คพอยต์สำหรับงานวิจัยเท่านั้นที่ปล่อยออกมาโดยไม่มีการประกาศและไม่มีการตรวจสอบอย่างเป็นอิสระ คือสิ่งที่คุณอยากชี้ไปที่เส้นทางทดสอบมากกว่าเส้นทางผลิต เมื่อทั้งใบอนุญาตและการตรวจสอบมาลงตัวแล้ว เรื่องการจัดเส้นทางก็เป็นเรื่องเล็กน้อย — คีย์ OrcaRouter เดียวกันที่รองรับโมเดลโฮสต์ 200+ รายการในราคารายการของผู้ให้บริการโดยไม่มีมาร์กอัป จะเพิ่มโมเดลนี้ในวันที่ผู้ให้บริการลงรายการ พร้อมเฟลโอเวอร์อัตโนมัติ เพื่อให้เช็คพอยต์เอเจนต์อายุสองสามวันที่ค้างอยู่ ไม่ทำให้เวิร์กโหลดจริงล่มตามไปด้วย จนกว่าจะถึงตอนนั้น น้ำหนักโมเดลก็เป็นสิ่งประดิษฐ์ทางการวิจัยที่น่าสนใจอย่างยิ่ง พร้อมสูตรการเทรนที่แปลกใหม่อย่างแท้จริง — และกำแพงทางกฎหมายที่ล้อมรอบมัน ซึ่งคุณควรอ่านก่อนจะทำอะไรกับมัน
