การ์ดไตเติลฮีโร่สำหรับ ContextPilot-14B พร้อมคำบรรยายใต้ชื่อว่า 'เอเจนต์โอเพนเวตส์เงียบ ๆ ของ Tencent ที่จัดการบริบทของตัวเอง', ป้ายยาเม็ด 'Qwen3-14B fine-tune', 'เช็คพอยต์สามตัวที่เผยแพร่' และ 'ใบอนุญาตสำหรับการวิจัยเท่านั้น', และส่วนท้าย 'น้ำหนัก 27 ส.ค. · เอกสาร 28 ส.ค. · ไม่มีการประกาศ' พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

ContextPilot-14B คือเอเจนต์โอเพนเวตเงียบๆ ของ Tencent ที่จัดการบริบทของตัวเอง

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

tencent/ContextPilot-14B เป็นโมเดลฟายจูนแบบเปิดน้ำหนักขนาด 15 พันล้านพารามิเตอร์ ซึ่งดัดแปลงจาก Qwen3-14B ปรากฏบน Hugging Face เมื่อวันที่ 27 สิงหาคม 2026 โดยไม่มีการประกาศใดๆ ทั้งสิ้น น้ำหนักถูกอัปโหลดขึ้น กระดาษวิจัย "ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL" (arXiv 2608.28476, ได้รับการยอมรับให้ตีพิมพ์ใน EMNLP 2026) ถูกเผยแพร่ในวันถัดมา ส่วนโค้ดสำหรับฝึกและประเมินผลตามมาบน GitHub นั่นคือทั้งหมดของการเปิดตัว มันเป็นเรือธงของตระกูลสามเช็คพอยต์ ได้แก่ ContextPilot-14B, ContextPilot-8B และ ContextPilot-E4B ซึ่งถูกสร้างขึ้นเพื่อทำสิ่งที่โมเดลเปิดน้ำหนักส่วนใหญ่ไม่พยายามทำ นั่นคือการตัดสินใจทีละเทิร์นว่าโมเดลควรเก็บอะไร จดจำอะไร และผลักอะไรออกจากบริบททำงานของตัวเอง ขณะที่มันให้เหตุผลและเรียกใช้เครื่องมือ

ก่อนอื่น มีข้อควรระวังอย่างหนึ่ง: เมื่อค้นหา "ContextPilot" ผลลัพธ์แรกๆ จะอธิบายถึงโปรเจกต์อื่นที่ไม่เกี่ยวข้องกัน ซึ่งเป็นระบบปรับแต่งการอนุมานแบบ long-context จากมหาวิทยาลัยเอดินบะระ ที่ใช้ชื่อ ContextPilot เช่นกัน โดยระบบนี้จะนำ cached context มาใช้ซ้ำข้ามการเรียกใช้งานเพื่อลดต้นทุน prefill ชื่อเดียวกันแต่เป็นคนละสิ่งกันโดยสิ้นเชิง บทความนี้พูดถึงเฟรมเวิร์กสำหรับเทรนเอเจนต์ของ Tencent และการสับสนระหว่างสองสิ่งนี้จะทำให้คุณไปที่ repo ผิด กระดาษวิชาการผิด และชุดข้อกล่าวอ้างที่ผิด

สิ่งที่ปล่อยออกมาแล้ว และสิ่งที่ทราบได้ในตอนนี้

พื้นผิวการเผยแพร่คือคลังพื้นที่เก็บข้อมูลของ Hugging Face สามแห่งภายใต้องค์กร tencent ซึ่งสร้างขึ้นห่างกันไม่เกินหนึ่งวัน รุ่นเรือธง tencent/ContextPilot-14B เป็น checkpoint แบบ BF16 ที่มีพารามิเตอร์ประมาณ 15B สร้างจาก Qwen/Qwen3-14B ส่วน tencent/ContextPilot-8B เป็นเวอร์ชันของ Qwen3-8B และ tencent/ContextPilot-E4B เป็นสมาชิกขนาดกะทัดรัดที่สร้างจากโครงหลัก Gemma4-E4B-it โมเดลการ์ดของรุ่น 14B ระบุการแบ่งหน้าที่ไว้ชัดเจน: การโหลด checkpoint เพียงอย่างเดียวไม่ได้ทำอะไรเลย — "คำจำกัดความของเครื่องมือ ตัวรันไทม์ของเอเจนต์ และไปป์ไลน์การประเมินผลถูกจัดเตรียมไว้ในคลังพื้นที่เก็บข้อมูล ContextPilot" ดังนั้นน้ำหนัก (weights) จะกลายเป็นเอเจนต์ก็ต่อเมื่อนำไปรันร่วมกับโค้ดเท่านั้น

A screenshot of the Hugging Face model card for tencent/ContextPilot-14B (captured August 31, 2026), showing the model summary 'ContextPilot-14B is the Qwen3-14B checkpoint of ContextPilot, a proactive context-management framework for long-horizon language-model agents', the tags 'Context Management', 'Context-Aware Partial Rollout', and 'Fine-Grained Credit Assignment', and 'License: other'.

หน้า repository ด้านบนคือทั้งหมดที่เปิดเผยต่อสาธารณะของการปล่อยเวอร์ชันนี้ในตอนนี้: โมเดลการ์ด ไฟล์ลิขสิทธิ์ และลิงก์ไปยังบทความและโค้ด ไม่มีบล็อกโพสต์เปิดตัว ไม่มีข่าวประชาสัมพันธ์ และไม่มีหน้าราคาบนเว็บไซต์ของผู้ขาย ณ เวลาที่เขียน

GitHub repository นั้นชื่อ Tencent/ContextPilot คือที่ที่สาระสำคัญทั้งหมดอยู่ มันประกอบด้วยไดเรกทอรี train ซึ่งมีการ implement reinforcement learning บนพื้นฐานของ verl — พร้อมด้วย recipes สำหรับทั้ง checkpoint Qwen3-8B และ Qwen3-14B — และไดเรกทอรี infer ซึ่งมีสคริปต์สำหรับประเมินผลและ data loaders สำหรับ benchmark บริบทระยะยาวสี่ตัว ได้แก่ InfBench, NovelQA, LongMemEval และ BrowseComp+ นอกจากนี้ยังมี live demo URL อยู่บน model card ด้วย ณ เวลาที่เขียนข้อความนี้ repository เพิ่งมีอายุได้สองวัน มีดาวเพียงหยิบมือและไม่มีการ fork เลย ดังนั้นทุกอย่างเกี่ยวกับมันควรอ่านว่าเพิ่งถูกสร้างขึ้นใหม่ ยังไม่ผ่านการพิสูจน์จากการใช้งานจริง

สิ่งที่ ContextPilot สอนให้เอเจนต์ทำ

โจทย์ปัญหาของบทความนี้คือรูปแบบความล้มเหลวหลักของเอเจนต์ในมุมมองระยะยาว: ในการดึงข้อมูล การเรียกใช้เครื่องมือ และการให้เหตุผลหลายๆ เทิร์น บริบทการทำงานของเอเจนต์จะขยายเติบโตอย่างไร้ขีดจำกัด ต้นทุน prefill สูงขึ้น และโมเดลก็จมอยู่กับประวัติของตัวเอง ความพยายามในช่วงแรกมอบเครื่องมือแก้ไขเพียงไม่กี่อย่างให้โมเดล ได้แก่ การค้นหา การลบ และการสรุปความ ซึ่งบทความชี้ว่าเครื่องมือเหล่านี้อ่อนแอเกินไป: ไม่มีแผนในภาพรวม ไม่มีความทรงจำที่อยู่รอดข้ามเทิร์น ไม่มีวิธีบีบอัดแทนการทำลาย

คำตอบของ ContextPilot คือชุดเครื่องมือที่มีส่วนเพิ่มเติมสามส่วน ได้แก่ เครื่องมือวางแผนที่ตัดสินใจว่าจะเก็บสิ่งใดไว้ก่อนที่เอเจนต์จะลงมือทำงาน คลังความจำระยะยาวที่เก็บรักษาข้อมูลให้คงอยู่ข้ามบริบทการทำงาน และกลไกการโอนย้ายแบบนุ่มนวลที่ย้ายบริบทที่มีประโยชน์น้อยออกจากหน้าต่างที่ใช้งานอยู่แทนที่จะลบทิ้ง เพื่อให้สามารถดึงกลับมาใช้ได้เมื่อจำเป็น ในด้านการฝึก บทความนี้นำเสนอเทคนิค RL สองเทคนิคที่เฉพาะเจาะจงกับการแก้ไขบริบท ได้แก่ การโรลเอาต์บางส่วนที่คำนึงถึงบริบท (context-aware partial rollout) ซึ่งแตกกิ่งของวิถี (trajectory) เฉพาะในช่วงเวลาที่การแก้ไขเปลี่ยนแปลงสถานะจริงเท่านั้น และการจัดสรรเครดิตแบบละเอียด (fine-grained credit assignment) ซึ่งให้รางวัลแก่การแก้ไขเฉพาะที่ส่งผลจริง แทนที่จะกระจายรางวัลสุดท้ายไปทั่วทุกการแก้ไข ทั้งสองเทคนิคเป็นความพยายามแก้ปัญหาพื้นฐานเดียวกัน นั่นคือ การแก้ไขบริบทมีผลกระทบที่แตกต่างกัน และการปฏิบัติต่อการแก้ไขทั้งหมดอย่างสม่ำเสมอจะทำให้สัญญาณ RL สูญเปล่า

ข้อความพาดหัวอ้างว่า "ประสิทธิภาพที่แข็งแกร่งขึ้นด้วยบริบทการทำงานที่กะทัดรัดยิ่งขึ้น" ตัวเลขการประเมินสนับสนุนครึ่งหลังเป็นอย่างน้อย: โมเดล ContextPilot ทำงานภายในหน้าต่างบริบท 32K ในขณะที่ backbone Qwen3-14B ที่ไม่ได้ปรับจูนถูกประเมินที่ 128K และ checkpoint ของ ContextPilot ยังคงได้คะแนนสูงกว่าในชุดทดสอบบริบทระยะยาวของบทความเอง

กระดานคะแนนที่ระบุอย่างตรงไปตรงมา

ตัวเลขทุกตัวในส่วนนี้รายงานโดยผู้พัฒนาจากเอกสาร (arXiv 2608.28476) และไม่เคยถูกตรวจสอบซ้ำอย่างเป็นอิสระ — ไม่มีบุคคลที่สามนำ tencent/ContextPilot-14B ไปรันบนชุดทดสอบสาธารณะ และโค้ดสำหรับการประเมินก็เพิ่งถูกเขียนขึ้นได้ไม่กี่วัน เอกสารรายงานค่าเฉลี่ยจากการรันสามครั้งบนเกณฑ์มาตรฐานสี่ชุด ได้แก่ NovelQA, ∞Bench (แบบเลือกตอบภาษาอังกฤษ), LongMemEval-S และ BrowseComp+

• tencent/ContextPilot-14B (หลัง SFT): 84.28 / 79.04 / 65.93 / 53.13 — ค่าเฉลี่ย 70.60

• tencent/ContextPilot-14B (+ RL): 84.81 / 81.08 / 67.40 / 55.50 — ค่าเฉลี่ย 72.20 การผ่าน RL มีค่าประมาณ 1.6 จุดโดยเฉลี่ย และกำไรที่มากที่สุดเกิดขึ้นในเกณฑ์วัดที่ยากที่สุดคือ BrowseComp+ (+2.4)

• การเปรียบเทียบที่ให้ความหมายกับตัวเลขเหล่านั้น: Qwen3-14B ที่ไม่ได้รับการปรับจูนและไม่มีเครื่องมือบริบท ประเมินที่บริบท 128K ได้ค่าเฉลี่ย 53.26 — ต่ำกว่ารุ่นที่ปรับจูนด้วย RL ซึ่งใช้บริบทเพียงหนึ่งในสี่เกือบ 19 จุด StateLM-14B-RL ซึ่งเป็นเส้นฐานการจัดการบริบทที่แข็งแกร่งที่สุดก่อนหน้า มีค่าเฉลี่ย 70.11 ดังนั้น ContextPilot-14B-RL จึงนำอยู่ประมาณ 2.1 จุด

• การค้นหาเชิงลึกเป็นการประเมินครั้งที่สองที่แยกออกไป บน WebExplorer-8B เอเจนต์ของ ContextPilot ทำค่าเฉลี่ยได้ 50.10 ใน BrowseComp, BrowseComp-ZH, GAIA และ xBench-DeepSearch เทียบกับ 49.09 ของ SUPO ซึ่งเป็นเบสไลน์ที่แข็งแกร่ง ส่วนบน WebSailor-7B ทำได้ 38.32 เทียบกับ 36.31 ของ SUPO

การอ้างสิทธิ์ด้านประสิทธิภาพเป็นสิ่งที่น่าสนใจที่สุดและยากที่สุดในการตรวจสอบ: บน BrowseComp อินพุตของเอเจนต์พื้นฐาน (baseline) เพิ่มขึ้นเกือบเป็นเส้นตรงจนถึงประมาณ 30K โทเคน ในขณะที่เอเจนต์ ContextPilot-8B คงที่อยู่ที่ประมาณ 8K–10K โทเคนต่อเทิร์น บริบทการทำงานที่กะทัดรัดคือแก่นของบทความนี้ และตัวเลขนี้คือหลักฐานโดยตรงที่สนับสนุนแนวคิดดังกล่าว

A single-column scoreboard card titled 'ContextPilot-14B — the scoreboard' with rows 'Checkpoints: 14B, 8B, E4B', 'Base: Qwen3-14B (dense)', 'Working context: 32K vs 128K base', 'Headline: 72.20 avg (vendor)', 'License: research-only', and 'Status: no announcement, no API', with footer 'All figures vendor-reported; no independent scores yet.', and the OrcaRouter logo in the bottom-right corner.

การ์ดด้านบนแสดงค่าเฉลี่ยที่รายงานของจุดตรวจสอบทั้งสามไว้เคียงข้างกัน โปรดถือว่าตัวเลขทุกตัวเป็นข้อกล่าวอ้างจากบทความ ไม่ใช่ผลลัพธ์ที่ผ่านการตรวจสอบ

ใบอนุญาตคือส่วนที่เปลี่ยนแปลงแผนของคุณ

นี่คือข้อเท็จจริงที่บทความส่วนใหญ่จะปิดบัง แต่คุณไม่ควร น้ำหนัก (weights) ถูกเปิดเป็น "โอเพน" แต่สัญญาอนุญาตไม่ใช่ Apache-2.0 — เป็นสัญญาอนุญาตแบบกำหนดเอง "License Terms of ContextPilot-14B" ซึ่งลอกข้อความ Apache มาและเพิ่ม Section 0 ที่ระบุว่าโมเดล "ถูกเผยแพร่เพื่อวัตถุประสงค์ของการวิจัยและพัฒนาทางวิทยาศาสตร์เท่านั้น" และ "จะไม่" ถูกใช้เพื่อวัตถุประสงค์อื่นใด ในภาษาที่เข้าใจง่าย นี่คือสัญญาอนุญาตสำหรับการวิจัยเท่านั้น: คุณสามารถปรับแต่งละเอียด (fine-tune) และศึกษาโมเดลได้ แต่ไม่สามารถนำไปใช้ในผลิตภัณฑ์ ให้บริการเชิงพาณิชย์ หรือใช้เป็นแกนหลักของบริการแบบเก็บเงิน หากไม่มีข้อตกลงแยกต่างหากกับ Tencent โมเดลฐาน Qwen3-14B ใช้สัญญาอนุญาต Apache-2.0; การปรับแต่งละเอียดของ ContextPilot เพิ่มข้อจำกัดซ้อนทับลงไป โมเดลพี่น้องขนาด 8B และ E4B ต่างมีไฟล์สัญญาอนุญาตของตัวเอง และควรอ่านตามเงื่อนไขของแต่ละโมเดล

ใบอนุญาตสำหรับการวิจัยเท่านั้นยังอธิบายถึงการไม่มีเส้นทางโฮสต์ (hosted route) ด้วย ผู้ให้บริการอนุมานรายใดในปัจจุบันก็ไม่ให้บริการ tencent/ContextPilot-14B เป็น API และใบอนุญาตที่จำกัดเฉพาะการวิจัยก็เป็นเหตุผลสำคัญที่ไม่มีเราเตอร์เชิงพาณิชย์รายใด — รวมถึง OrcaRouter — จะจัดให้มีรายการนี้จนกว่า Tencent จะเปลี่ยนเงื่อนไข สำหรับใครก็ตามที่ต้องการรันตอนนี้ นั่นหมายถึงการโฮสต์ด้วยตนเองเพื่อการวิจัย: โมเดลที่ปรับแต่งละเอียดจะให้บริการผ่าน vLLM หรือ SGLang พร้อมเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ซึ่งเป็นวิธีที่ไปป์ไลน์อนุมานของบทความวิจัยใช้ขับเคลื่อนมันโดยตรง

สิ่งที่ได้รับการยืนยันแล้ว และสิ่งที่ยังไม่ได้รับการยืนยัน

ยืนยันจากตัวที่เก็บโค้ดเอง: checkpoint ทั้งสามมีอยู่และดาวน์โหลดได้; บทความมีอยู่ ลงวันที่ 28 สิงหาคม 2026 และได้รับการตอบรับในสายหลัก (main-track) ของ EMNLP 2026; สูตรการฝึกเป็นของจริงและเฉพาะเจาะจง (verl, Qwen3-8B และ Qwen3-14B); ไปป์ไลน์การประเมินครอบคลุม benchmark ทั้งสี่ที่ระบุชื่อ; และข้อความใบอนุญาตเป็นแบบใช้เพื่อการวิจัยเท่านั้น

ยังไม่ได้รับการยืนยัน: การประกาศหรือโพสต์เปิดตัวใดๆ จาก Tencent (ยังไม่มี ณ เวลาที่เขียน); การตั้งราคาหรือ API แบบโฮสต์ใดๆ; การรันเกณฑ์มาตรฐานอิสระใดๆ; การทำซ้ำตัวเลข deep-search หรือ long-context โดยบุคคลที่สามใดๆ; และจำนวนพารามิเตอร์ที่แน่นอนและงบประมาณการฝึกสำหรับตัวแปร E4B ซึ่งรายงานอธิบายว่าเป็นสมาชิกขนาดกะทัดรัดที่สร้างบน Gemma4-E4B-it ชุดเกณฑ์มาตรฐานก็ควรอ่านด้วยความสงสัยเช่นกัน — BrowseComp+ ที่ค่าเฉลี่ยโทเคนอินพุต 552K เป็นการทดสอบความเครียดที่แตกต่างอย่างมากจาก NovelQA ที่ค่าเฉลี่ย 119K และค่าเฉลี่ยของรายงานก็กลบการกระจายที่กว้าง

A screenshot of the arXiv abstract page for 'ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL' (arXiv 2608.28476, captured August 31, 2026), showing 'Submitted on 28 Aug 2026', the author list, the abstract, and 'accepted to EMNLP 2026 (Main Track)'.

หน้าแลนดิงเพจของเอกสารด้านบนเป็นแหล่งอ้างอิงหลักสำหรับทุกข้อความในกระดานคะแนน — และการที่ไม่มีการอ้างอิงจากบุคคลที่สามก็คือคอลัมน์ "ยังไม่ได้รับการยืนยัน" นั่นเอง

สิ่งที่ควรดูต่อไป

การพัฒนาสามประการจะเปลี่ยนภาพรวม โดยเรียงตามลำดับความสำคัญ {{1}}ประการแรก ใบอนุญาตเชิงพาณิชย์หรือการประกาศอย่างเป็นทางการ — นั่นคือความแตกต่างระหว่างชิ้นงานวิจัยกับโมเดลที่นำไปใช้งานได้จริง และเป็นการตัดสินใจของ Tencent โดยสิ้นเชิง{{/1}} {{2}}ประการที่สอง การประเมินอิสระครั้งแรก: ชุดทดสอบ long-context และตัวเลข deep-search ต่างก็ทำซ้ำได้จากโค้ดและน้ำหนักที่เปิดเผยต่อสาธารณะ ดังนั้นการรันโดยบุคคลที่สามน่าจะเสร็จภายในไม่กี่สัปดาห์หากผลลัพธ์ยังคงเป็นจริง{{/2}} {{3}}ประการที่สาม สัญญาณใด ๆ ที่แนวทางนี้หลุดเข้าไปในโมเดลการผลิตของ Tencent — ตระกูลโมเดล Hunyuan คือตัวเลือกที่ชัดเจน — ซึ่งจะบอกคุณได้ว่าการจัดการบริบทเชิงรุกเป็นเพียงงานวิจัยเฉพาะทางหรือทิศทางที่วงการกำลังจะทำตาม{{/3}}

สำหรับนักพัฒนา จุดยืนที่ตรงไปตรงมาในระยะใกล้นี้คือ: จับตาดูมัน ประเมินมัน และยังอย่าสร้างผลิตภัณฑ์บนมัน เช็คพอยต์สำหรับงานวิจัยเท่านั้นที่ปล่อยออกมาโดยไม่มีการประกาศและไม่มีการตรวจสอบอย่างเป็นอิสระ คือสิ่งที่คุณอยากชี้ไปที่เส้นทางทดสอบมากกว่าเส้นทางผลิต เมื่อทั้งใบอนุญาตและการตรวจสอบมาลงตัวแล้ว เรื่องการจัดเส้นทางก็เป็นเรื่องเล็กน้อย — คีย์ OrcaRouter เดียวกันที่รองรับโมเดลโฮสต์ 200+ รายการในราคารายการของผู้ให้บริการโดยไม่มีมาร์กอัป จะเพิ่มโมเดลนี้ในวันที่ผู้ให้บริการลงรายการ พร้อมเฟลโอเวอร์อัตโนมัติ เพื่อให้เช็คพอยต์เอเจนต์อายุสองสามวันที่ค้างอยู่ ไม่ทำให้เวิร์กโหลดจริงล่มตามไปด้วย จนกว่าจะถึงตอนนั้น น้ำหนักโมเดลก็เป็นสิ่งประดิษฐ์ทางการวิจัยที่น่าสนใจอย่างยิ่ง พร้อมสูตรการเทรนที่แปลกใหม่อย่างแท้จริง — และกำแพงทางกฎหมายที่ล้อมรอบมัน ซึ่งคุณควรอ่านก่อนจะทำอะไรกับมัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube