
ContextPilot-8B: เทนเซ็นต์เปิดตัวเอเจนต์ Qwen3-8B อย่างเงียบๆ ที่จัดการบริบทของตัวเอง
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
tencent/ContextPilot-8B ปรากฏบน Hugging Face เมื่อวันที่ 27 สิงหาคม 2026 โดยไม่มีการประกาศ ไม่มีบันทึกการเปลี่ยนแปลง และไม่มีโพสต์เปิดตัว — และพื้นที่เก็บข้อมูล (repo) ยังคงถูกแก้ไขจนถึงวันที่ 31 สิงหาคม ซึ่งเป็นสองวันหลังจากที่เอกสารวิจัยที่อยู่เบื้องหลังถูกเผยแพร่ มันเป็นการปรับแต่งละเอียด (fine-tune) ขนาด 8 พันล้านพารามิเตอร์ของ Qwen/Qwen3-8B ซึ่งสอนให้เอเจนต์วางแผน จดจำ และถ่ายโอนบริบทการทำงานของตัวเองออกไปในขณะที่ยังคงใช้เหตุผลต่อไป เป็นส่วนหนึ่งของตระกูลที่ถูกปล่อยออกมาอย่างเงียบๆ ซึ่งรวมถึง ContextPilot-E4B และ ContextPilot-14B ด้วย จนถึงวันนี้ก็ยังไม่มีคำแถลงจากผู้พัฒนาที่ใดเลย: การเปิดตัวครั้งนี้ทราบได้ผ่านการ์ดโมเดล ไฟล์คอนฟิก ไฟล์สูตรการรวม และเอกสาร arXiv ที่มันลิงก์ไปเท่านั้น นี่คือการอ่านสรุปเท่าที่เรารู้ตอนนี้ — ว่าเช็คพอยต์อายุสี่วันจริงๆ แล้วคืออะไร ไฟล์ใน repo เปิดเผยอะไรที่เอกสารวิจัยไม่ได้บอก และใบอนุญาตสำหรับการวิจัยเท่านั้นในทางปฏิบัติหมายความว่าอย่างไร
จุดตรวจสอบ ในหกข้อเท็จจริง
ทุกอย่างด้านล่างนี้มาจาก repo โดยตรง และไม่มีการอ้างสิทธิ์ benchmark ใดๆ ทั้งสิ้น:
• โมเดลฐาน — Qwen/Qwen3-8B ตามโมเดลการ์ดและแท็ก base_model ใน config; ค่าน้ำหนักเป็นผลจากการ fine-tune โมเดลดังกล่าว ไม่ใช่โมเดลที่สร้างขึ้นใหม่เอง
• สถาปัตยกรรม — Qwen3ForCausalLM, 36 เลเยอร์, hidden size 4096, 32 attention heads พร้อม 8 KV heads, head_dim 128, ขนาดคำศัพท์ 151,936
• ขนาด — น้ำหนัก BF16 จำนวน 16.38 GB กระจายอยู่ใน safetensors 4 ชาร์ด ซึ่งสอดคล้องกับโมเดลแบบ dense ขนาด ~8B
• เพดานบริบท — max_position_embeddings 40960 (40K) ซึ่งเป็นเพดานเดียวกันกับที่คอนฟิกของ Qwen3-8B ตั้งไว้; หน้าต่างที่ฝึกไว้ที่ 32K ขยายไปถึง ~131K ผ่าน YaRN เช่นเดียวกับโมเดลฐานทุกประการ นี่ไม่ใช่โมเดลบริบทยาว — แต่เป็นโมเดลการจัดการบริบท
• การตั้งค่าการสร้าง — temperature 0.6, top_p 0.95, top_k 20, เปิดใช้งานการสุ่มตัวอย่าง; โปรไฟล์ที่พอประมาณและเอื้อต่อการสำรวจสำหรับการทำงานแบบ agentic
• สิทธิ์การใช้งาน — ข้อความ Apache-2.0 ที่ปรับแต่งเอง โดยเพิ่มมาตรา 0: สำหรับการวิจัยและพัฒนาเท่านั้น "คุณต้องไม่ใช้เพื่อวัตถุประสงค์อื่นใด"

หน้าโมเดล Hugging Face ด้านบนคือสิ่งที่เปิดเผยสู่สาธารณะทั้งหมดของการเปิดตัวครั้งนี้: การ์ดบาง ๆ, ชิ้นส่วน (shards), และลิงก์ไปยังที่เก็บ GitHub และเอกสารวิจัย ไม่มีตัวเลข ไม่มีรายการในลีดเดอร์บอร์ด ไม่มี API ที่โฮสต์ไว้
ทำไมรุ่นพื้นฐานถึงเป็นพาดหัว
ข้อเท็จจริงที่น่าสนใจเกี่ยวกับ ContextPilot-8B ไม่ใช่ว่า Tencent นำ Qwen3-8B มาปรับแต่งละเอียด (fine-tune) — ห้องแล็บทุกแห่งก็ทำแบบนั้น — แต่เป็นการที่การปรับแต่งนี้เปลี่ยนแปลงตัวโมเดลดั้งเดิมเพียงเล็กน้อย ขณะเดียวกันก็เปลี่ยนแปลงอย่างมากในวิธีที่คุณควรใช้งานมัน เช็คพอยต์ยังคงรักษารูปทรง dense 8B ของ Qwen3-8B โหมด hybrid thinking และเพดานตำแหน่ง 40K ไว้ ดังนั้นความเข้าใจใดๆ ที่คุณมีเกี่ยวกับการเสิร์ฟโมเดลพื้นฐานก็ยังใช้ได้: มันเป็นโมเดลระดับ GPU ตัวเดียว ไม่ใช่ระดับดาตาเซ็นเตอร์
สิ่งที่การปรับแต่งละเอียด (fine-tune) เปลี่ยนไปคือข้อกำหนดของเครื่องมือ (tool contract) การ์ดโมเดลระบุชัดเจนว่าการโหลด checkpoint เพียงอย่างเดียวไม่ได้ทำให้คุณได้เอเจนต์จัดการบริบทที่ใช้งานได้ — นิยามเครื่องมือ, รันไทม์ของเอเจนต์ และไปป์ไลน์การประเมินอยู่ในพื้นที่เก็บข้อมูล github.com/Tencent/ContextPilot และเดโมสดที่ tencent.github.io/ContextPilot เป็นวิธีที่เร็วที่สุดในการดูว่าพฤติกรรมที่คาดหวังควรเป็นอย่างไร ContextPilot-8B เป็นส่วนประกอบของรันไทม์ขนาดใหญ่ ซึ่งผิดปกติสำหรับการเผยแพร่น้ำหนักเปิด (open-weights release) และเป็นสิ่งแรกที่ต้องทำความเข้าใจ
นอกจากนี้ ยังควรทำความเข้าใจกับการจัดเรียงของตระกูลโมเดลนี้ด้วย เพราะ 8B อาจถูกเข้าใจผิดได้ง่ายว่าเป็นรุ่นเรือธง ทั้งที่จริงแล้วเป็นสมาชิกบริบทมาตรฐาน เช็กพอยต์ทั้งสามตัวของ tencent/ ถูกสร้างขึ้นในวันเดียวกัน (2026-08-27) แต่ปรากฏภายใต้บัญชีผู้เขียนชื่อ panzs19 ก่อนหน้านั้นหลายสัปดาห์ — 8B และ 14B (อิงจาก Qwen3) มีมาตั้งแต่กลางเดือนสิงหาคม ส่วน E4B (อิงจาก Gemma4-E4B) มีมาตั้งแต่ประมาณวันที่ 20 สิงหาคม E4B เป็นรุ่นที่มีเพดานตำแหน่ง 128K และสืบทอดเอนโค้ดเดอร์ภาพและเสียงมา ส่วน 8B และ 14B เป็นสมาชิก Qwen3-text ที่มีเพดาน 40K เฟรมเวิร์กเดียวกัน แต่คอนเทนเนอร์ต่างกันสามแบบ
สูตร merge เป็นไฟล์ที่เปิดเผยข้อมูลได้มากที่สุดในรีโพ
โอเพนซอร์สส่วนใหญ่ที่เผยแพร่มักมาพร้อมคอนฟิกและ README แล้วก็จบแค่นั้น ContextPilot-8B ยังมาพร้อม task_vectors.json ซึ่งบันทึกไว้ว่าเช็คพอยต์ถูกประกอบขึ้นมาอย่างไร: มันคือการรวมเวกเตอร์งานบนฐาน Qwen3-8B ดั้งเดิม ไม่ใช่การฟายจูนแบบ end-to-end เพียงครั้งเดียว สูตรนี้รวมเดลต้าถ่วงน้ำหนักสามตัว — SFT แบบ "joint recovery" สี่งานที่น้ำหนัก 0.5, SFT ผู้เชี่ยวชาญเฉพาะด้านการท่องเว็บที่สำเร็จที่น้ำหนัก 0.5, และการกู้คืนแบบวงปิด InfBench ที่น้ำหนัก 0.15 — เพิ่มเข้ากับฐานด้วยสูตร base + Σ weight·(expert − base)
อ่านไฟล์นั้นเพื่อดูว่ามันกล่าวถึงประวัติการฝึกอย่างไร เพราะชื่อพาธถูกระบุด้วยตราประทับเวลา การรัน SFT อยู่ภายใต้ agentic_verl/saves/sft/Qwen3-8B/ โดยมีวันที่ 20260731, 20260801 และ 20260802 — Tencent กำลังฝึกผู้เชี่ยวชาญพิเศษเหล่านี้บนสแตก agentic บนพื้นฐาน verl ตั้งแต่อาทิตย์สุดท้ายของเดือนกรกฎาคมจนถึงต้นเดือนสิงหาคม ซึ่งเป็นเวลาหลายสัปดาห์ก่อนที่น้ำหนักใดๆ จะถูกเปิดเผยแก่บุคคลภายนอก โครงสร้างการรวมยังอธิบายว่าทำไมการเผยแพร่ครั้งนี้จึงสอดคล้องกันมากสำหรับผลงานที่ไม่มีการประกาศ: ผู้เชี่ยวชาญสามคน (joint recovery, browse, InfBench) แมปแทบจะหนึ่งต่อหนึ่งกับตระกูลการประเมินสองตระกูลที่บทความอ้างว่า ได้แก่ long-context QA และ deep search
สิ่งที่ RL สอนจริงๆ
เอกสารเบื้องหลัง checkpoint — ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL (arXiv 2608.28476) — ระบุว่าโมเดลที่ผ่านการฝึกให้แก้ไขบริบทของตนเองมาจนถึงปัจจุบันนั้นมีจุดอ่อนร่วมกันสามประการ และเฟรมเวิร์กนี้ถูกออกแบบมาเพื่อแก้ทั้งสามประการพร้อมกัน
• ชุดเครื่องมือที่กว้างขึ้น นอกเหนือจากการค้นหา การลบ และการสรุปตามปกติ ContextPilot ยังมอบการวางแผน หน่วยความจำระยะยาวแบบมีโครงสร้าง (เขียน อัปเดต และอ่านบันทึก) การดึงข้อมูลจากดัชนี และการถ่ายโอนบริบทแบบนุ่มนวล — การเก็บบริบทที่ยังไม่จำเป็นต้องใช้ไว้ เพื่อให้สามารถเรียกใช้ในภายหลังแทนที่จะถูกลบและสร้างขึ้นมาใหม่
• การโรลเอาต์บางส่วนที่คำนึงถึงบริบท ไม่ใช่ทุกการแก้ไขบริบทที่มีความสำคัญเท่ากัน และการสำรวจของ RL จะสูญเปล่าเมื่อมันปฏิบัติต่อการลบเล็กน้อยแบบเดียวกับการตัดสินใจที่เปลี่ยนวิถีทั้งหมด วิธีการนี้ใช้ความแปรผันของบริบทและเอนโทรปีเพื่อค้นหาการตัดสินใจแก้ไขที่สำคัญ และรวมการสุ่มตัวอย่างสาขาไว้ที่นั่น
• การจัดสรรเครดิตแบบละเอียด (Fine-grained credit assignment) แทนที่จะให้รางวัลระดับเทรเจกทอรีสุดท้ายกับการแก้ไขบริบทระหว่างทางทุกครั้ง วิธีนี้จะประมาณค่าความได้เปรียบระดับการกระทำจากเทรเจกทอรีแยกย่อยทั้งหมดที่ผ่านการแก้ไขแต่ละครั้ง — เพื่อให้โมเดลเรียนรู้ว่าการแก้ไขแบบใดที่ช่วยได้จริง
องค์ประกอบทั้งสามนั้นคือสิ่งที่งานนี้นำเสนอ จุดตรวจสอบเป็นเพียงการทำให้สิ่งเหล่านั้นเป็นรูปธรรมบนฐาน Qwen3-8B ซึ่งเป็นเหตุผลว่าทำไมตระกูลโมเดลนี้จึงครอบคลุมฐานที่แตกต่างกันสามแบบและยังคงเป็นโปรเจกต์เดียว
ข้อกล่าวอ้างของเกณฑ์มาตรฐานที่ติดฉลากอย่างตรงไปตรงมา

กระดานคะแนนด้านบนเป็นบทสรุปของสิ่งที่ repo ระบุไว้เอง — ตัวเลขบนนั้นเป็นเพียงข้อเท็จจริงด้านการกำหนดค่าและวันที่ที่ repository บันทึกไว้ ไม่ใช่ตัวเลขประสิทธิภาพ ContextPilot ถูกวางตำแหน่งสำหรับงานสองกลุ่ม: การตอบคำถามบริบทระยะยาวบน InfBench, NovelQA และ LongMemEval และการค้นหาเชิงลึกบน BrowseComp+ ซึ่งเป็นตัวสืบทอดที่ยากกว่าของ BrowseComp ที่ต้องมีการท่องเว็บจริง บทความรายงานประสิทธิภาพที่แข็งแกร่งกว่าด้วยบริบทการทำงานที่กะทัดรัดกว่าเบสไลน์ในหลายโมเดลพื้นฐาน สิ่งเหล่านั้นเป็นข้อกล่าวอ้างของผู้เขียน ซึ่งรายงานโดยผู้จัดจำหน่ายและยังไม่มีการทำซ้ำผล การ์ดโมเดลไม่มีตัวเลข ไม่มีคะแนนอิสระ และไม่มีรายการลีดเดอร์บอร์ดสำหรับเช็คพอยต์นี้ที่ใดเลย ณ วันที่ 2026-08-31

หน้า arXiv สำหรับ 2608.28476 เป็นแหล่งข้อมูลสาธารณะที่สมบูรณ์ที่สุดในขณะนี้ — ยื่นส่งเมื่อวันที่ 28 สิงหาคม 2026 พร้อมการตอบรับในสายหลักของ EMNLP 2026 ที่แนบมาแล้ว และมีบทคัดย่อที่อ้างอิงตลอดทั้งบทความนี้
เพื่อการวิจัยเท่านั้น โดยตั้งใจ
{{1}}ใบอนุญาตคือส่วนที่ควรเป็นตัวชี้ขาดการตัดสินใจส่วนใหญ่ และเป็นใบอนุญาตที่เคร่งครัดมาก{{/1}} {{2}}น้ำหนักโมเดลที่เผยแพร่ถูกจำกัดให้ใช้เฉพาะงานวิจัยและพัฒนาทางวิทยาศาสตร์เท่านั้น โดยส่วนเพิ่มเติมข้อ 0 ตัดสิทธิ์การใช้เชิงพาณิชย์และการใช้งานจริงในระบบผลิตออกไปโดยสิ้นเชิง{{/2}} {{3}}โมเดลพื้นฐาน Qwen/Qwen3-8B อยู่ภายใต้สัญญาอนุญาต Apache 2.0 และสามารถนำไปใช้ในผลิตภัณฑ์ได้อย่างเต็มรูปแบบ ส่วนข้อจำกัดนี้เป็นของ Tencent เองที่ใช้กับโมเดล fine-tune นี้{{/3}} {{4}}หากโปรเจกต์ของคุณเป็นบทความตีพิมพ์ วิทยานิพนธ์ หรือการศึกษาประเมินผล ใบอนุญาตนี้ใช้ได้จริง{{/4}} {{5}}แต่หากเป็นผลิตภัณฑ์ ถือเป็นการหยุดทันที ไม่ใช่แค่พิธีการที่ปล่อยผ่านได้{{/5}}
สิ่งที่ต้องใช้จริงๆ ในการรันมัน
แม้แต่สำหรับกรณีการใช้งานเพื่อการวิจัย {{1}}ก็ควรจัดงบประมาณสำหรับการตั้งค่าจริง เพราะ checkpoint ไม่สามารถนำมาใช้แทนที่ได้ทันที{{/1}}. {{2}}คู่มือการอินเฟอเรนซ์กำหนดให้ต้องมี Elasticsearch สำหรับเครื่องมือค้นคืนข้อมูล {{3}}endpoint ผู้ตัดสินที่เข้ากันได้กับ OpenAI สำหรับการประเมิน LongMemEval และ BrowseComp+ {{4}}vLLM เพื่อให้บริการ checkpoint {{5}}และการจัดการข้อมูล — คำตอบของ NovelQA ต้องขอสิทธิ์การเข้าถึงแยกต่างหาก {{6}}และ BrowseComp+ มาพร้อมข้อมูลแบบอำพรางและต้องถอดรหัสภายในเครื่องเท่านั้น{{/6}}{{/5}}{{/4}}{{/3}}{{/2}}. {{7}}ในส่วนของการฝึกต้องใช้ verl โดยมีสคริปต์เปิดใช้งานสำหรับขนาด 8B และ 14B ให้{{/7}}. {{8}}นั่นคือไปป์ไลน์ระดับงานวิจัย ซึ่งสอดคล้องกับเงื่อนไขของไลเซนส์{{/8}}.
ในทางตรงกันข้าม เส้นทางการผลิตสำหรับเอเจนต์ระยะยาวยังคงเป็นโมเดลบริบทระยะยาวที่โฮสต์ไว้เบื้องหลัง API เดียว OrcaRouter กำหนดเส้นทางโมเดล 200+ รายการผ่านคีย์เดียวในราคารายการของผู้ให้บริการ โดยไม่มีส่วนเพิ่ม (0% markup) และมีการสลับไปยังระบบสำรองอัตโนมัติ ดังนั้นเมื่อผู้ให้บริการลดราคา ฝั่งเราก็จะได้ราคานั้นในวันเดียวกับที่ผู้ให้บริการปรับ — และการชั่งน้ำหนักเช็คพอยต์วิจัยอย่าง ContextPilot-8B เทียบกับผู้ให้บริการโฮสต์รายเดิมนั้นใช้เพียงการเปลี่ยนแปลงคอนฟิก ไม่ใช่สัญญาฉบับใหม่ (เพื่อความชัดเจน: เราไม่ได้โฮสต์ ContextPilot-8B และใบอนุญาตของมันไม่อนุญาตให้นำมาใช้ในเราเตอร์เชิงพาณิชย์ในปัจจุบัน)
สิ่งที่ยังไม่รู้
ณ วันที่ 31 สิงหาคม 2026 คำถามที่ยังค้างอยู่มีดังนี้: เทนเซ็นต์จะออกประกาศหรือไม่; กลุ่มอิสระจะสามารถทำซ้ำผลลัพธ์ของรายงานบน InfBench, NovelQA, LongMemEval หรือ BrowseComp+ ได้หรือไม่; ตัวเลขจำแนกตามโมเดลฐานในรายงานฉบับเต็มจะยังคงยืนหยัดได้หรือไม่; และใบอนุญาตเชิงพาณิชย์จะตามหลังใบอนุญาตสำหรับการวิจัยเท่านั้นหรือไม่ สิ่งเดียวที่ได้ข้อสรุปแล้วคือวันเผยแพร่ และเมื่อผ่านไปเพียงสี่วัน คำถามทุกข้อเหล่านี้ก็ยังคงเป็นประเด็นที่ยังไม่มีคำตอบอย่างแท้จริง
บรรทัดล่าง
ContextPilot-8B คือเช็คพอยต์ Qwen3-8B ของการเปิดตัวเอเจนต์แบบเงียบๆ ที่น่าสนใจที่สุดในเดือนนี้: การรวมเวกเตอร์งานของโมเดล SFT ผู้เชี่ยวชาญสามตัวที่สอนเอเจนต์ให้จัดการบริบทของตัวเอง โดยมีเอกสาร EMNLP 2026 ค้ำยัน นักวิจัยที่ทำงานกับเอเจนต์ระยะยาวควรอ่านสูตรการรวมและคำแนะนำการประเมินผลก่อนตัดสินใจอะไรทั้งสิ้น ทีมผลิตภัณฑ์สามารถหยุดอ่านที่สิทธิ์การใช้งานได้ เรื่องราวตอนนี้คือความเงียบ — และสิ่งที่การทดสอบอิสระสองสัปดาห์ข้างหน้าจะทำกับมัน
