
FrogNano-4B-2609: Microsoft ปล่อยเอเจนต์เขียนโค้ดขนาด 4B สู่ Hugging Face โดยไม่ประกาศเลย
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
รีโพซิทอรีนี้เปิดตัวเมื่อวันที่ 17 กันยายน 2026 พร้อมกับคอมมิตแรก และตัวเช็กพอยต์ก็ลงตามมาในอีกสี่นาทีถัดมา จากนั้นก็ไม่มีอะไรเลย ไม่มีทวีตจาก Microsoft AI ไม่มีรายการบนบล็อก Microsoft Research ไม่มีหน้าเปิดตัว เจ็ดสัปดาห์ต่อมา microsoft/FrogNano-4B-2609 — เอเจนต์เขียนโค้ดระดับสี่พันล้านพารามิเตอร์ที่สร้างบน Qwen3.5-4B — ยังไม่มีประกาศใดๆ อยู่เบื้องหลัง และความเงียบนั้นคือข้อเท็จจริงที่สำคัญที่สุดเพียงหนึ่งเดียวเกี่ยวกับการเผยแพร่โมเดลนี้ สิ่งที่มันมีก็คือโมเดลการ์ดที่อ้างถึงทั้งเปเปอร์และฮาร์เนส รีโพซิทอรี GitHub ที่กลายเป็นว่าคือฮาร์เนสไม่ใช่เปเปอร์ และ createdAt ที่เป็นวันที่ 17 กันยายน อยู่ใต้การ์ดที่เขียนว่า "Release date 22-SEP-2026" วันที่ทั้งสองถูกกะขึ้นมาเอง ไม่มีอันไหนผิด และทั้งสองก็ขัดแย้งกันเอง
สิ่งที่เผยแพร่จริง ๆ คืออะไร
ทุกอย่างด้านล่างนี้สามารถตรวจสอบได้บนฮับในตอนนี้ และตัวเลขทุกตัวในชิ้นนี้มาจากการ์ดของ Microsoft เอง หรือจากจำนวนไบต์ในรีโพซิทอรีเอง ไม่มีสิ่งใดถูกทำซ้ำโดยบุคคลที่สาม — ไม่มีรายการ Artificial Analysis ไม่มีคะแนน arena และไม่มีการประเมิน FrogNano แบบอิสระที่ไหนเลย
• Weights — ที่เก็บโค้ดสาธารณะหนึ่งแห่งภายใต้องค์กร Microsoft ไม่มีด่านกั้น ติดแท็ก MIT บน hub 15 ไฟล์ ไม่มีด่านดาวน์โหลด และไม่มีข้อตกลงให้ลงนาม
• เวทบนดิสก์ — 9.32 GB กระจายอยู่ในสองชาร์ด safetensors, 59.6 พันล้านไบต์ของข้อมูลรีโพซิทอรี รวมถึงชุดไฟล์ที่ไม่มีออปติไมเซอร์, 738 เทนเซอร์ในดัชนี
• สถาปัตยกรรม — Qwen3_5ForConditionalGeneration ซึ่งเป็นสแต็กแบบไฮบริดหนาแน่น 32 เลเยอร์ที่สืบทอดมาจาก Qwen3.5-4B พร้อมด้วยวิสชันทาวเวอร์ 24 เลเยอร์ที่การ์ดระบุว่าสืบทอดมาและไม่เคยผ่านการฝึกภายหลัง
• ฟิลด์พารามิเตอร์ของการ์ดเอง — "500M-5B" นั่นเป็นช่วง ไม่ใช่ตัวเลข และไฟล์ดาวน์โหลดเป็นเอกสารที่แม่นยำกว่า
• สัญญาอนุญาต — ข้อมูลส่วนหน้าของการ์ดระบุว่า MIT ตัวเนื้อหาของการ์ดเองกลับระบุว่า Apache License 2.0 และฮาร์เนสของ GitHub ก็มีไฟล์ LICENSE แบบ MIT มาด้วยจริง ๆ ข้อความทั้งสองนี้พูดถึงอาร์ติแฟกต์ที่ต่างกันในรีลีสเดียวกัน
• ประกาศ — ไม่มี. ไม่ปรากฏบนบล็อก Microsoft Research ไม่ปรากฏบนเว็บไซต์งานวิจัยของทีมเอง และไม่ปรากฏในฟีดขององค์กร Hugging Face ในรูปแบบอื่นใดนอกจากการเป็นรายการรีโพซิทอรี
บรรทัดสุดท้ายคือบรรทัดที่ควรกำหนดท่าทีของผู้อ่านต่อเนื้อหาที่เหลือของชิ้นนี้ เช็กพอยต์ที่อัปโหลดอย่างเงียบ ๆ ไม่ใช่ชิ้นงานที่ด้อยกว่าตัวที่ประกาศแล้ว — การ์ดของมันมักยาวกว่า เพราะไม่มีใครตัดทอนมันเพื่อทำข่าวประชาสัมพันธ์ แต่มันยังไม่ได้ผ่านตัวกรองเพียงหนึ่งเดียวที่การเปิดตัวแบบประกาศได้รับมาฟรี ๆ นั่นคือการมีคนอื่นมาดูมัน

คะแนน และใครเป็นผู้ผลิตทุกคะแนน
Microsoft รายงานว่า FrogNano ทำได้ 61.5% บน SWE-bench Verified, 37.6% บน SWE-bench Pro, 31.1% บน Terminal-Bench 2.0 และ 47.3% บน PatchEval-Verified โดยทั้งหมดเป็นอัตราการแก้ปัญหาที่วัดแบบ Avg@3 ผ่านฮาร์เนส Leaf การ์ดเดียวกันให้จุดตั้งต้นไว้: Qwen3.5-4B ทำได้ 39.4% บน SWE-bench Verified ภายใต้ฮาร์เนสและงบประมาณเดียวกัน การวนซ้ำการเรียนรู้แบบเสริมกำลังห้ารอบพาโมเดลทำได้ 49.1%, 53.1%, 56.7%, 59.1% และ 61.5% — 22.1 คะแนนเหนือโมเดลฐาน ซึ่งเมื่อคิดตามกรอบของ Microsoft เองจะปัดเป็นประมาณ 56% ของการปรับปรุงเชิงสัมพัทธ์
มีสองสิ่งเกี่ยวกับบันไดนั้นที่ควรหยุดคิดสักหน่อย เพราะมันเป็นจุดที่บทสรุปอาจผิดพลาดได้ มากกว่าจะเป็นจุดที่ผู้ขายทำพลาด
ข้อแรกคือความคลาดเคลื่อนของ Iter 5 ตารางพาดหัวของการ์ดบอกว่า 61.5% สำหรับรอบทำซ้ำสุดท้าย ส่วนภาคผนวกด้านประสิทธิภาพของบทความเองรายงานลำดับความก้าวหน้าห้าจุดตรวจชุดเดียวกันว่าเป็น 48.2%, 53.4%, 58.3%, 58.6% และ 61.6% มีเพียงตัวเลขสุดท้ายเท่านั้นที่ใกล้เคียง และมีเพียงตัวเลขสุดท้ายเท่านั้นที่ใคร ๆ ก็ยกมาอ้าง ให้ถือว่าตัวเลขสุดท้ายเป็นผลลัพธ์ที่มั่นคง และถือว่าขั้นกลางเหล่านั้นเป็นการวัดสิ่งที่แตกต่างกัน เพราะภายใต้การรวมผลแบบอื่น พวกมันเป็นเช่นนั้นอย่างชัดเจน
ประการที่สองคือ FrogNano ไม่ได้ดีกว่าโมเดลที่มันเริ่มต้นมาในทุกมิติอย่างสม่ำเสมอ อัตราการเรียกใช้เครื่องมือแบบขนานที่เผยแพร่ของมันคือ 1.71% การ์ดนี้เปิดเผยตรงไปตรงมาว่าการทำซ้ำในภายหลังสูญเสียความสามารถในการเรียกใช้เครื่องมือหลายรายการในเทิร์นเดียว และงาน consolidation ของทีมมีอยู่ส่วนหนึ่งเพื่อกู้ความสามารถนี้กลับคืนมา โมเดลที่แก้ปัญหามากขึ้นแต่แทบไม่มีการเรียกใช้พร้อมกันเลยเป็นการแลกเปลี่ยนทางวิศวกรรมที่แท้จริง ไม่ใช่เชิงอรรถ

ฮาร์เนสคือผลิตภัณฑ์ และรีโพซิทอรีคือฮาร์เนส
FrogNano ไม่ได้ทำงานด้วยตัวเอง มันจะส่งคำสั่งแบบมีโครงสร้างไปยังเครื่องมือห้าตัว — Read, Write, Edit, Glob และ Bash — และต้องมีบางสิ่งคอยรันคำสั่งเหล่านั้นในสภาพแวดล้อมที่แยกออกมาต่างหาก แล้วส่งผลลัพธ์กลับมา สิ่งนั้นคือ Leaf และตรงนี้เส้นทางก็ทำอะไรที่แปลกออกไปเล็กน้อย
แถว “สินทรัพย์ที่เกี่ยวข้องเพิ่มเติม” ของการ์ดโมเดลลิงก์ไปยังรายงานทางเทคนิคที่ aka.ms/frognano-tech-report และฮาร์เนสที่ github.com/microsoft/FrogNano. ส่วน aka.ms ลิงก์นี้ไม่ได้ชี้ไปที่ไฟล์ PDF; แต่เปลี่ยนเส้นทางตรงไปยังหน้าบทคัดย่อของ arXiv ซึ่งเป็นที่ที่รายงานฉบับจริงอยู่ ในขณะเดียวกัน ที่เก็บ GitHub ไม่มีโค้ดสำหรับการเทรน ไม่มีสูตร RL และไม่มีเช็กพอยต์ README ของมันเองอธิบายฮาร์เนสสำหรับการประเมินผลที่รันเอเจนต์เขียนโค้ดในแซนด์บ็อกซ์ Kubernetes กับปลายทางที่เข้ากันได้กับ OpenAI และชี้กลับไปที่บทความ arXiv สำหรับเรื่องราวการเทรน ดังนั้นลิงก์ทรัพยากรสองรายการของการ์ดจึงเป็นตัวชี้ไปยังบทความ และเป็นตัวชี้ไปยังการตอบกลับของบทความ และชื่อนี้เป็นชื่อที่ใช้ร่วมกัน
เรื่องนี้สำคัญในทางปฏิบัติสำหรับทุกคนที่วางแผนจะใช้โมเดลนี้ สูตรการให้บริการที่ระบุไว้ในเอกสารคือ SGLang พร้อมกับ --reasoning-parser qwen3 และ --tool-call-parser qwen3_coder และฮาร์เนสต้องการเอนด์พอยต์ที่รองรับการเรียกใช้เครื่องมือและการให้เหตุผลอยู่แล้ว หากตั้งค่าการแยกวิเคราะห์ผิดไปเล็กน้อย โมเดลจะสร้างข้อความในจุดที่ฮาร์เนสคาดหวัง JSON ซึ่งเมื่อมองจากภายนอกจะดูเหมือนโมเดลแย่ ทั้งที่จริงเป็นเพียงการตั้งค่าที่ผิด การ์ดระบุชัดเจนว่าคะแนนที่ตรงกันใด ๆ จำเป็นต้องมีเช็กพอยต์ โทเค็นไนเซอร์ การตั้งค่าการให้บริการ ภาพงาน และโปรโตคอลการประเมินที่ตรงกัน — นั่นคือผู้ขายกำลังบอกคุณว่าฮาร์เนสเป็นครึ่งหนึ่งของผลลัพธ์
ยังควรพูดให้ชัดเจนสำหรับใครก็ตามที่กำลังกำหนดสเปกฮาร์ดแวร์: เช็กพอยต์ขนาด 9.32 GB ณ บริบทที่การ์ดประเมินไว้ ไม่ได้แปลว่าเป็นปัญหาการอินเฟอเรนซ์ขนาด 9.32 GB การประเมินรันที่ประมาณ 131K โทเคนรวม โดยมีงบ 150 สเต็ป หน่วยความจำสเกลตามบริบท ไม่ใช่ตามน้ำหนัก และการ์ดระบุว่าคอนฟิกูเรชัน GPU ขั้นต่ำยัง “ต้องได้รับการตรวจสอบก่อนเผยแพร่” — ข้อความนี้ปรากฏอยู่บนโมเดลที่ดาวน์โหลดได้แล้ว
สิ่งที่การฝึกอบรมทำจริง ๆ ในหนึ่งย่อหน้า
ผลงานของบทความนี้ไม่ใช่ตัวโมเดล แต่คือลูป TaskPilot สร้างงานวิศวกรรมซอฟต์แวร์ที่เป็นแคนดิเดตจากสแนปช็อตของรีโพซิทอรีจริง รันโรลเอาต์จากเช็กพอยต์ปัจจุบันกับงานเหล่านั้น เก็บงานที่อยู่ใกล้ขอบของสิ่งที่เช็กพอยต์บางครั้งแก้ได้ และทิ้งแคนดิเดตที่เป็นเรื่องจิ๊บจ๊อยถาวรหรือเป็นไปไม่ได้ถาวร ชุดที่รับเข้ามาใช้ฝึกเช็กพอยต์ถัดไป จากนั้นเช็กพอยต์ถัดไปนั้นจะปรับเทียบการสร้างงานรอบถัดไป ดังนั้นการกระจายของงานจึงเคลื่อนไปตามการเคลื่อนของนโยบาย ประมาณ 1,500 สภาพแวดล้อมที่ผ่านการตรวจสอบทั้งหมด ไม่มีการกลั่นความรู้: การ์ดระบุตรง ๆ ว่าการฝึกหลังการฝึกเฉพาะเอเจนต์ไม่ได้ใช้เส้นทางการแก้ปัญหา แอ็กชัน ร่องรอยการให้เหตุผล หรือเป้าหมายแพตช์จากโมเดลที่แข็งแกร่งกว่า โมเดลที่แข็งแกร่งกว่าเขียนงาน พวกมันไม่ได้สาธิตคำตอบ
ไมโครซอฟต์รันลูปนั้นไปห้ารอบ และรายงานว่าได้เพิ่มขึ้น 8.7 จุดก่อนที่จะมีการควบรวมใด ๆ โดยเพิ่มบทลงโทษด้านความยาวบันทึกขึ้นกลางการรัน เนื่องจากร่องรอยการให้เหตุผลขยายตัวเร็วกว่าที่มันจะพัฒนาดีขึ้น
การ์ดแบบจำลองนี้พูดตรงไปตรงมาอย่างผิดปกติว่าแนวทางทั้งหมดนี้เปราะบางตรงไหน ข้อมูลฝึกถูกใช้กับ Python เป็นหลักและเป็นภาษาอังกฤษเป็นส่วนใหญ่ ชุดภาษาธรรมชาติที่การ์ดระบุว่ารองรับคือภาษาอังกฤษเท่านั้น ไม่มีภาษาอื่น โดยไม่ได้อ้างถึงความครอบคลุมหลายภาษาที่กว้างกว่าของแบบจำลองฐานอย่างชัดเจน ประสิทธิภาพขึ้นอยู่กับฮาร์เนสและคุณภาพของการทดสอบ แพตช์ที่สร้างขึ้น "อาจไม่ถูกต้องหรือไม่ปลอดภัยแม้จะผ่านการทดสอบที่มีอยู่" การ์ดแบบจำลองของรุ่น 4B ปิดย่อหน้านั้นด้วยประโยคที่ผู้อ่านทุกคนควรจดจำ คือ ไม่ควรนำไปใช้โดยไม่มีการตรวจทานโดยมนุษย์ที่มีคุณสมบัติเหมาะสมและการทดสอบการถดถอยและความปลอดภัยอย่างอิสระ นั่นคือถ้อยแถลงของผู้จำหน่ายเกี่ยวกับชิ้นงานของผู้จำหน่ายเอง และเป็นประโยคที่มีประโยชน์ยิ่งกว่าทุกแถวในกระดานคะแนนข้างต้น
ผู้ซื้อจะเหลือทางเลือกอะไร และเราเตอร์จะเข้ามามีบทบาทตรงไหน
FrogNano ไม่ใช่โมเดลที่คุณเรียกใช้ ไม่มี API ของเจ้าของเอง ไม่มีเอนด์พอยต์ที่โฮสต์ไว้ และไม่มีอิมเมจแบบเซิร์ฟเวอร์เลส มันเป็นเช็กพอยต์ และการใช้งานมันหมายถึงการตั้งดีพลอยเมนต์ SGLang ของคุณเองไว้เบื้องหลังแซนด์บ็อกซ์ที่โฮสต์บน Kubernetes หรือไม่ก็ประเมินมันเป็นคอมโพเนนต์ภายในสแตกเอเจนต์ที่คุณดำเนินการอยู่แล้ว นั่นคือเส้นทางการนำไปใช้ทั้งหมดในตอนนี้ และไม่มีการประกาศใดที่จะเปลี่ยนรูปร่างของมัน
สิ่งที่ routing layer ทำได้อย่างตรงไปตรงมาในกรณีนี้เป็นเรื่องที่แคบกว่าที่ฟังครั้งแรก หากแผนคือการนำ FrogNano ที่โฮสต์เองมาเปรียบเทียบกับโมเดลเขียนโค้ดแบบโฮสต์ภายในฮาร์เนสของคุณเอง ครึ่งที่เป็นแบบโฮสต์คือครึ่งที่ได้ประโยชน์จากการอยู่เบื้องหลังคีย์เดียวแทนที่จะเป็นสัญญาอีกฉบับ: OrcaRouter รองรับโมเดลกว่า 200 รุ่นไว้เบื้องหลัง endpoint เดียวที่เข้ากันได้กับ OpenAI โดยไม่บวกกำไรเพิ่ม 0% ซึ่งหมายความว่า ราคาตามรายการของผู้ให้บริการถูกส่งผ่านไปโดยไม่ถูกแตะต้อง และหากผู้ขายปรับราคา ฝั่งเราจะอัปเดตให้มีผลภายในวันเดียวกัน เรื่องนี้สำคัญสำหรับการทดสอบเปรียบเทียบที่ผลลัพธ์ตัดสินกันด้วยต้นทุนต่อปัญหาที่แก้ได้ ไม่ใช่ตัวเลขจาก benchmark เพียงตัวเดียว เราไม่ได้โฮสต์ FrogNano และไม่มีกำหนดการสำหรับเรื่องนี้ น้ำหนักโมเดลและงานด้านการให้บริการเป็นความรับผิดชอบของคุณ

สามสิ่งที่ทำให้เรื่องนี้จบ
อย่างแรก การทำซ้ำโดยอิสระ ทุกตัวเลขในบทความนี้ — 61.5, 37.6, 31.1, 47.3 — ถูกสร้างขึ้นโดยห้องแล็บที่ฝึกโมเดล บนฮาร์เนสที่ห้องแล็บเดียวกันดูแล เทียบกับตัวเลขของโมเดลฐานที่ห้องแล็บเดียวกันวัดมา นั่นคือภาพที่สมบูรณ์และสอดคล้องกันภายใน และยังเป็นวงปิดด้วย การทดสอบที่มีประโยชน์คือว่าใครสักคนที่ไม่มีส่วนได้ส่วนเสียจะทำซ้ำการกระโดดจาก 39.4 ไปเป็น 61.5 บนงาน 500 งานเดียวกันได้หรือไม่ โดยไม่มีงานปรับเทียบของ Microsoft บนชุดงานนั้น
ประการที่สอง ต้องมีคนตรวจสอบข้ออ้างเกี่ยวกับฮาร์เนสนั้นแบบครบวงจร รีโพซิทอรีเป็นแบบสาธารณะ ซึ่งมากกว่าที่หลาย ๆ รุ่นทำได้ แต่มันคือชุดเครื่องมือประเมิน หากเครื่องมือทั้งห้าและระบบแยกแซนด์บ็อกซ์เป็นกลไกที่ทำให้เกิดประสิทธิภาพจริง ๆ บุคคลที่สามที่รันการตั้งค่าที่เผยแพร่ควรได้ตัวเลขใกล้เคียงกับตัวเลขที่เผยแพร่ หากไม่เป็นเช่นนั้น ช่องว่างตรงนั้นแหละคือสิ่งที่ค้นพบที่แท้จริง
ประการที่สาม และเป็นข้อที่ตอบได้ด้วยต้นทุนต่ำที่สุด: Microsoft ควรบอกว่านี่เป็นผลิตภัณฑ์หรือผลงานบนกระดาษ ส่วนการเผยแพร่ของการ์ดมองว่าน้ำหนัก การ์ด และฮาร์เนสเป็นสิ่งส่งมอบ ซึ่งอ่านแล้วเหมือนการตีพิมพ์มากกว่าการเปิดตัว "วันวางจำหน่าย 22-SEP-2026" อ่านแล้วเหมือนการเปิดตัว โมเดลที่ประกาศแล้วน่าจะคลี่คลายความกำกวมนั้นได้ในประโยคแรกของโพสต์บล็อก และไม่มีโพสต์บล็อกอยู่เลย
จนถึงตอนนั้น ท่าทีที่ถูกต้องคือท่าทีที่ตัวรีลีสเองบอกเป็นนัยไว้ FrogNano-4B-2609 เป็นเช็กพอยต์จริง ดาวน์โหลดได้ มีสัญญาอนุญาต MIT และ Apache และอาจจะไม่ พร้อมการ์ดโมเดลที่ละเอียดอย่างผิดปกติ ชุดทดสอบประเมินผลแบบสาธารณะ แนวคิดเชิงระเบียบวิธีที่แท้จริง และกระดานคะแนนที่ไม่เคยมีใครซึ่งไม่มีที่อยู่อีเมล Microsoft แตะต้องเลย สำหรับห้องแล็บ นั่นคืออาร์ติแฟกต์ที่สมบูรณ์และน่าสนใจ สำหรับทีมที่กำลังจะเอาเอเจนต์ไปไว้หน้ารีพอซิทอรีตอนตีสาม มันเป็นเบาะแสที่ควรตามต่อ ยังไม่ใช่การตัดสินใจที่ควรลงมือทำ
