
FrogNano-4B-2609 กับ Gemma 4 12B: 61.5% บน SWE-bench และยังไม่มีใครตรวจสอบเลย
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ของ MicrosoftFrogNano-4B-2609 เป็นเอเจนต์เขียนโค้ดระดับสี่พันล้านพารามิเตอร์ที่ดัดแปลงมาจาก Qwen3.5-4B ซึ่งรายงานผล 61.5% บน SWE-bench Verified Gemma 4 12B เป็นโมเดลมัลติโมดัลแบบไม่มีเอนโคเดอร์ของ DeepMind ที่มีพารามิเตอร์ 1.195 หมื่นล้าน และการ์ดของมันรายงานผล 72.0% บน LiveCodeBench v6 สองตัวเลขนี้คือสิ่งที่ผู้ซื้อจะนำมาตั้งเทียบกัน และการตั้งเทียบกันนั่นแหละคือความผิดพลาด พวกมันมาจากเบนช์มาร์กคนละชุด ฮาร์เนสคนละแบบ แล็บคนละแห่ง และที่สำคัญยิ่งกว่านั้น มีเพียงตัวเดียวในสองตัวนี้ที่มีระเบียบวิธีประเมินที่เผยแพร่แล้วและมีคนนอกได้อ่าน ทุกอย่างที่เหลือเกี่ยวกับการจับคู่ครั้งนี้ล้วนเป็นคำถามว่าแต่ละโมเดลเป็นอะไรกันแน่ และคำตอบก็คือพวกมันไม่ใช่สิ่งประเภทเดียวกันเลย
ตัวเลข FrogNano ด้านล่างนี้มาจากการ์ดโมเดลของ Microsoft และรายงานทางเทคนิคของ Microsoft ซึ่งทั้งสองฉบับเปิดเผยต่อสาธารณะตั้งแต่เดือนกันยายน และไม่มีผู้ใดนอกห้องแล็บทำซ้ำได้เลย ตัวเลขของ Gemma 4 12B มาจากการ์ดโมเดลของ Google ซึ่งก็เป็นเอกสารของผู้ขายเช่นกัน — ความต่างอยู่ที่ตัวเลขของ Gemma ผ่านการตรวจสอบจากเวลา 20 สัปดาห์และยอดดาวน์โหลดราว 2.6 ล้านครั้งมาแล้ว ส่วน FrogNano มีเพียง 2 สัปดาห์และตัวนับดาวน์โหลดที่ยังไม่ขึ้นเลขสองหลัก
แต่ละโมเดลใช้สำหรับอะไร
นี่คือส่วนที่สเปกชีตปิดบังไว้ FrogNano-4B-2609 ไม่ใช่โมเดลทั่วไปที่บังเอิญเก่งเรื่องโค้ด หากแต่เป็นเช็กพอยต์ที่การฝึกหลังการฝึกทั้งหมดเป็นงานวิศวกรรมซอฟต์แวร์ระดับรีโพซิทอรี และถูกออกแบบมาให้ขับเคลื่อนด้วยฮาร์เนสมากกว่าจะถูกพูดคุยด้วย
เครื่องมือทั้งห้าของมันคือ Read, Write, Edit, Glob และ Bash มันส่งการเรียกไปยังเครื่องมือเหล่านี้ แซนด์บ็อกซ์จะรันการเรียกเหล่านั้นและส่งคืนผลลัพธ์ จากนั้นลูปจะทำงานต่อไปจนกว่าโมเดลจะหยุดขอ การกำหนดค่าที่ถูกประเมินคือ 150 ขั้นตอนการโต้ตอบภายในโทเค็นรวมประมาณ 131K และมันสร้างแพตช์ที่เสนอสำหรับแต่ละงาน การ์ดของ Microsoft ระบุชัดเจนว่าโมเดลนี้สำหรับคลังโค้ดที่ใช้ภาษาอังกฤษเป็นหลักและเน้น Python ซึ่งมีสภาพแวดล้อมที่ทำซ้ำได้และชุดทดสอบที่รันได้ และว่าองค์ประกอบรูปภาพและวิดีโอที่สืบทอดมาจากโมเดลฐานไม่เคยถูกฝึกเพิ่มเติมหลังการฝึกและไม่รองรับ
Gemma 4 12B มีรูปแบบที่ตรงกันข้าม เป็นโมเดลแบบรวมที่มี 48 เลเยอร์ มีบริบท 256K และไม่มีตัวเข้ารหัสภาพหรือเสียงแยกต่างหาก — แพตช์ภาพดิบและรูปคลื่นเสียงจะฉายตรงเข้าสู่พื้นที่ฝังตัวของเดคอดเดอร์ตัวเดียวผ่านเลเยอร์เชิงเส้นน้ำหนักเบา โดยรับข้อความ รูปภาพ และเสียงเข้า และส่งข้อความออก มีโหมดคิดที่ทริกเกอร์โดยโทเคนในพรอมต์ระบบ การเรียกฟังก์ชันแบบเนทีฟ และการ์ดของ Google เน้นย้ำการระบุเวิร์กโฟลว์แบบเอเจนต์ในบรรดาการใช้งานที่ตั้งใจไว้
ดังนั้น คำถามที่แท้จริงจึงไม่ใช่ว่าอันไหนฉลาดกว่า แต่เป็นว่าคุณต้องการส่วนประกอบเฉพาะทางที่ทำงานได้เพียงภายในชุดระบบที่คุณต้องเป็นผู้ควบคุม กับโมเดลทั่วไปที่ทำได้ดีพอสมควรในหลาย ๆ เรื่อง และถูกเรียกใช้โดยอะไรก็ได้

ทีละบรรทัด ในจุดที่แตกต่างกันจริง ๆ
• พารามิเตอร์ — FrogNano-4B-2609 ประกาศช่วงหนึ่งว่า "500M-5B" บนการ์ดที่คำอธิบายของการ์ดเองระบุไว้ประมาณ 4.66 พันล้าน; การดาวน์โหลดยืนยันว่ามันอยู่ที่ 9.32 GB ของน้ำหนัก BF16 Gemma 4 12B คือ 11.95B ซึ่งระบุไว้ครั้งเดียวและไม่มีการทำให้คลุมเครือ อัตราส่วนอยู่ที่ประมาณ 2.6 ต่อหนึ่ง และมันปรากฏโดยตรงในสิ่งที่คุณต้องเช่า
• บริบท — การกำหนดค่าที่ได้รับการประเมินของ FrogNano อยู่ที่ประมาณ 131K โทเค็นรวม โดยการให้เหตุผลและเอาต์พุตจากเครื่องมือใช้โควตาร่วมกัน Gemma 4 12B รองรับ 256,000 โทเค็น และในแถวบริบทยาวของตัวเองทำคะแนน 43.4% บน MRCR v2 ด้วยเข็ม 8 เข็มที่ 128K หน้าต่างเกือบสองเท่า และตัวเลขที่สองเป็นผลการวัดที่เผยแพร่แล้ว ไม่ใช่คำกล่าวอ้างเรื่องความสามารถ
• โมดาลิตี — FrogNano-4B-2609 มีอินพุตเป็นข้อความ เอาต์พุตเป็นข้อความ แม้ว่าจะมี vision tower อยู่ในเช็กพอยต์ของมันก็ตาม Gemma 4 12B มีอินพุตเป็นข้อความ รูปภาพ และเสียง
• เพดานเอาต์พุต — การกำหนดค่า FrogNano ที่ผ่านการตรวจสอบแล้วอนุญาตให้สร้างโทเค็นได้ 8,192 โทเค็นต่อการตอบหนึ่งครั้งของผู้ช่วย และการ์ดของมันระบุว่าการกำหนดค่าการฝึก RL ใช้เพดานเดียวกันนั้น Gemma 4 12B ไม่ได้เผยแพร่เพดานต่อการตอบหนึ่งครั้งที่เทียบเท่ากัน ข้อจำกัดตรงนั้นคือหน้าต่าง 256K
• อินเทอร์เฟซแบบ Agentic — FrogNano ส่งการเรียก Leaf แบบมีโครงสร้างออกมา และจำเป็นต้องมีฮาร์เนสเพื่อรันการเรียกเหล่านั้น Gemma 4 12B มาพร้อมความสามารถในการเรียกฟังก์ชันแบบเนทีฟในเวอร์ชันที่ปรับแต่งด้วยคำสั่ง และสามารถเรียกใช้งานได้โดยตรง
• สัญญาอนุญาต — Gemma 4 12B เป็น Apache 2.0 ภายใต้ข้อกำหนด Gemma 4 ของ Google ซึ่งระบุไว้อย่างชัดเจน การ์ดของ FrogNano ระบุว่าเป็น MIT ในส่วนนำ และ Apache 2.0 ในเนื้อหาของตัวเอง ซึ่งเป็นความคลุมเครือแบบที่ลงเอยด้วยการตรวจสอบทางกฎหมายมากกว่าจะเป็นเชิงอรรถ
• ตัวเลข — FrogNano รายงาน 61.5% SWE-bench Verified, 37.6% SWE-bench Pro, 31.1% Terminal-Bench 2.0 และ 47.3% PatchEval-Verified Gemma 4 12B รายงาน 77.2% MMLU Pro, 72.0% LiveCodeBench v6, Codeforces ELO ที่ 1659, 78.8% GPQA Diamond และ 69.0% บน Tau2 การ์ดของ Google ไม่เผยแพร่แถว SWE-bench และการ์ดของ Microsoft ไม่เผยแพร่ LiveCodeBench ไม่มีความทับซ้อนระหว่างสกอร์บอร์ดทั้งสองเลย
หัวข้อย่อยสุดท้ายนั่นแหละคือสิ่งที่ควรยุติสัญชาตญาณในการเปรียบเทียบด้วยตัวเลข ไม่มีเบนช์มาร์กแม้แต่รายการเดียวที่ปรากฏบนการ์ดทั้งสองใบ ผู้อ่านที่นำ 61.5 มาวางเทียบกับ 72.0 ได้เปรียบเทียบอัตราการแก้ปัญหาของรีโพซิทอรีกับอัตราการผ่านโจทย์การเขียนโปรแกรมเชิงแข่งขัน ซึ่งก็ประมาณเดียวกับการนำเวลาวิ่งมาราธอนมาเทียบกับเวลาวิ่ง 100 เมตร เพราะทั้งคู่มีหน่วยเป็นวินาที
ทำไมการที่ Google เงียบเรื่อง SWE-bench จึงไม่ใช่สัญญาณเตือน
ข้อสรุปที่ชวนให้เชื่อจากรายการหัวข้อย่อยคือ FrogNano มีตัวเลข SWE-bench จริง ส่วน Gemma ไม่มี ดังนั้น FrogNano จึงชนะในคำถามเรื่องการเขียนโค้ด ข้อสรุปนั้นไม่ได้ตามมา ด้วยเหตุผลที่ควรอธิบายให้แม่นยำ
Gemma 4 12B รายงานผล Tau2 ที่ 69.0% — ซึ่งเป็นเบนช์มาร์กด้านการใช้เครื่องมือแบบเอเจนต์จากการรันสามครั้ง — ควบคู่ไปกับการรองรับการเรียกฟังก์ชันและการวางตำแหน่งที่ชัดเจนสำหรับเวิร์กโฟลว์แบบเอเจนต์ โมเดลที่ได้คะแนน 69.0 บน Tau2 ไม่ใช่โมเดลที่ทำงานแบบเอเจนต์ไม่ได้ แต่เป็นโมเดลที่ผู้ขายเลือกจะรายงานประสิทธิภาพด้านการใช้เครื่องมือแทนการแก้ปัญหารีโพซิทอรี Google ยังไม่รายงานแถว SWE-bench สำหรับ 26B หรือ 31B เช่นกัน ซึ่งเป็นทางเลือกในการนำเสนอระดับทั้งตระกูล มากกว่าจะเป็นจุดอ่อนของ 12B
ในขณะเดียวกัน ผลลัพธ์ที่สวนทางสัญชาตญาณในรายงานของ Microsoft เอง ก็เป็นสิ่งที่ผู้ที่กำลังจะซื้อ Gemma ควรอ่านอย่างละเอียด FrogNano เริ่มต้นจาก Qwen3.5-4B ซึ่งเป็นโมเดลทั่วไป และทำคะแนนได้ 39.4% บน SWE-bench Verified ผ่านฮาร์เนส Leaf การเรียนรู้แบบเสริมกำลังห้ารอบบนงานสังเคราะห์ประมาณ 1,500 งาน ทำให้คะแนนขยับขึ้นไปที่ 61.5% บทเรียนไม่ใช่ว่า "โมเดลเล็กเขียนโค้ดไม่ได้" — หากแต่เป็นว่าเช็กพอยต์ขนาด 4B ทั่วไปที่ได้ 39.4% นั้นแก้ไขชุดปัญหาที่ยากและผ่านการตรวจสอบโดยมนุษย์ได้มากกว่าหนึ่งในสามอยู่แล้ว เมื่อมีคนรันมันภายในลูปของเอเจนต์ที่มีความสามารถ Gemma 4 12B มีขนาดใหญ่เป็นสามเท่า และผ่านการพัฒนามานานกว่า 20 สัปดาห์ ยังไม่มีใครรันมันผ่าน Leaf และจนกว่าจะมีคนทำ "Gemma ไม่ใช่เอเจนต์สำหรับ repo" ก็ยังเป็นเพียงสมมติฐาน ไม่ใช่ข้อค้นพบ
ภาษีฮาร์เนส ซึ่งสกอร์บอร์ดซ่อนไว้อย่างมิดชิด
นี่คือความไม่สมมาตรเชิงปฏิบัติ และมันคือสิ่งที่ชี้ขาดการตัดสินใจซื้อ
Gemma 4 12B เป็นโมเดลหนึ่ง ดาวน์โหลดเวต 11.95B แล้วชี้ Transformers, vLLM หรือ SGLang ไปที่เวตเหล่านั้น ส่งข้อความเข้า รับข้อความออก Google เผยแพร่เส้นทางการให้บริการ ใบอนุญาตชัดเจนไม่กำกวม และผู้คนซึ่งคิดเป็นยอดดาวน์โหลดถึง 2.6 ล้านครั้งได้เจอจุดขรุขระมาแล้วและบันทึกไว้แล้ว ถ้างานคือ "สรุป stack trace นี้", "อ่านภาพหน้าจอนี้แล้วบอกว่าอะไรพัง" หรือ "เรียกฟังก์ชันนี้ด้วยอาร์กิวเมนต์เหล่านี้" มันใช้ได้แล้ววันนี้
FrogNano-4B-2609 เป็นทั้งโมเดลและฮาร์เนส และ README ของ Microsoft เองก็ทำให้ฮาร์เนสนี้กลายเป็นสิ่งที่ขาดไม่ได้ ที่เก็บโค้ดที่ github.com/microsoft/FrogNano คือชุดประเมิน Leaf ไม่ใช่โค้ดสำหรับเทรน — มันต้องใช้คลัสเตอร์ Kubernetes, เนมสเปซที่มีอยู่แล้ว, สิทธิ์ในการจัดการพอดและนโยบายเครือข่าย, สิทธิ์ในการดึงอิมเมจคอนเทนเนอร์สำหรับ benchmark และเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ซึ่งตั้งค่าตัวแยกวิเคราะห์ (parser) สำหรับการให้เหตุผลและการเรียกเครื่องมืออย่างถูกต้อง การ์ดของ Microsoft ระบุเงื่อนไขการจับคู่อย่างตรงไปตรงมา: คะแนนที่เหมือนกันต้องมาจาก checkpoint, tokenizer, การตั้งค่าการให้บริการ, อิมเมจงาน และโปรโตคอลการประเมินที่ตรงกัน ครึ่งหนึ่งของรีลีสที่สร้างคะแนนขึ้นมาคือครึ่งที่การ์ดชี้ไปยังลิงก์ GitHub
นั่นมีคุณค่าจริง และควรค่าแก่การกล่าวถึงอย่างชัดเจนมากกว่าการมองข้ามไป ผลงานของ FrogNano คือลูปการสังเคราะห์งานที่สร้างโจทย์ฝึกขึ้นใหม่ให้ตรงกับระดับความสามารถของนโยบายปัจจุบัน — ข้ออ้างในเปเปอร์คือเอเจนต์ขนาดเล็กสามารถฝึกให้ถึงระดับที่แข่งขันได้บนงานสังเคราะห์โดยไม่ต้องใช้ distillation เลย และนั่นเปิดเส้นทางให้กับใครก็ตามที่ไม่สามารถจ่ายค่าครูระดับแนวหน้าได้ API ของมันเปิดเป็นสาธารณะ วิธีการของมันสามารถทำซ้ำได้ในหลักการ นั่นเป็นผลงานที่แข็งแรงกว่าการออก checkpoint แบบก้าวหน้าทีละน้อยอีกอัน และยังเป็นงานที่ต้องใช้ความพยายามมากกว่าที่ทีมส่วนใหญ่ที่สมัครเข้าร่วมจะคาดไว้

ถ้าคุณกำลังเลือกสักอัน ให้เลือกตามงาน
เลือก Gemma 4 12B หากงานนั้นผสมผสานหลาย modality หากมีอะไรที่ต้องดูภาพหรือฟังเสียง หากบริบทต้องรองรับโครงสร้างไฟล์ขนาดใหญ่และบทถอดเสียงยาว ๆ ไว้พร้อมกัน หรือหากคุณต้องการโมเดลที่เฟรมเวิร์กใดก็โหลดได้โดยไม่ต้องมีระบบที่สองคอยรองรับ คะแนน Tau2 ที่ 69.0 และความสามารถในการเรียกฟังก์ชันแบบเนทีฟทำให้มันเป็นตัวเลือกที่หาเหตุผลมารองรับได้สำหรับไปป์ไลน์แบบเอเจนต์ และไม่มีใครจำเป็นต้องเชื่อคำพูดของแล็บใดแล็บหนึ่ง — โมเดลนี้ถูกประเมินโดยผู้คนหลายพันคน และผลลัพธ์ก็ไม่ใช่ความลับ
เอา FrogNano-4B-2609 ไปใช้ถ้าคุณมี repository agent ที่รันใน sandbox อยู่แล้ว และอยากได้ checkpoint ระดับ 4B มาหยอดใส่ และถ้าข้อจำกัดที่ขับเคลื่อนการตัดสินใจคือไฟล์ดาวน์โหลดขนาด 9.32 GB ที่ลงตัวกับฮาร์ดแวร์ระดับกลาง ๆ มองลำดับขั้นตอนให้ชัดเจนไว้: คุณไม่ได้กำลังซื้อคะแนน แต่คุณกำลังเดิมพันกับวิธีการ และสิ่งแรกที่คุณจะค้นพบคือ polling loop กับตัวแยกวิเคราะห์ tool-call ของคุณดูเหมือนของ Leaf มากพอหรือไม่ บางทีมจะได้พฤติกรรมที่ใกล้เคียง 61.5% ภายในบ่ายวันที่สาม ส่วนบางทีมจะใช้เวลาสองสัปดาห์กว่าจะพบว่าชุดประเมินของตัวเองง่ายกว่า SWE-bench Verified และยังไม่มีใครนอกแล็บบอกคุณได้ว่าคุณเป็นแบบไหน
หากการตัดสินใจนั้นใกล้เคียงกันจริง ๆ การทดลองที่ประหยัดที่สุดคือการรันทั้งสองตัวในฮาร์เนสเดียวกันบนโจทย์ของคุณเอง แทนที่จะถกเถียงกันเรื่องตัวเลขที่ตีพิมพ์ซึ่งไม่ได้ใช้เบนช์มาร์กเดียวกัน หรือcaRouter มีโมเดลกว่า 200 รุ่นอยู่เบื้องหลังคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียว โดยบวกกำไร 0% ดังนั้นราคาตามรายการของผู้ให้บริการจึงผ่านมาโดยไม่ถูกแตะต้อง — ซึ่งทำให้เป็นไปได้ที่จะวางโมเดลทั่วไปแบบโฮสต์และโมเดลที่เหลือในชุดตัวเลือกของคุณไว้เบื้องหลังปลายทางเดียวและรอบบิลเดียวระหว่างที่คุณตัดสินใจ FrogNano ไม่ได้เป็นหนึ่งในเส้นทางของเรา และยังไม่มีกำหนดการสำหรับมัน ส่วนน้ำหนักโมเดลนั้นเป็นไฟล์ดาวน์โหลดที่คุณโฮสต์เอง สิ่งที่เราช่วยลดได้คือความยุ่งยากในอีกด้านของการเปรียบเทียบ: การสลับโมเดลตัวเลือกในฮาร์เนสของคุณเองโดยไม่ต้องมีสัญญาที่สอง, SDK ตัวที่สอง หรือชุดข้อมูลรับรองชุดที่สอง

สรุปที่ตรงไปตรงมาคือ ตัวเลข 61.5 เป็นผลงานจริงโดยแล็บที่สร้างมันขึ้นมา และในตอนนี้มันเป็นเหตุผลเดียวที่ทำให้ควรเลือก FrogNano สำหรับงานเขียนโค้ด เมื่อมีคนนอกไมโครซอฟต์ทำซ้ำได้ 61.5 บนงาน 500 งานเดียวกัน — หรือทำไม่ได้ — การเปรียบเทียบนี้จะได้คำตอบที่แท้จริง จนถึงตอนนั้น ค่าเริ่มต้นที่ปลอดภัยกว่าสำหรับทีมส่วนใหญ่คือโมเดล 11.95B ที่มีสัญญาอนุญาตแบบสะอาด การวัดบริบทแบบยาวที่เผยแพร่แล้ว และความผิดพลาดของคนอื่น ๆ ตลอดยี่สิบสัปดาห์ที่ถูกดูดซับเข้าไปในเอกสารของมันแล้ว
