การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความ 'FrogNano-4B-2609 vs Gemma 4 12B' พร้อมคำบรรยายใต้ภาพ 'เอเจนต์คลังรีโพซิทอรีขนาด 4B เทียบกับโมเดลมัลติโมดัลอเนกประสงค์ขนาด 11.95B' ชิปสามชิ้นที่ระบุว่า '61.5% SWE-bench, รายงานโดยผู้จำหน่าย' '72.0% LiveCodeBench, รายงานโดยผู้จำหน่าย' และ 'ไม่มีเบนช์มาร์กที่ใช้ร่วมกัน' ส่วนท้ายที่ระบุว่า 'เบนช์มาร์กต่างกันโดยไม่ทับซ้อนกัน; กระดานคะแนนทั้งสองรายการถูกรายงานโดยผู้จำหน่าย' และโลโก้ OrcaRouter ที่ประกอบไว้ในมุมขวาล่าง
Guides & Insights

FrogNano-4B-2609 กับ Gemma 4 12B: 61.5% บน SWE-bench และยังไม่มีใครตรวจสอบเลย

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ของ MicrosoftFrogNano-4B-2609 เป็นเอเจนต์เขียนโค้ดระดับสี่พันล้านพารามิเตอร์ที่ดัดแปลงมาจาก Qwen3.5-4B ซึ่งรายงานผล 61.5% บน SWE-bench Verified Gemma 4 12B เป็นโมเดลมัลติโมดัลแบบไม่มีเอนโคเดอร์ของ DeepMind ที่มีพารามิเตอร์ 1.195 หมื่นล้าน และการ์ดของมันรายงานผล 72.0% บน LiveCodeBench v6 สองตัวเลขนี้คือสิ่งที่ผู้ซื้อจะนำมาตั้งเทียบกัน และการตั้งเทียบกันนั่นแหละคือความผิดพลาด พวกมันมาจากเบนช์มาร์กคนละชุด ฮาร์เนสคนละแบบ แล็บคนละแห่ง และที่สำคัญยิ่งกว่านั้น มีเพียงตัวเดียวในสองตัวนี้ที่มีระเบียบวิธีประเมินที่เผยแพร่แล้วและมีคนนอกได้อ่าน ทุกอย่างที่เหลือเกี่ยวกับการจับคู่ครั้งนี้ล้วนเป็นคำถามว่าแต่ละโมเดลเป็นอะไรกันแน่ และคำตอบก็คือพวกมันไม่ใช่สิ่งประเภทเดียวกันเลย

ตัวเลข FrogNano ด้านล่างนี้มาจากการ์ดโมเดลของ Microsoft และรายงานทางเทคนิคของ Microsoft ซึ่งทั้งสองฉบับเปิดเผยต่อสาธารณะตั้งแต่เดือนกันยายน และไม่มีผู้ใดนอกห้องแล็บทำซ้ำได้เลย ตัวเลขของ Gemma 4 12B มาจากการ์ดโมเดลของ Google ซึ่งก็เป็นเอกสารของผู้ขายเช่นกัน — ความต่างอยู่ที่ตัวเลขของ Gemma ผ่านการตรวจสอบจากเวลา 20 สัปดาห์และยอดดาวน์โหลดราว 2.6 ล้านครั้งมาแล้ว ส่วน FrogNano มีเพียง 2 สัปดาห์และตัวนับดาวน์โหลดที่ยังไม่ขึ้นเลขสองหลัก

แต่ละโมเดลใช้สำหรับอะไร

นี่คือส่วนที่สเปกชีตปิดบังไว้ FrogNano-4B-2609 ไม่ใช่โมเดลทั่วไปที่บังเอิญเก่งเรื่องโค้ด หากแต่เป็นเช็กพอยต์ที่การฝึกหลังการฝึกทั้งหมดเป็นงานวิศวกรรมซอฟต์แวร์ระดับรีโพซิทอรี และถูกออกแบบมาให้ขับเคลื่อนด้วยฮาร์เนสมากกว่าจะถูกพูดคุยด้วย

เครื่องมือทั้งห้าของมันคือ Read, Write, Edit, Glob และ Bash มันส่งการเรียกไปยังเครื่องมือเหล่านี้ แซนด์บ็อกซ์จะรันการเรียกเหล่านั้นและส่งคืนผลลัพธ์ จากนั้นลูปจะทำงานต่อไปจนกว่าโมเดลจะหยุดขอ การกำหนดค่าที่ถูกประเมินคือ 150 ขั้นตอนการโต้ตอบภายในโทเค็นรวมประมาณ 131K และมันสร้างแพตช์ที่เสนอสำหรับแต่ละงาน การ์ดของ Microsoft ระบุชัดเจนว่าโมเดลนี้สำหรับคลังโค้ดที่ใช้ภาษาอังกฤษเป็นหลักและเน้น Python ซึ่งมีสภาพแวดล้อมที่ทำซ้ำได้และชุดทดสอบที่รันได้ และว่าองค์ประกอบรูปภาพและวิดีโอที่สืบทอดมาจากโมเดลฐานไม่เคยถูกฝึกเพิ่มเติมหลังการฝึกและไม่รองรับ

Gemma 4 12B มีรูปแบบที่ตรงกันข้าม เป็นโมเดลแบบรวมที่มี 48 เลเยอร์ มีบริบท 256K และไม่มีตัวเข้ารหัสภาพหรือเสียงแยกต่างหาก — แพตช์ภาพดิบและรูปคลื่นเสียงจะฉายตรงเข้าสู่พื้นที่ฝังตัวของเดคอดเดอร์ตัวเดียวผ่านเลเยอร์เชิงเส้นน้ำหนักเบา โดยรับข้อความ รูปภาพ และเสียงเข้า และส่งข้อความออก มีโหมดคิดที่ทริกเกอร์โดยโทเคนในพรอมต์ระบบ การเรียกฟังก์ชันแบบเนทีฟ และการ์ดของ Google เน้นย้ำการระบุเวิร์กโฟลว์แบบเอเจนต์ในบรรดาการใช้งานที่ตั้งใจไว้

ดังนั้น คำถามที่แท้จริงจึงไม่ใช่ว่าอันไหนฉลาดกว่า แต่เป็นว่าคุณต้องการส่วนประกอบเฉพาะทางที่ทำงานได้เพียงภายในชุดระบบที่คุณต้องเป็นผู้ควบคุม กับโมเดลทั่วไปที่ทำได้ดีพอสมควรในหลาย ๆ เรื่อง และถูกเรียกใช้โดยอะไรก็ได้

A screenshot of the google/gemma-4-12B-it model card on Hugging Face showing the Gemma 4 12B Unified heading, the Any-to-Any, Transformers, Safetensors and image-text-to-text tags, the Apache 2.0 license line credited to Google DeepMind, and the model overview explaining that text, audio, image and video inputs are handled without separate encoders.

ทีละบรรทัด ในจุดที่แตกต่างกันจริง ๆ

• พารามิเตอร์ — FrogNano-4B-2609 ประกาศช่วงหนึ่งว่า "500M-5B" บนการ์ดที่คำอธิบายของการ์ดเองระบุไว้ประมาณ 4.66 พันล้าน; การดาวน์โหลดยืนยันว่ามันอยู่ที่ 9.32 GB ของน้ำหนัก BF16 Gemma 4 12B คือ 11.95B ซึ่งระบุไว้ครั้งเดียวและไม่มีการทำให้คลุมเครือ อัตราส่วนอยู่ที่ประมาณ 2.6 ต่อหนึ่ง และมันปรากฏโดยตรงในสิ่งที่คุณต้องเช่า

• บริบท — การกำหนดค่าที่ได้รับการประเมินของ FrogNano อยู่ที่ประมาณ 131K โทเค็นรวม โดยการให้เหตุผลและเอาต์พุตจากเครื่องมือใช้โควตาร่วมกัน Gemma 4 12B รองรับ 256,000 โทเค็น และในแถวบริบทยาวของตัวเองทำคะแนน 43.4% บน MRCR v2 ด้วยเข็ม 8 เข็มที่ 128K หน้าต่างเกือบสองเท่า และตัวเลขที่สองเป็นผลการวัดที่เผยแพร่แล้ว ไม่ใช่คำกล่าวอ้างเรื่องความสามารถ

• โมดาลิตี — FrogNano-4B-2609 มีอินพุตเป็นข้อความ เอาต์พุตเป็นข้อความ แม้ว่าจะมี vision tower อยู่ในเช็กพอยต์ของมันก็ตาม Gemma 4 12B มีอินพุตเป็นข้อความ รูปภาพ และเสียง

• เพดานเอาต์พุต — การกำหนดค่า FrogNano ที่ผ่านการตรวจสอบแล้วอนุญาตให้สร้างโทเค็นได้ 8,192 โทเค็นต่อการตอบหนึ่งครั้งของผู้ช่วย และการ์ดของมันระบุว่าการกำหนดค่าการฝึก RL ใช้เพดานเดียวกันนั้น Gemma 4 12B ไม่ได้เผยแพร่เพดานต่อการตอบหนึ่งครั้งที่เทียบเท่ากัน ข้อจำกัดตรงนั้นคือหน้าต่าง 256K

• อินเทอร์เฟซแบบ Agentic — FrogNano ส่งการเรียก Leaf แบบมีโครงสร้างออกมา และจำเป็นต้องมีฮาร์เนสเพื่อรันการเรียกเหล่านั้น Gemma 4 12B มาพร้อมความสามารถในการเรียกฟังก์ชันแบบเนทีฟในเวอร์ชันที่ปรับแต่งด้วยคำสั่ง และสามารถเรียกใช้งานได้โดยตรง

• สัญญาอนุญาต — Gemma 4 12B เป็น Apache 2.0 ภายใต้ข้อกำหนด Gemma 4 ของ Google ซึ่งระบุไว้อย่างชัดเจน การ์ดของ FrogNano ระบุว่าเป็น MIT ในส่วนนำ และ Apache 2.0 ในเนื้อหาของตัวเอง ซึ่งเป็นความคลุมเครือแบบที่ลงเอยด้วยการตรวจสอบทางกฎหมายมากกว่าจะเป็นเชิงอรรถ

• ตัวเลข — FrogNano รายงาน 61.5% SWE-bench Verified, 37.6% SWE-bench Pro, 31.1% Terminal-Bench 2.0 และ 47.3% PatchEval-Verified Gemma 4 12B รายงาน 77.2% MMLU Pro, 72.0% LiveCodeBench v6, Codeforces ELO ที่ 1659, 78.8% GPQA Diamond และ 69.0% บน Tau2 การ์ดของ Google ไม่เผยแพร่แถว SWE-bench และการ์ดของ Microsoft ไม่เผยแพร่ LiveCodeBench ไม่มีความทับซ้อนระหว่างสกอร์บอร์ดทั้งสองเลย

หัวข้อย่อยสุดท้ายนั่นแหละคือสิ่งที่ควรยุติสัญชาตญาณในการเปรียบเทียบด้วยตัวเลข ไม่มีเบนช์มาร์กแม้แต่รายการเดียวที่ปรากฏบนการ์ดทั้งสองใบ ผู้อ่านที่นำ 61.5 มาวางเทียบกับ 72.0 ได้เปรียบเทียบอัตราการแก้ปัญหาของรีโพซิทอรีกับอัตราการผ่านโจทย์การเขียนโปรแกรมเชิงแข่งขัน ซึ่งก็ประมาณเดียวกับการนำเวลาวิ่งมาราธอนมาเทียบกับเวลาวิ่ง 100 เมตร เพราะทั้งคู่มีหน่วยเป็นวินาที

ทำไมการที่ Google เงียบเรื่อง SWE-bench จึงไม่ใช่สัญญาณเตือน

ข้อสรุปที่ชวนให้เชื่อจากรายการหัวข้อย่อยคือ FrogNano มีตัวเลข SWE-bench จริง ส่วน Gemma ไม่มี ดังนั้น FrogNano จึงชนะในคำถามเรื่องการเขียนโค้ด ข้อสรุปนั้นไม่ได้ตามมา ด้วยเหตุผลที่ควรอธิบายให้แม่นยำ

Gemma 4 12B รายงานผล Tau2 ที่ 69.0% — ซึ่งเป็นเบนช์มาร์กด้านการใช้เครื่องมือแบบเอเจนต์จากการรันสามครั้ง — ควบคู่ไปกับการรองรับการเรียกฟังก์ชันและการวางตำแหน่งที่ชัดเจนสำหรับเวิร์กโฟลว์แบบเอเจนต์ โมเดลที่ได้คะแนน 69.0 บน Tau2 ไม่ใช่โมเดลที่ทำงานแบบเอเจนต์ไม่ได้ แต่เป็นโมเดลที่ผู้ขายเลือกจะรายงานประสิทธิภาพด้านการใช้เครื่องมือแทนการแก้ปัญหารีโพซิทอรี Google ยังไม่รายงานแถว SWE-bench สำหรับ 26B หรือ 31B เช่นกัน ซึ่งเป็นทางเลือกในการนำเสนอระดับทั้งตระกูล มากกว่าจะเป็นจุดอ่อนของ 12B

ในขณะเดียวกัน ผลลัพธ์ที่สวนทางสัญชาตญาณในรายงานของ Microsoft เอง ก็เป็นสิ่งที่ผู้ที่กำลังจะซื้อ Gemma ควรอ่านอย่างละเอียด FrogNano เริ่มต้นจาก Qwen3.5-4B ซึ่งเป็นโมเดลทั่วไป และทำคะแนนได้ 39.4% บน SWE-bench Verified ผ่านฮาร์เนส Leaf การเรียนรู้แบบเสริมกำลังห้ารอบบนงานสังเคราะห์ประมาณ 1,500 งาน ทำให้คะแนนขยับขึ้นไปที่ 61.5% บทเรียนไม่ใช่ว่า "โมเดลเล็กเขียนโค้ดไม่ได้" — หากแต่เป็นว่าเช็กพอยต์ขนาด 4B ทั่วไปที่ได้ 39.4% นั้นแก้ไขชุดปัญหาที่ยากและผ่านการตรวจสอบโดยมนุษย์ได้มากกว่าหนึ่งในสามอยู่แล้ว เมื่อมีคนรันมันภายในลูปของเอเจนต์ที่มีความสามารถ Gemma 4 12B มีขนาดใหญ่เป็นสามเท่า และผ่านการพัฒนามานานกว่า 20 สัปดาห์ ยังไม่มีใครรันมันผ่าน Leaf และจนกว่าจะมีคนทำ "Gemma ไม่ใช่เอเจนต์สำหรับ repo" ก็ยังเป็นเพียงสมมติฐาน ไม่ใช่ข้อค้นพบ

ภาษีฮาร์เนส ซึ่งสกอร์บอร์ดซ่อนไว้อย่างมิดชิด

นี่คือความไม่สมมาตรเชิงปฏิบัติ และมันคือสิ่งที่ชี้ขาดการตัดสินใจซื้อ

Gemma 4 12B เป็นโมเดลหนึ่ง ดาวน์โหลดเวต 11.95B แล้วชี้ Transformers, vLLM หรือ SGLang ไปที่เวตเหล่านั้น ส่งข้อความเข้า รับข้อความออก Google เผยแพร่เส้นทางการให้บริการ ใบอนุญาตชัดเจนไม่กำกวม และผู้คนซึ่งคิดเป็นยอดดาวน์โหลดถึง 2.6 ล้านครั้งได้เจอจุดขรุขระมาแล้วและบันทึกไว้แล้ว ถ้างานคือ "สรุป stack trace นี้", "อ่านภาพหน้าจอนี้แล้วบอกว่าอะไรพัง" หรือ "เรียกฟังก์ชันนี้ด้วยอาร์กิวเมนต์เหล่านี้" มันใช้ได้แล้ววันนี้

FrogNano-4B-2609 เป็นทั้งโมเดลและฮาร์เนส และ README ของ Microsoft เองก็ทำให้ฮาร์เนสนี้กลายเป็นสิ่งที่ขาดไม่ได้ ที่เก็บโค้ดที่ github.com/microsoft/FrogNano คือชุดประเมิน Leaf ไม่ใช่โค้ดสำหรับเทรน — มันต้องใช้คลัสเตอร์ Kubernetes, เนมสเปซที่มีอยู่แล้ว, สิทธิ์ในการจัดการพอดและนโยบายเครือข่าย, สิทธิ์ในการดึงอิมเมจคอนเทนเนอร์สำหรับ benchmark และเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ซึ่งตั้งค่าตัวแยกวิเคราะห์ (parser) สำหรับการให้เหตุผลและการเรียกเครื่องมืออย่างถูกต้อง การ์ดของ Microsoft ระบุเงื่อนไขการจับคู่อย่างตรงไปตรงมา: คะแนนที่เหมือนกันต้องมาจาก checkpoint, tokenizer, การตั้งค่าการให้บริการ, อิมเมจงาน และโปรโตคอลการประเมินที่ตรงกัน ครึ่งหนึ่งของรีลีสที่สร้างคะแนนขึ้นมาคือครึ่งที่การ์ดชี้ไปยังลิงก์ GitHub

นั่นมีคุณค่าจริง และควรค่าแก่การกล่าวถึงอย่างชัดเจนมากกว่าการมองข้ามไป ผลงานของ FrogNano คือลูปการสังเคราะห์งานที่สร้างโจทย์ฝึกขึ้นใหม่ให้ตรงกับระดับความสามารถของนโยบายปัจจุบัน — ข้ออ้างในเปเปอร์คือเอเจนต์ขนาดเล็กสามารถฝึกให้ถึงระดับที่แข่งขันได้บนงานสังเคราะห์โดยไม่ต้องใช้ distillation เลย และนั่นเปิดเส้นทางให้กับใครก็ตามที่ไม่สามารถจ่ายค่าครูระดับแนวหน้าได้ API ของมันเปิดเป็นสาธารณะ วิธีการของมันสามารถทำซ้ำได้ในหลักการ นั่นเป็นผลงานที่แข็งแรงกว่าการออก checkpoint แบบก้าวหน้าทีละน้อยอีกอัน และยังเป็นงานที่ต้องใช้ความพยายามมากกว่าที่ทีมส่วนใหญ่ที่สมัครเข้าร่วมจะคาดไว้

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Gemma 4 12B'. The left column reads Parameters approx 4.66B with the card saying 500M-5B, Context about 131K evaluated, Input text only, Harness required Leaf with 5 tools, SWE-bench Verified 61.5% vendor, and Independent evals none. The right column reads Parameters 11.95B, Context 256,000 tokens, Input text, image, audio, Harness none required, LiveCodeBench v6 72.0% vendor, and Independent evals widely run. A footer reads 'Different benchmarks, no overlap; both scoreboards vendor-reported.'

ถ้าคุณกำลังเลือกสักอัน ให้เลือกตามงาน

เลือก Gemma 4 12B หากงานนั้นผสมผสานหลาย modality หากมีอะไรที่ต้องดูภาพหรือฟังเสียง หากบริบทต้องรองรับโครงสร้างไฟล์ขนาดใหญ่และบทถอดเสียงยาว ๆ ไว้พร้อมกัน หรือหากคุณต้องการโมเดลที่เฟรมเวิร์กใดก็โหลดได้โดยไม่ต้องมีระบบที่สองคอยรองรับ คะแนน Tau2 ที่ 69.0 และความสามารถในการเรียกฟังก์ชันแบบเนทีฟทำให้มันเป็นตัวเลือกที่หาเหตุผลมารองรับได้สำหรับไปป์ไลน์แบบเอเจนต์ และไม่มีใครจำเป็นต้องเชื่อคำพูดของแล็บใดแล็บหนึ่ง — โมเดลนี้ถูกประเมินโดยผู้คนหลายพันคน และผลลัพธ์ก็ไม่ใช่ความลับ

เอา FrogNano-4B-2609 ไปใช้ถ้าคุณมี repository agent ที่รันใน sandbox อยู่แล้ว และอยากได้ checkpoint ระดับ 4B มาหยอดใส่ และถ้าข้อจำกัดที่ขับเคลื่อนการตัดสินใจคือไฟล์ดาวน์โหลดขนาด 9.32 GB ที่ลงตัวกับฮาร์ดแวร์ระดับกลาง ๆ มองลำดับขั้นตอนให้ชัดเจนไว้: คุณไม่ได้กำลังซื้อคะแนน แต่คุณกำลังเดิมพันกับวิธีการ และสิ่งแรกที่คุณจะค้นพบคือ polling loop กับตัวแยกวิเคราะห์ tool-call ของคุณดูเหมือนของ Leaf มากพอหรือไม่ บางทีมจะได้พฤติกรรมที่ใกล้เคียง 61.5% ภายในบ่ายวันที่สาม ส่วนบางทีมจะใช้เวลาสองสัปดาห์กว่าจะพบว่าชุดประเมินของตัวเองง่ายกว่า SWE-bench Verified และยังไม่มีใครนอกแล็บบอกคุณได้ว่าคุณเป็นแบบไหน

หากการตัดสินใจนั้นใกล้เคียงกันจริง ๆ การทดลองที่ประหยัดที่สุดคือการรันทั้งสองตัวในฮาร์เนสเดียวกันบนโจทย์ของคุณเอง แทนที่จะถกเถียงกันเรื่องตัวเลขที่ตีพิมพ์ซึ่งไม่ได้ใช้เบนช์มาร์กเดียวกัน หรือcaRouter มีโมเดลกว่า 200 รุ่นอยู่เบื้องหลังคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียว โดยบวกกำไร 0% ดังนั้นราคาตามรายการของผู้ให้บริการจึงผ่านมาโดยไม่ถูกแตะต้อง — ซึ่งทำให้เป็นไปได้ที่จะวางโมเดลทั่วไปแบบโฮสต์และโมเดลที่เหลือในชุดตัวเลือกของคุณไว้เบื้องหลังปลายทางเดียวและรอบบิลเดียวระหว่างที่คุณตัดสินใจ FrogNano ไม่ได้เป็นหนึ่งในเส้นทางของเรา และยังไม่มีกำหนดการสำหรับมัน ส่วนน้ำหนักโมเดลนั้นเป็นไฟล์ดาวน์โหลดที่คุณโฮสต์เอง สิ่งที่เราช่วยลดได้คือความยุ่งยากในอีกด้านของการเปรียบเทียบ: การสลับโมเดลตัวเลือกในฮาร์เนสของคุณเองโดยไม่ต้องมีสัญญาที่สอง, SDK ตัวที่สอง หรือชุดข้อมูลรับรองชุดที่สอง

A generated timeline card headed 'Two releases, twenty weeks apart' showing an upper bar labelled Gemma 4 12B uploaded 23 May 2026 with 2.6 million downloads across the family, and a lower bar labelled FrogNano-4B-2609 uploaded 17 September 2026 with no announcement, with a span marker of 20 weeks between them and a footer reading 'Download figures from Hugging Face on 3 October 2026.'

สรุปที่ตรงไปตรงมาคือ ตัวเลข 61.5 เป็นผลงานจริงโดยแล็บที่สร้างมันขึ้นมา และในตอนนี้มันเป็นเหตุผลเดียวที่ทำให้ควรเลือก FrogNano สำหรับงานเขียนโค้ด เมื่อมีคนนอกไมโครซอฟต์ทำซ้ำได้ 61.5 บนงาน 500 งานเดียวกัน — หรือทำไม่ได้ — การเปรียบเทียบนี้จะได้คำตอบที่แท้จริง จนถึงตอนนั้น ค่าเริ่มต้นที่ปลอดภัยกว่าสำหรับทีมส่วนใหญ่คือโมเดล 11.95B ที่มีสัญญาอนุญาตแบบสะอาด การวัดบริบทแบบยาวที่เผยแพร่แล้ว และความผิดพลาดของคนอื่น ๆ ตลอดยี่สิบสัปดาห์ที่ถูกดูดซับเข้าไปในเอกสารของมันแล้ว

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube