การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความ 'FrogNano-4B-2609 vs Qwen 3.8' พร้อมคำโปรย 'เอเจนต์ 4B บน GPU ของคุณเอง เทียบกับเรือธงแบบโฮสต์ขนาด 2.4T' ชิปสามชิ้นที่อ่านว่า 'ดาวน์โหลด 9.32 GB' '$2 ขาเข้า / $6 ขาออก ต่อล้าน' และ 'สูงสุด 150 สเต็ปต่องาน' ส่วนท้ายที่อ่านว่า 'ตัวเลข FrogNano อ้างอิงตาม Microsoft; ราคา Qwen3.8-Max อ้างอิงตาม Alibaba ไม่มีสิ่งใดที่นี่เป็นอิสระ' และโลโก้ OrcaRouter ที่คอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

FrogNano-4B-2609 เทียบกับ Qwen 3.8: ต้นทุนของเอเจนต์เขียนโค้ดเมื่อเวตเป็นของคุณเอง

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

microsoft/FrogNano-4B-2609เป็นเอเจนต์สำหรับรีโพซิทอรีระดับสี่พันล้านที่ได้มาจาก Qwen3.5-4B ซึ่งคุณดาวน์โหลดและให้บริการเอง Qwen3.8-Maxคือเรือธงที่โฮสต์ให้บริการ — โมเดล sparse mixture-of-experts ขนาด 2.4 ล้านล้านพารามิเตอร์ โดยมีพารามิเตอร์ที่ทำงานอยู่ราว 95 พันล้านตัวต่อโทเคน หน้าต่างมัลติโมดัลขนาดหนึ่งล้านโทเคน และอัตราค่าบริการ $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $6.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน — เข้าถึงได้ด้วยคีย์ API ตั้งแต่ 3 สิงหาคม 2026 หนึ่งในนั้นต้องแลกมาด้วย GPU และเวลาหนึ่งบ่าย อีกตัวไม่มีค่าใช้จ่ายจนกว่าคุณจะใช้งานมัน และจากนั้นจะคิดค่าบริการตามโทเคนบนเส้นทางที่ยาวที่สุดที่ใช้กันทั่วไป การเปรียบเทียบที่แท้จริงคือข้อแลกเปลี่ยนนี้ ไม่ใช่ตาราง benchmark

ตัวเลขของ FrogNano ที่นี่มาจากการ์ดโมเดลและรายงานทางเทคนิคของ Microsoft; ตัวเลขของ Qwen3.8-Max มาจากราคาที่ Alibaba เผยแพร่และบันทึกโมเดลในแค็ตตาล็อกของเราเอง โดยคะแนนอิสระจะถูกกำกับว่าเป็นตัวเลขจาก Artificial Analysis ทุกที่ที่ปรากฏ โปรดสังเกตการตั้งชื่อให้ดี: Qwen3.8 รุ่นที่ปล่อยแบบโอเพนเวตส์ได้ประกาศแล้วแต่ยังไม่เปิดให้ใช้งาน ขณะที่ Qwen3.8-Max เปิดใช้งานและมีราคาแล้ววันนี้ ทุกสิ่งที่เรียกใช้งานได้ในบทความนี้คือตัวหลัง

เลขคณิตที่ตัดสินการเปรียบเทียบ

เริ่มจากสิ่งที่งานเพียงงานเดียวต้องแลกมา เพราะมันไม่ใช่เรื่องที่เห็นได้ชัด และก็ไม่ใช่เรื่องเล็ก

การประเมินของ FrogNano รันทุก trajectory ด้วยงบประมาณ 150 สเต็ปภายในขอบเขตประมาณ 131K โทเค็นรวม ที่สูงสุด 8,192 โทเค็นที่สร้างต่อหนึ่งเทิร์นของผู้ช่วย และเพดานเวลา 10,800 วินาที คูณขีดจำกัดที่เผยแพร่ทั้งสองค่าเข้าด้วยกัน แล้วคุณจะได้เพดานประมาณ 1.23 ล้านโทเค็นที่สร้างขึ้นสำหรับ trajectory กรณีเลวร้ายที่สุดหนึ่งครั้ง — ซึ่งที่ราคา $6.00 ต่อล้านโทเค็นเอาต์พุตของ Qwen3.8-Max คิดเป็นประมาณ $7.38 สำหรับงานเดียวที่รันจนถึงสิ้นสุดงบประมาณ นั่นคือการคำนวณทางคณิตศาสตร์จากตัวเลขที่เผยแพร่สองตัว ไม่ใช่การวัด: trajectory จริงหยุดก่อนเวลา ค่าเฉลี่ยต่ำกว่าเพดานมาก และผลลัพธ์ของเครื่องมือกับเอาต์พุตของเชลล์ถูกคิดค่าใช้จ่ายในอัตราอินพุตที่ถูกกว่าแทนอัตราเอาต์พุต แต่ก็ทำให้เห็นรูปร่างของสิ่งนี้ เอเจนต์เขียนโค้ดไม่ได้ใช้โทเค็นเพียงไม่กี่ร้อยโทเค็นกับคำถามหนึ่งข้อ; มันใช้บทสนทนาที่ยาวนานและเน้นการใช้เหตุผลกับตัวเอง และทุกโทเค็นของบทสนทนานั้นถูกสร้างขึ้น

ตอนนี้วางอีกด้านหนึ่งของบัญชีไว้ข้างๆ มัน FrogNano-4B-2609 เป็นเวต BF16 ขนาด 9.32 GB ในสองชาร์ด ดาวน์โหลดได้โดยไม่มีด่าน การให้บริการมันต้องการ SGLang พร้อมตัวแยกวิเคราะห์การให้เหตุผลของ Qwen3 และตัวแยกวิเคราะห์การเรียกใช้เครื่องมือของ Qwen3 coder บวกกับแซนด์บ็อกซ์ที่แยกออกต่างหากสำหรับเครื่องมือทั้งห้า หลังจากนั้นต้นทุนส่วนเพิ่มของวิถีหนึ่งคือไฟฟ้า และหน่วยความจำที่มันใช้คือขนาดที่บริบทของคุณเติบโตขึ้น ไม่ใช่น้ำหนักของเวต

• โมเดลต้นทุน — FrogNano-4B-2609 มีต้นทุนฮาร์ดแวร์คงที่และต้นทุนส่วนเพิ่มเกือบเป็นศูนย์ Qwen3.8-Max มีต้นทุนคงที่เป็นศูนย์และคิดค่าบริการต่อโทเคน โดยมีการแบ่ง $2.00 / $6.00 ที่ไม่คิดล่วงหน้าเลย และผลักภาระทั้งหมดไปที่อัตราเอาต์พุต

• สิ่งที่เงินซื้อได้ — เอเจนต์ระดับ 4B บนฮาร์ดแวร์ของคุณเอง เทียบกับโมเดลระดับแนวหน้าที่คุณไม่ต้องคอยวางแผนกำลังความจุให้เลย

• จุดคุ้มทุน — จะถึงเมื่อปริมาณ trajectory ต่อเดือนของคุณคูณกับค่าท็อกเกนเฉลี่ยต่อ trajectory แล้วมากกว่าค่าใช้จ่ายของ GPU ที่คุณจะต้องเช่าอยู่ดี สำหรับทีมที่รันงานใน repository แค่วันละไม่กี่งาน เส้นนั้นยังห่างไกลมาก และโมเดลแบบโฮสต์ชนะด้วยความสะดวกเพียงอย่างเดียว

สองโมเดลที่ทำงานไม่เหมือนกัน

การเปรียบเทียบต้นทุนจะยุติธรรมก็ต่อเมื่อผลลัพธ์นั้นเทียบเคียงกันได้ และในกรณีนี้กลับเทียบเคียงกันไม่ได้ ซึ่งเป็นส่วนที่เอกสารสเปกส่วนใหญ่มักปิดบังไว้

FrogNano-4B-2609 ถูก post-train โดยเฉพาะกับงานวิศวกรรมซอฟต์แวร์ระดับ repository อินเทอร์เฟซทั้งหมดของมันคือลูปห้าเครื่องมือ — Read, Write, Edit, Glob และ Bash — ทำงานโดย Leaf harness ใน sandbox ที่แยกออกมา วนซ้ำจนกว่าโมเดลจะหยุดเรียก การ์ดของ Microsoft ระบุภาษาที่รองรับว่าเป็นภาษาอังกฤษ และโดเมนการเขียนโปรแกรมที่ผ่านการตรวจสอบว่าเป็น Python และบอกตรง ๆ ว่าองค์ประกอบภาพและวิดีโอใน checkpoint ไม่เคยถูก post-train และไม่รองรับ มันไม่คิดวิเคราะห์สถาปัตยกรรมของคุณ ไม่ตอบคำถามเกี่ยวกับธุรกิจของคุณ หรืออ่านภาพหน้าจอ

Qwen3.8-Max เป็นโมเดลทั่วไป บันทึกแค็ตตาล็อกของ Alibaba ระบุว่ามีอินพุตข้อความ รูปภาพ และวิดีโอ พร้อมเอาต์พุตข้อความ และหน้าต่างบริบท 1,000,000 โทเคน มันให้เหตุผล เขียน อ่านเอกสาร และสนทนาได้ และการเรียกใช้ฟังก์ชันเป็นคุณสมบัติของโมเดลทั่วไป ไม่ใช่จุดประสงค์ทั้งหมดของเช็กพอยต์ ตัวเลข Artificial Analysis ของมัน ซึ่งอ่านจากบันทึกเมื่อวันที่ 2 กันยายน 2026 มีค่า Intelligence Index อยู่ที่ 45.4 และ Coding Index อยู่ที่ 76.2

• อินพุต — FrogNano-4B-2609 รองรับเฉพาะข้อความเท่านั้น Qwen3.8-Max รองรับข้อความ รูปภาพ และวิดีโอ

• บริบท — ประมาณ 131K โทเค็นรวมสำหรับการกำหนดค่าที่ประเมินของ FrogNano เทียบกับ 1,000,000 สำหรับ Qwen3.8-Max นั่นคือ 7.5 เท่า และมันสำคัญที่สุดพอดีกับอินพุตขนาดเท่ารีพอซิทอรีที่เอเจนต์เขียนโค้ดได้รับ

• เอาต์พุตต่อเทิร์น — การตั้งค่าที่ผ่านการตรวจสอบของ FrogNano จำกัดเทิร์นของผู้ช่วยหนึ่งเทิร์นไว้ที่ 8,192 โทเค็น Qwen3.8-Max ไม่ได้เปิดเผยเพดานต่อการตอบกลับที่เทียบเท่า

• รูปแบบเอาต์พุต — FrogNano ส่งการเรียกใช้เครื่องมือ Leaf แบบมีโครงสร้าง และต้องมีฮาร์เนสเพื่อรันการเรียกเหล่านั้น Qwen3.8-Max จะคืนข้อความร้อยเรียงหรือการเรียกฟังก์ชันไปยังไคลเอนต์ใดก็ตามที่คุณมีอยู่แล้ว

• คะแนนอิสระ — ไม่มีสำหรับ FrogNano-4B-2609 นอกเหนือจากที่มีในการ์ดของตัวเอง; ตัวเลขของ Qwen3.8-Max ข้างต้นเป็นข้อมูลของบุคคลที่สาม จาก Artificial Analysis

• พารามิเตอร์ — ประมาณ 4.66B สำหรับ FrogNano ตามคำอธิบายบนการ์ดของมันเอง เทียบกับ 2.4 ล้านล้านทั้งหมด และ active ประมาณ 95B สำหรับ Qwen3.8-Max

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

จุดที่ 4B พิสูจน์คุณค่าของตัวเองได้จริง ๆ

มีมิติหนึ่งที่เอเจนต์ขนาด 4B เอาชนะโมเดลระดับแนวหน้าได้อย่างเด็ดขาด และมิติ้นั้นไม่ใช่ความแม่นยำ

บทความของ FrogNano เริ่มต้นจาก Qwen3.5-4B ซึ่งทำคะแนนได้ 39.4% บน SWE-bench Verified ผ่านฮาร์เนส Leaf ในฐานะโมเดลทั่วไปธรรมดา การวนซ้ำด้วยการเรียนรู้แบบเสริมกำลังห้ารอบบนงานสังเคราะห์ราว 1,500 งาน ดันคะแนนขึ้นไปถึง 61.5% โดยภาคผนวกของบทความเดียวกันรายงานความก้าวหน้าในแต่ละรอบเป็น 48.2%, 53.4%, 58.3%, 58.6% และ 61.6% วิธีการนี้ — การสร้างงานที่ปรับเทียบให้เข้ากับพรมแดนความสามารถในการเรียนรู้ของนโยบายปัจจุบัน โดยไม่มีการกลั่นองค์ความรู้จากโมเดลที่แข็งแกร่งกว่า — คือผลงานที่นำเสนอ และเป็นเหตุผลที่กลุ่มวิจัยซึ่งไม่มีงบประมาณสำหรับโมเดลระดับแนวหน้าจะให้ความสนใจ

อ่านถึงนัยที่สิ่งนี้บอกเกี่ยวกับการเปรียบเทียบ การ์ดของ Microsoft เปิดเผยอย่างตรงไปตรงมาว่า FrogNano ไม่ได้ดีกว่าโมเดลต้นทางอย่างสม่ำเสมอในทุกด้าน: อัตราการเรียกใช้เครื่องมือแบบขนานของมันอยู่ที่ 1.71% เพราะการปรับปรุงในรอบหลัง ๆ สูญเสียความสามารถในการยิงการเรียกพร้อมกัน และทีมได้เพิ่มขั้นตอนการรวมเข้าด้วยกันเพื่อพยายามกู้ความสามารถนั้นกลับคืนมา โมเดลที่แก้ปัญหาได้มากขึ้นแต่กลับแย่ลงในพฤติกรรมหนึ่งโดยเฉพาะถือเป็นชิ้นงานทางวิศวกรรมของจริงที่มองเห็นรอยต่อได้ และการ์ดของมันก็บอกเช่นนั้นแทนที่จะปกปิดเรื่องนี้ไว้

และตัวเลข SWE-bench ก็เป็นวงจรปิด ค่าพื้นฐานของโมเดลฐาน ฮาร์เนส และคะแนนสุดท้ายล้วนมาจากแล็บเดียวกัน และตารางสองตารางในเปเปอร์เดียวกันก็ให้บันไดสองแบบที่ต่างกันสำหรับการทดลองเดียวกัน ในทางตรงกันข้าม ตัวเลขด้านการเขียนโค้ดของ Qwen3.8-Max กลับมาจาก Artificial Analysis ไม่ใช่จาก Alibaba — หลักฐานคนละชนิด ความมั่นใจคนละระดับ และสองสิ่งนี้ไม่ควรถูกนำมาหักลบกันเด็ดขาด

4B ที่คุณยังไม่อาจวางแผนรับมือได้อย่างเต็มที่นัก

มีสองสิ่งขวางกั้นระหว่าง FrogNano-4B-2609 กับตำแหน่งขึ้นโปรดักชัน และทั้งสองสิ่งนั้นอยู่ในเอกสารของมันเอง ไม่ใช่ในความเห็นของผู้ตรวจสอบคนใด

ประการแรกคือฮาร์ดแวร์ การ์ดระบุข้อกำหนดน้ำหนัก BF16 ไว้ที่ประมาณ 9.3 GB จากนั้นเสริมว่าหน่วยความจำ "จะเพิ่มขึ้นอย่างมากเมื่อบริบทรวมเข้าใกล้ประมาณ 131K โทเคน" ก่อนจะระบุว่าโมเดล GPU ขั้นต่ำที่แน่ชัด การกำหนดค่า VRAM เวอร์ชันรันไทม์ และโปรไฟล์ประสิทธิภาพ "ยังต้องได้รับการตรวจสอบยืนยันก่อนเปิดตัว" — ประโยคที่ปรากฏอยู่บนโมเดลที่ดาวน์โหลดได้แล้ว ไม่มีใครเผยแพร่ตัวเลข VRAM สำหรับการกำหนดค่าที่ประเมินไว้ และการ์ดก็ไม่มีตัวเลขดังกล่าวเช่นกัน

ประการที่สองคือจุดยืนด้านความปลอดภัย บันทึก alignment ของ Microsoft เองระบุว่า การ post-training ที่เฉพาะสำหรับ agent ไม่ได้ใช้ชุดข้อมูลด้าน safety-preference, refusal, harmful-content หรือ adversarial เลย แต่กลับปรับให้เหมาะกับความถูกต้องเชิงฟังก์ชันและการหลีกเลี่ยง regression แทน และโมเดลนี้ "ไม่ควรถือว่าถูกจัดแนวด้านความปลอดภัยอย่างอิสระสำหรับการปรับใช้แบบ autonomous โดยไม่มีข้อจำกัด" การ์ดปิดท้ายด้วยการระบุความเสี่ยงที่เป็นรูปธรรม: แพตช์อาจไม่ถูกต้องหรือไม่ปลอดภัยแม้ว่าจะผ่านการทดสอบ ประสิทธิภาพอ่อนไหวต่อคุณภาพของการทดสอบเหล่านั้น และแพตช์ที่เสนอทุกรายการจำเป็นต้องได้รับการตรวจทานจากมนุษย์ที่มีคุณสมบัติเหมาะสม รวมถึงการทดสอบ regression และความปลอดภัยอย่างอิสระก่อนนำไปใช้ โมเดลที่โฮสต์แบบทั่วไปไม่มีข้อควรระวังเฉพาะเหล่านั้น และจะไม่รันคำสั่ง shell ใน repository ของคุณเช่นกัน

กุญแจหนึ่งดอกสำหรับฝ่ายใดก็ตามที่คุณเลือก

สิ่งที่มีประโยชน์ของการรันการเปรียบเทียบนี้ในทางปฏิบัติก็คือ มีเพียงครึ่งเดียวเท่านั้นที่เป็นการดาวน์โหลด Qwen3.8-Max และโมเดลทั่วไปที่คุณจะใช้เป็นเกณฑ์เปรียบเทียบกับเอเจนต์ที่โฮสต์เองนั้น ล้วนเข้าถึงได้ผ่านปลายทางที่เข้ากันได้กับ OpenAI เพียงจุดเดียวบน OrcaRouter โดยบวกเพิ่ม 0% — ราคาตามรายการของผู้ให้บริการถูกส่งผ่านตรง ๆ ดังนั้นเมื่อผู้ให้บริการเปลี่ยนราคา มันจะมาถึงฝั่งเราภายในวันเดียวกัน ซึ่งเป็นตัวเลขที่ขยับจริงเมื่อค่าใช้จ่ายโทเคนเอาต์พุตของเอเจนต์เขียนโค้ดคือสิ่งที่คุณกำลังพยายามควบคุม นั่นยังทำให้คำถามเรื่อง failover ง่ายขึ้นด้วย: หากครึ่งที่เป็นโฮสต์ของไปป์ไลน์คุณเสื่อมประสิทธิภาพลง ระบบจะลองใหม่โดยอัตโนมัติ และการทดลองก็ดำเนินต่อไป

FrogNano-4B-2609 ไม่ใช่หนึ่งในเส้นทางของเรา และยังไม่มีกำหนดการสำหรับมัน น้ำหนักโมเดลเป็นของคุณที่จะนำไปให้บริการ และการ์ดก็ระบุไว้ตรงไปตรงมาว่าการตั้งค่าสำหรับการให้บริการยังไม่ได้รับการตรวจสอบยืนยันอย่างเต็มที่ สิ่งที่เราทำได้คือทำให้อีกฝั่งของการเปรียบเทียบไม่มีค่าใช้จ่ายใด ๆ ในการตั้งค่า เพื่อให้คำถามที่คุณลงเอยด้วยการตอบนั้นเป็นคำถามที่แท้จริง — ว่าเอเจนต์ SWE-bench ที่ผู้ขายรายงานผลไว้ 61.5% บน GPU ของคุณเอง จะเอาชนะโมเดลระดับแนวหน้าที่คิดค่าบริการตามปริมาณการใช้งาน บนงานของคุณเอง ในปริมาณการใช้งานของคุณเองได้หรือไม่

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

ควรเลือกอันไหนดี

เลือกใช้ Qwen3.8-Max เมื่องานเป็นงานทั่วไป เมื่อทีมปฏิบัติการของคนอื่นควรเป็นฝ่ายแบกรับ capacity เมื่อข้อมูลนำเข้าอาจมีรูปภาพหรือเอกสารยาว หรือเมื่อคุณต้องการคำตอบภายในวันนี้ ไม่ใช่รอสร้าง serving stack ให้เสร็จภายในวันศุกร์ คะแนนจากบุคคลที่สามของมันทำให้คุณประเมินได้คร่าว ๆ ว่ากำลังซื้ออะไรอยู่ และค่าบริการต่อโทเคนเป็นต้นทุนผันแปรที่คุณเห็นได้ก่อนตัดสินใจ สำหรับทีมที่รันงานใน repository จำนวนไม่มากต่อเดือน ตัวเลขที่คำนวณได้ไม่ได้ใกล้เคียงกันเลย

เลือกใช้ FrogNano-4B-2609 เมื่อปริมาณงานสูงพอที่การคิดค่าบริการต่อโทเคนบนเส้นทางระยะยาวกลายเป็นข้อจำกัด เมื่อข้อมูลไม่สามารถออกจากโครงสร้างพื้นฐานของคุณได้ หรือเมื่อคำถามวิจัย — เอเจนต์ขนาดเล็กสามารถฝึกให้มีความสามารถระดับรีพอซิทอรีโดยไม่มีครูได้หรือไม่ — คือสิ่งที่คุณกำลังทดสอบจริง ๆ เข้าไปโดยรู้สามสิ่งนี้: 61.5% เป็นการวัดของห้องแล็บเองบนฮาร์เนสที่ห้องแล็บดูแลเอง ไม่มีใครเผยแพร่ตัวเลข VRAM สำหรับการกำหนดค่าที่ถูกประเมิน และการ์ดเองระบุว่าการตั้งค่าการให้บริการยังไม่ได้รับการตรวจสอบยืนยัน

สิ่งที่ทำให้คู่นี้คุ้มค่าแก่การเขียนถึงก็คือ ทั้งคู่มีบรรพบุรุษร่วมกันย้อนไปสองรุ่น FrogNano สืบทอดมาจาก Qwen3.5-4B — โมเดลทั่วไปจากบริษัทเดียวกัน ซึ่งมีเรือธงขนาด 2.4 ล้านล้านพารามิเตอร์อยู่อีกฟากของหน้านี้ ไมโครซอฟต์เลือกตัวเล็ก นำไปผ่านการวนซ้ำ RL ห้ารอบบนรีโพซิทอรีสังเคราะห์ และได้ผู้เชี่ยวชาญเฉพาะทางออกมา อาลีบาบาไปอีกทางและขยายขนาดขึ้น ทั้งสองคำตอบได้รับการเผยแพร่ และช่องว่างระหว่างต้นทุนการดาวน์โหลดกับต้นทุน API คือวิธีที่ตรงไปตรงมาในการเลือกระหว่างสองสิ่งนี้

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube