การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งอ่านว่า 'FrogNano-4B-2609 vs LFM2.5 2.6B Base' พร้อมคำโปรยย่อย 'เอเจนต์ขนาด 4B ที่ผ่านการฝึกจนเสร็จสมบูรณ์ เทียบกับเช็กพอยต์พรีเทรนขนาด 2.69B' ชิปสามชิ้นที่อ่านว่า 'การฝึกหลังด้วย RL เสร็จสิ้น' 'พรีเทรนเท่านั้น 2.69B แบบ dense ใน 30 เลเยอร์' และ 'ไม่มีการปรับจูนตามคำสั่ง' ส่วนท้ายที่อ่านว่า 'ทั้งสองคอลัมน์เป็นข้อมูลที่ผู้ขายรายงานเอง ไม่มีบุคคลที่สามรายใดให้คะแนนโมเดลใดเลย' และโลโก้ OrcaRouter ที่วางซ้อนไว้บริเวณมุมขวาล่าง
Engineering & Research

FrogNano-4B-2609 เทียบกับ LFM2.5 2.6B Base: ผู้เชี่ยวชาญที่พร้อมใช้งาน กับ ชุดน้ำหนักที่ผ่านการฝึกมาแล้ว

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

พิมพ์คำถามลงใน LFM2.5 2.6B Base แล้วมันจะต่อประโยคของคุณให้แทนที่จะตอบคำถามนั้น นั่นไม่ใช่ข้อบกพร่อง — Liquid AI เผยแพร่มันในฐานะเช็กพอยต์ที่ผ่านการฝึกมาก่อนซึ่งเป็นฐานของตระกูล LFM2.5 โดยตั้งใจละการปรับแต่งตามคำสั่งไว้ให้รุ่นพี่น้องที่ไม่ใช่ Base และการ์ดก็ระบุตรง ๆ ว่ามันมีไว้สำหรับการปรับแต่งอย่างหนัก FrogNano-4B-2609 ของ Microsoft คือสิ่งที่ปลายอีกด้านของไปป์ไลน์นั้นดูเป็นแบบนี้: โมเดลภาษาขนาดเล็กแบบเดียวกัน ถูกนำผ่านการเรียนแบบเสริมกำลัง (reinforcement learning) ห้ารอบบนงานคลังโค้ดสังเคราะห์ จนกระทั่งมันเปล่งการเรียกใช้เครื่องมือแบบมีโครงสร้างและแพตช์ตัวเลือกผ่านฮาร์เนสห้าเครื่องมือ ไม่มีตัวใดมีเกณฑ์มาตรฐานอิสระที่เผยแพร่ ความแตกต่างคือตัวหนึ่งได้ทำ post-training เสร็จแล้ว และการรู้ว่าตัวไหนคือตัวนั้นคือการตัดสินใจทั้งหมด

ข้อมูลตัวเลข FrogNano ด้านล่างมาจากการ์ดโมเดลและรายงานทางเทคนิคของ Microsoft ข้อมูลตัวเลข LFM มาจากการ์ดของ Liquid AI, การตั้งค่าสถาปัตยกรรมของมัน, และไฟล์สัญญาอนุญาตของมัน ตัวเลขทุกตัวที่ถูกระบุว่าเป็นของผู้ขายรายใดรายหนึ่งจะถูกติดป้ายว่าเป็นข้อมูลที่ผู้ขายรายงาน และไม่มีโมเดลใดในสองตัวนี้ที่ผ่านการประเมินจากบุคคลที่สาม — สำหรับ LFM2.5 2.6B Base นั้นส่วนใหญ่เป็นไปตามการออกแบบ เนื่องจากเช็คพอยต์ที่ไม่มีการปรับแต่งคำสั่งไม่ใช่เป้าหมายที่ยุติธรรมสำหรับการทดสอบแชท

การเปรียบเทียบจะได้ผลก็ต่อเมื่อคุณรู้ว่ากำลังเปรียบเทียบอะไรอยู่

วางเอกสารสเปกทั้งสองไว้เคียงข้างกัน แล้วสิ่งแรกที่ผิดพลาดก็คือจำนวนพารามิเตอร์ LFM2.5 2.6B Base มีพารามิเตอร์แบบ dense 2.69 พันล้านตัวใน 30 เลเยอร์ — 22 บล็อก short-convolution แบบ double-gated และ 8 เลเยอร์ grouped-query-attention ฝึกบนโทเค็นประมาณ 34 ล้านล้านโทเค็นใน 16 ภาษา มีคำศัพท์ 128,000 โทเค็น และบริบท 131,072 โทเค็น บิลด์แบบควอนไทซ์ของมันอยู่ที่ประมาณ 1.67 GB ใน Q4_K_M

การ์ดของ FrogNano-4B-2609 ระบุฟิลด์พารามิเตอร์เป็นช่วง "500M-5B" และสรุปโมเดลอธิบายว่ามีประมาณ 4.66 พันล้าน การดาวน์โหลดยุติข้อโต้แย้งนี้: safetensors สองแชร์ด์รวมน้ำหนัก BF16 9.32 GB, 738 เทนเซอร์ บนสแต็ก Gated DeltaNet และ gated-attention แบบไฮบริด 32 เลเยอร์แบบ dense ที่สืบทอดมา หอวิสชัน 24 เลเยอร์อยู่ในเช็กพอยต์และไม่เคยถูกฝึกแบบ post-training

ดังนั้นอัตราส่วนขนาดจึงอยู่ที่ประมาณ 1.7 ต่อ 1 และอัตราส่วนหน่วยความจำจะเข้าใกล้ 5.6 ต่อ 1 มากขึ้นเมื่อพิจารณาการควอนไทเซชัน ช่องว่างนี้สำคัญกว่าตัวเลขพารามิเตอร์ เพราะโมเดลทั้งสองนี้เป็นตัวเลือกที่มีศักยภาพสำหรับการโฮสต์เองมากกว่าที่จะเป็นเอนด์พอยต์ — ซึ่งเป็นเหตุผลเดียวที่ทำให้ทั้งสองอยู่ในบทความเดียวกัน

• การใช้งานที่ตั้งใจ — LFM2.5 2.6B Base เป็นวัตถุดิบสำหรับการรัน fine-tuning FrogNano-4B-2609 เป็นนโยบายที่เสร็จสมบูรณ์สำหรับวิศวกรรมซอฟต์แวร์ระดับรีโพซิทอรีภายในฮาร์เนส Leaf

• การทำตามคำสั่ง — LFM2.5 2.6B Base ไม่มีมาให้เลยโดยค่าเริ่มต้น; การ์ดของ Liquid AI แนะนำให้ใช้กับงานที่ต้องปรับแต่งละเอียดอย่างหนัก FrogNano-4B-2609 ทำตามคำอธิบายงานและส่งออกการเรียกเครื่องมือแบบมีโครงสร้าง เพราะนั่นคือสิ่งที่วัตถุประสงค์ RL ของมันฝึกมา

• บริบท — 131,072 โทเค็นสำหรับ LFM2.5 2.6B Base เทียบกับโทเค็นรวมประมาณ 131K สำหรับคอนฟิกูเรชันที่ประเมินของ FrogNano ตามชื่อแล้วเหมือนกัน แต่หน้าต่างของ FrogNano ต้องเก็บผลลัพธ์ของเครื่องมือ เอาต์พุตเชลล์ และล็อกการทดสอบ ไม่ใช่แค่พรอมป์ต

• เพดานเอาต์พุต — การกำหนดค่าที่ผ่านการตรวจสอบของ FrogNano อนุญาตให้สร้างโทเค็นได้ 8,192 โทเค็นต่อเทิร์นของผู้ช่วย LFM2.5 2.6B Base ไม่ได้เปิดเผยค่าที่เทียบเท่า เนื่องจากไม่ได้ถูกสร้างมาเพื่อจบคำตอบ

• โมดัลลิตี — ทั้งคู่เป็นข้อความเท่านั้น องค์ประกอบด้านวิชันของ FrogNano เป็นสิ่งที่สืบทอดมาและไม่รองรับอย่างชัดเจน; LFM2.5 2.6B Base เป็นแบบข้อความเข้า–ข้อความออกโดยโครงสร้าง

• สัญญาอนุญาต — LFM2.5 2.6B Base อยู่ภายใต้ LFM Open License v1.0 ซึ่งฟรีสำหรับผู้ที่มีรายได้ต่อปีต่ำกว่า $10M และต้องมีสัญญาอนุญาตแยกต่างหากเมื่อมีรายได้เท่ากับหรือสูงกว่าเส้นนั้น โดยงานดัดแปลงจะสืบทอดเพดานดังกล่าว การ์ดของ FrogNano ระบุ MIT ไว้ในส่วนนำ และระบุ Apache 2.0 ไว้ในเนื้อความ

สิ่งที่ Microsoft จ่ายให้ และสิ่งที่คุณจะต้องจ่ายด้วยตัวเอง

นี่คือส่วนที่สำคัญที่สุด เพราะเป็นจุดที่การเปรียบเทียบสเปกทำให้เข้าใจผิดได้

มูลค่าเพิ่มทั้งหมดของ FrogNano-4B-2609 อยู่ที่การฝึกหลังการฝึก (post-training) และ Microsoft ได้เผยแพร่วิธีนี้แล้ว เริ่มจาก Qwen3.5-4B ซึ่งได้คะแนน 39.4% บน SWE-bench Verified ผ่าน Leaf harness ในฐานะโมเดลทั่วไป สร้างงานในรีโพซิทอรีที่เป็นแคนดิเดตจากสแนปช็อตจริง รัน rollout จากเช็กพอยต์ปัจจุบันเพื่อหางานที่โมเดลแก้ได้ในบางครั้ง เก็บงานเหล่านั้นไว้ ฝึก แล้วทำซ้ำ — ห้ารอบ รวมแล้วประมาณ 1,500 สภาพแวดล้อมสังเคราะห์ที่ผ่านการตรวจสอบ และไม่มีการกลั่นความรู้จากโมเดลที่ใหญ่กว่าเลยในทุกช่วงขั้นตอน ผลลัพธ์บนการ์ดโมเดลของ Microsoft เองคือ 61.5% บน SWE-bench Verified, 37.6% บน SWE-bench Pro, 31.1% บน Terminal-Bench 2.0 และ 47.3% บน PatchEval-Verified ภาคผนวกด้านประสิทธิภาพของบทความรายงานการไต่ระดับเดียวกันว่าเป็น 48.2%, 53.4%, 58.3%, 58.6% และ 61.6% ตลอดแต่ละรอบ ซึ่งเป็นเครื่องเตือนใจที่มีประโยชน์ว่าแม้แต่ตารางสองตารางของห้องแล็บเองจากการทดลองเดียวกันก็ยังไม่ตรงกันในแต่ละขั้น

ตอนนี้อ่านสิ่งนั้นเทียบกับ LFM2.5 2.6B Base มันคือเช็กพอยต์ก่อนที่งานนั้นจะเริ่มต้น คำแนะนำบนการ์ดของมันเอง — ให้ไฟน์จูนมัน — คือสิ่งที่ FrogNano บันทึกไว้พอดี: สภาพแวดล้อมงาน, รางวัลที่รันได้, ฮาร์เนสที่ให้บริการได้ยาวนานขึ้น และรอบการเทรนหลายรอบกับ policy ที่เคลื่อนที่ เปเปอร์ไม่ได้อ้างว่านั่นเป็นเรื่องง่าย มันรายงานว่าเช็กพอยต์ระหว่างทางมีค่าใช้จ่ายในการเทรนสูงขึ้นเรื่อย ๆ เมื่อร่องรอยการใช้เหตุผลยาวขึ้น ว่าต้องเพิ่มบทลงโทษด้านความยาว log เพื่อหยุดการดริฟต์ และว่ารอบการเทรนรุ่นหลัง ๆ สูญเสียความสามารถในการเรียกเครื่องมือแบบขนานที่โมเดลฐานมี จบลงที่อัตราการเรียกพร้อมกัน 1.71% ใครก็ตามที่วางแผนจะรันสูตร FrogNano บนโมเดลฐาน 2.6B อื่น ควรเผื่องบสำหรับสามปัญหานี้โดยเฉพาะ

สิ่งที่ LFM2.5 2.6B Base มอบให้คือความได้เปรียบตั้งต้นอีกรูปแบบหนึ่ง: งบประมาณการพรีเทรน 34 ล้านล้านโทเคน, สถาปัตยกรรมไฮบริดที่มีเอกสารประกอบ, บิลด์ควอนไทซ์ที่มีอยู่แล้ว, และบริบท 131,072 โทเคนที่มีการบันทึกไว้, ทั้งหมดนี้ในขนาดที่รันบนฮาร์ดแวร์ที่เช็กพอยต์ BF16 ขนาด 9.32 GB ใส่ไม่ลง ถ้างานของคุณแคบพอที่การไฟน์จูนเล็ก ๆ จะเอาชนะโมเดลทั่วไปได้ นั่นคือจุดยืนที่ใช้ได้จริง — และถ้าไม่ใช่ คุณก็ประหยัดการฝึกไปหนึ่งรอบ

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

สิ่งที่คุณต้องสร้างไม่ว่าจะทางไหนก็ตาม

ทั้งสองอย่างนี้ไม่ใช่การเรียกผ่านเครือข่าย และนั่นคือสิ่งที่กำหนดการเปรียบเทียบในทางปฏิบัติมากกว่าข้อมูลจำเพาะแถวใด ๆ

LFM2.5 2.6B Base ต้องการรันไทม์สำหรับการอนุมานและรอบการเทรน การ์ดของ Liquid AI ระบุบิลด์รูปแบบเนทีฟ, GGUF, ONNX และ MLX ดังนั้นฝั่งการให้บริการจึงครอบคลุมดีอยู่แล้ว — llama.cpp บนแล็ปท็อปถือเป็นตัวเลือกที่ใช้ได้จริงสำหรับเช็กพอยต์ที่ควอนไทซ์แล้ว ส่วนการเทรนเป็นของคุณ: ข้อมูล วัตถุประสงค์ การประเมิน และวิธีบอกว่าผลลัพธ์ดีขึ้นหรือแค่แตกต่างไป

FrogNano-4B-2609 ต้องการเอนด์พอยต์ที่เข้ากันได้กับ OpenAI พร้อม parser ที่ถูกต้อง และคลัสเตอร์ Kubernetes ที่มีสิทธิ์จัดการพอดและนโยบายเครือข่าย README ของ Microsoft ระบุอย่างตรงไปตรงมาผิดปกติว่า harness เป็น dependency มากกว่าจะเป็นความสะดวก และการ์ดระบุว่าคะแนนที่เหมือนกันต้องมี checkpoint, tokenizer, การตั้งค่าการเสิร์ฟ, อิมเมจงาน และโปรโตคอลการประเมินที่ตรงกัน การตั้งค่าไม่ใช่รายละเอียดเล็กน้อยในที่นี้ — หากเสิร์ฟโดยไม่มี Qwen3 reasoning parser และ Qwen3 coder tool-call parser โมเดลจะเขียนข้อความร้อยเรียงในจุดที่ harness คาดหวังการเรียกใช้เครื่องมือ

นี่คือลักษณะของการประกบคู่ครั้งนี้: ด้านหนึ่งเป็นโปรเจกต์ฝึกโมเดลที่มีปัญหาการให้บริการเล็กน้อย; อีกด้านหนึ่งเป็นโปรเจกต์ให้บริการที่มีปัญหาการประเมินผลขนาดใหญ่และไม่เหลืองานฝึกให้ทำแล้ว ทั้งคู่เป็นงานที่ทำแค่ไม่กี่เย็น มีเพียงอันเดียวเท่านั้นที่เป็นงานไม่กี่เย็นซึ่งอาจจบลงด้วย "โมเดลยังไม่ดีพอ" โดยไม่ใช่ความผิดของคุณ

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

จุดที่เราเตอร์พิสูจน์คุณค่าในบิลด์แบบนี้

ทั้งสองโมเดลนี้ลงเอยอยู่ในไปป์ไลน์ที่เรียกใช้บริการที่โฮสต์ไว้ด้วย ชุดทดสอบประเมินผลของ FrogNano เองคือหลักฐาน: ฮาร์เนส Leaf สื่อสารกับเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ซึ่งหมายความว่าโมเดลที่กำลังทดสอบและโมเดลใดก็ตามที่คุณนำมาเปรียบเทียบนั้นเข้าถึงผ่านอินเทอร์เฟซเดียวกัน นั่นคือแพตเทิร์นที่คุ้มค่าจะลอกเลียนแบบ แม้ว่าเหตุผลจะเป็นเพียงเรื่องความเรียบร้อยทางเทคนิค และนั่นคือจุดที่เอนด์พอยต์เดียวทำสิ่งที่เป็นรูปธรรม

OrcaRouter รวมโมเดลกว่า 200 รายการไว้เบื้องหลังคีย์เดียวที่เข้ากันได้กับ OpenAI โดยบวกกำไร 0% ราคาตามรายการของผู้ให้บริการจึงส่งผ่านมาถึงคุณโดยไม่ถูกแตะต้อง และเมื่อผู้ขายปรับราคา ฝั่งเราก็อัปเดตให้ทันทีในวันเดียวกัน — ซึ่งนั่นคือตัวเลขที่ขยับจริงเวลาคุณกำลังตัดสินใจว่าโมเดลเฉพาะทางที่โฮสต์เองจะเอาชนะโมเดลทั่วไปที่โฮสต์ให้บริการในแง่ต้นทุนต่องานได้หรือไม่ การสลับใช้งานอัตโนมัติเมื่อเกิดข้อขัดข้อง ครอบคลุมครึ่งที่เป็นฝั่งโฮสต์ของการเปรียบเทียบนั้น ไม่ใช่เช็กพอยต์ที่คุณให้บริการเอง เราไม่ได้โฮสต์ FrogNano-4B-2609 หรือ LFM2.5 2.6B Base ทั้งคู่เป็นไฟล์ดาวน์โหลด สิ่งที่เลเยอร์จัดเส้นทางช่วยตัดออกไปคือการอินทิเกรตครั้งที่สอง ทุกครั้งที่ฝั่งโฮสต์ของเบนช์มาร์กของคุณเปลี่ยน

เลือกอันหนึ่ง พูดตามตรง

เลือก LFM2.5 2.6B Base หากงานของคุณเฉพาะทาง ฮาร์ดแวร์ของคุณเล็ก และคุณพร้อมที่จะรับผิดชอบการรันเทรนด้วยตัวเอง — สัญญาอนุญาตฟรีเมื่อรายได้ต่ำกว่า $10M บิลด์แบบควอนไทซ์มีขนาด 1.67 GB และการ์ดของ Liquid AI เองก็แนะนำรุ่นนี้สำหรับกรณีนี้โดยเฉพาะ ข้อแลกเปลี่ยนคือคุณได้จุดเริ่มต้น ไม่ใช่ขีดความสามารถ: ไม่มีอะไรในรีลีสที่บอกคุณว่าการรัน RL รูปแบบ FrogNano ทับบนรุ่นนี้จะได้คะแนนเท่าไร และยังไม่มีใครเผยแพร่ผลลัพธ์นั้นเลย

เลือก FrogNano-4B-2609 หากงานเป็นวิศวกรรมซอฟต์แวร์ระดับรีโพซิทอรีและคุณต้องการให้การฝึกภายหลังเสร็จเรียบร้อยแล้ว ตัวเลข 61.5%, 37.6%, 31.1% และ 47.3% เป็นผลลัพธ์ที่เผยแพร่จริงจากห้องแล็บที่อธิบายวิธีการอย่างละเอียด — และ ณ ขณะนี้ พวกมันยังเป็นวงปิด: ห้องแล็บเดียวกัน ฮาร์เนสเดียวกัน และเส้นฐานของโมเดลฐานเดียวกัน การดาวน์โหลด 9.32 GB การพึ่งพาฮาร์เนส และการออกใบอนุญาตแบบผสม เป็นราคาที่ต้องจ่ายสำหรับการข้ามโครงการฝึกซึ่งมิฉะนั้นคุณจะต้องรัน

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

การปรับมุมมองที่มีประโยชน์คือสิ่งเหล่านี้ไม่ใช่คู่แข่งกัน LFM2.5 2.6B Base อยู่ต้นน้ำของกระบวนการที่ให้กำเนิดบางสิ่งอย่าง FrogNano-4B-2609 หากคุณพบว่าตัวเองกำลังเลือกระหว่างสองสิ่งนี้ คำถามจริง ๆ คือปัญหาของคุณคุ้มค่าที่จะลงมือฝึกโมเดลเองหรือไม่ — และถ้าคำตอบคือไม่ เช็กพอยต์ 4B ที่มีฮาร์เนส วิธีที่เผยแพร่ และบันได SWE-bench ตามที่ผู้ขายรายงาน คือตัวที่มาถึงแบบเสร็จสมบูรณ์แล้ว

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube