
FrogNano-4B-2609 เทียบกับ LFM2.5 2.6B Base: ผู้เชี่ยวชาญที่พร้อมใช้งาน กับ ชุดน้ำหนักที่ผ่านการฝึกมาแล้ว
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
พิมพ์คำถามลงใน LFM2.5 2.6B Base แล้วมันจะต่อประโยคของคุณให้แทนที่จะตอบคำถามนั้น นั่นไม่ใช่ข้อบกพร่อง — Liquid AI เผยแพร่มันในฐานะเช็กพอยต์ที่ผ่านการฝึกมาก่อนซึ่งเป็นฐานของตระกูล LFM2.5 โดยตั้งใจละการปรับแต่งตามคำสั่งไว้ให้รุ่นพี่น้องที่ไม่ใช่ Base และการ์ดก็ระบุตรง ๆ ว่ามันมีไว้สำหรับการปรับแต่งอย่างหนัก FrogNano-4B-2609 ของ Microsoft คือสิ่งที่ปลายอีกด้านของไปป์ไลน์นั้นดูเป็นแบบนี้: โมเดลภาษาขนาดเล็กแบบเดียวกัน ถูกนำผ่านการเรียนแบบเสริมกำลัง (reinforcement learning) ห้ารอบบนงานคลังโค้ดสังเคราะห์ จนกระทั่งมันเปล่งการเรียกใช้เครื่องมือแบบมีโครงสร้างและแพตช์ตัวเลือกผ่านฮาร์เนสห้าเครื่องมือ ไม่มีตัวใดมีเกณฑ์มาตรฐานอิสระที่เผยแพร่ ความแตกต่างคือตัวหนึ่งได้ทำ post-training เสร็จแล้ว และการรู้ว่าตัวไหนคือตัวนั้นคือการตัดสินใจทั้งหมด
ข้อมูลตัวเลข FrogNano ด้านล่างมาจากการ์ดโมเดลและรายงานทางเทคนิคของ Microsoft ข้อมูลตัวเลข LFM มาจากการ์ดของ Liquid AI, การตั้งค่าสถาปัตยกรรมของมัน, และไฟล์สัญญาอนุญาตของมัน ตัวเลขทุกตัวที่ถูกระบุว่าเป็นของผู้ขายรายใดรายหนึ่งจะถูกติดป้ายว่าเป็นข้อมูลที่ผู้ขายรายงาน และไม่มีโมเดลใดในสองตัวนี้ที่ผ่านการประเมินจากบุคคลที่สาม — สำหรับ LFM2.5 2.6B Base นั้นส่วนใหญ่เป็นไปตามการออกแบบ เนื่องจากเช็คพอยต์ที่ไม่มีการปรับแต่งคำสั่งไม่ใช่เป้าหมายที่ยุติธรรมสำหรับการทดสอบแชท
การเปรียบเทียบจะได้ผลก็ต่อเมื่อคุณรู้ว่ากำลังเปรียบเทียบอะไรอยู่
วางเอกสารสเปกทั้งสองไว้เคียงข้างกัน แล้วสิ่งแรกที่ผิดพลาดก็คือจำนวนพารามิเตอร์ LFM2.5 2.6B Base มีพารามิเตอร์แบบ dense 2.69 พันล้านตัวใน 30 เลเยอร์ — 22 บล็อก short-convolution แบบ double-gated และ 8 เลเยอร์ grouped-query-attention ฝึกบนโทเค็นประมาณ 34 ล้านล้านโทเค็นใน 16 ภาษา มีคำศัพท์ 128,000 โทเค็น และบริบท 131,072 โทเค็น บิลด์แบบควอนไทซ์ของมันอยู่ที่ประมาณ 1.67 GB ใน Q4_K_M
การ์ดของ FrogNano-4B-2609 ระบุฟิลด์พารามิเตอร์เป็นช่วง "500M-5B" และสรุปโมเดลอธิบายว่ามีประมาณ 4.66 พันล้าน การดาวน์โหลดยุติข้อโต้แย้งนี้: safetensors สองแชร์ด์รวมน้ำหนัก BF16 9.32 GB, 738 เทนเซอร์ บนสแต็ก Gated DeltaNet และ gated-attention แบบไฮบริด 32 เลเยอร์แบบ dense ที่สืบทอดมา หอวิสชัน 24 เลเยอร์อยู่ในเช็กพอยต์และไม่เคยถูกฝึกแบบ post-training
ดังนั้นอัตราส่วนขนาดจึงอยู่ที่ประมาณ 1.7 ต่อ 1 และอัตราส่วนหน่วยความจำจะเข้าใกล้ 5.6 ต่อ 1 มากขึ้นเมื่อพิจารณาการควอนไทเซชัน ช่องว่างนี้สำคัญกว่าตัวเลขพารามิเตอร์ เพราะโมเดลทั้งสองนี้เป็นตัวเลือกที่มีศักยภาพสำหรับการโฮสต์เองมากกว่าที่จะเป็นเอนด์พอยต์ — ซึ่งเป็นเหตุผลเดียวที่ทำให้ทั้งสองอยู่ในบทความเดียวกัน
• การใช้งานที่ตั้งใจ — LFM2.5 2.6B Base เป็นวัตถุดิบสำหรับการรัน fine-tuning FrogNano-4B-2609 เป็นนโยบายที่เสร็จสมบูรณ์สำหรับวิศวกรรมซอฟต์แวร์ระดับรีโพซิทอรีภายในฮาร์เนส Leaf
• การทำตามคำสั่ง — LFM2.5 2.6B Base ไม่มีมาให้เลยโดยค่าเริ่มต้น; การ์ดของ Liquid AI แนะนำให้ใช้กับงานที่ต้องปรับแต่งละเอียดอย่างหนัก FrogNano-4B-2609 ทำตามคำอธิบายงานและส่งออกการเรียกเครื่องมือแบบมีโครงสร้าง เพราะนั่นคือสิ่งที่วัตถุประสงค์ RL ของมันฝึกมา
• บริบท — 131,072 โทเค็นสำหรับ LFM2.5 2.6B Base เทียบกับโทเค็นรวมประมาณ 131K สำหรับคอนฟิกูเรชันที่ประเมินของ FrogNano ตามชื่อแล้วเหมือนกัน แต่หน้าต่างของ FrogNano ต้องเก็บผลลัพธ์ของเครื่องมือ เอาต์พุตเชลล์ และล็อกการทดสอบ ไม่ใช่แค่พรอมป์ต
• เพดานเอาต์พุต — การกำหนดค่าที่ผ่านการตรวจสอบของ FrogNano อนุญาตให้สร้างโทเค็นได้ 8,192 โทเค็นต่อเทิร์นของผู้ช่วย LFM2.5 2.6B Base ไม่ได้เปิดเผยค่าที่เทียบเท่า เนื่องจากไม่ได้ถูกสร้างมาเพื่อจบคำตอบ
• โมดัลลิตี — ทั้งคู่เป็นข้อความเท่านั้น องค์ประกอบด้านวิชันของ FrogNano เป็นสิ่งที่สืบทอดมาและไม่รองรับอย่างชัดเจน; LFM2.5 2.6B Base เป็นแบบข้อความเข้า–ข้อความออกโดยโครงสร้าง
• สัญญาอนุญาต — LFM2.5 2.6B Base อยู่ภายใต้ LFM Open License v1.0 ซึ่งฟรีสำหรับผู้ที่มีรายได้ต่อปีต่ำกว่า $10M และต้องมีสัญญาอนุญาตแยกต่างหากเมื่อมีรายได้เท่ากับหรือสูงกว่าเส้นนั้น โดยงานดัดแปลงจะสืบทอดเพดานดังกล่าว การ์ดของ FrogNano ระบุ MIT ไว้ในส่วนนำ และระบุ Apache 2.0 ไว้ในเนื้อความ
สิ่งที่ Microsoft จ่ายให้ และสิ่งที่คุณจะต้องจ่ายด้วยตัวเอง
นี่คือส่วนที่สำคัญที่สุด เพราะเป็นจุดที่การเปรียบเทียบสเปกทำให้เข้าใจผิดได้
มูลค่าเพิ่มทั้งหมดของ FrogNano-4B-2609 อยู่ที่การฝึกหลังการฝึก (post-training) และ Microsoft ได้เผยแพร่วิธีนี้แล้ว เริ่มจาก Qwen3.5-4B ซึ่งได้คะแนน 39.4% บน SWE-bench Verified ผ่าน Leaf harness ในฐานะโมเดลทั่วไป สร้างงานในรีโพซิทอรีที่เป็นแคนดิเดตจากสแนปช็อตจริง รัน rollout จากเช็กพอยต์ปัจจุบันเพื่อหางานที่โมเดลแก้ได้ในบางครั้ง เก็บงานเหล่านั้นไว้ ฝึก แล้วทำซ้ำ — ห้ารอบ รวมแล้วประมาณ 1,500 สภาพแวดล้อมสังเคราะห์ที่ผ่านการตรวจสอบ และไม่มีการกลั่นความรู้จากโมเดลที่ใหญ่กว่าเลยในทุกช่วงขั้นตอน ผลลัพธ์บนการ์ดโมเดลของ Microsoft เองคือ 61.5% บน SWE-bench Verified, 37.6% บน SWE-bench Pro, 31.1% บน Terminal-Bench 2.0 และ 47.3% บน PatchEval-Verified ภาคผนวกด้านประสิทธิภาพของบทความรายงานการไต่ระดับเดียวกันว่าเป็น 48.2%, 53.4%, 58.3%, 58.6% และ 61.6% ตลอดแต่ละรอบ ซึ่งเป็นเครื่องเตือนใจที่มีประโยชน์ว่าแม้แต่ตารางสองตารางของห้องแล็บเองจากการทดลองเดียวกันก็ยังไม่ตรงกันในแต่ละขั้น
ตอนนี้อ่านสิ่งนั้นเทียบกับ LFM2.5 2.6B Base มันคือเช็กพอยต์ก่อนที่งานนั้นจะเริ่มต้น คำแนะนำบนการ์ดของมันเอง — ให้ไฟน์จูนมัน — คือสิ่งที่ FrogNano บันทึกไว้พอดี: สภาพแวดล้อมงาน, รางวัลที่รันได้, ฮาร์เนสที่ให้บริการได้ยาวนานขึ้น และรอบการเทรนหลายรอบกับ policy ที่เคลื่อนที่ เปเปอร์ไม่ได้อ้างว่านั่นเป็นเรื่องง่าย มันรายงานว่าเช็กพอยต์ระหว่างทางมีค่าใช้จ่ายในการเทรนสูงขึ้นเรื่อย ๆ เมื่อร่องรอยการใช้เหตุผลยาวขึ้น ว่าต้องเพิ่มบทลงโทษด้านความยาว log เพื่อหยุดการดริฟต์ และว่ารอบการเทรนรุ่นหลัง ๆ สูญเสียความสามารถในการเรียกเครื่องมือแบบขนานที่โมเดลฐานมี จบลงที่อัตราการเรียกพร้อมกัน 1.71% ใครก็ตามที่วางแผนจะรันสูตร FrogNano บนโมเดลฐาน 2.6B อื่น ควรเผื่องบสำหรับสามปัญหานี้โดยเฉพาะ
สิ่งที่ LFM2.5 2.6B Base มอบให้คือความได้เปรียบตั้งต้นอีกรูปแบบหนึ่ง: งบประมาณการพรีเทรน 34 ล้านล้านโทเคน, สถาปัตยกรรมไฮบริดที่มีเอกสารประกอบ, บิลด์ควอนไทซ์ที่มีอยู่แล้ว, และบริบท 131,072 โทเคนที่มีการบันทึกไว้, ทั้งหมดนี้ในขนาดที่รันบนฮาร์ดแวร์ที่เช็กพอยต์ BF16 ขนาด 9.32 GB ใส่ไม่ลง ถ้างานของคุณแคบพอที่การไฟน์จูนเล็ก ๆ จะเอาชนะโมเดลทั่วไปได้ นั่นคือจุดยืนที่ใช้ได้จริง — และถ้าไม่ใช่ คุณก็ประหยัดการฝึกไปหนึ่งรอบ

สิ่งที่คุณต้องสร้างไม่ว่าจะทางไหนก็ตาม
ทั้งสองอย่างนี้ไม่ใช่การเรียกผ่านเครือข่าย และนั่นคือสิ่งที่กำหนดการเปรียบเทียบในทางปฏิบัติมากกว่าข้อมูลจำเพาะแถวใด ๆ
LFM2.5 2.6B Base ต้องการรันไทม์สำหรับการอนุมานและรอบการเทรน การ์ดของ Liquid AI ระบุบิลด์รูปแบบเนทีฟ, GGUF, ONNX และ MLX ดังนั้นฝั่งการให้บริการจึงครอบคลุมดีอยู่แล้ว — llama.cpp บนแล็ปท็อปถือเป็นตัวเลือกที่ใช้ได้จริงสำหรับเช็กพอยต์ที่ควอนไทซ์แล้ว ส่วนการเทรนเป็นของคุณ: ข้อมูล วัตถุประสงค์ การประเมิน และวิธีบอกว่าผลลัพธ์ดีขึ้นหรือแค่แตกต่างไป
FrogNano-4B-2609 ต้องการเอนด์พอยต์ที่เข้ากันได้กับ OpenAI พร้อม parser ที่ถูกต้อง และคลัสเตอร์ Kubernetes ที่มีสิทธิ์จัดการพอดและนโยบายเครือข่าย README ของ Microsoft ระบุอย่างตรงไปตรงมาผิดปกติว่า harness เป็น dependency มากกว่าจะเป็นความสะดวก และการ์ดระบุว่าคะแนนที่เหมือนกันต้องมี checkpoint, tokenizer, การตั้งค่าการเสิร์ฟ, อิมเมจงาน และโปรโตคอลการประเมินที่ตรงกัน การตั้งค่าไม่ใช่รายละเอียดเล็กน้อยในที่นี้ — หากเสิร์ฟโดยไม่มี Qwen3 reasoning parser และ Qwen3 coder tool-call parser โมเดลจะเขียนข้อความร้อยเรียงในจุดที่ harness คาดหวังการเรียกใช้เครื่องมือ
นี่คือลักษณะของการประกบคู่ครั้งนี้: ด้านหนึ่งเป็นโปรเจกต์ฝึกโมเดลที่มีปัญหาการให้บริการเล็กน้อย; อีกด้านหนึ่งเป็นโปรเจกต์ให้บริการที่มีปัญหาการประเมินผลขนาดใหญ่และไม่เหลืองานฝึกให้ทำแล้ว ทั้งคู่เป็นงานที่ทำแค่ไม่กี่เย็น มีเพียงอันเดียวเท่านั้นที่เป็นงานไม่กี่เย็นซึ่งอาจจบลงด้วย "โมเดลยังไม่ดีพอ" โดยไม่ใช่ความผิดของคุณ

จุดที่เราเตอร์พิสูจน์คุณค่าในบิลด์แบบนี้
ทั้งสองโมเดลนี้ลงเอยอยู่ในไปป์ไลน์ที่เรียกใช้บริการที่โฮสต์ไว้ด้วย ชุดทดสอบประเมินผลของ FrogNano เองคือหลักฐาน: ฮาร์เนส Leaf สื่อสารกับเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ซึ่งหมายความว่าโมเดลที่กำลังทดสอบและโมเดลใดก็ตามที่คุณนำมาเปรียบเทียบนั้นเข้าถึงผ่านอินเทอร์เฟซเดียวกัน นั่นคือแพตเทิร์นที่คุ้มค่าจะลอกเลียนแบบ แม้ว่าเหตุผลจะเป็นเพียงเรื่องความเรียบร้อยทางเทคนิค และนั่นคือจุดที่เอนด์พอยต์เดียวทำสิ่งที่เป็นรูปธรรม
OrcaRouter รวมโมเดลกว่า 200 รายการไว้เบื้องหลังคีย์เดียวที่เข้ากันได้กับ OpenAI โดยบวกกำไร 0% ราคาตามรายการของผู้ให้บริการจึงส่งผ่านมาถึงคุณโดยไม่ถูกแตะต้อง และเมื่อผู้ขายปรับราคา ฝั่งเราก็อัปเดตให้ทันทีในวันเดียวกัน — ซึ่งนั่นคือตัวเลขที่ขยับจริงเวลาคุณกำลังตัดสินใจว่าโมเดลเฉพาะทางที่โฮสต์เองจะเอาชนะโมเดลทั่วไปที่โฮสต์ให้บริการในแง่ต้นทุนต่องานได้หรือไม่ การสลับใช้งานอัตโนมัติเมื่อเกิดข้อขัดข้อง ครอบคลุมครึ่งที่เป็นฝั่งโฮสต์ของการเปรียบเทียบนั้น ไม่ใช่เช็กพอยต์ที่คุณให้บริการเอง เราไม่ได้โฮสต์ FrogNano-4B-2609 หรือ LFM2.5 2.6B Base ทั้งคู่เป็นไฟล์ดาวน์โหลด สิ่งที่เลเยอร์จัดเส้นทางช่วยตัดออกไปคือการอินทิเกรตครั้งที่สอง ทุกครั้งที่ฝั่งโฮสต์ของเบนช์มาร์กของคุณเปลี่ยน
เลือกอันหนึ่ง พูดตามตรง
เลือก LFM2.5 2.6B Base หากงานของคุณเฉพาะทาง ฮาร์ดแวร์ของคุณเล็ก และคุณพร้อมที่จะรับผิดชอบการรันเทรนด้วยตัวเอง — สัญญาอนุญาตฟรีเมื่อรายได้ต่ำกว่า $10M บิลด์แบบควอนไทซ์มีขนาด 1.67 GB และการ์ดของ Liquid AI เองก็แนะนำรุ่นนี้สำหรับกรณีนี้โดยเฉพาะ ข้อแลกเปลี่ยนคือคุณได้จุดเริ่มต้น ไม่ใช่ขีดความสามารถ: ไม่มีอะไรในรีลีสที่บอกคุณว่าการรัน RL รูปแบบ FrogNano ทับบนรุ่นนี้จะได้คะแนนเท่าไร และยังไม่มีใครเผยแพร่ผลลัพธ์นั้นเลย
เลือก FrogNano-4B-2609 หากงานเป็นวิศวกรรมซอฟต์แวร์ระดับรีโพซิทอรีและคุณต้องการให้การฝึกภายหลังเสร็จเรียบร้อยแล้ว ตัวเลข 61.5%, 37.6%, 31.1% และ 47.3% เป็นผลลัพธ์ที่เผยแพร่จริงจากห้องแล็บที่อธิบายวิธีการอย่างละเอียด — และ ณ ขณะนี้ พวกมันยังเป็นวงปิด: ห้องแล็บเดียวกัน ฮาร์เนสเดียวกัน และเส้นฐานของโมเดลฐานเดียวกัน การดาวน์โหลด 9.32 GB การพึ่งพาฮาร์เนส และการออกใบอนุญาตแบบผสม เป็นราคาที่ต้องจ่ายสำหรับการข้ามโครงการฝึกซึ่งมิฉะนั้นคุณจะต้องรัน

การปรับมุมมองที่มีประโยชน์คือสิ่งเหล่านี้ไม่ใช่คู่แข่งกัน LFM2.5 2.6B Base อยู่ต้นน้ำของกระบวนการที่ให้กำเนิดบางสิ่งอย่าง FrogNano-4B-2609 หากคุณพบว่าตัวเองกำลังเลือกระหว่างสองสิ่งนี้ คำถามจริง ๆ คือปัญหาของคุณคุ้มค่าที่จะลงมือฝึกโมเดลเองหรือไม่ — และถ้าคำตอบคือไม่ เช็กพอยต์ 4B ที่มีฮาร์เนส วิธีที่เผยแพร่ และบันได SWE-bench ตามที่ผู้ขายรายงาน คือตัวที่มาถึงแบบเสร็จสมบูรณ์แล้ว
