
FrogNano-4B-2609 vs LFM2.5 2.6B Base: một chuyên gia đã hoàn thiện và một túi trọng số tiền huấn luyện
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 219 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Gõ một câu hỏi vào LFM2.5 2.6B Base và nó sẽ viết tiếp câu của bạn thay vì trả lời câu hỏi đó. Đó không phải là lỗi — Liquid AI đã công bố nó như checkpoint tiền huấn luyện nằm bên dưới dòng LFM2.5, với việc tinh chỉnh theo chỉ dẫn được cố ý để lại cho người anh em không phải bản Base của nó, và thẻ mô hình nói rõ rằng nó được dành cho việc tinh chỉnh chuyên sâu. FrogNano-4B-2609 của Microsoft là hình ảnh ở đầu bên kia của quy trình đó: cùng một loại mô hình ngôn ngữ nhỏ, được đưa qua năm vòng học tăng cường trên các tác vụ kho mã tổng hợp cho đến khi nó phát ra các lệnh gọi công cụ có cấu trúc và các bản vá ứng viên thông qua một bộ khung năm công cụ. Cả hai đều không có benchmark độc lập nào được công bố. Khác biệt nằm ở chỗ một trong hai đã hoàn tất quá trình hậu huấn luyện, và biết được điều đó chính là toàn bộ quyết định.
Các số liệu FrogNano dưới đây đến từ thẻ mô hình và báo cáo kỹ thuật của Microsoft. Các số liệu LFM đến từ thẻ của Liquid AI, cấu hình kiến trúc và tệp giấy phép của nó. Mọi con số được gán cho một trong hai nhà cung cấp đều được ghi nhãn là do nhà cung cấp báo cáo, và cả hai mô hình này đều chưa qua đánh giá của bên thứ ba — với LFM2.5 2.6B Base, điều đó phần lớn là do thiết kế, vì một checkpoint không có tinh chỉnh chỉ dẫn không phải là mục tiêu công bằng cho một benchmark trò chuyện.
Việc so sánh chỉ có ý nghĩa nếu bạn biết mình đang so sánh điều gì
Đặt hai bảng thông số cạnh nhau, và điều đầu tiên không khớp chính là số lượng tham số. LFM2.5 2.6B Base có 2,69 tỷ tham số dense trong 30 lớp — 22 khối tích chập ngắn cổng đôi và 8 lớp grouped-query attention, được huấn luyện trên khoảng 34 nghìn tỷ token thuộc 16 ngôn ngữ, với từ vựng 128.000 token và ngữ cảnh 131.072 token. Bản lượng tử hóa của nó có dung lượng khoảng 1,67 GB ở Q4_K_M.
Thẻ mô hình của FrogNano-4B-2609 ghi trường tham số của nó là dải "500M-5B", và phần tóm tắt mô hình mô tả nó xấp xỉ 4,66 tỷ tham số. Bản tải xuống giải quyết cuộc tranh luận: hai shard safetensors tổng cộng 9,32 GB trọng số BF16, 738 tensor, trên một ngăn xếp hybrid Gated DeltaNet và gated-attention dense 32 lớp được kế thừa. Một vision tower 24 lớp nằm trong checkpoint và chưa từng được hậu huấn luyện.
Vậy tỷ lệ kích thước vào khoảng 1,7 trên một, còn tỷ lệ bộ nhớ gần 5,6 trên một khi đã tính đến lượng tử hóa. Khoảng cách đó quan trọng hơn dòng thông số, bởi vì cả hai mô hình này đều là triển vọng tự vận hành chứ không phải endpoint — đó là lý do duy nhất chúng cùng nằm trong một bài viết.
• Mục đích sử dụng — LFM2.5 2.6B Base là nguyên liệu thô cho một lần chạy tinh chỉnh. FrogNano-4B-2609 là một chính sách hoàn chỉnh cho kỹ thuật phần mềm cấp kho lưu trữ bên trong Leaf harness.
• Tuân thủ chỉ dẫn — LFM2.5 2.6B Base không có khả năng này ngay từ đầu; thẻ mô hình của Liquid AI khuyến nghị nó cho các tác vụ đòi hỏi tinh chỉnh chuyên sâu. FrogNano-4B-2609 tuân theo mô tả tác vụ và phát ra các lệnh gọi công cụ có cấu trúc, vì đó chính xác là điều mà mục tiêu RL của nó đã huấn luyện.
• Ngữ cảnh — 131,072 token cho LFM2.5 2.6B Base, so với khoảng 131K token tổng cộng cho cấu hình được đánh giá của FrogNano. Về danh nghĩa là giống hệt nhau, nhưng cửa sổ của FrogNano phải chứa kết quả công cụ, đầu ra shell và nhật ký kiểm thử, chứ không chỉ một prompt.
• Giới hạn đầu ra — cấu hình đã được xác thực của FrogNano cho phép 8.192 token được tạo mỗi lượt trợ lý. LFM2.5 2.6B Base không công bố mức tương đương, vì nó không được thiết kế để kết thúc câu trả lời.
• Phương thức — cả hai đều chỉ là văn bản. Các thành phần thị giác của FrogNano được kế thừa và không được hỗ trợ một cách rõ ràng; LFM2.5 2.6B Base là đầu vào văn bản, đầu ra văn bản theo thiết kế.
• Giấy phép — LFM2.5 2.6B Base thuộc LFM Open License v1.0, miễn phí khi doanh thu hằng năm dưới 10 triệu USD và cần một giấy phép riêng khi đạt hoặc vượt mốc đó, với các tác phẩm phái sinh kế thừa mức trần này. Thẻ của FrogNano ghi MIT ở phần mở đầu và Apache 2.0 ở phần nội dung.
Điều mà Microsoft đã trả tiền, và điều mà bạn sẽ phải tự trả tiền.
Đây là phần chịu lực, bởi vì đây chính là chỗ mà việc so sánh thông số dễ khiến người ta hiểu lầm.
Toàn bộ giá trị gia tăng của FrogNano-4B-2609 nằm ở hậu huấn luyện, và Microsoft đã công bố phương pháp này. Bắt đầu từ Qwen3.5-4B, mô hình này đạt 39,4% trên SWE-bench Verified thông qua Leaf harness với tư cách là một mô hình tổng quát. Hãy tạo các tác vụ repository ứng viên từ snapshot thực, chạy rollout từ checkpoint hiện tại để tìm những tác vụ mà nó đôi khi giải được, giữ lại những tác vụ đó, huấn luyện, rồi lặp lại — năm vòng lặp, tổng cộng khoảng 1.500 môi trường tổng hợp đã được xác thực, và không hề có chưng cất từ một mô hình lớn hơn ở bất kỳ thời điểm nào. Kết quả trên thẻ mô hình của chính Microsoft là 61,5% trên SWE-bench Verified, 37,6% trên SWE-bench Pro, 31,1% trên Terminal-Bench 2.0 và 47,3% trên PatchEval-Verified. Phụ lục về hiệu quả của bài báo báo cáo cùng đà tăng đó là 48,2%, 53,4%, 58,3%, 58,6% và 61,6% qua các vòng lặp, một lời nhắc hữu ích rằng ngay cả hai bảng của chính phòng thí nghiệm về cùng một thí nghiệm cũng không khớp nhau ở các nấc.
Giờ hãy đọc điều đó đối chiếu với LFM2.5 2.6B Base. Đây là checkpoint trước khi công việc đó bắt đầu. Khuyến nghị trên chính model card của nó — hãy tinh chỉnh nó — chính xác là công việc mà FrogNano ghi lại: một môi trường tác vụ, một phần thưởng có thể thực thi, một harness phục vụ lâu hơn, và một vài vòng lặp huấn luyện đối đầu với một policy đang thay đổi. Bài báo không tuyên bố rằng điều đó dễ. Bài báo báo cáo rằng các checkpoint trung gian trở nên ngày càng tốn kém để huấn luyện khi các dấu vết suy luận dài ra, rằng phải thêm một hình phạt độ dài log để chặn sự trôi dạt, và rằng các vòng lặp sau đó đã mất khả năng gọi công cụ song song mà mô hình gốc từng có, kết thúc ở tỷ lệ gọi đồng thời 1,71%. Bất kỳ ai dự định chạy công thức FrogNano trên một base 2.6B khác nên dự trù ngân sách cho đúng ba vấn đề đó.
Điều mà LFM2.5 2.6B Base mang lại là một kiểu khởi đầu thuận lợi khác: ngân sách tiền huấn luyện 34 nghìn tỷ token, một kiến trúc lai đã được tài liệu hóa, một bản dựng lượng tử hóa sẵn có, và ngữ cảnh 131.072 token đã được tài liệu hóa, tất cả ở một kích cỡ chạy được trên phần cứng mà một checkpoint BF16 9,32 GB sẽ không vừa. Nếu tác vụ của bạn đủ hẹp để một bản fine-tune nhỏ đánh bại một mô hình tổng quát, thì đó là một vị thế thực sự — và nếu không, bạn đã tiết kiệm cho mình một lần chạy huấn luyện.

Dù theo cách nào thì đó vẫn là thứ bạn phải xây dựng
Cả hai đều không phải là lệnh gọi mạng, và điều đó định hình so sánh thực tế hơn bất kỳ dòng thông số kỹ thuật nào.
LFM2.5 2.6B Base cần một runtime suy luận và một lượt huấn luyện. Thẻ mô hình của Liquid AI liệt kê các bản dựng định dạng gốc, GGUF, ONNX và MLX, nên phần phục vụ đã được lo liệu ổn thỏa — llama.cpp trên một chiếc laptop là lựa chọn thực tế cho checkpoint đã lượng tử hóa. Phần huấn luyện là của bạn: dữ liệu, mục tiêu, đánh giá, và một cách để biết liệu kết quả trở nên tốt hơn hay chỉ khác đi mà thôi.
FrogNano-4B-2609 muốn một endpoint tương thích OpenAI với các parser phù hợp và một cụm Kubernetes được cấp quyền quản lý pod cùng network policy. README của Microsoft nói thẳng một cách bất thường rằng harness là một dependency chứ không phải một tiện ích, và thẻ mô hình nêu rõ rằng điểm số giống hệt đòi hỏi checkpoint, tokenizer, cấu hình serving, task image và evaluation protocol phải khớp nhau. Cấu hình ở đây không phải là chi tiết nhỏ — cứ phục vụ nó mà không có parser suy luận Qwen3 và parser tool-call của Qwen3 coder thì mô hình sẽ viết văn xuôi ở nơi harness mong đợi một tool call.
Đó là cục diện của màn đối đầu này: một bên là dự án huấn luyện với một vấn đề phục vụ nhỏ; bên kia là dự án phục vụ với một vấn đề đánh giá lớn và không còn việc huấn luyện nào để làm. Cả hai đều là vài buổi tối làm việc. Chỉ một trong hai là những buổi tối làm việc có thể kết thúc bằng "mô hình không đủ tốt" mà không phải do lỗi của bạn.

Nơi một chiếc router khẳng định được vị trí của mình trong một dự án như thế này
Cả hai mô hình này đều nằm trong một pipeline mà cũng gọi đến một thứ gì đó được host. Bộ công cụ đánh giá của chính FrogNano là bằng chứng: Leaf harness giao tiếp với một endpoint tương thích OpenAI, nghĩa là mô hình đang được kiểm thử và bất kỳ mô hình nào bạn so sánh với nó đều được truy cập thông qua cùng một giao diện. Đó là một khuôn mẫu đáng để sao chép ngay cả khi lý do chỉ là để giữ sự sạch sẽ, và đó là nơi một endpoint duy nhất làm được điều gì đó cụ thể.
OrcaRouter mang trong mình hơn 200 mô hình sau một khóa tương thích OpenAI duy nhất với mức chênh 0%, nhờ đó giá niêm yết từ nhà cung cấp được truyền nguyên vẹn và mọi thay đổi giá từ nhà cung cấp đều được cập nhật ngay bên phía chúng tôi trong cùng ngày — đây chính là con số thực sự biến động khi bạn cân nhắc liệu một mô hình chuyên biệt tự vận hành có vượt mặt một mô hình tổng quát dạng dịch vụ thuê ngoài xét theo chi phí cho mỗi tác vụ hay không. Chuyển đổi dự phòng tự động bao quát phần dịch vụ thuê ngoài trong phép so sánh đó, chứ không bao gồm checkpoint mà bạn tự phục vụ. Chúng tôi không vận hành FrogNano-4B-2609 hay LFM2.5 2.6B Base; cả hai đều là bản tải về. Điều mà một lớp định tuyến loại bỏ chính là việc phải tích hợp thêm lần thứ hai mỗi khi phần dịch vụ thuê ngoài trong bài đánh giá của bạn thay đổi.
Thành thật mà nói, chọn một cái
Chọn LFM2.5 2.6B Base nếu tác vụ của bạn hẹp, phần cứng của bạn nhỏ và bạn sẵn sàng tự đảm nhận lượt chạy huấn luyện — giấy phép miễn phí khi doanh thu dưới 10 triệu USD, bản lượng tử hóa có dung lượng 1,67 GB, và chính model card của Liquid AI khuyến nghị nó cho đúng trường hợp này. Đánh đổi là bạn nhận được một điểm khởi đầu, chứ không phải một năng lực: không có gì trong bản phát hành cho bạn biết một lượt chạy RL kiểu FrogNano chồng lên nó sẽ đạt điểm bao nhiêu, và chưa ai công bố một kết quả như vậy.
Chọn FrogNano-4B-2609 nếu tác vụ là kỹ thuật phần mềm ở cấp kho lưu trữ và bạn muốn phần hậu huấn luyện đã được thực hiện sẵn. Các mức 61,5%, 37,6%, 31,1% và 47,3% là những kết quả công bố thực sự từ một phòng thí nghiệm đã mô tả chi tiết phương pháp của mình — và ở thời điểm này, chúng cũng là một vòng khép kín: cùng phòng thí nghiệm, cùng harness, cùng baseline mô hình nền. Bản tải xuống 9,32 GB, sự phụ thuộc vào harness và việc cấp phép phức hợp chính là cái giá của việc bỏ qua một dự án huấn luyện mà nếu không thì bạn sẽ phải chạy.

Cách diễn đạt lại hữu ích là đây không phải là những đối thủ cạnh tranh. LFM2.5 2.6B Base nằm ở thượng nguồn của một quá trình đã tạo ra thứ gì đó giống như FrogNano-4B-2609. Nếu bạn thấy mình đang phải chọn giữa chúng, câu hỏi thực sự là liệu vấn đề của bạn có đáng để bạn tự đứng ra chạy một lượt huấn luyện hay không — và nếu câu trả lời là không, thì checkpoint 4B với harness, phương pháp đã công bố và thang SWE-bench do nhà cung cấp báo cáo chính là thứ đến nơi ở trạng thái hoàn chỉnh.
