
FrogNano-4B-2609 vs Gemma 4 12B: 61,5% trên SWE-bench và chẳng ai kiểm chứng
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 219 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Của Microsoft FrogNano-4B-2609là một agent lập trình cỡ bốn tỷ tham số, được phát triển từ Qwen3.5-4Bvà báo cáo đạt 61,5% trên SWE-bench Verified. Gemma 4 12Blà mô hình đa phương thức không dùng encoder với 11,95 tỷ tham số của DeepMind, và thẻ mô hình của nó báo cáo đạt 72,0% trên LiveCodeBench v6. Đó là hai con số mà người mua sẽ đặt cạnh nhau, và việc đặt chúng cạnh nhau chính là sai lầm. Chúng đến từ những benchmark khác nhau, những harness khác nhau, những phòng thí nghiệm khác nhau, và — quan trọng hơn — chỉ một trong hai có phương pháp đánh giá đã được công bố mà một người ngoài từng đọc. Mọi thứ còn lại trong cuộc so kè này đều xoay quanh câu hỏi mỗi mô hình thực sự là gì, và câu trả lời là chúng hoàn toàn không thuộc cùng một loại.
Những số liệu FrogNano dưới đây đến từ thẻ mô hình của Microsoft và báo cáo kỹ thuật của hãng, cả hai đều đã công khai từ tháng Chín và đều chưa được bất kỳ ai ngoài phòng thí nghiệm tái lập. Những số liệu Gemma 4 12B đến từ thẻ mô hình của Google, cũng là một tài liệu của nhà cung cấp — khác biệt là các con số của Gemma đã được soi xét suốt hai mươi tuần và qua khoảng 2,6 triệu lượt tải về, còn FrogNano mới chỉ có hai tuần và một bộ đếm lượt tải vẫn chưa đạt tới hai chữ số.
Mỗi mô hình dùng để làm gì
Đây là phần mà một bảng thông số kỹ thuật che giấu. FrogNano-4B-2609 không phải là một mô hình tổng quát tình cờ giỏi về mã. Nó là một checkpoint mà toàn bộ quá trình hậu huấn luyện là kỹ thuật phần mềm cấp kho lưu trữ, và được thiết kế để được điều khiển bởi một harness thay vì được trò chuyện với.
Năm công cụ của nó là Read, Write, Edit, Glob và Bash. Nó phát ra các lời gọi tới chúng, một sandbox thực thi chúng và trả về đầu ra, và vòng lặp chạy cho đến khi mô hình ngừng yêu cầu. Cấu hình được đánh giá là 150 bước tương tác trong khoảng 131K token kết hợp, và nó tạo ra một bản vá ứng viên cho mỗi tác vụ. Thẻ của Microsoft nêu rõ rằng mô hình dành cho các kho chứa thiên về Python và sử dụng tiếng Anh, với môi trường có thể tái lập và bộ kiểm thử có thể thực thi, và rằng các thành phần hình ảnh và video kế thừa từ mô hình cơ sở chưa từng được huấn luyện hậu kỳ và không được hỗ trợ.
Gemma 4 12B có thiết kế trái ngược. Đây là mô hình hợp nhất 48 lớp với ngữ cảnh 256K và không có bộ mã hóa thị giác hay âm thanh riêng — các mảng ảnh thô và dạng sóng âm thanh được chiếu thẳng vào không gian nhúng của bộ giải mã duy nhất thông qua các lớp tuyến tính nhẹ. Nó nhận văn bản, hình ảnh và âm thanh đầu vào rồi ghi văn bản đầu ra. Nó có chế độ suy nghĩ được kích hoạt bởi một token trong lời nhắc hệ thống, khả năng gọi hàm gốc, và thẻ của Google nhấn mạnh việc liệt kê các quy trình tác tử trong số những mục đích sử dụng dự kiến của nó.
Vậy nên câu hỏi thực sự không phải là cái nào thông minh hơn. Mà là bạn muốn một thành phần chuyên biệt chỉ hoạt động bên trong một hệ thống mà bạn phải vận hành, hay một mô hình tổng quát làm khá tốt nhiều việc và có thể được gọi bởi bất cứ thứ gì.

Từng dòng một, ở những chỗ chúng thực sự khác nhau
• Tham số — FrogNano-4B-2609 công bố một dải, "500M-5B", trên một card mà mô tả của chính nó ghi khoảng 4,66 tỷ; bản tải xuống chốt con số ở 9,32 GB trọng số BF16. Gemma 4 12B là 11,95B, được nêu một lần và không hề rào đón. Tỷ lệ này xấp xỉ 2,6 so với 1, và nó xuất hiện trực tiếp trong thứ bạn phải thuê.
• Bối cảnh — cấu hình được đánh giá của FrogNano có khoảng 131K token kết hợp, với phần suy luận và đầu ra công cụ dùng chung ngân sách. Gemma 4 12B mang 256.000 token, và ở riêng hàng ngữ cảnh dài của nó đạt 43,4% trên MRCR v2 với tám needle ở 128K. Gần gấp đôi cửa sổ, và con số thứ hai là một phép đo đã được công bố chứ không phải một tuyên bố về năng lực.
• Phương thức — FrogNano-4B-2609 là văn bản vào, văn bản ra, bất chấp việc tháp thị giác nằm trong checkpoint của nó. Gemma 4 12B nhận đầu vào là văn bản, hình ảnh và âm thanh.
• Giới hạn đầu ra — cấu hình FrogNano đã được xác thực cho phép tạo 8,192 token mỗi lượt của trợ lý, và thẻ mô hình của nó ghi chú rằng cấu hình huấn luyện RL đã dùng đúng mức trần đó. Gemma 4 12B không công bố giới hạn tương đương cho một lượt; ràng buộc ở đây là cửa sổ 256K.
• Giao diện agentic — FrogNano phát ra các lời gọi Leaf có cấu trúc và cần một bộ khung để thực thi chúng. Gemma 4 12B đi kèm khả năng gọi hàm gốc trong dạng tinh chỉnh theo chỉ dẫn và có thể được gọi trực tiếp.
• Giấy phép — Gemma 4 12B là Apache 2.0 theo các điều khoản Gemma 4 của Google, được nêu rõ ràng. Thẻ của FrogNano là MIT trong phần mở đầu và Apache 2.0 trong phần nội dung của chính nó, một kiểu mơ hồ thường dẫn đến việc rà soát pháp lý chứ không phải chỉ là một chú thích.
• Các con số — FrogNano báo cáo 61.5% SWE-bench Verified, 37.6% SWE-bench Pro, 31.1% Terminal-Bench 2.0 và 47.3% PatchEval-Verified. Gemma 4 12B báo cáo 77.2% MMLU Pro, 72.0% LiveCodeBench v6, ELO Codeforces là 1659, 78.8% GPQA Diamond và 69.0% trên Tau2. Thẻ mô hình của Google không công bố dòng SWE-bench nào, và thẻ mô hình của Microsoft không công bố LiveCodeBench. Không hề có sự trùng lặp nào giữa hai bảng điểm.
Gạch đầu dòng cuối cùng đó chính là thứ nên dập tắt bản năng so sánh bằng con số. Không một benchmark nào xuất hiện trên cả hai thẻ. Một độc giả đặt 61.5 bên cạnh 72.0 là đã so sánh tỷ lệ giải quyết kho mã nguồn với tỷ lệ vượt qua của lập trình thi đấu, điều này gần giống như so sánh thời gian chạy marathon với thời gian chạy 100 mét chỉ vì cả hai đều tính bằng giây.
Tại sao sự im lặng của Google về SWE-bench không phải là một dấu hiệu đáng ngại
Kết luận hấp dẫn rút ra từ danh sách gạch đầu dòng là FrogNano có một con số SWE-bench thực sự còn Gemma thì không, nên FrogNano thắng ở câu hỏi về lập trình. Điều đó không suy ra được, vì một lý do đáng để nói cho thật chính xác.
Gemma 4 12B báo cáo Tau2 ở mức 69,0% — một benchmark sử dụng công cụ dạng tác tử qua ba lần chạy — cùng với hỗ trợ gọi hàm và định vị rõ ràng cho các quy trình làm việc tác tử. Một mô hình đạt 69,0 trên Tau2 không phải là mô hình không thể làm công việc tác tử; đó là mô hình mà nhà cung cấp đã chọn báo cáo hiệu năng sử dụng công cụ thay vì khả năng giải quyết vấn đề trong kho mã. Google cũng không báo cáo các dòng SWE-bench cho 26B hay 31B, đây là lựa chọn biên tập trên toàn dòng sản phẩm chứ không phải điểm yếu của 12B.
Trong khi đó, kết quả phản trực giác trong bài báo của chính Microsoft là điều mà người mua Gemma nên đọc kỹ. FrogNano khởi đầu từ Qwen3.5-4B, một mô hình đa dụng, vốn đạt 39,4% trên SWE-bench Verified thông qua harness Leaf. Năm vòng học tăng cường trên khoảng 1.500 tác vụ tổng hợp đã đưa nó lên 61,5%. Bài học không phải là "mô hình nhỏ không thể viết mã" — mà là một checkpoint 4B đa dụng ở mức 39,4% đã giải được hơn một phần ba một tập issue khó, được con người kiểm chứng, khi có ai đó chạy nó bên trong một vòng lặp agent đủ giỏi. Gemma 4 12B có kích thước gấp ba lần và trưởng thành hơn hai mươi tuần. Chưa ai chạy nó qua Leaf, và cho đến khi có người làm vậy, "Gemma không phải là một repo agent" chỉ là một giả định chứ không phải một phát hiện.
Gánh nặng từ harness, điều mà các bảng điểm che giấu hoàn toàn
Đây là sự bất đối xứng thực tế, và chính nó là yếu tố quyết định việc mua hàng.
Gemma 4 12B là một mô hình. Tải 11,95 tỷ trọng số, trỏ Transformers, vLLM hoặc SGLang vào chúng, gửi văn bản, nhận văn bản. Google công bố lộ trình phục vụ, giấy phép rõ ràng không mập mờ, và lượng người tương đương 2,6 triệu lượt tải đã vấp phải những cạnh thô ráp và ghi lại chúng. Nếu tác vụ là "tóm tắt stack trace này", "đọc ảnh chụp màn hình này và cho tôi biết cái gì hỏng", hoặc "gọi hàm này với các tham số này", thì nó hoạt động được ngay hôm nay.
FrogNano-4B-2609 là một mô hình cộng với một harness, và chính README của Microsoft biến harness thành thứ không thể tùy chọn. Kho lưu trữ tại github.com/microsoft/FrogNano là giàn đánh giá Leaf, không phải mã huấn luyện — nó cần một cụm Kubernetes, một namespace sẵn có, quyền quản lý pod và chính sách mạng, quyền pull các image container benchmark, và một endpoint tương thích OpenAI được cấu hình với đúng các parser suy luận và gọi công cụ. Card của Microsoft nêu thẳng điều kiện khớp: điểm số giống hệt đòi hỏi checkpoint, tokenizer, cấu hình phục vụ, image tác vụ và giao thức đánh giá phải khớp. Nửa phần của bản phát hành tạo ra điểm số chính là nửa mà card chỉ vào một liên kết GitHub.
Có giá trị thực sự ở đó, và điều đó đáng được gọi tên chứ không phải bị gạt đi. Đóng góp của FrogNano là một vòng lặp tổng hợp tác vụ, thứ tái tạo các bài toán huấn luyện đối chiếu với năng lực của policy hiện tại — tuyên bố của bài báo là một tác nhân nhỏ có thể được huấn luyện đạt trình độ cạnh tranh trên các nhiệm vụ tổng hợp mà hoàn toàn không cần chưng cất, và điều đó mở ra một con đường cho bất kỳ ai không đủ khả năng chi trả cho một mô hình thầy tiên tiến. API của nó là công khai. Các phương pháp của nó về nguyên tắc là có thể tái lập. Đó là một đóng góp mạnh hơn một checkpoint gia tăng khác, và nó cũng đòi hỏi nhiều công việc hơn mức mà hầu hết các nhóm đăng ký tham gia.

Nếu phải chọn một, hãy chọn dựa theo công việc.
Hãy chọn Gemma 4 12B nếu công việc kết hợp nhiều phương thức, nếu có bất cứ thứ gì cần xem hình ảnh hoặc nghe âm thanh, nếu ngữ cảnh phải chứa một cây tệp lớn và một bản ghi dài cùng lúc, hoặc nếu bạn muốn một mô hình mà bất kỳ framework nào cũng có thể tải mà không cần một hệ thống thứ hai phía sau. Điểm Tau2 69,0 và khả năng gọi hàm gốc của nó khiến nó trở thành lựa chọn có thể bảo vệ cho các pipeline tác nhân, và không ai phải tin lời một phòng thí nghiệm — mô hình đã được hàng nghìn người đánh giá và kết quả không hề bí mật.
Hãy chọn FrogNano-4B-2609 nếu bạn đã vận hành một agent kho mã trong môi trường sandbox và bạn muốn một checkpoint hạng 4B để thả vào đó, và nếu bản tải xuống 9,32 GB vừa với phần cứng khiêm tốn là ràng buộc dẫn dắt quyết định. Hãy tỉnh táo về trình tự: bạn không mua điểm số, bạn đang đặt cược vào một phương pháp, và điều đầu tiên bạn sẽ khám phá là liệu vòng polling và bộ phân tích lệnh gọi công cụ của bạn có đủ giống Leaf hay không. Một số nhóm sẽ đạt được hành vi gần mức 61,5% vào chiều ngày thứ ba, còn một số sẽ mất hai tuần để phát hiện ra bộ đánh giá của họ dễ hơn SWE-bench Verified, và chưa ai ngoài phòng thí nghiệm có thể nói cho bạn biết bạn thuộc nhóm nào.
Nếu quyết định thực sự sát nút, thử nghiệm rẻ tiền là chạy cả hai trong cùng một harness trên chính các issue của bạn, thay vì tranh luận về những con số đã công bố vốn không dùng chung một benchmark. OrcaRouter mang hơn 200 mô hình phía sau một khóa tương thích OpenAI duy nhất với mức markup 0%, nên giá niêm yết của nhà cung cấp được truyền qua nguyên vẹn — điều đó giúp bạn có thể đặt một mô hình tổng quát dạng hosted cùng phần còn lại trong tập ứng viên của mình sau một endpoint duy nhất và một dòng hóa đơn trong lúc cân nhắc. FrogNano không nằm trong các route của chúng tôi và chưa có ngày ra mắt; trọng số là bản tải về mà bạn tự host. Điều chúng tôi có thể loại bỏ là ma sát ở phía bên kia của phép so sánh: hoán đổi các mô hình ứng viên trong chính harness của bạn mà không cần hợp đồng thứ hai, SDK thứ hai, hay bộ thông tin xác thực thứ hai.

Tóm tắt trung thực là con số 61.5 là công trình thực sự của phòng thí nghiệm đã tạo ra nó, và hiện tại đó là lý do duy nhất để ưu tiên FrogNano khi lập trình. Khi ai đó bên ngoài Microsoft tái lập được 61.5 trên cùng 500 tác vụ — hoặc không làm được — thì cuộc so tài này mới có câu trả lời thực sự. Cho đến lúc đó, lựa chọn mặc định an toàn hơn cho hầu hết các nhóm là mô hình 11.95B với giấy phép sạch, phép đo ngữ cảnh dài đã được công bố, và hai mươi tuần sai lầm của người khác đã được tiếp thu vào tài liệu của nó.
