Một thẻ tiêu đề được tạo với nội dung 'FrogNano-4B-2609', phụ đề 'một tác nhân lập trình 4B trên nền Qwen3.5-4B', ba chip ghi '59,6B byte trọng số', 'thẻ ghi 22-SEP-2026' và 'không có bài đăng ra mắt', chân trang ghi 'Số liệu theo thẻ mô hình và báo cáo kỹ thuật của Microsoft; không có gì ở đây được tái lập một cách độc lập', và logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Engineering & Research

FrogNano-4B-2609: Microsoft đã phát hành một tác nhân lập trình 4B lên Hugging Face và không hề công bố.

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Kho lưu trữ xuất hiện vào ngày 17 tháng 9 năm 2026 với commit đầu tiên, và bản checkpoint được đẩy lên chỉ bốn phút sau đó. Rồi không có gì nữa. Không một dòng tweet nào từ Microsoft AI, không một mục nào trên blog Microsoft Research, không có trang ra mắt. Bảy tuần sau microsoft/FrogNano-4B-2609 — một coding agent cỡ bốn tỷ tham số dựng trên Qwen3.5-4B — vẫn không có thông báo nào đứng sau nó, và sự im lặng đó chính là sự thật quan trọng nhất về việc công bố mô hình này. Thứ nó thực sự có là một model card khẳng định có một bài báo và một harness, một kho GitHub hóa ra lại chính là harness chứ không phải bài báo, và một createdAt mang giá trị 17 tháng 9 nằm dưới một model card ghi "Release date 22-SEP-2026". Cả hai ngày đều là tạm bợ; không ngày nào sai; chúng mâu thuẫn với nhau.

Điều gì thực sự được xuất bản

Mọi thứ dưới đây đều có thể kiểm chứng trên hub ngay lúc này, và mọi con số trong bài viết này đều đến từ card của chính Microsoft hoặc từ số byte trong chính repository. Không có gì được bên thứ ba tái tạo — không có mục Artificial Analysis nào, không có xếp hạng arena nào, và không có bất kỳ đánh giá độc lập nào về FrogNano ở bất cứ đâu.

• Trọng số — một kho lưu trữ công khai thuộc tổ chức Microsoft, không bị hạn chế truy cập, được gắn nhãn MIT trên hub, 15 tệp, không có cổng tải xuống và không cần ký thỏa thuận.

• Trọng số trên đĩa — 9,32 GB trải rộng trên hai phân mảnh safetensors, 59,6 tỷ byte dữ liệu kho lưu trữ bao gồm bộ tệp không có optimizer, 738 tensor trong chỉ mục.

• Kiến trúc — Qwen3_5ForConditionalGeneration, ngăn xếp lai dày đặc 32 lớp kế thừa từ Qwen3.5-4B, cùng một tháp thị giác 24 lớp mà thẻ cho biết là được kế thừa và chưa từng được huấn luyện hậu kỳ.

• Trường tham số của chính thẻ — "500M-5B". Đó là một dải, không phải một con số, và bản tải xuống là tài liệu chính xác hơn.

• Giấy phép — phần mở đầu của thẻ ghi MIT. Phần nội dung của chính thẻ lại ghi Apache License 2.0, và harness trên GitHub thực sự có kèm một tệp LICENSE theo MIT. Hai phát biểu đó nói về những tạo tác khác nhau trong cùng một bản phát hành.

• Thông báo — không có. Không có trên blog Microsoft Research, không có trên trang nghiên cứu của chính nhóm, không có trong nguồn cấp của tổ chức Hugging Face dưới bất kỳ hình thức nào khác ngoài một danh sách kho lưu trữ.

Dòng cuối cùng đó là dòng nên định hình tư thế của người đọc cho phần còn lại của bài viết này. Một checkpoint được tải lên âm thầm không phải là một tạo tác kém cỏi hơn so với một checkpoint được công bố — thẻ của nó thường dài hơn, vì không ai biên tập nó ngắn lại cho một thông cáo báo chí. Nhưng nó chưa đi qua một bộ lọc mà bản phát hành được công bố mặc nhiên có: những người khác nhìn vào nó.

A screenshot of Microsoft's Hugging Face model card for FrogNano-4B-2609 showing the model summary table with rows for Developer (Microsoft Corporation), Description, Model architecture, Parameters (500M-5B), Inputs, Outputs, Context length (approximately 131K tokens in the evaluated coding-agent configuration), Training Dates (Jun 2026 to Aug 2026), Release date (22-SEP-2026), License (Apache License 2.0), the Qwen/Qwen3.5-4B model dependency, the 'Technical report;' and 'Leaf harness.' asset links, and the section 1 Model overview naming Qwen3.5-4B and the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

Các tỷ số, và ai là người tạo ra từng tỷ số một

Microsoft báo cáo FrogNano đạt 61,5% trên SWE-bench Verified, 37,6% trên SWE-bench Pro, 31,1% trên Terminal-Bench 2.0 và 47,3% trên PatchEval-Verified, tất cả đều là tỷ lệ giải quyết Avg@3 được đo thông qua harness Leaf. Cùng card đó đưa ra điểm khởi đầu: Qwen3.5-4B đạt 39,4% trên SWE-bench Verified với cùng harness và ngân sách. Năm vòng lặp học tăng cường đã đưa nó lần lượt qua 49,1%, 53,1%, 56,7%, 59,1% và 61,5% — cao hơn mô hình cơ sở 22,1 điểm, mà cách diễn đạt của chính Microsoft làm tròn thành mức cải thiện tương đối khoảng 56%.

Có hai điều về cái thang đó đáng để dừng lại suy ngẫm, vì chúng là những chỗ mà một bản tóm tắt có thể sai, chứ không phải những chỗ mà nhà cung cấp đã sai.

Đầu tiên là sự sai lệch ở Iter 5. Bảng tiêu đề của thẻ ghi 61,5% cho vòng lặp cuối cùng; còn phụ lục về hiệu quả của chính bài báo lại báo cáo cùng tiến trình năm điểm kiểm tra là 48,2%, 53,4%, 58,3%, 58,6% và 61,6%. Chỉ con số cuối là gần khớp, và cũng chỉ con số cuối mới là thứ mà ai cũng trích dẫn. Hãy coi con số cuối cùng là kết quả ổn định, còn các nấc trung gian là phép đo những thứ khác nhau, bởi vì dưới một cách tổng hợp khác thì rõ ràng chúng đúng là như vậy.

Điều thứ hai là FrogNano không tốt hơn một cách đồng đều so với mô hình khởi điểm của nó trên mọi phương diện. Tỷ lệ gọi công cụ song song được công bố của nó là 1,71%. Thẻ mô hình thẳng thắn cho biết các phiên bản sau đã mất khả năng gọi nhiều công cụ trong một lượt, và rằng công việc hợp nhất của nhóm một phần tồn tại để khôi phục lại khả năng đó. Một mô hình giải quyết được nhiều vấn đề hơn nhưng hầu như không đưa ra cuộc gọi đồng thời là một đánh đổi kỹ thuật thực sự, chứ không phải một chú thích nhỏ.

A generated two-column scoreboard reading 'Microsoft reports' on the left with rows Qwen3.5-4B base 39.4%, Iter 2 49.1%, Iter 4 59.1% and Iter 5 61.5%, and 'What is not verified' on the right with rows Independent evaluation: none, Parallel tool calls: 1.71%, Repository size: 59.6B bytes, Card release date: 22-SEP-2026 and Hub created: 17-SEP-2026, with a footer reading 'All scores vendor-reported through the Leaf harness; no third party has reproduced any of them.'

Bộ khung là sản phẩm, và kho lưu trữ là bộ khung.

FrogNano không tự chạy. Nó phát ra các lệnh gọi có cấu trúc tới năm công cụ — Read, Write, Edit, Glob và Bash — và phải có thứ gì đó thực thi chúng trong một môi trường cô lập rồi trả lại kết quả. Thứ đó chính là Leaf, và ở đây dấu vết có một điểm hơi khác thường.

Hàng "tài sản liên quan bổ sung" của thẻ mô hình liên kết tới một báo cáo kỹ thuật tại aka.ms/frognano-tech-report và một harness tại github.com/microsoft/FrogNano. Liên kết aka.ms không trỏ tới một tệp PDF; nó chuyển hướng thẳng tới trang tóm tắt arXiv, nơi báo cáo thực sự nằm ở đó. Trong khi đó, kho GitHub không chứa mã huấn luyện, không có công thức RL và không có checkpoint. README của chính nó mô tả một harness đánh giá chạy các tác nhân lập trình trong sandbox Kubernetes hướng tới một endpoint tương thích với OpenAI, và trỏ ngược lại bài báo arXiv để tìm câu chuyện huấn luyện. Vậy nên hai liên kết tài sản của thẻ là một con trỏ tới bài báo và một con trỏ tới phản hồi của bài báo, và cái tên là một cái tên dùng chung.

Điều này quan trọng với bất kỳ ai dự định sử dụng mô hình, vì một lý do thực tế. Công thức phục vụ được tài liệu hóa là SGLang với --reasoning-parser qwen3 và --tool-call-parser qwen3_coder, và harness muốn một endpoint vốn đã hỗ trợ sẵn tool call và suy luận. Chỉ cần cấu hình parsing sai một chút là mô hình sẽ tạo ra văn bản ở nơi harness mong đợi JSON, thứ mà khi nhìn từ bên ngoài trông y hệt như một mô hình tồi chứ không phải một cấu hình tồi. Card nói rõ rằng bất kỳ điểm số khớp nào cũng đòi hỏi checkpoint, tokenizer, cấu hình phục vụ, ảnh tác vụ và giao thức đánh giá tương ứng — đó là nhà cung cấp đang nói với bạn rằng harness là một nửa kết quả.

Cũng đáng nói rõ ràng cho bất kỳ ai đang cân nhắc phần cứng: một checkpoint 9,32 GB ở ngữ cảnh được đánh giá của thẻ không phải là một bài toán suy luận 9,32 GB. Các đánh giá chạy ở khoảng 131K token kết hợp với ngân sách 150 bước. Bộ nhớ tỉ lệ với ngữ cảnh, không phải với trọng số, và thẻ cho biết cấu hình GPU tối thiểu vẫn "phải được xác nhận trước khi phát hành" — một cụm từ xuất hiện trên một mô hình đã có thể tải xuống.

Quá trình huấn luyện thực sự đã làm gì, trong một đoạn văn.

Đóng góp của bài báo không nằm ở mô hình, mà ở vòng lặp. TaskPilot tạo các tác vụ kỹ thuật phần mềm ứng viên từ những ảnh chụp kho lưu trữ thực tế, chạy rollout từ checkpoint hiện tại trên chúng, giữ lại những tác vụ nằm sát ranh giới của những gì chính sách đôi khi có thể giải được, và loại bỏ những ứng viên vĩnh viễn tầm thường hoặc vĩnh viễn bất khả thi. Tập được chấp nhận huấn luyện checkpoint tiếp theo. Checkpoint tiếp theo đó lại hiệu chỉnh vòng tạo tác vụ kế tiếp, nên phân phối tác vụ dịch chuyển cùng với chính sách. Tổng cộng khoảng 1.500 môi trường đã được xác thực. Không chưng cất: thẻ nói thẳng rằng hậu huấn luyện dành riêng cho agent không dùng quỹ đạo lời giải, hành động, dấu vết lập luận hay mục tiêu bản vá nào từ mô hình mạnh hơn. Các mô hình mạnh hơn viết tác vụ; chúng không trình diễn đáp án.

Microsoft đã chạy vòng lặp đó trong năm lần lặp và báo cáo mức tăng 8,7 điểm trước bất kỳ đợt hợp nhất nào, với hình phạt độ dài log được thêm vào giữa chừng vì các dấu vết suy luận tăng nhanh hơn mức chúng cải thiện.

Thẻ mô hình nói thẳng một cách bất thường về những điểm mà toàn bộ cách tiếp cận này trở nên mong manh. Dữ liệu huấn luyện thiên về Python và chủ yếu là tiếng Anh; tập ngôn ngữ tự nhiên được hỗ trợ chính thức ghi trên thẻ chỉ gồm tiếng Anh và không có gì khác, đồng thời không hề tuyên bố rằng mô hình nền có phạm vi đa ngôn ngữ rộng hơn. Hiệu năng nhạy cảm với khung đánh giá và với chất lượng của các bài kiểm thử. Các bản vá được tạo ra "có thể không chính xác hoặc không an toàn dù đã vượt qua các bài kiểm thử hiện có." Thẻ mô hình của bản 4B khép lại đoạn đó bằng câu mà mọi người đọc đều nên ghi nhớ: không được sử dụng nếu không có sự đánh giá của chuyên gia con người và kiểm thử độc lập về hồi quy cũng như bảo mật. Đó là một tuyên bố của nhà cung cấp về một sản phẩm của nhà cung cấp, và nó là một câu hữu ích hơn bất kỳ dòng bảng điểm nào ở phía trên.

Điều này đặt người mua ở đâu, và bộ định tuyến phù hợp ở đâu

FrogNano không phải là một mô hình mà bạn gọi. Không có API chính chủ, không có endpoint được host, và không có image serverless. Nó là một checkpoint, và việc dùng nó đồng nghĩa với việc hoặc là tự dựng triển khai SGLang của riêng bạn phía sau một sandbox chạy trên Kubernetes, hoặc đánh giá nó như một thành phần bên trong agent stack mà bạn đã vận hành. Đó là toàn bộ lộ trình áp dụng hiện nay, và không thông báo nào có thể thay đổi hình dạng của nó.

Điều mà một lớp định tuyến có thể làm một cách trung thực ở đây là một việc hẹp hơn nhiều so với vẻ ngoài ban đầu của nó. Nếu kế hoạch là so sánh một FrogNano tự vận hành với một mô hình lập trình được host trong chính harness của bạn, thì nửa được host chính là nửa hưởng lợi từ việc nằm sau một khóa duy nhất thay vì một hợp đồng thứ hai: OrcaRouter mang hơn 200 mô hình phía sau một endpoint tương thích OpenAI duy nhất với mức markup 0%, nghĩa là giá niêm yết của nhà cung cấp được truyền qua nguyên vẹn và thay đổi giá từ nhà cung cấp sẽ có hiệu lực phía chúng tôi ngay trong cùng ngày. Điều đó quan trọng đối với một cuộc so tài mà kết quả được quyết định bởi chi phí trên mỗi vấn đề được giải quyết thay vì bởi một con số benchmark đơn lẻ. Chúng tôi không tự vận hành FrogNano và không có ngày nào cho việc đó; trọng số và công việc phục vụ là của bạn.

A generated timeline card headed 'One model, three dates' with three markers: 17 September 2026 labelled 'Hugging Face creation timestamp', 22 September 2026 labelled 'Release date printed on the model card', and 2 October 2026 labelled 'Most recent file update', with a footer reading 'No announcement accompanied any of the three. Dates read from the Hugging Face repository history on 3 October 2026.'

Ba điều có thể giải quyết được chuyện đó

Đầu tiên, một bản tái lập độc lập. Mọi con số trong bài viết này — 61.5, 37.6, 31.1, 47.3 — đều do phòng thí nghiệm đã huấn luyện mô hình tạo ra, trên một bộ khung đánh giá do chính phòng thí nghiệm đó duy trì, đối chiếu với một con số mô hình cơ sở do chính phòng thí nghiệm đó đo. Đó là một bức tranh hoàn chỉnh và nhất quán nội tại, đồng thời cũng là một vòng khép kín. Phép thử hữu ích là liệu một người không có lợi ích liên quan có tái lập được bước nhảy từ 39.4 lên 61.5 trên cùng 500 tác vụ mà không cần đến công việc hiệu chỉnh của Microsoft trên tập tác vụ hay không.

Thứ hai, ai đó phải kiểm tra tuyên bố về harness từ đầu đến cuối. Kho chứa này công khai, điều mà nhiều bản phát hành không làm được, nhưng nó chính là giàn đánh giá. Nếu năm công cụ và cách ly sandbox thực sự là cơ chế tạo ra hiệu năng, thì một bên thứ ba chạy cấu hình đã công bố sẽ đạt được kết quả gần với các con số đã công bố. Nếu không, khoảng cách đó mới là phát hiện thực sự.

Thứ ba, và là điều dễ trả lời nhất: Microsoft nên nói rõ đây là một sản phẩm hay một hiện vật học thuật. Phần phân phối của model card coi trọng số, model card và bộ khung đánh giá là sản phẩm bàn giao, đọc lên giống như công bố nghiên cứu hơn là ra mắt. "Ngày phát hành 22-SEP-2026" đọc lên giống như ra mắt. Một mô hình đã được công bố lẽ ra sẽ giải quyết sự mơ hồ đó ngay ở câu đầu tiên của một bài đăng blog, và không hề có bài đăng blog nào.

Cho đến lúc đó, thế đứng đúng đắn là thế đứng mà chính bản phát hành hàm ý. FrogNano-4B-2609 là một checkpoint thật, có thể tải xuống, theo MIT và Apache và có lẽ không, với một thẻ mô hình kỹ càng một cách bất thường, một bộ khung đánh giá công khai, một ý tưởng phương pháp luận thực sự, và một bảng điểm chưa từng được ai không có địa chỉ Microsoft đụng tới. Đối với một phòng thí nghiệm, đó là một hiện vật hoàn chỉnh và thú vị. Đối với một nhóm sắp đưa một agent đứng trước một repository lúc ba giờ sáng, đó là một manh mối đáng theo đuổi và chưa phải là một quyết định đáng đưa ra.