Một thẻ tiêu đề được tạo ghi 'FrogNano-4B-2609 vs Qwen 3.8' với phụ đề 'một agent 4B trên GPU của riêng bạn đối đầu với một flagship 2,4T chạy trên máy chủ', ba chip ghi 'tải xuống 9,32 GB', '$2 vào / $6 ra mỗi triệu' và 'tối đa 150 bước mỗi tác vụ', một chân trang ghi 'số liệu FrogNano theo Microsoft; giá Qwen3.8-Max theo Alibaba. Không có gì ở đây là độc lập', và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

FrogNano-4B-2609 so với Qwen 3.8: Một Coding Agent tốn bao nhiêu khi trọng số là của bạn

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

microsoft/FrogNano-4B-2609 là một repository agent thuộc lớp bốn tỷ tham số, được dẫn xuất từ Qwen3.5-4B, do chính bạn tải về và tự vận hành. Qwen3.8-Max là mô hình chủ lực chạy trên hạ tầng có sẵn — một mô hình mixture-of-experts thưa với 2,4 nghìn tỷ tham số, trong đó khoảng 95 tỷ tham số hoạt động trên mỗi token, cửa sổ đa phương thức một triệu token, cùng bảng giá $2.00 cho mỗi triệu token đầu vào và $6.00 cho mỗi triệu token đầu ra — có thể truy cập bằng API key kể từ ngày 3 tháng 8 năm 2026. Một trong hai tốn một chiếc GPU và cả một buổi chiều. Cái còn lại chẳng tốn gì cho đến khi bạn dùng nó, và khi đó sẽ tính phí theo token trên những quỹ đạo dài nhất đang được dùng phổ biến. Chính sự đánh đổi đó, chứ không phải bảng benchmark, mới là cuộc so kè thực sự.

Các số liệu FrogNano ở đây đến từ thẻ mô hình và báo cáo kỹ thuật của Microsoft; các số liệu Qwen3.8-Max đến từ bảng giá đã công bố của Alibaba và hồ sơ mô hình trong danh mục của chính chúng tôi, với các điểm số độc lập được ghi nhãn là số liệu Artificial Analysis ở bất cứ nơi nào chúng xuất hiện. Hãy lưu ý kỹ cách đặt tên: Qwen3.8, bản phát hành trọng số mở, đã được công bố nhưng chưa ra mắt, trong khi Qwen3.8-Max đang hoạt động và đã có giá ngay hôm nay. Mọi thứ có thể gọi được trong bài viết này đều là bản sau.

Phép tính quyết định sự so sánh

Bắt đầu với chi phí của một nhiệm vụ đơn lẻ, bởi vì nó không hề rõ ràng và cũng không hề nhỏ.

Các đánh giá của FrogNano đã chạy mọi quỹ đạo với ngân sách 150 bước trong khoảng 131K token tổng cộng, tối đa 8.192 token được tạo cho mỗi lượt trợ lý và mức trần 10.800 giây. Nhân hai giới hạn đã công bố với nhau và bạn sẽ có mức trần khoảng 1,23 triệu token được tạo cho một quỹ đạo trong trường hợp xấu nhất — với Qwen3.8-Max tính 6,00 USD cho mỗi triệu token đầu ra, thì đó là khoảng 7,38 USD cho một tác vụ duy nhất đã chạy đến hết ngân sách. Đó là phép tính từ hai con số đã công bố, không phải một phép đo: các quỹ đạo thực tế dừng sớm, mức trung bình thấp hơn nhiều so với mức trần, và kết quả công cụ cùng đầu ra shell được tính theo mức giá đầu vào rẻ hơn thay vì mức giá đầu ra. Nhưng nó cho thấy hình dạng của vấn đề. Một tác nhân lập trình không tiêu tốn vài trăm token cho một câu hỏi; nó tiêu tốn một cuộc trò chuyện dài, nặng về suy luận với chính mình, và mọi token trong cuộc trò chuyện đó đều được tạo ra.

Giờ hãy đặt phía bên kia của sổ cái bên cạnh nó. FrogNano-4B-2609 là 9,32 GB trọng số BF16 trong hai shard, có thể tải xuống mà không cần cổng chặn. Phục vụ nó cần SGLang với bộ phân tích suy luận Qwen3 và bộ phân tích tool-call Qwen3 coder, cùng một sandbox biệt lập cho năm công cụ. Sau đó, chi phí biên của một trajectory là điện năng, và bộ nhớ mà nó chiếm dụng chính là độ lớn mà ngữ cảnh của bạn đạt tới, chứ không phải cân nặng của các trọng số.

• Mô hình chi phí — FrogNano-4B-2609 có chi phí phần cứng cố định và chi phí biên gần như bằng không. Qwen3.8-Max không có chi phí cố định và tính phí theo token, với mức chia $2.00 / $6.00 mà không dồn gì về trước và dồn toàn bộ về sau theo đơn giá đầu ra.

• Đồng tiền mua được gì — một agent cấp 4B trên chính phần cứng của bạn, đối đầu với một mô hình quy mô tiên phong mà bạn không bao giờ phải lập kế hoạch năng lực cho nó.

• Điểm hòa vốn — đạt được khi khối lượng trajectory hằng tháng của bạn nhân với hóa đơn token trung bình mỗi trajectory vượt quá chi phí GPU mà lẽ ra bạn phải thuê. Với một nhóm chỉ chạy một vài tác vụ kho mã mỗi ngày, mốc đó còn xa lắm, và mô hình được host thắng chỉ nhờ tính tiện lợi.

Hai mô hình không làm cùng một công việc

Việc so sánh chi phí chỉ công bằng khi các đầu ra có thể so sánh được với nhau, và ở đây thì chúng không như vậy — đây chính là phần mà hầu hết các bảng thông số kỹ thuật đều lờ đi.

FrogNano-4B-2609 được hậu huấn luyện độc quyền trên kỹ thuật phần mềm ở cấp kho lưu trữ. Toàn bộ giao diện của nó là một vòng lặp năm công cụ — Read, Write, Edit, Glob và Bash — được thực thi bởi Leaf harness trong một sandbox biệt lập, lặp lại cho đến khi mô hình ngừng gọi. Thẻ mô hình của Microsoft ghi ngôn ngữ được hỗ trợ là tiếng Anh và lĩnh vực lập trình đã được kiểm chứng là Python, đồng thời nói thẳng rằng các thành phần hình ảnh và video trong checkpoint chưa từng được hậu huấn luyện và không được hỗ trợ. Nó không suy luận về kiến trúc của bạn, không trả lời các câu hỏi về hoạt động kinh doanh của bạn, cũng không đọc ảnh chụp màn hình.

Qwen3.8-Max là một mô hình tổng quát. Hồ sơ danh mục của Alibaba cho nó đầu vào văn bản, hình ảnh và video với đầu ra văn bản cùng cửa sổ ngữ cảnh 1.000.000 token. Nó suy luận, viết, đọc tài liệu và trò chuyện, còn khả năng gọi hàm của nó là một tính năng của mô hình tổng quát chứ không phải toàn bộ mục đích của checkpoint. Các số liệu Artificial Analysis của nó, đọc từ hồ sơ ngày 2 tháng 9 năm 2026, là Chỉ số Thông minh 45,4 và Chỉ số Lập trình 76,2.

• Đầu vào — FrogNano-4B-2609 chỉ có văn bản. Qwen3.8-Max nhận văn bản, hình ảnh và video.

• Ngữ cảnh — khoảng 131K token tổng cộng cho cấu hình được đánh giá của FrogNano, so với 1,000,000 của Qwen3.8-Max. Đó là gấp bảy lần rưỡi, và điều này quan trọng nhất đối với đúng những đầu vào cỡ kho mã nguồn mà agent lập trình nhận được.

• Đầu ra mỗi lượt — Cấu hình đã được xác thực của FrogNano giới hạn một lượt phản hồi của trợ lý ở mức 8.192 token. Qwen3.8-Max không công bố giới hạn tương đương cho mỗi phản hồi.

• Định dạng đầu ra — FrogNano sử dụng các lệnh gọi công cụ Leaf có cấu trúc và cần một harness để thực thi chúng. Qwen3.8-Max trả về một lời gọi hàm tới bất kỳ client nào bạn đã có.

• Điểm số độc lập — không có điểm nào dành cho FrogNano-4B-2609 ngoài thẻ của chính nó; các số liệu Qwen3.8-Max ở trên là của bên thứ ba, từ Artificial Analysis.

• Tham số — khoảng 4,66 tỷ đối với FrogNano theo mô tả trên card của chính nó, so với tổng 2,4 nghìn tỷ và khoảng 95 tỷ hoạt động đối với Qwen3.8-Max.

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

Nơi 4B thực sự khẳng định được vị trí của mình

Có một khía cạnh mà một agent 4B đánh bại hoàn toàn một mô hình hàng đầu, và đó không phải là độ chính xác.

Bài báo của FrogNano bắt đầu từ Qwen3.5-4B, mô hình đạt 39,4% trên SWE-bench Verified thông qua Leaf harness với tư cách là một mô hình tổng quát thông thường. Năm vòng lặp học tăng cường trên khoảng 1.500 tác vụ tổng hợp đã đưa nó lên 61,5%, với phụ lục của cùng bài báo báo cáo tiến trình theo từng vòng lặp lần lượt là 48,2%, 53,4%, 58,3%, 58,6% và 61,6%. Phương pháp — tạo các tác vụ được hiệu chỉnh theo biên khả năng học của chính sách hiện tại, không chưng cất từ một mô hình mạnh hơn — chính là đóng góp, và là lý do một nhóm nghiên cứu không có ngân sách cho mô hình tiên phong sẽ quan tâm.

Hãy đọc xem điều đó hàm ý gì cho phép so sánh. Thẻ của Microsoft thẳng thắn rằng FrogNano không tốt hơn một cách đồng đều so với mô hình mà nó bắt nguồn từ đó: tỷ lệ gọi công cụ song song của nó là 1,71%, vì các lần lặp sau đã mất khả năng kích hoạt các lời gọi đồng thời, và nhóm đã thêm một giai đoạn hợp nhất để cố khôi phục lại. Một mô hình giải quyết được nhiều vấn đề hơn nhưng lại trở nên kém hơn ở một hành vi cụ thể là một sản phẩm kỹ thuật thực sự với những mối nối lộ rõ, và thẻ của nó nói ra điều đó thay vì vùi lấp.

Và con số SWE-bench là một vòng khép kín. Đường cơ sở của mô hình nền, harness và điểm số cuối cùng đều đến từ cùng một phòng thí nghiệm, và hai bảng trong cùng một bài báo lại đưa ra hai thang bậc khác nhau cho cùng một thí nghiệm. Ngược lại, con số về lập trình của Qwen3.8-Max được tạo ra bởi Artificial Analysis chứ không phải Alibaba — một loại bằng chứng khác, một mức độ tin cậy khác, và không bao giờ nên lấy cái này trừ đi cái kia.

4B mà bạn vẫn chưa thể tính đến một cách trọn vẹn.

Có hai điều đang chắn giữa FrogNano-4B-2609 và một suất trong môi trường sản xuất, và cả hai đều nằm trong tài liệu của chính nó chứ không phải trong ý kiến của bất kỳ người đánh giá nào.

Đầu tiên là phần cứng. Thẻ mô hình nêu yêu cầu trọng số BF16 vào khoảng 9,3 GB, rồi nói thêm rằng bộ nhớ “tăng đáng kể khi ngữ cảnh kết hợp tiến gần khoảng 131K token”, trước khi tuyên bố rằng mẫu GPU tối thiểu chính xác, cấu hình VRAM, phiên bản runtime và hồ sơ hiệu năng “vẫn phải được xác thực trước khi phát hành” — một câu xuất hiện trên một mô hình đã có thể tải xuống. Chưa ai công bố con số VRAM cho cấu hình được đánh giá, và thẻ mô hình không có con số nào như vậy.

Điều thứ hai là lập trường an toàn. Ghi chú căn chỉnh của chính Microsoft cho biết quá trình hậu huấn luyện dành riêng cho agent không sử dụng tập dữ liệu nào về ưu tiên an toàn, từ chối, nội dung độc hại hoặc đối kháng; thay vào đó, nó tối ưu hóa cho tính đúng đắn chức năng và việc tránh hồi quy, đồng thời mô hình "không nên được coi là đã được căn chỉnh an toàn một cách độc lập để triển khai tự chủ không giới hạn". Thẻ này kết thúc bằng việc nêu rõ các rủi ro cụ thể: các bản vá có thể không chính xác hoặc không an toàn dù đã vượt qua các bài kiểm thử của chúng; hiệu suất rất nhạy cảm với chất lượng của những bài kiểm thử đó; và mọi bản vá ứng viên đều cần được con người có chuyên môn xem xét cùng với kiểm thử hồi quy và kiểm thử bảo mật độc lập trước khi sử dụng. Một mô hình tổng quát được host không mang bất kỳ lưu ý cụ thể nào trong số đó, và nó cũng sẽ không chạy lệnh shell trong kho chứa của bạn.

Một chìa khóa cho bất kỳ phe nào bạn chọn

Điều hữu ích khi thực hiện so sánh này trong thực tế là chỉ có một nửa của nó là tải về. Qwen3.8-Max, cùng những mô hình phổ thông mà bạn dùng để đối chiếu với một agent tự vận hành, đều có thể truy cập được qua một endpoint tương thích OpenAI trên OrcaRouter với mức chênh 0% — giá niêm yết của nhà cung cấp được chuyển nguyên, nên khi nhà cung cấp đổi giá thì phía chúng tôi nhận được ngay trong cùng ngày, và đó mới là con số thực sự biến động khi thứ bạn đang muốn kiểm soát là hóa đơn token đầu ra của một coding agent. Điều đó cũng khiến câu hỏi về chuyển đổi dự phòng trở nên đơn giản: nếu nửa chạy trên dịch vụ lưu trữ trong pipeline của bạn bị suy giảm, việc thử lại diễn ra tự động và thí nghiệm vẫn tiếp tục.

FrogNano-4B-2609 không phải là một trong các tuyến của chúng tôi và không có ngày cho nó. Các trọng số là của bạn để triển khai, và model card trung thực ở chỗ cho biết cấu hình phục vụ chưa được xác thực đầy đủ. Điều chúng tôi có thể làm là khiến phía còn lại của phép so sánh không tốn gì để thiết lập, để câu hỏi mà cuối cùng bạn trả lời là câu hỏi thật sự — liệu một agent SWE-bench đạt 61,5% theo báo cáo của nhà cung cấp, chạy trên GPU của chính bạn, có đánh bại một mô hình tiên phong tính phí theo lượng dùng trên chính tác vụ của bạn, ở chính quy mô sử dụng của bạn hay không.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

Nên chọn cái nào

Hãy chọn Qwen3.8-Max khi công việc mang tính tổng quát, khi đội vận hành của người khác nên gánh phần năng lực, khi đầu vào có thể chứa hình ảnh hoặc một tài liệu dài, hoặc khi bạn cần câu trả lời ngay hôm nay thay vì một ngăn xếp phục vụ đến thứ Sáu. Điểm số từ bên thứ ba của nó nghĩa là bạn có thể dự đoán đại khái mình đang mua gì, và hóa đơn theo token của nó là một chi phí biến đổi mà bạn có thể thấy trước khi cam kết. Với một đội chạy một số lượng vừa phải tác vụ kho mã trong một tháng, phép tính không hề cân sức.

Hãy tìm đến FrogNano-4B-2609 khi khối lượng đủ lớn đến mức việc tính phí theo token trên các quỹ đạo dài là ràng buộc, khi dữ liệu không thể rời khỏi hạ tầng của bạn, hoặc khi câu hỏi nghiên cứu — liệu một tác nhân nhỏ có thể được huấn luyện để đạt năng lực cấp kho lưu trữ mà không cần giáo viên — chính là điều bạn đang thực sự kiểm tra. Hãy bắt đầu bằng việc biết ba điều: con số 61,5% là phép đo của chính phòng thí nghiệm trên một harness do phòng thí nghiệm duy trì, chưa ai công bố con số VRAM cho cấu hình được đánh giá, và chính thẻ đó nói rằng thiết lập phục vụ chưa được xác thực.

Điều khiến sự ghép cặp này đáng để viết tới là chúng có chung một tổ tiên cách đây hai thế hệ. FrogNano bắt nguồn từ Qwen3.5-4B — một mô hình tổng quát đến từ cùng công ty mà mô hình chủ lực 2,4 nghìn tỷ tham số của công ty ấy nằm ở phía bên kia trang này. Microsoft lấy mô hình nhỏ, dành năm vòng lặp RL trên các kho tổng hợp, và có được một mô hình chuyên biệt. Alibaba đi theo hướng ngược lại và mở rộng quy mô. Cả hai câu trả lời đều đã được công bố, và khoảng cách giữa chi phí tải xuống và chi phí API chính là cách trung thực để chọn giữa chúng.

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày