Một thẻ tiêu đề được tạo hiển thị 'FrogNano-4B-2609 vs Intern-Decision-4B' với phụ đề 'cùng tổ tiên Qwen3.5-4B, hai kết quả trái ngược', ba chip ghi 'lệnh gọi công cụ và bản vá', 'một ký hiệu cho mỗi trường' và 'không cái nào được chấm điểm độc lập', phần chân trang ghi 'Cả hai bảng điểm đều do nhà cung cấp báo cáo; chưa có bên thứ ba nào tái lập được bất kỳ bảng nào', và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

FrogNano-4B-2609 vs Intern Decision 4B: Một mô hình cơ sở, hai canh bạc hoàn toàn khác biệt

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai phòng thí nghiệm đã lấy cùng một checkpoint, Qwen3.5-4B, rồi đẩy nó theo những hướng không giống nhau. microsoft/FrogNano-4B-2609 đã được huấn luyện hậu kỳ bằng học tăng cường trên khoảng 1.500 môi trường kỹ thuật phần mềm tổng hợp cho đến khi nó có thể phát ra các lệnh gọi công cụ có cấu trúc và các bản vá nhiều tệp thông qua một bộ khung năm công cụ. internlm/Intern-Decision-4B đã được tinh chỉnh để không phát ra văn bản nào cả — nó nhận một trạng thái cùng một lược đồ gồm các câu hỏi có tên và trả về xác suất đã hiệu chỉnh cho từng lựa chọn trong một lượt lan truyền xuôi duy nhất. Một mô hình viết mã. Mô hình kia từ chối viết bất cứ thứ gì và trả về một phân phối. So sánh chúng về chất lượng là vô nghĩa; so sánh chúng về chi phí để chạy và những gì có thể tin cậy giao phó cho chúng mới là bài tập trung thực.

Cả hai đều ra mắt mà không hề có thông báo, và đó cũng chính là điểm chung còn lại giữa chúng. Không bên nào có mục trên Artificial Analysis, có xếp hạng đấu trường, hay dù chỉ một đánh giá độc lập. Mọi con số dưới đây — thang SWE-bench ở một bên, các hàng hiệu chuẩn Brier và ECE ở bên kia — đều do chính phòng thí nghiệm đã huấn luyện mô hình tạo ra, trên hệ thống đo lường của chính phòng thí nghiệm đó, và chưa từng gặp một tập kiểm thử nào không đến từ nơi ấy.

Sự phân nhánh đã xảy ra trước khi một trong hai mô hình tồn tại.

Checkpoint cơ sở là một mô hình lai dày đặc 32 lớp gồm Gated DeltaNet và gated-attention, và cả hai biến thể phái sinh đều kế thừa bộ khung của nó. Sau đó, hai pipeline hậu huấn luyện không có điểm gì chung.

Pipeline của Microsoft là một vòng lặp kín. TaskPilot tạo ra các tác vụ kho mã ứng viên từ những ảnh chụp nhanh thực tế, chạy rollout từ checkpoint hiện tại để tìm ra những tác vụ mà chính sách đôi khi giải được, giữ lại những tác vụ đó và huấn luyện. Năm vòng lặp, mỗi vòng được hiệu chỉnh dựa trên 61,5% của vòng lặp trước đó trên SWE-bench Verified và 37,6% trên SWE-bench Pro. Không có chưng cất — thẻ nêu rõ rằng không có quỹ đạo, hành động hay dấu vết suy luận nào từ mô hình mạnh hơn được dùng làm mục tiêu.

Đường ống của InternLM là một mục tiêu có giám sát duy nhất trên một dạng tác vụ cố định. Mô hình được cấp một lời nhắc hệ thống, một trạng thái, một lược đồ quyết định và một bộ khung JSON trợ lý hoàn chỉnh với một chỗ giữ chỗ cho mỗi trường. Nó chạy một lượt truyền xuôi nhân quả, đọc logits tại mỗi vị trí giữ chỗ và lấy softmax chỉ trên các ký hiệu ứng viên được phép của trường đó. Thẻ của InternLM nói thẳng ra: con đường này "không gọi generate() hay lấy mẫu văn bản tự do."

Sự khác biệt đó không phải là khác biệt về quy mô. Đó là sự khác biệt về việc tạo tác ấy rốt cuộc là cái gì. FrogNano-4B-2609 là một tác nhân có thể sai theo hàng trăm cách thú vị và được sửa chữa bằng các bài kiểm tra. Intern-Decision-4B là một bộ chấm điểm mà kiểu thất bại của nó là một con số đầy tự tin.

Hai hợp đồng, và không hợp đồng nào là “gửi một prompt”

Hợp đồng của FrogNano là một vòng lặp. Mô hình phát ra các lời gọi tới Read, Write, Edit, Glob và Bash; Leaf harness thực thi chúng bên trong một sandbox kho lưu trữ biệt lập và trả về đầu ra; vòng lặp tiếp tục cho đến khi mô hình ngừng gọi. Các đánh giá chạy ở 150 bước trong khoảng 131K token tổng cộng, với tối đa 8.192 token được tạo mỗi lượt trợ lý. Việc phục vụ cần SGLang với một bộ phân tích suy luận Qwen3 và một bộ phân tích lời gọi công cụ Qwen3 coder — làm sai điều đó và mô hình sẽ tạo ra văn xuôi ở nơi harness mong đợi JSON, thứ mà từ bên ngoài trông giống hệt một mô hình bị hỏng.

Hợp đồng của Intern-Decision-4B là một lần chạy duy nhất với giới hạn cứng. Các câu hỏi và tùy chọn giữ nguyên thứ tự của chúng. Các tùy chọn được ánh xạ lên các ký hiệu đơn token — A đến Z, sau đó a đến z, sau đó 0 đến 9, đó là lý do số học khiến một câu hỏi tối đa chỉ có 62 tùy chọn. Mức trần của wrapper là 8.192 token và thẻ của InternLM nói rõ rằng các đầu vào dài hơn sẽ bị từ chối mà không cắt ngắn. Ba loại câu hỏi được hỗ trợ: choice với một bản đồ tiêu chí có thứ tự, score với một danh sách hoặc bản đồ khóa số, và noul, một dạng nhị phân. Tối đa tám hình ảnh được phép và token của chúng được tính vào cùng 8.192.

• Hình dạng đầu ra — FrogNano-4B-2609 phát ra các lệnh gọi công cụ, văn bản lập luận và một bản vá. Intern-Decision-4B phát ra một ký hiệu cho mỗi trường và không gì khác.

• Tính tất định — FrogNano lấy mẫu ở nhiệt độ 0,6 trên ba seed, nên nó mang tính xác suất theo thiết kế. Argmax của Intern-Decision-4B được cố định bởi lượt truyền xuôi; nhiệt độ được khớp chỉ làm thay đổi độ tin cậy của nó.

• Bề mặt lỗi — FrogNano có thể ảo giác ra một API, mở rộng phạm vi chỉnh sửa quá mức, hoặc vượt qua kiểm thử trong khi đưa vào một lỗ hổng, tất cả những điều này đều được thẻ của nó nêu tên. Intern-Decision-4B không thể ảo giác ra câu trả lời, vì nó chỉ có thể chọn từ các tùy chọn bạn cung cấp — nó chỉ có thể bị hiệu chỉnh sai.

• Giới hạn đầu vào — khoảng 131K token kết hợp đối với FrogNano trong cấu hình đã được đánh giá của nó, so với mức cứng 8.192 dành cho Intern-Decision-4B, tức là gấp mười sáu lần và không có cách khắc phục nào.

• Cấu trúc chi phí — FrogNano tính phí theo quỹ đạo, mà quỹ đạo thì dài. Intern-Decision-4B không có token đầu ra nào để tính phí cả.

Tham số — thẻ FrogNano đưa ra dải “500M-5B” và mô tả khoảng 4,66B, với bản tải xuống BF16 9,32 GB; Intern-Decision-4B được nêu ở mức 4,54B cùng một vision tower 612 MB và một projector 54 MB song hành với các shard ngôn ngữ của nó.

Con số quyết định sự ghép cặp này

Card của InternLM đặt Intern-Decision-4B ở mức độ trễ trung bình 44,16 ms và trung vị 44,03 ms trên một RTX 4090 duy nhất qua đường dẫn Hugging Face cục bộ, với P95 là 44,60 ms. Hãy đọc lại độ phân tán đó: từ trung vị đến đuôi thấp hơn một mili giây rất nhiều, vì một lượt truyền xuôi có hình dạng cố định hầu như không có gì để biến thiên. Đó chính là toàn bộ lập luận cho kiến trúc này.

Con số tương ứng của FrogNano không tính bằng mili giây. Các đánh giá của nó cho phép ngân sách 150 bước với mức trần 10.800 giây cho agent mỗi tác vụ. Đó không phải là những đơn vị có thể so sánh được và không bao giờ nên được đặt trong cùng một câu với một tuyên bố về độ trễ — nhưng chúng cho bạn biết hình dạng của sự đánh đổi. Một mô hình trả lời một quyết định trong bốn mươi tư mili giây, còn mô hình kia dành hàng phút gọi công cụ để theo đuổi một bản vá. Nếu vấn đề của bạn là “định tuyến ticket này vào một trong sáu hàng đợi và cho tôi biết bạn chắc chắn đến mức nào”, thì cái đầu tiên không phải là một phiên bản rẻ hơn của cái thứ hai, mà nó là một cỗ máy khác.

Cả hai phòng thí nghiệm đều tự đo lường mình một cách cẩn thận, và cả hai tập số đo đều nên được đọc như những ý định chứ không phải kết quả. InternLM báo cáo mức trung bình trên bảy bộ là 90,02 với điểm Brier là 0,347 và sai số hiệu chuẩn kỳ vọng là 0,065, được khớp ở nhiệt độ 1,99241824 trên 1.728 trường hợp hiệu chuẩn được chỉ định. Microsoft báo cáo mức tăng qua năm vòng lặp từ 39,4% lên 61,5% trên SWE-bench Verified, và phần phụ lục của cùng bài báo đó báo cáo cùng tiến trình ấy là 48,2%, 53,4%, 58,3%, 58,6% và 61,6% — một lời nhắc rằng ngay cả bên trong một phòng thí nghiệm, cùng một sự thật được đo bằng hai cách cũng tạo ra hai chiếc thang.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

Dấu hiệu nhận biết nằm ở điều mà mỗi lá bài chọn cảnh báo bạn.

Cả hai card đều trung thực một cách bất thường, và sự trung thực ấy lại chỉ về hai hướng đối lập — đó chính là điều hữu ích nhất trong phép so sánh này.

Phần hạn chế đã biết của Microsoft đọc như một cảnh báo triển khai. Chỉ tiếng Anh và Python. Hiệu năng nhạy cảm với harness và chất lượng kiểm thử. Các bản vá có thể không chính xác hoặc không an toàn dù đã vượt qua các bài kiểm thử của chúng. Câu trong chính thẻ mô hình đó là FrogNano “không nên được coi là đã căn chỉnh an toàn một cách độc lập để triển khai tự trị không giới hạn”, và nó nêu rõ lỗ hổng cụ thể: quá trình hậu huấn luyện dành riêng cho agent không dùng dữ liệu ưu tiên an toàn, dữ liệu từ chối hay dữ liệu đối kháng, vì thay vào đó nó tối ưu cho tính đúng đắn chức năng và việc tránh hồi quy. Nó cũng chủ động nêu ra tỷ lệ gọi công cụ song song là 1,71%, nghĩa là mô hình gần như không bao giờ kích hoạt hai công cụ trong một lượt dù harness cho phép điều đó — một sự hồi quy năng lực thực sự so với mô hình cơ sở mà nhóm đã thêm một giai đoạn hợp nhất để cố gắng khôi phục.

Thẻ của InternLM cảnh báo về nhóm vấn đề ngược lại. Không có bề mặt ảo giác nào để cảnh báo, nên những lưu ý đều nằm ở đầu vào: việc từ chối ở 8.192, mức trần 62 tùy chọn, việc text tower bên dưới khai báo giới hạn vị trí 262.144 token mà wrapper được phát hành từ chối dùng. Rủi ro của nó là một con số được đưa ra một cách tự tin lại được tin tưởng vượt quá mức nó xứng đáng, và thẻ nói thẳng rằng việc hiệu chuẩn thu hẹp khoảng cách với baseline Jev nhưng không khép lại khoảng cách đó trên mọi lát cắt.

Đọc cùng nhau, chúng mô tả hai tư thế tin cậy khác nhau. FrogNano cần được giám sát vì nó hành động. Intern-Decision-4B cần được kiểm toán vì nó cho điểm — và một con số có thể làm thay đổi một quyết định sản xuất đúng là kiểu đầu ra mà không ai nghĩ đến việc kiểm thử.

Router phù hợp ở đâu, và một ghi chú trung thực về cả hai

Không mô hình nào là endpoint được host. FrogNano được phân phối dưới dạng trọng số cùng một harness đánh giá Kubernetes; Intern-Decision-4B được phân phối dưới dạng một lớp Python mà bạn import sau khi tải xuống bốn shard. Với một nhóm muốn thử một trong hai trước một thứ có thật, mô thức an toàn là giống nhau cho cả hai và nó không hào nhoáng: hãy đặt thành phần thử nghiệm phía sau một cơ chế dự phòng để một quỹ đạo tồi hoặc một ngày bị hiệu chỉnh sai chỉ tốn một lần thử lại thay vì gây ra một sự cố.

Mẫu đó chính là việc mà một lớp định tuyến sinh ra để làm. OrcaRouter chạy hơn 200 mô hình phía sau một khóa tương thích OpenAI với mức markup 0% — giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn, nên thay đổi giá từ nhà cung cấp sẽ đến phía chúng tôi ngay trong cùng ngày — và cơ chế chuyển đổi dự phòng của nó nằm trước mô hình tổng quát mà bạn dùng làm phương án dự phòng, chứ không nằm trước hai mô hình này. Nói thẳng: chúng tôi không cung cấp FrogNano-4B-2609 hay Intern-Decision-4B, và chưa có ngày ra mắt cho cả hai. Điều mà một endpoint duy nhất mang lại cho bạn ở đây là bản thân việc so sánh trở nên rẻ — một thông tin xác thực, một dòng tính phí, và không cần thêm tích hợp thứ hai mỗi khi bạn đổi mô hình tổng quát mà bạn dùng làm mốc so sánh cho mô hình chuyên biệt.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

Cái nào, và khi nào

Hãy dùng Intern-Decision-4B khi câu trả lời đã có sẵn trong prompt của bạn và bạn cần nó được chọn, kèm theo một độ tin cậy, với tốc độ hàng nghìn lần mỗi giây. Định tuyến theo taxonomy cố định, chấm điểm theo rubric, trích xuất ràng buộc theo schema, kiểm duyệt dựa trên một tập nhãn đóng. Lượt truyền xuôi 44 mili-giây và hóa đơn token đầu ra bằng không chính là sản phẩm, và hiệu chuẩn là thứ cần kiểm toán trước khi bạn tin vào nó.

Hãy dùng FrogNano-4B-2609 khi câu trả lời chưa tồn tại và phải được khám phá bằng cách đọc một kho mã và chạy các bài kiểm thử của nó. Đó là một quá trình kéo dài vài phút, chạy trong sandbox, có thể xem xét lại, và 61,5% trên SWE-bench Verified — do nhà cung cấp báo cáo, chưa được tái lập — là bằng chứng tốt nhất hiện có cho thấy một checkpoint 4B có thể làm được điều đó.

Điều không nên được cho qua theo bất kỳ hướng nào chính là thói quen so sánh điểm số của chúng. Mức trung bình 90,02 trên bảy set và tỷ lệ 61,5 trên SWE-bench Verified là những phép đo cho hai câu hỏi khác nhau, do hai phòng thí nghiệm tạo ra, trên hai harness, và không con số nào từng qua tay bên thứ ba. Chúng chỉ chung một tổ tiên, không gì khác.

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

Dự đoán thực sự hữu ích duy nhất từ tổ tiên chung: vì cả hai mô hình đều khởi đầu từ cùng một checkpoint 4B, khác biệt giữa chúng gần như nằm hoàn toàn ở phần hậu huấn luyện, nghĩa là câu hỏi thú vị đối với bất kỳ ai đang xây dựng trên Qwen3.5-4B là cấu trúc phần thưởng nào trong hai cấu trúc này sẽ chuyển giao sang lĩnh vực riêng của họ. Một vòng lặp tác vụ tổng hợp tự hiệu chỉnh dựa trên chính chính sách của nó, hay một đầu chấm điểm có dạng cố định với nhiệt độ được fit. Đó là hai công thức, cả hai đều đã công bố, đều đến từ những phòng thí nghiệm vẫn chưa cho ai khác chạy chúng. Đó là một tình huống hiếm gặp và đáng để theo dõi hơn là tin theo.