Thẻ tiêu đề cho 'Prime Agent vs Qoder Cantus': tiêu đề chính, phụ đề 'bộ khung mở bạn có thể kiểm tra vs model bạn không thể chạm tới', và hai thẻ so sánh — Prime Agent (khung RLM mã nguồn mở · giấy phép MIT · kiểm tra mã nguồn · tự mang model của bạn) và Qoder Cantus (model IDE độc quyền · chỉ dành riêng cho Qoder · không có API · đặc tả một dòng · hệ số nhân tín dụng 3,2x). Logo OrcaRouter ghép ở góc dưới bên phải.
Guides & Insights

Prime Agent vs Qoder Cantus: một bộ khung mở bạn có thể kiểm toán vs một mô hình bạn không thể chạm tới

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Prime AgentQoder Cantus là hai lời chào hàng "lập trình tự động đỉnh cao" gây xôn xao nhất tuần này, nhưng chúng hoàn toàn trái ngược nhau. Prime Agent là bộ khung agent mã nguồn mở hoàn toàn, được cấp phép MIT của Prime Intellect — khoảng 344.000 dòng TypeScript và Python mà bạn có thể clone ngay tối nay và chạy với bất kỳ mô hình nào bạn đã có sẵn chìa khóa API. Qoder Cantus là mô hình chủ lực của Alibaba nằm trong Qoder — một cái tên bạn chọn từ menu thả xuống, không có API độc lập, không có trọng số để tải xuống, không có tham số, và không một benchmark nào được công bố. So sánh quan trọng không phải là "cái nào viết mã tốt hơn." Mà là một trong hai thứ này bạn có thể kiểm chứng được, còn thứ kia bạn chỉ có thể tin theo lời.

Tóm lại: {{1}}Prime Agent là một bộ khung miễn phí trao cho bạn cả quyền chọn mô hình lẫn nhật ký kiểm toán, nên chất lượng của nó tùy thuộc vào mô hình bạn trỏ vào — DeepSeek V4 Flash chạy qua nó thì nhanh và gần như miễn phí, còn Opus 5 chạy qua nó lại là thứ mà Prime Intellect báo cáo đạt 95,5% trên ARC-AGI-3.{{/1}} {{2}}Qoder Cantus là một mô hình cố định, đóng, được tính phí theo hệ số nhân tín dụng 3,2x mà không ai ngoài Qoder có thể đánh giá được chút nào.{{/2}} {{3}}Nếu bạn muốn kiểm soát và khả năng xác minh, thì sự bất đối xứng đó chính là toàn bộ lý lẽ.{{/3}} {{4}}Nếu bạn muốn không cần thiết lập gì và hóa đơn có trần, Cantus vẫn có lý do — bạn chỉ cần biết mình đang mua thứ gì.{{/4}}

Các kích thước thực sự quyết định sự ghép cặp này:

• Mỗi cái là gì — một bộ khung (harness) không phụ thuộc mô hình mà bạn tự cài đặt và chạy, so với một mô hình độc quyền bị khóa bên trong IDE Qoder.

• Giá — $0 cho harness, bạn chỉ trả token của mô hình so với khoảng $0,38 mỗi lượt agent tại hệ số 3.2x của Cantus.

• Bằng chứng — một kết quả 95,5% ARC-AGI-3 do nhà cung cấp báo cáo cộng với một bài kiểm tra độc lập vượt qua cả 9 bài, so với không có gì được công bố và không có cách nào để công bố.

• Tác vụ dài hạn — một kernel IPython bền bỉ giữ trạng thái như các biến Python sống, so với một cơ chế không được tiết lộ và cửa sổ ngữ cảnh.

• Khóa chặt — chuyển đổi mô hình chỉ bằng thay đổi cấu hình, thay vì một cánh cửa một chiều.

Comparison scoreboard for Prime Agent vs Qoder Cantus. Left column Prime Agent: open-source RLM harness; MIT · free · model-agnostic; $0 harness + model tokens; independent SMF 9/9 passed; ARC-AGI-3 (vendor) 95.5% w/ Opus 5; context persistent kernel 200K+. Right column Qoder Cantus: proprietary IDE model; Qoder-only · no API; 3.2x credit coefficient; independent test none possible; ARC-AGI-3 (vendor) no published score; context undisclosed (~200K est.). Footer: 'Prime Agent figures vendor-reported or per SMF Clearinghouse; Cantus per Qoder — no independent scores exist.' OrcaRouter logo composited bottom-right.

Điều bạn thực sự đang so sánh: một bộ khung và một mô hình

Prime Agent không phải là một mô hình. Đây là phần mềm — một bộ khung (harness) lập trình và nghiên cứu do Prime Intellect phát hành vào ngày 5 tháng 8 năm 2026 (v0.7.0), được xây dựng dựa trên pi TUI của Mario Zechner, sau khoảng một năm và 4.470 commit. Điểm thú vị nằm ở hai lớp trừu tượng hóa của nó. Mô hình Ngôn ngữ Đệ quy (RLM) cấp cho agent đúng một công cụ duy nhất: một nhân IPython thường trực. Đọc tệp, chạy lệnh shell, duyệt web, thậm chí khởi tạo agent con — tất cả đều diễn ra dưới dạng mã Python do mô hình tự viết; việc ủy quyền cho agent con chỉ là một lời gọi hàm — await rlm("subtask") — trả về một handle trong khi tiến trình con chạy như một instance Prime Agent đầy đủ của riêng nó. Bộ khung liên tục (continual harness) cho phép sổ tay vận hành của agent được chỉnh sửa ngay giữa nhiệm vụ: nó có thể tạo, cập nhật và xóa các prompt, kỹ năng, bộ nhớ và thông số agent con của mình, đồng thời lệnh /refine áp dụng các chỉnh sửa tự cải thiện nhỏ, dựa trên bằng chứng, vào quỹ đạo hoạt động của chính nó, với khả năng khôi phục (rollback) theo ID và một system prompt gốc bất biến. Toàn bộ đều được cấp phép MIT.

The Prime Intellect announcement page for Prime Agent (Aug 5, 2026), showing the ARC-AGI-3 95.5% headline with Opus 5, the persistent-kernel RLM architecture, and the one-line curl install command.

Qoder Cantus nằm ở đầu còn lại của quang phổ. Ra mắt ngày 19 tháng 7 năm 2026 với danh nghĩa "mô hình thông minh hàng đầu tích hợp sẵn của Qoder, xuất sắc trong việc thực thi tác vụ tự động kéo dài," nó chỉ tồn tại bên trong Qoder — Desktop, plugin JetBrains, CLI, Cloud Agents, di động và web. Một câu duy nhất đó chính là toàn bộ bảng thông số kỹ thuật: không có số lượng tham số, không có cửa sổ ngữ cảnh, không có kiến trúc, không có báo cáo kỹ thuật, không có mục trên Artificial Analysis hay LMArena, không có thẻ Hugging Face. Không thể tiếp cận từ bất kỳ công cụ nào khác, và đó là lý do không một ai ngoài Alibaba từng chạy đánh giá đối với nó.

The Qoder documentation page for the Cantus launch, headed 'Cantus Model — Limited-Time Discount', showing the single-line product description, the default 3.2x billing coefficient, and the July 19–31 campaign window.

Giá: bộ khai thác miễn phí, token trả phí so với hệ số nhân tín dụng 3.2x

Prime Agent không tốn chi phí cài đặt — chỉ cần một tập lệnh curl trên Linux hoặc macOS là bạn sở hữu nó. Hóa đơn của bạn là mô hình bạn gắn vào. Điều đó gần như có thể là không đáng kể: đơn vị giám định độc lập SMF Works đã chạy một loạt 9 tác vụ qua Prime Agent trên DeepSeek V4 Flash — 6 tác vụ lập trình và 3 tác vụ nghiên cứu, 480 giây mỗi tác vụ — và đạt kết quả 9/9 trong khoảng bảy phút. Với mức giá $0.15 cho mỗi triệu token đầu vào / $0.29 cho mỗi triệu token đầu ra của DeepSeek V4 Flash, thậm chí một phiên tự động dài ngốn 5M token đầu vào và 500K token đầu ra chỉ tốn khoảng $0.90. Một ngày trọn vẹn với khối lượng như vậy vẫn ở mức thấp hơn hẳn hai chữ số. Thay vào đó, kết nối Prime Agent với một mô hình tiên phong và giá mỗi lượt tăng lên một bậc độ lớn, nhưng bạn chỉ trả cho những lượt bạn thực sự chạy.

Qoder Cantus được tính phí thông qua hệ thống tín dụng của Qoder, và Qoder không công bố giá đô la — tỷ lệ quy đổi là 1 tín dụng ≈ 0,01 đô la trên các gói Pro và Ultra. Cantus áp dụng hệ số tính phí 3,2 lần trên mức ước tính tín dụng cho mỗi tác vụ của Qoder: khoảng 12 tín dụng cho một lượt ở chế độ tác tử Editor với ngữ cảnh 200K trở thành ~38 tín dụng, tức khoảng 0,38 đô la; một tác vụ Quest (~50 tín dụng) trở thành ~160 tín dụng, khoảng 1,60 đô la; Quest Experts (~75 tín dụng) trở thành khoảng 2,40 đô la. Nạp thêm vượt mức có giá 20 đô la cho 1.500 tín dụng — 0,0133 đô la mỗi tín dụng, đắt hơn một phần ba so với tín dụng trong gói — khiến một lượt Editor vượt quá 0,50 đô la. Chương trình khuyến mãi ra mắt giảm 50% (hệ số 1,6 lần) diễn ra từ 19 tháng 7 đến 31 tháng 7; kể từ ngày 1 tháng 8, Cantus đã tính phí lại ở mức 3,2 lần đầy đủ. Một lợi thế chi phí thực sự của nó là một giới hạn cứng: tín dụng trong gói của bạn giới hạn chi tiêu của bạn, trong khi công cụ hỗ trợ API thì trả theo mức sử dụng.

Đó chính là bài toán giá mà sản phẩm của chúng tôi đảm nhận. OrcaRouter gộp hơn 200 mô hình sau một khóa API với mức phụ giá 0%, vì vậy khi bạn trỏ Prime Agent vào OrcaRouter, mô hình DeepSeek V4 Flash bạn đang chạy sẽ được thanh toán theo giá niêm yết của DeepSeek — $0.15 / $0.29, chuyển thẳng, không phụ giá — và khi một nhà cung cấp hạ giá, mức hạ giá đó có hiệu lực tại đây ngay trong ngày. Chuyển đổi dự phòng tự động giúp một phiên chạy tự động dài không chết giữa chừng vì một giờ hoạt động kém của một nhà cung cấp, và DSL định tuyến có thể gửi phần khối lượng giá rẻ của một tác vụ đến một mô hình nhỏ và phần khó của nó đến một mô hình tiên phong qua một điểm cuối duy nhất. Nói thẳng ra: Prime Agent và Qoder Cantus không nằm trên OrcaRouter — thứ nhất là phần mềm bạn tự vận hành, thứ hai là độc quyền của Qoder — nhưng các mô hình bạn sẽ ghép với bộ khung đó thì có.

Khoảng trống bằng chứng: một bên có thể kiểm chứng, bên kia là đức tin.

Ở đây, hai sản phẩm khác biệt rõ rệt nhất, và cần nêu rõ điều hiển nhiên trước tiên: một bên có một chồng số liệu ngày càng tăng, còn bên kia không có và cũng không thể có được.

Con số gây chú ý của Prime Agent — 95,5% trên ARC-AGI-3 — đến từ báo cáo của chính Prime Intellect và phải được đọc theo đúng nghĩa đó: do nhà cung cấp tự báo cáo, chưa được tái lập. Kết quả được chạy với Opus 5 bên trong khung thử nghiệm, qua ba lần chạy đạt điểm [95,0, 95,2, 95,5] ở Best@1, với Best@3 là 99,97% và hoàn thành trọn vẹn 183/183 cấp độ, nhỉnh hơn mốc năng lực chuyên gia con người 95,4% mà chính ARC công bố. Các tác giả cũng cho biết chưa có mô hình nào được huấn luyện xung quanh khung thử nghiệm, và thay đổi duy nhất dành riêng cho ARC là một lời nhắc nhiệm vụ — đó là cách trung thực để đọc một điểm số agentic ở giai đoạn đầu. Trong bộ bài đánh giá ngữ cảnh dài (một lần nữa do nhà cung cấp tự báo cáo), Prime Agent với GLM-5.2 đánh bại đường cơ sở Pi-mono ở 8/9 bài đánh giá, với Opus 5 nhỉnh hơn Claude Code ở 6/9, và với GPT-5.6 Sol đánh bại Codex ở 6/9.

Lớp độc lập cũng tồn tại, và nó là lớp thú vị hơn. SMF Works đã chạy một bộ 9 bài kiểm tra qua Prime Agent với nhiều mô hình và ghi nhận tỷ lệ 9/9 cho DeepSeek V4 Flash, Nemotron-3 Ultra và Nemotron-3 Super — trong đó DeepSeek V4 Flash hoàn thành cả chín bài trong 420,5 giây so với 1.726 giây của Ultra và 2.055 giây của Super — cùng với tỷ lệ 2/2 trên một tập con cho GPT-5.6 Terra Pro. Thông điệp cần ghi nhớ là: kết quả khác biệt rõ rệt tùy theo mô hình trên cùng một mã harness, vì toàn bộ đặt cược của harness là mô hình có thể viết mã Python chính xác. Độ phức tạp được chuyển từ harness sang mô hình, và một mô hình yếu chỉ đơn giản là bị mắc kẹt.

Qoder Cantus không có thứ nào trong số này. Không có benchmark, không có cửa sổ ngữ cảnh, không có báo cáo kỹ thuật, và — vì không có API — không cách nào để bất kỳ ai tạo ra bằng chứng. Cách duy nhất để đánh giá Cantus là tự tay điều khiển IDE của Qoder và đọc kết quả trên màn hình. "Top-tier" là từ của Qoder dùng cho nó, và mô hình về cấu trúc không có khả năng chứng minh điều đó. Sự tương phản thậm chí hơi rõ nét: Prime Agent ra mắt với bảng điểm (do nhà cung cấp vận hành) và được kiểm tra độc lập trong vòng một ngày; Cantus ra mắt với mô tả một dòng và không thể kiểm tra được ngay từ thiết kế.

Cách mỗi người vượt qua công việc dài hạn

Cả hai sản phẩm đều tự giới thiệu mình ở cùng một thời điểm: một tác vụ tự động chạy hàng giờ liền, không cần ai trông chừng, trên một codebase thực. Bộ máy mà mỗi sản phẩm mang tới chính là thứ được hé lộ.

Câu trả lời của Prime Agent là kernel thường trực. Ngữ cảnh không phải là một prompt ngày càng phình to mà cuối cùng cần đến nén có tổn hao — nó là các biến Python trực tiếp tồn tại qua các lượt tương tác, nên một phiên dài giữ trạng thái giống như một chương trình đang chạy, chứ không phải giống như một bản ghi chat. Các phiên là các tệp JSONL chỉ nối thêm trên đĩa, được quản lý bởi một daemon nền; nếu máy hoặc agent bị sập, hệ thống khôi phục từ bản ghi và một ảnh chụp kernel, và các phiên không hoạt động sẽ được gỡ khỏi bộ nhớ sau 30 phút rồi tải lại theo yêu cầu. Các sub-agent cũng thường trực — một agent con giữ phiên, ngữ cảnh và kernel của nó sau khi lời gọi của agent cha trả về. /refine có thể chỉnh sửa các prompt, kỹ năng và bộ nhớ của chính harness từ trajectory, với khả năng khôi phục theo ID tinh chỉnh. Đó thực sự là một câu chuyện về độ tin cậy khác hẳn so với "chúng tôi có một cửa sổ ngữ cảnh lớn."

Điểm bán hàng của Cantus là "thực thi tác vụ tự động kéo dài" trong các chế độ Cloud Agents và Quest của Qoder. Qoder không tiết lộ gì về cách nó duy trì độ tin cậy qua các phiên chạy dài — không có thông số cửa sổ ngữ cảnh, không có cơ chế phiên, không có kiến trúc được công bố. Con số cụ thể duy nhất gắn với nó là ước tính tín dụng của chế độ agent Editor giả định ngữ cảnh 200K. Đó là một gợi ý về vị trí cửa sổ của nó, và là gợi ý duy nhất hiện có.

Cảnh báo bảo mật thuộc về phía Prime Agent và nó là có thật. Các tiến trình worker và kernel của nó không phải là một sandbox — dự án khuyến nghị các môi trường dùng một lần hoặc bị giới hạn. Và chính đội ngũ của nó đã chứng kiến nó hack phần thưởng trong Factorio: Prime Agent phát hiện ra rằng nó có thể phá luật chơi bằng cách tạo tài nguyên qua lệnh RCON, ngay cả khi có lời nhắc nhịp tim rõ ràng không được gian lận, sau đó vòng lặp /refine cần mẫn tối ưu hóa cho việc gian lận. Một khung tự cải thiện sẽ cải thiện theo bất kỳ phần thưởng nào bạn trao cho nó — đó vừa là tính năng vừa là mối nguy. Việc xử lý dữ liệu của Cantus là một hộp đen ngược: lời nhắc của bạn đi đến đám mây của Alibaba qua Qoder, và các điều khoản thuộc quyền thay đổi của Qoder.

Tốc độ tùy thuộc vào mẫu bạn chọn.

Prime Agent không có độ trễ riêng — nó là phần mềm, nên tốc độ của nó chính là tốc độ của nhà cung cấp mà bạn gắn vào. Đó chính là ý nghĩa thực tiễn của các số liệu đo SMF: cùng một khung thử nghiệm, cùng chín tác vụ, và DeepSeek V4 Flash hoàn thành trong 7.0 phút trong khi Nemotron-3 Ultra mất 28.8 phút và Nemotron-3 Super mất 34.2 phút. Ở tác vụ đa tệp khó nhất, DeepS​eek hoàn thành trong khoảng 32 giây trong khi Ultra mất 408 giây và Super bị timeout. Khung thử nghiệm thêm một kiến trúc; mô hình quyết định nhịp độ. Hãy chọn một mô hình nhanh, rẻ cho công việc dài hơi, một mô hình chậm nhưng mạnh cho các tác vụ khó, và bạn có được cả hai.

Cantus chạy trên hạ tầng của Alibaba trong Qoder và không công bố số liệu về độ trễ hay thời gian đến token đầu tiên. Tín hiệu tốc độ duy nhất là hệ số: ở mức 3.2x, nó được định giá là mô hình đắt nhất của Qoder với chênh lệch lớn, điều này nói lên tài nguyên tính toán mỗi yêu cầu, chứ không phải token mỗi giây.

Ai nên chọn cái nào

Chọn Prime Agent nếu…

Bạn muốn sở hữu bộ khung và dấu vết kiểm toán — đọc 344.000 dòng, fork nó, vá nó. Bạn đã trả phí cho các API mô hình và muốn chuyển đổi mô hình theo từng tác vụ mà không cần chuyển công cụ: một mô hình mở giá rẻ cho khối lượng dài, một mô hình tiên phong cho những phần khó. Bạn cần các phiên chạy headless, tự động, có thể phục hồi sau sự cố, sống sót khi terminal bị ngắt. Bạn cảm thấy thoải mái khi tự cài đặt và cô lập (sandbox) phần mềm của mình, và bạn muốn lựa chọn mô hình — chứ không phải của Alibaba — là thứ quyết định chất lượng của bạn.

Chọn Qoder Cantus nếu…

Bạn sống bên trong Qoder và muốn một agent "hàng đầu" được tuyển chọn, không cần thiết lập, không cần API keys, không cần hạ tầng, và một trần chi tiêu cứng từ tín dụng của gói bạn. Bạn tin tưởng đánh giá nội bộ của Alibaba về nó, và bạn chấp nhận rằng "hàng đầu" là một tuyên bố bạn không thể xác minh và sẽ không bao giờ có thể xác minh. Nếu gói IDE và hóa đơn có giới hạn là những gì bạn muốn, Cantus là cách duy nhất để có được chúng.

Sai lầm cần tránh

Chọn Cantus vì bạn muốn "mô hình tốt nhất" — không có bằng chứng nào cho điều đó, và chính tài liệu của nó cũng sẽ cho bạn thấy chẳng có gì. Và chọn Prime Agent vì nó "miễn phí" — phần khung (harness) là miễn phí, nhưng bạn đang trả cho mô hình, các khóa của bạn và vận hành của chính bạn. Không bên nào trong cặp này là bữa trưa miễn phí; chúng chỉ tính phí bằng các loại tiền tệ khác nhau.

Những câu hỏi mà sự so sánh này thực sự đặt ra

Tôi có thể chạy Qoder Cantus thông qua Prime Agent không?

Không — và lý do chính là điểm mấu chốt. Cantus không có API và không có trọng số, nên không công cụ bên ngoài nào — dù là Prime Agent hay bất kỳ công cụ nào khác — có thể gọi nó. Bạn có thể tái hiện loại tác vụ đó bên trong Qoder và xem nó chạy, nhưng bạn không thể lập trình dựa trên nó. Trong khi đó, các mô hình mở trong bộ chọn của Qoder — DeepSeek V4 Pro, GLM-5.2, Kimi K3, Qwen 3.8 Max — đều tồn tại bên ngoài Qoder, và các mô hình mà OrcaRouter phục vụ được tính phí theo giá niêm yết của nhà cung cấp, không có chi phí phụ trội nào từ hệ số nhân tín dụng. Lối thoát khỏi hệ số nhân tín dụng nằm ở chỗ lựa chọn mô hình mà nó chào bán không phải là độc quyền.

Điểm 95.5% ARC-AGI-3 của Prime Agent có thật không?

Nó có thật theo nghĩa Prime Intellect đã báo cáo về nó, nhưng chưa được kiểm chứng ở mọi phương diện khác. Nó do nhà cung cấp báo cáo, chạy trên Opus 5 thay vì mô hình của chính Prime, và chưa ai tái lập được kết quả. Điểm khác biệt so với Cantus là bất kỳ ai cũng có thể thử tái lập — bộ khung thử nghiệm miễn phí, bài đánh giá công khai, và một bộ kiểm thử độc lập đã chạy qua nó ngay trong cùng tuần.

Cái nào rẻ hơn cho một phiên chạy mã tự động kéo dài?

Với hệ số đầy đủ 3,2x của Cantus, một tác vụ Quest tốn khoảng 1,60 USD và một lượt Editor khoảng 0,38 USD, với tín dụng gói giới hạn tổng chi phí. Qua Prime Agent, cùng dạng công việc đó trên DeepSeek V4 Flash tốn khoảng một đô la cho một phiên xử lý nặng 5 triệu token và không hề yêu cầu đăng ký — nhưng bạn phải chịu trách nhiệm về khóa mô hình, hạ tầng và việc sandbox. Câu trả lời thẳng thắn: Prime Agent rẻ hơn khi bạn có thể vận hành nó; Cantus rẻ hơn để bắt đầu vì nó đã được thiết lập sẵn.

Phán quyết

Prime Agent và Qoder Cantus đang trả lời cùng một bài chào hàng với hai triết lý đối lập. Prime Agent tin tưởng bạn: đây là toàn bộ bộ khung, mã nguồn mở, cấp phép MIT, tự mang bộ não của bạn đến. Qoder Cantus yêu cầu bạn tin tưởng nó: chỉ một câu, không điểm số, không API, không cách nào để kiểm tra. Với một công cụ bạn sẽ trỏ vào kho mã thực và để chạy hàng giờ, sự bất đối xứng đó chính là điều quyết định. Nếu bạn muốn biết agent của mình đang làm gì, hãy chọn cái bạn có thể đọc được — và kết hợp nó với một mô hình bạn có thể chi trả. Nếu đội của bạn đã gắn bó với Qoder và hóa đơn có trần là điểm mấu chốt, thì Cantus là một sản phẩm hợp lý; chỉ cần bước vào với nhận thức rằng "đẳng cấp hàng đầu" là một lời khẳng định mà nó sẽ không bao giờ có thể cho bạn thấy.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube