Một thẻ tiêu đề hero cho Apodex 1.1 với tiêu đề 'Apodex 1.1' và phụ đề '44 trên Chỉ số Trí tuệ - sức mạnh tác nhân, độ dài văn bản lớn và khả năng tiếp thu kiến thức', các huy hiệu dạng viên thuốc ghi 'AA Index 44', '#11/177', 'ngữ cảnh 256K', và dòng chân trang 'Phát hành ngày 24 tháng 8 năm 2026 - mô hình Apodex đầu tiên trên Artificial Analysis', với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Apodex 1.1, được giải thích: điểm 44 trên Chỉ số Thông minh, sức mạnh tác nhân thực sự — và một điểm hạn chế về độ tin cậy kiến thức

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Apodex 1.1 mới ra mắt được một tuần, là mô hình độc quyền, và cho đến tuần này nó chủ yếu chỉ là một thứ gây tò mò trong phòng thí nghiệm. Sau đó, Artificial Analysis công bố bài đánh giá độc lập đầu tiên về mô hình này — cũng là lần đầu tiên Apodex xuất hiện trên nền tảng — và bảng xếp hạng đã cho thấy một điều bất thường: Apodex 1.1 đạt 44 điểm trên Chỉ số Trí tuệ Artificial Analysis, xếp hạng 11/177, đồng thời ghi nhận điểm số tác nhân (agentic-work) vượt qua mọi mô hình cùng phân khúc trí tuệ, bao gồm DeepSeek V4 Pro, Qwen3.7 MaxKimi K2.6. Cùng báo cáo đó cũng đưa ra một con số thứ hai, kém ấn tượng hơn nhiều: thành tích về độ tin cậy tri thức yếu đến mức đủ để thay đổi quyết định về việc có chạy khối lượng công việc thực tế trên mô hình này hay không. Phiên bản anh em mã nguồn mở, Apodex 1.1 Mini, mới là mô hình mà hầu hết mọi người thực sự có thể chạy được. Dưới đây là những gì bản đánh giá nói, những gì nó không nói, và ai nên quan tâm.

Apodex, công ty AI do Chen Tianqiao sáng lập, đã ra mắt dòng sản phẩm vào ngày 24 tháng 8 năm 2026, cùng với một bài báo arXiv với 70 tác giả, "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). Sản phẩm chủ lực là mã nguồn đóng — khoảng 397B tham số, theo báo cáo của nhà cung cấp — được xây dựng dựa trên luận điểm rằng nút thắt thực sự của các tác nhân không phải là trí thông minh thô mà là môi trường chúng thực thi trong đó. Vì vậy, Apodex 1.1 được huấn luyện để làm việc trực tiếp với tệp tin, tìm kiếm và viết mã trong các khoảng thời gian dài, với một khung thực thi dùng chung ("AgentOS") điều phối tối đa 150 tác nhân con song song và lưu giữ hồ sơ nguồn gốc của từng bước. Phần mã nguồn mở là phiên bản anh em: Apodex 1.1 Mini, một MoE hạng 35B được tinh chỉnh từ Qwen3.5-35B-A3B của Alibaba, được phát hành theo giấy phép Apache-2.0 kèm theo một khung tác nhân đồng hành có tên là FrontierAgent. Mô hình đầy đủ chỉ đến tay bạn qua API và workbench trực tuyến của riêng Apodex; còn bản Mini thì hoặc tự lưu trữ, hoặc không có gì.

Điểm 44 trong Chỉ số Trí tuệ có ý nghĩa gì

Chỉ số Trí tuệ Artificial Analysis là một tổng hợp có trọng số của bộ điểm chuẩn của nền tảng — bao gồm các bài đánh giá tác nhân như GDPval-AA v2 và Terminal-Bench, cùng với các thành phần suy luận, toán học và kiến thức. Điểm 44 đưa Apodex 1.1 lên vị trí #11 trong số 177 mô hình, vượt xa mức trung vị 18. Điều này cũng xếp mô hình vào một phân khúc đông đúc và thú vị: Kimi K2.6 (45), MiniMax-M3 (45) và Inkling (42) đều chỉ chênh nhau ba điểm, và Apodex 1.1 là mô hình duy nhất trong nhóm mà một tuần trước hầu hết người dùng AI vẫn chưa biết đến tên. Artificial Analysis lưu ý rằng trang này đề cập đến phiên bản suy luận của mô hình và một biến thể không suy luận cũng có thể tồn tại.

A single-column scoreboard for Apodex 1.1 titled 'Apodex 1.1 - the scoreboard' listing AA Intelligence Index 44 (#11 of 177), GDPval-AA v2 Elo 1348, TerminalBench v2.1 70%, Output tokens per task ~17,000, Full Index evaluation cost 18.41, and AA-Omniscience -21.9 (78% hallucination), with a footer 'All figures per Artificial Analysis, August 2026.' and the OrcaRouter logo in the bottom-right corner.

Chỉ số điểm tổng quan không phải là nơi mô hình này trở nên thú vị. Nó thú vị bởi vì vị trí của những điểm mạnh và điểm yếu của nó so với điểm số đó — và đó chính là điều mà so sánh theo cấp bậc làm rõ ràng.

Nơi nó vượt trên đẳng cấp của mình: các bài đánh giá tác nhân AI và công việc tri thức

Trên hai thành phần Index đo lường công việc tác nhân trong thế giới thực, Apodex 1.1 hoạt động vượt trội so với các mô hình cùng nhóm 44 điểm. Trên GDPval-AA v2 — một chuẩn đánh giá chấm điểm khả năng của tác nhân trong việc hoàn thành trọn vẹn các tác vụ văn phòng thực tế — Apodex 1.1 đạt Elo 1348, vượt qua DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) và Kimi K2.6 (1202). Trên TerminalBench v2.1, chuẩn kiểm tra tác nhân làm việc trên terminal, nó đạt 70%, vượt qua Kimi K2.6 (66%) và chỉ xếp sau Qwen3.7 Max (75%). Đây là những con số độc lập do Artificial Analysis vận hành, và là bằng chứng mạnh nhất trong báo cáo cho thấy phương pháp huấn luyện ưu tiên môi trường thực sự hiệu quả.

Các tuyên bố điểm chuẩn của chính nhà cung cấp còn đi xa hơn nữa, và nên được xem là số liệu do nhà cung cấp tự báo cáo cho đến khi có ai đó tái lập được chúng: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% với công cụ, DeepSearchQA 92.4%, FrontierFinance 54.3, và FrontierScience-Research 63.3. Điều khiến hồ sơ năng lực tác nhân trở nên đáng tin cậy thay vì chỉ là thổi phồng chính là kiến trúc đằng sau nó: mở rộng môi trường (mở rộng tính đa dạng của các môi trường tệp thực thi, tìm kiếm và mã được dùng trong huấn luyện) và mở rộng phối hợp tác nhân (huấn luyện mô hình phân rã các tác vụ tầm xa, ủy quyền công việc song song, tích hợp các kết quả bất đồng bộ và lập lại kế hoạch). Chế độ "Agent Team" sinh ra tối đa 150 tác nhân con cho các tác vụ truy xuất và tổng hợp, cùng với bước xác minh tích hợp sẵn ("Statement Review") kiểm tra các kết luận trước khi chúng được đưa ra. Nói cách khác: đây là một mô hình được thiết kế để sai, tự kiểm tra và sửa chữa — chứ không phải để đọc lại các dữ kiện từ trí nhớ.

Cái giá tiềm ẩn của tất cả quyền tự chủ đó: sự dài dòng

Thiết kế đó xuất hiện trên bảng chi phí-hiệu quả của Artificial Analysis như điểm yếu rõ ràng nhất của mô hình sau kiến thức: nó rất dài dòng. Việc chạy toàn bộ Intelligence Index tiêu thụ 180 triệu token đầu ra — so với mức trung vị 67 triệu — và khoảng 17.000 token đầu ra cho mỗi tác vụ benchmark, so với khoảng 9.400 đối với Qwen3.7 Max và 8.100 đối với MiniMax-M3. Tổng cộng, toàn bộ đợt đánh giá tiêu tốn 618,41 USD chi phí API, theo Artificial Analysis.

A screenshot of the Artificial Analysis model page for Apodex 1.1 (captured August 31, 2026), showing 'Apodex 1.1 scores 44 on the Artificial Analysis Intelligence Index' with a median of 18, the note that it generated 180M tokens versus a 67M median, pricing of $0.30 per 1M input and $3.00 per 1M output tokens, and the $618.41 total cost to evaluate the model on the Intelligence Index.

Mức giá tạo ra hóa đơn đó: $0,30 cho mỗi triệu token đầu vào và $3,00 cho mỗi triệu token đầu ra — giá truy cập bộ nhớ đệm là $0,03 cho đầu vào đã lưu trong bộ nhớ đệm, giảm 90% — kết hợp lại thành khoảng $0,38 cho mỗi triệu token với tỷ lệ 7:2:1 điển hình giữa cache/đầu vào/đầu ra. Cả hai mức giá trên mỗi token đều cao hơn mức trung vị của nền tảng ($0,25 đầu vào, $0,90 đầu ra). Tuy nhiên, ước tính chi phí trên mỗi tác vụ của Artificial Analysis vẫn đưa Apodex 1.1 vào mức khoảng $0,05 cho mỗi tác vụ benchmark, rẻ hơn Qwen3.7 Max (~$0,07) và Kimi K2.6 (~$0,06). Việc đối chiếu này rất quan trọng cho ngân sách: token của nó đủ rẻ để ngay cả khi dài dòng nhiều vẫn cạnh tranh được trên mỗi tác vụ — rủi ro chi phí nằm ở khối lượng, chứ không phải ở mức giá. Nếu bạn đặt một agent chạy lâu dài trên đó, hóa đơn sẽ bị chi phối bởi mức độ nói nhiều của nó, và nó nói rất nhiều.

Một lưu ý về giá trước khi bạn lập ngân sách: $0.30/$3.00 là bảng giá của chính nhà cung cấp. Một nền tảng định tuyến chuyển tiếp giá niêm yết của nhà cung cấp với mức tăng giá 0% sẽ tính chính xác con số đó, và mọi đợt giảm giá của Apodex trong tương lai sẽ hiển thị ngay trong ngày công bố.

Điều bất lợi: một thành tích kém về độ tin cậy kiến thức.

Đây là {{1}}con số mà các bài truyền thông về buổi ra mắt hầu như bỏ qua{{/1}}. Trên AA-Omniscience, công cụ đánh giá độ tin cậy tri thức của Artificial Analysis, Apodex 1.1 đạt -21,9 điểm. Mô hình này trả lời 87% số câu hỏi thay vì từ chối, {{2}}nhưng chỉ đúng 32%{{/2}}, và tỷ lệ ảo giác là 78,4%. {{3}}Với một mô hình được định vị như một bộ giải hạng nặng, đó là một sự phân tách nghiêm trọng: mạnh về thực thi tác tử, yếu về tri thức có căn cứ.{{/3}}

Hai sự thật này có liên quan với nhau, không hề mâu thuẫn. Các benchmark tác nhân khen thưởng việc hành động trong một môi trường — gọi công cụ, lặp lại, phục hồi — nên một mô hình có thể đạt điểm cao ở đó trong khi khả năng hồi tưởng kém, vì môi trường đảm nhận việc ghi nhớ. Thiết kế thậm chí còn giả định điều đó: Statement Review tồn tại để kiểm tra đầu ra, và workbench được xây dựng quanh việc xác minh, chứ không phải quanh việc mô hình nhớ đúng từ bộ nhớ. Cách hiểu thực dụng rất thẳng thừng: đừng đặt Apodex 1.1 vào các tác vụ phụ thuộc vào việc nó truy xuất dữ liệu từ chính trọng số của mình. Hãy đặt nó vào các tác vụ tầm xa, nơi công việc của nó có thể được đối chiếu với tệp, mã nguồn và nguồn tài liệu — và hãy xác minh kết quả bàn giao.

Người anh em mã nguồn mở: Apodex 1.1 Mini và FrontierAgent

Nếu cánh cửa đóng kín của mô hình chủ lực là vấn đề, thì nửa cánh mở của gia đình chính là đối trọng. Apodex 1.1 Mini là một mô hình MoE ~35B tổng / ~3B kích hoạt, được tinh chỉnh từ Qwen3.5-35B-A3B (mô hình gốc do Alibaba mở mã nguồn vào tháng 2 năm 2026), phát hành theo giấy phép Apache-2.0 với cửa sổ ngữ cảnh 262K cùng các biến thể FP8, FP4 và GPTQ-Int4 trên Hugging Face. Điểm số chính do nhà cung cấp công bố là 50.2 trên FrontierFinance (đứng đầu trong bảng so sánh riêng của Apodex) và 27.7 trên APEX-Agents khi bật harness Agent Team. Và FrontierAgent — bộ runtime mã nguồn mở đi kèm — thực sự là thành phần thú vị: một harness chạy trên terminal với các chế độ ReAct và Agent Team, làm việc với tệp trong môi trường sandbox, cổng phê duyệt, checkpoint và trace, tất cả đều kết nối với mọi endpoint tương thích OpenAI.

Hai điều đáng biết trước khi bạn tự triển khai. {{1}}Đầu tiên, Mini là một mô hình fine-tune, không phải mô hình tiên phong — hãy đọc các con số benchmark của nó giống như cách bạn đọc bảng số liệu do nhà cung cấp công bố cho mô hình chủ lực: những so sánh không được tái lập, có kèm bộ khung đánh giá, do nhà cung cấp lựa chọn.{{/1}} {{2}}Thứ hai, hành vi của nó kế thừa từ mô hình gốc: nếu bạn muốn kiểm tra liệu mô hình nền tảng Qwen3.5-35B-A3B đã làm được tác vụ của bạn hay chưa, bạn không cần GPU và bộ công cụ phục vụ để tìm ra — mô hình gốc chỉ cách một lệnh gọi API.{{/2}}

Ai nên sử dụng Apodex 1.1 ngay hôm nay

Phiên bản flagship hiện chỉ ở giai đoạn đầu, đóng, và chỉ có trên API và bàn làm việc trực tuyến của riêng nhà cung cấp; Apodex cho biết khả năng sử dụng API rộng rãi hơn sẽ đến qua các nền tảng lớn, nhưng trọng số (weights) không được mở. Điều đó giới hạn những ai có thể hành động dựa trên bảng xếp hạng tuần này: các đội đã có mặt trên bàn làm việc của Apodex, hoặc sẵn sàng đăng ký khóa API của bên thứ nhất. Bản Mini là con đường dễ tiếp cận hơn, nhưng có nghĩa là phải tự lưu trữ (self-hosting).

A screenshot of the Apodex online workbench homepage (captured August 31, 2026), showing the deep-research interface with the prompt field 'Ask the question that matters', feature points for a step-level reasoning trace, citations in every report, branching off any report, and full-text search across threads, and a sign-in prompt for saving inquiries.

Nơi mô hình thực sự xứng đáng với vị trí của mình: các pipeline tác tử tầm xa, nơi đầu ra được xác minh ở hạ nguồn — bàn làm việc nghiên cứu, các tác vụ đa bước trên tệp và công cụ, công việc trên terminal — và nơi mức chi phí ~0,05 USD mỗi tác vụ vẫn trụ được bất chấp độ dài dòng. Nơi nó chưa thuộc về: bất cứ thứ gì phụ thuộc vào việc kiến thức của chính mô hình có đáng tin cậy hay không, hoặc một đường vận hành sản xuất không thể chấp nhận một mô hình mới bảy ngày tuổi chưa được kiểm chứng hành xử sai lệch. Với chính tình huống đó, một lớp định tuyến chính là lớp bọc phù hợp.Một API cho hơn 200 mô hình nghĩa là mô hình cơ bản Qwen3.5-35B-A3B đã có thể được gọi ở mức giá niêm yết, một Mini tự lưu trữ có thể nằm sau cùng một bộ định tuyến với khả năng tự động chuyển đổi dự phòng, và một mô hình mới không ổn định không thể kéo sập một đường vận hành sản xuất — khi nó hoạt động kém, yêu cầu sẽ được chuyển sang một nhà cung cấp khỏe mạnh.

Xem gì tiếp theo

Đánh giá này là bước đọc đầu tiên, không phải là phán quyết. Ba điều sẽ quyết định liệu Apodex 1.1 có còn quan trọng sau một tháng nữa hay không: việc tái tạo độc lập các tuyên bố về năng lực tác tử của nhà cung cấp (các con số GDPval và TerminalBench do Artificial Analysis vận hành là những con số duy nhất không phải do chính Apodex tạo ra); liệu khoảng cách về độ tin cậy tri thức có thu hẹp trong một phiên bản không suy luận hoặc bản phát hành kế tiếp hay không; và liệu mô hình có xuất hiện trên nhiều API và nhiều bảng xếp hạng độc lập hơn hay không, lúc đó con số 44 và -21.9 sẽ trở thành bài toán của người khác phải vượt qua. Đối với một mô hình mới chỉ bảy ngày tuổi với kiểu hồ sơ phân hóa như thế này, đó gần như là điều tối đa bạn có thể kỳ vọng: một lợi thế tác tử thực sự, một mức giá trung thực, và một điểm yếu bạn biết trước khi đăng ký.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày