Một thẻ tiêu đề hero cho UI-Mate-27B, tác nhân GUI nền tảng trọng số mở của Tencent ra mắt ngày 14 tháng 8 năm 2026, hiển thị màn hình máy tính để bàn với con trỏ chuột và các mũi tên tự động hóa, phụ đề 'Open-Weight Foundation GUI Agent', các chip nhãn 'Apache-2.0', '27B params', 'vLLM sẵn sàng', và logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Tencent UI-Mate-27B: Tác nhân GUI trọng số mở thầm lặng giành vị trí dẫn đầu tại WindowsAgentArena

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 14 tháng 8 năm 2026, nhóm HY Frontier Multimodal Agent của Tencent đã đẩy ba checkpoint lên Hugging Face dưới tổ chức tencent/ — gồm UI-Mate-27B, bản UI-Mate-9B nhỏ hơn, và UI-Mate-democua-27B được hướng dẫn bằng bản demo. Bốn ngày sau vẫn chưa có bất kỳ thông báo nào ở đâu: không bài đăng ra mắt, không thông cáo báo chí, không dòng tweet về sản phẩm. Điều được phát hành thay vào đó lại hoàn chỉnh một cách bất thường so với một bản phát hàng thầm lặng: một trang dự án, một kho GitHub kèm bộ khung hoạt động, và một bài báo arXiv được đệ trình hai ngày trước, trong đó gọi mô hình lớn hơn là một tiêu chuẩn mới mã nguồn mở với trọng số mở trong lĩnh vực điều khiển GUI trên máy tính để bàn.

Toàn bộ nội dung trong bài này đều dựa trên các model cards, repo GitHub, trang dự án và bài báo nói trên — chưa có gì được tái tạo độc lập. Các checkpoint hiện có 0 lượt tải trên Hugging Face tính đến thời điểm viết bài, nghĩa là chúng tôi có thể nằm trong số những người đầu tiên bên ngoài Tencent chịu khó xem xét chúng một cách nghiêm túc trên giấy tờ. Đây là những gì thực sự có thể biết được từ các repo, và những gì vẫn chưa được xác nhận cho đến khi có người khác chạy thử.

Mục lục

Những gì đã phát hành, và những gì chưa được công bố

• UI-Mate-27B thực sự là gì

• Tính năng khác biệt: thực thi theo hướng dẫn trình diễn

• Các con số — tất cả đều do nhà cung cấp báo cáo

• Nơi những con số đó sẽ nằm — nếu chúng giữ được

Cách chạy nó

• Ngăn xếp xung quanh một tác nhân GUI mới

• Xem gì tiếp theo

• Câu hỏi thường gặp

Những gì đã phát hành và những gì chưa được công bố

Tencent đã phát hành UI-Mate-27B (27 tỷ tham số, Apache-2.0, safetensors ở định dạng BF16) vào ngày 14 tháng 8 năm 2026, cùng với phiên bản 9B và checkpoint định hướng demo UI-Mate-democua-27B. Hai checkpoint 27B được xây dựng trên Qwen3.6-27B — bản thân là một mô hình đa phương thức Apache-2.0 được phát hành vào tháng 4 năm 2026 — nghĩa là toàn bộ stack, từ mô hình nền tảng đến mô hình tinh chỉnh, đều có thể sử dụng cho mục đích thương mại. Các kho lưu trữ mang dấu thời gian sửa đổi lần cuối từ tuần này — checkpoint định hướng demo được cập nhật gần đây nhất là hôm nay — vì vậy Tencent đã tích cực phát triển chúng.

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

Những gì đã được công khai cho đến nay:

• Các bộ trọng số UI-Mate-27B, UI-Mate-9B và UI-Mate-democua-27B trên Hugging Face, mỗi bộ đều có thẻ mô hình, bảng đánh giá và công thức phục vụ.

• Một trang dự án tại ui-mate.github.io với video demo, hướng dẫn sử dụng, và ứng dụng macOS Apple Silicon (DMG v0.2.4).

• Kho lưu trữ GitHub (github.com/Tencent/UI-Mate) chứa prompt chính thức, bộ phân tích phản hồi và khung tương tác — thẻ mô hình nêu rõ rằng đây là "một agent checkpoint thay vì một mô hình chat trực quan độc lập" và khung này được khuyến nghị cho mọi ứng dụng thực tế.

• Một bản in trước arXiv (2608.15930), được đệ trình vào ngày 16 tháng 8, có tựa đề “UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations.”

{{1}}Điều chưa được công khai:{{/1}} {{2}}bản thân Tencent chưa hề lên tiếng{{/2}} — {{3}}đây mới chỉ là bản phát hành repo, không phải một sự ra mắt chính thức{{/3}}. {{4}}Biến thể dẫn dắt bằng minh họa{{/4}} {{5}}mà trang dự án từng liệt kê là chưa công khai{{/5}} {{6}}giờ đã có trọng số khả dụng trên Hugging Face:{{/6}} {{7}}kho tencent/UI-Mate-democua-27B{{/7}}, {{8}}được tạo trong cùng đợt push ngày 14 tháng 8{{/8}}, {{9}}được gắn thẻ tường minh là checkpoint dẫn dắt bằng minh họa của dòng mô hình{{/9}} — {{10}}một mô hình riêng biệt, không phải bản đổi thương hiệu của mô hình 27B{{/10}}. {{11}}Vẫn chưa có API nào được lưu trữ ở bất kỳ đâu{{/11}}. {{12}}Điều đó rất quan trọng:{{/12}} {{13}}cách duy nhất để chạy UI-Mate hiện nay{{/13}} {{14}}là tải trọng số về và tự mình phục vụ chúng{{/14}}.

UI-Mate-27B thực chất là gì

UI-Mate-27B là một tác nhân GUI nền tảng cho "công việc dài hạn xuyên suốt các ứng dụng và hệ điều hành". Nó quan sát ảnh chụp màn hình trực tiếp, suy luận dựa trên trạng thái hiển thị và xuất ra các hành động bàn phím và chuột có cấu trúc để tương tác với màn hình nền gốc. Quá trình huấn luyện là tinh chỉnh có giám sát, tiếp theo là học tăng cường trực tuyến trong các môi trường GUI có thể thực thi — mô hình đã học bằng cách thực sự điều khiển các màn hình nền, chứ không chỉ từ các ảnh chụp màn hình tĩnh.

Không gian hành động là phần mà các nhà phát triển sẽ quan tâm: chuột, bàn phím, cuộn trang, chờ đợi, tương tác người dùng và hoàn thành tác vụ, với các đầu ra tương thích với pyautogui. Mô hình suy luận trong không gian tọa độ chuẩn hóa 1000×1000 và agent tham chiếu chia tỷ lệ lại các dự đoán của nó về độ phân giải màn hình thực tế, vì vậy các hành động vẫn hoạt động chính xác khi có sự khác biệt về tỷ lệ hiển thị giữa các máy. README của chính mô hình khuyến nghị phục vụ nó với vLLM phía sau một endpoint tương thích OpenAI.

Tính năng khác biệt: thực thi theo hướng dẫn minh họa

Hầu hết các tác tử GUI chỉ nhận một đầu vào: một chỉ dẫn. UI-Mate nhận thêm một đầu vào thứ hai thực sự hiếm thấy trong một checkpoint mở — một bản trình diễn. "Hãy trình bày quy trình một lần. Để tác tử tự thích ứng với nhiệm vụ hiện tại," như trang dự án mô tả.

Cơ chế này không phải là video trong ngữ cảnh hay một kịch bản hành động cố định. Một bản trình diễn ghi lại ảnh chụp màn hình ngay trước và sau mỗi hành động bàn phím hoặc con trỏ, sau đó đường ống xử lý chuẩn hóa chuỗi thao tác thành một biểu diễn hành động-khung hình nhất quán, chú thích nó bằng các quan sát, ý định, hành động và bằng chứng xác minh, đồng thời phân đoạn nó thành các nhiệm vụ con được đặt tên kèm tiêu chí hoàn thành. Tại thời điểm suy luận, nó trở thành một quy trình gọn nhẹ được chèn vào cho nhiệm vụ con đang hoạt động — nhưng ảnh chụp màn hình trực tiếp vẫn giữ vai trò quyết định trong suốt quá trình, vì vậy khi trạng thái ứng dụng khác với bản trình diễn, mô hình sẽ lên kế hoạch lại thay vì phát lại.

Tencent đã biến checkpoint đằng sau quy trình này thành mô hình công khai của riêng mình: thẻ UI-Mate-democua-27B ghép cặp kết quả khi chỉ có chỉ dẫn với kết quả khi có một bản minh họa trên cùng các bộ đánh giá, và lược đồ công cụ của nó bổ sung hành động subtask_complete — cơ chế đằng sau các subtask được nêu tên đó. Trên tập con self-demo của OSWorkerBench, một bản minh họa nâng tỷ lệ thành công nghiêm ngặt từ 17.17 lên 35.35 và tiến độ từ 67.85 lên 81.14; trên tập con OSWorld, tiến độ tăng từ 40.27 lên 65.75; trên bộ đánh giá GameDev, điểm trung bình tăng từ 76.76 lên 81.15 trong khi độ dài quỹ đạo trung bình giảm từ 303.6 xuống 253.1 bước — bản minh họa vừa rút ngắn tác vụ vừa cải thiện nó. Thẻ báo cáo rằng bản minh họa đã cải thiện 28 trong số 33 tác vụ self-demo và giải quyết được bốn tác vụ mà khi không có hướng dẫn sẽ đạt điểm 0. Điểm hạn chế cũng chính là điều xuyên suốt toàn bài viết này: đây là các bộ đánh giá ghép cặp do chính nhóm thực hiện, được tính trung bình từ ba đến năm lần chạy, và chưa ai tái lập được chúng.

Các con số — tất cả đều do nhà cung cấp báo cáo

Thực thi chỉ dựa trên hướng dẫn, trực tiếp từ thẻ mô hình:

• Điểm trung bình OSWorld-Verified — 77.0

• Điểm trung bình của WindowsAgentArena — 66.2

• OSWorkerBench thành công nghiêm ngặt — 41.00

• Tiến độ OSWorkerBench — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

Bản thân OSWorkerBench là một trong ba đóng góp trong bài báo: một chuẩn đánh giá mới gồm 100 tác vụ văn phòng dài hạn trên 41 ứng dụng, với 33 tập con tự demo và 45 tập con demo biến thể. Đây là một phép đánh giá mới, nên không có công trình nào trước đó để so sánh hai điểm số này với nhau. So với mô hình nền của chính nó, UI-Mate-27B được cho là vượt Qwen3.6-27B 17,7 điểm về thành công tuyệt đối và 24,5 điểm về tiến triển trên OSWorkerBench — con số so sánh công bằng nhất trong toàn bộ bản phát hành, vì cả hai mô hình đều chạy trên cùng một hệ thống đánh giá.

Mọi con số phía trên đều là đánh giá của chính nhóm thực hiện. Chưa có điểm số độc lập nào, chưa có lần chạy lại nào từ bên thứ ba, và với số lượt tải về bằng không, cũng chưa có sự tái hiện nào từ cộng đồng. Hãy coi mọi con số ở đây là một tuyên bố, không phải một sự thật.

Nơi những con số đó sẽ nằm — nếu chúng giữ vững

WindowsAgentArena chính là thứ sẽ tạo nên một tiêu đề thực sự. Các kết quả WAA được công bố công khai tốt nhất hồi đầu năm 2026 dao động quanh mức 61.0 (một hệ thống mô-đun tên là VLAA-GUI, tháng 4/2026); EvoCUA-32B trọng số mở từ Meituan đạt 56.5, còn UI-TARS-2 đóng của ByteDance nằm ở mức thấp đến trung bình của thập niên 50 trên cùng bảng xếp hạng. Mức 66.2 trên bản đánh giá của chính UI-Mate-27B sẽ đưa nó lên trên mọi thứ đã được công bố trên benchmark này trong năm nay — dù mở hay đóng. Đó là một tuyên bố mạnh mẽ, và nó cần được chạy lại một cách độc lập.

OSWorld-Verified ở mức 77.0 là con số mạnh nhưng chưa phải kỷ lục trọng số mở mới trên bảng xếp hạng công khai. Trên bản chụp bảng xếp hạng OSWorld-Verified từ đầu tháng 8 năm 2026, mô hình trọng số mở Holo3-35B-A3B được liệt kê ở mức 82.6, với một số mô hình đóng tiên phong xếp trên nó (Qwen3.8 Max ở 86.1, Claude Mythos 5 và Claude Fable 5 ở 85.0, Claude Opus 4.8 ở 83.4). Do đó, cách diễn đạt "state of the art" của bài báo chỉ là tuyên bố về thiết lập đánh giá của riêng họ, chứ không phải sự thật đã được xác lập — các bộ khung đánh giá khác nhau, bộ phân tích hành động khác nhau và sai lệch tự báo cáo đều khiến mức 77.0 so với 82.6 trở thành câu hỏi chỉ có lần chạy lại độc lập mới giải đáp được. Để bối cảnh hóa ý nghĩa của việc một mô hình mở 27B đạt 77.0: nó sẽ nằm trên đường cơ sở chuyên gia ~72.4 và trên một số hệ thống tiên phong lớn hơn trên cùng bảng đó, bao gồm Claude Opus 4.6 ở 72.7 và Kimi K2.6 ở 73.1.

Tencent không phải là người mới trong lĩnh vực này — họ đã phát hành POINTS-GUI-G, một mô hình GUI-grounding 8B, vào tháng 2 năm 2026, ra mắt trợ lý Marvis OS vào tháng 5, và đóng góp cho dự án computer-use GUICrafter vào tháng 6. UI-Mate là một dòng sản phẩm riêng biệt nhắm đến việc điều khiển máy tính để bàn toàn diện, và là GUI agent đầu tiên của Tencent được phát hành dưới dạng mô hình nền tảng mở thay vì một thành phần grounding hay một sản phẩm.

Cách chạy nó

Mô hình được thiết kế cho vLLM và thẻ mô hình đưa ra lệnh chính xác — vllm serve tencent/UI-Mate-27B với tensor-parallel size 2 và chat template tương thích OpenAI. Một chi tiết thực tế nổi bật: tác nhân mặc định giữ năm ảnh chụp màn hình trong ngữ cảnh, vì vậy máy chủ phải chấp nhận ít nhất sáu ảnh cho mỗi prompt, bởi ảnh chụp mới nhất đến trước khi ảnh cũ nhất bị thu gọn. Cờ được khuyến nghị là --limit-mm-per-prompt với sáu ảnh và không có video. Checkpoint định hướng bằng minh họa được phục vụ theo cùng cách — thẻ của nó nêu tên vLLM và SGLang phía sau một endpoint tương thích OpenAI.

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

Khi được phục vụ, một lớp agent Python (UIMateAgent) sẽ nhận một ảnh chụp màn hình và một chỉ dẫn, sau đó trả về phản hồi cùng các hành động có cấu trúc, đồng thời co giãn lại tọa độ 1000×1000 về đúng độ phân giải của bạn. Trang dự án cũng cung cấp ứng dụng macOS Apple Silicon cho chế độ hướng dẫn bằng trình diễn, đây là cách dễ nhất để thử quy trình "show it once" mà không cần tự xây dựng bộ khung. Toàn bộ được cấp phép theo Apache-2.0, vì vậy việc sử dụng cục bộ, tinh chỉnh và tích hợp thương mại đều được phép.

Hai cảnh báo cần được đặt bên cạnh bất kỳ hướng dẫn "cách chạy" nào dành cho agent sử dụng máy tính, và cả hai đều đến từ chính thẻ mô hình. Hãy sử dụng môi trường cô lập hoặc dùng một lần. Yêu cầu xác nhận của con người trước bất kỳ hành động nhạy cảm nào, giám sát toàn bộ quá trình thao tác, và đừng coi báo cáo thành công từ mô hình là bằng chứng rằng kết quả dự kiến thực sự đã xảy ra. Agent giao diện đồ họa có thể bấm nhầm, và việc chèn lệnh độc hại qua nội dung hiển thị trên màn hình là một mô hình mối đe dọa thực tế, không phải là giả thuyết.

Bộ công nghệ cho một tác nhân GUI mới

Chưa có checkpoint nào của UI-Mate trên OrcaRouter — dòng model này mới ra đời vài ngày, chưa có lượt tải nào, và model nền Qwen3.6-27B cũng chưa có. Không có API nào được lưu trữ sẵn, vì vậy nếu bạn muốn chạy một model trong tuần này, bạn phải tự phục vụ vLLM. Điều đó thì ổn cho phòng thí nghiệm, nhưng lại không phù hợp cho môi trường sản xuất.

{{1}}Một pipeline sử dụng máy tính trong sản xuất hiếm khi chỉ là một checkpoint duy nhất.{{/1}} {{2}}Nó bao gồm một mô hình planner quyết định ý định tiếp theo, một mô hình grounding hoặc thị giác đọc màn hình, bản thân GUI agent, và một phương án dự phòng rẻ khi một bước con thất bại{{/2}} — {{3}}và tất cả các thành phần đó đều là các mô hình được phục vụ (served model), ngay cả khi GUI agent chạy cục bộ.{{/3}} {{4}}Sự kết hợp đó chính là thứ mà một lớp định tuyến sinh ra để phục vụ: một API duy nhất trên hơn 200 mô hình được lưu trữ, giá niêm yết từ nhà cung cấp được chuyển thẳng với mức chênh lệch 0%, và tự động chuyển đổi dự phòng để một sự cố tạm thời của một nhà cung cấp không làm đình trệ một phiên chạy agent dài.{{/4}} {{5}}Routing DSL cũng cho phép bạn kết hợp nhiều mô hình thành một lệnh gọi duy nhất — một planner ở phía trước, một bộ xác minh rẻ ở phía cuối — mà không cần tự nối các nhà cung cấp trong code của mình.{{/5}} {{6}}Tóm tắt trung thực rất đơn giản: agent điều khiển desktop là cục bộ, nhưng các mô hình quyết định việc cần làm xung quanh nó đều có thể định tuyến, và thử nghiệm an toàn các checkpoint mới chưa được kiểm chứng chính là mục đích của failover.{{/6}}

Xem gì tiếp theo

Bốn điều sẽ thay đổi cục diện cho UI-Mate-27B, theo thứ tự tầm quan trọng gần đúng:

• Một lần chạy lại độc lập của OSWorld-Verified và WindowsAgentArena. Con số WAA nói riêng hoặc là một vấn đề lớn, hoặc là một hiện vật giả tạo do bộ khung thử nghiệm tạo ra, và chỉ có một đánh giá bên ngoài mới xác định được điều nào.

Báo cáo kỹ thuật chính thức. Trích dẫn hiện tại chỉ là chỗ tạm, và bài báo đầy đủ có lẽ sẽ trình bày các chi tiết về công cụ dữ liệu mà phần tóm tắt chỉ mới phác thảo.

• Thông báo của chính Tencent. Một bản phát hành theo hướng repo-first như thế này thường báo trước điều gì đó — tích hợp Marvis, dịch vụ lưu trữ, hoặc một nỗ lực thúc đẩy mô hình mở trên diện rộng hơn.

• Một API được lưu trữ. Trọng số của cả ba checkpoint hiện đã công khai, nhưng không có gì được phục vụ ở bất kỳ đâu — không có endpoint Tencent, không có nhà cung cấp suy luận bên thứ ba — vì vậy tự lưu trữ vẫn là con đường duy nhất, và chỉ có một thông báo từ Tencent hoặc một nhà cung cấp nhận phục vụ mới thay đổi điều đó.

Câu hỏi thường gặp

Tencent UI-Mate-27B là gì?

UI-Mate-27B là một tác nhân GUI nền tảng có 27 tỷ tham số, được cấp phép theo Apache-2.0, đến từ Nhóm Tác nhân Đa phương thức HY Frontier của Tencent, được tinh chỉnh từ Qwen3.6-27B. Mô hình này theo dõi ảnh chụp màn hình desktop theo thời gian thực, suy luận dựa trên chúng, và xuất ra các thao tác chuột cùng bàn phím tương thích với pyautogui. Nó được âm thầm phát hành trên Hugging Face vào ngày 14 tháng 8 năm 2026 — cùng với phiên bản 9B và bản UI-Mate-democua-27B được hướng dẫn bằng trình diễn — mà không có bất kỳ thông báo nào, và các điểm chuẩn của nó cho đến nay hoàn toàn do nhà cung cấp tự báo cáo.

Thực thi có hướng dẫn bằng trình diễn khác với việc phát lại một tập lệnh như thế nào?

Thay vì thực thi một macro đã ghi lại, UI-Mate coi một bản demo như một quy trình làm việc có chú thích, được cấu trúc theo nhiệm vụ phụ, được đưa vào như một hướng dẫn. Ảnh chụp màn hình trực tiếp vẫn là nguồn đáng tin cậy, vì vậy khi bố cục, nội dung hoặc trạng thái của ứng dụng khác với những gì được hiển thị, mô hình sẽ lập kế hoạch lại thay vì phát lại các tọa độ cũ. Đó là cơ chế đằng sau sự tăng vọt được tuyên bố từ 17.2 lên 35.4 về tỷ lệ thành công nghiêm ngặt trên tập hợp con tự demo — và đó vẫn chỉ là tuyên bố của nhà cung cấp cho đến khi ai đó tái lập được nó.

UI-Mate-27B có thực sự là chuẩn mực tiên tiến nhất cho các agent giao diện đồ họa trọng số mở không?

Điều đó hoàn toàn phụ thuộc vào thiết lập đánh giá. Chỉ số WindowsAgentArena 66.2 của nó sẽ vượt qua các kết quả WAA được công bố công khai tốt nhất từ đầu năm 2026, nhưng OSWorld-Verified 77.0 của nó nằm dưới mức 82.6 của mô hình open-weight Holo3-35B-A3B trên bảng xếp hạng công khai. Bài báo gọi đây là mô hình open-weight tiên tiến nhất mới; chạy lại độc lập trên một bộ công cụ nhất quán là cách duy nhất để biết.

Tôi có thể chạy UI-Mate-27B hôm nay không?

Vâng, nếu bạn tự phục vụ nó: tải các trọng số từ Hugging Face — checkpoint đa dụng 27B, bản 9B, hoặc UI-Mate-democua-27B được hướng dẫn bằng demo — chạy lệnh vLLM từ model card (tensor-parallel size 2, sáu ảnh mỗi prompt), và điều khiển nó bằng Python agent hoặc ứng dụng macOS. Không có API lưu trữ sẵn, và chưa có checkpoint nào trên OrcaRouter — điều này, đối với những mô hình mới và chưa được kiểm chứng như vậy, là một lý do hợp lý để giữ chúng trong môi trường cô lập vào lúc này.

Cách đọc đúng về UI-Mate-27B không phải là "người chiến thắng" mà là "đáng để theo dõi". Một mô hình mở 27B tuyên bố dẫn đầu WAA và cung cấp quy trình trình diễn một lần là một điểm dữ liệu có ý nghĩa {{1}}trong một năm mà các tác nhân sử dụng máy tính trọng lượng mở đã đi từ trò đùa đến gần chạm tới biên giới công nghệ.{{/1}} Giờ đây khi checkpoint được dẫn dắt bằng trình diễn là trọng số công khai thay vì chỉ là chỗ trống trên trang dự án, quy trình "chỉ cần trình diễn một lần" là thứ bạn thực sự có thể chạy. Tencent trước đây vốn thận trọng với các bản phát hành, và bản này có hình dạng của một công việc đang dang dở được công khai. Hãy chạy nó trong sandbox, chạy lại các benchmark, và tiếp tục theo dõi các thông báo {{2}}— phần thú vị của câu chuyện này vẫn còn ở phía trước.{{/2}}

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube