Thẻ hero với dòng kicker 'TWO DIFFERENT JOBS' và tiêu đề 'DSpark vs UI-Venus 2.9B', phụ đề 'Hệ số tăng tốc 279,5M đối đầu với một GUI agent 9B - phép so sánh chỉ hợp lý khi bạn ngừng coi chúng là những thứ thay thế cho nhau.' Ba thẻ ghi 'Drafter 279,5M - Giúp LFM2.5-VL-3B nhanh hơn; tự nó không tạo ra gì cả', 'GUI agent 9B - inclusionAI của Ant Group; nhấp, gõ, điều hướng' và 'Không phải thứ thay thế - Một cái là tối ưu hóa runtime, cái kia là policy'. Một dòng footer ghi 'Các con số tốc độ do Liquid AI tự đo; điểm số agent do Ant Group tự công bố. Cả hai đều chưa được kiểm chứng độc lập.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Engineering & Research

LFM2.5-VL-3B-DSpark so với UI-Venus 2.9B: Bội số tốc độ đối đầu với một GUI Agent

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

LFM2.5-VL-3B-DSpark và UI-Venus 2.9B bị xếp chung dưới một tiêu đề mơ hồ — các mô hình thị giác nhỏ — rồi bị đem so sánh với nhau, và đó là một lỗi phân loại đáng sửa trước khi nó khiến ai đó tốn cả một tuần tích hợp. LFM2.5-VL-3B-DSpark là một mô hình nháp 279,5M tham số, có nhiệm vụ tăng tốc LFM2.5-VL-3B của Liquid AI. UI-Venus 2.9B, đến từ phòng thí nghiệm inclusionAI của Ant Group, là một GUI agent 9B, đọc ảnh chụp màn hình, quyết định hành động và thực thi hành động đó trên môi trường di động, web và máy tính để bàn. Một cái làm cho một mô hình hiện có nhanh hơn. Cái còn lại chính là thứ đang làm công việc đó. Nếu thứ bạn cần là một GUI agent, thì mô hình nháp không phải là một lựa chọn rẻ hơn — nó hoàn toàn không phải là một lựa chọn.

Phép so sánh hữu ích không phải là cái nào tốt hơn mà là mỗi cái giải quyết vấn đề gì, và mỗi cái khiến bạn tốn những gì trong quá trình đó. Cả hai cũng đều là những thứ mới xuất hiện gần đây mà hệ sinh thái rộng lớn hơn vẫn chưa bắt kịp, và khoảng cách giữa những gì kho lưu trữ của chúng tuyên bố và những gì bất kỳ ai khác đã xác minh là lớn hơn ở một trong hai so với cái kia.

Chính xác thì mỗi cái là gì

Hãy bắt đầu với các hình dạng, vì chúng giải thích phần lớn những thứ còn lại.

• Đó là gì — LFM2.5-VL-3B-DSpark là một bộ soạn thảo giải mã suy đoán; UI-Venus 2.9B là một chính sách tác nhân GUI đa dụng

• Tham số — 279,5M BF16 cho mô hình dự thảo, so với 9B cho UI-Venus 2.9B được khởi tạo từ Qwen3.5-9B

• Khả năng độc lập — bộ soạn thảo không tạo ra được gì hữu ích khi đứng một mình và không thể được đánh giá chuẩn trong trạng thái tách biệt; UI-Venus 2.9B vận hành như một tác nhân hoàn chỉnh

• Đầu vào — mô hình dự thảo không bao giờ nhìn thấy chính hình ảnh, mà chỉ thấy các trạng thái ẩn của mô hình đích; UI-Venus 2.9B xử lý trực tiếp ảnh chụp màn hình và được xây dựng hoàn toàn xoay quanh chúng

• Đầu ra — bộ dự thảo đề xuất token để xác minh; UI-Venus 2.9B phát ra các hành động có căn cứ kèm hộp bao trên một giao diện trực tiếp

• Cơ sở — mô hình nháp được gắn với LiquidAI/LFM2.5-VL-3B trong siêu dữ liệu của chính nó; UI-Venus 2.9B được xây dựng trên Qwen3.5-9B

• Bối cảnh — mô hình dự thảo kế thừa mọi thứ mà mô hình đích cung cấp; UI-Venus 2.9B được phục vụ ở mức tối đa 262.144 token trong công thức vLLM của chính nhà cung cấp

• Giấy phép — cả hai đều chưa ngã ngũ theo những cách khác nhau; Liquid được phát hành theo giấy phép LFM1.0, còn thẻ mô hình của UI-Venus 2.9B nói thẳng rằng giấy phép trọng số của nó đang chờ xác nhận cuối cùng

A two-panel card titled 'Drafter vs agent - different units', subtitled 'One column measures seconds saved. The other measures tasks completed. They are not on the same axis.' The left panel 'LFM2.5-VL-3B-DSpark' has rows: What it is 'Speculative-decoding drafter', Parameters '279.5M BF16', Base 'LiquidAI/LFM2.5-VL-3B', Runs alone 'No, by construction', Its number '2.04x-3.13x decode', License 'LFM1.0, not OSI'. The right panel 'UI-Venus 2.9B' has rows: What it is 'GUI agent policy', Parameters '9B, from Qwen3.5-9B', Base 'Ant Group inclusionAI', Runs alone 'Yes - a complete agent', Its number '80.2 AndroidWorld', License 'Pending final confirmation'. A strip beneath reads 'Neither figure has been reproduced outside the lab that published it. Treat both as ceilings, not expectations.' The OrcaRouter logo is composited in the bottom-right corner.

Gạch đầu dòng cuối cùng đó chính là điểm bạn cần chậm lại mà cân nhắc. Bài đưa tin của chính chúng tôi về UI-Venus-2-9B vào cuối tháng Tám đã mô tả bản phát hành này là Apache-2.0, bởi vì đó là những gì tài liệu của dự án ghi tại thời điểm đó. Thẻ mô hình (model card) ngày hôm nay lại nói một điều khác và mạnh mẽ hơn: rằng giấy phép trọng số mô hình đang chờ xác nhận cuối cùng và sẽ được bổ sung trước khi phát hành công khai, và rằng một tuyên bố Apache-2.0 đã cố ý không được giữ lại vì các tài liệu thượng nguồn hiện tại chứa những tuyên bố giấy phép mâu thuẫn nhau. Nếu bạn đang lên kế hoạch triển khai thương mại UI-Venus 2.9B, thì câu hỏi về giấy phép vẫn để ngỏ theo chính sự thừa nhận của nhà cung cấp, và đó là một rủi ro trọng yếu chứ không phải chỉ là một chú thích nhỏ.

Những con số mà mỗi bên thực sự công bố

Hai kho lưu trữ đo lường những thứ khác nhau, và đó chính là mấu chốt. Liquid công bố thông lượng; Ant Group công bố mức độ thành công của tác vụ.

Đối với drafter, theo bộ khung kiểm thử của chính Liquid: tăng tốc giải mã tốt nhất là 2,66× trên một H100 80GB ở BF16 thông qua SGLang, tốt nhất là 3,13× với MLX-VLM trên Apple M5 Max, và tốt nhất là 2,14× với llama.cpp trên M3 Ultra. Xét từ đầu đến cuối, chính những lần chạy đó nằm trong khoảng 1,30× đến 2,62× tùy thuộc vào stack và tác vụ. Tỷ lệ chấp nhận bản nháp nằm quanh mức 3,2 đến 4,5 token cho mỗi lượt xác minh. Tất cả những con số đó đều do nhà cung cấp đo lường và không có bên thứ ba tái lập.

Đối với UI-Venus 2.9B, các bảng của chính model card báo cáo 80,2 trên AndroidWorld, 65,8 trên MobileWorld với ngân sách 50 bước, 70,8 trên OSWorld-Verified, 48,0 trên DeskCraft, 90,8 trên WebVoyager trên split 595 tác vụ đã được làm mới, 74,0 trên Online-Mind2Web, 73,0 trên ScreenSpot-Pro và 77,1 trên VenusBench-GD. Về CAPTCHA, nó báo cáo 78,1 trên VenusBench-CAPTCHA và 75,7 trên MCA-Bench. Về khía cạnh an toàn, nó báo cáo tỷ lệ thành công của cuộc tấn công là 11,3% trên OSHarm, so với 25,3% của base Qwen3.5-9B. Tất cả những số này đều do nhà cung cấp báo cáo, một số baseline mang dấu hoa thị, nghĩa là các tác giả UI-Venus đã đánh giá chúng theo giao thức đã nêu, và chính model card cảnh báo rằng các so sánh OSWorld-Verified sử dụng action scaffold riêng cho từng mô hình và nên được đọc như các tham chiếu ở cấp benchmark thay vì các ablation có kiểm soát.

Hãy lưu ý những gì vắng mặt trong cả hai danh sách: bất cứ thứ gì được bên thứ ba đo lường. Với drafter, đó là vì checkpoint đã cũ vài ngày. Với UI-Venus 2.9B, đó là vì các benchmark GUI-agent rất tốn kém để tái tạo và kết quả trong môi trường trực tiếp thay đổi theo trạng thái của môi trường vào ngày đánh giá — một lưu ý mà model card tự đưa ra.

Nơi cả hai thực sự gặp nhau

A screenshot of the Hugging Face model card for inclusionAI/UI-Venus-2-9B showing 'Like 34' and 'Downloads last month 8,423'. The card describes UI-Venus-2 as a general-purpose foundation GUI agent covering 170+ multilingual apps and 4,000+ domains across 19 categories, evaluated on OSWorld, AndroidWorld and MobileWorld, and reports an OSHarm attack success rate of 11.3% against 25.3% for its Qwen3.5-9B base and an OSBlind figure of 48.8% against 79.4% for that base.

Có một sự chồng lấn thực sự, và nó hẹp hơn so với những gì nhãn danh mục gợi ý. Cả hai đều liên quan nếu bạn đang xây dựng một tác nhân thị giác trên thiết bị hoặc ở biên, và cả hai đều quan tâm đến chi phí đưa pixel qua một mô hình. Chúng tiếp cận nó từ hai đầu đối lập.

UI-Venus 2.9B tấn công nó bằng huấn luyện: một quy trình ba giai đoạn gồm huấn luyện trung gian đa phương thức trên các môi trường di động, web và OS mô phỏng, RL ngoại tuyến theo từng miền, rồi chưng cất on-policy từ nhiều giáo viên thành một chính sách duy nhất. Năng lực được công bố chính là kết quả. Mô hình có 9B, con số nhỏ đối với một GUI agent và lớn đối với một thiết bị biên, và cấu hình phục vụ dự kiến của card là triển khai vLLM — cùng tài liệu đó lưu ý rằng cấu hình đó chưa được xác thực live-canary như một phần của bản cập nhật card và bảo bạn ghim và xác minh phiên bản vLLM dành cho Qwen3.5 trước khi triển khai.

LFM2.5-VL-3B-DSpark tấn công nó bằng runtime: nó để nguyên trọng số của mô hình đích và đổi lấy tốc độ bằng cách nháp rồi xác minh token. Trên một thiết bị tầm điện thoại, sự đánh đổi này chỉ nghiêng một chiều về phía bên nháp, vì đầu ra chứng minh được là của mô hình đích và bộ nhớ tăng thêm chưa bằng một phần mười kích thước một mô hình.

Hệ quả đối với bất kỳ ai lựa chọn: một vòng lặp agent thực hiện nhiều lệnh gọi mô hình cho mỗi tác vụ, và mỗi lệnh gọi đều phải trả chi phí prefill cho một ảnh chụp màn hình mới. Mã hóa thị giác và prefill chính xác là những giai đoạn mà giải mã suy đoán không tăng tốc — chính thông báo của Liquid đưa ra lập luận này để phản đối cách diễn giải vô hạn các con số tiêu đề của mình. Vì vậy, lợi thế của drafter thu hẹp lại đúng trong loại khối lượng công việc mà UI-Venus 2.9B tồn tại. Ngược lại, lợi thế của UI-Venus 2.9B — thực sự hoàn thành tác vụ — không phải là điều mà một drafter cung cấp ở bất kỳ tốc độ nào.

Chạy hai

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention plus a Markov head and a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'.

Cả hai đều không phải là một endpoint được host trên OrcaRouter. LFM2.5-VL-3B-DSpark và UI-Venus 2.9B đều yêu cầu bạn tự tải trọng số về và tự phục vụ chúng, và cách triển khai phục vụ của chúng được định hình bởi những vai trò rất khác biệt. Bộ dự thảo cần SGLang v0.5.19 trở lên với cờ thuật toán suy đoán DSPARK và kích thước khối là 9, hoặc MLX-VLM v0.7.2 trở lên với bộ dự thảo được truyền làm mô hình nháp và nhiệt độ bị buộc về 0, hoặc llama.cpp với một GGUF F16 567 MB được ghép với mô hình đích đã lượng tử hóa. UI-Venus 2.9B cần một máy chủ vLLM đủ lớn cho mô hình 9B ở độ dài tối đa 262.144 token, cùng với các prompt tham chiếu và bộ phân tích hành động từ kho mã nguồn của dự án — thẻ mô hình nêu rõ rằng chỉ khởi động máy chủ thôi thì không mang lại cho bạn một GUI agent vòng kín hoạt động được.

Cả hai cũng đều để lại cùng một khoảng trống ở các rìa của những gì chúng có thể làm. Một mô hình ngôn ngữ-thị giác nhỏ kết hợp với một drafter vẫn gặp phải những màn hình và tác vụ mà nó không thể xử lý, và một GUI agent vẫn thất bại trên những môi trường nằm ngoài phân phối huấn luyện của nó. Những truy vấn bị rơi ra ngoài sẽ đáp xuống một nơi nào đó, và trong hầu hết các thiết kế production, đó là một mô hình đa dụng lớn hơn. Định tuyến những truy vấn đó qua một endpoint duy nhất bao phủ hơn 200 mô hình ở mức giá niêm yết của từng nhà cung cấp, với tính năng tự động chuyển đổi dự phòng khi một nhà cung cấp bị suy giảm, giữ cho đường dự phòng nằm ngoài danh sách tích hợp quan trọng thay vì biến nó thành một dự án triển khai thứ hai với các khóa và hợp đồng riêng.

Cách quyết định trong một phút

Nếu bạn cần phần mềm vận hành giao diện người dùng — nhấp, gõ, điều hướng một ứng dụng mà nó chưa từng thấy — thì bạn đang mua một policy, và đó chính là UI-Venus 2.9B. Hãy dự trù ngân sách cho một triển khai vLLM 9B, đọc câu hỏi giấy phép đang chờ xử lý trước khi bạn cam kết thương mại, và coi bảng benchmark của nhà cung cấp như một giả thuyết khởi đầu mạnh mẽ chứ không phải kết quả đã ngã ngũ, đặc biệt là các so sánh OSWorld-Verified mà chính model card đánh dấu là phụ thuộc vào scaffold.

Nếu bạn đã chạy LFM2.5-VL-3B và muốn nó nhanh hơn trên phần cứng bạn sở hữu, thì bạn đang mua một tối ưu hóa runtime, và đó chính là LFM2.5-VL-3B-DSpark. Hãy kiểm tra ba điều trước: rằng khối lượng công việc của bạn nặng về decode hơn là nặng về prefill, rằng bạn đang phục vụ ở 16-bit thay vì bản xuất 4-bit, và rằng runtime của bạn đáp ứng các mức phiên bản tối thiểu. Nếu cả ba đều đúng, chi phí bộ nhớ là 8.9% và đầu ra không thay đổi theo thiết kế.

Điều duy nhất không thể tồn tại khi tiếp xúc với một trong hai kho lưu trữ là việc coi chúng như những thứ thay thế cho nhau. Chúng là một hệ số nhân tốc độ và một tác nhân, và kịch bản duy nhất mà chúng cạnh tranh là khi bạn đã quyết định mình đang xây dựng cái gì và đang tìm lý do để xây dựng một thứ gì đó rẻ hơn để thay thế.

OrcaRouter đạt tới hơn 200 mô hình chỉ qua một khóa với giá niêm yết của nhà cung cấp, mức chênh 0%, kèm chính sách định tuyến và tự động chuyển đổi dự phòng cho những truy vấn mà một mô hình biên hoặc một tác nhân không nên đảm nhận. một API cho đường dự phòngKhông mô hình nào trên trang này được lưu trữ ở đó - cả hai đều được phục vụ từ trọng số của chính bạn - nhưng đường dự phòng là phần bạn không phải tự xây dựng.