Một thẻ hero được tạo có tiêu đề 'Dots vs Gemini 3.1 Pro'. Một đường kẻ dọc chia nó: bảng bên trái, được dán nhãn 'Dots', mang biểu tượng máy tính đám mây và dòng 'máy tính riêng + trình duyệt - hơn 4.000 ứng dụng'; bảng bên phải, được dán nhãn 'Gemini 3.1 Pro', mang biểu tượng mắt và dạng sóng cùng 'đầu vào văn bản, hình ảnh, âm thanh, video - ngữ cảnh 1M - $2.00 / $12.00'. Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Dots vs Gemini 3.1 Pro: Một Agent Với Desktop Đối Đầu Với Một Mô Hình Có Năm Giác Quan

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

The word "multimodal" hides the real difference between these two, so start with what each one does with the world. Gemini 3.1 Pro Preview is Goog​le's flagship reasoning model, released in preview on February 19, 2026: it accepts text, images, audio, video and files as input and returns text, works across a 1,048,576-token context window with up to 65,536 tokens of output, and costs $2.00 per million input tokens and $12.00 per million output tokens below a 200,000-token prompt, repricing to $4.00 and $18.00 above it. Dots is the company's always-on agent, announced at DevDay on September 29, 2026: an agent with its own cloud computer and browser that works across more than 4,000 connected apps, runs on GPT-6 Astra, and comes included with Pro and Business Premium. Gemini 3.1 Pro watches the world and describes it; a dot acts inside it. Those are different verbs, and almost every practical question about this pair follows from which verb your problem needs.

Đầu vào không giống như hành động

Khả năng hỗ trợ đa phương tiện của Gemini 3.1 Pro thực sự rất rộng — một bản ghi âm dài hai giờ, một ảnh sản phẩm, một bản xuất bảng tính và một hợp đồng đều có thể đến trong cùng một yêu cầu — nhưng mỗi đầu vào trong số đó đều là thứ đã tồn tại từ trước lệnh gọi. Đầu ra của mô hình là văn bản: một câu trả lời, một bản trích xuất, một kế hoạch, một bản nháp. Không có gì bên ngoài cuộc hội thoại thay đổi vì mô hình đã chạy.

Một dấu chấm đảo ngược điều đó. Đầu vào của nó thật bình thường — tin nhắn của bạn, dữ liệu ứng dụng của bạn, một tác vụ bạn mô tả — và đầu ra của nó là một thay đổi trên thế giới: một tệp được di chuyển, một ticket được cập nhật, một tin nhắn được gửi sau khi bạn phê duyệt, một trang được mở trong trình duyệt riêng của nó. Tài liệu ra mắt của OpenAI mô tả nó thúc đẩy nhiều dự án cùng lúc, học hỏi từ phản hồi và tiếp nhận các tác vụ mới mà không cần một luồng mới. Đó là mô tả về một người lao động, không phải về một mô hình, và điều đó giải thích tại sao OpenAI không công bố benchmark nào cho nó: bạn không đánh giá một đồng nghiệp trên bảng xếp hạng, bạn quan sát những gì nó hoàn thành và kiểm tra Activity View.

• Những gì nó tiếp nhận — tin nhắn, mô tả tác vụ và dữ liệu từ các ứng dụng được kết nối ở một phía; văn bản, hình ảnh, âm thanh, video và tệp ở phía còn lại

• Những gì nó tạo ra — các thay đổi bên trong phần mềm khác, chịu sự ràng buộc của các quy tắc và cổng phê duyệt, dựa trên văn bản mà sau đó bạn tự xử lý

• Nơi nó chạy — máy tính đám mây của OpenAI với trình duyệt riêng, tách biệt khỏi máy của bạn trừ khi bạn liên kết chúng, so với hạ tầng phục vụ của Google, có thể truy cập qua API từ bất cứ đâu bạn muốn

• Ngữ cảnh — không có tài liệu cho một dấu chấm, so với 1,048,576 token đầu vào và 65,536 token đầu ra

• Bằng chứng — các bản demo của nhà cung cấp, không có đánh giá độc lập, so với Artificial Analysis Intelligence Index là 29,7 với 94,1 trên GPQA Diamond và 82 về khả năng nhớ ngữ cảnh dài, được công bố độc lập với Google

Gemini 3.1 Pro có đáng để sở hữu không

Lý do để giữ một mô hình như thế này lại là vì nhận thức là việc khó, và hầu hết các agent đều yếu ở khoản đó. Hồ sơ độc lập được công bố của Gemini 3.1 Pro thật bất thường: 94,1 trên GPQA Diamond là kết quả gần mức tiên phong, 82 về truy hồi ngữ cảnh dài là con số tốt thứ hai trong bộ mô hình chúng tôi liệt kê, và 58,7 trên SciCode đưa nó lên đầu bảng đó. Chỗ nó không tỏa sáng là ra quyết định mang tính agent — điểm τ²-Bench 95,6 là đáng nể, nhưng phân đoạn τ-banking của nó, phần đo việc sử dụng công cụ nhiều bước với hệ thống của một ngân hàng, chỉ đạt 21,4. Tất cả đều là các phép đo của bên thứ ba được liệt kê kèm nguồn trong danh mục của chúng tôi, không phải số liệu từ nhà cung cấp, và đó là lý do chúng đáng giá hơn một bản trình bày ra mắt.

Nửa còn lại của câu chuyện tính phí theo từng yêu cầu đó là mô hình này không miễn phí. Nó bước vào giai đoạn xem trước hồi tháng Hai, nhiều tháng trước khi mô hình tiên phong hiện tại ra mắt, và nó được định giá cao hơn bậc rẻ: $2.00 và $12.00 mỗi triệu token tương đương khoảng $0.0006 đầu vào cho mỗi trang văn bản dày đặc, chẳng đáng là bao cho đến khi bạn chạy nạp video trên cả một thư viện, và khi đó nó trở thành một khoản mục chi phí. Đọc một khung hình video tốn chi phí ngang với đọc một đoạn văn, và mô hình sẽ vui vẻ tính tiền bạn cho việc đó.

A screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview, showing the identifier 'google/gemini-3.1-pro-preview' with Vision, Audio, Tools, JSON and Reasoning badges, a publication date of 2026-02-19, the description of it as Google's frontier reasoning model with improved software engineering and agentic reliability, a side panel showing 1M tokens of context and 65K maximum output over audio, file, image, text and video input, and a price strip reading $2.00 and $12.00. The page's own sidebar note records this as a headless screenshot of the live page.

Hai mô hình chi phí không chịu chuyển đổi

Chi phí của một dot là một gói đăng ký với hạn mức chưa được công bố: chiếc đầu tiên được bao gồm cùng Pro hoặc Business Premium, các giới hạn mở rộng được áp dụng trong tháng đầu tiên, các cuộc trò chuyện với dot của bạn không làm tiêu hao hạn mức sử dụng ChatGPT, và không có mức giá nào được công bố cho chiếc dot thứ hai, cho tốc độ hoặc dung lượng tăng thêm, hoặc cho một tác vụ đã hoàn tất. Bài tường thuật của CNBC về keynote cho thấy Sarah Friar định giá gói $500 Pro 500 mới như một hạn mức sử dụng cộng với chế độ Ultrafast chứ không phải là mức giá theo từng dot, vì vậy gói đắt nhất trên bảng giá của OpenAI cũng không tạo ra chi phí trên mỗi đơn vị công việc của agent.

Gemini 3.1 Pro chuyển đổi mọi thứ thành token, kể cả những phần không phải văn bản. Âm thanh, video và hình ảnh đều được tính phí như đầu vào, nên chi phí của một tác vụ phụ thuộc vào việc bạn đã bắt mô hình “nhìn” bao nhiêu phần của thế giới — một đặc tính hữu ích, vì bạn có thể đo lường nó, và cũng là một đặc tính nguy hiểm, vì con số lớn nhất trên hóa đơn thường là con số mà không ai lường trước. Định tuyến mô hình giúp ích ở đây theo một cách cụ thể chứ không chung chung: với hơn 200 mô hình nằm sau một khóa duy nhất với giá niêm yết của nhà cung cấp, không đội giá, phần đọc đa phương thức đắt đỏ và công việc tiếp nối rẻ hơn có thể nằm trên các mô hình khác nhau trong cùng một pipeline, và thay đổi về mức giá từ Google sẽ được áp dụng vào tài khoản của bạn ngay trong ngày thay vì đến kỳ gia hạn.

A generated scoreboard titled 'Dots vs Gemini 3.1 Pro - inputs, outputs, evidence', with two columns. 'Dots' lists: Inputs messages and app data; Output changes inside connected apps; Model GPT-6 Astra (vendor-stated); Computer its own cloud computer and browser; Connectors 4,000+ apps; Independent benchmark none. 'Gemini 3.1 Pro' lists: Inputs text, image, audio, video, file; Output text only; Context 1,048,576 tokens; Max output 65,536 tokens; Price $2.00 in / $12.00 out per 1M below 200K; AA Intelligence Index 29.7. A footer reads 'Dots details vendor-stated from DevDay; Gemini 3.1 Pro figures from independent listings in the OrcaRouter catalogue.'

Nơi hai bên cùng làm việc với nhau

Sự ghép cặp tự nhiên là một dot điều phối và một mô hình đa phương thức cảm nhận. Công việc đến, một dot định tuyến nó: bất cứ thứ gì cần được nhìn hoặc nghe sẽ được đưa đến Gemini 3.1 Pro để tạo mô tả có cấu trúc, và mô tả đó quay trở lại quy trình, nơi một lịch biểu hoặc một quy tắc có thể tác động lên nó. dot đảm nhiệm việc theo đuổi; mô hình đảm nhiệm việc đọc. Tách ra như vậy cũng giữ cho các lệnh gọi phương thức đắt đỏ có thể kiểm toán được, điều này quan trọng vì chúng chính là những thứ khiến người ta bất ngờ.

Trên OrcaRouter, mô hình được định tuyến dưới dạng google/gemini-3.1-pro-preview theo đúng giá niêm yết của nhà cung cấp, chuyển tiếp nguyên vẹn với mức chênh lệch 0%, nằm cạnh phần còn lại của danh mục, cùng với cơ chế chuyển đổi dự phòng tự động khi một upstream suy giảm và một DSL định tuyến để kết hợp nhiều mô hình thành một lệnh gọi duy nhất. Điều đó nói rõ những gì không nằm trong đó: các dấu chấm không thuộc về phía chúng tôi, không có endpoint nào dành cho nó, và cũng không có mã định danh mô hình nào để trỏ tới. Nếu bạn muốn mô hình nằm trong tầm kiểm soát của chính mình — và một mô hình tháng Hai đúng là kiểu phụ thuộc đáng để giới hạn — thì mô hình nên nằm sau endpoint của bạn, còn agent vẫn ở nguyên nơi bạn đã thuê nó.

Vấn đề của bạn cần động từ nào?

Nếu công việc liên quan đến việc nhìn hoặc nghe một thứ gì đó và tạo ra câu trả lời, thì Gemini 3.1 Pro là công cụ còn một dot là lựa chọn mua sai. Nếu công việc liên quan đến việc hoàn thành xong một thứ gì đó xuyên suốt nhiều ứng dụng mà bạn không phải trực tiếp điều khiển, thì dot là công cụ và không lượng đầu vào đa phương thức nào có thể thay thế được nó. Những đội làm đúng điều này sẽ vận hành cả hai và giữ ranh giới thật rõ ràng: nhận thức trên một mô hình tính phí theo mức dùng mà bạn có thể đo lường, hành động nằm sau một sản phẩm mà bạn có thể hủy.

A screenshot of the OrcaRouter model catalogue page headed 'Models', showing the line '206 models - 16 providers - one API key, one bill' above filter controls for input modalities, context length, input price, status and supported parameters, with a grid of model cards and credit top-up offers visible beneath.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày