Đã tạo thẻ tiêu đề hero cho Claude Sonnet 5.5 so với Gemini 3.1 Pro, với phụ đề 'Rẻ hơn trên mỗi token, đắt hơn gấp mười một lần trên mỗi tác vụ', hiển thị $2.00 và $10.00 mỗi triệu token so với $2.00 và $12.00 cùng giới hạn đầu ra 65,536 token được ghi chú ở bên phải, và logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Claude Sonnet 5.5 vs Gemini 3.1 Pro: Rẻ hơn trên mỗi token, đắt hơn gấp mười một lần trên mỗi tác vụ

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trên bảng giá, Claude Sonnet 5.5 là mô hình rẻ hơn, và về năng lực thì đây không phải một cuộc so kè sít sao. Nó đạt mức khả dụng chung (GA) vào ngày 28 tháng 9 năm 2026 với giá 2,00 USD cho mỗi triệu token đầu vào và 10,00 USD cho mỗi triệu token đầu ra; Gemini 3.1 Pro, được công bố ngày 19 tháng 2 năm 2026 và vẫn được phục vụ từ một endpoint xem trước, có giá 2,00 và 12,00 USD. Sonnet 5.5 cũng đạt 56 điểm trên Chỉ số Trí tuệ v4.3 của Artificial Analysis, so với 30 điểm của Gemini 3.1 Pro Preview — một khoảng cách hai mươi sáu điểm trên cùng một khung đánh giá. Ngữ cảnh 1.048.576 token của Gemini là con số tiêu đề duy nhất mà nó thắng tuyệt đối. Ấy vậy mà chính nhà đánh giá đó lại báo cáo rằng để hoàn thành một tác vụ mở, chi phí là 0,67 USD với mô hình của Google và 7,60 USD với mô hình của Anthropic, tức gấp mười một lần theo hướng ngược lại. Cả hai con số đều đúng, và lý do chúng cùng tồn tại — giới hạn đầu ra 65.536 token ở một bên và vấn đề dài dòng ở bên kia — chính là toàn bộ nội dung của phép so sánh này.

Mỗi endpoint thực sự là gì

Xác định đúng danh tính trước khi làm phép tính. Chủ thể ở đây là anthropic/claude-sonnet-5.5, phát hành ngày 28 tháng 9 năm 2026, đầu vào văn bản, hình ảnh và tệp, ngữ cảnh 1.000.000 token, đầu ra tối đa 128.000 token, tư duy thích ứng với tham số effort mặc định ở mức high trên Claude Platform. Đối thủ là google/gemini-3.1-pro-preview, phát hành ngày 19 tháng 2 năm 2026, đầu vào văn bản, hình ảnh, video, âm thanh và tệp, ngữ cảnh 1.048.576 token, đầu ra tối đa 65.536 token. Một trong hai cái tên đó mang một từ mà tên kia không có, và đó không phải là để trang trí.

Hậu tố preview đã được gắn trong bảy tháng. Google đã phát hành một số bản phát hành Flash trong khoảng thời gian đó và không có bản kế nhiệm cho hạng Pro; model mà 3.1 Pro thay thế được liệt kê là đã ngừng hoạt động. Không điều nào trong số đó là lỗi của model — nó đã hoạt động, ổn định và được định giá đúng suốt thời gian qua — nhưng điều đó có nghĩa là endpoint mà bạn đang tích hợp không được bao phủ bởi cam kết vòng đời GA, và dòng model này đã cho nghỉ hưu một model Pro rồi. Hãy coi đó là một mục thường trực trong danh sách chi phí/rủi ro chứ không phải một chú thích, vì nó thay đổi cái giá của một quyết định kiến trúc nhiều năm nếu bạn làm sai.

Hai số hướng về hai phía ngược nhau

So sánh theo từng token trước tiên, vì đó là phép so sánh mà ai cũng chạy và nó có lợi cho mô hình mới hơn.

• Đầu vào — 2,00 USD mỗi triệu ở cả hai; hòa chính xác ở mức giá niêm yết

• Đầu ra — $10.00 cho Claude Sonnet 5.5 so với $12.00 cho Gemini 3.1 Pro; mô hình Anthropic rẻ hơn 17%

• Đọc cache — $0,20 mỗi triệu cho cả hai ở dưới ranh giới bậc

• Ghi cache — $2.50 mỗi triệu cho cửa sổ năm phút trên Claude Sonnet 5.5, so với $0.375 cho Gemini 3.1 Pro; Google rẻ hơn khoảng bảy lần khi ghi một mục cache

• Ngữ cảnh — 1,000,000 so với 1,048,576; một sự khác biệt không có hậu quả thực tế

• Đầu ra tối đa — 128.000 token so với 65.536; mô hình Anthropic có mức trần gần gấp đôi

• Phương thức đầu vào — văn bản, hình ảnh và tệp so với văn bản, hình ảnh, video, âm thanh và tệp

Sau đó là so sánh theo từng tác vụ, từ cùng một bên đánh giá, trong cùng một tuần, ở cấu hình nỗ lực tối đa ở cả hai phía: 7,60 USD cho Claude Sonnet 5.5 so với 0,67 USD cho Gemini 3.1 Pro. Gấp mười một lần. Cơ chế này được ghi lại trên cùng trang chứ không phải suy đoán — Sonnet 5.5 đã tạo ra 410 triệu token trên toàn bộ bộ chỉ mục, so với mức trung vị 88 triệu của nhóm còn lại, điều mà bên đánh giá mô tả là rất dài dòng, trong khi Gemini 3.1 Pro được mô tả là khá súc tích. Khi một mô hình viết nhiều gấp mấy lần mô hình kia, lợi thế 17% về mức giá đầu ra không thể đứng vững khi chạm mặt hóa đơn.

Bài học này khái quát vượt ra ngoài hai mô hình đó: bảng giá định giá một token, còn bạn bị tính phí cho công việc đã hoàn thành. Bất kỳ so sánh nào chỉ dừng lại ở bảng giá đều đang đo lường sai đại lượng.

Ranh giới bậc tại 200.000 token

Giá của Gemini 3.1 Pro không đồng nhất, và mức tăng giá đủ lớn để đảo ngược một số phần trong so sánh ở trên. Với prompt dưới 200.000 token, mức giá là $2.00 cho đầu vào và $12.00 cho đầu ra, cùng $0.20 cho đọc cache. Trên mốc đó, toàn bộ lệnh gọi được tính lại giá ở mức $4.00 cho đầu vào, $18.00 cho đầu ra và $0.40 cho đọc cache — mức giá đầu vào tăng gấp đôi, lên đúng gấp hai lần mức của Claude Sonnet 5.5, và đầu ra chuyển từ rẻ hơn 17% ở phía Anthropic thành đắt hơn 80% ở phía Google.

Ranh giới đó không hề kỳ lạ. Một prompt 200.000 token là một codebase nhỏ, một bộ hợp đồng dài, vài giờ bản ghi, hoặc một agent đã hoạt động được một lúc. Công việc ngữ cảnh dài chính là thứ mà cửa sổ 1M token được bán để phục vụ, vì vậy bậc được hưởng lợi nhiều nhất từ cửa sổ đó cũng chính là bậc mà lợi thế về giá biến mất. Nếu prompt của bạn thường xuyên vượt 200.000 token, hãy đánh giá Gemini 3.1 Pro ở mức $4.00 và $18.00, không phải ở mức giá trên trang đích.

Ghi cache xứng đáng có một câu riêng, vì chúng đảo chiều theo hướng ngược lại và vẫn tồn tại qua thay đổi bậc. Ở mức $0.375 mỗi triệu so với $2.50, Gemini rẻ hơn nhiều để nạp đầy một cache, và mức giá đó không thay đổi khi bạn vượt qua ranh giới. Với một agent xây dựng lại một tiền tố lớn mỗi lượt thay vì tái sử dụng một tiền tố, dòng duy nhất đó có thể là một lợi thế về cấu trúc lớn hơn cả mức giá đầu vào — và đó là dòng duy nhất trong so sánh này mà không ranh giới bậc nào chạm tới.

Giới hạn 65,536 token, và lý do nó quyết định kiến trúc

Con số thay đổi nhiều nhất những gì bạn có thể xây dựng là đầu ra tối đa: 65.536 token trên Gemini 3.1 Pro so với 128.000 trên Claude Sonnet 5.5. Mức trần không phải là một chỉ số hiệu năng; nó là một ràng buộc về việc một tác vụ có nằm gọn trong một lần gọi hay không.

Bất cứ thứ gì tạo ra một sản phẩm đầu ra lớn — một tệp nguồn hoàn chỉnh, một báo cáo dài, một tài liệu đầy đủ, một tập dữ liệu có cấu trúc — vượt quá 65.536 token trong trường hợp của Gemini đều phải được phân rã thành một chuỗi lời gọi với trạng thái được truyền giữa chúng. Việc phân rã tốn thêm token đầu vào ở mỗi bước, thêm mã điều phối, và thêm một chế độ lỗi mới tại các mối nối, nơi một đoạn kết thúc và đoạn tiếp theo bắt đầu. Một ràng buộc thứ hai càng làm trầm trọng thêm điều đó: tài liệu của chính Anthropic đặt ngưỡng thực tế của Sonnet 5.5 cho công việc dài đáng tin cậy cao hơn đáng kể, còn mức trần của Gemini là mức chặt hơn trong hai, thấp hơn một nửa. Nếu sản phẩm đầu ra dài nhất của bạn là 40.000 token, phần này không liên quan và bạn nên so sánh dựa trên chi phí mỗi tác vụ. Nếu là 100.000, mức trần đã quyết định thay bạn rồi.

Phương thức, trục duy nhất mà Gemini sở hữu hoàn toàn

Gemini 3.1 Pro chấp nhận video và âm thanh; Claude Sonnet 5.5 chấp nhận văn bản, hình ảnh và tệp, đồng thời không thể nhận cả hai. Đối với một tác vụ được xây dựng xoay quanh nội dung đa phương tiện — bản ghi cuộc gọi, ảnh chụp màn hình, video sản phẩm, âm thanh cuộc họp — không có sự thay thế nào trong cặp này, và việc so sánh giá là không còn ý nghĩa vì chỉ một trong hai điểm cuối có thể chấp nhận đầu vào ngay từ đầu. Đối với các tác vụ văn bản và hình ảnh, các tập khả năng trùng nhau và phép tính giá ở trên sẽ chi phối.

Một con số vận hành khác của Gemini đáng được nêu rõ vì rất dễ bị bỏ sót trên một trang vốn mở đầu bằng trí tuệ: danh mục của chúng tôi đo độ trễ token đầu tiên trung vị là 10.000 ms ở p50 và tốc độ đầu ra gần 1.283 token mỗi giây, với tỷ lệ lỗi trong bảy ngày là 56,8%. Đó là một mô hình cực nhanh với tỷ lệ thất bại quan sát được rất cao — một sự kết hợp phù hợp với công việc theo lô có ngân sách thử lại dồi dào hơn nhiều so với bất kỳ việc gì mà người dùng đang chờ đợi. Claude Sonnet 5.5 là cấu hình chậm hơn, ổn định hơn khi so sánh. Tỷ lệ lỗi không xuất hiện trên trang đích của cả hai nhà cung cấp; đó là kiểu số liệu chỉ hiện ra khi các ứng viên nằm sau một endpoint duy nhất đo lường chúng, và đây là một lý do để đánh giá cả hai từ một nơi thay vì hai bảng điều khiển.

Định tuyến cái gì đến đâu

Hãy gửi nó đến Claude Sonnet 5.5 khi công việc là văn bản hoặc hình ảnh, khi mức chất lượng yêu cầu đủ cao đến mức khoảng cách chỉ số hai mươi sáu điểm trở nên quan trọng, khi các sản phẩm đầu ra đủ dài để cần đến giới hạn 128.000 token, hoặc khi khối lượng công việc mang tính tương tác và tỷ lệ lỗi 56,8% là không thể chấp nhận. Với các tác vụ có cấu trúc, có giới hạn, hình phạt vì dài dòng tạo ra con số $7,60 phần lớn biến mất, và lợi thế trên mỗi token trở thành tiền thật.

Hãy gửi nó đến Gemini 3.1 Pro khi đầu vào chứa video hoặc âm thanh, khi prompt vẫn ở dưới 200.000 token và khối lượng lớn, khi bạn thường xuyên ghi những bộ đệm (cache) lớn và khoản ghi cache $0.375 cứ thế cộng dồn, hoặc khi tác vụ có dạng theo lô và chi phí trên mỗi tác vụ là cột duy nhất đáng quan tâm — ở mức $0.67 một tác vụ so với $7.60, bạn có thể thoải mái thử lại rất nhiều lần.

Cả hai đều có thể định tuyến trên OrcaRouter ngay hôm nay. google/gemini-3.1-pro-preview và anthropic/claude-sonnet-5 đều là các mục trong danh mục đang hoạt động trên cùng một thông tin xác thực, theo giá niêm yết của nhà cung cấp với mức chênh lệch 0%, nghĩa là sự phân tách ở trên có thể được biểu diễn dưới dạng một quy tắc định tuyến thay vì hai tích hợp riêng biệt — các yêu cầu dạng phương tiện thì gửi đến một điểm cuối, các yêu cầu văn bản-và-hình ảnh thì gửi đến điểm cuối còn lại, kèm cơ chế chuyển đổi dự phòng nếu một trong hai bắt đầu gặp lỗi. Claude Sonnet 5.5 hiện chưa phải là một tuyến trên nền tảng của chúng tôi; khi nó được đưa vào danh mục, quy tắc tương tự sẽ bao phủ nó mà không cần khóa mới.

Phán quyết trung thực cho màn đối đầu này: Claude Sonnet 5.5 là mô hình tốt hơn với khoảng cách lớn và cũng rẻ hơn trên mỗi token, còn Gemini 3.1 Pro rẻ hơn khoảng mười một lần trên mỗi tác vụ hoàn thành đối với công việc mở, rẻ hơn sáu lần để ghi một cache, và là mô hình duy nhất trong hai mô hình có thể xem video. Bất kỳ ai đọc bảng giá cho bạn đều đang mô tả một sự so sánh không tồn tại; sự so sánh tồn tại là về việc bạn có thể giới hạn những yêu cầu nào.

A two-column scoreboard for Claude Sonnet 5.5 and Gemini 3.1 Pro Preview across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column Gemini 3.1 Pro Preview: input $2.00 rising to $4.00 over 200K tokens, output $12.00 rising to $18.00, cache read $0.20, cache write $0.375, 1,048,576-token context with a 65,536-token max output, input modality text, image, video, audio and file, AA Intelligence Index v4.3 score 30, $0.67 per task on the index run. The card heading reads "Cheaper per token, eleven times dearer per finished task", and a footer line notes that Gemini 3.1 Pro remains a preview endpoint seven months after its February 19, 2026 announcement.Screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the model header, the 1,048,576-token context window, the 65,536-token maximum output, audio, file, image, text and video input, the Vision, Audio, Tools, JSON and Reasoning capability tags, a 10.00-second p50 time to first token, a "Public benchmarks by Google · 2026-02-19" line, and the $2.00 input and $12.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Gemini 3.1 Pro Preview, marked a proprietary model and released February 2026, showing In $2.00 and Out $12.00 with a 90% cache discount, the Intelligence Index score of 30, an output rate of 114 tokens per second, the $0.67 average cost per task, and 67M output tokens described as fairly concise against a median of 88M.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày