Một thẻ tiêu đề hero được tạo tự động hiển thị 'GPT-6 Luna vs Gemini 3.1 Pro', với phụ đề 'Một bản xem trước đã chạy được bảy tháng so với một mô hình GA ra mắt cách đây ba tuần.', cùng các chip cho thấy Luna ở mức $0.10/$0.50 mỗi 1M và GA kể từ ngày 22 tháng 9, Gemini 3.1 Pro ở mức $2.00/$12.00 mỗi 1M và đang trong giai đoạn xem trước kể từ ngày 19 tháng 2, và điểm chỉ số 37 so với 30, với logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

GPT-6 Luna so với Gemini 3.1 Pro: Bản xem trước bảy tháng tuổi có giá đầu vào gấp hai mươi lần

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mô hình suy luận tiên phong đã được dán nhãn "Preview" kể từ khi Gemini 3.1 Pro ra mắt vào ngày 19 tháng 2 năm 2026. Bảy tháng sau, nó vẫn là bản xem trước, vẫn ở mức 2,00 đô la cho mỗi triệu token đầu vào và 12,00 đô la cho mỗi triệu token đầu ra, và vẫn là thứ mà trang sản phẩm gọi là mô hình suy luận tiên phong của công ty. Vào ngày 22 tháng 9 năm 2026, nhà cung cấp đã phát hành GPT-6 Luna dưới dạng một hạng nhỏ sẵn có rộng rãi với giá 0,10 đô la và 0,50 đô la. Đặt hai bảng giá cạnh nhau và mô hình mới hơn, rẻ hơn, sẵn có rộng rãi này rẻ hơn hai mươi lần ở đầu vào và hai mươi bốn lần ở đầu ra — và nó đạt điểm cao hơn trên chỉ số độc lập mà bộ phận tiếp thị của cả hai nhà cung cấp đều quan tâm.

Mệnh đề cuối cùng đó là phần đáng để chậm lại mà suy ngẫm. GPT-6 Luna đo được 37 trên Artificial Analysis Intelligence Index ở mức nỗ lực tối đa. Gemini 3.1 Pro Preview đo được 30 trên cùng bản sửa đổi. Một mô hình được bán như lựa chọn hiệu quả cho khối lượng lớn lại dẫn trước bảy điểm so với một mô hình được bán như hệ thống suy luận tiên tiến, với giá đầu vào chỉ bằng một phần hai mươi. Đây không phải trường hợp một mô hình rẻ đang đuổi kịp một mô hình đắt. Ở khía cạnh cụ thể này, mô hình rẻ đơn giản là đang dẫn trước, còn mô hình đắt đã ở dạng xem trước suốt bảy tháng.

Kết luận tự nhiên — rằng Gemini 3.1 Pro bị định giá quá cao — cũng không hẳn đúng, và phần còn lại của bài viết này nói về ba điểm mà mô hình của Google xứng đáng với mức giá của nó, bởi vì chúng là thật và không hề nhỏ.

Năm điều quyết định điều đó

Trước khi đi vào chi tiết, đây là phiên bản ngắn gọn:

• GPT-6 Luna thắng về giá khoảng 20 lần ở đầu vào và 24 lần ở đầu ra, thắng với cách biệt lớn ở đầu vào đã lưu đệm, và thắng bảy điểm ở chỉ số đa dụng khi so sánh tại cùng mức nỗ lực tối đa.

• Gemini 3.1 Pro thắng thế về phương thức đầu vào — nó chấp nhận âm thanh và video, còn GPT-6 Luna thì không — và ở việc đã có thể truy cập trong bảy tháng, mà đối với một bản xem trước, đó là một thành tích vận hành thực tế dài.

• Giới hạn đầu ra không hề gần nhau ở cả hai hướng: GPT-6 Luna phát ra tối đa 128.000 token, Gemini 3.1 Pro tối đa 65.000.

• Cả hai đều có ranh giới tầng ngữ cảnh dài khiến toàn bộ yêu cầu được tính giá lại, ở mức 272.000 token đầu vào đối với GPT-6 Luna và khoảng 200.000 đối với Gemini 3.1 Pro.

• Cái bẫy nỗ lực mặc định chỉ áp dụng cho Luna: điểm 37 của nó là điểm ở mức nỗ lực tối đa, còn thiết lập mặc định mức trung bình đạt 29, thấp hơn mức 30 của Gemini 3.1 Pro.

Hai bảng giá và phép tính giữa chúng

Mỗi chiều một dòng, cả hai mặt trên mỗi dòng:

• Đầu vào mỗi 1M — GPT-6 Luna $0.10 so với Gemini 3.1 Pro $2.00

• Đầu ra trên mỗi 1M — GPT-6 Luna $0.50 so với Gemini 3.1 Pro $12.00

• Đầu vào đã lưu đệm — GPT-6 Luna $0.01 mỗi 1M, giảm giá 90% so với Gemini 3.1 Pro $0.20 mỗi 1M, giảm giá 90%

• Ranh giới ngữ cảnh dài — GPT-6 Luna trên 272K token đầu vào so với Gemini 3.1 Pro trên khoảng 200K token đầu vào

• Hiệu ứng ngữ cảnh dài — GPT-6 Luna 2x đầu vào và bộ nhớ đệm, 1,5x đầu ra, trên toàn bộ yêu cầu so với Gemini 3.1 Pro $4.00 vào / $18.00 ra, cũng trên toàn bộ yêu cầu

• Cửa sổ ngữ cảnh — GPT-6 Luna 1.050.000 token so với Gemini 3.1 Pro 1 triệu token

• Đầu ra tối đa — GPT-6 Luna 128.000 token so với Gemini 3.1 Pro 65.000 token

• Phương thức đầu vào — GPT-6 Luna văn bản và hình ảnh so với Gemini 3.1 Pro văn bản, hình ảnh, âm thanh, video và tệp

• Chỉ số AA Intelligence — GPT-6 Luna 37 ở mức nỗ lực tối đa, 29 ở mức mặc định so với Gemini 3.1 Pro 30

• Tốc độ đầu ra — GPT-6 Luna 153,9 token/giây so với Gemini 3.1 Pro khoảng 115-143 token/giây tùy thuộc vào bản snapshot

• Công tắc tắt suy luận — GPT-6 Luna từ none đến max so với Gemini 3.1 Pro ưu tiên suy luận, không có chế độ không suy luận nào được cung cấp

• Trạng thái — GPT-6 Luna chính thức có mặt rộng rãi kể từ 2026-09-22 so với Gemini 3.1 Pro đang trong giai đoạn xem trước kể từ 2026-02-19

A generated single-panel scoreboard card headed 'Two rate cards, seven months apart' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M and GA since September 22, 2026; Gemini 3.1 Pro $2.00 in / $12.00 out per 1M and in preview since February 19, 2026; Intelligence Index Luna 37 at max and 29 at default against Gemini 3.1 Pro's 30; input modality Luna text and image against Gemini 3.1 Pro's text, image, audio and video; maximum output Luna 128K tokens against Gemini 3.1 Pro's 65K; and a long-context clause that reprices the whole request on both. Footer: 'Index figures per Artificial Analysis; prices per OpenAI and Google.'

Hàng đáng chú ý không phải là giá. Mà là cặp hàng ở dưới cùng. Nhãn preview của Gemini 3.1 Pro không phải là chuyện hình thức — nó thay đổi nghĩa vụ của Google đối với bạn. Một mô hình preview có thể bị thay đổi, định giá lại hoặc rút lại mà không có thông báo ngừng hỗ trợ như một mô hình GA nhận được, và mức giá không đổi sau bảy tháng là một lời hứa mà chưa ai cam kết bằng văn bản. Mọi nội dung bên dưới về việc mô hình của Google là lựa chọn an toàn hơn cho môi trường production đều phải được đọc dưới lưu ý đó, bởi vì "bảy tháng ổn định" và "bảy tháng không có bảo đảm ổn định" là cùng một bảy tháng.

Nơi mô hình của Google kiếm được gấp hai mươi lần

Ba vị trí, và vị trí đầu tiên là thứ khép lại cuộc so sánh đối với một số đội một cách dứt khoát.

Phương thức. Gemini 3.1 Pro nhận đầu vào là âm thanh và video. GPT-6 Luna nhận văn bản và hình ảnh. Nếu pipeline của bạn tiếp nhận bản ghi cuộc gọi, ảnh chụp màn hình hoặc video, thì không có phiên bản nào của cuộc so tài này mà chênh lệch giá lại quan trọng, bởi vì một trong hai mô hình không thể đảm nhận công việc đó. Đó không phải là khoảng cách điểm chuẩn có thể thu hẹp qua một bản phát hành nhỏ; đó là một năng lực hoặc có, hoặc không, và đó là lý do mạnh mẽ nhất khiến bảng giá của Google trụ vững khi đối diện với một quy trình mua sắm thực tế.

Giới hạn đầu ra, ở chiều ngược lại. Các mức trần đầu ra cắt theo hướng ngược lại so với phương thức đầu vào, và lần này nó có lợi cho OpenAI. GPT-6 Luna phát ra tối đa 128.000 token trong một phản hồi; Gemini 3.1 Pro tối đa 65.000. Nếu bạn đang tạo ra các sản phẩm có cấu trúc dài — một tài liệu đầy đủ, một đợt tái cấu trúc lớn, một bản vá nhiều tệp — thì mức trần của Google chỉ bằng khoảng một nửa của OpenAI, và một pipeline bị cắt cụt ở 65.000 token thì coi như hỏng, bất kể nó trả bao nhiêu cho mỗi token.

Công việc tiên phong về đa phương thức. Định vị của Gemini 3.1 Pro là một mô hình suy luận mà tình cờ có khả năng đa phương thức, và hệ quả thực tế là những tác vụ đòi hỏi suy luận trên một sơ đồ, một biểu đồ hay một bản ghi màn hình sẽ được giao cho nó thay vì cho một tầng nhỏ ưu tiên văn bản. GPT-6 Luna chấp nhận hình ảnh, nên ranh giới không chỉ nằm ở âm thanh và video — mà là ở chỗ mô hình của Google được xây dựng cho suy luận thị giác và âm thanh như một trường hợp sử dụng chính, còn mô hình của OpenAI được xây dựng để tối ưu thông lượng.

Nơi mà gói rẻ thực sự thua kém, và đó không phải ở chỗ bạn tưởng.

Mức effort mặc định chính là cái bẫy trong cặp so sánh này, và ở đây nó cắn đau hơn so với khi đối đầu một đối thủ yếu hơn. Điểm chỉ số headline của GPT-6 Luna là 37, được đo ở mức reasoning effort tối đa. Mặc định của nó là medium, và ở mức medium nó đạt 29 — kém một điểm so với 30 của Gemini 3.1 Pro. Vậy nên khoảng cách bảy điểm mà bài viết này mở đầu thực chất chỉ là so sánh giữa trần của một mô hình với trần của một mô hình khác, và một đội ngũ cài đặt GPT-6 Luna rồi để nguyên cấu hình đang chạy một mô hình kém hơn của Google một chút, cũ hơn bảy tháng, vẫn đang trong giai đoạn preview, với mức giá chỉ bằng một phần hai mươi.

Với hầu hết khối lượng công việc, đó vẫn là sự đánh đổi đúng — một điểm chỉ số không phải là khác biệt về năng lực, còn mức chênh lệch giá gấp 20 lần thì có. Nhưng đó là một kiểu đánh đổi khác với kiểu mà các bảng giá quảng cáo, và nó vô hình trừ khi bạn chịu khó đi tìm tham số effort.

Điểm thứ hai mà hạng giá rẻ thua thiệt là phép tính ngữ cảnh dài. Cả hai mô hình đều định giá lại toàn bộ yêu cầu khi nó vượt qua một ngưỡng, thay vì phụ thu thêm cho phần vượt, và cả hai ngưỡng đều đủ thấp để gây ảnh hưởng: 272,000 token đầu vào trên GPT-6 Luna, khoảng 200,000 trên Gemini 3.1 Pro. Điều khoản của GPT-6 Luna tăng gấp đôi giá đầu vào và cache, đồng thời tăng giá đầu ra thêm một nửa. Điều khoản của Gemini 3.1 Pro đưa toàn bộ lượt gọi lên mức $4.00 cho đầu vào và $18.00 cho đầu ra. Không cái nào chỉ là khoản phụ thu nhỏ, và với một mô hình được bán dựa trên giá, điều khoản ấy chính là cái giá.

Thứ ba là tính dài dòng, đây là khoản chi phí không bao giờ xuất hiện trên bảng giá. Artificial Analysis đã đo được GPT-6 Luna tạo ra 150 triệu token đầu ra trong toàn bộ lượt chạy chỉ mục, so với mức trung vị là 85 triệu — mô hình này nói nhiều, và với mức $0.50 mỗi triệu token đầu ra thì đó là $75 tiền token, trong khi một mô hình súc tích sẽ chỉ tốn $42.50. Nó vẫn rẻ hơn một bậc độ lớn so với phương án thay thế. Đây cũng là lý do khiến các con số chi phí trên mỗi tác vụ và chi phí trên mỗi token kể những câu chuyện khác nhau, và là lý do bạn nên đo khối lượng đầu ra của chính mình trước khi mô phỏng khoản tiết kiệm.

Một cuộc di chuyển giữa chúng trông như thế nào

Mô hình của Google có thể truy cập được thông qua API riêng của nhà cung cấp và một số nền tảng bên thứ ba; GPT-6 Luna có thể truy cập được thông qua API riêng của OpenAI, và tại thời điểm viết bài này, không bên nào trong cặp đôi ấy là lựa chọn dễ hơn để chuẩn hóa. Cả hai đều cung cấp một bề mặt chat completions tương thích OpenAI, nghĩa là cấu trúc lời gọi không phải là vấn đề — mà là các tham số. Thang effort của GPT-6 Luna, điều khoản 272.000 token của nó, và yêu cầu rằng gọi hàm trên Chat Completions phải chạy với reasoning effort được đặt thành none đều là những hành vi mà Gemini 3.1 Pro không có, và một bản port chỉ thay đổi chuỗi mô hình sẽ tạo ra một lời gọi chạy được nhưng với cấu hình chi phí sai.

Gemini 3.1 Pro Preview có trên OrcaRouter với mức giá niêm yết của Google, theo cơ chế định giá chuyển tiếp, nghĩa là thay đổi mức giá của Google sẽ có hiệu lực ở phía chúng tôi ngay trong cùng ngày. GPT-6 Luna hiện chưa có trong danh mục của chúng tôi tại thời điểm viết bài này. Với một nhóm đang vận hành cả hai — mô hình của Google cho mọi thứ cần âm thanh hoặc video, mô hình của OpenAI cho văn bản khối lượng lớn — đó là một khóa cho Gemini 3.1 Pro song song với bất kỳ thứ gì bạn đã dùng cho OpenAI, với quyết định định tuyến được thể hiện dưới dạng cấu hình thay vì hai luồng mã. Đây là cặp đôi mà điều đó quan trọng nhất, bởi vì hai mô hình hoàn toàn không thể hoán đổi cho nhau: một tuyến phải lựa chọn giữa bản xem trước đa phương thức và một bậc nhỏ chỉ văn bản đã GA là một tuyến sẽ được quyết định lại mỗi lần một trong hai nhà cung cấp phát hành sản phẩm.

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

Điều gì sẽ thay đổi điều này

So sánh ở thời điểm hiện tại là một ảnh chụp nhanh của một khoảnh khắc bất thường: một mô hình GA từ tháng Chín đang đánh bại một mô hình xem trước từ tháng Hai trên chỉ số tổng quát với chi phí đầu vào chỉ bằng một phần hai mươi, trong khi lại thua kém về mô thức và về độ chín muồi mà một bản xem trước không bao giờ thực sự đạt được. Ba yếu tố sẽ làm thay đổi cục diện, và mỗi yếu tố đều đáng để theo dõi hơn là đoán mò.

Đầu tiên là việc Gemini 3.1 Pro rời khỏi giai đoạn preview. Một bản phát hành GA sẽ mang theo chính sách ngừng hỗ trợ, một bảng giá ổn định, và rất có thể là một đợt thay đổi giá — Google đã giữ mức $2.00/$12.00 suốt bảy tháng preview trong khi phần còn lại của thị trường giảm một nửa xung quanh mình, và sự kiềm chế đó phù hợp hơn với một mức giá ra mắt đang chờ ngày GA so với một lập trường đã được cân nhắc kỹ.

Thứ hai là liệu OpenAI có mở rộng thang nỗ lực Luna hay thay đổi giá trị mặc định của nó. Khoảng cách hai mươi hai điểm giữa điểm số nỗ lực tối đa của GPT-6 Luna và điểm số nỗ lực mặc định của nó là độ nhạy cấu hình lớn nhất trong bài viết này, và một thay đổi mặc định sẽ làm thay đổi năng lực hiệu dụng của mô hình đối với mọi người gọi chưa từng chạm tới tham số đó.

Thứ ba là khoảng cách phương thức. Đây là khía cạnh duy nhất ở đây không phải là vấn đề mức độ, và chính nó khiến việc này không thể chỉ là một phép so sánh giá trực tiếp. Cho đến khi một trong những mô hình này có thể làm được điều mà mô hình kia không thể, khoảng cách gấp hai mươi lần là một con số có thật, chỉ ra hai công việc khác nhau.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the Vision, Audio, Tools, JSON and Reasoning badges, a 2026-02-19 catalogue date, 65K maximum output, list pricing of $2.00 input and $12.00 output per 1M tokens, a p50 time to first token of 10.60s, 111.8M tokens of traffic, and the description of the model as Google's frontier reasoning model for software engineering and agentic reliability.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày