
GPT-6 Luna vs DeepSeek V4 Pro: Một điểm chỉ số, giá gấp năm lần, và luận cứ cho việc tự sở hữu trọng số
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Đây là con số lẽ ra phải quyết định cuộc so tài này nhưng lại không: GPT-6 Lunađạt 37 điểm trên Artificial Analysis Intelligence Index ở mức nỗ lực tối đa. DeepSeek V4 Prođạt 36 điểm trên cùng bản sửa đổi chỉ số, cũng ở mức nỗ lực tối đa. Cách nhau một điểm, trên một chỉ số tổng hợp mà ở đó một điểm nằm trong ngưỡng nhiễu của một lần chạy lại — và hai mô hình chênh nhau khoảng năm lần về giá. GPT-6 Luna niêm yết ở mức $0.10 mỗi triệu token đầu vào và $0.50 mỗi triệu token đầu ra. DeepSeek V4 Pro 0813 niêm yết ở mức $0.66 và $1.98 ngoài giờ cao điểm, tăng gấp đôi lên $1.32 và $3.96 trong khung giờ cao điểm của nó.
Nếu đó là toàn bộ câu chuyện, bài viết này sẽ chỉ dài một đoạn và kết thúc bằng “hãy dùng GPT-6 Luna”. Đó không phải là toàn bộ câu chuyện, và lý do nằm ở một khía cạnh mà sự so sánh đảo ngược hoàn toàn: trọng số của DeepSeek V4 Pro là mở và được cấp phép MIT. Mô hình tốn kém gấp năm lần cho mỗi token lại chính là mô hình mà bạn được phép tải xuống, sửa đổi, tinh chỉnh và chạy trên phần cứng của riêng mình mãi mãi. Đó không phải là một chú thích nhỏ cho lập luận về giá — đối với một nhóm người mua cụ thể, đó là toàn bộ lập luận, và sự ra mắt ngày 22 tháng 9 của GPT-6 Luna càng làm điều đó rõ nét hơn thay vì giải quyết nó.
Những gì đã được phát hành, và khi nào
GPT-6 Luna là mô hình thuộc phân khúc nhỏ của OpenAI, ra mắt ngày 22 tháng 9 năm 2026, cùng với GPT-6 Sol ở mức $2.00/$10.00 và nằm dưới mô hình chủ lực GPT-6 Astra ở mức $10.00/$50.00. OpenAI mô tả đây là mô hình hiệu quả nhất của công ty cho các tác vụ tập trung, khối lượng lớn. Mô hình có cửa sổ ngữ cảnh 1.050.000 token với đầu vào tối đa 922.000 token và giới hạn đầu ra 128.000 token, chấp nhận văn bản và hình ảnh, đồng thời cho phép chọn mức nỗ lực suy luận từ none đến low, medium, high, xhigh và max — với medium là mặc định.
DeepSeek V4 Pro 0813 là bản GA của mô hình thế hệ thứ tư chủ lực của DeepSeek, được công bố vào ngày 13 tháng 8 năm 2026, thay thế bản xem trước tháng Tư dưới cùng định danh deepseek-v4-pro. Đây là một mô hình mixture-of-experts chỉ xử lý văn bản với 1,6 nghìn tỷ tham số tổng cộng và 49 tỷ tham số hoạt động, cửa sổ ngữ cảnh 1M token, và giới hạn đầu ra 384.000 token hào phóng bất thường — gấp ba lần của GPT-6 Luna. Các trọng số đã được đăng lên Hugging Face với tên deepseek-ai/DeepSeek-V4-Pro-0813 khoảng nửa ngày sau khi API ra mắt: 66 shard fp8, không hạn chế truy cập, MIT. Trang danh mục của chính chúng tôi cho mô hình vẫn ghi ngày xem trước tháng Tư thay vì ngày GA tháng Tám, điều đáng để biết nếu bạn đang đọc ngày từ các trang sản phẩm thay vì ghi chú phát hành.
Cả hai đều lấy suy luận làm trọng tâm và có ngữ cảnh dài. Chỉ một trong hai là tệp mà bạn có thể cầm trên tay.
Bảng giá, nói thật lòng.
Mỗi chiều một dòng, cả hai mặt trên mỗi dòng:
• Đầu vào mỗi 1M — GPT-6 Luna $0.10 so với DeepSeek V4 Pro $0.66 giờ thấp điểm / $1.32 giờ cao điểm
• Output trên mỗi 1M — GPT-6 Luna $0.50 so với DeepSeek V4 Pro $1.98 ngoài giờ cao điểm / $3.96 giờ cao điểm
• Đầu vào đã lưu đệm — GPT-6 Luna 0,01 USD mỗi 1M, mức giảm 90% so với đơn giá của chính nó, trong khi DeepSeek V4 Pro có mức giảm giá bộ đệm 97%, tỷ lệ phần trăm chiết khấu sâu hơn nhưng trên một nền giá cao hơn
• Khung giờ cao điểm — GPT-6 Luna không có, ổn định suốt cả ngày so với DeepSeek V4 Pro tăng gấp đôi trong khoảng 01:00-04:00 và 06:00-10:00 UTC
• Điều khoản ngữ cảnh dài — GPT-6 Luna tăng gấp đôi input và cache và đẩy output lên 1,5 lần khi input trên 272K, áp dụng cho toàn bộ yêu cầu, so với DeepSeek V4 Pro không có phụ phí ngữ cảnh dài được công bố trên card của nó
• Ngữ cảnh và đầu ra — GPT-6 Luna 1.050.000 vào / 128.000 ra so với DeepSeek V4 Pro 1.048.576 vào / 384.000 ra
• AA Intelligence Index — GPT-6 Luna 37 ở mức nỗ lực tối đa so với DeepSeek V4 Pro 36 ở mức nỗ lực tối đa, cùng bản sửa đổi chỉ số
• Điểm ở mức nỗ lực mặc định — GPT-6 Luna 29 ở mức trung bình so với DeepSeek V4 Pro 36 ở thiết lập tối đa của nó, mức nỗ lực mà Artificial Analysis đo được
• Công tắc tắt suy luận — GPT-6 Luna từ không đến tối đa so với DeepSeek V4 Pro chỉ có thấp, cao và tối đa
• Chi phí chạy chỉ mục — GPT-6 Luna $122.39 so với DeepSeek V4 Pro $1,122.27
• Trọng số — GPT-6 Luna đóng, chỉ qua API so với DeepSeek V4 Pro mở, theo giấy phép MIT, có thể tự lưu trữ
• Trên OrcaRouter — GPT-6 Luna không có trong danh mục của chúng tôi so với DeepSeek V4 Pro có thể định tuyến theo giá niêm yết của DeepSeek

Đọc những dòng đó cùng nhau, và cục diện hiện ra thật bất thường: mô hình đóng rẻ hơn ở mọi dòng tính theo token, ngoại trừ phần đầu vào được cache, còn mô hình mở lại thắng ở độ dài đầu ra, ở hành vi với ngữ cảnh dài, và ở đúng một thứ hoàn toàn không thể định giá theo token.
Vì sao khoảng cách một điểm không phải là vấn đề chính
Một điểm chênh lệch trên một chỉ số tổng hợp không phải là khác biệt về năng lực mà bạn có thể hành động dựa trên đó, và cần nói thẳng rằng đây là con số ít thú vị nhất trong bài viết. Tuy nhiên, có hai điều về nó thực sự quan trọng.
Điều đầu tiên là bản sửa đổi chỉ số thay đổi. Những ảnh chụp trước đó của cùng một đánh giá cho điểm nỗ lực tối đa của DeepSeek V4 Pro cao hơn đáng kể so với mức 36 mà bản ghi nhận hôm nay của chúng tôi cho thấy, và các con số của GPT-6 Astra trôi dạt qua 52,8, 53 và 54,7 trong tài liệu được công bố trong vòng một tháng. Bất kỳ so sánh nào dựa vào khoảng cách chính xác giữa hai mô hình trên một chỉ số luân chuyển đều đang dựa vào thứ sẽ không đứng yên. Cách hiểu trung thực là hai mô hình này nằm trong cùng một dải năng lực ở mức trần của chúng, và chỉ số không thể cho bạn biết mô hình nào tốt hơn cho tác vụ của bạn.
Điều thứ hai là mặc định về mức nỗ lực, và ở đây khoảng cách là có thật. 37 của GPT-6 Luna là con số ở mức nỗ lực tối đa. Mặc định của nó là trung bình, ở đó nó đạt 29. 36 của DeepSeek V4 Pro cũng là con số ở mức nỗ lực tối đa của nó, và đó cũng là thiết lập mà Artificial Analysis đã chạy nó. Một đội triển khai GPT-6 Luna mà không thay đổi gì đang chạy 29 đối đầu với 36 — một mức hụt bảy điểm theo sai hướng, và là kiểu điều xuất hiện dưới dạng “mô hình rẻ thì tệ hơn” trong một buổi hậu kiểm sản xuất, khi vấn đề thực sự lại nằm ở một giá trị mặc định.
Trọng số mở thực sự đáng giá bao nhiêu
Đây là lúc việc so sánh giá không còn thuần túy là số học nữa mà trở thành một câu hỏi về doanh nghiệp của bạn. Các trọng số được cấp phép MIT đem lại cho bạn bốn thứ, và mỗi thứ đều có một cái giá không bao giờ xuất hiện trên bảng giá.
Điều đầu tiên là mức sàn về chi phí. Định giá theo token là thuê; trọng số là tài sản. Nếu khối lượng của bạn đủ lớn để một lượng GPU cố định thắng hóa đơn tính theo mức dùng, thì DeepSeek V4 Pro là mô hình duy nhất trong hai mô hình này có lựa chọn đó. Với mức giá của GPT-6 Luna, điểm hòa vốn còn ở rất xa — mức giá đầu vào được cache một xu thực sự khó bị đánh bại bằng silicon đi thuê — nhưng “ở rất xa” là một phát biểu khác với “bất khả thi,” và đó là một cánh cửa một chiều: bạn có thể chuyển từ tự vận hành sang API bất cứ lúc nào, còn bạn không thể đi theo hướng ngược lại.
Điều thứ hai là sự độc lập khỏi lộ trình của nhà cung cấp. Mức giá khuyến mại của GPT-5.6 Luna có thời hạn hết hiệu lực được nêu rõ. Còn giá của GPT-6 Luna là vĩnh viễn, theo OpenAI — nhưng sự vĩnh viễn là một lời hứa về một mô hình mà nhà cung cấp có thể cho ngừng cung cấp bất cứ khi nào họ ra mắt bản kế nhiệm. Một mô hình do bạn tự vận hành thì không thể bị ngừng hỗ trợ ngay dưới chân bạn. Với bất kỳ ai từng bị buộc phải di chuyển khỏi một mô hình đóng, điều đó đáng giá hơn cả một hệ số năm lần về token.
Thứ ba là dữ liệu. Nếu lời nhắc chứa tài liệu không thể rời khỏi hạ tầng của bạn, thì việc so sánh dừng lại ở đây và không quan trọng GPT-6 Luna tốn bao nhiêu.
Điều thứ tư là bạn có thể tinh chỉnh nó. GPT-6 Luna hoàn toàn không khả dụng để tinh chỉnh — nó chỉ có Chat Completions, Responses và Batch, và danh sách chỉ có vậy. Trọng số của DeepSeek V4 Pro có thể được huấn luyện trên phân phối của riêng bạn, điều mà với một tác vụ hẹp, khối lượng lớn thường là một lợi ích lớn hơn bất kỳ điểm chỉ số đa dụng nào.
Đối lại với tất cả những điều đó, lập luận của GPT-6 Luna là nó rẻ hơn khoảng năm lần trên hỗn hợp đầu vào-đầu ra theo tỷ lệ 3:1 vào giờ thấp điểm và rẻ hơn gần mười lần trong giờ cao điểm của DeepSeek, rằng giá đầu vào được lưu trữ của nó chỉ bằng một phần mười mức giá đầu vào vốn đã thấp của nó, rằng nó có thể được yêu cầu ngừng suy luận hoàn toàn, và rằng giá niêm yết của nó không tăng gấp đôi hai lần một ngày. Đối với một khối lượng công việc không có ràng buộc về lưu trú dữ liệu, không có yêu cầu tinh chỉnh, và không có nhu cầu vận hành cơ sở hạ tầng suy luận, đó là một câu trả lời đơn giản.
Sự di cư nhỏ hơn mức chênh lệch giá gợi ý.
Việc chuyển đổi giữa hai lựa chọn này gần với một thay đổi cấu hình hơn là một cuộc chuyển đổi nền tảng. Cả hai đều dùng dạng chat completions tương thích với OpenAI, đều có cửa sổ ngữ cảnh cỡ 1M, và các kiểu lỗi đều là những kiểu bạn sẽ lường trước được chứ không phải mang tính cấu trúc.
Hai trong số đó đáng để lưu tâm trước khi bạn chuyển lưu lượng. Điều khoản ngữ cảnh dài của GPT-6 Luna là điều khoản đắt đỏ: vượt qua 272.000 token đầu vào và toàn bộ yêu cầu sẽ được định giá lại thành gấp đôi đối với đầu vào và cache, cùng gấp 1,5 lần đối với đầu ra, vì vậy một lệnh gọi 300.000 token tốn gấp đôi so với cùng lệnh gọi đó khi chia làm hai. DeepSeek V4 Pro không có điều khoản như vậy, nghĩa là với những yêu cầu đơn lẻ thực sự khổng lồ, khoảng cách giá gấp năm lần nhỏ hơn vẻ ngoài của nó và có thể đảo ngược trong một lệnh gọi vào giờ cao điểm. Và giới hạn đầu ra là một ràng buộc cứng chứ không phải một tùy chọn: 128.000 token so với 384.000. Một pipeline tạo ra các tạo tác có cấu trúc dài có thể hoàn toàn không vừa với GPT-6 Luna, và không mức lợi thế giá nào khắc phục được điều đó.
DeepSeek V4 Pro có mặt trên OrcaRouter với đúng mức giá niêm yết của DeepSeek, cùng cơ chế định giá chuyển tiếp giúp mọi thay đổi giá từ nhà cung cấp được xử lý ngay trong ngày ở phía chúng tôi — điều này đặc biệt đáng quan tâm với một model mà mức giá vốn đã thay đổi giữa giờ cao điểm và giờ thấp điểm. GPT-6 Luna hiện chưa có trong danh mục của chúng tôi tại thời điểm viết bài này và phải truy cập qua API riêng của OpenAI, nên một nhóm muốn dùng cả hai chỉ cần một key cho DeepSeek V4 Pro bên cạnh key mà họ vốn đã dùng cho OpenAI. Tự động chuyển đổi dự phòng chính là phần khẳng định được giá trị của nó trong sự kết hợp cụ thể này: một endpoint DeepSeek tự vận hành hoặc của bên thứ ba bị suy giảm chính là tình huống mà bạn muốn tuyến được chuyển hướng mà không cần triển khai lại.

Ai nên chọn cái nào
Chọn DeepSeek V4 Pro nếu bất kỳ điều nào sau đây là đúng. Prompt không thể rời khỏi hạ tầng của bạn. Bạn cần tinh chỉnh. Bạn tạo ra đầu ra dài hơn 128.000 token. Các yêu cầu của bạn thường xuyên vượt quá 272.000 token đầu vào. Hoặc khối lượng của bạn đủ lớn đến mức bạn thà mua GPU hơn là thuê token, và bạn muốn có tùy chọn thực hiện chuyển đổi đó sau này mà không cần viết lại ứng dụng.
Chọn GPT-6 Luna nếu không mục nào trong số đó áp dụng và khối lượng công việc của bạn có lượng lớn, do chương trình tiêu thụ và ngắn. Phân loại, trích xuất, định tuyến, tóm tắt hàng loạt, vòng lặp bên trong của một agent. Với mức $0.10/$0.50, giá đầu vào được lưu cache là một xu và Batch chỉ bằng một nửa giá, bài toán chênh lệch không hề sát nút, và khác biệt một điểm chỉ số ở nỗ lực tối đa sẽ không thấy được trong bài đánh giá của bạn. Hãy chạy ở mức medium, kiểm tra mức giảm hai điểm trên Coding Agent Index dựa trên các bài kiểm thử của riêng bạn thay vì biểu đồ của nhà cung cấp, và giữ các lệnh gọi dài của bạn ở phía đúng của mốc 272.000 token.
Sai lầm cần tránh là coi mức chênh lệch giá gấp năm lần là câu trả lời. Nó là câu trả lời cho một câu hỏi — một token tốn bao nhiêu — và nó không nói gì về bốn câu hỏi quyết định liệu bạn còn có thể chạy khối lượng công việc này trong hai năm nữa hay không.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
