
GPT-6.1 Sol vs GPT-6 Luna: Mười ba điểm chỉ số, gấp mười lần tiền, và hai bài đánh giá mà nó không giữ vững
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
OpenAI đã phát hành GPT-6.1 Sol vào ngày 29 tháng 9 năm 2026, một tuần sau khi GPT-6 Luna ra mắt vào ngày 22 tháng 9 trong cùng chu kỳ keynote. Chúng là hai đầu của cùng một thế hệ: Luna là hạng rẻ, Sol là hạng trung ở trên nó, và GPT-6 Astra nằm trên cả hai. Chênh lệch giá giữa hai mô hình là một bậc độ lớn — 0,10 USD và 0,50 USD mỗi triệu token so với 2,00 USD và 10,00 USD, đầu vào lưu trong bộ nhớ đệm 0,01 USD so với 0,10 USD — và chênh lệch năng lực trên bảng độc lập là 13,7 điểm Chỉ số Thông minh, 51,8 so với 38,1 ở mức nỗ lực suy luận tối đa. Gấp mười lần số tiền cho mười ba điểm là khoảng tỷ giá trao đổi tệ nhất trong đội hình OpenAI hiện tại. Điều khiến việc so sánh đáng để viết đến là câu hỏi bốn mươi đô la tiếp theo: mười ba điểm nào?
Hai người mẫu, và tuần lễ giữa họ
GPT-6 Luna là mô hình nhỏ thuộc thế hệ GPT-6 — mô hình mà OpenAI mô tả là được xây dựng cho công việc khối lượng lớn, nhạy cảm với độ trễ: phân loại, trích xuất, định tuyến, tóm tắt hàng loạt, vòng lặp bên trong của một tác nhân. Nó có cửa sổ ngữ cảnh 1.050.000 token và giới hạn đầu ra 128.000 token, nhận văn bản, hình ảnh và tệp làm đầu vào, đồng thời giữ nguyên thang mức nỗ lực đầy đủ sáu bậc bao gồm cả mức không, mà bậc 6.1 đã bỏ. Bảng giá là lý do nó tồn tại: $0.10 cho đầu vào và $0.50 cho đầu ra mỗi triệu token, đầu vào được lưu đệm ở mức $0.01 và ghi bộ đệm ở mức $0.125, với bước giá ngữ cảnh dài trên 272.000 token đầu vào lên $0.20, $0.75 và $0.02 cho đầu vào được lưu đệm.
GPT-6.1 Sol là bản làm mới tầm trung ra mắt một tuần sau đó. Cùng cửa sổ, cùng giới hạn đầu ra, cùng các phương thức đầu vào, mốc cắt kiến thức ngày 30 tháng 4 năm 2026 so với mốc của Luna, và một thang mức nỗ lực bắt đầu từ low vì none và minimal đều bị loại thẳng. Nó được định giá ở mức $2.00 và $10.00 với đầu vào lưu đệm ở mức $0.10 — gấp hai mươi lần mức giá đầu vào của Luna và gấp hai mươi lần mức giá đầu ra của nó, cùng một dòng cache đắt hơn mười lần cho mỗi lần truy cập.
Cả hai đều đang được mở bán, cả hai đều có mặt trong ChatGPT Work và Codex cũng như API, và cả hai đều có thể được gọi thông qua cùng một key từ phía chúng tôi. Không có gì trong sự kết hợp này buộc bạn phải chọn.
Mười ba điểm chỉ số thực sự mua được những gì
Điểm tổng hợp là con số ít thông tin nhất trong phép so sánh, vì nó lấy trung bình trên những tác vụ có hành vi rất khác nhau. Khi chấm điểm từng đánh giá một ở mức nỗ lực suy luận tối đa trên Artificial Analysis v4.3.2, hình dạng thu được là sự phân tách chứ không phải một độ dốc:
• AA-LCR v1.1, suy luận ngữ cảnh dài — GPT-6 Luna 0.833 so với GPT-6.1 Sol 0.830. Luna nhỉnh hơn một chút.
• SciCode — GPT-6 Luna 0.546 so với GPT-6.1 Sol 0.542. Một lần nữa lại ngang bằng trên thực tế, và một lần nữa mô hình rẻ hơn lại nhỉnh hơn trên danh nghĩa.
• Terminal-Bench 4.0 — GPT-6 Luna 0.126 so với GPT-6.1 Sol 0.561. Chênh lệch 43 điểm; hai mô hình thuộc hai đẳng cấp khác nhau khi làm việc trên terminal.
• Humanity's Last Exam — GPT-6 Luna 0,385 so với GPT-6.1 Sol 0,529.
• AutomationBench-AA — GPT-6 Luna 0.532 so với GPT-6.1 Sol 0.649.
• GDPval-AA v2.1 — GPT-6 Luna đạt Elo 1437,1 so với GPT-6.1 Sol đạt Elo 1575,1, mức chênh lệch Elo 138 điểm trong công việc tri thức chuyên môn.
• GDP.pdf — GPT-6 Luna 0.228 so với GPT-6.1 Sol 0.310.
• CritPt — GPT-6 Luna 0.194 so với GPT-6.1 Sol 0.317.
• AA-Omniscience — GPT-6 Luna 0.65 so với GPT-6.1 Sol 41.5. Trên thang điểm mà ở đó 0 có nghĩa là số câu trả lời đúng bằng số câu trả lời sai, Luna đang ở ngay mức nước và Sol cao hơn mức đó một cách đáng kể.
• MMMU-Pro — GPT-6 Luna 0.797 so với GPT-6.1 Sol 0.860.
• Chi phí cho mỗi tác vụ lập chỉ mục, độc lập — GPT-6 Luna $0.068 so với GPT-6.1 Sol $0.72; khoảng cách khoảng gấp mười lần nghiêng về mô hình rẻ
• Số token đầu ra trong lượt chạy chỉ số — GPT-6 Luna 144 triệu so với GPT-6.1 Sol 67 triệu, so với trung vị của lớp là 100 triệu đối với Luna và khoảng 81 triệu đối với Sol
Hai trong số mười đánh giá là hòa, nghiêng về phía mô hình rẻ. Tám đánh giá thuộc về mô hình đắt tiền, và trong sáu trong số tám đó, mức chênh lệch không hề nhỏ. Đó là cách đọc trung thực về mười ba điểm: đây không phải là một thang bậc chất lượng đồng nhất, mà là hai năng lực — thực thi tác tử bền bỉ và độ tin cậy thông tin — nơi Luna đơn giản không thuộc cùng đẳng cấp mô hình, cùng một vùng giữa rộng lớn nơi sự khác biệt là có thật nhưng đủ nhỏ để trở nên vô hình trong bộ đánh giá của chính bạn.
Kết quả AA-LCR đáng được lưu ý một điều, bởi vì đó là con số tôn vinh Luna nhiều nhất. Suy luận ngữ cảnh dài ở mức 0,833 là một điểm số mạnh và hai mô hình chỉ cách nhau chưa đầy nửa điểm, nhưng bài kiểm chuẩn này đo khả năng truy xuất và suy luận trên các đầu vào dài, chứ không đo khả năng hành động xuyên suốt một phiên dài. Khoảng cách trên Terminal-Bench 4.0 mới là hình ảnh của việc "hành động xuyên suốt một phiên dài" khi được chấm điểm, và nó lên tới 43 điểm.

Phép tính chi phí trên mỗi tác vụ, và khi nào nó không còn đúng nữa
Artificial Analysis định giá mỗi lần chạy chỉ số dựa trên mức tiêu thụ token đo được, nên con số chi phí không phải là suy diễn từ bảng giá niêm yết. Lần chạy của GPT-6 Luna tốn $0,068 mỗi tác vụ; của GPT-6.1 Sol tốn $0,72. Tỷ lệ là 10,7×, chỉ kém một chút so với tỷ lệ giá danh nghĩa gấp hai mươi lần, đơn thuần vì Luna đã tạo ra 144 triệu token đầu ra trong lần chạy đó, so với 67 triệu của Sol — mô hình rẻ hơn nói nhiều hơn gấp đôi, và điều đó làm xói mòn lợi thế của chính nó. Dù vậy, thứ hạng không hề sát nhau, và trên một khối lượng công việc trả lời ngắn, khoảng cách đó sẽ nới rộng: khối lượng đầu ra ít hơn nghĩa là hình phạt vì nói dài dòng của Luna thu nhỏ lại trong khi lợi thế về giá của nó giữ nguyên.
Chỗ mà phép toán không còn đúng là bất kỳ khối lượng công việc nào mà chỉ số này không phản ánh được. Nếu tác vụ của bạn là một chỉnh sửa ở quy mô toàn kho mã, đòi hỏi hai mươi lệnh gọi công cụ phải được duy trì nhất quán, thì một mô hình giá $0,07 thất bại ở tác vụ đó sẽ khiến bạn tốn toàn bộ vòng thử lại cộng thêm thời gian chờ thực tế, còn mô hình $0,72 chỉ cần hoàn thành một lần lại rẻ hơn. Cách định vị khi ra mắt của chính GPT-6.1 Sol hoàn toàn được xây dựng trên ý tưởng này — chi phí cho mỗi tác vụ đã hoàn thành — và đó mới là cách định vị đúng đắn: phép so sánh thích hợp không phải là đơn giá token, mà là chi phí kỳ vọng cho mỗi kết quả, và với những tác vụ mà Luna không thể hoàn thành thì kỳ vọng đó là vô hạn.
Hai chi tiết cấu trúc làm rõ thêm ranh giới. Thứ nhất, bước ngữ cảnh dài: cả hai mô hình đều định giá lại khi vượt trên 272.000 token đầu vào, Luna lên 0,20 USD và 0,75 USD, còn Sol lên 4,00 USD và 15,00 USD, nên khoảng cách tuyệt đối nới rộng tại ranh giới thay vì thu hẹp, nhưng mức giá đã định giá lại của Luna vẫn thấp hơn một bậc độ lớn so với mức giá tiêu chuẩn của Sol. Thứ hai, và dễ bị bỏ sót: thang mức nỗ lực không cùng hình dạng. Luna chấp nhận none; Sol thì không. Một chuỗi dự phòng định tuyến tới Sol trước và chuyển về Luna khi lỗi hoặc hết thời gian chờ không được mang reasoning.effort của yêu cầu đi qua nguyên trạng, vì một cấu hình hợp lệ trên mô hình này lại trả về lỗi trên mô hình kia. Đó là vấn đề của lớp định tuyến, không phải vấn đề chất lượng mô hình, và đó chính xác là kiểu việc mà một endpoint duy nhất với quy tắc định tuyến đáng lẽ phải xử lý.
Chạy cả hai mới là mục đích, không phải là sự phòng hờ
Cả hai mô hình đều có trên OrcaRouter theo đúng giá niêm yết của chính OpenAI, không cộng thêm gì: GPT-6 Luna ở mức $0.10 và $0.50 với đầu vào được lưu cache ở mức $0.01, GPT-6.1 Sol ở mức $2.00 và $10.00 với đầu vào được lưu cache ở mức $0.10, và bước 272.000 token trên mỗi mô hình được chuyển nguyên xi đúng như nhà cung cấp niêm yết. Vì nền tảng chuyển nguyên giá niêm yết của nhà cung cấp thay vì đánh lên giá, tỷ lệ gấp hai mươi lần trong bài viết này chính là tỷ lệ bạn thực sự phải trả, ở cả hai phía.

Lý do đáng quan tâm ở đây cụ thể là cặp đôi này là một cascade đang chờ được viết ra. Một bộ phân loại, một bộ định tuyến, một tác vụ trích xuất hàng loạt và một coding agent quy mô repo không thuộc về cùng một model, và khoảng cách giá đủ lớn đến mức chọn sai theo hướng nào cũng đắt đỏ — gấp hai mươi lần chi phí mỗi lần gọi theo một hướng, còn hướng kia là một tác vụ thất bại. Một key, hai model, cùng một quy tắc đẩy lưu lượng dễ sang Luna và chuyển cấp lên Sol khi lớp tác vụ thay đổi hoặc khi đầu ra của Luna không vượt qua một bước kiểm tra, chỉ là một thay đổi cấu hình về phía chúng ta chứ không phải một hợp đồng nhà cung cấp thứ hai. Cơ chế chuyển đổi dự phòng tự động bao phủ trường hợp một trong hai bị suy giảm, mà với một model mới ra mắt cách đây tám ngày thì đó vẫn là một khả năng có thật.

Quyết định, chỉ trong một lượt
• Phân loại, trích xuất, định tuyến, tóm tắt hàng loạt, vòng lặp nội bộ của tác nhân — GPT-6 Luna, và hãy ngừng đọc tiếp. Với mức $0.10/$0.50 cùng một xu cho mỗi lần đọc từ bộ nhớ đệm, mười ba điểm chỉ số về năng lực tổng quát không đáng để đội hóa đơn lên gấp mười lần cho những công việc mà câu trả lời ngắn gọn và có thể kiểm chứng được.
• Lập trình quy mô repo, tác nhân terminal, thực thi đa bước — GPT-6.1 Sol. Khoảng cách 43 điểm trên Terminal-Bench 4.0 chính là toàn bộ lý lẽ; đây là năng lực mà cái giá đang mua.
• Câu hỏi về công việc tri thức, nơi một câu trả lời sai gây tốn kém — GPT-6.1 Sol, về khoảng cách AA-Omniscience và GDPval-AA. Điểm độ tin cậy thực tế của Luna đang ở ngay mức ngưỡng.
• Đầu vào dài với câu trả lời ngắn được tạo ra — GPT-6 Luna. Nó suy luận trên ngữ cảnh dài ngang bằng với một mô hình có chi phí đắt gấp hai mươi lần, và hình phạt dài dòng 144 triệu token của nó không bao giờ có cơ hội được áp dụng.
• Bất cứ thứ gì đã đặt thành none — hãy ở lại Luna, hoặc dự trù ngân sách cho sự thay đổi. Bậc đó không tồn tại trên GPT-6.1 Sol.
• Các bề mặt nhạy cảm với độ trễ — GPT-6 Luna, theo chính số đo của bảng xếp hạng: 129.4 token đầu ra mỗi giây và 100 giây cho chunk đầu tiên, so với 59.7 và 332 của Sol.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
