
GPT-5.6 Luna vs Claude Haiku 4.5: Phân khúc giá rẻ, hai hóa đơn rất khác nhau
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
GPT-5.6 Luna và Claude Haiku 4.5 là các hạng rẻ của hai dòng mô hình tiên phong khác nhau, và khoảng cách giữa chúng phụ thuộc hoàn toàn vào việc bạn nhìn vào con số nào. Về giá niêm yết, đây là một thắng lợi áp đảo: 0,20 USD cho mỗi triệu token đầu vào so với 1,00 USD. Còn xét theo chi phí của Artificial Analysis cho mỗi tác vụ Intelligence Index đã hoàn thành, con số là 0,18 USD so với 0,21 USD — chênh lệch khoảng 14%. Vẫn là hai mô hình đó, hai câu trả lời trung thực, và lý do chúng khác nhau chính là điều hữu ích nhất cần hiểu trước khi bạn chọn một trong hai.
Bản ngắn gọn: Luna là mô hình mạnh hơn trên lý thuyết và nhanh hơn về thông lượng, nhưng nó suy nghĩ lâu và tính phí cho việc đó. Haiku 4.5 thì cũ hơn, phạm vi nhỏ hơn, và dễ dự đoán hơn đáng kể về chi phí cho một yêu cầu. Việc điều nào trong số đó quan trọng hơn là đặc điểm của khối lượng công việc của bạn, chứ không phải của các mô hình.
Tổng quan
• Nhà cung cấp — OpenAI so với Anthropic
• Phát hành — ngày 9 tháng 7 năm 2026 so với ngày 15 tháng 10 năm 2025
• Cửa sổ ngữ cảnh — 1M token so với 200K token
• Đầu ra tối đa — 128K token so với 64K token
• Đầu vào — văn bản, hình ảnh và tệp so với văn bản, hình ảnh và PDF
• Giá mỗi triệu token — 0,20 USD vào / 1,20 USD ra so với 1,00 USD vào / 5,00 USD ra
• Artificial Analysis Intelligence Index — 38, thứ 4 trong 177 so với 18, thứ 138 trong 200 (cả hai đều ở cấu hình suy luận)
• Chi phí cho mỗi tác vụ Intelligence Index — $0.18 so với $0.21
• Tốc độ xuất — 109.4 token/giây so với 84.7 token/giây
• Điều khiển suy luận — một núm điều chỉnh mức nỗ lực từ none đến max, so với extended thinking được bật thủ công, không có tham số nỗ lực
• Mốc kiến thức đáng tin cậy — Tháng 2 năm 2026 so với Tháng 2 năm 2025 (dữ liệu huấn luyện đến tháng 7 năm 2025)
• Cam kết nghỉ hưu — không công bố so với không sớm hơn ngày 15 tháng 10 năm 2026
Nơi GPT-5.6 Luna thực sự chiến thắng

Về năng lực, cách biệt là quá lớn. Chỉ số Intelligence Index 38 so với 18 không phải là một so sánh sít sao. Luna xếp hạng cao hơn Haiku trên chỉ số tổng hợp mà Artificial Analysis xây dựng từ các đánh giá về suy luận, kiến thức, toán học và lập trình, và làm được như vậy dù là mô hình rẻ hơn trên mỗi token. Bất kỳ ai lần cuối so sánh hai dòng mô hình này trên chỉ số trước tháng 9 — khi Luna đạt 51 và 52 — nên lưu ý rằng toàn bộ thang điểm đã được chấm lại vào tháng 9 năm 2026, và lợi thế của Luna vẫn giữ được sau lần chấm lại đó.
Ngữ cảnh, gấp năm lần. Cửa sổ 1M token so với 200K tự nó đã quyết định cả một nhóm công việc: quét toàn bộ kho mã, các bộ tài liệu dài, những bản ghi hội thoại agent kéo dài mà trên Haiku sẽ cần phải tóm tắt. Nếu ứng dụng của bạn được định hình bởi lượng ngữ cảnh mà nó phải chứa, thì phép so sánh dừng lại ở đây.
Dư địa đầu ra, gấp đôi. Mức tối đa 128K token đầu ra so với 64K có ý nghĩa quan trọng đối với việc tạo nội dung dài và đối với các vòng lặp tác tử trả về kế hoạch có cấu trúc thay vì câu trả lời chỉ một dòng.
Thông lượng. 109,4 token đầu ra mỗi giây so với 84,7 là một sự khác biệt thực sự đối với các giao diện truyền phát, mặc dù nó không đồng nghĩa với khả năng phản hồi — xem phần độ trễ bên dưới.
Giá cả, ngay trên nhãn dán.Rẻ hơn năm lần ở đầu vào và rẻ hơn khoảng bốn lần ở đầu ra không phải là một sai số làm tròn, và với những công việc có đầu ra ngắn thì đó chính là toàn bộ quyết định.
Nơi Claude Haiku 4.5 vẫn giữ được vị trí của mình
Chi phí có thể dự đoán được. Lý luận của Haiku 4.5 là dạng suy nghĩ mở rộng mà bạn bật thủ công. Khi tắt đi, nó trả lời trực tiếp và tính phí theo cách dễ dự đoán. Núm điều chỉnh nỗ lực của GPT-5.6 Luna có thể lên tới mức tối đa, và mỗi bước tăng thêm đều là thêm token đầu ra ở mức giá đầu ra. Một nhóm muốn có mức trần chi phí có thể nêu ra trước sẽ thấy Haiku dễ suy tính hơn, ngay cả khi giá niêm yết cao hơn.
Cấu hình không suy luận thực sự rẻ để chạy. Artificial Analysis chấm điểm cấu hình không suy luận của Claude 4.5 Haiku ở mức Intelligence Index là 15, không có số liệu chi phí mỗi tác vụ nào được công bố, và nó phù hợp một cách hợp lý cho những công việc mà yêu cầu chỉ đơn giản là "phân tích chính xác nội dung này" — phân loại ý định, trích xuất trường, quyết định định tuyến, phân loại kiểm duyệt. Với những tác vụ đó, khoảng cách chỉ số giữa 15 và 38 phần lớn là không đáng kể, vì cả hai mô hình đều không được yêu cầu phải suy nghĩ.
Bộ nhớ đệm và chiết khấu theo lô đã chín muồi. Haiku 4.5 có mức chiết khấu 90% khi đọc bộ đệm prompt và chiết khấu 50% trên Batch API. Luna có kinh tế bộ đệm tương đương, nên đây gần như là thế hòa hơn là một lợi thế — nhưng nếu pipeline của bạn vốn đã xử lý theo lô qua bộ công cụ của Anthropic, thì chi phí chuyển đổi khỏi Haiku là một chi phí thực sự, và nó sẽ không hiện ra trên bất kỳ bảng đánh giá nào.
Một bề dày vận hành thực tế. Haiku 4.5 đã được đưa vào vận hành từ tháng 10 năm 2025 và có cam kết ngừng hỗ trợ được công bố là không sớm hơn ngày 15 tháng 10 năm 2026. Luna mới chỉ hai tháng tuổi. Với một khối lượng công việc mà ở đó mô hình chỉ là một chi tiết chứ không phải là sản phẩm, lịch sử vận hành mười một tháng mang một giá trị mà không bài kiểm chuẩn nào có thể diễn đạt được.
Đó là mô hình trung thực hơn, xét trên trục duy nhất đo lường được điều đó. Cuộc so sánh đối đầu của Artificial Analysis đưa Luna dẫn trước ở gần như mọi hạng mục năng lực — AA-Briefcase 1.339 so với 614, GDPval-AA v2 1.489 so với 854, AutomationBench-AA 50% so với 3%, Humanity's Last Exam 39% so với 10%, GDPpdf 24% so với 4%. Ngoại lệ là AA-Omniscience, chỉ số này phạt những câu trả lời sai nhưng tự tin ở các câu hỏi kiến thức: Luna đạt -10 ở đó, so với -4 của Haiku. Điểm âm nghĩa là hình phạt ảo giác lớn hơn điểm cộng cho độ chính xác, và hình phạt của Luna lớn hơn. Chỉ số tổng hợp cao hơn không đồng nghĩa với một câu trả lời đáng tin cậy hơn, và trên bài đánh giá duy nhất được xây dựng để phân biệt hai điều đó, mô hình cũ hơn làm tốt hơn.
Phép tính chi phí trên một khối lượng công việc thực tế
Hãy lấy một pipeline tiêu thụ 100 triệu token đầu vào và xuất ra 20 triệu token đầu ra mỗi tháng.
• GPT-5.6 Luna — 100 × $0.20 = $20, cộng thêm 20 × $1.20 = $24. Tổng cộng $44 mỗi tháng.
• Claude Haiku 4.5 — 100 × $1.00 = $100, cộng thêm 20 × $5.00 = $100. Tổng cộng $200 mỗi tháng.
Với những tỷ lệ đó, Luna rẻ hơn khoảng 4,5 lần, và đó là phép tính mà hầu hết các so sánh công bố. Giờ hãy thay đổi một giả định. Nếu mức nỗ lực suy luận của Luna được tăng lên, số token đầu ra của nó sẽ tăng, và đầu ra là phía đắt đỏ — ở mức $1,20, nó tốn gấp sáu lần so với đầu vào. Đẩy Luna đến mức nó phát ra 150 triệu token đầu ra cho cùng khối lượng công việc, giống như cách nó làm trên tập đánh giá của Artificial Analysis, và mức $44 trở thành vượt trên $180 một cách thoải mái. Mức 4,5 lần sụp đổ về phía ngang bằng.
Bài học không phải là Luna đắt. Mà là lợi thế về giá của Luna phụ thuộc vào việc nó “nói” bao nhiêu, một tham số do bạn kiểm soát. Hãy giảm suy luận cho trích xuất và phân loại thì mức chiết khấu là thật. Để nó ở mức tối đa cho mọi thứ thì bạn đã mua một mô hình có năng lực hơn với mức giá không còn giống với giá niêm yết của nó.
Độ trễ, và một con số mà bạn không nên tin tưởng
Các số liệu được công bố về thời gian đến token đầu tiên cho hai mô hình này gần như vô dụng, và đáng để hiểu vì sao. Trên Artificial Analysis, các cấu hình suy luận của cả hai mô hình đều cho thấy độ trễ token đầu tiên ở mức hàng chục hoặc thậm chí hàng trăm giây, bởi vì giàn thử nghiệm không phát ra token nào cho đến khi mô hình hoàn tất suy luận. Số liệu đó đo lường thiết lập đánh giá, chứ không phải khả năng phản hồi của mô hình.
Dữ liệu telemetry định tuyến là nguồn tốt hơn, vì nó đo lường mô hình trong môi trường vận hành thực tế. Số liệu của chính OrcaRouter cho thấy GPT-5.6 Luna đạt trung vị 1,83 giây để có token đầu tiên và phân vị 95 là 10,00 giây, so với Claude Haiku 4.5 ở mức trung vị 3,81 giây và 9,47 giây ở phân vị 95. Đọc một cách kỹ lưỡng, điều đó cho thấy hai mô hình gần nhau hơn mức mà các bảng xếp hạng gợi ý: Luna thắng ở yêu cầu điển hình, còn phần đuôi phân phối chỉ chênh nhau khoảng nửa giây. Nếu điều bạn quan tâm là trường hợp xấu nhất thay vì mức trung bình, thì giữa chúng có rất ít khác biệt.
Chọn cái nào?
Chọn GPT-5.6 Luna nếu bạn đang cần ngữ cảnh dài, nếu tác vụ hưởng lợi từ suy luận thực sự, nếu đầu ra dài hoặc có cấu trúc, hoặc nếu bạn muốn mô hình mạnh nhất hiện có ở mức giá thấp nhất trong khoảng giá. Đây cũng là lựa chọn tự nhiên hơn nếu phần còn lại trong hệ thống của bạn đã vận hành theo hành vi của dòng OpenAI.
Chọn Claude Haiku 4.5 nếu công việc của bạn có đầu ra ngắn và khối lượng lớn, nếu bạn cần một mức trần chi phí có thể nêu ra trước khi yêu cầu được chạy, nếu pipeline của bạn đã được xây dựng quanh tính năng xử lý theo lô và lưu đệm của Anthropic, hoặc nếu bạn coi trọng một mô hình có lịch sử vận hành thực tế cùng vòng đời được công bố hơn là một mô hình mới chỉ hai tháng tuổi.
Đừng chọn cái nào trong hai cho một tác vụ mà một mô hình suy luận nhỏ hoặc một bộ phân loại đã được tinh chỉnh có thể đảm nhiệm. Một phần lớn lưu lượng mà hai tầng này hấp thụ là phân loại và trích xuất, những việc sẽ chạy rẻ hơn trên một thứ hẹp hơn — và mô hình rẻ nhất luôn là mô hình bạn không cần đến.
Chạy cả hai trên một phím

Sự so kè này không còn mang tính độc quyền một khi cả hai đều có thể truy cập được qua một endpoint duy nhất. Trên OrcaRouter, Claude Haiku 4.5 và GPT-5.6 Luna nằm sau cùng một base URL tương thích với OpenAI — một API cho hơn 200 mô hình, một key, một dòng thanh toán, không cần hợp đồng thứ hai, và không cần thay đổi code nào ngoài mã định danh mô hình. Với một quyết định về tier mà bạn chưa chắc chắn, điều đó biến việc migration thành một giá trị cấu hình.
Hai tính năng thực sự tạo ra giá trị ở đây. Chuyển đổi dự phòng tự động giữa các nhà cung cấp nghĩa là một hạng dịch vụ chi phí thấp có thể gánh lưu lượng production mà không phụ thuộc vào một nhà cung cấp duy nhất — hữu ích khi mô hình đủ rẻ để bạn gửi hàng nghìn lời gọi mỗi giờ thay vì một lời gọi quan trọng. Và DSL định tuyến cho phép bạn ghép một lời gọi từ nhiều mô hình: định tuyến phần lớn yêu cầu đơn giản đến Luna, chuyển phần còn lại lên GPT-5.6 Terra, và giữ Haiku 4.5 trong nhóm như một phương án dự phòng khi bạn muốn câu trả lời từ nhà cung cấp thứ hai thay vì thử lại.
Hãy kiểm tra mức giá trực tiếp trên mỗi token của GPT-5.6 Luna và Claude Haiku 4.5 trước khi đưa một trong hai vào lộ trình sản xuất — cả hai mức giá đều được chuyển thẳng với mức markup 0%, nên chúng thay đổi ngay ngày nhà cung cấp thay đổi, còn các dịch vụ theo dõi giá của bên thứ ba thì trễ từ vài ngày đến vài tuần.
Những câu hỏi thực sự đáng trả lời
GPT-5.6 Luna có thật sự rẻ hơn năm lần so với Claude Haiku 4.5 không? Đối với token đầu vào, đúng vậy — 0,20 USD so với 1,00 USD. Còn về chi phí hoàn thành cùng một tác vụ đã được đánh giá, thì không: 0,18 USD so với 0,21 USD. Khoảng cách giữa hai phát biểu đó chính là mức độ dài dòng của Luna. Nó tạo ra lượng token đầu ra gấp đôi Haiku để hoàn thành cùng một công việc, và token đầu ra có giá gấp sáu lần token đầu vào. Với những câu trả lời ngắn, mức giá niêm yết nhìn chung là trung thực. Với công việc nặng về suy luận thì không.
Tôi có thể điều chỉnh chi phí theo cùng một cách trên cả hai không? Không, và đây là khác biệt ít được nhắc đến nhất giữa chúng. Luna cung cấp một núm điều chỉnh reasoning effort với các thiết lập từ none đến max, nên chi phí và chất lượng được đánh đổi một cách rõ ràng theo từng yêu cầu. Extended thinking của Haiku 4.5 hoặc được bật, kèm một ngân sách token, hoặc là không — không có tham số effort. Nếu việc kiểm soát chi phí theo từng yêu cầu quan trọng với bạn, chỉ một trong hai cái này cho bạn đòn bẩy đó.
Còn với một bộ phân loại lưu lượng lớn thực hiện vài triệu lượt gọi mỗi ngày thì sao?Cả hai mô hình đều không cần suy luận cho việc này. Hãy chạy Haiku 4.5 với extended thinking được tắt, hoặc Luna với effort được đặt thành none, rồi so sánh về độ trễ và độ dài đầu ra thay vì chỉ số tổng hợp — đến lúc đó, những câu hỏi thực sự liên quan là token đầu tiên đến nhanh như thế nào và câu trả lời tốn bao nhiêu token, còn các benchmark về trí tuệ thì không còn giúp phân biệt được giữa chúng nữa.

Cái nào sẽ vẫn còn ở đây sau một năm nữa? Claude Haiku 4.5 có cam kết đã được công bố là không ngừng hỗ trợ trước ngày 15 tháng 10 năm 2026. OpenAI không công bố ngày tương đương cho GPT-5.6 Luna, và dòng GPT-5.6 đã có một thế hệ mới hơn ở phía trên là GPT-6 Astra. Cả hai đều không phải lý do để tránh Luna, nhưng nếu lộ trình của bạn giả định chân trời lập kế hoạch 11 tháng, thì đó là lý do để giữ mã định danh mô hình trong cấu hình thay vì mã hóa cứng.
Mức giá trực tiếp theo từng token cho GPT-5.6 Luna trên cùng một key, được chuyển nguyên giá với mức chênh lệch 0% và không phát sinh quan hệ thanh toán thứ hai.
Mức giá trực tiếp theo token cho Claude Haiku 4.5 trên cùng một endpoint, để hai hạng có thể được so sánh mà không cần hợp đồng thứ hai.
