Một thẻ tiêu đề so sánh GPT-5.6 Luna và Claude Haiku 4.5, cho thấy Luna có Chỉ số Thông minh là 38, cửa sổ ngữ cảnh 1M token và mức giá $0.20 cho đầu vào và $1.20 cho đầu ra trên mỗi triệu token, so với Haiku 4.5 có Chỉ số Thông minh là 18, ngữ cảnh 200K token và mức giá $1.00 cho đầu vào và $5.00 cho đầu ra.
Guides & Insights

GPT-5.6 Luna vs Claude Haiku 4.5: Phân khúc giá rẻ, hai hóa đơn rất khác nhau

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GPT-5.6 LunaClaude Haiku 4.5 là các hạng rẻ của hai dòng mô hình tiên phong khác nhau, và khoảng cách giữa chúng phụ thuộc hoàn toàn vào việc bạn nhìn vào con số nào. Về giá niêm yết, đây là một thắng lợi áp đảo: 0,20 USD cho mỗi triệu token đầu vào so với 1,00 USD. Còn xét theo chi phí của Artificial Analysis cho mỗi tác vụ Intelligence Index đã hoàn thành, con số là 0,18 USD so với 0,21 USD — chênh lệch khoảng 14%. Vẫn là hai mô hình đó, hai câu trả lời trung thực, và lý do chúng khác nhau chính là điều hữu ích nhất cần hiểu trước khi bạn chọn một trong hai.

Bản ngắn gọn: Luna là mô hình mạnh hơn trên lý thuyết và nhanh hơn về thông lượng, nhưng nó suy nghĩ lâu và tính phí cho việc đó. Haiku 4.5 thì cũ hơn, phạm vi nhỏ hơn, và dễ dự đoán hơn đáng kể về chi phí cho một yêu cầu. Việc điều nào trong số đó quan trọng hơn là đặc điểm của khối lượng công việc của bạn, chứ không phải của các mô hình.

Tổng quan

Nhà cung cấpOpenAI so với Anthropic

Phát hành — ngày 9 tháng 7 năm 2026 so với ngày 15 tháng 10 năm 2025

Cửa sổ ngữ cảnh — 1M token so với 200K token

Đầu ra tối đa — 128K token so với 64K token

Đầu vào — văn bản, hình ảnh và tệp so với văn bản, hình ảnh và PDF

Giá mỗi triệu token — 0,20 USD vào / 1,20 USD ra so với 1,00 USD vào / 5,00 USD ra

Artificial Analysis Intelligence Index — 38, thứ 4 trong 177 so với 18, thứ 138 trong 200 (cả hai đều ở cấu hình suy luận)

Chi phí cho mỗi tác vụ Intelligence Index — $0.18 so với $0.21

Tốc độ xuất — 109.4 token/giây so với 84.7 token/giây

Điều khiển suy luận — một núm điều chỉnh mức nỗ lực từ none đến max, so với extended thinking được bật thủ công, không có tham số nỗ lực

Mốc kiến thức đáng tin cậy — Tháng 2 năm 2026 so với Tháng 2 năm 2025 (dữ liệu huấn luyện đến tháng 7 năm 2025)

Cam kết nghỉ hưu — không công bố so với không sớm hơn ngày 15 tháng 10 năm 2026

Nơi GPT-5.6 Luna thực sự chiến thắng

Screenshot of an Artificial Analysis head-to-head between GPT-5.6 Luna (max) and Claude 4.5 Haiku (Reasoning). The Intelligence Index row reads 38 against 18, AA-Briefcase 1339 against 614, GDPval-AA v2 1489 against 854, AutomationBench-AA 50% against 3%, Terminal-Bench v4.0 12% against 0%, SciCode 54% against 42%, Humanity's Last Exam 39% against 10%, GDPpdf 24% against 4%, CritPt 21% against 0%, AA-Omniscience -10 against -4, and AA-LCR v1.1 84% against 74%. The Cost section shows a blended price per 1M tokens of $0.174 against $0.77.

Về năng lực, cách biệt là quá lớn. Chỉ số Intelligence Index 38 so với 18 không phải là một so sánh sít sao. Luna xếp hạng cao hơn Haiku trên chỉ số tổng hợp mà Artificial Analysis xây dựng từ các đánh giá về suy luận, kiến thức, toán học và lập trình, và làm được như vậy dù là mô hình rẻ hơn trên mỗi token. Bất kỳ ai lần cuối so sánh hai dòng mô hình này trên chỉ số trước tháng 9 — khi Luna đạt 51 và 52 — nên lưu ý rằng toàn bộ thang điểm đã được chấm lại vào tháng 9 năm 2026, và lợi thế của Luna vẫn giữ được sau lần chấm lại đó.

Ngữ cảnh, gấp năm lần. Cửa sổ 1M token so với 200K tự nó đã quyết định cả một nhóm công việc: quét toàn bộ kho mã, các bộ tài liệu dài, những bản ghi hội thoại agent kéo dài mà trên Haiku sẽ cần phải tóm tắt. Nếu ứng dụng của bạn được định hình bởi lượng ngữ cảnh mà nó phải chứa, thì phép so sánh dừng lại ở đây.

Dư địa đầu ra, gấp đôi. Mức tối đa 128K token đầu ra so với 64K có ý nghĩa quan trọng đối với việc tạo nội dung dài và đối với các vòng lặp tác tử trả về kế hoạch có cấu trúc thay vì câu trả lời chỉ một dòng.

Thông lượng. 109,4 token đầu ra mỗi giây so với 84,7 là một sự khác biệt thực sự đối với các giao diện truyền phát, mặc dù nó không đồng nghĩa với khả năng phản hồi — xem phần độ trễ bên dưới.

Giá cả, ngay trên nhãn dán.Rẻ hơn năm lần ở đầu vào và rẻ hơn khoảng bốn lần ở đầu ra không phải là một sai số làm tròn, và với những công việc có đầu ra ngắn thì đó chính là toàn bộ quyết định.

Nơi Claude Haiku 4.5 vẫn giữ được vị trí của mình

Chi phí có thể dự đoán được. Lý luận của Haiku 4.5 là dạng suy nghĩ mở rộng mà bạn bật thủ công. Khi tắt đi, nó trả lời trực tiếp và tính phí theo cách dễ dự đoán. Núm điều chỉnh nỗ lực của GPT-5.6 Luna có thể lên tới mức tối đa, và mỗi bước tăng thêm đều là thêm token đầu ra ở mức giá đầu ra. Một nhóm muốn có mức trần chi phí có thể nêu ra trước sẽ thấy Haiku dễ suy tính hơn, ngay cả khi giá niêm yết cao hơn.

Cấu hình không suy luận thực sự rẻ để chạy. Artificial Analysis chấm điểm cấu hình không suy luận của Claude 4.5 Haiku ở mức Intelligence Index là 15, không có số liệu chi phí mỗi tác vụ nào được công bố, và nó phù hợp một cách hợp lý cho những công việc mà yêu cầu chỉ đơn giản là "phân tích chính xác nội dung này" — phân loại ý định, trích xuất trường, quyết định định tuyến, phân loại kiểm duyệt. Với những tác vụ đó, khoảng cách chỉ số giữa 15 và 38 phần lớn là không đáng kể, vì cả hai mô hình đều không được yêu cầu phải suy nghĩ.

Bộ nhớ đệm và chiết khấu theo lô đã chín muồi. Haiku 4.5 có mức chiết khấu 90% khi đọc bộ đệm prompt và chiết khấu 50% trên Batch API. Luna có kinh tế bộ đệm tương đương, nên đây gần như là thế hòa hơn là một lợi thế — nhưng nếu pipeline của bạn vốn đã xử lý theo lô qua bộ công cụ của Anthropic, thì chi phí chuyển đổi khỏi Haiku là một chi phí thực sự, và nó sẽ không hiện ra trên bất kỳ bảng đánh giá nào.

Một bề dày vận hành thực tế. Haiku 4.5 đã được đưa vào vận hành từ tháng 10 năm 2025 và có cam kết ngừng hỗ trợ được công bố là không sớm hơn ngày 15 tháng 10 năm 2026. Luna mới chỉ hai tháng tuổi. Với một khối lượng công việc mà ở đó mô hình chỉ là một chi tiết chứ không phải là sản phẩm, lịch sử vận hành mười một tháng mang một giá trị mà không bài kiểm chuẩn nào có thể diễn đạt được.

Đó là mô hình trung thực hơn, xét trên trục duy nhất đo lường được điều đó. Cuộc so sánh đối đầu của Artificial Analysis đưa Luna dẫn trước ở gần như mọi hạng mục năng lực — AA-Briefcase 1.339 so với 614, GDPval-AA v2 1.489 so với 854, AutomationBench-AA 50% so với 3%, Humanity's Last Exam 39% so với 10%, GDPpdf 24% so với 4%. Ngoại lệ là AA-Omniscience, chỉ số này phạt những câu trả lời sai nhưng tự tin ở các câu hỏi kiến thức: Luna đạt -10 ở đó, so với -4 của Haiku. Điểm âm nghĩa là hình phạt ảo giác lớn hơn điểm cộng cho độ chính xác, và hình phạt của Luna lớn hơn. Chỉ số tổng hợp cao hơn không đồng nghĩa với một câu trả lời đáng tin cậy hơn, và trên bài đánh giá duy nhất được xây dựng để phân biệt hai điều đó, mô hình cũ hơn làm tốt hơn.

Phép tính chi phí trên một khối lượng công việc thực tế

Hãy lấy một pipeline tiêu thụ 100 triệu token đầu vào và xuất ra 20 triệu token đầu ra mỗi tháng.

GPT-5.6 Luna — 100 × $0.20 = $20, cộng thêm 20 × $1.20 = $24. Tổng cộng $44 mỗi tháng.

Claude Haiku 4.5 — 100 × $1.00 = $100, cộng thêm 20 × $5.00 = $100. Tổng cộng $200 mỗi tháng.

Với những tỷ lệ đó, Luna rẻ hơn khoảng 4,5 lần, và đó là phép tính mà hầu hết các so sánh công bố. Giờ hãy thay đổi một giả định. Nếu mức nỗ lực suy luận của Luna được tăng lên, số token đầu ra của nó sẽ tăng, và đầu ra là phía đắt đỏ — ở mức $1,20, nó tốn gấp sáu lần so với đầu vào. Đẩy Luna đến mức nó phát ra 150 triệu token đầu ra cho cùng khối lượng công việc, giống như cách nó làm trên tập đánh giá của Artificial Analysis, và mức $44 trở thành vượt trên $180 một cách thoải mái. Mức 4,5 lần sụp đổ về phía ngang bằng.

Bài học không phải là Luna đắt. Mà là lợi thế về giá của Luna phụ thuộc vào việc nó “nói” bao nhiêu, một tham số do bạn kiểm soát. Hãy giảm suy luận cho trích xuất và phân loại thì mức chiết khấu là thật. Để nó ở mức tối đa cho mọi thứ thì bạn đã mua một mô hình có năng lực hơn với mức giá không còn giống với giá niêm yết của nó.

Độ trễ, và một con số mà bạn không nên tin tưởng

Các số liệu được công bố về thời gian đến token đầu tiên cho hai mô hình này gần như vô dụng, và đáng để hiểu vì sao. Trên Artificial Analysis, các cấu hình suy luận của cả hai mô hình đều cho thấy độ trễ token đầu tiên ở mức hàng chục hoặc thậm chí hàng trăm giây, bởi vì giàn thử nghiệm không phát ra token nào cho đến khi mô hình hoàn tất suy luận. Số liệu đó đo lường thiết lập đánh giá, chứ không phải khả năng phản hồi của mô hình.

Dữ liệu telemetry định tuyến là nguồn tốt hơn, vì nó đo lường mô hình trong môi trường vận hành thực tế. Số liệu của chính OrcaRouter cho thấy GPT-5.6 Luna đạt trung vị 1,83 giây để có token đầu tiên và phân vị 95 là 10,00 giây, so với Claude Haiku 4.5 ở mức trung vị 3,81 giây và 9,47 giây ở phân vị 95. Đọc một cách kỹ lưỡng, điều đó cho thấy hai mô hình gần nhau hơn mức mà các bảng xếp hạng gợi ý: Luna thắng ở yêu cầu điển hình, còn phần đuôi phân phối chỉ chênh nhau khoảng nửa giây. Nếu điều bạn quan tâm là trường hợp xấu nhất thay vì mức trung bình, thì giữa chúng có rất ít khác biệt.

Chọn cái nào?

Chọn GPT-5.6 Luna nếu bạn đang cần ngữ cảnh dài, nếu tác vụ hưởng lợi từ suy luận thực sự, nếu đầu ra dài hoặc có cấu trúc, hoặc nếu bạn muốn mô hình mạnh nhất hiện có ở mức giá thấp nhất trong khoảng giá. Đây cũng là lựa chọn tự nhiên hơn nếu phần còn lại trong hệ thống của bạn đã vận hành theo hành vi của dòng Open​AI.

Chọn Claude Haiku 4.5 nếu công việc của bạn có đầu ra ngắn và khối lượng lớn, nếu bạn cần một mức trần chi phí có thể nêu ra trước khi yêu cầu được chạy, nếu pipeline của bạn đã được xây dựng quanh tính năng xử lý theo lô và lưu đệm của Anthropic, hoặc nếu bạn coi trọng một mô hình có lịch sử vận hành thực tế cùng vòng đời được công bố hơn là một mô hình mới chỉ hai tháng tuổi.

Đừng chọn cái nào trong hai cho một tác vụ mà một mô hình suy luận nhỏ hoặc một bộ phân loại đã được tinh chỉnh có thể đảm nhiệm. Một phần lớn lưu lượng mà hai tầng này hấp thụ là phân loại và trích xuất, những việc sẽ chạy rẻ hơn trên một thứ hẹp hơn — và mô hình rẻ nhất luôn là mô hình bạn không cần đến.

Chạy cả hai trên một phím

Screenshot of the OrcaRouter model page for Claude Haiku 4.5, showing the model identifier anthropic/claude-haiku-4.5, a release date of 2025-10-15, a 200K-token context window, 64K maximum output, input pricing of $1.00 per million tokens, output pricing of $5.00, a median time to first token of 3.81 seconds and a 95th percentile of 9.47 seconds.

Sự so kè này không còn mang tính độc quyền một khi cả hai đều có thể truy cập được qua một endpoint duy nhất. Trên OrcaRouter, Claude Haiku 4.5 và GPT-5.6 Luna nằm sau cùng một base URL tương thích với OpenAI — một API cho hơn 200 mô hình, một key, một dòng thanh toán, không cần hợp đồng thứ hai, và không cần thay đổi code nào ngoài mã định danh mô hình. Với một quyết định về tier mà bạn chưa chắc chắn, điều đó biến việc migration thành một giá trị cấu hình.

Hai tính năng thực sự tạo ra giá trị ở đây. Chuyển đổi dự phòng tự động giữa các nhà cung cấp nghĩa là một hạng dịch vụ chi phí thấp có thể gánh lưu lượng production mà không phụ thuộc vào một nhà cung cấp duy nhất — hữu ích khi mô hình đủ rẻ để bạn gửi hàng nghìn lời gọi mỗi giờ thay vì một lời gọi quan trọng. Và DSL định tuyến cho phép bạn ghép một lời gọi từ nhiều mô hình: định tuyến phần lớn yêu cầu đơn giản đến Luna, chuyển phần còn lại lên GPT-5.6 Terra, và giữ Haiku 4.5 trong nhóm như một phương án dự phòng khi bạn muốn câu trả lời từ nhà cung cấp thứ hai thay vì thử lại.

Hãy kiểm tra mức giá trực tiếp trên mỗi token của GPT-5.6 Luna và Claude Haiku 4.5 trước khi đưa một trong hai vào lộ trình sản xuất — cả hai mức giá đều được chuyển thẳng với mức markup 0%, nên chúng thay đổi ngay ngày nhà cung cấp thay đổi, còn các dịch vụ theo dõi giá của bên thứ ba thì trễ từ vài ngày đến vài tuần.

Những câu hỏi thực sự đáng trả lời

GPT-5.6 Luna có thật sự rẻ hơn năm lần so với Claude Haiku 4.5 không? Đối với token đầu vào, đúng vậy — 0,20 USD so với 1,00 USD. Còn về chi phí hoàn thành cùng một tác vụ đã được đánh giá, thì không: 0,18 USD so với 0,21 USD. Khoảng cách giữa hai phát biểu đó chính là mức độ dài dòng của Luna. Nó tạo ra lượng token đầu ra gấp đôi Haiku để hoàn thành cùng một công việc, và token đầu ra có giá gấp sáu lần token đầu vào. Với những câu trả lời ngắn, mức giá niêm yết nhìn chung là trung thực. Với công việc nặng về suy luận thì không.

Tôi có thể điều chỉnh chi phí theo cùng một cách trên cả hai không? Không, và đây là khác biệt ít được nhắc đến nhất giữa chúng. Luna cung cấp một núm điều chỉnh reasoning effort với các thiết lập từ none đến max, nên chi phí và chất lượng được đánh đổi một cách rõ ràng theo từng yêu cầu. Extended thinking của Haiku 4.5 hoặc được bật, kèm một ngân sách token, hoặc là không — không có tham số effort. Nếu việc kiểm soát chi phí theo từng yêu cầu quan trọng với bạn, chỉ một trong hai cái này cho bạn đòn bẩy đó.

Còn với một bộ phân loại lưu lượng lớn thực hiện vài triệu lượt gọi mỗi ngày thì sao?Cả hai mô hình đều không cần suy luận cho việc này. Hãy chạy Haiku 4.5 với extended thinking được tắt, hoặc Luna với effort được đặt thành none, rồi so sánh về độ trễ và độ dài đầu ra thay vì chỉ số tổng hợp — đến lúc đó, những câu hỏi thực sự liên quan là token đầu tiên đến nhanh như thế nào và câu trả lời tốn bao nhiêu token, còn các benchmark về trí tuệ thì không còn giúp phân biệt được giữa chúng nữa.

A two-column comparison scoreboard for GPT-5.6 Luna and Claude Haiku 4.5. Luna's column reads Intelligence Index 38, context window 1M tokens, price $0.20/$1.20, cost per index task $0.18, output speed 109.4 tokens per second, reasoning control an effort dial from none to max. Haiku 4.5's column reads Intelligence Index 18, context window 200K tokens, price $1.00/$5.00, cost per index task $0.21, output speed 84.7 tokens per second, reasoning control extended thinking on or off.

Cái nào sẽ vẫn còn ở đây sau một năm nữa? Claude Haiku 4.5 có cam kết đã được công bố là không ngừng hỗ trợ trước ngày 15 tháng 10 năm 2026. OpenAI không công bố ngày tương đương cho GPT-5.6 Luna, và dòng GPT-5.6 đã có một thế hệ mới hơn ở phía trên là GPT-6 Astra. Cả hai đều không phải lý do để tránh Luna, nhưng nếu lộ trình của bạn giả định chân trời lập kế hoạch 11 tháng, thì đó là lý do để giữ mã định danh mô hình trong cấu hình thay vì mã hóa cứng.

Mức giá trực tiếp theo từng token cho GPT-5.6 Luna trên cùng một key, được chuyển nguyên giá với mức chênh lệch 0% và không phát sinh quan hệ thanh toán thứ hai.

Mức giá trực tiếp theo token cho Claude Haiku 4.5 trên cùng một endpoint, để hai hạng có thể được so sánh mà không cần hợp đồng thứ hai.