Một thẻ tiêu đề được tạo ghi 'Claude Haiku 5.5 vs GPT-6 Luna Pro' với phụ đề 'Một là mô hình bạn có thể gọi; cái kia là công tắc bạn có thể gạt', hai thẻ ghi 'Claude Haiku 5.5: phát hành ngày 7 tháng 10 năm 2026, $0.10 / $0.50 mỗi MTok' và 'GPT-6 Luna Pro: GPT-6 Luna với chế độ suy luận được đặt thành pro', và một dòng chân trang ghi 'Số liệu của nhà cung cấp theo Anthropic và OpenAI; số liệu độc lập theo Artificial Analysis.' Logo OrcaRouter thật được ghép ở góc dưới bên phải.
Guides & Insights

Claude Haiku 5.5 vs GPT-6 Luna Pro: Mô hình đối đầu Chế độ

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một bên trong so sánh này là một mô hình, còn bên kia là một thiết lập. Claude Haiku 5.5đã chính thức khả dụng rộng rãi vào ngày 7 tháng 10 năm 2026 với mức 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra, trên Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry và Claude Platform on AWS. GPT-6 Luna Prokhông phải là một mô hình: cách để có được nó là gọi GPT-6 Luna — đang hoạt động từ ngày 22 tháng 9 năm 2026 với cùng mức 0,10 USD và 0,50 USD — với reasoning.mode được đặt thành pro thay vì standard. Không hề có gpt-6-luna-pro nào là mã định danh trên trang mô hình của OpenAI. Vậy nên cách diễn đạt trung thực về cuộc đối đầu này không phải là "mô hình nào thắng" mà là "đâu là cách tốt hơn để tiêu mười xu cho mỗi triệu token đầu vào": một mô hình nhỏ với một nút điều chỉnh nỗ lực, hay một mô hình lớn hơn chạy ở chế độ làm nhiều việc hơn và tính tiền bạn cho những token mà nó không hiển thị cho bạn. Đối với công việc ngắn, khối lượng lớn, câu trả lời thường là cái thứ nhất. Đối với công việc khó, không thường xuyên, câu trả lời có thể là cái thứ hai — và con số quyết định điều đó, OpenAI vẫn chưa công bố.

"pro" là gì, về mặt cơ chế

Hướng dẫn suy luận của OpenAI nêu rằng các mô hình GPT-5.6 và GPT-6 hỗ trợ hai chế độ trong Responses API, standard (mặc định) và pro, được chọn thông qua reasoning.mode. Chế độ là một cơ chế điều khiển khác với reasoning.effort: chế độ quyết định mô hình thực hiện bao nhiêu công việc trước khi đưa ra câu trả lời, còn effort quyết định mức độ suy luận diễn ra bên trong chế độ mà bạn đã chọn. Các giá trị effort được tài liệu của GPT-6 Luna ghi nhận là none, low, medium (mặc định), high, xhigh và max, và bất kỳ giá trị nào trong số đó đều có thể được kết hợp với chế độ pro.

Về phần tính phí, hướng dẫn nói rõ ràng và hơi phản trực giác. Chế độ Pro gom toàn bộ công việc của mô hình đằng sau câu trả lời cuối cùng và tính phí những token đó “theo đơn giá token tiêu chuẩn của mô hình đã chọn”. Không có phụ phí Pro nào trên bảng giá. Chi phí xuất hiện dưới dạng khối lượng, vì chế độ Pro “thực hiện nhiều công việc mô hình hơn chế độ tiêu chuẩn, làm tăng mức sử dụng token và chi phí” — và token suy luận được tính phí như token đầu ra trong khi chỉ xuất hiện trong đối tượng usage dưới output_tokens_details.reasoning_tokens. Nếu bạn không đọc trường đó, mức tăng sẽ vô hình cho đến khi hóa đơn đến.

Từ đó có hai so sánh, và chúng đáng được tách riêng. So với GPT-6 Luna ở chế độ tiêu chuẩn, chế độ pro là cùng một mô hình với một hệ số nhân chưa rõ trên mức tiêu thụ token. So với Claude Haiku 5.5, nó cũng là một mô hình khác ở một quy mô khác — 1.050.000 token ngữ cảnh so với 1M, giới hạn đầu vào 922.000 token và mốc kiến thức ngày 18 tháng 5 năm 2026, ở một phân hạng mà tài liệu ra mắt của chính Anthropic định vị cao hơn một chút so với Haiku trong các công việc agent khó. Hai khác biệt này tác động cùng chiều về chi phí và ngược chiều về năng lực, đó là lý do không thể đọc ra cái nào trong hai từ một bảng giá.

Các bảng giá, đặt cạnh nhau

Cả hai mô hình đều được tính phí theo hai bậc, và các ngưỡng nằm ở những vị trí khác nhau — điều này quan trọng hơn cả mức giá niêm yết, bởi vì cả hai mức giá niêm yết đều giống hệt nhau.

• Đầu vào — Claude Haiku 5.5 $0.10 mỗi triệu token cho tới 100.000 token, $0.50 khi vượt mức đó. GPT-6 Luna $0.10 cho tới 272.000 token, $0.20 khi vượt mức đó.

• Đầu ra — Claude Haiku 5.5 0,50 đô la cho tối đa 100.000 token, 2,50 đô la nếu vượt quá. GPT-6 Luna 0,50 đô la cho tối đa 272.000 token, 0,75 đô la nếu vượt quá.

• Bộ nhớ đệm — Claude Haiku 5.5 đọc bộ nhớ đệm $0.01 và ghi $0.125 dưới ngưỡng, $0.05 và $0.625 trên ngưỡng. GPT-6 Luna đọc bộ nhớ đệm $0.01 và ghi $0.125 dưới 272,000 token, $0.02 và $0.25 trên mức đó.

• Ngữ cảnh và đầu ra — 1M token với đầu ra tối đa 128,000 cho Claude Haiku 5.5; 1,050,000 token với giới hạn đầu vào 922,000 token và đầu ra tối đa 128,000 cho GPT-6 Luna.

• Suy nghĩ — thích ứng đang bật. Claude Haiku 5.5 mặc định ở mức nỗ lực trung bình; GPT-6 Luna mặc định ở mức nỗ lực trung bình và chế độ tiêu chuẩn, với chế độ pro là tùy chọn bật thêm.

• Giảm giá theo lô và bộ nhớ đệm — Claude Haiku 5.5 giảm 50% trên Message Batches API; GPT-6 Luna giảm 50% trên Batch và Flex, tăng gấp đôi ở chế độ Fast, và cộng thêm 10% phụ phí cho xử lý theo khu vực.

Dòng duy nhất không cùng hình dạng là tokenizer. Tài liệu của Anthropic lưu ý rằng Claude Haiku 5.5 sử dụng tokenizer mới hơn, dùng chung với Claude 4.7 và các phiên bản sau, nên cùng một đoạn văn bản được tính thành khoảng 30% số token nhiều hơn so với trên Claude Haiku 4.5. Điều đó không làm thay đổi mức giá; nó thay đổi việc một prompt đạt đến mốc 100.000 token nhanh đến mức nào, và đó là một khác biệt chi phí thực sự mà không bảng giá nào hiển thị. Một prompt 90.000 token được đo khoảng 117.000 và phải trả $0.50 mỗi triệu token đầu vào thay vì $0.10 — mức gấp năm lần cho một prompt trông như thể đang thoải mái nằm dưới ngưỡng.

Giá của chế độ pro, tính bằng đơn vị duy nhất mà ai cũng dùng được

Vì hệ số nhân không được công bố, điều hữu ích cần nêu là mỗi token bổ sung tốn bao nhiêu, và sau đó là các khoảng hợp lý sẽ hoạt động thế nào ở quy mô lớn.

• Với mức 0,50 USD cho mỗi triệu token đầu ra của GPT-6 Luna, mỗi 10.000 token đầu ra tăng thêm cho một tác vụ tốn 0,005 USD. Chạy 100.000 tác vụ mỗi ngày thì phần tăng thêm đó là một tỷ token — khoảng 500 USD một ngày, hay 15.000 USD một tháng, trên một mô hình có mức giá quảng cáo chỉ 10 xu cho mỗi triệu token đầu vào.

• Để dễ hình dung, GPT-6 Luna ở mức nỗ lực tối đa đã tiêu tốn 140 triệu token đầu ra khi chạy Intelligence Index, so với mức trung vị 100 triệu — điều mà bên đánh giá mô tả là có phần dài dòng. Bảng công bố ra mắt của Anthropic, chạy trên harness của chính Anthropic, đặt GPT-6 Luna ở mức 16,4% trên Terminal-Bench 4.0 và 42,4% trên FrontierCode 1.1, so với 39,2% và 46,4% của Claude Haiku 5.5 — do nhà cung cấp tự báo cáo, bộ kiểm thử của một nhà cung cấp, và là mô hình của một đối thủ.

• Trên bảng độc lập, thứ tự xếp hạng có khoảng cách hẹp hơn. Artificial Analysis chấm Claude Haiku 5.5 ở Max effort 43 trên Intelligence Index v4.3.2, đứng thứ hai trong 182, và GPT-6 Luna (Max) ở 38, thứ tám trong 182. Cả hai con số đều ở chế độ standard, max-effort. Không có đánh giá độc lập nào về GPT-6 Luna ở chế độ pro: trang của nó không có mục pro, và Artificial Analysis cũng không liệt kê mục nào như vậy.

Vấn đề mang tính cấu trúc đối với chế độ pro là sự tương tác giữa hai điểm cuối cùng đó. Toàn bộ lợi thế chi phí của GPT-6 Luna so với Claude Haiku 5.5 đến từ hiệu quả token — 140 triệu token đầu ra so với 440 triệu cho cùng một bộ kiểm thử, ở mức giá như nhau, đó là lý do cùng một bài đánh giá tốn $0.07 mỗi tác vụ ở một bên và $0.21 ở bên kia. Chế độ pro, theo định nghĩa, là một chế độ phát ra nhiều token hơn. Bật nó lên là tắt đi thứ đã khiến mô hình trở nên rẻ trong so sánh này, và hệ số nhân cho biết mức độ rẻ hơn đó không được công bố. Đó không phải là lập luận rằng chế độ pro là một thỏa thuận tồi — với các tác vụ khó, nhiều công sức hơn thường là công việc tốt hơn — mà là lập luận rằng chế độ pro cạnh tranh về năng lực, không phải về giá, và nên được đánh giá so với các mô hình tầm trung mà nó có mức giá gần tương đương, thay vì so với tầng rẻ mà nó nằm trong đó.

A screenshot of OpenAI's developer documentation for GPT-6 Luna, showing the model identifier gpt-6-luna, a 1,050,000-token context window, a 922,000-token input limit, a 128,000-token output limit, a May 18, 2026 knowledge cutoff, reasoning effort values of none, low, medium, high, xhigh and max, and Standard pricing of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per million tokens. No pro model identifier appears on the page.

Nơi mỗi cái thực sự giành chiến thắng

Chỉ cần bóc tách đến tận cùng quyết định, sự phân chia sẽ thật rạch ròi, dù chẳng bên nào thoát khỏi những lưu ý kèm theo.

Claude Haiku 5.5 nắm giữ phân khúc giá rẻ. Nó nhanh hơn theo cả hai nghĩa quan trọng: 241,9 token đầu ra mỗi giây do Artificial Analysis đo được, so với 123,0 của GPT-6 Luna, và thời gian đến token đầu tiên là 295 giây trong lần chạy Index — đây là hệ quả của việc nó suy nghĩ bao lâu trước khi trả lời ở mức effort Max chứ không phải một con số về mạng. Bảng giá của nó đạt bậc thứ hai ở 100.000 token, và tokenizer của nó làm phồng prompt lên khoảng 30%, nên các workload có prompt dài phải trả nhiều hơn mức giá niêm yết gợi ý, ở cả hai khía cạnh. Đổi lại, nó mang đến lợi thế năm điểm về trí tuệ trên chỉ số độc lập và một nút điều chỉnh effort — từ Low đến Max — công cụ kiểm soát chi phí hữu ích nhất mà bất kỳ nhà cung cấp nào trong hai đưa ra kèm các bản ra mắt này. Ghim effort xuống thấp là cách bạn đánh đổi một phần trong lợi thế năm điểm đó để lấy con số chi phí trên mỗi tác vụ gần hơn với mức của GPT-6 Luna.

GPT-6 Luna Pro sở hữu phần khó nhất, với một hóa đơn chưa được định lượng. Mô hình bên dưới rẻ hơn trên mỗi token khi vượt 272.000 token đầu vào so với Claude Haiku 5.5 khi vượt 100.000, theo hệ số hai lần rưỡi ở đầu vào và ba và một phần ba ở đầu ra, và bậc đầu tiên của nó vươn xa hơn mười tám lần trong cửa sổ ngữ cảnh. Chế độ Standard rẻ hơn một cách đo lường được trên mỗi tác vụ đã hoàn thành. Chế độ Pro đánh đổi điều đó để có nhiều công việc hơn trên mỗi câu trả lời với cùng mức giá, và liệu nó có đánh bại Claude Haiku 5.5 ở Max effort hay một mô hình tầm trung trong một tác vụ nhất định hay không là câu hỏi mà không con số công bố nào trả lời được. Cách để trả lời là chạy tác vụ theo cả hai cách và đọc trường token suy luận.

A screenshot of OrcaRouter's model page for openai/gpt-6-luna, showing the model card, its 1,050,000-token context window, and its list pricing of $0.10 per million input tokens and $0.50 per million output tokens with a $0.01 per million cache read, captured in English.

Thử một trong hai mà không đặt cược vào nó

Phần khó xử của phép so sánh này là con số quan trọng nhất của nó — chi phí thực sự của chế độ pro — chỉ có thể được tạo ra bằng cách chạy lưu lượng của chính bạn qua nó, và chi phí hiệu quả của mô hình nhỏ hơn phụ thuộc vào việc các prompt của bạn rơi vào đâu so với mốc 100.000 token sau khi tái token hóa. Cả hai đều là những bài toán đo lường, và cả hai đều rẻ hơn trên một endpoint dùng chung so với khi đi qua hai client của nhà cung cấp.

GPT-6 Luna đã có trên danh mục của OrcaRouter ngay hôm nay ở đúng mức giá niêm yết của nhà cung cấp với mức markup 0% được chuyển nguyên vẹn, nhờ đó đường cơ sở ở chế độ tiêu chuẩn cho phép so sánh này có thể gọi được chỉ từ một key duy nhất, và thay đổi giá từ nhà cung cấp sẽ được cập nhật về phía chúng ta ngay trong ngày thay vì phải chờ đến kỳ thanh toán kế tiếp. Claude Haiku 5.5 vẫn chưa có trên danh mục; phân tầng Anthropic mà chúng ta thực sự route hôm nay là Claude Haiku 4.5, Claude Sonnet 5.5 và Claude Opus 5.5, điều này biến một bài kiểm tra leo thang từ chặng rẻ lên xuyên qua một tầng trung thành một quy tắc routing thay vì một thay đổi mã nguồn. Tính năng chuyển đổi dự phòng tự động ở bên dưới chính là thứ cho phép một model mới ra đời được hai ngày gánh lưu lượng production trong khi bạn vẫn đang đo lường nó: một nhà cung cấp bắt đầu gặp lỗi sẽ được route vòng qua thay vì làm sập request, và đó là khác biệt giữa một bản thử nghiệm bạn có thể chạy ngay trong tuần này và một cuộc cutover bạn phải lên lịch.

Điều gì giải quyết được chuyện đó?

Ba điều, theo thứ tự mức độ chúng sẽ thay đổi câu trả lời. Việc OpenAI công bố hệ số nhân token cho chế độ pro, hoặc một slug pro có dòng giá riêng, sẽ biến ẩn số trung tâm thành phép tính. Việc Artificial Analysis chạy lại GPT-6 Luna ở chế độ pro với mức effort tương đương sẽ làm được điều đó từ phía độc lập. Và một lần chạy độc lập thứ hai của Claude Haiku 5.5 ở medium thay vì Max sẽ cho bạn biết chi phí thực tế của model ở thiết lập mặc định, vốn là cấu hình mà hầu hết mọi người sẽ triển khai — con số $0,21 mỗi tác vụ trên bảng là số liệu ở mức effort Max, và Max không phải là mặc định.

Cho đến lúc đó, bản tóm tắt chính xác vẫn còn hẹp. Claude Haiku 5.5 là một mô hình mà bạn có thể gọi, định giá và đo hiệu năng ngay hôm nay, và ở khối lượng mà hạng của nó được xây dựng để phục vụ, nó là phương án rẻ hơn cùng với một cách được tài liệu hóa để còn rẻ hơn nữa. GPT-6 Luna Pro là một cấu hình của một mô hình mà bạn có thể gọi; bảng giá của nó không phải là vấn đề, mức tiêu thụ token của nó chưa được kiểm toán, và toàn bộ lập luận dành cho nó đều dựa trên những tác vụ đủ khó đến mức chi thêm token mới chính là cốt lõi. Hãy mua nó cho những tác vụ đó, hãy đo lường nó trước khi mua, và đừng đưa nó vào một luồng khối lượng lớn cho đến khi có ai đó công bố hệ số nhân.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna Pro — the scoreboard'. Left column Claude Haiku 5.5: what it is, a released model, GA 7 October 2026; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; context window 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21. Right column GPT-6 Luna Pro: what it is, GPT-6 Luna in reasoning mode pro, not a separate model; input price $0.10 per million up to 272,000 tokens; output price $0.50 per million up to 272,000 tokens; token multiplier unpublished; independent score 38 for GPT-6 Luna at Max effort in standard mode, with no pro-mode evaluation available; cost per task $0.07 for standard mode. A footer line reads 'Vendor pricing per Anthropic and OpenAI; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.