
Claude Haiku 5.5 vs GPT-6 Luna Pro: Mô hình đối đầu Chế độ
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Một bên trong so sánh này là một mô hình, còn bên kia là một thiết lập. Claude Haiku 5.5đã chính thức khả dụng rộng rãi vào ngày 7 tháng 10 năm 2026 với mức 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra, trên Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry và Claude Platform on AWS. GPT-6 Luna Prokhông phải là một mô hình: cách để có được nó là gọi GPT-6 Luna — đang hoạt động từ ngày 22 tháng 9 năm 2026 với cùng mức 0,10 USD và 0,50 USD — với reasoning.mode được đặt thành pro thay vì standard. Không hề có gpt-6-luna-pro nào là mã định danh trên trang mô hình của OpenAI. Vậy nên cách diễn đạt trung thực về cuộc đối đầu này không phải là "mô hình nào thắng" mà là "đâu là cách tốt hơn để tiêu mười xu cho mỗi triệu token đầu vào": một mô hình nhỏ với một nút điều chỉnh nỗ lực, hay một mô hình lớn hơn chạy ở chế độ làm nhiều việc hơn và tính tiền bạn cho những token mà nó không hiển thị cho bạn. Đối với công việc ngắn, khối lượng lớn, câu trả lời thường là cái thứ nhất. Đối với công việc khó, không thường xuyên, câu trả lời có thể là cái thứ hai — và con số quyết định điều đó, OpenAI vẫn chưa công bố.
"pro" là gì, về mặt cơ chế
Hướng dẫn suy luận của OpenAI nêu rằng các mô hình GPT-5.6 và GPT-6 hỗ trợ hai chế độ trong Responses API, standard (mặc định) và pro, được chọn thông qua reasoning.mode. Chế độ là một cơ chế điều khiển khác với reasoning.effort: chế độ quyết định mô hình thực hiện bao nhiêu công việc trước khi đưa ra câu trả lời, còn effort quyết định mức độ suy luận diễn ra bên trong chế độ mà bạn đã chọn. Các giá trị effort được tài liệu của GPT-6 Luna ghi nhận là none, low, medium (mặc định), high, xhigh và max, và bất kỳ giá trị nào trong số đó đều có thể được kết hợp với chế độ pro.
Về phần tính phí, hướng dẫn nói rõ ràng và hơi phản trực giác. Chế độ Pro gom toàn bộ công việc của mô hình đằng sau câu trả lời cuối cùng và tính phí những token đó “theo đơn giá token tiêu chuẩn của mô hình đã chọn”. Không có phụ phí Pro nào trên bảng giá. Chi phí xuất hiện dưới dạng khối lượng, vì chế độ Pro “thực hiện nhiều công việc mô hình hơn chế độ tiêu chuẩn, làm tăng mức sử dụng token và chi phí” — và token suy luận được tính phí như token đầu ra trong khi chỉ xuất hiện trong đối tượng usage dưới output_tokens_details.reasoning_tokens. Nếu bạn không đọc trường đó, mức tăng sẽ vô hình cho đến khi hóa đơn đến.
Từ đó có hai so sánh, và chúng đáng được tách riêng. So với GPT-6 Luna ở chế độ tiêu chuẩn, chế độ pro là cùng một mô hình với một hệ số nhân chưa rõ trên mức tiêu thụ token. So với Claude Haiku 5.5, nó cũng là một mô hình khác ở một quy mô khác — 1.050.000 token ngữ cảnh so với 1M, giới hạn đầu vào 922.000 token và mốc kiến thức ngày 18 tháng 5 năm 2026, ở một phân hạng mà tài liệu ra mắt của chính Anthropic định vị cao hơn một chút so với Haiku trong các công việc agent khó. Hai khác biệt này tác động cùng chiều về chi phí và ngược chiều về năng lực, đó là lý do không thể đọc ra cái nào trong hai từ một bảng giá.
Các bảng giá, đặt cạnh nhau
Cả hai mô hình đều được tính phí theo hai bậc, và các ngưỡng nằm ở những vị trí khác nhau — điều này quan trọng hơn cả mức giá niêm yết, bởi vì cả hai mức giá niêm yết đều giống hệt nhau.
• Đầu vào — Claude Haiku 5.5 $0.10 mỗi triệu token cho tới 100.000 token, $0.50 khi vượt mức đó. GPT-6 Luna $0.10 cho tới 272.000 token, $0.20 khi vượt mức đó.
• Đầu ra — Claude Haiku 5.5 0,50 đô la cho tối đa 100.000 token, 2,50 đô la nếu vượt quá. GPT-6 Luna 0,50 đô la cho tối đa 272.000 token, 0,75 đô la nếu vượt quá.
• Bộ nhớ đệm — Claude Haiku 5.5 đọc bộ nhớ đệm $0.01 và ghi $0.125 dưới ngưỡng, $0.05 và $0.625 trên ngưỡng. GPT-6 Luna đọc bộ nhớ đệm $0.01 và ghi $0.125 dưới 272,000 token, $0.02 và $0.25 trên mức đó.
• Ngữ cảnh và đầu ra — 1M token với đầu ra tối đa 128,000 cho Claude Haiku 5.5; 1,050,000 token với giới hạn đầu vào 922,000 token và đầu ra tối đa 128,000 cho GPT-6 Luna.
• Suy nghĩ — thích ứng đang bật. Claude Haiku 5.5 mặc định ở mức nỗ lực trung bình; GPT-6 Luna mặc định ở mức nỗ lực trung bình và chế độ tiêu chuẩn, với chế độ pro là tùy chọn bật thêm.
• Giảm giá theo lô và bộ nhớ đệm — Claude Haiku 5.5 giảm 50% trên Message Batches API; GPT-6 Luna giảm 50% trên Batch và Flex, tăng gấp đôi ở chế độ Fast, và cộng thêm 10% phụ phí cho xử lý theo khu vực.
Dòng duy nhất không cùng hình dạng là tokenizer. Tài liệu của Anthropic lưu ý rằng Claude Haiku 5.5 sử dụng tokenizer mới hơn, dùng chung với Claude 4.7 và các phiên bản sau, nên cùng một đoạn văn bản được tính thành khoảng 30% số token nhiều hơn so với trên Claude Haiku 4.5. Điều đó không làm thay đổi mức giá; nó thay đổi việc một prompt đạt đến mốc 100.000 token nhanh đến mức nào, và đó là một khác biệt chi phí thực sự mà không bảng giá nào hiển thị. Một prompt 90.000 token được đo khoảng 117.000 và phải trả $0.50 mỗi triệu token đầu vào thay vì $0.10 — mức gấp năm lần cho một prompt trông như thể đang thoải mái nằm dưới ngưỡng.
Giá của chế độ pro, tính bằng đơn vị duy nhất mà ai cũng dùng được
Vì hệ số nhân không được công bố, điều hữu ích cần nêu là mỗi token bổ sung tốn bao nhiêu, và sau đó là các khoảng hợp lý sẽ hoạt động thế nào ở quy mô lớn.
• Với mức 0,50 USD cho mỗi triệu token đầu ra của GPT-6 Luna, mỗi 10.000 token đầu ra tăng thêm cho một tác vụ tốn 0,005 USD. Chạy 100.000 tác vụ mỗi ngày thì phần tăng thêm đó là một tỷ token — khoảng 500 USD một ngày, hay 15.000 USD một tháng, trên một mô hình có mức giá quảng cáo chỉ 10 xu cho mỗi triệu token đầu vào.
• Để dễ hình dung, GPT-6 Luna ở mức nỗ lực tối đa đã tiêu tốn 140 triệu token đầu ra khi chạy Intelligence Index, so với mức trung vị 100 triệu — điều mà bên đánh giá mô tả là có phần dài dòng. Bảng công bố ra mắt của Anthropic, chạy trên harness của chính Anthropic, đặt GPT-6 Luna ở mức 16,4% trên Terminal-Bench 4.0 và 42,4% trên FrontierCode 1.1, so với 39,2% và 46,4% của Claude Haiku 5.5 — do nhà cung cấp tự báo cáo, bộ kiểm thử của một nhà cung cấp, và là mô hình của một đối thủ.
• Trên bảng độc lập, thứ tự xếp hạng có khoảng cách hẹp hơn. Artificial Analysis chấm Claude Haiku 5.5 ở Max effort 43 trên Intelligence Index v4.3.2, đứng thứ hai trong 182, và GPT-6 Luna (Max) ở 38, thứ tám trong 182. Cả hai con số đều ở chế độ standard, max-effort. Không có đánh giá độc lập nào về GPT-6 Luna ở chế độ pro: trang của nó không có mục pro, và Artificial Analysis cũng không liệt kê mục nào như vậy.
Vấn đề mang tính cấu trúc đối với chế độ pro là sự tương tác giữa hai điểm cuối cùng đó. Toàn bộ lợi thế chi phí của GPT-6 Luna so với Claude Haiku 5.5 đến từ hiệu quả token — 140 triệu token đầu ra so với 440 triệu cho cùng một bộ kiểm thử, ở mức giá như nhau, đó là lý do cùng một bài đánh giá tốn $0.07 mỗi tác vụ ở một bên và $0.21 ở bên kia. Chế độ pro, theo định nghĩa, là một chế độ phát ra nhiều token hơn. Bật nó lên là tắt đi thứ đã khiến mô hình trở nên rẻ trong so sánh này, và hệ số nhân cho biết mức độ rẻ hơn đó không được công bố. Đó không phải là lập luận rằng chế độ pro là một thỏa thuận tồi — với các tác vụ khó, nhiều công sức hơn thường là công việc tốt hơn — mà là lập luận rằng chế độ pro cạnh tranh về năng lực, không phải về giá, và nên được đánh giá so với các mô hình tầm trung mà nó có mức giá gần tương đương, thay vì so với tầng rẻ mà nó nằm trong đó.

Nơi mỗi cái thực sự giành chiến thắng
Chỉ cần bóc tách đến tận cùng quyết định, sự phân chia sẽ thật rạch ròi, dù chẳng bên nào thoát khỏi những lưu ý kèm theo.
Claude Haiku 5.5 nắm giữ phân khúc giá rẻ. Nó nhanh hơn theo cả hai nghĩa quan trọng: 241,9 token đầu ra mỗi giây do Artificial Analysis đo được, so với 123,0 của GPT-6 Luna, và thời gian đến token đầu tiên là 295 giây trong lần chạy Index — đây là hệ quả của việc nó suy nghĩ bao lâu trước khi trả lời ở mức effort Max chứ không phải một con số về mạng. Bảng giá của nó đạt bậc thứ hai ở 100.000 token, và tokenizer của nó làm phồng prompt lên khoảng 30%, nên các workload có prompt dài phải trả nhiều hơn mức giá niêm yết gợi ý, ở cả hai khía cạnh. Đổi lại, nó mang đến lợi thế năm điểm về trí tuệ trên chỉ số độc lập và một nút điều chỉnh effort — từ Low đến Max — công cụ kiểm soát chi phí hữu ích nhất mà bất kỳ nhà cung cấp nào trong hai đưa ra kèm các bản ra mắt này. Ghim effort xuống thấp là cách bạn đánh đổi một phần trong lợi thế năm điểm đó để lấy con số chi phí trên mỗi tác vụ gần hơn với mức của GPT-6 Luna.
GPT-6 Luna Pro sở hữu phần khó nhất, với một hóa đơn chưa được định lượng. Mô hình bên dưới rẻ hơn trên mỗi token khi vượt 272.000 token đầu vào so với Claude Haiku 5.5 khi vượt 100.000, theo hệ số hai lần rưỡi ở đầu vào và ba và một phần ba ở đầu ra, và bậc đầu tiên của nó vươn xa hơn mười tám lần trong cửa sổ ngữ cảnh. Chế độ Standard rẻ hơn một cách đo lường được trên mỗi tác vụ đã hoàn thành. Chế độ Pro đánh đổi điều đó để có nhiều công việc hơn trên mỗi câu trả lời với cùng mức giá, và liệu nó có đánh bại Claude Haiku 5.5 ở Max effort hay một mô hình tầm trung trong một tác vụ nhất định hay không là câu hỏi mà không con số công bố nào trả lời được. Cách để trả lời là chạy tác vụ theo cả hai cách và đọc trường token suy luận.

Thử một trong hai mà không đặt cược vào nó
Phần khó xử của phép so sánh này là con số quan trọng nhất của nó — chi phí thực sự của chế độ pro — chỉ có thể được tạo ra bằng cách chạy lưu lượng của chính bạn qua nó, và chi phí hiệu quả của mô hình nhỏ hơn phụ thuộc vào việc các prompt của bạn rơi vào đâu so với mốc 100.000 token sau khi tái token hóa. Cả hai đều là những bài toán đo lường, và cả hai đều rẻ hơn trên một endpoint dùng chung so với khi đi qua hai client của nhà cung cấp.
GPT-6 Luna đã có trên danh mục của OrcaRouter ngay hôm nay ở đúng mức giá niêm yết của nhà cung cấp với mức markup 0% được chuyển nguyên vẹn, nhờ đó đường cơ sở ở chế độ tiêu chuẩn cho phép so sánh này có thể gọi được chỉ từ một key duy nhất, và thay đổi giá từ nhà cung cấp sẽ được cập nhật về phía chúng ta ngay trong ngày thay vì phải chờ đến kỳ thanh toán kế tiếp. Claude Haiku 5.5 vẫn chưa có trên danh mục; phân tầng Anthropic mà chúng ta thực sự route hôm nay là Claude Haiku 4.5, Claude Sonnet 5.5 và Claude Opus 5.5, điều này biến một bài kiểm tra leo thang từ chặng rẻ lên xuyên qua một tầng trung thành một quy tắc routing thay vì một thay đổi mã nguồn. Tính năng chuyển đổi dự phòng tự động ở bên dưới chính là thứ cho phép một model mới ra đời được hai ngày gánh lưu lượng production trong khi bạn vẫn đang đo lường nó: một nhà cung cấp bắt đầu gặp lỗi sẽ được route vòng qua thay vì làm sập request, và đó là khác biệt giữa một bản thử nghiệm bạn có thể chạy ngay trong tuần này và một cuộc cutover bạn phải lên lịch.
Điều gì giải quyết được chuyện đó?
Ba điều, theo thứ tự mức độ chúng sẽ thay đổi câu trả lời. Việc OpenAI công bố hệ số nhân token cho chế độ pro, hoặc một slug pro có dòng giá riêng, sẽ biến ẩn số trung tâm thành phép tính. Việc Artificial Analysis chạy lại GPT-6 Luna ở chế độ pro với mức effort tương đương sẽ làm được điều đó từ phía độc lập. Và một lần chạy độc lập thứ hai của Claude Haiku 5.5 ở medium thay vì Max sẽ cho bạn biết chi phí thực tế của model ở thiết lập mặc định, vốn là cấu hình mà hầu hết mọi người sẽ triển khai — con số $0,21 mỗi tác vụ trên bảng là số liệu ở mức effort Max, và Max không phải là mặc định.
Cho đến lúc đó, bản tóm tắt chính xác vẫn còn hẹp. Claude Haiku 5.5 là một mô hình mà bạn có thể gọi, định giá và đo hiệu năng ngay hôm nay, và ở khối lượng mà hạng của nó được xây dựng để phục vụ, nó là phương án rẻ hơn cùng với một cách được tài liệu hóa để còn rẻ hơn nữa. GPT-6 Luna Pro là một cấu hình của một mô hình mà bạn có thể gọi; bảng giá của nó không phải là vấn đề, mức tiêu thụ token của nó chưa được kiểm toán, và toàn bộ lập luận dành cho nó đều dựa trên những tác vụ đủ khó đến mức chi thêm token mới chính là cốt lõi. Hãy mua nó cho những tác vụ đó, hãy đo lường nó trước khi mua, và đừng đưa nó vào một luồng khối lượng lớn cho đến khi có ai đó công bố hệ số nhân.

