Một thẻ hero được tạo cho 'Mức giá giống hệt, hóa đơn gấp ba lần', được gắn nhãn 'SAME STICKER' với dòng kicker 'HAI MÔ HÌNH, $0.10 VÀ $0.50, MỘT CÂU HỎI' và phụ đề 'Claude Haiku 5.5 đối đầu GPT-6 Luna: cùng hai con số, nhưng ngưỡng rất khác nhau.' Bốn chip hiển thị '$0.10 / $0.50 cả hai', '100K so với 272K', '$0.21 so với $0.07' và '43.40 so với 38.12'. Hai thẻ bên dưới được dán nhãn 'GIỐNG NHAU' ('$0.10 và $0.50 đầu ra dưới bậc đầu tiên, và cửa sổ 1M token trên cả hai') và 'KHÔNG GIỐNG NHAU' ('chi phí cho mỗi tác vụ khác nhau gấp ba lần'). Một phần chân trang ghi 'Giá niêm yết của nhà cung cấp; các đo lường độc lập từ Artificial, đọc ngày 8 tháng 10, 2026.' Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

Claude Haiku 5.5 vs GPT-6 Luna: Cùng giá niêm yết, hóa đơn gấp ba lần

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Claude Haiku 5.5 và GPT-6 Luna có mức giá niêm yết giống hệt nhau: 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra, hai con số y hệt nhau đến từng xu, đến từ hai nhà cung cấp hiếm khi đồng tình với nhau về bất cứ điều gì. Bài đăng ra mắt của Anthropic thậm chí còn in điểm số của Luna ngay cạnh cột điểm của chính mình, điều mà các nhà cung cấp không đời nào làm với những mô hình mà họ coi là không đáng lo ngại.

Hai thẻ khác biệt ở mọi thứ mà tấm tem che giấu. Luna giữ mức đó đến 272.000 token trước khi tăng bậc; Claude Haiku 5.5 tăng bậc ở 100.000. Claude Haiku 5.5 đạt 43,40 trên Artificial Analysis Intelligence Index v4.3.2 so với 38,12 của Luna — và tốn 0,21 đô la cho mỗi tác vụ Index hoàn thành so với 0,07 đô la của Luna. Cùng mức giá, hóa đơn gấp ba lần, trí tuệ hơn năm điểm. Đó là toàn bộ sự đánh đổi, và nó rõ ràng hơn hầu hết các màn đối đầu trực tiếp trong phân khúc này.

Hai thẻ, cạnh nhau

Trên mỗi triệu token, tính bằng đô la Mỹ, theo mức giá công bố của Ant​hropic và OpenAI như được phản ánh trong danh mục của chúng tôi, cùng với các đo lường độc lập được ghi nguồn từ Artificial Analysis. Lưu đệm ngày 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna - two cards, side by side'. Claude Haiku 5.5 reads input $0.10 under the first tier and $0.50 past 100,000, output $0.50 and $2.50 past 100,000, maximum output 128,000 tokens, Intelligence Index v4.3.2 43.40, cost per task $0.21, output speed 241.9 tokens per second. GPT-6 Luna reads input $0.10 under the first tier and $0.20 past 272,000, output $0.50 and $0.75, maximum output 128,000 tokens, Intelligence Index v4.3.2 38.12, cost per task $0.07, output speed 129.4 tokens per second. A footer reads 'Vendors' published list rates; independent measurements from Artificial Analysis.'

• Đầu vào — Claude Haiku 5.5 $0.10 cho tối đa 100.000 token, $0.50 cho phần vượt quá. GPT-6 Luna $0.10 cho tối đa 272.000 token, $0.20 cho phần vượt quá.

• Đầu ra — Claude Haiku 5.5 $0,50 cho tối đa 100.000 token, $2,50 cho phần vượt trên. GPT-6 Luna $0,50 cho tối đa 272.000 token, $0,75 cho phần vượt trên.

• Đầu vào và các thao tác ghi được lưu trong bộ nhớ đệm — cả hai ở mức $0.01 và $0.125 dưới ngưỡng đầu tiên, với Claude Haiku 5.5 chuyển sang $0.05 và $0.625 khi vượt 100.000 token, và GPT-6 Luna chuyển sang $0.02 và $0.25 khi vượt 272.000.

• Ngữ cảnh và đầu ra — 1M token cho cả hai; đầu ra tối đa 128.000 cho cả hai. Hai cái này thực sự có cùng một dạng.

• Thinking — thích ứng trên cả hai, cả hai đều có tham số effort. Mức effort mặc định của Claude Haiku 5.5 là medium; không phải tất cả điểm số đã công bố đều ở thiết lập đó.

• Điểm độc lập — Claude Haiku 5.5 (Max) 43.40, đứng thứ hai trong số 182 mô hình. GPT-6 Luna (Max) 38.12, đứng thứ tám trong số 182.

• Chi phí độc lập cho mỗi tác vụ — 0,21 USD so với 0,07 USD.

• Tốc độ — 241,9 token đầu ra mỗi giây so với 129,4, được đo bởi cùng một trình đánh giá.

Ngưỡng chính là nơi tạo nên sự khác biệt

Cả hai nhà cung cấp đều xây dựng một bảng giá hai bậc. Họ làm điều đó ở những vị trí rất khác nhau, và vị trí quan trọng hơn hẳn con số ở trên cùng.

Bước giá của Anthropic nằm ở mức 100.000 token. Dưới ngưỡng đó, bạn trả 0,10 đô la và 0,50 đô la; vượt ngưỡng, gấp năm lần và gấp năm lần — 0,50 đô la và 2,50 đô la. Anthropic cho biết các prompt dưới ngưỡng chiếm khoảng 90% số yêu cầu gửi đến mô hình Haiku trước đây của hãng, đây là cơ cấu lưu lượng của chính nhà cung cấp và cũng là một mô tả hợp lý cho các khối lượng công việc gọi ngắn nói chung.

Bậc của OpenAI nằm ở 272.000 token. Dưới nó, $0,10 và $0,50 — giống hệt Ant​hropic. Trên nó, $0,20 và $0,75, gấp đôi và tăng 50%. Đó là một bậc thoai thoải hơn nhiều và nó bắt đầu xa gần gấp ba lần.

Hãy lấy một prompt 200.000 token, một kích thước hợp lý cho pipeline tài liệu dài và hoàn toàn hợp lý với cửa sổ 1 triệu token. Trên Claude Haiku 5.5, yêu cầu đó được tính phí ở bậc hai: 0,50 USD đầu vào, 2,50 USD đầu ra. Trên GPT-6 Luna, nó vẫn ở bậc một: 0,10 USD đầu vào, 0,50 USD đầu ra. Gấp năm lần mức đầu vào và gấp năm lần mức đầu ra, trên cùng một yêu cầu, giữa hai mô hình có cùng mức giá niêm yết. Đó không phải là một khác biệt nhỏ — với khối lượng công việc prompt dài, đó là toàn bộ phép so sánh.

Tại sao cùng một mức giá lại tạo ra hóa đơn gấp ba lần

Chi phí cho mỗi tác vụ là con số nên quyết định một pipeline khối lượng lớn, và ở đây hai mô hình tách khỏi nhau theo cách mà bảng giá không thể giải thích được.

Artificial Analysis định giá GPT-6 Luna (Max) ở mức 0,07 USD cho mỗi tác vụ trong Chỉ số Trí tuệ và Claude Haiku 5.5 (Max) ở mức 0,21 USD — gấp ba lần, trên cùng mức giá niêm yết, cho chênh lệch 5,28 điểm. Nguyên nhân nằm ngay trên cùng trang đó và không hề tinh tế. Claude Haiku 5.5 đã tạo ra 440 triệu token đầu ra khi chạy Chỉ số, so với mức trung vị 100 triệu, và bên đánh giá gọi nó là cực kỳ dài dòng. GPT-6 Luna tạo ra 140 triệu token so với cùng mức trung vị 100 triệu, được mô tả là có phần dài dòng. Gấp ba lần token đầu ra nghĩa là gấp ba lần hóa đơn khi đầu ra chính là thước đo chiếm ưu thế.

Những con số của chính Anthropic cũng chỉ về cùng một hướng. Các biểu đồ chi phí so với độ chính xác của nhà cung cấp vẽ Haiku 5.5 trên toàn bộ dải mức nỗ lực, và câu trích dẫn nổi bật từ buổi ra mắt là Sonnet 5.5 và Opus 5.5 vẫn là những lựa chọn tốt hơn cho công việc lập trình dạng tác tử phức tạp, còn Haiku 5.5 được định vị cho việc nén, tóm tắt và các tác tử con. Công việc càng nhỏ thì bạn càng ít phải mua cái vấn đề dài dòng đó — đây chính xác là khối lượng công việc mà mô hình được tạo ra để xử lý, và cũng chính xác là khối lượng công việc mà khoảng cách chi phí gấp ba đáng để đối chiếu với nhật ký của chính bạn hơn là với nhật ký của một bảng xếp hạng nào đó.

Thêm một mục nữa vào sổ cái, lần này là từ tài liệu của Anthropic chứ không phải từ phía người đánh giá: Claude Haiku 5.5 dùng bộ tách token mới hơn, chia sẻ chung với Claude 4.7 và các phiên bản sau đó, nên cùng một đoạn văn bản sẽ được tính thành khoảng 30% token nhiều hơn so với Haiku trước. Mức giá thì giống với Luna; còn bộ tách token thì không.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table, with the per-million-token input, output and cache rates and the 100,000-token threshold at which the second tier begins.

Bảng của chính Ant​hropic nói gì về Luna

Trang ra mắt của Ant​hropic chạy GPT-6 Luna như một cột trong bảng điểm chuẩn của mình, và cách trung thực để báo cáo nó là kèm theo thông tin ghi nguồn: đây là các đánh giá của Ant​hropic, chạy trên harness của Ant​hropic, đối chiếu với mô hình của đối thủ cạnh tranh. Chúng được nhà cung cấp báo cáo, không được tái tạo độc lập, và việc một nhà cung cấp chạy bộ kiểm thử của riêng họ so với điểm số của đối thủ là một so sánh cần cân nhắc thay vì chấp nhận.

• Công việc tri thức — GDPval-AA v2.1 đạt 1620 cho Claude Haiku 5.5 so với 1437 cho GPT-6 Luna. AA-Briefcase v1.1 đạt 1578 so với 1336.

• Sử dụng máy tính — tập con ngoại tuyến của OSWorld 2.1 đạt 72,4% so với 48,9%.

• Lập trình tác nhân — Terminal-Bench 4.0 đạt 39,2% so với 16,4%; FrontierCode 1.1 (Main) đạt 46,4% so với 42,4%.

• Suy luận trực quan — Chartography đạt 46,4% khi không dùng công cụ, so với 29,1%.

Trên bộ kiểm thử của chính nhà cung cấp, Claude Haiku 5.5 dẫn đầu ở mọi hàng. Trên bảng độc lập, nó dẫn đầu với mức chênh nhỏ hơn — 43,40 so với 38,12 — đây là mối quan hệ thường thấy giữa bảng của nhà cung cấp và bảng của bên thứ ba, và cũng là lý do cả hai được in ở đây. Hai bảng đồng thuận về hướng nhưng không đồng thuận về độ lớn.

Dự luật là lá phiếu quyết định.

Đặt bốn sự thật thực sự quan trọng lên bàn cân với nhau, và lựa chọn không còn sít sao nữa đối với hầu hết các khối lượng công việc.

GPT-6 Luna rẻ hơn trên mỗi tác vụ hoàn thành theo hệ số ba trên phép đo độc lập, bậc giá đầu tiên của nó với tới xa hơn gấp mười tám lần trong cửa sổ ngữ cảnh, tỷ lệ vượt ngưỡng của nó thấp hơn trên cả hai thước đo, và nó là mô hình duy nhất trong hai mô hình có mức phạt ngữ cảnh dài là gấp đôi thay vì gấp năm lần. Claude Haiku 5.5 dẫn trước về trí tuệ đo lường được với một khoảng cách là thật và khiêm tốn, nhanh hơn gần gấp đôi về đầu ra, và — trên chính bộ kiểm thử của nhà cung cấp, nơi khoảng cách là lớn nhất — dẫn trước trên mọi dòng benchmark được công bố.

Nếu các lệnh gọi của bạn ngắn, nếu thông lượng là ràng buộc, hoặc nếu khác biệt về chất lượng thể hiện trong đánh giá của chính bạn, hãy trả gấp ba lần. Nếu các lệnh gọi của bạn dài, nếu chúng do máy tạo ra và không bao giờ được con người đọc, hoặc nếu bạn đang chạy một tầng phân loại được gọi một triệu lần mỗi ngày, thì cùng mức $0.10 và $0.50 đó sẽ mua cho bạn một hóa đơn chỉ bằng một phần ba ở phía bên kia, và năng lực mà bạn đánh đổi chỉ là năm điểm trên một bảng xếp hạng mà cả hai mô hình đều nằm gần vị trí đầu.

Gọi một trong hai cái đó từ một nơi

Điều hữu ích ở một phép so sánh sát sao đến vậy là bạn không cần phải tin lời bất kỳ ai, kể cả chúng tôi. GPT-6 Luna đang có trên danh mục OrcaRouter hôm nay với mức giá của nhà cung cấp, không cộng thêm 0% markup — cùng cấu trúc giá in ở trên, được chuyển thẳng thay vì pha trộn — và Claude Sonnet 5.5 cùng Claude Opus 5.5 cũng vậy, khiến một bài kiểm tra nâng cấp từ chặng giá rẻ lên hạng trung trở thành một cấu hình thay vì cả một dự án. Một khóa, một SDK, tự động chuyển đổi dự phòng bên dưới, và DSL định tuyến nếu việc nâng cấp thuộc về tuyến đường thay vì nằm trong ứng dụng của bạn.

Claude Haiku 5.5 chưa có trên danh mục. Nói thẳng điều đó ra thì hữu ích hơn là ngụ ý điều ngược lại: phía Luna của so sánh này có thể được chúng tôi gọi vào sáng nay, còn phía Ant​hropic thì phải được liên hệ tại Ant​hropic cho đến khi không còn như vậy.

A screenshot of the OrcaRouter catalogue page for GPT-6 Luna, showing the model identifier openai/gpt-6-Luna, the provider OpenAI, a 1M-token context window, 128,000 maximum output, the release date September 22 2026, the $0.10 per million input and $0.50 per million output rates and a p50 time to first token of 1.49 seconds.

Điều gì sẽ làm thay đổi câu trả lời

Hai điều, và cả hai đều đáng để theo dõi hơn là ước lượng.

Điều đầu tiên là liệu mức độ dài dòng có thay đổi không. Chi phí trên mỗi tác vụ của Claude Haiku 5.5 là một hàm của số token mà nó tiêu tốn cho mỗi câu trả lời khi ở mức effort tối đa, và tham số effort chính là đòn bẩy tác động lên điều đó. Một nhóm đặt effort thấp hơn — mặc định của chính mô hình là medium, chứ không phải max — sẽ thấy mức chi phí trên mỗi tác vụ gần với Luna hơn và điểm số cũng gần với Luna hơn. Sự đánh đổi luôn sẵn có; việc nó đáng giá bao nhiêu là câu hỏi về bài đánh giá của bạn, không phải về mô hình.

Điều thứ hai là liệu các con số chi phí độc lập trên mỗi tác vụ có còn đứng vững khi cả hai mô hình tích lũy thêm nhiều lượt chạy được đo lường hay không. Một lần xếp hạng trên bảng chỉ là một ảnh chụp nhanh, và khoảng cách gấp ba xuất hiện trong một ảnh chụp nhanh thì đáng để xác nhận với hóa đơn của chính bạn trước khi một pipeline được xây dựng lại quanh nó. Đó chính là mục đích của endpoint dùng chung.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày