Một thẻ hero được tạo có tiêu đề 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base' với dòng kicker 'CÁI RẺ HƠN KHÔNG THỂ TRẢ LỜI MỘT CÂU HỎI' và các chip hiển thị $0,10 so với $0,06 mỗi triệu token đầu vào, AA Index 43 so với 13, và sẵn sàng trả lời so với checkpoint cơ sở.
Guides & Insights

Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: Bản rẻ tiền không thể trả lời một câu hỏi

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trên hai con số mà một bảng tính mua sắm quan tâm nhất, mô hình rẻ hơn và nhanh hơn sẽ thắng. Nemotron 3.5 Lightning 30B A3B Base chạy ở tốc độ 298,9 token đầu ra mỗi giây, nhanh nhất trong số 142 mô hình được theo dõi độc lập, và có giá 0,06 USD cho mỗi triệu token đầu vào, so với 0,10 USD của Claude Haiku 5.5. Nó cũng — như từ "Base" trong tên gọi đang cảnh báo bạn — không phải là một trợ lý. Đây là một checkpoint đã tiền huấn luyện — không tinh chỉnh có giám sát, không học tăng cường, không có mẫu chat nào ra hồn — được công bố theo giấy phép OpenMDW-1.1 vào ngày 11 tháng 8 năm 2026 để người khác có thể xây dựng dựa trên nó. Claude Haiku 5.5, ra mắt ngày 7 tháng 10 năm 2026, là một sản phẩm hoàn chỉnh mà bạn có thể gửi câu hỏi tới. So sánh chúng về giá chẳng khác nào so sánh chi phí bột mì với chi phí bánh mì, và phần thú vị của cuộc đối đầu này là xác định xem khối lượng công việc của bạn thực sự cần cái nào.

Không ai trong các bài đưa tin về buổi ra mắt nói rõ phần đó, bởi vì "rẻ hơn và nhanh hơn Claude Haiku 5.5" là một tiêu đề hấp dẫn hơn "rẻ hơn, nhanh hơn, và không dùng được nếu không chạy tinh chỉnh." Cả hai phát biểu đều đúng. Chỉ một trong số đó là hữu ích.

Mỗi mô hình thực sự là gì

Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, phát hành ngày 7 tháng 10 năm 2026. Đầu vào là văn bản và hình ảnh, đầu ra là văn bản. Ngữ cảnh 1 triệu token, đầu ra tối đa 128.000 token (300.000 khi dùng header beta trên Batch API), thời điểm cắt dữ liệu huấn luyện là tháng 6 năm 2026, thời điểm ngừng hỗ trợ không sớm hơn ngày 7 tháng 10 năm 2027. Mức độ nỗ lực có thể điều chỉnh gồm Low, Medium, High, Xhigh và Max, mặc định là Medium, với tính năng suy luận thích ứng bật theo mặc định. API tính phí theo mức sử dụng, đọc cache với giá $0,01 mỗi triệu, Batch bằng một nửa mức giá. Khả dụng qua API của Anthropic và từ đó, ở bất cứ nơi nào các mô hình của Anthropic được bán lại.

Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, công bố ngày 11 tháng 8 năm 2026. Một checkpoint mixture-of-experts lai 30 tỷ tham số với khoảng 3 tỷ tham số hoạt động mỗi token, được xây dựng trên ngăn xếp Mamba-2 kết hợp MoE và attention, được chưng cất từ Nemotron 3 Ultra, và đi kèm với giải mã suy đoán MTP, DFlash và DSpark. Ngữ cảnh chạy tới 1M token, mặc dù khoảng 256.000 là giới hạn thực tế trên một H100. Nó chỉ xử lý văn bản. Trọng số được mở theo OpenMDW-1.1. Và đây là một checkpoint cơ sở: trọng số tiền huấn luyện thô không có tinh chỉnh chỉ dẫn, nghĩa là nó hoàn thành văn bản thay vì tuân theo chỉ dẫn.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base — the scoreboard'. Claude Haiku 5.5 reads output speed 243.4 tokens per second, AA Index 43, proprietary weights, instruction-tuned yes, $0.10 per million input and $0.21 per task; the Nemotron column reads output speed 298.9 tokens per second, AA Index 13, weights open under OpenMDW-1.1, instruction-tuned no — base checkpoint, $0.06 per million input and $0.09 per task. A footer notes the Artificial Analysis figures are independently run and the NVIDIA figures are vendor-reported and unreproduced.

• Các kích thước, mỗi dòng một kích thước

• Giá đầu vào — Claude Haiku 5.5: 0,10 USD mỗi triệu cho đến 100K token, sau đó 0,50 USD; Nemotron 3.5 Lightning 30B A3B Base: 0,06 USD mỗi triệu.

• Giá đầu ra — $0.50 mỗi triệu cho đến 100K token, sau đó là $2.50, so với $0.20 mỗi triệu.

• Chi phí cho mỗi tác vụ đã hoàn thành — 0,21 USD cho mỗi tác vụ chỉ mục độc lập đối với Claude Haiku 5.5, so với 0,09 USD đối với Nemotron — mô hình rẻ hơn có chi phí thấp hơn trên mỗi tác vụ, chứ không chỉ trên mỗi token.

• Tốc độ đầu ra — 243,4 token mỗi giây đối với Claude Haiku 5.5, đứng thứ chín trong số 182; 298,9 token mỗi giây đối với Nemotron, đứng thứ nhất trong số 142.

• Thời gian đến token đầu tiên — khoảng 0,3 giây đối với Claude Haiku 5.5, so với 0,54 giây đối với Nemotron.

• Điểm số độc lập — Chỉ số Trí tuệ Artificial Analysis là 43 đối với Claude Haiku 5.5, đứng thứ hai trong số 182, với cấu hình Max ở mức 43,40; Chỉ số là 13 đối với Nemotron, đứng thứ hai mươi chín trong số 142.

• Cửa sổ ngữ cảnh — 1.000.000 token mỗi cái, với khoảng 256.000 khả dụng thực tế cho Nemotron trên một H100.

• Phương thức — văn bản và hình ảnh đầu vào cho Claude Haiku 5.5; chỉ văn bản cho Nemotron.

• Trọng số — độc quyền so với mở theo OpenMDW-1.1, một MoE lai tổng 30B và 3B hoạt động.

• Tinh chỉnh theo hướng dẫn — có trên Claude Haiku 5.5, không có trên Base checkpoint.

Vấn đề "Base", được nói một cách đơn giản

Một checkpoint gốc dự đoán token tiếp theo. Khi bạn đặt câu hỏi cho nó, nó thường sẽ tiếp tục văn bản theo phong cách của một tài liệu có thể chứa câu hỏi như vậy, thay vì trả lời. Hãy nhắc nó bằng “Tóm tắt hợp đồng này” và một mô hình gốc có thể tạo ra phần tiếp nối hợp lý của một tài liệu huấn luyện pháp lý thay vì bản tóm tắt hợp đồng của bạn. NVIDIA công bố một checkpoint BF16 riêng và các mô hình anh em được tinh chỉnh theo chỉ dẫn riêng chính xác vì trọng số gốc là nguyên liệu thô.

Trên thẻ mô hình của chính NVIDIA — do nhà cung cấp báo cáo, không được tái lập độc lập — checkpoint cơ sở đạt 78,59 trên MMLU, 67,94 trên MMLU-Pro, 91,28 trên GSM8K, 77,44 trên HumanEval và 69,62 trên RULER ở 1 triệu token. Thẻ Lightning cho phiên bản anh em đã tinh chỉnh báo cáo MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 và 86% trên PinchBench, với suy luận nhanh hơn khoảng 30% so với mô hình mà nó thay thế. Ngay cả những con số đã tinh chỉnh cũng là của chính NVIDIA, và những con số cơ sở mới là những con số áp dụng cho checkpoint được nêu trong tiêu đề của bài viết này. So với chúng, con số 43,40 được đo độc lập của Claude Haiku 5.5 — đứng thứ hai trong số 182 trên chỉ số của Artificial Analysis, một chỉ số khác đo lường những thứ khác — không thể so sánh trực tiếp, và cách hiểu trung thực là một checkpoint cơ sở 30B và một mô hình nhỏ đã hoàn thiện đang được chấm điểm bằng những công cụ khác nhau cho những mục đích khác nhau.

Điều có thể khẳng định không cần thêm điều kiện gì chính là hình dạng của khoảng cách. Một checkpoint cơ sở cần pipeline tinh chỉnh, ngăn xếp phục vụ và bộ khung đánh giá trước khi nó trả lời được bất cứ điều gì thì không phải là vật thay thế cho một mô hình được vận hành sẵn với giá 0,10 đô la mỗi triệu. Nó là điểm khởi đầu cho những ai muốn sở hữu mô hình.

Nơi Nemotron thực sự chiến thắng, và đó không phải là một giải an ủi.

Tốc độ là trên hết. 298.9 token đầu ra mỗi giây đưa nó lên đứng đầu bảng gồm 142 mô hình — nhanh hơn 23% so với 243.4 của Claude Haiku 5.5. Đối với một pipeline nhạy cảm với độ trễ, đó là một khác biệt thực sự, có thể đo lường được, và đó là lý do cái tên "Lightning" có mặt trên hộp.

Mã nguồn mở đứng thứ hai, và đây mới là điểm lớn hơn. Theo OpenMDW-1.1, bạn có thể tải checkpoint về, tinh chỉnh nó trên dữ liệu của riêng mình và tự triển khai phục vụ. Claude Haiku 5.5 hoàn toàn không thể tinh chỉnh và không thể tự lưu trữ dù với bất kỳ mức giá nào. Với một nhóm có tác vụ độc quyền, phân phối đầu vào khác thường, hoặc yêu cầu tuân thủ rằng lưu lượng truy cập không bao giờ rời khỏi hạ tầng của chính họ, sự khác biệt đó mang tính quyết định bất kể các trang đánh giá nói gì. Một mô hình tổng 30B với 3B tham số hoạt động cũng đủ nhỏ để có thể phục vụ một cách kinh tế — kiến trúc được thiết kế chính xác cho điều đó.

Giá đứng thứ ba: $0.06 cho đầu vào và $0.20 cho đầu ra trên mỗi triệu, với chiết khấu bộ nhớ đệm 17% và $0.09 cho mỗi tác vụ lập chỉ mục, chỉ bằng khoảng một nửa mức $0.21 của Claude Haiku 5.5. Cả hai mô hình đều rẻ; Nemotron rẻ hơn.

Ở những phương diện mà Claude Haiku 5.5 chiến thắng, tức là mọi khía cạnh cần đến một câu trả lời

Tuân thủ chỉ dẫn, vì nó đã được huấn luyện cho việc đó. Năng lực độc lập, ở Index 43 so với 13 — khoảng cách ba mươi điểm trên một bảng điểm đã chấm cả hai, đây là khoảng cách như vậy lớn nhất trong nhóm so sánh này. Đầu vào hình ảnh, thứ mà Nemotron hoàn toàn không chấp nhận. Đầu ra tối đa ở mức 128.000 token so với một con số chưa được công bố, với một đường beta 300.000 token trên Batch. Và nút điều chỉnh effort, thứ cho phép bạn lấy lại chi phí bằng cách giảm effort suy luận thay vì xây dựng lại mô hình.

Lưu ý về độ dài dòng ở đây có thể hiểu theo cả hai hướng. Trên bộ đánh giá của Artificial Analysis, Claude Haiku 5.5 phát ra khoảng 440 triệu token đầu ra so với mức trung vị khoảng 100 triệu — nó suy nghĩ rất nhiều. Nemotron phát ra khoảng 120 triệu, mà cùng nguồn đó mô tả là có phần dài dòng so với kích thước của nó. Chi phí mỗi tác vụ của Haiku 5.5 tuy vậy là $0.21 so với $0.09 của Nemotron, nên ngay cả mô hình nói nhiều cũng không phải là mô hình đắt đỏ. Điều đó cho bạn biết rằng giá mỗi token gây hiểu lầm theo cả hai hướng, và con số mỗi tác vụ mới là thứ để lập ngân sách dựa trên đó.

Tự lưu trữ so với một điểm cuối

Nemotron 3.5 Lightning 30B A3B Base được phân phối dưới dạng trọng số mở và được phục vụ bởi một số nhà cung cấp suy luận; NVIDIA cũng phát hành các phiên bản cùng dòng đã được tinh chỉnh. Claude Haiku 5.5 có sẵn thông qua API của Anthropic và từ đó, ở bất cứ nơi nào các mô hình của Anthropic được bán lại. Cả hai đều không nằm trong danh mục của OrcaRouter, và chúng tôi sẽ không giả vờ điều ngược lại — thứ chúng tôi định tuyến từ khu vực này là anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 và anthropic/claude-fable-5.1, tầng cấp cao hơn chủ đề của bài viết này.

Hai con đường mà so sánh này mô tả có hạ tầng kỹ thuật thực sự khác nhau, và thật đáng để gọi tên chúng. Con đường tự vận hành (self-hosted) nghĩa là một GPU, một framework phục vụ, một quyết định lượng tử hóa và một lịch trực vận hành. Con đường dùng dịch vụ hosted nghĩa là một key và một chuỗi tên model. OrcaRouter tồn tại cho con đường thứ hai: một API cho hơn 200 model, một key và một hóa đơn, giá niêm yết của nhà cung cấp được chuyển thẳng với mức markup 0% nên mức cắt giảm từ nhà cung cấp có hiệu lực ngay trong ngày, cùng với cơ chế chuyển đổi dự phòng tự động ở bên dưới. Đây không phải là con đường dẫn tới một checkpoint base 30B, và việc mua một chiếc máy cấp DGX cũng không phải là con đường dẫn tới một model nhỏ dạng hosted.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

Ai nên chọn cái nào

Nếu tác vụ của bạn được định nghĩa rõ ràng, dữ liệu huấn luyện của bạn đủ lớn để tạo khác biệt và lưu lượng của bạn không thể rời khỏi hạ tầng của chính bạn, thì Nemotron 3.5 Lightning 30B A3B Base là đối tượng thú vị hơn: nhanh nhất trong số 142 về tốc độ đầu ra, giá mỗi token chỉ bằng một nửa, và thuộc quyền bạn tùy chỉnh. Hãy dự trù ngân sách cho lần chạy tinh chỉnh và chi phí phục vụ trước khi bạn tính khoản tiết kiệm, vì mức giá đầu vào $0.06 giả định rằng ai đó đã làm sẵn phần việc biến một checkpoint thành một trợ lý.

Nếu bạn muốn gửi một prompt và nhận câu trả lời ngay chiều nay, Claude Haiku 5.5 chính là lựa chọn làm được điều đó — 43 trên chỉ số độc lập so với 13, đầu vào hình ảnh, giới hạn đầu ra 128.000 token và mức giá thực sự nhỏ. So sánh chỉ có vẻ sít sao trên bảng giá. Nó không còn vẻ sít sao ngay khi nhiệm vụ là trả lời một câu hỏi thay vì viết tiếp một tài liệu.

A capture of the Artificial Analysis page for Nemotron 3.5 Lightning showing its Intelligence Index of 13 and rank of 29 of 142, the $0.06 per-million input and $0.20 output pricing, the $0.09 cost per index task, the 298.9 tokens-per-second output speed ranked first of 142, the 0.54-second time to first token, the 1M-token context window, text-only input and open weights.