
Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: Bản rẻ tiền không thể trả lời một câu hỏi
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Trên hai con số mà một bảng tính mua sắm quan tâm nhất, mô hình rẻ hơn và nhanh hơn sẽ thắng. Nemotron 3.5 Lightning 30B A3B Base chạy ở tốc độ 298,9 token đầu ra mỗi giây, nhanh nhất trong số 142 mô hình được theo dõi độc lập, và có giá 0,06 USD cho mỗi triệu token đầu vào, so với 0,10 USD của Claude Haiku 5.5. Nó cũng — như từ "Base" trong tên gọi đang cảnh báo bạn — không phải là một trợ lý. Đây là một checkpoint đã tiền huấn luyện — không tinh chỉnh có giám sát, không học tăng cường, không có mẫu chat nào ra hồn — được công bố theo giấy phép OpenMDW-1.1 vào ngày 11 tháng 8 năm 2026 để người khác có thể xây dựng dựa trên nó. Claude Haiku 5.5, ra mắt ngày 7 tháng 10 năm 2026, là một sản phẩm hoàn chỉnh mà bạn có thể gửi câu hỏi tới. So sánh chúng về giá chẳng khác nào so sánh chi phí bột mì với chi phí bánh mì, và phần thú vị của cuộc đối đầu này là xác định xem khối lượng công việc của bạn thực sự cần cái nào.
Không ai trong các bài đưa tin về buổi ra mắt nói rõ phần đó, bởi vì "rẻ hơn và nhanh hơn Claude Haiku 5.5" là một tiêu đề hấp dẫn hơn "rẻ hơn, nhanh hơn, và không dùng được nếu không chạy tinh chỉnh." Cả hai phát biểu đều đúng. Chỉ một trong số đó là hữu ích.
Mỗi mô hình thực sự là gì
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, phát hành ngày 7 tháng 10 năm 2026. Đầu vào là văn bản và hình ảnh, đầu ra là văn bản. Ngữ cảnh 1 triệu token, đầu ra tối đa 128.000 token (300.000 khi dùng header beta trên Batch API), thời điểm cắt dữ liệu huấn luyện là tháng 6 năm 2026, thời điểm ngừng hỗ trợ không sớm hơn ngày 7 tháng 10 năm 2027. Mức độ nỗ lực có thể điều chỉnh gồm Low, Medium, High, Xhigh và Max, mặc định là Medium, với tính năng suy luận thích ứng bật theo mặc định. API tính phí theo mức sử dụng, đọc cache với giá $0,01 mỗi triệu, Batch bằng một nửa mức giá. Khả dụng qua API của Anthropic và từ đó, ở bất cứ nơi nào các mô hình của Anthropic được bán lại.
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, công bố ngày 11 tháng 8 năm 2026. Một checkpoint mixture-of-experts lai 30 tỷ tham số với khoảng 3 tỷ tham số hoạt động mỗi token, được xây dựng trên ngăn xếp Mamba-2 kết hợp MoE và attention, được chưng cất từ Nemotron 3 Ultra, và đi kèm với giải mã suy đoán MTP, DFlash và DSpark. Ngữ cảnh chạy tới 1M token, mặc dù khoảng 256.000 là giới hạn thực tế trên một H100. Nó chỉ xử lý văn bản. Trọng số được mở theo OpenMDW-1.1. Và đây là một checkpoint cơ sở: trọng số tiền huấn luyện thô không có tinh chỉnh chỉ dẫn, nghĩa là nó hoàn thành văn bản thay vì tuân theo chỉ dẫn.

• Các kích thước, mỗi dòng một kích thước
• Giá đầu vào — Claude Haiku 5.5: 0,10 USD mỗi triệu cho đến 100K token, sau đó 0,50 USD; Nemotron 3.5 Lightning 30B A3B Base: 0,06 USD mỗi triệu.
• Giá đầu ra — $0.50 mỗi triệu cho đến 100K token, sau đó là $2.50, so với $0.20 mỗi triệu.
• Chi phí cho mỗi tác vụ đã hoàn thành — 0,21 USD cho mỗi tác vụ chỉ mục độc lập đối với Claude Haiku 5.5, so với 0,09 USD đối với Nemotron — mô hình rẻ hơn có chi phí thấp hơn trên mỗi tác vụ, chứ không chỉ trên mỗi token.
• Tốc độ đầu ra — 243,4 token mỗi giây đối với Claude Haiku 5.5, đứng thứ chín trong số 182; 298,9 token mỗi giây đối với Nemotron, đứng thứ nhất trong số 142.
• Thời gian đến token đầu tiên — khoảng 0,3 giây đối với Claude Haiku 5.5, so với 0,54 giây đối với Nemotron.
• Điểm số độc lập — Chỉ số Trí tuệ Artificial Analysis là 43 đối với Claude Haiku 5.5, đứng thứ hai trong số 182, với cấu hình Max ở mức 43,40; Chỉ số là 13 đối với Nemotron, đứng thứ hai mươi chín trong số 142.
• Cửa sổ ngữ cảnh — 1.000.000 token mỗi cái, với khoảng 256.000 khả dụng thực tế cho Nemotron trên một H100.
• Phương thức — văn bản và hình ảnh đầu vào cho Claude Haiku 5.5; chỉ văn bản cho Nemotron.
• Trọng số — độc quyền so với mở theo OpenMDW-1.1, một MoE lai tổng 30B và 3B hoạt động.
• Tinh chỉnh theo hướng dẫn — có trên Claude Haiku 5.5, không có trên Base checkpoint.
Vấn đề "Base", được nói một cách đơn giản
Một checkpoint gốc dự đoán token tiếp theo. Khi bạn đặt câu hỏi cho nó, nó thường sẽ tiếp tục văn bản theo phong cách của một tài liệu có thể chứa câu hỏi như vậy, thay vì trả lời. Hãy nhắc nó bằng “Tóm tắt hợp đồng này” và một mô hình gốc có thể tạo ra phần tiếp nối hợp lý của một tài liệu huấn luyện pháp lý thay vì bản tóm tắt hợp đồng của bạn. NVIDIA công bố một checkpoint BF16 riêng và các mô hình anh em được tinh chỉnh theo chỉ dẫn riêng chính xác vì trọng số gốc là nguyên liệu thô.
Trên thẻ mô hình của chính NVIDIA — do nhà cung cấp báo cáo, không được tái lập độc lập — checkpoint cơ sở đạt 78,59 trên MMLU, 67,94 trên MMLU-Pro, 91,28 trên GSM8K, 77,44 trên HumanEval và 69,62 trên RULER ở 1 triệu token. Thẻ Lightning cho phiên bản anh em đã tinh chỉnh báo cáo MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 và 86% trên PinchBench, với suy luận nhanh hơn khoảng 30% so với mô hình mà nó thay thế. Ngay cả những con số đã tinh chỉnh cũng là của chính NVIDIA, và những con số cơ sở mới là những con số áp dụng cho checkpoint được nêu trong tiêu đề của bài viết này. So với chúng, con số 43,40 được đo độc lập của Claude Haiku 5.5 — đứng thứ hai trong số 182 trên chỉ số của Artificial Analysis, một chỉ số khác đo lường những thứ khác — không thể so sánh trực tiếp, và cách hiểu trung thực là một checkpoint cơ sở 30B và một mô hình nhỏ đã hoàn thiện đang được chấm điểm bằng những công cụ khác nhau cho những mục đích khác nhau.
Điều có thể khẳng định không cần thêm điều kiện gì chính là hình dạng của khoảng cách. Một checkpoint cơ sở cần pipeline tinh chỉnh, ngăn xếp phục vụ và bộ khung đánh giá trước khi nó trả lời được bất cứ điều gì thì không phải là vật thay thế cho một mô hình được vận hành sẵn với giá 0,10 đô la mỗi triệu. Nó là điểm khởi đầu cho những ai muốn sở hữu mô hình.
Nơi Nemotron thực sự chiến thắng, và đó không phải là một giải an ủi.
Tốc độ là trên hết. 298.9 token đầu ra mỗi giây đưa nó lên đứng đầu bảng gồm 142 mô hình — nhanh hơn 23% so với 243.4 của Claude Haiku 5.5. Đối với một pipeline nhạy cảm với độ trễ, đó là một khác biệt thực sự, có thể đo lường được, và đó là lý do cái tên "Lightning" có mặt trên hộp.
Mã nguồn mở đứng thứ hai, và đây mới là điểm lớn hơn. Theo OpenMDW-1.1, bạn có thể tải checkpoint về, tinh chỉnh nó trên dữ liệu của riêng mình và tự triển khai phục vụ. Claude Haiku 5.5 hoàn toàn không thể tinh chỉnh và không thể tự lưu trữ dù với bất kỳ mức giá nào. Với một nhóm có tác vụ độc quyền, phân phối đầu vào khác thường, hoặc yêu cầu tuân thủ rằng lưu lượng truy cập không bao giờ rời khỏi hạ tầng của chính họ, sự khác biệt đó mang tính quyết định bất kể các trang đánh giá nói gì. Một mô hình tổng 30B với 3B tham số hoạt động cũng đủ nhỏ để có thể phục vụ một cách kinh tế — kiến trúc được thiết kế chính xác cho điều đó.
Giá đứng thứ ba: $0.06 cho đầu vào và $0.20 cho đầu ra trên mỗi triệu, với chiết khấu bộ nhớ đệm 17% và $0.09 cho mỗi tác vụ lập chỉ mục, chỉ bằng khoảng một nửa mức $0.21 của Claude Haiku 5.5. Cả hai mô hình đều rẻ; Nemotron rẻ hơn.
Ở những phương diện mà Claude Haiku 5.5 chiến thắng, tức là mọi khía cạnh cần đến một câu trả lời
Tuân thủ chỉ dẫn, vì nó đã được huấn luyện cho việc đó. Năng lực độc lập, ở Index 43 so với 13 — khoảng cách ba mươi điểm trên một bảng điểm đã chấm cả hai, đây là khoảng cách như vậy lớn nhất trong nhóm so sánh này. Đầu vào hình ảnh, thứ mà Nemotron hoàn toàn không chấp nhận. Đầu ra tối đa ở mức 128.000 token so với một con số chưa được công bố, với một đường beta 300.000 token trên Batch. Và nút điều chỉnh effort, thứ cho phép bạn lấy lại chi phí bằng cách giảm effort suy luận thay vì xây dựng lại mô hình.
Lưu ý về độ dài dòng ở đây có thể hiểu theo cả hai hướng. Trên bộ đánh giá của Artificial Analysis, Claude Haiku 5.5 phát ra khoảng 440 triệu token đầu ra so với mức trung vị khoảng 100 triệu — nó suy nghĩ rất nhiều. Nemotron phát ra khoảng 120 triệu, mà cùng nguồn đó mô tả là có phần dài dòng so với kích thước của nó. Chi phí mỗi tác vụ của Haiku 5.5 tuy vậy là $0.21 so với $0.09 của Nemotron, nên ngay cả mô hình nói nhiều cũng không phải là mô hình đắt đỏ. Điều đó cho bạn biết rằng giá mỗi token gây hiểu lầm theo cả hai hướng, và con số mỗi tác vụ mới là thứ để lập ngân sách dựa trên đó.
Tự lưu trữ so với một điểm cuối
Nemotron 3.5 Lightning 30B A3B Base được phân phối dưới dạng trọng số mở và được phục vụ bởi một số nhà cung cấp suy luận; NVIDIA cũng phát hành các phiên bản cùng dòng đã được tinh chỉnh. Claude Haiku 5.5 có sẵn thông qua API của Anthropic và từ đó, ở bất cứ nơi nào các mô hình của Anthropic được bán lại. Cả hai đều không nằm trong danh mục của OrcaRouter, và chúng tôi sẽ không giả vờ điều ngược lại — thứ chúng tôi định tuyến từ khu vực này là anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 và anthropic/claude-fable-5.1, tầng cấp cao hơn chủ đề của bài viết này.
Hai con đường mà so sánh này mô tả có hạ tầng kỹ thuật thực sự khác nhau, và thật đáng để gọi tên chúng. Con đường tự vận hành (self-hosted) nghĩa là một GPU, một framework phục vụ, một quyết định lượng tử hóa và một lịch trực vận hành. Con đường dùng dịch vụ hosted nghĩa là một key và một chuỗi tên model. OrcaRouter tồn tại cho con đường thứ hai: một API cho hơn 200 model, một key và một hóa đơn, giá niêm yết của nhà cung cấp được chuyển thẳng với mức markup 0% nên mức cắt giảm từ nhà cung cấp có hiệu lực ngay trong ngày, cùng với cơ chế chuyển đổi dự phòng tự động ở bên dưới. Đây không phải là con đường dẫn tới một checkpoint base 30B, và việc mua một chiếc máy cấp DGX cũng không phải là con đường dẫn tới một model nhỏ dạng hosted.

Ai nên chọn cái nào
Nếu tác vụ của bạn được định nghĩa rõ ràng, dữ liệu huấn luyện của bạn đủ lớn để tạo khác biệt và lưu lượng của bạn không thể rời khỏi hạ tầng của chính bạn, thì Nemotron 3.5 Lightning 30B A3B Base là đối tượng thú vị hơn: nhanh nhất trong số 142 về tốc độ đầu ra, giá mỗi token chỉ bằng một nửa, và thuộc quyền bạn tùy chỉnh. Hãy dự trù ngân sách cho lần chạy tinh chỉnh và chi phí phục vụ trước khi bạn tính khoản tiết kiệm, vì mức giá đầu vào $0.06 giả định rằng ai đó đã làm sẵn phần việc biến một checkpoint thành một trợ lý.
Nếu bạn muốn gửi một prompt và nhận câu trả lời ngay chiều nay, Claude Haiku 5.5 chính là lựa chọn làm được điều đó — 43 trên chỉ số độc lập so với 13, đầu vào hình ảnh, giới hạn đầu ra 128.000 token và mức giá thực sự nhỏ. So sánh chỉ có vẻ sít sao trên bảng giá. Nó không còn vẻ sít sao ngay khi nhiệm vụ là trả lời một câu hỏi thay vì viết tiếp một tài liệu.

