
Claude Haiku 5.5 so với Gemma 4 12B: Một mô hình trọng số bạn có thể nắm giữ đối đầu với API của nhà cung cấp
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Claude Haiku 5.5 và Gemma 4 12B thực sự không cạnh tranh cho cùng một vị trí, và cách nhanh nhất để thấy điều đó chỉ gói gọn trong một câu: một trong hai được phát hành dưới dạng trọng số Apache-2.0 mà bạn có thể tải về, lượng tử hóa và chạy trên phần cứng của riêng mình, còn cái kia chỉ tồn tại phía sau một API. Claude Haiku 5.5 ra mắt ngày 7 tháng 10 năm 2026 và ngay lập tức vẽ lại mức điểm mà một phân khúc nhỏ có thể đạt được — 43 trên Chỉ số Trí tuệ Artificial Analysis độc lập. Gemma 4 12B đứng ở vị trí 14 trên cùng bảng xếp hạng đó. Khoảng cách ấy là khổng lồ, và đó không phải là lý do khiến hầu hết các đội nhóm cuối cùng phải lựa chọn giữa hai mô hình này.
Lựa chọn thường đã bị ép sẵn trước khi người ta tham khảo bất kỳ benchmark nào: một pipeline chịu quy định không thể gửi token đến nhà cung cấp, một thiết bị biên không có đường ra đáng tin cậy, một ngân sách độ trễ tính bằng mili giây, hoặc một yêu cầu tinh chỉnh mà API đóng sẽ không bao giờ đáp ứng được. Nếu không điều nào trong số đó áp dụng cho bạn, câu trả lời không hề sít sao. Nếu có một điều đúng, khoảng cách điểm số không còn quan trọng nữa và ràng buộc triển khai sẽ quyết định toàn bộ vấn đề.
Hội đồng quản trị đã đo lường những gì và khi nào
Các số liệu độc lập dưới đây đến từ Artificial Analysis, còn mức giá của nhà cung cấp đến từ tài liệu riêng của Anthropic và Google. Đây là hai loại số liệu khác nhau và được ghi nhãn như vậy xuyên suốt.

• Điểm số độc lập — Claude Haiku 5.5 đạt 43 trên Intelligence Index, đứng thứ hai trong số 182 mô hình. Gemma 4 12B (Reasoning) đạt 14, thứ 21 trong số 142 ở cùng phân khúc. Khoảng cách 29 điểm.
• Giá đầu vào mỗi triệu token — Claude Haiku 5.5 $0.10 cho tối đa 100.000 token và $0.50 cho phần vượt trên; Gemma 4 12B $0.10.
• Giá đầu ra trên mỗi triệu token — Claude Haiku 5.5: $0,50 cho tối đa 100.000 token và $2,50 cho phần vượt trên; Gemma 4 12B: $0,30.
• Cửa sổ ngữ cảnh — 1.000.000 token cho Claude Haiku 5.5; 262.000 cho Gemma 4 12B.
• Thông lượng — 240,4 token đầu ra mỗi giây đối với Claude Haiku 5.5; 113,1 đối với Gemma 4 12B, với thời gian đến token đầu tiên là 2,48 giây.
• Chi phí cho mỗi tác vụ Index đã hoàn thành — 0,21 USD đối với Claude Haiku 5.5. Gemma 4 12B đủ rẻ trên mỗi token đến mức con số tổng hợp của ban điều hành là 0,12 USD cho mỗi triệu token, nhưng chi phí suy ra trên mỗi tác vụ không phải là con số nên quyết định sự so sánh này.
• Trọng số — Apache 2.0 cho Gemma 4 12B, có thể tải xuống, khoảng 12 tỷ tham số dạng dense. Claude Haiku 5.5 là độc quyền; không có bản phát hành trọng số nào và cũng không có kế hoạch nào như vậy.
• Thời gian ra mắt — Gemma 4 12B đã ra mắt từ tháng 6 năm 2026. Claude Haiku 5.5 mới chỉ hai ngày tuổi tính đến thời điểm viết bài này.
Khoảng cách là 29 điểm, và chênh lệch về giá thì gần như không đáng kể
Nhìn lại hai dòng giá: đầu vào $0.10 cho cả hai, còn đầu ra là $0.30 so với $0.50. Gemma 4 12B rẻ hơn, và mức chênh lệch đủ nhỏ để bị số lượng token lấn át — tokenizer mới hơn của Claude Haiku 5.5 khiến cùng một đoạn văn bản trở thành nhiều hơn khoảng 30% token, nên lợi thế 40% về giá đầu ra thô của Gemma gần như chỉ còn hòa nhau trên hóa đơn thực tế.
Vậy là bạn đang trả gần như cùng một mức giá cho một mô hình kém 29 điểm Index, hoặc bạn đang trả gần như cùng một mức giá cho một mô hình hơn 29 điểm, tùy thuộc vào việc bạn đọc cột nào trước. Đó là cách diễn đạt trung thực và cần được nói rõ ràng: trong bất kỳ tác vụ nào cả hai mô hình đều có thể làm được, Claude Haiku 5.5 là lựa chọn mua tốt hơn ở giá niêm yết, và nó tốt hơn với một khoảng cách mà không lượng prompt engineering nào trên mô hình nhỏ hơn có thể thu hẹp được.
Do đó, câu hỏi thú vị không phải là "cái nào tốt hơn". Mà là "Gemma 4 12B thất bại ở những tác vụ nào trong hàng đợi của tôi", và câu trả lời cho điều đó là thứ duy nhất quyết định sự so sánh.
Trọng số mang lại cho bạn điều gì mà API không thể?

Một mô hình được tải xuống là một loại tài sản khác, và những lợi thế của nó mang tính cấu trúc chứ không phải tính gia tăng.
• Ranh giới dữ liệu — với Gemma 4 12B, hoàn toàn không có nhà cung cấp nào tham gia vào quy trình. Đối với các tác vụ y tế, pháp lý, quốc phòng hoặc tài chính, đây thường là yêu cầu duy nhất thực sự quan trọng, và dù điểm số có cao đến đâu cũng không thể khiến một API trở nên chấp nhận được.
• Chi phí cố định thay vì chi phí biến đổi — một mô hình dense 12B được lượng tử hóa xuống bốn bit vừa vặn thoải mái trên một accelerator hiện đại duy nhất. Đến lúc đó, chi phí biên cho mỗi token chính là điện năng, và một khối lượng công việc có thể được định cỡ theo một cỗ máy thay vì theo một đồng hồ đo.
• Không có lưu lượng ra ngoài, không có độ trễ mạng — một mô hình 12B tại chỗ trả lời trong vài mili giây vì không có gì rời khỏi máy. Một API của nhà cung cấp phải trả giá bằng một vòng khứ hồi và một đuôi khởi động nguội mà triển khai tại biên đơn giản là không hề có.
• Tinh chỉnh và chưng cất — bạn có thể điều chỉnh Gemma 4 12B trên dữ liệu của riêng mình, phát hành adapter và đóng băng nó. Việc Anthropic có bao giờ cho phép bạn tinh chỉnh một mô hình cấp Haiku hay không không phải là điều bạn có thể lập kế hoạch lộ trình xoay quanh.
• Một mức sàn cho lộ trình của bạn — các trọng số không thể bị khai tử ngay dưới chân bạn. Anthropic đã cam kết không khai tử Claude Haiku 5.5 trước ngày 7 tháng 10 năm 2027, điều đó thật hào phóng, nhưng một cam kết có ghi ngày vẫn chỉ là một cam kết có ghi ngày.
• Về phương thức, lạ thay — bảng ghi nhận Gemma 4 12B nhận đầu vào văn bản, hình ảnh, giọng nói và video để xuất ra văn bản, tức là phạm vi đầu vào rộng hơn so với khả năng xử lý văn bản và hình ảnh của Claude Haiku 5.5. Đối với một pipeline cục bộ tiếp nhận âm thanh mà không cần dịch vụ phiên âm riêng, đó là một năng lực thực sự mà phía API không có.

Nơi 12B không thể tồn tại khi tiếp xúc
Cùng một bảng đánh giá đo khoảng cách 29 điểm đó cũng ghi lại những thứ mà một mô hình nhỏ, dense không thể làm tốt, và bỏ qua chúng thì sẽ là không trung thực:
• Ngữ cảnh dài — 262.000 token so với 1.000.000. Một pipeline nhồi cả một codebase hay một năm hồ sơ vào một prompt thì không có đường chạy trên Gemma 4 12B, và việc chia nhỏ nó thành một vòng lặp truy xuất sẽ làm phát sinh thêm phần kỹ thuật mà cửa sổ lớn hơn lẽ ra đã tránh được.
• Công việc dạng tác nhân và sử dụng máy tính — nhóm nhiệm vụ mà ở đó thất bại của một mô hình nhỏ diễn ra âm thầm và tốn kém. Các số liệu do chính nhà cung cấp Anthropic báo cáo cho Claude Haiku 5.5 đặt OSWorld 2.1 ở mức 72,4% so với 15,7% của Haiku trước đó; một mô hình 12B với Chỉ số 14 không phải là công cụ phù hợp cho công việc đó, và những con số của nhà cung cấp ở đây là một tín hiệu hữu ích, ngay cả khi tính đến việc chưa có lần chạy độc lập nào tái lập được chúng.
• Thông lượng trên mỗi đô la trên một cụm dùng chung — 113 token mỗi giây trên một instance được host là ổn, nhưng lý do để tự vận hành không phải là tốc độ, và triển khai trên một GPU duy nhất sẽ còn chậm hơn nữa.
• Không có phương án dự phòng — nếu bạn vận hành Gemma 4 12B trong môi trường sản xuất, sự cố ngừng hoạt động của phần cứng của chính bạn là sự cố của bạn, không có nhà cung cấp thứ hai để chuyển sang dự phòng trừ khi bạn tự xây dựng một nhà cung cấp như vậy.
Chạy một trong hai qua một endpoint
OrcaRouter hiện cung cấp Gemma 4 31B và Gemma 4 26B-A4B trong danh mục hôm nay theo giá niêm yết của Google với 0% phụ trội, nhưng không có 12B — và thật đáng nói thẳng điều đó thay vì ngụ ý điều ngược lại. 12B có thể được truy cập thông qua kênh phân phối của chính nhà cung cấp và một số nền tảng bên thứ ba. Claude Haiku 5.5 cũng vậy, chưa có trong danh mục; nó có sẵn từ API của Anthropic và các nhà cung cấp đám mây lớn.
Điều mà một router thực sự mang lại chính là hình dạng mà sự so sánh này thực sự cần đến. Một cách triển khai hợp lý gồm một mô hình cục bộ rẻ và một mô hình API đắt đỏ không phải là một ngã rẽ — đó là một tuyến đường: Gemma 4 12B hoặc một biến thể Gemma 4 được lưu trữ trả lời phần lớn các yêu cầu dễ, và những yêu cầu kích hoạt điều kiện về chất lượng hoặc độ dài sẽ được chuyển lên nhánh Anthropic. Claude Haiku 4.5, Claude Sonnet 5.5 và Claude Opus 5.5 hiện đã có trong danh mục, nên đường chuyển cấp có thể được xây dựng và kiểm thử tải trước cả khi nhánh tầng nhỏ thậm chí còn chưa sẵn sàng. Trên OrcaRouter, sự kết hợp đó là một biểu thức DSL định tuyến và chuyển đổi dự phòng tự động thay vì một dịch vụ bạn phải duy trì, và với giá niêm yết của nhà cung cấp được chuyển tiếp với mức markup 0%, thay đổi giá trên bất kỳ nhánh nào sẽ có hiệu lực ngay trong cùng ngày xảy ra.
Quy tắc
Hãy chọn Claude Haiku 5.5 trừ khi có một ràng buộc nào đó loại nó ra. Nó dẫn trước Gemma 4 12B 29 điểm Index với mức giá niêm yết gần như tương đương, xử lý được một triệu token ngữ cảnh, và là mô hình mạnh hơn ở mọi tác vụ mà cả hai đều có thể đảm nhận. Không có phiên bản nào của phép so sánh này mà 12B lại thắng về thực lực.
Chọn Gemma 4 12B khi chính ràng buộc là điều mấu chốt — khi các token không thể rời khỏi cơ sở của bạn, khi ngân sách là một cỗ máy thay vì một đồng hồ đo, khi bạn cần tinh chỉnh, hoặc khi bạn cần nắm trọng số trong tay thay vì một bảng giá và một ngày ngừng hoạt động. Đó không phải là những sở thích, mà là những yêu cầu bắt buộc, và khi đối chiếu với một yêu cầu bắt buộc thì khoảng cách 29 điểm đơn giản không phải là con số quyết định.
