Một phiên bản không kiểm duyệt, không mất mát của Gemma 4 26B A4B được thiết kế để bảo tồn các khả năng của mô hình gốc đồng thời giảm thiểu hành vi từ chối. Được tối ưu hóa cho các nhà phát triển, nhà nghiên cứu AI và các ứng dụng tiên tiến yêu cầu phản hồi chất lượng cao với ít hạn chế nhất. Biến thể Balanced được khuyến nghị cho hầu hết các khối lượng công việc, cung cấp câu trả lời hoàn chỉnh trong khi duy trì suy luận ổn định và hành vi hội thoại tự nhiên. Trong một số tình huống nhạy cảm, mô hình có thể tạm thời đóng khung suy luận trước khi đưa ra phản hồi đầy đủ, nhưng nó được thiết kế để tránh giữ lại nội dung. So với các biến thể không kiểm duyệt mạnh mẽ hơn, Balanced cung cấp lấy mẫu nhất quán hơn, độ ổn định ngữ cảnh dài mạnh hơn và giảm sự trôi chủ đề trong các cuộc trò chuyện kéo dài. Phù hợp cho viết sáng tạo, nhập vai, trợ lý đa ngôn ngữ, suy luận ngữ cảnh dài và các ứng dụng AI đa năng nơi chất lượng, mạch lạc và độ tin cậy là ưu tiên hàng đầu. Quyền truy cập vào mô hình này được kiểm soát và dành cho các nhà nghiên cứu bảo mật, đội đỏ, nhà nghiên cứu an toàn AI và các chuyên gia có trình độ khác đang tiến hành nghiên cứu, đánh giá và thử nghiệm hợp pháp.
Gemma 4 26B A4B Uncensored là mô hình ngôn ngữ hỗn hợp chuyên gia (MoE) thuộc dòng Gemma 4 của Google, được cung cấp bởi nhà cung cấp Obsidian và truy cập qua OrcaRouter. Mô hình có tổng cộng 26 tỷ…
Gemma 4 26B A4B Uncensored xuất sắc trong các tác vụ yêu cầu suy luận tầm xa trên các ngữ cảnh lớn, như tóm tắt sách, hội thoại nhiều lượt với lịch sử dài, và phân tích mã nguồn. Kiến trúc MoE của nó giúp xử lý hiệu quả các lô dữ liệu khi nhiều prompt được xử lý đồng thời. Khả năng đa phương thức cho phép nó suy luận về hình ảnh—ví dụ, diễn giải biểu đồ, meme, hoặc ảnh sản phẩm. Hành vi không kiểm duyệt lý tưởng cho sáng tác văn học khám phá các chủ đề người lớn, nhập vai người lớn, hoặc tạo tiểu thuyết không bị giới hạn nội dung. Nó cũng hoạt động tốt trên các chuẩn mực NLP tiêu chuẩn về suy luận, toán học và lập trình, tương tự như các biến thể Gemma 4 khác.
Nếu tác vụ của bạn không yêu cầu ngữ cảnh dài (ví dụ, dưới 8K token) hoặc đầu vào đa phương thức, bạn có thể được phục vụ tốt hơn bởi một mô hình dense nhỏ hơn như Gemma 2 9B hoặc Llama 3 8B, vốn nhanh hơn và rẻ hơn trên mỗi token. Đối với các tác vụ cần bộ lọc an toàn, mô hình không được kiểm duyệt có thể tạo ra đầu ra không phù hợp — thay vào đó hãy chọn mô hình đã được tinh chỉnh an toàn. Ngoài ra, nếu bạn cần độ trễ cực thấp cho chat thời gian thực, mô hình MoE này có thể chậm hơn so với mô hình dense nhỏ vì chi phí định tuyến chuyên gia. Hãy cân nhắc nhu cầu thông lượng của bạn: đối với các yêu cầu ngữ cảnh ngắn, khối lượng lớn, một mô hình rẻ hơn như Gemma 2 27B (dense) có thể tiết kiệm chi phí hơn.
Thiết kế mixture-of-experts chỉ kích hoạt một tập con các tham số cho mỗi token (4 tỷ trong tổng số 26 tỷ). Điều này giảm chi phí tính toán cho mỗi lượt truyền xuôi so với mô hình dense 26B, cho phép thông lượng cao hơn trên cùng một phần cứng. Tuy nhiên, việc định tuyến gây ra một chút chi phí độ trễ cho mỗi token và có thể dẫn đến mất cân bằng tải giữa các expert nếu các prompt có tính chuyên môn hóa cao. Trong thực tế, các mô hình MoE như thế này mang lại sự cân bằng tốt: chất lượng cạnh tranh với một phần nhỏ FLOPs. 4B tham số hoạt động có thể so sánh với mô hình dense 4B về mặt tính toán trên mỗi token, nhưng mô hình lại được hưởng lợi từ kiến thức được lưu trữ trên tổng số 26B tham số.
Có, mô hình chấp nhận cả đầu vào văn bản và hình ảnh. Bạn có thể gửi một hoặc nhiều hình ảnh trong một yêu cầu, kèm theo hướng dẫn bằng văn bản. Các hình ảnh được mã hóa và xử lý cùng với văn bản trong cửa sổ ngữ cảnh 262.144 token. Điều này cho phép trả lời câu hỏi trực quan, hiểu tài liệu và các tác vụ yêu cầu phân tích biểu đồ, sơ đồ hoặc ảnh chụp. Mô hình sử dụng bộ mã hóa thị giác (thường là thành phần giống ViT) để chuyển đổi hình ảnh thành token. Mặc dù chi tiết chính xác về kiến trúc chưa được công bố công khai, nhưng nó hỗ trợ các định dạng hình ảnh tiêu chuẩn. Lưu ý rằng hình ảnh tiêu thụ token theo tỷ lệ với độ phân giải của chúng, vì vậy hình ảnh có độ phân giải cao sẽ làm giảm ngữ cảnh văn bản khả dụng.
Là một biến thể của Gemma 4, mô hình cơ sở (có tinh chỉnh an toàn) đã cho thấy hiệu suất mạnh mẽ trên các chuẩn đánh giá suy luận như MMLU, GSM8K và các tác vụ lập trình như HumanEval và MBPP. Phiên bản không kiểm duyệt có khả năng vẫn giữ lại các khả năng này vì trọng số mô hình cốt lõi không thay đổi. Tuy nhiên, điểm số chuẩn cụ thể cho biến thể không kiểm duyệt này chưa được công bố. Người dùng có thể mong đợi kết quả cạnh tranh trong suy luận số học, sinh mã và các tác vụ đa ngôn ngữ. Cửa sổ ngữ cảnh 262K cũng cho phép hiệu suất vượt trội trong truy xuất tài liệu dài và tóm tắt so với các mô hình có ngữ cảnh ngắn hơn. Đối với các chuẩn đánh giá đa phương thức, mô hình sẽ xử lý đầy đủ các tập dữ liệu trả lời câu hỏi trực quan.
Độ trễ của mô hình Gemma 4 26B A4B thường thấp hơn so với mô hình đặc dày (dense) 26B tham số vì chỉ có 4B tham số hoạt động cho mỗi token. Tuy nhiên, cơ chế định tuyến MoE thêm một chi phí nhỏ cho mỗi token được sinh ra, vì vậy tổng độ trễ cho mỗi token có thể cao hơn một chút so với mô hình đặc dày thuần túy 4B. Đối với suy luận theo lô (batch inference) với các chuỗi dài, thông lượng có thể cao hơn nhờ giảm yêu cầu băng thông bộ nhớ. Trên OrcaRouter, độ trễ cũng sẽ phụ thuộc vào phần cứng cơ bản được cung cấp bởi nhà cung cấp Obsidian. Hiệu suất thực tế nên được kiểm tra với các khối lượng công việc đại diện để xác định xem nó có đáp ứng yêu cầu tốc độ của bạn hay không.
Dù có những điểm mạnh, mô hình này vẫn có những hạn chế. Tham số hoạt động 4B có nghĩa là đối với các suy luận rất phức tạp hoặc kiến thức chuyên ngành, nó có thể hoạt động kém hơn các mô hình lớn hơn như Gemma 4 47B (dense) hoặc các mô hình tiên tiến. Bản chất không kiểm duyệt có nghĩa là đầu ra có thể độc hại, thiên vị hoặc không phù hợp với giá trị con người nếu sử dụng mà không có kiểm duyệt. Nó cũng có thể tạo ra nội dung có hại vi phạm chính sách sử dụng của OpenAI khi được truy cập qua OrcaRouter—người dùng chịu trách nhiệm tuân thủ. Ngoài ra, kiến trúc MoE có thể dẫn đến chất lượng không nhất quán giữa các token nếu việc định tuyến chuyên gia không tối ưu. Cuối cùng, khả năng hiểu đa phương thức, mặc dù có, có thể không sánh được với các mô hình ngôn ngữ-thị giác chuyên dụng.
Giá cho mô hình này do nhà cung cấp Obsidian quy định và được OrcaRouter chuyển qua mà không có bất kỳ khoản tăng giá nào. Bạn trả $0.25 trên một triệu token đầu vào và $2.90 trên một triệu token đầu ra. Token đầu vào bao gồm cả token văn bản và token hình ảnh (hình ảnh được token hóa trước khi xử lý). Token đầu ra bao gồm phản hồi được tạo ra. Không có phí bổ sung nào cho các cuộc gọi API hoặc sử dụng cửa sổ ngữ cảnh ngoài chi phí trên mỗi token. Mức giá này có tính cạnh tranh cho mô hình MoE 26B, đặc biệt với cửa sổ ngữ cảnh lớn. Phí được tính cho từng yêu cầu và xuất hiện trên bảng kê hóa đơn OrcaRouter của bạn.
Token đầu ra đắt hơn đáng kể so với token đầu vào ($2.90 so với $0.25 mỗi triệu). Điều này là điển hình cho các mô hình ngôn ngữ vì việc sinh token yêu cầu nhiều tính toán hơn so với xử lý đầu vào. Để giảm thiểu chi phí, bạn có thể cấu trúc prompt nhằm giảm số lượng token đầu ra—ví dụ, bằng cách yêu cầu phản hồi ngắn hơn hoặc sử dụng hướng dẫn hệ thống để hạn chế sự dài dòng. Ngoài ra, vì chi phí đầu vào thấp, bạn có thể đủ khả năng bao gồm các cửa sổ ngữ cảnh lớn (lên đến 262K token) mà không tốn kém quá nhiều. Nếu trường hợp sử dụng của bạn liên quan đến nhiều prompt ngắn nhưng phản hồi dài, chi phí token đầu ra sẽ chiếm ưu thế.
OrcaRouter không cung cấp bộ nhớ đệm tích hợp cho mô hình này. Mức giá được tính theo từng token và từng yêu cầu. Tuy nhiên, bạn có thể triển khai bộ nhớ đệm phía máy khách cho các chuỗi đầu vào phổ biến để tránh gửi lại các prompt giống hệt nhau. Ngoài ra, nếu bạn lặp lại cùng một system message qua nhiều cuộc hội thoại, bạn có thể cân nhắc đưa nó vào một ngữ cảnh dài và tái sử dụng cùng một phiên qua API chat completions để tránh các token đầu vào dư thừa. Một số nhà cung cấp có thể tự cung cấp bộ nhớ đệm cho prompt, nhưng mức giá của Obsidian như được liệt kê không bao gồm tùy chọn bộ nhớ đệm. Hãy kiểm tra tài liệu của nhà cung cấp để biết mọi khoản giảm giá tiềm năng cho các prompt lặp lại.
Để sử dụng mô hình này, hãy gửi yêu cầu đến endpoint tương thích OpenAI https://api.orcarouter.ai/v1. Đặt tham số model thành "obsidian/gemma-4-26B-A4B". Khóa API của bạn từ OrcaRouter phải được bao gồm trong header Authorization dưới dạng Bearer token. API hỗ trợ cả endpoint hoàn thành văn bản và hoàn thành trò chuyện. Đối với trò chuyện, sử dụng endpoint /v1/chat/completions với mảng messages bao gồm các vai trò user, assistant và system. Đối với yêu cầu đa phương thức, bao gồm URL hình ảnh hoặc dữ liệu base64 trong trường content. Một ví dụ về nội dung yêu cầu trong Python sẽ sử dụng thư viện openai với base_url được đặt thành endpoint của OrcaRouter và ID mô hình như trên.
API hỗ trợ các tham số OpenAI tiêu chuẩn: temperature (0-2, mặc định 1), top_p (0-1), max_tokens (lên đến cửa sổ ngữ cảnh), presence_penalty, frequency_penalty, chuỗi dừng (stop sequences), và n (số lượng hoàn chỉnh). Đối với đa phương thức, trường content chấp nhận một mảng với loại "text" và loại "image_url". Bạn cũng có thể đặt stream=true để nhận phản hồi dạng luồng. Mô hình hỗ trợ tin nhắn hệ thống. Cửa sổ ngữ cảnh là 262,144 token bao gồm đầu vào và đầu ra. Không phải tất cả tham số đều được hỗ trợ chính xác như tài liệu; hãy kiểm tra tài liệu OrcaRouter để biết các giới hạn cụ thể của từng nhà cung cấp. Để có kết quả tốt nhất, đặt temperature trong khoảng 0.7 đến 1.0 cho các tác vụ sáng tạo và thấp hơn cho đầu ra mang tính xác định.
Việc di chuyển rất đơn giản nhờ API tương thích với OpenAI. Nếu bạn đang sử dụng thư viện Python của OpenAI, hãy thay đổi base_url thành https://api.orcarouter.ai/v1 và đặt khóa API của bạn thành khóa OrcaRouter. Cập nhật tham số model từ tên mô hình trước đó thành "obsidian/gemma-4-26B-A4B". Không cần thay đổi mã nguồn nào khác cho hầu hết các trường hợp sử dụng. Đối với các yêu cầu đa phương thức, định dạng hình ảnh có thể khác; hãy sử dụng cấu trúc giống như API vision của OpenAI. Hãy thử một vài yêu cầu để đảm bảo tương thích. Lưu ý rằng giới hạn tốc độ và xử lý lỗi có thể khác; hãy tham khảo tài liệu của OrcaRouter để có các phương pháp tốt nhất.
URL cơ sở cho tất cả các lệnh gọi API là https://api.orcarouter.ai/v1. Mã định danh model chính xác để sử dụng trong các yêu cầu là "obsidian/gemma-4-26B-A4B". Mã này phải được truyền dưới dạng tham số model trong các lệnh gọi chat completions hoặc completions. Không có mã định danh model thay thế cho biến thể này. Hãy đảm bảo bao gồm đầy đủ tiền tố 'obsidian/' để định tuyến chính xác đến nhà cung cấp Obsidian. Nếu bạn cố gắng sử dụng mã ID chung 'gemma-4-26B-A4B' mà không có tiền tố nhà cung cấp, nó có thể không phân giải được. Tiền tố nhà cung cấp là cần thiết vì OrcaRouter hỗ trợ nhiều nhà cung cấp cùng cung cấp model cơ sở.
Trong dòng sản phẩm Gemma 4, Google cung cấp cả biến thể dày đặc và biến thể MoE. Phiên bản dày đặc (ví dụ: Gemma 4 47B) có tất cả các tham số hoạt động, mang lại chất lượng cao hơn trên mỗi token nhưng với chi phí tính toán cao hơn. Phiên bản MoE với tổng 26B và 4B hoạt động mang đến điểm cân bằng tối ưu về hiệu quả chi phí. So với Gemma 4 2B hoặc 9B dày đặc, mô hình này có kiến thức rộng hơn nhờ tổng số tham số lớn hơn. Trong số các mô hình MoE, Gemma 4 26B A4B nhỏ hơn các mô hình MoE lớn hơn như Mixtral 8x22B (tổng 141B, 39B hoạt động). Khía cạnh không kiểm duyệt là điểm độc đáo của biến thể Obsidian này; các mô hình Gemma 4 khác có tích hợp tinh chỉnh an toàn.
Các mô hình không kiểm duyệt như dòng Llama 3-Uncensored hay Wizard thường loại bỏ bộ lọc an toàn khỏi mô hình gốc. Biến thể Gemma 4 này là một trong số ít tùy chọn MoE không kiểm duyệt, cung cấp tổng số tham số lớn hơn (26B) với số tham số hoạt động thấp hơn (4B). So với Llama 3 70B Uncensored, nó nhỏ hơn và rẻ hơn nhiều nhưng có thể có giới hạn thấp hơn ở các tác vụ phức tạp. Cửa sổ ngữ cảnh 262K của nó lớn hơn đáng kể so với hầu hết các mô hình không kiểm duyệt, vốn thường giới hạn ở 8K-32K. Hỗ trợ đa phương thức cũng là điểm khác biệt: hầu hết các mô hình không kiểm duyệt chỉ hỗ trợ văn bản.
GPT-4o và Claude 3.5 Sonnet là các mô hình độc quyền lớn hơn với khả năng tinh chỉnh an toàn và đa phương thức rộng rãi. Chúng thường vượt trội hơn Gemma 4 26B A4B trong các điểm chuẩn và tác vụ thực tế, đặc biệt về lý luận, sáng tạo và tính nhất quán. Tuy nhiên, chúng đắt hơn nhiều cho mỗi token (GPT-4o: $5/M đầu vào, $15/M đầu ra; Claude: $3/M đầu vào, $15/M đầu ra). Mô hình Gemma lý tưởng cho các ứng dụng nhạy cảm về chi phí cần ngữ cảnh lớn nhưng không có các hạn chế về an toàn. Nó sẽ không sánh kịp các mô hình tiên tiến về khả năng tuân theo hướng dẫn tinh tế hay độ chính xác thực tế, nhưng có thể đủ cho nhiều tác vụ sinh tạo.
Chọn mô hình này thay vì mô hình lớn hơn (như GPT-4o hoặc Claud Opus) khi: (1) bạn cần một cửa sổ ngữ cảnh rất lớn (262K) mà không phải trả giá cao; (2) bạn yêu cầu đầu ra không bị kiểm duyệt cho các trường hợp sử dụng được phép; (3) khối lượng công việc của bạn có thông lượng cao và hiệu quả chi phí của MoE là quan trọng; (4) các tác vụ của bạn nằm trong khả năng của một mô hình có 4B tham số hoạt động. Tránh mô hình này nếu bạn cần chất lượng cao nhất cho các quyết định quan trọng, sự an toàn nghiêm ngặt, hoặc lý luận cực kỳ phức tạp. Đối với nhiều tác vụ thông thường như tóm tắt, dịch thuật, hoặc hỏi đáp trên các tài liệu dài, mô hình này cung cấp tỷ lệ giá-hiệu suất mạnh mẽ.
| Đầu vào / 1M tokens | $0.250 |
| Đầu ra / 1M tokens | $2.90 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/obsidian/gemma-4-26B-A4BMở @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B