Một phiên bản không kiểm duyệt, không mất mát của Qwen3.6 35B A3B, giữ nguyên khả năng của mô hình gốc trong khi loại bỏ hành vi từ chối. Được xây dựng cho các nhà phát triển, nhà nghiên cứu AI và các quy trình tác nhân tiên tiến yêu cầu đầu ra của mô hình không bị hạn chế mà không làm giảm khả năng suy luận, lập trình, đa ngôn ngữ hoặc sử dụng công cụ. Biến thể Aggressive được mở khóa hoàn toàn và được thiết kế để cung cấp các phản hồi trực tiếp, đầy đủ trên nhiều loại prompt. Mặc dù mô hình đôi khi có thể thêm vào các tuyên bố từ chối trách nhiệm ngắn gọn kế thừa từ quá trình huấn luyện của mô hình gốc, nhưng đó không phải là hành vi từ chối và nội dung được yêu cầu vẫn được tạo ra đầy đủ. Lý tưởng cho nghiên cứu AI, kiểm thử bảo mật, red teaming, phát triển tác nhân, trợ lý lập trình và các ứng dụng AI tiên tiến khác hưởng lợi từ tính linh hoạt tối đa của đầu ra. Quyền truy cập vào mô hình này có kiểm soát và dành cho các nhà nghiên cứu bảo mật, đội red team, nhà nghiên cứu an toàn AI và các chuyên gia có trình độ khác đang tiến hành nghiên cứu, đánh giá và kiểm thử hợp pháp.
Mô hình này là một biến thể Hỗn hợp chuyên gia (Mixture-of-Experts) thuộc dòng Qwen3.6, được phát triển bởi Alibaba Cloud và lưu trữ bởi nhà cung cấp Obsidian trên OrcaRouter. Mô hình có tổng cộng 35…
Mô hình này vượt trội trong các tác vụ hưởng lợi từ cửa sổ ngữ cảnh lớn và khả năng hiểu đa phương thức. Về văn bản, nó có thể tóm tắt hoặc trả lời câu hỏi trên các tài liệu dài tới 262,144 token, chẳng hạn như toàn bộ sách hoặc báo cáo dài. Về hình ảnh và video, nó có thể trích xuất thông tin chi tiết và kết hợp với ngữ cảnh văn bản. Bản chất không kiểm duyệt cho phép nó tạo ra nội dung sáng tạo mà không bị ràng buộc bởi các ràng buộc an toàn thông thường, hữu ích cho việc tạo truyện, nhập vai hoặc các tình huống khác không muốn có bộ lọc hạn chế. Thiết kế MoE của nó cung cấp suy luận nhanh so với các mô hình dày đặc có tổng kích thước tương tự, làm cho nó trở nên thực tế cho các ứng dụng thời gian thực khi được triển khai hiệu quả. Khả năng đa ngôn ngữ được kế thừa từ dòng Qwen3.6, hỗ trợ nhiều ngôn ngữ.
Thẻ "uncensored" có nghĩa là mô hình đã trải qua quá trình huấn luyện căn chỉnh giảm so với các checkpoint Qwen3.6 tiêu chuẩn. Điều này có thể dẫn đến các đầu ra ít được lọc hơn đối với nội dung có hại, xúc phạm hoặc gây tranh cãi. Người dùng nên kiểm tra mô hình kỹ lưỡng trong trường hợp sử dụng cụ thể của họ để đảm bảo đầu ra đáp ứng tiêu chuẩn của họ. Việc thiếu kiểm duyệt có thể có lợi cho các tác vụ như viết sáng tạo, nhập vai không kiểm duyệt, hoặc nghiên cứu về các chủ đề nhạy cảm nơi mong muốn tạo ra nội dung trung lập. Tuy nhiên, điều đó cũng có nghĩa là mô hình có thể tạo ra nội dung vi phạm các chính sách nội dung thông thường. OrcaRouter không tuyên bố có thêm bất kỳ bộ lọc an toàn nào; hành vi cơ bản của mô hình là những gì bạn nhận được.
Nếu nhiệm vụ của bạn liên quan đến đầu vào ngắn (ví dụ: vài trăm token), phân loại đơn giản hoặc chỉ yêu cầu hiểu ngôn ngữ cơ bản, các mô hình nhỏ hơn và rẻ hơn như Qwen2.5-7B hoặc GPT-4o-mini có thể tiết kiệm chi phí hơn. Điểm mạnh của mô hình này thể hiện rõ nhất khi xử lý các ngữ cảnh rất dài (trên 10K token) hoặc đầu vào đa phương thức. Đối với các tác vụ văn bản thuần túy dưới 8K token và không cần khả năng xử lý hình ảnh/video, bạn có thể tiết kiệm chi phí bằng cách sử dụng một mô hình nhỏ chuyên dụng. Ngoài ra, nếu ứng dụng của bạn yêu cầu lọc nội dung nghiêm ngặt, bản chất không kiểm duyệt có thể buộc bạn phải thêm một lớp kiểm duyệt bên ngoài, làm tăng chi phí.
Mô hình chấp nhận đầu vào là hình ảnh và video bên cạnh văn bản. Đối với hình ảnh, bạn có thể cung cấp dữ liệu hình ảnh được mã hóa base64 hoặc URL (thông qua mảng nội dung của API với loại "image_url"). Đối với video, API có thể chấp nhận các khung hình video dưới dạng chuỗi hình ảnh hoặc URL tệp video; định dạng chính xác nên được kiểm tra trong tài liệu của OrcaRouter. Mô hình xử lý các đầu vào trực quan này cùng với văn bản để tạo ra phản hồi. Cửa sổ ngữ cảnh 262,144 token áp dụng cho tổng số token của tất cả các phương thức đầu vào. Lưu ý rằng việc xử lý hình ảnh và video tiêu thụ token tỷ lệ thuận với độ phân giải và độ dài trực quan, do đó đầu vào lớn hơn sẽ làm giảm dung lượng văn bản khả dụng.
Không có điểm chuẩn cụ thể nào được nhà cung cấp đưa ra cho mô hình này. Dòng Qwen3.6 thường hoạt động cạnh tranh trên các điểm chuẩn ngữ cảnh dài như L-Eval và RULER, cũng như trên các tác vụ đa phương thức như MMMU và MathVista, nhưng các con số chính xác cho biến thể không kiểm duyệt 35B A3B này vẫn chưa được công bố. Người dùng quan tâm đến hiệu suất thực nghiệm nên tự chạy đánh giá trên các tập dữ liệu đại diện. Kiến trúc MoE với 3B tham số được kích hoạt thường cho kết quả tương đương với các mô hình dày đặc có kích thước hoạt động tương tự, trong khi tổng chi phí lưu trữ và bộ nhớ cao hơn do có đầy đủ 35B tham số.
Tốc độ và độ trễ phụ thuộc vào một số yếu tố: độ dài đầu vào, độ dài đầu ra, tải máy chủ và cấu hình phần cứng. Vì mô hình chỉ kích hoạt 3B tham số cho mỗi token, nó được kỳ vọng sẽ nhanh hơn mô hình dày đặc 35B, với tốc độ sinh tương đương với các mô hình như GPT-3.5 (mặc dù không có số liệu chính xác được cung cấp). Hạ tầng của OrcaRouter qua Obsidian có thể mang lại độ trễ thay đổi; người dùng có thể tự kiểm tra với khối lượng công việc của mình. Đối với các kịch bản ngữ cảnh dài (ví dụ: 100K+ token), thời gian prefill tăng tuyến tính theo độ dài đầu vào. Việc sinh token đầu ra thường là yếu tố đóng góp chính vào độ trễ. Không có thỏa thuận mức dịch vụ (SLA) về tốc độ nào được nêu rõ.
Điểm mạnh của mô hình bao gồm cửa sổ ngữ cảnh lớn 262K, cho phép xử lý toàn bộ sách hoặc bản ghi video dài nhiều giờ trong một lần truyền. Thiết kế MoE mang lại sự cân bằng tốt giữa dung lượng và tốc độ suy luận. Đầu vào đa phương thức cho phép thực hiện các tác vụ kết hợp dữ liệu văn bản và hình ảnh. Bản chất không kiểm duyệt cho phép tạo ra nội dung mà các mô hình khác có thể từ chối. Hỗ trợ đa ngôn ngữ bao gồm hàng chục ngôn ngữ. Mức giá cạnh tranh cho một mô hình có khả năng như vậy: $0,31/M đầu vào và $4,21/M đầu ra, không có phụ phí.
Các hạn chế bao gồm việc thiếu các số liệu benchmark được công bố, khiến cho việc đánh giá hiệu suất tương đối trở nên khó khăn hơn. Bản chất không kiểm duyệt có thể tạo ra các đầu ra không mong muốn nếu không có sự kiểm duyệt bổ sung. Số lượng tham số kích hoạt 3B có nghĩa là nó có thể không sánh được với sức mạnh suy luận thô của các mô hình dense lớn hơn (ví dụ: GPT-4) trong các tác vụ logic phức tạp. Khả năng đa phương thức có thể kém tinh tế hơn so với các mô hình ngôn ngữ-thị giác chuyên dụng. Các phương thức đầu vào như tokenization video có thể làm giảm ngữ cảnh hiệu quả cho văn bản. Không có khả năng streaming hoặc sử dụng công cụ nào được đảm bảo. Cuối cùng, sự phụ thuộc vào nhà cung cấp bên thứ ba Obsidian có nghĩa là tính khả dụng và thời gian hoạt động không nằm trong tầm kiểm soát của OrcaRouter.
Giá cả minh bạch: $0,31 cho mỗi triệu token đầu vào và $4,21 cho mỗi triệu token đầu ra. Đây là mức giá chính xác từ nhà cung cấp Obsidian, không có bất kỳ khoản phụ phí nào từ OrcaRouter. Token đầu vào bao gồm tất cả văn bản và token hình ảnh (cho ảnh và video). Token đầu ra là văn bản được tạo ra. Không có phí cho mỗi yêu cầu hay yêu cầu đăng ký. Bạn chỉ trả tiền cho token đã sử dụng. Giá được tính theo 1 triệu token, vì vậy các yêu cầu nhỏ chỉ tốn một phần nhỏ của xu. Không có gói miễn phí hay dùng thử nào được quảng cáo.
Không có thông tin về giảm giá, lợi ích từ bộ nhớ đệm, hoặc giá theo khối lượng được tiết lộ cho mô hình này. Mức giá được liệt kê là cố định theo token. Không giống như một số nhà cung cấp đưa ra mức giá thấp hơn cho token đầu vào được lưu trong bộ nhớ đệm, OrcaRouter áp dụng cùng một mức giá đầu vào bất kể tần suất lặp lại. Đối với mức sử dụng rất cao, bạn có thể liên hệ với OrcaRouter để thỏa thuận tùy chỉnh tiềm năng, nhưng không có chương trình giảm giá tiêu chuẩn nào được ghi nhận. Chính sách không tăng giá đảm bảo bạn đang trả chính xác số tiền Obsidian tính phí, không có phí ẩn.
Các mô hình đa phương thức ngữ cảnh dài tương tự từ các nhà cung cấp khác thường có giá cao hơn: ví dụ, GPT-4 Turbo của OpenAI có giá $10/1M đầu vào và $30/1M đầu ra, trong khi Claude 3.5 Sonnet có giá $3/1M đầu vào và $15/1M đầu ra. Mô hình này rẻ hơn đáng kể với $0.31/$4.21. Tuy nhiên, các mô hình đó cung cấp các khả năng khác nhau (ví dụ: sử dụng công cụ, benchmark suy luận cao hơn). Mức giá thấp hơn phản ánh kiến trúc MoE và thực tế đây là mô hình không kiểm duyệt do bên thứ ba lưu trữ. Nếu bạn yêu cầu độ tin cậy đảm bảo, bảo mật cao hơn hoặc các tính năng nâng cao như gọi hàm, chi phí bổ sung có thể là hợp lý.
Để sử dụng mô hình, hãy gửi một yêu cầu POST đến https://api.orcarouter.ai/v1/chat/completions (hoặc endpoint phù hợp theo API tương thích OpenAI của OrcaRouter). Bao gồm header "Authorization: Bearer YOUR_API_KEY". Trong phần thân yêu cầu, đặt "model": "obsidian/Qwen3.6-35B-A3B". Truyền tin nhắn theo định dạng OpenAI chuẩn: một mảng các đối tượng có "role" và "content". Đối với nội dung đa phương thức, sử dụng mảng nội dung với loại "text" và "image_url" (hoặc tương đương video). Ví dụ với cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
Bạn có thể sử dụng các tham số tương thích với OpenAI điển hình: temperature (mặc định 1.0), top_p (0.9), max_tokens (mặc định thay đổi, khuyến nghị đặt rõ ràng), chuỗi dừng, frequency_penalty, presence_penalty, và seed để tái lập kết quả. Mô hình hỗ trợ phát trực tuyến qua "stream": true để nhận phản hồi từng token. Đối với đầu vào đa phương thức, API yêu cầu mảng nội dung với loại "image_url" và tùy chọn "video_url" (kiểm tra tài liệu OrcaRouter để biết định dạng video chính xác). Giới hạn cửa sổ ngữ cảnh là 262.144 token, áp dụng cho tổng số token trong tin nhắn cộng với phản hồi. Nếu vượt quá giới hạn, bạn sẽ nhận lỗi độ dài ngữ cảnh; bạn có thể điều chỉnh "max_tokens" hoặc cắt bớt tin nhắn.
Để tận dụng bối cảnh 262K, hãy cấu trúc các prompt của bạn để bao gồm toàn bộ tài liệu hoặc lịch sử hội thoại. Hãy lưu ý rằng mỗi token trong đầu vào đều tính vào chi phí và giới hạn. Đối với đầu vào rất dài, hãy cân nhắc việc phân đoạn hoặc tóm tắt trước khi gửi, mặc dù mô hình được thiết kế để xử lý toàn bộ bối cảnh. Sử dụng tham số "max_tokens" để kiểm soát độ dài đầu ra. Nếu bạn gặp lỗi timeout, hãy bật streaming để nhận kết quả một phần nhanh hơn. OrcaRouter có thể có cài đặt timeout riêng; hãy liên hệ bộ phận hỗ trợ nếu cần. Mô hình không hỗ trợ tin nhắn hệ thống theo cách đặc biệt; hãy coi chúng như tin nhắn của người dùng hoặc trợ lý với vai trò "system" (định dạng OpenAI chuẩn).
Di chuyển từ các nhà cung cấp như OpenAI hoặc Anthropic bao gồm việc thay đổi URL gốc thành https://api.orcarouter.ai/v1 và cập nhật ID mô hình. Nếu mã của bạn sử dụng client Python của OpenAI, hãy đặt `client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1")` và sau đó sử dụng `client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...)`. Định dạng tin nhắn và tên tham số là giống hệt nhau. Không cần thay đổi logic prompt. Lưu ý rằng hình dạng đối tượng phản hồi cũng tương thích, vì vậy mã phân tích hiện tại sẽ hoạt động. Hãy thử nghiệm với một yêu cầu nhỏ trước để đảm bảo xác thực và thanh toán đúng cách.
So với Qwen3.6-72B (dense), mô hình này sử dụng MoE và do đó có chi phí suy luận mỗi token thấp hơn nhưng có thể có dung lượng thô thấp hơn một chút. Ngữ cảnh 262K lớn hơn 128K của Qwen2.5. So với Qwen3.6-32B (có thể là dense), mô hình này cung cấp đầu vào đa phương thức mà các phiên bản trước đó có thể không có. Biến thể "uncensored" là độc đáo; các bản phát hành Qwen tiêu chuẩn có alignment. Nếu bạn cần an toàn nghiêm ngặt, chọn Qwen3.6 thông thường. Về giá cả, mô hình này rẻ hơn nhiều mô hình Qwen dense trên các nền tảng khác.
GPT-4o và Claude 3.5 Sonnet là các mô hình độc quyền với đào tạo an toàn rộng rãi, điểm chuẩn cao hơn về lý luận và lập trình, hỗ trợ sử dụng công cụ, thị giác và ngữ cảnh lớn (200K đối với Claude). Mô hình này cung cấp ngữ cảnh lớn hơn (262K) và đầu vào đa phương thức với mức giá thấp hơn đáng kể. Tuy nhiên, nó thiếu các tính năng tiên tiến, độ tin cậy và tính nhất quán về hiệu suất so với các mô hình đó. Đối với các ứng dụng mà chi phí là mối quan tâm chính và bạn có thể chấp nhận một số đánh đổi về chất lượng, mô hình này là một lựa chọn thay thế tốt. Nếu bạn cần lý luận đẳng cấp cao nhất hoặc gọi hàm, các mô hình cao cấp đáng giá với chi phí bổ sung.
Mô hình này phù hợp nhất khi bạn cần: (1) ngữ cảnh rất dài (262K token) với chi phí thấp; (2) đầu vào đa phương thức (hình ảnh/video) mà không phải trả phí cao; (3) sinh văn bản không kiểm duyệt, nơi các bộ lọc nội dung có thể gây cản trở; (4) suy luận nhanh so với tổng số tham số nhờ vào kích hoạt MoE. Đây là một ứng cử viên mạnh cho nghiên cứu, trích xuất dữ liệu, viết sáng tạo và bất kỳ tác vụ nào được hưởng lợi từ ngữ cảnh cao và chi phí mỗi token thấp. Nếu bạn cần các tính năng nâng cao như gọi công cụ, đầu ra có cấu trúc, hoặc độ tin cậy cao, hãy cân nhắc các mô hình khác.
| Đầu vào / 1M tokens | $0.310 |
| Đầu ra / 1M tokens | $4.21 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BMở @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B