Qwen3-VL 235B-A22B Instruct — mô hình ngôn ngữ-thị giác trọng số mở, 235B tổng / 22B tham số hoạt động, ngữ cảnh 256k, không có chế độ suy nghĩ.
Qwen3 VL 235B A22B Instruct là một biến thể ngôn ngữ thị giác của dòng mô hình Qwen3, được xây dựng bởi Alibaba Cloud. Nó sử dụng thiết kế hỗn hợp chuyên gia (mixture-of-experts) với tổng số 235 tỷ…
Mô hình này xuất sắc trong các tác vụ mà hình ảnh và văn bản tương tác. Nó có thể trả lời các câu hỏi về nội dung của một hình ảnh, mô tả các cảnh một cách chi tiết, đọc văn bản từ tài liệu hoặc biển báo, và suy luận về mối quan hệ giữa các đối tượng trong một bức ảnh. Nó cũng xử lý nhiều hình ảnh trong một cuộc trò chuyện duy nhất, cho phép phân tích so sánh hoặc suy luận tuần tự. Việc tinh chỉnh hướng dẫn cho phép mô hình tuân theo các lời nhắc đa phương thức phức tạp, chẳng hạn như 'Giải thích tại sao biểu đồ này cho thấy một xu hướng' hoặc 'Trích xuất tất cả các giá trị số từ bảng này.' Những khả năng này bắt nguồn từ nhánh MoE lớn và việc đào tạo thị giác-ngôn ngữ chuyên biệt.
Là một biến thể Instruct, mô hình đã được tinh chỉnh để tuân theo hướng dẫn của người dùng với độ trung thực cao trên cả các prompt chỉ có văn bản và đa phương thức. Mô hình có thể xử lý các cuộc hội thoại nhiều lượt trong đó hình ảnh được giới thiệu dần dần, duy trì ngữ cảnh qua nhiều trao đổi và tuân theo các hướng dẫn về định dạng (ví dụ: xuất ra dưới dạng JSON, gạch đầu dòng hoặc từng bước). Mô hình hoạt động tốt trong các tác vụ yêu cầu tuân thủ các ràng buộc, chẳng hạn như 'Chỉ trả lời nếu hình ảnh có chứa một con chó.' Điều này làm cho nó phù hợp với các ứng dụng mà hành vi tuân thủ quy tắc nhất quán là quan trọng.
Đối với các tác vụ chỉ có văn bản, không có thành phần hình ảnh, mô hình 235B MoE có thể là quá mức cần thiết; các mô hình dense nhỏ hơn hoặc các biến thể Qwen chỉ dành cho văn bản khác sẽ tiết kiệm chi phí hơn. Tương tự, nếu hình ảnh của bạn đơn giản (ví dụ: logo cơ bản, đối tượng đơn lẻ) hoặc bạn cần thông lượng cực cao với ngân sách hạn chế, một mô hình thị giác nhỏ hơn như Qwen2-VL 7B có thể đáp ứng được. Mô hình này là phù hợp nhất khi bạn cần xử lý các hình ảnh phức tạp, độ phân giải cao, tài liệu có mật độ văn bản dày đặc hoặc các tác vụ yêu cầu suy luận đa phương thức sâu. Trên OrcaRouter, bạn có thể so sánh giá cả và chuyển đổi ID mô hình một cách dễ dàng.
Không. Qwen3 VL 235B A22B Instruct là một mô hình sinh văn bản chỉ chấp nhận đầu vào là hình ảnh. Nó không sinh ra hình ảnh, âm thanh hay bất kỳ phương thức nào khác. Đầu ra luôn là một chuỗi văn bản. Nếu bạn cần sinh hình ảnh, bạn sẽ sử dụng một mô hình riêng biệt. Điểm mạnh của mô hình này nằm ở khả năng hiểu và suy luận về đầu vào hình ảnh. Ví dụ, nó có thể mô tả hình ảnh trông như thế nào hoặc trả lời các câu hỏi về nó, nhưng nó không thể tự tạo, chỉnh sửa hoặc biến đổi hình ảnh.
Điểm MMLU-Pro được báo cáo cho mô hình này là 82.3. MMLU-Pro là phiên bản cải tiến của chuẩn đánh giá Massive Multitask Language Understanding, bao gồm 57 chủ đề trong các lĩnh vực STEM, nhân văn và khoa học xã hội. Điểm số 82.3 cho thấy kiến thức tổng quát mạnh mẽ và khả năng suy luận trên nhiều chủ đề đa dạng. Đây là một con số tổng hợp; hiệu suất có thể thay đổi theo từng chủ đề. Điểm số này đưa mô hình vào nhóm những mô hình hàng đầu trong cùng phân khúc kích thước, đặc biệt khi xét đến kiến trúc MoE chỉ kích hoạt một phần nhỏ trong tổng số tham số của nó cho mỗi truy vấn.
Điểm mạnh bao gồm độ chính xác cao trên các điểm chuẩn suy luận đa phương thức, khả năng tuân thủ hướng dẫn tốt và hiệu quả chi phí so với các mô hình dày đặc có tổng số tham số tương tự. Thiết kế MoE cho phép mở rộng dung lượng mà không làm tăng chi phí tính toán tương ứng. Hạn chế bao gồm chi phí tuyệt đối cao hơn so với các mô hình nhỏ hơn, tiềm ẩn độ trễ cao hơn do số lượng lớn tham số tổng thể (mặc dù chỉ có 22B tham số hoạt động, toàn bộ mô hình phải được tải vào bộ nhớ). Mô hình cũng có thể thỉnh thoảng bị ảo giác về các chi tiết nhỏ trong ảnh hoặc thất bại đối với các đầu vào hình ảnh quá mơ hồ. Hiệu năng trên các tác vụ miền cụ thể (ví dụ: hình ảnh y tế) không được đảm bảo.
Tốc độ suy luận phụ thuộc vào phần cứng nền tảng mà OrcaRouter sử dụng và tải hiện tại. Là một mô hình MoE với tổng số 235 tỷ tham số, nó yêu cầu bộ nhớ GPU đáng kể mặc dù chỉ có 22 tỷ tham số được kích hoạt cho mỗi token. Điều này thường dẫn đến độ trễ mỗi yêu cầu cao hơn so với các mô hình đặc nhỏ hơn (ví dụ: 7B-70B tham số). Thông lượng cũng bị ảnh hưởng bởi kích thước batch và độ dài chuỗi. Đối với các ứng dụng nhạy cảm với độ trễ, hãy cân nhắc sử dụng mô hình nhỏ hơn hoặc tối ưu hóa cho các prompt ngắn hơn. OrcaRouter không cung cấp các đảm bảo độ trễ cụ thể nhưng hướng tới khả năng phản hồi cấp sản xuất.
OrcaRouter tính phí chính xác theo mức giá niêm yết của nhà cung cấp: $0,40 cho mỗi 1 triệu token đầu vào và $1,60 cho mỗi 1 triệu token đầu ra. Không có thêm bất kỳ khoản chênh lệch giá nào. Cả token đầu vào và token đầu ra đều được đếm theo quy tắc token hóa của OpenAI, có thể khác biệt đôi chút so với bộ token hóa nội bộ của mô hình. Hình ảnh cũng được tính phí dưới dạng token dựa trên kích thước và mức độ chi tiết, theo chính sách của nhà cung cấp. Bạn có thể ước tính chi phí bằng cách nhân lượng token dự kiến sử dụng với các mức giá này.
Chi phí cho mỗi token cao hơn so với các mô hình nhỏ hơn hoặc dày đặc, nhưng kiến trúc MoE cung cấp nhiều dung lượng hơn trên mỗi tham số hoạt động so với một mô hình dày đặc có kích thước hoạt động tương đương. Đối với các tác vụ đa phương thức phức tạp, mô hình này có thể hoàn thành tác vụ với ít token hơn hoặc độ chính xác cao hơn, có khả năng giảm tổng chi phí. Tuy nhiên, đối với các tác vụ đơn giản, một mô hình rẻ hơn sẽ giảm chi phí. Trên OrcaRouter, bạn có thể chuyển đổi mô hình linh hoạt, cho phép bạn chỉ sử dụng mô hình này khi cần thiết. Không có cam kết tối thiểu hàng tháng hoặc phí ẩn.
OrcaRouter hiện không công bố chính sách lưu đệm cụ thể cho mô hình này. Nhà cung cấp nền tảng có thể áp dụng lưu đệm ở cấp độ token nhưng không được đảm bảo. Không có chương trình giảm giá theo số lượng hoặc giá theo bậc nào được đề cập; giá cố định trên mỗi token. Đối với người dùng khối lượng lớn, có thể nên liên hệ bộ phận hỗ trợ của OrcaRouter để thương lượng các thỏa thuận riêng. Nhìn chung, giá cả minh bạch và dựa trên mức sử dụng.
Hình ảnh được chuyển đổi thành số lượng token dựa trên độ phân giải và cài đặt chi tiết của chúng. Công thức chính xác được xác định bởi nhà cung cấp (Qwen) và có thể thay đổi. Thông thường, hình ảnh có độ phân giải cao hơn tiêu thụ nhiều token hơn. OrcaRouter chuyển tiếp quá trình token hóa của nhà cung cấp mà không thay đổi. Bạn có thể kiểm soát chi phí bằng cách thay đổi kích thước hình ảnh hoặc sử dụng chế độ chi tiết thấp nếu mô hình hỗ trợ. Luôn tham khảo tài liệu của nhà cung cấp để biết cách tính token hình ảnh chính xác. Token đầu vào cho hình ảnh được tính vào tỷ lệ $0.40 mỗi triệu.
Bạn gửi một yêu cầu POST tới https://api.orcarouter.ai/v1/chat/completions với payload JSON tương thích OpenAI. Đặt trường model thành "qwen/qwen3-vl-235b-a22b-instruct". Bao gồm một mảng messages trong đó mỗi message có thể chứa nội dung văn bản và/hoặc hình ảnh. Đối với hình ảnh, sử dụng định dạng nội dung hình ảnh chuẩn của OpenAI (URL hoặc base64). Xác thực qua token Bearer (API key của bạn). Các tham số ví dụ: temperature, max_tokens, top_p và stop sequences hoạt động giống hệt như API OpenAI. Tài liệu của OrcaRouter cung cấp chi tiết đầy đủ.
Tất cả các tham số hoàn tất trò chuyện tiêu chuẩn đều được hỗ trợ: temperature (0-2, mặc định 1), top_p (0-1, mặc định 1), max_tokens (số lượng token đầu ra), stop (danh sách các chuỗi), presence_penalty, frequency_penalty và seed để tái tạo. Mô hình cũng tôn trọng các thông báo hệ thống để thiết lập hành vi. Đối với các yêu cầu đa phương thức, bạn bao gồm một phần hình ảnh trong nội dung của tin nhắn người dùng. Không có tham số riêng cho mô hình nào được hiển thị; API được giữ chung chung để tương thích. Nếu bạn cần kiểm soát định tuyến MoE, việc đó được xử lý nội bộ.
Có. Vì OrcaRouter sử dụng định dạng API của OpenAI, việc di chuyển rất đơn giản. Thay thế base URL và model ID hiện tại của bạn bằng endpoint của OrcaRouter và "qwen/qwen3-vl-235b-a22b-instruct". Đảm bảo khóa API của bạn hợp lệ và bạn có đủ credits. Định dạng tin nhắn cho hình ảnh giống hệt của OpenAI (sử dụng loại nội dung 'image_url'). Bạn có thể cần điều chỉnh ước tính số lượng token do cách token hóa khác nhau. Không cần thay đổi logic ứng dụng của bạn ngoài endpoint và tên model.
Qwen3 VL 235B A22B Instruct và GPT-4V đều xử lý đầu vào đa phương thức. Sự khác biệt chính: Qwen3 VL sử dụng MoE với 22B tham số hoạt động, trong khi GPT-4V là mô hình dense độc quyền với kích thước không được tiết lộ. Giá của Qwen3 VL qua OrcaRouter là 0,40/1,60 đô la mỗi triệu token, thấp hơn đáng kể so với mức giá thông thường của GPT-4V. Điểm benchmark không thể so sánh trực tiếp vì MMLU-Pro và các bài kiểm tra khác sử dụng các tập con khác nhau. GPT-4V có hệ sinh thái hỗ trợ rộng hơn, nhưng Qwen3 VL mang lại lợi thế về chi phí cho khối lượng công việc đa phương thức lớn trên OrcaRouter.
Claude 3.5 Sonnet là một mô hình dense từ Anthropic với khả năng văn bản và thị giác mạnh mẽ. Nó không sử dụng MoE, do đó tổng dung lượng của nó nhỏ hơn tổng tham số của Qwen3 VL nhưng dung lượng hoạt động mỗi lần suy luận lại cao hơn 22B. Giá cho Claude 3.5 Sonnet thường cao hơn mỗi token (khoảng $3.00/$15.00 mỗi triệu token). Qwen3 VL cung cấp chi phí thấp hơn nhiều cho các tác vụ đa phương thức. Tuy nhiên, các mô hình Claude có cửa sổ ngữ cảnh lớn hơn (200K token). Lựa chọn phụ thuộc vào ngân sách, nhu cầu độ dài ngữ cảnh và nhà cung cấp ưa thích.
OrcaRouter có thể cung cấp các mô hình Qwen khác như Qwen2.5 7B, Qwen2.5 72B hoặc các biến thể Qwen2-VL. Qwen3 VL 235B A22B Instruct là mô hình MoE đa phương thức lớn nhất trong dòng Qwen. So với Qwen2-VL 72B, nó có tổng số tham số lớn hơn và kiến trúc MoE, có thể mang lại hiệu suất tốt hơn trên các tác vụ phức tạp trong khi vẫn duy trì chi phí suy luận hợp lý. Nó đắt hơn trên mỗi token so với các mô hình Qwen nhỏ hơn nhưng có thể tiết kiệm chi phí nếu giảm nhu cầu gọi nhiều lần hoặc tiêu thụ token cao.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Đầu vào / 1M tokens | $0.400 |
| Đầu ra / 1M tokens | $1.60 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructMở @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct