Qwen3-VL 235B-A22B Instruct — 오픈 가중치 비전-언어 모델, 총 235B / 활성 22B 파라미터, 256k 컨텍스트, 씽킹 모드 없음.
Qwen3 VL 235B A22B Instruct는 Alibaba Cloud가 구축한 Qwen3 모델 시리즈의 시각-언어 변형입니다. 이 모델은 총 2350억 개의 파라미터를 가진 혼합 전문가(MoE) 설계를 사용하며, 그중 약 220억 개가 순방향 패스당 활성화됩니다. 이 MoE 구조는 모델이 높은 용량을 유지하면서도 유사한 전체 크기의 밀집 모델보다…
이 모델은 이미지와 텍스트가 상호작용하는 작업에 뛰어납니다. 이미지 내용에 대한 질문에 답하고, 장면을 상세히 설명하며, 문서나 간판의 텍스트를 읽고, 사진 속 객체 간의 관계를 추론할 수 있습니다. 또한 단일 대화에서 여러 이미지를 처리하여 비교 분석이나 순차적 추론이 가능합니다. 명령어 튜닝을 통해 모델은 'Explain why this chart shows a trend' 또는 'Extract all numerical values from this table.'과 같은 복잡한 멀티모달 프롬프트를 따를 수 있습니다. 이러한 능력은 대규모 MoE 백본과 특화된 시각-언어 훈련에서 비롯됩니다.
Instruct 변종으로서 이 모델은 텍스트 전용 및 멀티모달 프롬프트 모두에서 사용자 지침을 높은 정확도로 따르도록 미세 조정되었습니다. 이미지가 점진적으로 도입되는 다중 턴 대화를 처리하고, 여러 교환에 걸쳐 컨텍스트를 유지하며, JSON, 불릿 포인트, 단계별 출력과 같은 형식 지정 지침을 따를 수 있습니다. '이미지에 개가 포함된 경우에만 답변하세요.'와 같은 제약 조건을 준수해야 하는 작업에서도 우수한 성능을 보입니다. 이는 일관된 규칙 준수 행동이 중요한 애플리케이션에 적합합니다.
텍스트 전용 작업(시각적 요소 없음)의 경우 235B MoE 모델은 과잉일 수 있습니다. 더 작은 밀집 모델이나 다른 텍스트 전용 Qwen 변형이 비용 효율적일 것입니다. 마찬가지로, 이미지가 단순하거나(예: 기본 로고, 단일 객체) 예산 내에서 매우 높은 처리량이 필요한 경우 Qwen2-VL 7B와 같은 더 작은 비전 모델로도 충분할 수 있습니다. 이 모델은 복잡한 고해상도 이미지, 밀집된 텍스트가 포함된 문서, 또는 심층 다중 모드 추론이 필요한 작업을 처리해야 할 때 가장 적합합니다. OrcaRouter에서 가격을 비교하고 모델 ID를 쉽게 전환할 수 있습니다.
아니요. Qwen3 VL 235B A22B Instruct는 입력으로 이미지만을 받아들이는 텍스트 생성 모델입니다. 이미지, 오디오 또는 다른 양식을 생성하지 않습니다. 출력은 항상 텍스트 문자열입니다. 이미지 생성이 필요하다면 별도의 모델을 사용해야 합니다. 이 모델의 강점은 시각적 입력을 이해하고 추론하는 데 있습니다. 예를 들어, 이미지가 어떻게 생겼는지 설명하거나 이미지에 대한 질문에 답변할 수 있지만, 이미지 자체를 생성, 편집 또는 변환할 수는 없습니다.
해당 모델의 MMLU-Pro 점수는 82.3으로 보고되었습니다. MMLU-Pro는 Massive Multitask Language Understanding 벤치마크의 향상된 버전으로, STEM, 인문학, 사회과학 전반에 걸친 57개 주제를 다룹니다. 82.3의 점수는 다양한 주제에 걸친 강력한 일반 지식과 추론 능력을 나타냅니다. 이는 단일 숫자로 집계된 값이며, 주제별 성능은 다를 수 있습니다. 이 점수는 특히 쿼리당 전체 매개변수의 일부만 활성화하는 MoE 아키텍처를 고려할 때, 해당 모델을 동일 규모 클래스 내 최고 성능 모델 중 하나로 자리매김하게 합니다.
장점으로는 다중 모드 추론 벤치마크에서 높은 정확도, 뛰어난 명령 수행 능력, 그리고 동일한 총 파라미터 수를 가진 밀집 모델 대비 비용 효율성이 있습니다. MoE 설계 덕분에 비례적인 연산 비용 없이 용량을 확장할 수 있습니다. 한계점으로는 소형 모델에 비해 절대 비용이 높고, 총 파라미터 수가 많아(활성화되는 파라미터는 22B에 불과하지만 전체 모델을 메모리에 로드해야 함) 지연 시간이 증가할 가능성이 있습니다. 또한 이미지의 미세한 세부 사항을 가끔 환각(hallucinate)하거나 모호한 시각적 입력에서 실패할 수 있습니다. 특정 도메인 작업(예: 의료 영상)에서의 성능은 보장되지 않습니다.
추론 속도는 OrcaRouter가 사용하는 하드웨어 백엔드와 현재 부하에 따라 달라집니다. 2350억 개의 총 파라미터를 가진 MoE 모델로서, 토큰당 220억 개의 파라미터만 활성화되지만 상당한 GPU 메모리가 필요합니다. 이는 일반적으로 더 작은 밀집 모델(예: 7B~70B 파라미터)에 비해 요청당 지연 시간이 더 높아집니다. 처리량은 배치 크기와 시퀀스 길이의 영향을 받습니다. 지연 시간에 민감한 애플리케이션의 경우 더 작은 모델을 사용하거나 더 짧은 프롬프트에 맞게 최적화하는 것을 고려하세요. OrcaRouter는 특정 지연 시간을 보장하지는 않지만 프로덕션 수준의 응답성을 목표로 합니다.
OrcaRouter는 제공업체가 명시한 요율을 정확히 부과합니다: 입력 토큰 100만 개당 $0.40, 출력 토큰 100만 개당 $1.60입니다. 추가 마크업은 없습니다. 입력 및 출력 토큰 모두 OpenAI의 토큰화 규칙에 따라 계산되며, 이는 모델의 내부 토크나이저와 약간 다를 수 있습니다. 이미지도 제공업체 정책에 따라 크기와 세부 수준에 따라 토큰으로 청구됩니다. 예상 토큰 사용량에 이 요율을 곱하여 비용을 추정할 수 있습니다.
토큰당 비용은 더 작거나 조밀한 모델보다 높지만, MoE 아키텍처는 동일한 활성 크기의 조밀한 모델보다 활성 매개변수당 더 많은 용량을 제공합니다. 복잡한 멀티모달 작업의 경우 이 모델은 더 적은 토큰으로 작업을 완료하거나 더 높은 정확도를 제공하여 총 지출을 줄일 수 있습니다. 그러나 간단한 작업의 경우 더 저렴한 모델이 비용을 낮춥니다. OrcaRouter에서 모델을 즉시 전환할 수 있으므로 필요할 때만 이 모델을 사용할 수 있습니다. 최소 월 약정이나 숨겨진 수수료는 없습니다.
OrcaRouter는 현재 이 모델에 대한 특정 캐싱 정책을 공개하지 않습니다. 기본 제공자에 의해 토큰 수준 캐싱이 적용될 수 있지만 보장되지는 않습니다. 언급된 대량 할인이나 계층별 가격은 없으며, 요금은 토큰당 고정입니다. 대량 사용자의 경우 OrcaRouter 지원팀에 문의하여 맞춤형 제안을 받는 것이 좋을 수 있습니다. 일반적으로 가격은 투명하고 사용량 기반입니다.
이미지는 해상도와 세부 설정에 따라 토큰 수로 변환됩니다. 정확한 공식은 제공업체(Qwen)에 의해 정의되며 달라질 수 있습니다. 일반적으로 해상도가 높은 이미지는 더 많은 토큰을 소비합니다. OrcaRouter는 제공업체의 토큰화를 변경 없이 그대로 전달합니다. 모델이 지원하는 경우 이미지 크기를 조정하거나 저세부 모드를 사용하여 비용을 제어할 수 있습니다. 정확한 이미지 토큰 계산은 항상 제공업체의 문서를 참조하세요. 이미지에 대한 입력 토큰은 백만 개당 $0.40 요율로 계산됩니다.
https://api.orcarouter.ai/v1/chat/completions로 POST 요청을 보내며 OpenAI 호환 JSON 페이로드를 사용합니다. 모델 필드를 "qwen/qwen3-vl-235b-a22b-instruct"로 설정합니다. 각 메시지가 텍스트 및/또는 이미지 콘텐츠를 포함할 수 있는 messages 배열을 포함합니다. 이미지의 경우 표준 OpenAI 이미지 콘텐츠 형식(URL 또는 base64)을 사용합니다. 인증은 Bearer 토큰(API 키)을 통해 이루어집니다. 예시 매개변수: temperature, max_tokens, top_p, stop 시퀀스는 OpenAI API와 동일하게 작동합니다. OrcaRouter의 문서에서 전체 세부 정보를 제공합니다.
모든 표준 채팅 완료 파라미터가 지원됩니다: temperature(0-2, 기본값 1), top_p(0-1, 기본값 1), max_tokens(출력 토큰 수), stop(문자열 목록), presence_penalty, frequency_penalty, 재현성을 위한 seed. 또한 모델은 동작 설정을 위해 시스템 메시지를 존중합니다. 멀티모달 요청의 경우, 사용자 메시지 내용에 이미지 부분을 포함합니다. 모델별 파라미터는 노출되지 않으며, API는 호환성을 위해 일반적으로 유지됩니다. MoE 라우팅을 제어해야 하는 경우, 내부적으로 처리됩니다.
예. OrcaRouter는 OpenAI API 형식을 사용하므로 마이그레이션이 간단합니다. 기존 베이스 URL과 모델 ID를 OrcaRouter의 엔드포인트 및 "qwen/qwen3-vl-235b-a22b-instruct"로 교체하세요. API 키가 유효하고 충분한 크레딧이 있는지 확인하십시오. 이미지에 대한 메시지 형식은 OpenAI와 동일합니다('image_url' 콘텐츠 유형 사용). 토큰화 방식이 다르므로 토큰 수 추정치를 조정해야 할 수 있습니다. 엔드포인트와 모델 이름 외에는 애플리케이션 로직을 변경할 필요가 없습니다.
Qwen3 VL 235B A22B Instruct와 GPT-4V는 모두 멀티모달 입력을 처리합니다. 주요 차이점: Qwen3 VL은 22B 활성 파라미터를 가진 MoE를 사용하는 반면, GPT-4V는 비공개 밀집 모델로 크기가 공개되지 않았습니다. OrcaRouter를 통한 Qwen3 VL의 가격은 백만 토큰당 $0.40/$1.60으로, 일반적인 GPT-4V 요율보다 훨씬 낮습니다. MMLU-Pro 및 기타 테스트가 서로 다른 하위 집합을 사용하기 때문에 벤치마크 점수는 직접 비교할 수 없습니다. GPT-4V는 더 넓은 생태계 지원을 제공하지만, Qwen3 VL은 OrcaRouter에서 대용량 멀티모달 워크로드에 대한 비용 이점을 제공합니다.
Claude 3.5 Sonnet은 Anthropic의 밀집 모델로, 강력한 텍스트 및 비전 기능을 갖추고 있습니다. MoE를 사용하지 않으므로 전체 용량은 Qwen3 VL의 전체 파라미터보다 적지만 추론당 활성 용량은 22B보다 높습니다. Claude 3.5 Sonnet의 가격은 일반적으로 토큰당 더 높습니다 (백만 토큰당 약 $3.00/$15.00). Qwen3 VL은 멀티모달 작업에 대해 훨씬 낮은 비용을 제공합니다. 그러나 Claude 모델은 더 큰 컨텍스트 창(200K 토큰)을 가지고 있습니다. 선택은 예산, 컨텍스트 길이 요구 사항 및 선호하는 제공업체에 따라 달라집니다.
OrcaRouter는 Qwen2.5 7B, Qwen2.5 72B, Qwen2-VL 변종과 같은 다른 Qwen 모델을 제공할 가능성이 있습니다. Qwen3 VL 235B A22B Instruct는 Qwen 라인업에서 가장 큰 멀티모달 MoE 모델입니다. Qwen2-VL 72B와 비교했을 때, 전체 파라미터 수가 더 많고 MoE 아키텍처를 사용하여 복잡한 작업에서 더 나은 성능을 발휘하면서도 합리적인 추론 비용을 유지할 수 있습니다. 더 작은 Qwen 모델보다 토큰당 비용이 더 비싸지만, 여러 번의 호출이나 높은 토큰 소비를 줄일 수 있다면 비용 효율적일 수 있습니다.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| 입력 / 1M tokens | $0.400 |
| 출력 / 1M tokens | $1.60 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instruct열기 @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct