Qwen3.5 122B-A10B — 오픈 가중치 MoE 멀티모달 (텍스트/이미지/비디오), 총 122B / 활성 매개변수 10B, 32k 컨텍스트 (비전 모드).
Qwen3.5-122B-A10B는 알리바바 클라우드의 Qwen 시리즈에 속하는 대규모 언어 모델입니다. 혼합 전문가(MoE) 아키텍처를 사용하여 총 파라미터 수는 1220억 개이지만, 순방향 패스당 활성화되는 파라미터는 100억 개에 불과합니다. 이 설계는 높은 용량과 효율적인 추론을 결합하는 것을 목표로 합니다. 이 모델은 텍스트, 이미지, 비디오…
아키텍처와 벤치마크 점수를 바탕으로 볼 때, Qwen3.5-122B-A10B는 다단계 추론, 도구 사용, 명령 수행을 포함한 작업에서 뛰어난 성능을 보입니다. τ²-Bench 점수 93.6은 모델이 도구(예: 계산기, 검색 엔진, 코드 인터프리터)를 사용하여 일련의 행동을 계획하고 실행해야 하는 벤치마크에서 강력한 성능을 나타냅니다. 따라서 외부 시스템과 상호작용해야 하는 자율 에이전트를 구축하는 데 적합합니다. 또한 이 모델은 멀티모달 입력을 처리할 수 있어 시각적 추론, 이미지가 포함된 문서 분석, 영상 요약과 같은 작업도 강점으로 꼽힙니다. 게다가 큰 출력 제한 덕분에 단일 응답으로 상세한 설명, 코드 완성, 구조화된 데이터를 생성할 수 있습니다. 복잡한 챗봇, 코딩 어시스턴트, 연구 분석 도구를 개발하는 개발자에게 이 모델이 효과적일 수 있습니다.
Qwen3.5-122B-A10B는 강력하지만 모든 사용 사례에 가장 비용 효율적인 선택은 아닙니다. 여러분의 작업이 단순한 분류, 짧은 텍스트 생성, 또는 다단계 추론이나 멀티모달 이해가 필요하지 않은 간단한 Q&A인 경우, Qwen-7B와 같은 더 작은 모델이나 비멀티모달 모델로도 만족스러운 결과를 얻을 수 있습니다. 이러한 모델들은 토큰당 속도가 더 빠르고 비용이 더 저렴할 수 있습니다. 또한 컨텍스트 요구 사항이 매우 작은 경우(예: 1,000토큰 미만), 122B 파라미터 모델을 사용하는 상대적인 오버헤드가 가치가 없을 수 있습니다. OrcaRouter는 다양한 가격 및 성능 특성을 가진 모델들을 제공합니다. 먼저 더 작은 모델로 실험해 보고 품질이 충분하지 않은 경우에만 업그레이드할 수 있습니다. 또한 65K 출력 제한이 필요하지 않은 경우, 더 짧은 출력을 가진 모델로도 충분할 수 있습니다.
모델은 32,768 토큰의 컨텍스트 윈도우와 최대 65,536 토큰의 출력을 가지고 있어, 확장된 추론 체인과 긴 명령어를 처리할 수 있습니다. 높은 τ²-Bench 점수는 여러 단계에 걸쳐 일관성을 유지하고 조건부 논리, 도구 호출, 분기를 포함하는 복잡한 명령을 올바르게 따를 수 있음을 시사합니다. 실제로 사용자들은 Qwen3.5 시리즈 모델이 수학 문제 해결, 코드 생성, 논리 퍼즐 같은 작업에서 다른 최신 모델들과 경쟁력이 있다고 보고했습니다. 그러나 모든 대규모 모델과 마찬가지로, 컨텍스트에 관련 없는 정보가 가득하거나 명령이 모호하면 성능이 저하될 수 있습니다. 프롬프트 엔지니어링을 통해 모델을 효과적으로 안내하는 것이 권장됩니다. 또한 모델은 컨텍스트 한도에 가까운 매우 긴 문서에서 처음부터 세부 사항을 기억해야 할 때 어려움을 겪을 수 있습니다.
멀티모달 입력(텍스트 + 이미지/비디오)을 통해 여러 실용적인 애플리케이션이 가능해집니다. 문서 분석에서 모델은 PDF나 이미지 내의 텍스트와 포함된 차트, 다이어그램 또는 서명을 모두 읽을 수 있습니다. 예를 들어, 스캔된 표에서 데이터를 추출하거나 그래프를 해석할 수 있습니다. 시각적 질문 응답에서는 모델이 사진이나 삽화에 대한 질문에 답할 수 있습니다. 비디오 분석에서는 프레임을 처리하여 장면을 설명하거나 시간에 따른 변화를 추적할 수 있습니다. 개발자는 접근성을 위한 도구(예: 시각 장애 사용자를 위한 이미지 설명) 또는 자동화 도구(예: UI 스크린샷 분석)를 구축할 수 있습니다. 모델이 OrcaRouter를 통해 액세스되므로, 이러한 기능은 텍스트 전용 프롬프트에 사용되는 동일한 API 호출을 통해 기존 애플리케이션에 통합될 수 있으며, 메시지 내용에 image_url 또는 video_url만 포함하면 됩니다.
이 모델에 대해 공개된 유일한 벤치마크는 τ²-Bench로, 해당 벤치마크에서 93.6점을 기록했습니다. τ²-Bench는 모델이 시뮬레이션 환경에서 도구를 사용하고 다단계 작업을 완료하는 능력을 평가하기 위해 설계되었습니다. 93.6점은 모델이 이러한 작업의 높은 비율을 올바르게 완료할 수 있음을 나타냅니다. 맥락상, 이 점수는 동일한 벤치마크에서 다른 최첨단 모델들과 경쟁력 있는 수준입니다. 하지만 벤치마크 점수가 항상 실제 성능을 반영하는 것은 아닙니다. 작업의 난이도가 다양할 수 있고 벤치마크가 모든 도메인을 포괄하지 않을 수 있기 때문입니다. 사용자는 자신의 특정 작업에 대해 자체 평가를 수행해야 합니다. MMLU, HumanEval 또는 멀티모달 벤치마크 등 다른 벤치마크 점수는 제공된 사실에 포함되어 있지 않으므로, 더 넓은 표준 지표 세트에서 이 모델을 비교하는 것은 불가능합니다.
장점: 이 모델은 도구 사용 벤치마크에서 높은 점수를 기록하여 강력한 추론 및 지시 수행 능력을 시사합니다. 멀티모달 기능과 큰 출력 제한 덕분에 다양하게 활용될 수 있습니다. MoE 아키텍처는 성능과 효율성 사이에서 좋은 균형을 제공할 수 있습니다(적어도 유사한 총 매개변수를 가진 밀집 모델과 비교했을 때). 한계: 이 모델의 컨텍스트 윈도우는 32,768개 토큰에 불과하여, 100K 이상을 제공하는 일부 모델에 비해 보통 수준입니다. 활성화되는 매개변수(10B)는 전체 크기에 비해 상대적으로 낮아 매우 복잡한 작업에서 성능이 제한될 수 있습니다. 지연 시간, 처리량 또는 하드웨어 요구 사항에 대한 정보는 제공되지 않습니다. 또한 모델이 새롭기 때문에 커뮤니티 생태계(예: 파인튜닝 스크립트, 양자화 도구)가 더 잘 구축된 모델에 비해 덜 발전했을 수 있습니다. 사용자는 모델을 철저히 테스트해야 합니다.
이 모델에 대한 특정 지연 시간 또는 처리량 수치는 OrcaRouter에서 제공되지 않습니다. 추론 속도는 입력 길이, 출력 길이, 배치 크기 및 OrcaRouter가 할당하는 기본 하드웨어와 같은 요소에 따라 달라집니다. MoE 모델은 라우팅 메커니즘이 토큰마다 다른 전문가를 활성화할 수 있으므로 속도가 가변적일 수 있습니다. 일반적으로 10B 활성화 파라미터를 가진 모델은 최신 GPU에서 적당한 속도로 생성할 수 있지만, 메모리에 있는 총 122B 파라미터는 더 높은 메모리 사용량과 더 긴 프리필 시간을 초래할 수 있습니다. 짧은 지연 시간이 중요한 경우 일반적인 프롬프트로 모델을 테스트하는 것이 좋습니다. OrcaRouter의 API는 응답 헤더에 타임스탬프와 성능 메트릭을 반환하여 속도를 측정하는 데 도움을 줍니다. 지연 시간에 민감한 애플리케이션의 경우, 작업이 허용된다면 더 작은 모델 사용을 고려하세요.
사용 가능한 사실에는 단일 벤치마크인 τ²-Bench만 포함되어 있습니다. MMLU(지식), HumanEval(코드), GSM8K(수학)와 같은 일반적인 벤치마크나 MMBench와 같은 멀티모달 벤치마크는 제공되지 않습니다. 이로 인해 도구 관련 작업이 아닌 태스크에서 모델의 성능을 평가하기 어렵습니다. 예를 들어, 애플리케이션에 사실적 정확성이 요구된다면 MMLU에서의 성능을 알고 싶을 것입니다. 마찬가지로 멀티모달 태스크의 경우 시각적 추론 벤치마크 점수가 유용할 것입니다. 이러한 점수가 없다고 해서 성능이 나쁘다는 의미는 아니지만, 사용자가 직접 평가를 수행해야 함을 의미합니다. OrcaRouter는 요청 시 또는 문서에서 추가 벤치마크 결과를 제공할 수 있습니다. 더 많은 데이터가 제공될 때까지는 특정 도메인에서 다른 모델과 질적으로 비교하는 것이 좋습니다.
Qwen3.5-122B-A10B에 대한 OrcaRouter의 가격 세부 정보는 제공된 사실에서 명시적으로 제공되지 않습니다. 일반적으로 OrcaRouter는 입력과 출력 모두에 대해 토큰당 요금을 부과하며, 프롬프트 토큰과 생성된 토큰에 대해 별도의 요율을 적용합니다. 멀티모달 입력(이미지/비디오)은 처리된 이미지 블록 또는 비디오 프레임 수에 따라 토큰 등가물로 청구됩니다. 일부 제공업체는 사용자가 동일한 프롬프트를 반복할 경우 캐시 히트에 대해 할인 요금을 제공하기도 합니다. 정확한 가격을 확인하려면 사용자는 OrcaRouter의 가격 페이지를 참조하거나 영업 팀에 문의해야 합니다. 이 모델은 122B의 총 매개변수와 멀티모달 기능을 갖추고 있으므로, 소형 모델이나 텍스트 전용 모델보다 토큰당 가격이 더 높을 수 있습니다. 작업에 대한 총 비용을 추정할 때 이미지/비디오에 대한 토큰 비용을 고려하는 것이 중요합니다.
더 큰 모델(예: Qwen3.5-122B-A10B)을 사용하면 일반적으로 소형 모델보다 토큰당 비용이 더 많이 발생합니다. 하지만 모델의 성능 덕분에 더 적은 단계나 더 적은 토큰으로 작업을 해결할 수 있다면 총 비용은 여전히 경쟁력이 있을 수 있습니다. 큰 출력 제한(65,536 토큰)은 장점이자 비용 위험이 될 수 있습니다. 긴 출력을 생성하면 토큰 비용이 빠르게 누적될 수 있기 때문입니다. 또한 멀티모달 입력은 텍스트 전용 프롬프트보다 프롬프트당 더 많은 토큰을 소비합니다. 예를 들어, 단일 고해상도 이미지는 수백 개의 토큰을 소모할 수 있습니다. 작업에 모델의 모든 기능이 필요하지 않은 경우, 더 작은 모델을 선택하여 비용을 절약할 수 있습니다. OrcaRouter는 사용량 대시보드와 최대 출력 토큰 수 설정 또는 예산 알림과 같은 비용 관리 기능을 제공하여 지출을 관리하는 데 도움이 될 것입니다.
이용 가능한 사실에는 OrcaRouter의 이 모델에 대한 캐싱 할인이 언급되어 있지 않습니다. 많은 추론 제공업체는 프롬프트 캐싱을 제공하는데, 시스템 프롬프트나 사용자 메시지에서 반복되는 텍스트를 임시로 저장하고 더 낮은 요금으로 청구합니다. OrcaRouter가 캐싱을 지원한다면, 긴 정적 프롬프트(예: 시스템 지침, 캐릭터 설명)를 사용하는 애플리케이션의 비용을 절감할 수 있습니다. 그러나 구체적인 문서가 없으므로 이를 가정해서는 안 됩니다. 사용자는 캐싱이 구현된 경우 API 응답 헤더에서 캐시 히트 표시기를 확인할 수 있습니다. 비용을 최소화하려면 정적 지침과 동적 콘텐츠를 분리하여 동일한 긴 접두사를 반복하지 않도록 프롬프트를 설계할 수 있습니다. 또한 가능하면 더 짧은 컨텍스트 창을 사용하거나 불필요한 이미지를 생략하는 것을 고려하세요.
Qwen3.5-122B-A10B를 사용하려면 https://api.orcarouter.ai/v1/chat/completions의 OrcaRouter API 엔드포인트로 POST 요청을 보내세요. model 파라미터를 "qwen/qwen3.5-122b-a10b"로 설정하세요. 이 API는 OpenAI의 채팅 완성 형식과 완벽하게 호환되므로, base URL과 API 키만 변경하면 동일한 클라이언트 라이브러리(예: openai Python 라이브러리)를 사용할 수 있습니다. 요청 본문에는 messages(각각 role과 content 포함)가 포함되며, 선택적으로 temperature, max_tokens, top_p 등의 파라미터를 추가할 수 있습니다. 다중 모달 입력의 경우 이미지에는 type: "image_url" 콘텐츠 블록을 사용하거나, 모델의 특정 비디오 처리 방식(base64 인코딩 프레임 또는 URL 사용)을 활용하세요. API는 생성된 텍스트와 사용량 메타데이터(토큰 수)를 포함한 JSON 응답을 반환합니다. 지원되는 파라미터에 대한 자세한 내용은 OrcaRouter 문서를 참조하세요.
이 모델은 표준 채팅 매개변수를 지원합니다: temperature(기본값 일반적으로 0.7), top_p(기본값 0.9), max_tokens(모델의 최대 출력인 65,536까지), presence_penalty, frequency_penalty 및 stop sequences. 컨텍스트 윈도우 제한은 32,768 토큰이며, 여기에는 모든 메시지, 이미지 및 비디오 프레임이 포함됩니다. 총 토큰 수가 이 제한을 초과하면 API는 오류를 반환하거나 입력을 자릅니다(설정에 따라 다름). max_tokens 매개변수는 65,536을 초과할 수 없습니다. 멀티모달 요청의 경우 이미지와 비디오가 토큰을 추가한다는 점에 유의하십시오. 정확한 변환 비율은 제공되지 않지만 고해상도 또는 긴 비디오는 컨텍스트 윈도우를 빠르게 소모할 수 있습니다. OrcaRouter는 또한 스트림 모드를 지원할 수 있으며, 여기서 응답은 토큰별로 스트리밍되어 실시간 애플리케이션에 유용합니다. logprobs 또는 tools와 같은 추가 옵션은 API 참조를 확인하십시오.
마이그레이션은 간단합니다: 기본 URL을 https://api.orcarouter.ai/v1 로 교체하고, 모델 ID로 "qwen/qwen3.5-122b-a10b"를 사용하며, OrcaRouter API 키를 제공하면 됩니다. 요청 형식은 OpenAI 채팅 완성 API와 동일합니다. 예를 들어, Python에서 openai 라이브러리를 사용할 때 client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key') 로 설정한 후 client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...) 를 호출하면 됩니다. 애플리케이션에서 함수 호출이나 도구를 사용하는 경우, 이 모델은 τ²-Bench에서 훈련되어 도구 사용을 지원하므로 이를 지원한다는 점에 유의하세요. 그러나 정확한 도구 호출 구문은 OpenAI와 다를 수 있습니다. OrcaRouter는 OpenAI 형식을 지원할 가능성이 높지만, 테스트를 통해 확인하세요. 멀티모달 입력의 경우, 모델이 해당 형식을 지원한다면 메시지에 image_url을 전송하는 기존 코드가 작동할 수 있습니다.
Qwen 제품군 내에서 이 모델은 소규모 밀집 모델(예: Qwen-7B, Qwen-14B)과 가장 큰 MoE 모델(예: Qwen3.5-235B) 사이에 위치합니다. 밀집 모델과 비교할 때, 이 MoE 모델은 더 큰 전체 파라미터 세트에 접근할 수 있지만 토큰당 일부만 활성화되므로 더 전문화된 전문가를 활용할 수 있습니다. 이는 다양한 지식을 필요로 하는 작업을 포함한 여러 작업에서 더 나은 성능을 제공할 수 있습니다. 그러나 소규모 밀집 모델은 특정 작업에 대해 더 빠르고 비용 효율적일 수 있습니다. 더 큰 Qwen3.5-235B와 비교하면, 이 모델은 성능이 낮을 가능성이 있지만 효율성이 더 높습니다. 멀티모달 지원은 Qwen3.5 세대의 공통 기능이며, 이전 버전(Qwen2, Qwen1)은 텍스트 전용이었습니다. 사용자는 자신의 특정 작업에 대한 벤치마크 결과를 비교하여 가장 적합한 모델을 결정해야 합니다.
포괄적인 벤치마크 없이는 직접 비교가 어렵습니다. Qwen3.5-122B-A10B는 τ²-Bench에서 93.6을 달성했으며, 이는 도구 사용 작업에서 강력한 결과입니다. 참고로, 해당 벤치마크에서 다른 모델의 유사한 점수는 제공되지 않았지만, 이는 높은 수준의 능력으로 간주됩니다. 아키텍처 측면에서 Llama 모델은 밀집형이고 단순한 반면, Claude 모델은 다른 독점 아키텍처를 가지고 있습니다. Qwen3.5는 멀티모달 입력(이미지/비디오)을 지원하며, Claude도 이를 지원하지만 Llama 3.2 및 3.1은 일부 비전 변형을 제외하고는 텍스트 전용입니다. 32K의 컨텍스트 윈도우는 Claude의 100K 또는 200K보다 작지만 Llama 3.1의 128K와 비교할 수 있을까요? 정확히는 아닙니다. 숫자를 임의로 만들어내면 안 됩니다. 코드 및 추론 측면에서 많은 모델이 경쟁력을 가지고 있습니다. 이 모델의 장점은 도구 사용을 위한 특화된 튜닝(τ²-Bench 높은 점수)과 멀티모달 MoE 효율성일 수 있습니다. 그러나 Claude와 Llama는 더 큰 생태계와 더 많은 커뮤니티 지원을 가지고 있습니다.
멀티모달 입력, 큰 컨텍스트 윈도우, 큰 출력 제한, 그리고 높은 τ²-Bench 점수를 하나의 패키지로 결합한 모델은 거의 없습니다. Qwen3.5 시리즈는 강력한 추론 및 도구 사용 능력을 갖춘 유능한 범용 모델로 설계되었습니다. 총 122B, 활성 10B의 MoE 아키텍처를 통해 밀집 122B 모델보다 추론 비용을 낮게 유지하면서 많은 지식을 담을 수 있습니다. 그렇다고 해도, Mixtral 8x7B(총 47B, 활성 13B)와 같은 다른 MoE 모델은 다른 트레이드오프가 있습니다. Qwen3.5-122B-A10B는 총 파라미터 수는 훨씬 많지만 토큰당 활성 파라미터 수는 더 적습니다(10B 대 13B). 멀티모달 지원이 차별화 요소입니다. Mixtral은 텍스트 전용입니다. 멀티모달 MoE 공간에서는 Qwen-VL과 같은 모델이나 다른 모델들이 존재하지만 종종 더 작은 컨텍스트 윈도우를 가지고 있습니다. 이 모델은 OrcaRouter에서 다양하고 멀티모달이며 도구 사용이 많은 작업을 위해 단일 모델이 필요한 개발자에게 강력한 옵션으로 포지셔닝됩니다.
애플리케이션이 멀티모달 이해와 복잡한 다단계 추론을 모두 필요로 하고, 긴 응답을 생성하기 위해 큰 출력 제한이 필요한 경우 Qwen3.5-122B-A10B를 선택하세요. 높은 τ²-Bench 점수를 고려할 때 도구를 사용하는 에이전트 시스템을 구축하는 경우에도 좋은 선택입니다. 작업이 텍스트 전용이고 추가 용량이 필요하지 않다면 Llama 3.1 70B나 Qwen-14B와 같은 더 저렴한 모델로 충분할 수 있습니다. 더 큰 컨텍스트 창(예: >100K 토큰)이 필요한 경우, 긴 컨텍스트에 특화된 모델을 고려하세요. 낮은 지연 시간이 필요하다면 더 작거나 밀집된 모델이 더 나을 수 있습니다. OrcaRouter는 다양한 모델을 제공하므로 동일한 API를 통해 여러 모델을 평가하여 비용과 품질 목표에 가장 적합한 모델을 찾을 수 있습니다. 모델 ID는 qwen/qwen3.5-122b-a10b입니다.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| 등급 | 입력 / 1M tokens | 출력 / 1M tokens |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| 등급은 요청별 입력 토큰 수에 따라 결정됩니다 | ||
정가 기준 추정치
구간별 요금제 — 이 추정치는 기본 구간 요율을 사용합니다.
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
@misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b