2026년 9월 2일자 Qwen3.8 Max의 스냅샷 — 알리바바의 대표 멀티모달 추론 모델: 텍스트 + 이미지 + 비디오 입력, 텍스트 출력, 1M 토큰 컨텍스트. 기본 모델과 동일한 기능과 가격을 제공하며, 재현 가능한 동작을 위해 버전을 고정(pin)하세요.
Qwen3.8 Max (0902)는 공급업체 qwen의 OrcaRouter에 등록된 모델 항목으로, 모델 ID qwen/qwen3.8-max-0902로 게시되어 있습니다. 0902 표기는 목록에 표시되어 있지만, 제공된 정보에는 이것이 릴리스 날짜, 체크포인트 또는 개정 라벨을 나타내는지에 대한 설명이 없습니다. 이것은 긴 컨텍스트를 지원하는 멀티모달…
이 모델은 1,000,000개의 토큰으로 구성된 컨텍스트 창을 지원합니다. 이는 프롬프트에 포함된 텍스트, 이미지 및 비디오 콘텐츠를 포함하여 모델이 한 번의 요청에서 처리(attend to)할 수 있는 총 입력량입니다. 주어진 사실(Facts)에는 추가 제한이 명시되어 있지 않으므로, 실제 한계는 OrcaRouter와 제공자가 토큰화 및 요청 시간 초과를 어떻게 적용하는지에 따라 달라집니다. 긴 텍스트의 경우 1,000,000개의 토큰을 사용하면 단일 프롬프트에 많은 분량의 문서를 포함할 수 있어, 모델을 호출하기 전에 청크로 나누거나 요약해야 할 필요성이 줄어듭니다. 비디오의 경우, 주어진 사실(Facts)에는 초당, 프레임당 또는 비디오 파일당 몇 개의 토큰이 소비되는지 명시되어 있지 않으므로 메타데이터나 테스트 호출을 통해 추정해야 합니다. 또한 컨텍스트 창 크기가 1,000,000-토큰 프롬프트에서 모델이 얼마나 정확한지 알려주지 않는다는 점을 기억하는 것이 중요합니다. 제공된 벤치마크 데이터가 없습니다. 애플리케이션에 정확한 장문 컨텍스트 품질이 필요하다면, 프로덕션에 투입하기 전에 자체 문서 샘플로 평가하십시오.
텍스트, 이미지, 비디오를 입력으로 받아들이므로, 모델은 동일한 요청에서 이러한 유형들을 결합한 소스 자료에 대해 추론하도록 요청받을 수 있습니다. 예를 들어 텍스트로 된 지침을 읽고, 이미지를 검토하고, 답변을 생성할 때 비디오를 참조하는 경우가 포함됩니다. 공급업체 팩트 시트에는 OCR, 객체 탐지, 시간적 비디오 추론과 같은 작업별 기능이 나열되어 있지 않으므로 이러한 동작을 가정해서는 안 됩니다. 모델에서 기대할 수 있는 기능은 주로 해당 모델의 훈련된 능력에 따라 달라지며, 이는 제공된 사실에 문서화되어 있지 않습니다. 안전한 설계는 혼합 양식 프롬프트에서 텍스트 출력을 요구하고 이미지와 비디오를 입력 토큰으로 저장하는 비용을 감당할 수 있는 작업에 이 모델을 사용하는 것입니다. 작업 부하가 텍스트 전용인 경우에는 이미지와 비디오 입력이 없는 다른 모델이 더 간단할 수 있습니다. 작업에 정확한 타임스탬프 수준의 비디오 작업이 필요한 경우, 모델 카드는 그러한 동작이 신뢰할 수 있는지에 대한 증거를 제공하지 않습니다.
더 저렴한 모델을 선택하는 것은 작업이 이 목록을 정의하는 기능을 요구하지 않을 때 합리적입니다. 짧은 텍스트 질문에는 1,000,000 토큰 컨텍스트나 131,072 토큰 출력 상한이 필요하지 않습니다. 텍스트 전용 워크플로우에는 이미지나 비디오 입력이 필요하지 않습니다. OrcaRouter는 이 모델을 입력 토큰 1,000,000개당 $2.00, 출력 토큰 1,000,000개당 $6.00으로 청구합니다. 더 저렴한 대안이 토큰당 가격이 더 낮고 적절한 컨텍스트 및 모달리티 지원을 갖추고 있다면 비용을 절감할 수 있습니다. 제공된 사실에는 품질이나 속도 벤치마크가 없으므로 다른 모델보다 이 모델을 선택하는 것을 측정된 정확도로 정당화할 수 없습니다. 이는 명시적인 제품 요구 사항, 즉 대규모 컨텍스트, 텍스트/이미지/비디오 혼합 입력, 또는 한 번의 생성에서 긴 출력으로 정당화되어야 합니다. 입력 가격이 컨텍스트의 모든 토큰에 적용되므로 사용자 질문이 짧더라도 매우 큰 컨텍스트 호출은 더 작은 호출보다 비용이 더 많이 들 수 있습니다. 따라서 프롬프트를 불필요하게 채우지 마십시오.
제공된 Qwen3.8 Max (0902) 모델 정보에는 벤치마크 점수, 평가 세트 또는 정확도 수치가 포함되어 있지 않습니다. 따라서 모델 품질에 대한 어떠한 진술도 추측에 불과하며, OrcaRouter는 추론된 점수를 게시하지 않습니다. 후보 모델을 비교할 수치가 필요하다면, 전송할 예정인 이미지 및 비디오 사례를 포함한 대표 입력에 대해 자체 테스트를 실행하십시오. 공개 지식 테스트와 같은 벤치마크는 특정 1,000,000토큰 비디오 프롬프트를 모델이 얼마나 잘 처리하는지 알려주지 않습니다. Max와 같은 모델 이름은 라벨일 뿐 품질의 증거가 아니라는 점을 유의하십시오. 이 목록에서 측정 가능한 항목은 컨텍스트 창, 최대 출력 길이, 입력 양식 및 가격입니다. 이러한 속성은 워크로드가 적합한지 여부에 영향을 미치지만 정확도, 추론 깊이, 지시 수행 또는 안전 동작을 설명하지는 않습니다. 이러한 영역의 역량은 평가를 직접 수행하지 않는 한 검증되지 않은 것으로 간주하십시오.
모델 팩트에는 초당 토큰 수, 첫 토큰까지의 시간, 요청 시간 초과 지침 또는 기타 성능 측정치가 포함되어 있지 않습니다. OrcaRouter는 이 공급자 모델에 대해 지연 시간 수치를 주장하지 않습니다. 속도는 공급자의 서빙 인프라, 입력 크기 및 요청된 출력량에 따라 달라집니다. 1,000,000토큰 입력과 131,072토큰 출력이 포함된 요청은 짧은 요청보다 더 오래 걸릴 가능성이 높지만, 목록에는 정확한 관계가 제시되어 있지 않습니다. 비디오 입력은 모델이 처리할 수 있기 전에 토큰으로 변환되어야 하므로 지연 시간을 더욱 악화시킬 수 있으며, 팩트에는 해당 단계가 정량화되어 있지 않습니다. 검토자는 낮은 토큰당 가격이 빠른 디코딩을 의미한다고 가정해서는 안 됩니다. 속도와 관련하여 팩트가 뒷받침하는 유일한 결정은 예상 부하 조건에서 대표적인 요청 크기를 테스트하는 것입니다. 컨텍스트 윈도우 크기나 모델 이름에서 실시간 적합성을 추론하지 마십시오.
명시된 강점은 구조적입니다. 이 모델은 1,000,000-토큰 컨텍스트 창, 높은 131,072-토큰 최대 출력을 가지며 텍스트, 이미지 및 비디오 입력을 허용합니다. 이는 긴 응답을 작성하기 전에 한 번의 모델 호출로 방대하거나 혼합된 자료를 관찰해야 하는 애플리케이션에 유용합니다. 한계 또한 강점보다 사실로부터 더 쉽게 설명할 수 있습니다. 게시된 품질 벤치마크가 없으므로 정확성, 추론 및 안전성은 문서화되어 있지 않습니다. 0902 라벨 뒤의 학습 데이터, 릴리스 노트 또는 업데이트 방법론에 대한 별도 목록이 없습니다. 이미지 및 비디오 입력은 정확한 시각적 또는 시간적 이해를 보장하지 않습니다. 컨텍스트 및 출력 제한은 최대값이지 권장 사용량이 아닙니다. 매우 큰 출력은 1,000,000 출력 토큰당 $6.00로 비용이 많이 들 수 있습니다. 1,000,000-토큰 컨텍스트를 가득 채우는 요청은 출력이 생성되기 전에 입력 토큰 $2.00를 소비하게 되며, 이는 실질적인 운영 비용입니다.
명시된 단위 가격은 입력 토큰 1,000,000개당 $2.00, 출력 토큰 1,000,000개당 $6.00입니다. OrcaRouter는 공급자 요율을 마크업 없이 그대로 적용하여 모델 사용량을 청구하므로, 표시된 가격은 공급자 요율이 통과된 것입니다. 입력 토큰에는 프롬프트에 포함된 텍스트, 이미지, 비디오 토큰이 포함됩니다. 출력 토큰은 생성된 응답 토큰입니다. 이 요율 기준으로 입력 토큰 1,000,000개는 $2.00, 출력 토큰 1,000,000개는 $6.00입니다. 더 적은 요청은 비용도 비례하여 줄어듭니다. 예를 들어 입력 토큰 100,000개는 $0.20, 출력 토큰 100,000개는 $0.60입니다. 단, 이는 공급자가 해당 수량을 측정했을 때의 경우입니다. 모델 카드에는 캐시된 입력, 배치 요청 또는 대화형 등급에 대한 별도 가격이 포함되어 있지 않으므로 해당 가격이 있다고 가정해서는 안 됩니다. 정확한 청구 토큰 수는 각 호출에 대한 OrcaRouter 사용량 응답 또는 로그에서 확인해야 합니다.
OrcaRouter가 모델이 마크업 없는 제공업체 요금으로 청구된다고 명시할 때, 이는 OrcaRouter가 이 목록에 대해 제공업체 요금 위에 자체적인 토큰당 수수료를 추가하지 않는다는 뜻입니다. 따라서 토큰 사용량에 대한 최종 금액은 명시된 토큰 100만 개당 $2.00 입력 및 $6.00 출력 가격을 기준으로 산정되어야 합니다. 이것이 반드시 최종 청구서에 다른 요금이 없다는 의미는 아닙니다. 계약 조건에 따라 세금이나 계정 수준 수수료가 적용될 수 있지만, 본 사실에서는 그러한 수수료가 문서화되어 있지 않습니다. 또 토큰당 요금이 여전히 적용되므로 모델이 무료로 제공된다는 의미도 아닙니다. 제공업체를 비교할 때 OrcaRouter가 이 모델에 대해 표시하는 가격은 이 목록과 동일한 단위여야 합니다. 다른 게이트웨이가 다른 가격을 제시하는 경우, 그 차이는 청구 구조의 차이일 뿐 모델의 컨텍스트 창이 변경된 것은 아닙니다.
비용 관리는 프롬프트 길이부터 시작해야 합니다. 입력 비용은 1,000,000 토큰당 $2.00이므로, 토큰이 하나 추가될 때마다 입력 요금이 증가하며, 요청에 포함된 모든 이미지나 비디오는 이 목록에 제공되지 않은 규칙을 사용하여 토큰으로 변환됩니다. 관련 없는 소스 자료를 줄이면 비용을 절감할 수 있습니다. 출력은 입력 단가의 3배이므로, 요청하는 출력 길이를 제한하는 것도 비용을 통제합니다. 131,072토큰 출력 제한이 있는 모델은 비용이 드는 응답을 생성할 수 있습니다. $6.00/1,000,000 토큰 기준으로 131,072개의 출력 토큰은 출력 토큰만으로 약 $0.79의 비용이 듭니다. 그렇게 많은 토큰을 생성하는 것은 자동이 아닙니다. 프롬프트가 응답 크기를 제어하기 때문입니다. 이 모델에 대해 게시된 캐시 가격이 없으므로, 반복되는 컨텍스트가 할인된다고 가정해서는 안 됩니다. 사실에 캐시 또는 배치 가격이 없다는 것은 그러한 옵션이 존재하지 않는다는 증거가 아니며, 단지 이 목록에 포함되지 않았다는 의미입니다.
Qwen3.8 Max (0902)는 OrcaRouter의 OpenAI 호환 API를 통해 노출됩니다. 클라이언트 기본 URL을 https://api.orcarouter.ai/v1로 설정하고 정확한 모델 ID인 qwen/qwen3.8-max-0902를 사용하세요. OpenAI 호환 SDK를 사용하면 요청 구조는 일반적인 chat-completions 호출과 기본적으로 동일합니다. OrcaRouter용 API 키, 위의 기본 URL을 전달하고 본문에 모델 ID를 포함하세요. Qwen3.8 Max나 qwen3.8 같은 일반적인 이름을 사용하지 마세요. 목록에는 qwen/qwen3.8-max-0902가 필요합니다. 동일한 모델 ID는 기본 URL에 대한 직접 HTTP 요청에도 사용해야 하며, 경로와 페이로드는 OrcaRouter가 제공하는 OpenAI 호환 규약을 따릅니다. OpenAI와 호환되므로 기존에 OpenAI chat completions용으로 작성된 코드는 base_url과 model 매개변수를 변경하여 마이그레이션할 수 있는 경우가 많지만, 인증 세부 사항은 OrcaRouter의 요구 사항과 일치해야 합니다.
OpenAI 호환 채팅 완료의 경우 model, messages 및 출력 토큰 제한과 같은 매개변수는 다른 호환 모델과 동일하게 처리됩니다. 제공된 정보에 따르면 최대 출력은 131,072 토큰이므로 출력 제한을 설정할 때 131,072를 초과해서는 안 됩니다. 기본 출력 제한은 제공된 정보에 명시되어 있지 않습니다. Temperature, top-p, stop 및 기타 샘플링 매개변수는 제공된 모델 정보에 문서화되어 있지 않으므로 OrcaRouter의 API 문서와 표준 OpenAI 매개변수 의미 체계를 따르십시오. 이미지 및 비디오 입력의 경우 OrcaRouter API에서 기대하는 멀티모달 콘텐츠 형식을 사용하십시오. 제공된 정보에는 샘플이 없습니다. API가 지원되지 않는 매개변수 이름에 대한 오류를 반환하는 경우 SDK가 레거시 매개변수를 전송하는지 확인하십시오. 컨텍스트 창은 1,000,000 토큰이므로 프롬프트는 이미지 및 비디오 토큰을 포함한 모든 입력 토큰을 해당 한도 미만으로 유지해야 합니다. 응답은 131,072 토큰 최대 한도에 별도로 집계됩니다.
OrcaRouter는 https://api.orcarouter.ai/v1에서 OpenAI 호환 API를 제공하므로, 마이그레이션은 대부분 구성 변경에 해당합니다. 기본 URL을 https://api.orcarouter.ai/v1로 교체하고, API 키 필드를 OrcaRouter 키로 교체한 다음, 모델을 qwen/qwen3.8-max-0902로 설정하세요. 코드에서 OpenAI 호환 클라이언트 라이브러리를 사용하는 경우, 클라이언트의 base_url과 api_key를 업데이트하고, 멀티모달 형식이 이 모델과 일치한다고 가정할 때 대부분의 메시지 구조는 그대로 유지하세요. 이 모델이 모든 OpenAI 고유 파라미터를 지원하는지에 대해서는 확인된 바가 없으므로, 마이그레이션 전에 애플리케이션이 전송하는 파라미터를 검토하세요. 또한 컨텍스트 제한이 1,000,000이고 최대 출력이 131,072이므로, 요청 잘림(truncation) 로직을 이러한 제한에 맞게 조정하세요. 다른 최대 컨텍스트 길이를 하드코딩한 기존 코드가 있다면 업데이트해야 할 수 있습니다. 마지막으로, 모델 정보 자체가 데이터 보존에 대해 다루지 않으므로, 애플리케이션의 데이터 처리 기대치가 OrcaRouter의 약관과 일치하는지 확인하세요.
비교의 주요 기준은 입력 계약입니다. Qwen3.8 Max (0902)는 텍스트, 이미지, 비디오를 지원하므로, 텍스트 전용 대안을 사용하면 이러한 모달리티가 제외됩니다. 실제 워크로드에 텍스트만 포함되어 있다면, 충분히 큰 컨텍스트를 갖춘 텍스트 전용 모델이 더 직접적으로 적합할 가능성이 높으며 가격도 다를 수 있습니다. 모델 정보에는 다른 모델과의 정확도나 속도 비교가 포함되어 있지 않으므로, 공개된 품질 점수를 기준으로 선택할 수 없습니다. 구조적 속성을 비교할 수 있습니다: 텍스트 전용 대안은 컨텍스트가 더 작거나, 출력 제한이 더 짧거나, 입력 가격이 더 낮을 수 있습니다. OrcaRouter는 이 모델을 1,000,000토큰당 입력 $2.00, 출력 $6.00으로 청구합니다. 이미지 및 비디오 입력을 지원한다는 사실은 해당 입력이 사용되는 경우에만 유용합니다. 해당 입력이 사용되지 않는다면, 작업과 무관한 멀티모달 용량에 비용을 지불하고 있을 수 있습니다.
작업 프로필이 나열된 기능과 일치할 때 Qwen3.8 Max (0902)를 선택하세요. 먼저, 소스 자료를 더 작은 창에 맞추기 위해 줄일 수 없으므로 1,000,000-토큰 컨텍스트가 필요합니다. 둘째, 동일한 프롬프트에서 이미지와 비디오 입력이 필요하거나 향후 요청에서 이러한 모달리티를 기대해야 합니다. 셋째, 최대 131,072토큰의 출력 최대치를 원합니다. 워크로드에 이러한 요구 사항이 하나도 없다면 이 목록의 많은 이점이 사용되지 않습니다. Max라는 이름이 강력해 보인다고 해서 선택하지 마세요. 목록에는 벤치마크 증거가 포함되어 있지 않습니다. OrcaRouter는 동일한 OpenAI 호환 API를 통해 모델을 노출하므로 모델 ID를 바꾸는 것이 쉬워서 자신의 작업에서 이 모델을 다른 후보와 테스트할 수 있습니다. 입력 및 출력 가격이 다르며 이 모델에 대해 캐시 가격이 지정되지 않았다는 점만 기억하세요.
비용을 비교할 때는 먼저 동일한 토큰 기준으로 정규화하세요. 이 모델은 입력 토큰 1,000,000개당 $2.00, 출력 토큰 1,000,000개당 $6.00이며, 공급업체에서 마크업 없이 전달된 가격입니다. 토큰당 입력 가격이 더 낮은 경쟁 모델이 전체 컨텍스트 요청에서는 실제로 더 저렴할 수 있지만, 컨텍스트 창과 최대 출력 길이도 고려해야 합니다. 예를 들어, 1,000,000개 토큰 요청은 이 모델의 전체 컨텍스트를 한 번의 호출로 사용할 수 있습니다. 컨텍스트가 200,000개 토큰인 모델은 여러 번 호출해야 하며, 추가 출력 또는 요약 패스로 인해 총 가격이 달라질 수 있습니다. 제공된 사실에는 객관적인 정확도나 지연 시간 값이 포함되어 있지 않으므로, 정답당 비용 비교는 반드시 자체 테스트를 통해 수행해야 합니다. 또한 경쟁 모델이 이미지나 비디오 토큰에 대해 별도의 요금을 부과하는지 확인하세요. 이러한 토큰은 여기에 설명되어 있지 않기 때문입니다. 확실하지 않은 경우, OrcaRouter에서 일반적인 워크로드를 실행하여 측정된 토큰 사용량과 응답 품질을 비교하고, 단순히 표시된 가격만 신뢰하지 마세요.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 입력 / 1M tokens | $2.00 |
| 출력 / 1M tokens | $6.00 |
| 캐시 읽기 / 1M | $0.250 |
| 캐시 쓰기 / 1M | $2.50 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
이번 주 개발자들의 이야기
@misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902