qwen/qwen3.5-flash

qwen/qwen3.5-flash
비전도구JSON추론
제공 qwen

Qwen3.5 Flash — 비용에 최적화된 멀티모달 채팅 (텍스트/이미지/영상), 1M 컨텍스트

엔드포인트:/v1/chat/completions
컨텍스트1M 토큰
최대 출력65K
입력text + image + video
출력text
p50 TTFT2.71 s
입력$0.10/ 100만 토큰
출력$0.40/ 100만 토큰
p50 TTFT2.71 s7일
p95 TTFT10.00 s7일
트래픽1.3M토큰 / 7일

Qwen3.5 Flash는 Qwen 제품군의 멀티모달 언어 모델로, 빠른 추론과 저렴한 비용을 위해 설계되었습니다. 텍스트, 이미지, 비디오 입력을 받아 텍스트 응답을 생성합니다. 1,048,576개의 토큰으로 구성된 컨텍스트 창을 통해 단일 요청으로 매우 긴 문서나 여러 비디오 프레임을 처리할 수 있습니다. 이 모델은 생성당 최대 65,536개의 토큰을…

Qwen3.5 Flash란 무엇인가요?

이 모델은 누구를 위한 것인가요?

주요 사양을 한눈에

코드 샘플

어떤 SDK에서도 호출

OpenAI 호환 — 쓰던 SDK 그대로

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3.5-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

지원되는 매개변수

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

가격

입력 / 1M tokens$0.100
출력 / 1M tokens$0.400
통화USD

비용 계산기

월 토큰 수10MM
입력 비율70%%
월 예상 $1.90

정가 기준 추정치

토큰 및 비용 추정기

입력 토큰: 9요청당 비용: $0.000201

추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.

성능

p50 TTFT
2.71 s
출력 속도
206 tok/s
p95 TTFT
10.00 s
오류율
7.3%

공개 벤치마크

소스: Design Arena

커뮤니티 화제

이번 주 개발자들의 이야기

Hacker News0 회 언급 · 7일

비교

qwen/qwen3.5-flashQwen3.8 Maxqwen/qwen3-max-previewQwen3.5 397B A17B
입력 $/100만$0.10$2.00$0.86$0.17
출력 $/100만$0.40$6.00$3.44$1.03
컨텍스트1.0M1.0M262K33K
품질6/109/108/108/10
나란히 비교나란히 비교나란히 비교나란히 비교

FAQ

OrcaRouter에서 Qwen3.5 Flash를 사용하는 비용은 얼마입니까?
비용은 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.40입니다. 이는 OrcaRouter의 마크업이 없는 제공업체 요금입니다. 추가 수수료 없이 제공업체가 청구하는 금액만 정확히 지불합니다.
컨텍스트 윈도우 크기는 얼마인가요?
컨텍스트 창은 1,048,576 토큰(약 100만 토큰)입니다. 여기에는 전체 대화 기록에 걸친 입력 및 출력 토큰이 모두 포함됩니다. 생성당 최대 출력은 65,536 토큰입니다.
Qwen3.5 Flash의 강점은 무엇인가요?
장점으로는 멀티모달 입력(텍스트, 이미지, 비디오), 매우 큰 1M 컨텍스트 윈도우, 65K 토큰의 긴 출력, 토큰당 낮은 비용, 그리고 더 큰 Qwen 모델에 비해 빠른 추론이 있습니다. 대용량 또는 실시간 멀티모달 작업에 이상적입니다.
더 큰 Qwen 모델과 어떻게 비교되나요?
더 큰 Qwen 모델(예: Qwen3.5-72B)은 복잡한 추론에서 더 높은 정확도를 제공하지만 속도가 느리고 비용이 더 많이 듭니다. Qwen3.5 Flash는 일부 정확도를 속도와 비용 효율성과 맞바꾸면서도 동일한 멀티모달 및 장문 맥락 기능을 유지합니다.
OrcaRouter가 제공업체 가격에 마크업을 적용하나요?
아니요. 가격은 제공업체 요율로 전달되며 마크업이 전혀 없습니다. OrcaRouter를 통한 Qwen3.5 Flash의 경우 입력 토큰 100만 개당 정확히 $0.10, 출력 토큰 100만 개당 $0.40을 지불합니다.
Qwen3.5 Flash를 OpenAI 호환 API로 호출할 수 있나요?
네. OrcaRouter는 https://api.orcarouter.ai/v1에서 OpenAI 호환 엔드포인트를 제공합니다. OrcaRouter API 키와 함께 모델 ID "qwen/qwen3.5-flash"를 사용하십시오. 요청 및 응답 형식은 OpenAI의 채팅 완료 API와 일치합니다.
OrcaRouter에서 데이터 처리는 어떻게 작동하나요?
데이터 처리 정책은 OrcaRouter와 Qwen에 의해 결정됩니다. 카탈로그 항목은 구체적인 세부 사항을 제공하지 않습니다. 사용자는 민감한 데이터를 전송하기 전에 OrcaRouter의 개인정보 보호정책과 Qwen의 데이터 사용 약관을 검토해야 합니다.
모델은 어떤 모달리티를 지원하나요?
텍스트, 이미지 및 비디오 입력을 지원합니다. 이미지는 사용자 메시지에서 URL 또는 base64 데이터로 제공할 수 있습니다. 비디오 입력은 일반적으로 프레임(이미지) 시퀀스로 전송됩니다. 모델은 텍스트 출력만 생성합니다.
최소 또는 최대 토큰 수가 필요한가요?
최소 토큰 수는 없습니다. 최대 입력 토큰(대화 기록 포함)은 1,048,576개 토큰입니다. 응답당 최대 출력 토큰은 65,536개입니다. 출력 길이를 제어하려면 max_tokens 매개변수를 사용하세요.
OrcaRouter를 통해 이 모델을 호출하기 시작하려면 어떻게 해야 하나요?
OrcaRouter에 가입하여 API 키를 받으세요. 코드에서 기본 URL을 https://api.orcarouter.ai/v1로 설정하세요. 모델 ID "qwen/qwen3.5-flash"를 사용하고 멀티모달 콘텐츠로 표준 채팅 완료 요청을 보내세요. 예제는 OrcaRouter 문서를 참조하세요.

이 배지 임베드

qwen/qwen3.5-flash$0.10/M in2705ms p50OrcaRouter를 통해
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3.5-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3.5-flash.svg" alt="OrcaRouter 의 qwen/qwen3.5-flash" /> </a>
Markdown [![qwen/qwen3.5-flash](https://www.orcarouter.ai/embed/qwen/qwen3.5-flash.svg)](https://www.orcarouter.ai/models/qwen/qwen3.5-flash)

모델 카드를 데이터로

GET /api/public/models/qwen/qwen3.5-flash열기
기계 판독 가능:/llms.txt/llms-full.txt