Qwen3.8-Omni-Flash vs Qwen 3.8 비교를 위한 히어로 타이틀 카드로, 아이브로우는 '정면 대결 - 같은 패밀리, 상반된 브리프', 부제는 '수시간 분량의 미디어를 위해 만들어진 전문 모델과 토큰당 깊이를 위해 만들어진 2.4조 매개변수 오픈 코어의 대결', 그리고 세 개의 스탯 칩은 'M 토큰당 가격: 13배 차이', '컨텍스트: 양쪽 모두 1M', '오픈 가중치: 한쪽만'을 표시합니다.
Guides & Insights

Qwen3.8-Omni-Flash vs Qwen 3.8: 전문가용 모델 대 플래그십 모델

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

짧게 말하자면: Qwen3.8-Omni-Flash대략 토큰당 13배 더 저렴하며보다 Qwen 3.8둘 중 유일하게 한 시간 분량의 오디오·비디오를 무리 없이 소화하도록 만들어진 모델이다 — 반면 Qwen 3.8은 Qwen3.8 라인 최상단의 2조 4,000억 매개변수 오픈 코어로, 답이 정확해야보다 저렴하기 할 때 쓰는 모델이며, 둘 중 유일하게 가중치를 내려받을 수 있는 쪽이다. 두 모델은 컨텍스트 길이와 패밀리 이름, 그리고 8월에서 9월에 걸친 출시 시점을 공유한다. 이 둘은 서로 대체재가 아니며, 이 비교의 가치는 당신이 실제로 어떤 질문을 하고 있는지 아는 데 전부 달려 있다.

이름을 정확히 짚자면, 제품군이 워낙 붐비기 때문이다. Qwen 3.8은 여기서 2.4T-A95B 전문가 혼합(MoE) 오픈 코어, 즉 알리바바가 2026년 8월 3일에 선보이고 8월 12일에 가중치를 공개한 Qwen3.8-Max 엔드포인트의 기반 모델을 뜻하며, Artificial Analysis가 40점으로 자체 Intelligence Index에서 집계하는 모델이다. Qwen3.8-Omni-Flash는 알리바바가 2026년 9월 18일 API 서비스에 투입한 네이티브 옴니모달 모델로, Qwen3.8-Flash 아키텍처 계열을 기반으로 하며 텍스트, 이미지, 오디오, 비디오를 입력받아 텍스트를 반환한다. 플래그십에 관한 모든 내용은 명시된 대로 벤더 보고 또는 독립적 인덱싱에 근거한 것이고, 옴니 모델에 관한 모든 내용은 벤더 보고뿐인데, 공개된 지 불과 몇 시간밖에 되지 않아 알리바바 밖에서는 아무도 측정하지 않았기 때문이다.

두 개의 모델, 하나의 패밀리, 상반된 디자인 브리프

이것을 같은 세대의 큰 모델과 작은 모델로 읽으려는 유혹이 든다. 마치 Qwen3.8-Max를 Qwen3.8-Flash와 대조해 읽듯이. 그런 해석은 돈이 나가는 오독이다. 그 Qwen 3.8 코어는 이미지와 비디오를 받아들이기도 하는 추론 엔진이다. 처리량은 어려운 문제에서 초당 토큰으로 측정되고, 가격은 950억 활성 파라미터 순전파에 드는 연산량을 반영하도록 정해지며, 평가표는 추론 및 코딩 리더보드 목록이다. Qwen3.8-Omni-Flash는 추론도 하는 지각 및 행동 엔진이다. 가격은 몇 시간 분량의 미디어를 입력하는 비용에 맞춰 정해지고, 평가표는 오디오, 비디오 및 도구 호출 리더보드 목록이다. 하나는 토큰당 깊이에 최적화되어 있다. 다른 하나는 콘텐츠 한 시간당 토큰에 최적화되어 있다.

그 차이는 마케팅에서 언급하지 않는 지점에서 가장 선명하게 드러난다. 두 모델 모두 약 100만 토큰을 받아들이고 둘 다 동영상을 받아들인다. 하지만 Qwen3.8-Omni-Flash는 지속 시간 문제를 염두에 두고 명시적으로 설계되었다 — 단일 호출로 최대 1시간의 연속 오디오-비디오를 처리하며, 모델이 모든 프레임을 처리하는 대신 무엇을 샘플링할지 스스로 선택하는 에이전틱 이해(Agentic Understanding) 모드를 갖추고 있어, 쿼리당 토큰을 145,736개에서 79,117개로 줄이면서도 OmniVideoBench 정확도를 63.4에서 67.8로 끌어올린다. Qwen 3.8에는 이에 상응하는 공개된 메커니즘이 없다. 두 시간 분량의 동영상을 입력하는 것은 이론상 가능하다. 하지만 재무팀의 검증을 통과할 만한 가격으로 그것을 해내는 것은 별개의 문제이며, 바로 그 문제에 답하기 위해 이 옴니 모델이 만들어진 것이다.

실제로 그것을 결정하는 차원들

• 가격 — Qwen3.8-Omni-Flash는 입력 100만 토큰당 $0.15, 출력 100만 토큰당 $0.47로, Qwen 3.8의 $2.00, $6.00과 대비됩니다. 캐시 읽기: $0.016 대 $0.25.

• 오픈 웨이트 — Qwen 3.8은 2026년 8월 12일 사용자 정의 라이선스로 웨이트를 공개했습니다; Qwen3.8-Omni-Flash는 API 전용이며 Alibaba는 이를 공개할 것이라고 밝히지 않았습니다.

• 컨텍스트 — 양쪽 모두 100만 토큰이며, 옴니 모델에서는 최대 입력 991K에 최대 출력 131K, 추론 예산 262K입니다.

• 미디어 지속 시간 — 단일 omni call에서 최대 1시간의 연속 오디오-비디오; 플래그십은 비디오 입력에 대해 문서화되어 있지만 시간당 비용에 대한 설명은 없습니다.

• 출력 모달리티 — 양쪽 모두 텍스트. 옴니 모델의 계보에도 불구하고, 어느 쪽도 음성을 생성하지 않는다.

• 독립 점수 — Qwen 3.8은 Artificial Analysis Intelligence Index에서 40점을 기록합니다. Qwen3.8-Omni-Flash는 아직 어떤 종류의 독립 점수도 없습니다.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen 3.8 - the scoreboard'. Left column Qwen3.8-Omni-Flash: Price per M $0.15 in / $0.47 out, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Open weights not released, Independent score none yet. Right column Qwen 3.8: Price per M $2.00 in / $6.00 out, Context 1M tokens, Media per call video input with no per-hour price, Output text only, Open weights published 12 Aug 2026, Independent score AA Index 40. The footer reads 'Qwen 3.8 pricing and Index score per Artificial Analysis and Alibaba; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

왜 벤치마크 테이블만으로는 이 문제를 해결할 수 없는가

일대일 비교표는 없고, 당분간 생길 일도 없다. Alibaba의 Qwen3.8-Omni-Flash 출시 자료에서 이 모델을 벤치마크한 대상은 오직 Qwen3.5-Omni-Plus, 즉 직전 모델, 그리고 Gemini 3.8 Flash뿐이다; 플래그십의 수치는 완전히 다른 추론 및 코딩 평가 세트에서 나온다. 두 표는 단 하나의 행도 공유하지 않는다. 이 둘을 한 축에 나란히 놓는 표를 게시하는 사람은 그 축을 스스로 만든 것이다.

정직하게 말할 수 있는 것은 방향성에 그친다. 벤더가 자체 제시한 수치에서는 omni 모델이 그것이 대체하는 omni 라인에 비해 큰 도약이다 — 약 30개 평가에서 평균 26% 이상 향상되었으며, WildClawBench-MM 71.0, UniClawBench 69.6, LongAudioSpan 82.7 — 그리고 Gemini 3.8 Flash에 대해서는 실질적이지만 부분적인 우위인데, SpotSoundBench(67.2 대 39.7)와 MMAU(81.8 대 76.9) 같은 오디오 중심 벤치마크에서는 앞서고 순수 비디오 추론 AgenticVBench(36.8 대 45.0)에서는 뒤진다. 플래그십 쪽에서 Qwen 3.8의 Index 점수 40은 독립적인 측정치이며 위의 어느 것보다 더 가치가 있다. 이는 서로 다른 종류의 증거이므로 함께 평균 내서는 안 된다.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

가정을 명시한 비용 비교 예시

긴 문서 및 영상 분석 작업을 하나 들어 보겠습니다. 입력 토큰 300,000개와 출력 토큰 20,000개로, 슬라이드가 포함된 90분 분량의 녹화된 회의에 그럴듯한 규모입니다. Qwen3.8-Omni-Flash에서는 300,000 × 백만 토큰당 $0.15 = $0.045의 입력이고 20,000 × 백만 토큰당 $0.47 = $0.0094의 출력이므로 약 5.4센트입니다. Qwen 3.8에서 같은 호출은 300,000 × 백만 토큰당 $2.00 = $0.60이고 20,000 × 백만 토큰당 $6.00 = $0.12, 즉 약 72센트입니다. 동일한 토큰 수에 대해 비용이 13배를 조금 넘습니다.

결정을 바꾸는 숫자는 비율이 아니라 총량입니다. 하루에 그런 작업이 100건이라면, 하루 약 $5 대 약 $72입니다 — 출시하는 기능과 범위를 줄이는 기능의 차이입니다. 하지만 300K 토큰 계약서에서 어려운 추출 작업 하나를 하는데, 잘못된 답변이 사람의 검토 한 시간을 잡아먹는다면, 13배 프리미엄은 무의미하며 더 강력한 추론 모델이 자신이 저지르지 않는 첫 번째 실수에서 승리합니다. 가정은 가격표를 본 뒤가 아니라 보기 전에 설정하세요.

각각이 실제로 우위를 차지하는 지점

Qwen3.8-Omni-Flash는 시간 단위로 측정되는 모든 작업에서 앞선다. 화자 분리와 후속 작업 추출을 포함한 회의 전사, 장시간 영상 요약, 시청각 연구 보고서, 캡션 파이프라인, 그리고 녹음의 어느 순간이 중요한지 스스로 판단해야 하는 모든 에이전트가 그렇다. 벤더가 보고한 화자 분리 개선 — AliMeeting 화자 오류율이 88.11에서 3.35로 떨어진 것 — 은 수동 검토 파이프라인을 자동화된 파이프라인으로 바꿔 놓는 종류의 변화량이지만, 이번 출시에 관한 중국의 한 기술 분석은 그 개선의 상당 부분이 모델 자체가 아니라 모델을 둘러싼 프런트엔드 및 화자 분리 엔지니어링에서 비롯된다고 주장하므로, 사람 검토 단계를 없애기 전에 자체 오디오로 벤치마크하라. 또한 이 옴니 모델은 텍스트 품질이 충분한 대량 텍스트 워크로드라면 가격에서도 명확히 앞서는데, 알리바바는 그 텍스트 품질이 같은 크기의 텍스트 전용 모델에 필적한다고 주장한다 — 검증되지 않은 주장이므로 가정하지 말고 테스트해 볼 가치가 있다.

Qwen 3.8은 결과가 집계되는 것이 아니라 평가되는 모든 곳에서 승리합니다: 어려운 추론, 장기적인 에이전트 작업, 대규모 코드 작업, 종합이 곧 결과물인 백만 토큰 문서 분석에서 말이죠. 또한 벤치마크와는 전혀 무관한 차원에서도 승리합니다 — 그것은 바로 오픈 웨이트라는 점입니다. 데이터 상주, 온프레미스 배포, 파인튜닝, 또는 추론 경로에 벤더를 두지 않으려는 것만이 제약이라면, 이 옴니 모델은 애초에 후보가 아니며, 어떤 가격 우위도 그 격차를 메우지 못합니다. 바로 그 단 하나의 제약이 위의 모든 숫자보다 더 많은 실제 배포를 결정합니다.

두 개의 계약 없이 그것들을 운영하기

이런 비교에서 실질적인 걸림돌은 대개 모델 선택이 아닙니다. 문제는 결국 두 벤더, 두 개의 결제 관계, 두 세트의 클라이언트 코드를 통합한 끝에야 어느 쪽을 원했는지 알게 된다는 점입니다. 2.4조 개 매개변수 오픈 코어를 탑재한 엔드포인트인 Qwen3.8-Max는 OrcaRouter에서 모델 ID qwen/qwen3.8-max로, 입력 백만 토큰당 $2.00, 출력 백만 토큰당 $6.00에, 100만 토큰 컨텍스트와 텍스트, 이미지, 비디오 입력을 지원하며, 하나의 키로 200개가 넘는 다른 모델과 함께 제공자 정가, 0% 마크업, 엔드포인트 성능이 저하될 경우 제공자 간 자동 페일오버로 제공됩니다. Qwen3.8-Omni-Flash는 그 카탈로그에 없습니다 — 알리바바 자체 플랫폼에서 실행되기 때문입니다 — 따라서 오늘날 정직한 구성은 우리 라우트에서는 플래그십을, omni 모델은 직접 호출하는 것이며, 라우팅 계층은 테스트를 마친 뒤 테스트에서 진 쪽을 배치할 자리를 제공해 줍니다.

A screenshot of the OrcaRouter model page for Qwen3.8 Max at www.orcarouter.ai/models/qwen/qwen3.8-max (captured 18 September 2026, English UI), showing the model id qwen/qwen3.8-max with a FEATURED badge and a byline date of 2026-08-03, a spec panel reading ctx 1M tokens, Input text + image + video, Output text, p50 TTFT 10.00s, and a metrics row reading INPUT $2.00 / 1M tokens, OUTPUT $6.00 / 1M tokens, TRAFFIC 84.0M tokens / 7d, above OpenAI- and Anthropic-compatible SDK code samples.

판결

를 선택하세요Qwen3.8-Omni-Flash입력은 길고 출력은 짧으며 물량 때문에 단가가 결정적 제약이 되는 경우Qwen 3.8을 선택하세요 — 입력이 밀도 높고 출력 자체가 제품이며 정확성 또는 배포 통제가 타협 불가일 때. 겹치는 영역인 영상 이해는 진정한 일대일 비교가 성립하는 유일한 곳이며, 그 영역에서는 omni 모델이 비용과 소요 시간이라는 논거를, 플래그십이 추론과 오픈 웨이트라는 논거를 쥐고 있습니다. 확정하기 전에 자체 데이터로 둘 다 실행해 보세요. omni 모델은 아직 독립적인 평가가 없으며, 출시일 가격 우위란 발표문이 아니라 청구서로 확인해 볼 만한 바로 그런 종류입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트