Qwen3.8-Omni-Flash의 히어로 타이틀 카드로, 아이브로우는 'Alibaba - Qwen - 2026년 9월 18일', 부제는 'Qwen의 네이티브 옴니모달 모델 - 텍스트, 이미지, 오디오, 비디오 입력, 100만 토큰 컨텍스트, 호출당 최대 1시간의 연속 오디오-비디오', 그리고 세 개의 통계 칩은 'M 토큰당 가격: 입력 $0.15 / 출력 $0.47', '이전 세대 대비 오디오 비용: 98% 절감', '출력 모달리티: 텍스트 전용'을 표시합니다.
Guides & Insights

Qwen3.8-Omni-Flash 출시: 1M 토큰 컨텍스트, 오디오 비용 98% 절감, 텍스트 출력 전용

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이번 출시로 Qwen3.8-Omni-Flash가 오늘, 2026년 9월 18일, API 고객에게 공개됐으며, 발표에서 가장 먼저 내세운 숫자는 점수가 아니라 비용이다. Qwen에 따르면 새 모델은 오디오 입력 1시간당 보다 98% 저렴하다이전 모델 Qwen3.5-Omni-Plus; 오디오와 영상을 합친 1시간당으로는 93% 저렴하다. 이 발표의 나머지 내용은 모두 이 틀에서 나온다. Qwen3.8-Omni-Flash는 네이티브 옴니모달 모델이다. 텍스트, 이미지, 오디오, 비디오를 입력받고, 100만 토큰의 컨텍스트, 단일 호출로 최대 1시간의 연속 오디오-비디오를 처리할 수 있다. Alibaba는 이 모델을 미디어를 더 잘 설명하는 도구가 아니라, 미디어에 작용하도록 만들어진 첫 Qwen 모델로 판매하고 있다. 태그라인은 "옴니 감각. 에이전트 전달."이다. 같은 자료에서 분명히 밝힌 문제는 모델이 텍스트로만 응답한다는 점이다. 듣고 보지만 말하지는 않는다.

아래 내용 중 독립적으로 재현된 것은 아무것도 없습니다. 이 모델은 출시된 지 몇 시간밖에 되지 않았고, 아직 이에 대한 제3자 평가는 존재하지 않으며, 출시 자료의 모든 벤치마크와 가격 수치는 알리바바 자체의 것입니다. 어떤 수치가 공급업체 보고일 경우 이 글은 그 수치를 담은 문장에서 그 사실을 밝힙니다. 어떤 해석이 공급업체가 아닌 비평가로부터 나온 경우에는 출처를 밝힙니다. 오늘 독립적으로 확인할 수 있는 단 하나의 사실 — 이 모델이 알리바바의 플랫폼에서 서비스 중이며 다른 누구의 카탈로그에도 없다는 점 — 이번 출시가 가장 말하기 꺼리는 바로 그 사실입니다.

실제로 출시된 것

옴니모달 출시치고는 스펙 시트가 유난히 깔끔한데, 그 자체가 이 소식의 핵심이다. 이 제품군의 이전 세대 옴니 모델들은 텍스트 LLM에 별도의 인식 인코더를 볼트로 붙여 조립한 것이었지만, 이번 모델은 Qwen3.8-Flash 아키텍처 계열 위에 직접 구축되어 모달리티를 후천적으로 이식한 것이 아니라 네이티브로 처리한다.

• 입력 — 텍스트, 이미지, 오디오, 비디오(스테레오 및 4채널 공간 오디오 지원), 출력은 텍스트만 가능합니다.

• 컨텍스트 — 100만 토큰, 최대 입력은 약 991K(사고 모드에서는 약 983K), 최대 출력은 131K, 추론 예산은 262K에 달합니다.

• 지속 시간 — 통화당 최대 1시간의 연속 오디오 또는 오디오비디오로, 청킹 없이 회의 및 장시간 비디오 사용 사례를 가능하게 하는 수치입니다.

• 음성 지원 범위 — 주변 툴링에서 74개 언어 인식 및 29개 언어 음성 생성; 이번 출시에 관한 한 중국어 기사에서는 오디오 입력에 대해 113개 언어와 방언을 언급한다.

• 가용성 — Qianwen AI 플랫폼 및 Alibaba Cloud Model Studio(Bailian), API ID qwen3-8-omni-flash를 통해 제공됩니다. 가중치는 공개되지 않습니다. Realtime 변형은 음원 위치 추정 기능을 갖춘 최초의 옴니모달 모델로 설명됩니다.

A single-model scoreboard for Qwen3.8-Omni-Flash with six rows: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Price $0.15 in / $0.47 out per M, Output text only, and Independent score none yet. A footer reads 'All figures vendor-reported from Alibaba's launch materials, 18 Sep 2026. No independent evaluation of this model exists at the time of writing.'

98%는 비용에 관한 주장이며, 그 뒤에 있는 계산은 살펴볼 가치가 있다.

오디오 1시간의 비용이 98% 감소했다는 것은 토큰 가격이 98% 감소했다는 것보다 훨씬 큰 숫자이며, 이 두 가지 사이의 격차가 바로 이번 발표가 효과를 발휘하는 지점이다. 시간당 수치는 2분 샘플의 가격을 매긴 뒤 30을 곱해 산출하며, 비디오는 720p, 초당 1프레임으로 샘플링한다. 이는 프로덕션 워크로드를 견적하는 합당한 방식이며, 동시에 모델이 무엇을 보도록 요청받는지에 대한 설명이기도 하다: 초당 1프레임은 무엇이 말해졌고 화면에서 대략 무슨 일이 일어났는지 알기에는 충분하지만, 프레임 수준 작업을 점검하거나 편집 품질을 판단하거나 단일 프레임 아티팩트를 잡아내기에는 턱없이 부족하다. 두 가지 변화가 함께 곱해지고 있다 — 실제 단가 인하, 그리고 훨씬 더 공격적인 샘플링 정책 — 그리고 첫 번째만이 모델 개선이다.

단가 자체는 구체적입니다. 국제 가격은 다음과 같습니다: 백만 입력 토큰당 $0.15, 백만 캐시된 입력 토큰당 $0.016, 백만 출력 토큰당 $0.47. 국내 Bailian 가격은 다음과 같습니다: 백만당 ¥0.8 (멀티모달 입력 기준, 약 ¥18에서 인하된 가격). 참고로, 국제와 중국 본토의 청구 시스템은 별개이며 수치는 서로 호환되지 않습니다. 이를 직접 비교하는 사람은 잘못된 답을 얻게 됩니다.

이번 발표에서 라우팅이 평소보다 더 중요해지는 부분입니다. OrcaRouter는 공급자 정가를 0% 마크업(으)로 그대로 전달하기에, 이런 종류의 공급업체 가격 인하는 다음 계약 갱신 시점이 아니라 가격이 적용되는 당일에 우리 고객에게 도달합니다. 실제로 검증 가능한 비교 사례 하나가 이미 우리 자체 카탈로그에 있습니다: Qwen3.8-Flash, 이 모델과 나란히 만들어진 멀티모달 모델은 현재 라우팅이 가능하며 가격은 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.47 — 알리바바가 새로운 옴니 모델에 제시하는 것과 동일한 정가입니다 — 그리고 이 글을 쓰기 전 7일 동안 우리 API를 통해 24억 7천만 토큰의 트래픽을 처리했는데, 이는 이 등급이 이미 얼마나 큰 수요를 지니고 있는지를 보여주는 적절한 척도입니다. 옴니 모델 자체는 아직 우리 카탈로그에 없으며, 그때까지는 알리바바 자체 플랫폼에서만 작동하고 다른 곳에서는 작동하지 않습니다. 우리는 이를 다르게 포장할 생각이 없습니다.

이번 출시의 모든 벤치마크는 단 한 가지를 비교합니다

헤드라인은 평균 개선폭이 약 30개 평가에서 26% 이상 — 그리고 그 평가들 각각은 Qwen3.5-Omni-Plus를 상대로 한 것입니다. 그것은 출시에 적절한 기준선이자 좁은 기준선입니다: 그것은 해당 패밀리가 진전했다는 점은 알려주지만, 여러분이 이미 비용을 지불하고 있을 수 있는 어떤 대상과 비교해 어디에 자리 잡았는지는 알려주지 않습니다.

개별 수치들은 모두 벤더 보고치입니다: WildClawBench-MM 71.0, 36.5점 상승으로 이 세트에서 단일 최대 상승폭입니다; UniClawBench 69.6; AgenticVBench 22.3점 상승한 36.8; LongAudioSpan 82.7, 8.3 상승; OmniVideoBench 63.4, 9.6 상승; OmniCap-IF 28.2. 가장 눈에 띄는 쌍은 AliMeeting의 화자 분리(speaker diarisation)로, 여기서 오류율은 88.11에서 3.35로 떨어지고 cpWER은 89.61에서 17.18로 떨어집니다 — 이 정도 낙폭은 박수보다는 면밀한 검증을 받을 만큼 큽니다. 이번 출시에 관한 한 중국어 기술 분석도 바로 그 점을 지적하며, 개선의 상당 부분을 모델 자체의 추론 능력이 아니라 모델을 감싼 프런트엔드 및 화자 분리 엔지니어링 덕분으로 돌리고, 이 시스템이 청각 특화로 읽히는 반면 심층 비디오 추론은 상대적으로 약하다고 경고합니다. 이는 비평가의 해석이지 측정된 재현 결과는 아니지만, 델타의 크기만큼은 계속 염두에 둘 이유가 됩니다.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

기억해 둘 만한 또 다른 숫자는 점수가 전혀 아니다. 알리바바가 Agentic Understanding 모드라고 부르는 방식에서 모델은 모든 프레임을 처리하기보다 스스로 무엇을 보고 들을지 결정하며, 거친 단계에서 세밀한 단계로 이어지는 라운드로 증거를 수집한다. OmniVideoBench에서 그 모드는 정확도를 63.4에서 67.8로 높이면서 쿼리당 토큰을 145,736에서 79,117로 줄인다 — 45.7% 감소다. 정확도는 올리고 비용은 동시에 내린 것은 이번 발표에서 가장 강력한 주장이며, 에이전트적 제안을 가장 직접적으로 뒷받침하는 주장이다.

Gemini 비교는 보도가 시사하는 것보다 범위가 좁다

알리바바의 포지셔닝은 오디오-비디오 성능이 Gemini 3.8 Flash에 "근접"하며, 전반적인 오디오 성능은 이를 능가한다는 것입니다. 수사적 포장을 걷어내면, 벤더가 보고한 비교는 다음과 같습니다. WildClawBench-MM: 71.0 대 58.9. SpotSoundBench: 67.2 대 39.7. MMAU: 81.8 대 76.9. DailyOmni: 85.1 대 84.0. 이는 오디오 및 오디오 중심 도구 사용에서 실제 격차입니다. 다만 선별적이기도 합니다. AgenticVBench라는 순수 비디오 추론 부문에서는 순서가 뒤바뀝니다 — Gemini가 45.0으로 Qwen의 36.8을 앞서며, 알리바바 자신의 설명도 Gemini가 여러 비디오 이해 테스트에서 여전히 앞선다는 점을 인정합니다. 합리적으로 요약하자면, Qwen은 옴니의 오디오 절반을 차지했지만 비디오 절반에서는 여전히 뒤처져 있으며, 이는 헤드라인이 내세운 주장과는 다른 이야기입니다.

"Qwen의 첫 옴니모달 모델"에는 한정어가 필요합니다

가 Qwen의 첫 옴니모달 모델이라는 프레이밍은Qwen3.8-Omni-Flash 오늘 널리 퍼졌는데, 이 점은 정확히 짚고 넘어갈 가치가 있다. 왜냐하면 이 패밀리에는 그 타이틀을 정당하게 내세울 수 있는 더 이른 모델이 있기 때문이다. Qwen2.5-Omni는 2025년 3월 Thinker-Talker 아키텍처로 공개된 7B 오픈 웨이트 모델로, 역시 텍스트, 이미지, 오디오, 비디오를 입력으로 받았고 텍스트뿐 아니라 음성도 생성했다. 여기서 진짜 처음인 것은 네이티브 옴니모달리티다. 하나의 모델이 Qwen3.8-Flash 기반 위에 구축된 것이지, 지각 인코더를 덧붙인 텍스트 LLM이 아니며, 여기에 에이전트 우선 설계 브리프까지 더해졌다. 두 진술 모두 사실이다. 다만 반복된 것은 둘 중 하나뿐이다. 이번 주 이전에 Qwen 옴니 모델이 존재하지 않았다는 가정 위에서 이 모델을 평가한다면, Qwen2.5-Omni로부터의 업그레이드 경로를 잘못 평가하게 된다. 이는 우리가 별도로 정리한 비교다.

도구가 바로 에이전트적 주장이 실제로 존재하는 곳이다

모델과 함께 두 가지가 출시되었는데, 이들은 모델 카드가 시사하는 것보다 더 중요합니다. 이들이 인식을 전달로 바꾸는 역할을 하기 때문입니다. Qwen-MM-Plugins는 에이전트 하네스를 위한 멀티모달 플러그인 제품군으로, 외부 에이전트에 이미지, 오디오, 비디오 및 문서 이해와 장시간 비디오 메모리, 비디오 편집 기능을 제공합니다. Codex, Claude Code, Qwen Code, Gemini CLI 및 여러 다른 도구에 대한 지원을 홍보하며, 수시간 분량의 비디오를 삽화가 포함된 PDF 노트로 바꿔 주는 Video2Note를 포함해 이름이 붙은 도구들을 제공합니다. Qwen-Live Harness는 지속적인 실시간 옴니모달 상호작용을 위한 오픈소스 런타임으로, 사용자가 실시간으로 대화하고 더 무거운 작업을 백그라운드 에이전트에 위임하는 스케줄링 계층 역할을 합니다. 출시 당일 보도에서 나온 한 가지 주의점: Gigazine이 확인했을 때 Qwen-Live Harness GitHub 페이지가 404를 반환하고 있었으므로, 저장소가 정상적으로 열릴 때까지는 이 도구를 검증된 것이 아니라 발표된 것으로 간주하십시오.

그 런칭이 묻어버리는 문장: 그것은 말하지 않는다

전신 모델이 음성을 생성했던 모델이라면, Qwen3.8-Omni-Flash가 멀티모달 입력·텍스트 출력이라는 사실이야말로 이 스펙에서 가장 중대한 대목인데도, 자료에서는 대체로 각주처럼 등장할 뿐이다. 이는 이 모델을 음성-대-음성 제품에 단독으로 투입할 수 없다는 뜻이다. 이를 기반으로 만든 더빙, 음성 에이전트, 실시간 대화는 모두 외부 텍스트-음성 변환 단계가 필요하고, 영상의 경우 외부 렌더러까지 필요하다 — 플러그인 제품군과 라이브 하네스가 존재하는 이유가 바로 이것이다. 실무적 결과는 "하나의 옴니 모델"보다 움직이는 부품이 더 많은 파이프라인이며, 지연 시간은 그 모든 구성 요소에 걸쳐 예산을 배분해야 한다.

이번 릴리스에는 그 격차와 이 모델이 무엇에 유용한지를 보여주는 깔끔한 시연이 묻혀 있다. "모델 최적화 모델" 실험에서 Qwen3.8-Omni-Flash는 Qwen2.5-Omni-3B의 쓰촨 방언 인식을 자율적으로 개선하여 문자 오류율을 25.79%에서 15.30%로 12시간 이내에 낮추고 네 차례에 걸쳐 3,413개의 훈련 샘플을 구축했다. 더 작은 형제 모델의 방언 처리를 진단하고 수리할 수 있는 모델은 전사 API가 할 수 없는 일을 하는 것이다. 벤치마크 표가 아니라 바로 그것이, 여기서 "에이전트형"이 무엇을 의미해야 하는지에 대한 가장 명확한 논거다.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (captured 18 September 2026), headed '199 models - 15 providers - one API key, one bill', with modality tabs reading Text 164, Image 10, Embeddings 5, Video 10 and TTS 10, a 'How to call any model' panel showing the OpenAI-compatible endpoint, and model cards including Qwen3.8 Max (0902) and DeepSeek V4.1 Flash.

무엇이 우리의 판단을 바꿀까요?

솔직한 현 상황은 이렇다. 이것은 명세가 잘 갖춰진 출시이며, 설득력 있는 가격 스토리를 갖췄고, 독립적 평가는 없으며, 발표가 축소해 표현한 적어도 하나의 구조적 한계가 있다. 세 가지가 이를 판가름할 것이다. Artificial Analysis나 LMArena에 등재되면 벤더 수치가 비교 가능한 수치로 바뀔 텐데, 아직 그런 항목은 없다. 45.7% 토큰 감소 — 정확도는 오르고 비용은 내려간다는 주장 — 에 대한 제3자 테스트는 이번 릴리스에서 가장 유용하고 가장 화려하지 않은 결과를 확인해 줄 것이다. 그리고 AliMeeting 화자 분리에 대한 독립적 측정은 88포인트 하락이 모델 자체의 것인지 그 주변 파이프라인의 것인지를 보여 줄 것이다.

그때까지는 모든 모델의 첫날에 적용되는 합리적인 태도, 즉 테스트할 가치는 있지만 프로덕션 경로를 걸 만한 가치는 없다는 태도를 취하는 것이 현명합니다. 이미 OrcaRouter를 통해 라우팅하고 있다면, 실용적인 조치는 워크로드를 이미 측정해 둔 모델에 유지하고, Qwen3.8-Omni-Flash를 두 벤더 중 어느 한쪽의 벤치마크 표가 아니라 자체 오디오와 비디오에서 그 모델들과 비교해 오디션할 후보로 취급하는 것입니다. 사용 사례가 중국어와 영어의 장시간 회의 또는 미디어 분석이라면, 여기의 토큰 경제성은 지금 테스트를 정당화할 만큼 충분히 강력합니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트