
Qwen3.8-Omni-Flash vs Qwen2.5-Omni: 18개월이 지난 지금, 업그레이드는 목소리를 잃었다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
이 비교를 단순한 세대 교체보다 더 흥미롭게 만드는 사실이 있습니다. 이전 모델은 말할 수 있고, 새 모델은 그럴 수 없습니다. Qwen2.5-Omni는 2025년 3월에 출시되어 텍스트, 이미지, 오디오, 비디오를 입력으로 받고 텍스트로 답하거나 스트리밍 자연 음성으로 답하는, 다운로드할 수 있는 단일 엔드투엔드 모델이었습니다. Qwen3.8-Omni-Flash는 2026년 9월 18일에 출시되어 동일한 네 가지 모달리티를 30배 더 큰 컨텍스트 창에서 처리하며, 이전 모델이 몇 초를 다루던 것과 달리 한 시간 분량의 연속 오디오-비디오를 입력받고, 텍스트만 반환합니다. 18개월의 작업으로 훨씬 더 넓은 입력을 얻은 대신 출력 채널을 포기했습니다. 그것이 진보인지 아니면 트레이드오프인지는 전적으로 예전 모델을 무엇에 사용하고 있었는지에 달려 있습니다 — 그리고 답은 깔끔하게 둘로 갈립니다.
의 수치는Qwen2.5-Omni 벤더의 것입니다. 2025년 3월 출시 자료에서 나온 것이며, 18개월간의 광범위한 배포가 이를 부분적으로 입증해 왔습니다. 다음으로, Qwen3.8-Omni-Flash의 수치도 Alibaba의 것입니다. 이 글을 작성하기 몇 시간 전에 공개된 출시 자료에서 나온 것이며, 그 안의 어떤 것도 독립적으로 재현되지 않았습니다. 어떤 주장이 벤더가 아니라 비평가로부터 나온 경우에는 그렇게 출처가 밝혀집니다. 검증이 필요 없는 단 하나의 구조적 사실은 또한 가장 중대합니다: Qwen2.5-Omni는 오픈 웨이트이고 다운로드 가능하며, Qwen3.8-Omni-Flash는 그렇지 않습니다.
Qwen2.5-Omni는 무엇이었고, 왜 중요했는가
2025년 3월 26일에 출시되었을 때, Qwen2.5-Omni는 이 제품군 최초의 엔드투엔드 옴니모달 모델이었습니다. 이번 릴리스는 전사, 비전, 음성 각각에 별도의 모델과 별도의 글루 레이어가 필요했던 "전문가 동물원" 문제에 대한 해답으로 이를 내세웠습니다. 7B 모델은 네 가지 입력 모달리티와 텍스트 및 음성 출력을 모두 처리했고, OmniBench 융합 벤치마크에서 Gemini-1.5-Pro보다 앞선 최첨단 결과를 주장했으며, Alibaba가 인간 수준이라고 설명한 음성 생성 품질 점수 4.51을 보고했습니다. 3B 변형도 동일한 아키텍처를 따랐습니다.
이를 작동하게 만든 엔지니어링은 이름을 붙일 가치가 있습니다. 새 모델은 이를 사용하지 않기 때문입니다. Thinker-Talker 작업을 두 가지로 나눴습니다: Thinker 트랜스포머는 오디오 및 이미지 인코더를 융합하여 의미와 텍스트를 생성했고, Talker는 Thinker의 은닉 상태에서 음성 토큰을 스트리밍하면서 전체 대화 기록을 공유했습니다. 시간 정렬 멀티모달 RoPE(TMRoPE)는 비디오와 오디오 위치를 인터리브하여 두 스트림이 동기화된 상태를 유지하도록 했습니다. 블록 단위 스트리밍 덕분에 인코더는 지각을 수행하고 언어 모델은 긴 시퀀스를 처리할 수 있었으며, 이것이 저지연 음성 응답을 가능하게 했습니다. 두 가지 고정 음성, Chelsie와 Ethan이 함께 제공되었습니다.
제약은 똑같이 실재했다. 컨텍스트는 32,768 토큰이었다. 메모리는 연산보다 훨씬 더 강하게 발목을 잡는 한계였다. 알리바바 자체 표에 따르면 FlashAttention-2를 적용한 BF16 추론은 15초 영상에 약 31GB의 GPU 메모리를 요구했고, 30초에는 42GB, 꽉 찬 1분에는 60GB였다. 7B 모델로 영상 1분을, 임대할 수 있는 가장 큰 단일 GPU 중 하나에서 돌리는 것이다. 바로 이 숫자를 계속 눈여겨봐야 한다. 2026년 모델은 바로 그 숫자를 파괴하기 위해 만들어졌기 때문이다.
Qwen3.8-Omni-Flash란 무엇인가
새로운 모델은 조립식이 아니라 네이티브 옴니모달입니다 — Qwen3.8-Flash 아키텍처 라인에 직접 구축된 것이지, 인식 인코더를 덧붙인 텍스트 LLM이 아닙니다. 이는 단순한 세대 라벨이 아닌 구조적 차이입니다. 텍스트, 이미지, 오디오, 비디오를 입력으로 받으며 스테레오와 4채널 공간 오디오도 포함하고, 텍스트를 반환합니다. 100만 토큰 컨텍스트를 기반으로 최대 입력 약 991K, 최대 출력 131K, 추론 예산 262K를 지원합니다. 또한 호출당 최대 1시간의 연속 오디오-비디오를 처리합니다. 음성 인식은 74개 언어를 지원하며, 29개 언어의 음성 생성은 모델이 아닌 주변 툴링에서 처리됩니다. Qianwen AI 플랫폼과 Alibaba Cloud Model Studio에서 qwen3-8-omni-flash라는 ID로 사용할 수 있으며, 입력 토큰 100만 개당 $0.15, 출력 100만 개당 $0.47, 캐시된 입력은 $0.016입니다.

18개월, 차원별로
• 컨텍스트 — Qwen2.5-Omni 32,768 토큰 대 Qwen3.8-Omni-Flash 100만, 대략 30배 증가.
• 미디어 길이 — GPU 메모리에 의해 제한되는 몇 초 분량의 영상 대, 단일 호스팅 통화에서의 한 시간 연속 오디오·비디오.
• 출력 — 구형 모델에서는 텍스트와 스트리밍 자연 음성, 신형 모델에서는 텍스트만.
• 배포 — Qwen2.5-Omni는 Apache-2.0에 따라 오픈 웨이트로 공개되어 Hugging Face와 ModelScope에서 다운로드할 수 있으며, Qwen3.8-Omni-Flash는 API 전용으로 가중치 공개 계획이 발표되지 않았습니다.
• 하드웨어 — 1분 분량의 비디오를 위해 최대 약 60GB의 GPU 메모리가 필요한 7B 매개변수, 반면 전혀 프로비저닝할 필요가 없는 호스팅 엔드포인트와 대비됩니다.
• 가격 — 이전 모델은 GPU 한 대를 필요로 하지만, 새 모델은 입력 토큰 100만 개당 $0.15이며, 알리바바는 시간당 오디오 입력이 대체하는 Qwen3.5-Omni-Plus 세대보다 98% 더 저렴하다고 주장합니다.
• 음성 생성 — 2025년의 두 가지 고정 음성에 맞서, 2026년 도구에서는 29개 언어의 음성 생성이 가능하며, 그중 어느 것도 모델 자체가 생성한 것은 아니다.
아무도 광고하지 않은 거래
두 스펙 시트를 함께 읽으면 지난 18개월의 윤곽이 분명해진다. 알리바바는 그 기간 동안 흡수량, 즉 모델이 얼마나 많은 미디어를 얼마나 저렴하게 받아들일 수 있는지, 그리고 스스로 얼마나 많은 결정을 내릴 수 있는지를 해결하는 데 시간을 쏟았다. Qwen3.8-Omni-Flash는 그 축에서 거둔 쾌거다. 모델이 모든 프레임을 처리하는 대신 무엇을 샘플링할지 스스로 선택하는 Agentic Understanding 모드에서는 쿼리당 토큰 수가 145,736개에서 79,117개로 줄어드는 동시에 OmniVideoBench 정확도는 63.4에서 67.8로 상승하며, 벤더에 따르면 AliMeeting의 화자 분리 오류는 88.11에서 3.35로 급감한다.
이번 간격이 우선순위를 두지 않은 것은 출력이다. 2025년 모델의 결정적 특징 — 별도의 음성 합성기 없이, 처음부터 끝까지, 당신의 말을 듣고 소리 내어 답하는 하나의 모델 — 은 여기서 이어지지 않는다. 음성 에이전트, 더빙 파이프라인 또는 접근성 도구를 Qwen2.5-Omni의 Talker 위에 구축했다면, 2026년 모델은 그것에 대한 업그레이드가 아니다. 그것은 새로운 텍스트 음성 변환 단계를 덧붙여야 하는 구성 요소로, 이전에는 둘 다 없던 파이프라인에 지연 시간과 공급업체를 추가하게 된다. 출시 자료는 모달리티 관련 문구를 자세히 읽어보면 이 점에 대해 솔직하지만, 그것이 헤드라인은 아니며, 두 릴리스에서 "omni"가 같은 의미라고 가정하고 마이그레이션하는 사람은 프로덕션에서 그 차이를 발견하게 될 것이다.

2025년 모델이 여전히 일자리를 가진 이유
세 가지 이유가 있고, 그중 어느 것도 향수가 아닙니다. 첫째는 위에서 말한 목소리입니다. 둘째는 오픈 웨이트입니다: 32K의 컨텍스트와 7B 풋프린트는 당신이 통제하는 하드웨어에서 오프라인으로 실행되며, 데이터가 건물 밖으로 나가지 않고 토큰당 계량기도 없습니다 — 오디오가 데이터 상주 규정의 적용을 받거나 지연 예산이 왕복 통신을 허용하지 않는 경우 유일한 선택지입니다. 셋째는 매우 낮은 사용량에서의 비용입니다. 이미 보유한 GPU는 한계 비용이 0이고, 호스팅 모델의 백만 토큰당 $0.15는 저렴하지만 0은 아니며, 그에 대비한 프로비저닝의 고정 비용은 주 두 번 실행되는 워크로드에 실제 부담이 됩니다.
반론은 구형 모델의 제약이 해마다 더 크게 발목을 잡는다는 것이다. 1분 분량의 영상, 32K의 컨텍스트, 그리고 에이전트가 기본 배포 형태인 세상에서 툴 호출이나 구조화된 출력이 전혀 없다는 것은 매우 좁은 범위다. 녹화된 회의를 반드시 입력으로 받아들여야 하는 파이프라인에게 Qwen3.8-Omni-Flash는 단지 더 나은 것이 아니라 가능과 불가능을 가르는 차이다. 2025년 모델은 물리적으로 그 입력을 담을 수 없기 때문이다.
옛 가중치에 얼마나 수명이 남았는지 구체적으로 따져보는 게 좋습니다. '레거시'라는 말로는 그것들을 제대로 설명하지 못하니까요. Qwen2.5-Omni-7B 저장소는 지난달 343,676회 다운로드를 기록했습니다 2026년 9월 18일에 확인했을 때, 그 위에 구축된 약 100개의 커뮤니티 Space와 수십 개의 파인튜닝, 어댑터, 양자화가 있었습니다. 플래그십이 무엇을 하든, 여전히 많은 사람들이 2025년 모델을 기반으로 작업하고 있습니다. 그리고 특히 Hugging Face는 이를 배포하는 추론 제공자를 목록에 올리지 않았는데, 이는 그러한 사용량의 거의 전부가 자체 호스팅된다는 뜻입니다.
새로운 모델이 기존 모델을 개선합니다
이번 출시에서 가장 기이하면서도 가장 설득력 있는 세부 사항은 자료의 거의 끝자락에 묻혀 있습니다. 알리바바가 모델이 모델을 최적화하는 것이라고 설명하는 실험에서 Qwen3.8-Omni-Flash의 쓰촨 방언 음성 인식을 자율적으로 개선했으며Qwen2.5-Omni-3B — 명목상 대체하는 모델의 작은 형제 모델입니다 — 문자 오류율을 25.79%에서 15.30%로 낮추었고12시간 이내에 네 차례에 걸쳐 3,413개의 훈련 샘플을 구축했습니다.
이는 이번 릴리스에 포함된 어떤 벤치마크보다 새 모델을 더 잘 뒷받침하는 논거이며, 두 모델 사이의 관계를 재정의합니다. 2026년 모델은 2025년 모델을 대체하는 것만이 아니라, 2025년 가중치를 더 낫게 만드는 도구입니다. Qwen2.5-Omni가 잘 처리하지 못하는 언어나 방언 때문에 이를 프로덕션에서 실행하고 있다면, 실용적인 방법은 워크로드를 이전하는 대신 배포를 유지하고 새 모델을 사용해 학습 데이터를 구축하는 것일 수 있습니다. 다만 이것은 공개된 방법론이 없는 공급업체 보고 시연이므로, 재현 가능한 레시피보다는 고무적인 일화로 취급해야 합니다.

마이그레이션하는 경우
결정은 좀처럼 하나의 모델로 귀결되지 않는다. 자체 호스팅 omni 모델을 떠나는 팀은 세 가지 형태 중에서 선택하게 된다: 오픈 가중치에 남아 계속 프로비저닝하거나, 벤더 API로 옮겨 통제권을 포기하거나, 워크로드를 분할해 백만 토큰 입력이 필요한 부분만 호스팅 모델로 보내는 것이다. 세 번째 선택지가 보통 옳고, 사람들이 건너뛰는 바로 그 선택지이기도 하다. 실제보다 더 많은 일처럼 들리기 때문이다 — 회의 요약 단계가 옮겨졌다고 해서 한 달을 들인 방언 파인튜닝을 버릴 필요는 없다.
라우팅이 도움이 되는 곳은 이음새입니다. OrcaRouter는 200개가 넘는 모델 전반에 걸쳐 하나의 키를 제공하며, 제공업체 정가 대비 0% 마크업과 자동 페일오버를 갖춥니다 엔드포인트가 저하되면, 이는 분할 파이프라인에서 호스팅되는 절반이 자체 계약과 자체 클라이언트 코드, 자체 모니터링을 갖출 필요가 없다는 뜻입니다. 해당 워크로드가 그 모든 것을 정당화하는지 알기도 전에 말이죠. 우리가 하지 않는 일을 분명히 하자면: 어느 omni 모델도 우리 카탈로그에 없습니다 — 둘 다 Alibaba의 플랫폼이나 여러분의 자체 하드웨어에서 실행됩니다 — 따라서 이는 우리를 통해서가 아니라 모델을 둘러싸고 내리는 라우팅 결정입니다.
누가 이동해야 하고, 누가 이동하지 말아야 하는가
워크로드가 장편 오디오나 비디오라면, 32K 컨텍스트 때문에 파이프라인 자체가 존재하지 못하는 상황이라면, 미디어에 대한 에이전트형 동작이 필요하다면, 또는 대규모 화자 분리가 바로 당신의 문제라면 이동하세요. 모델이 말하게 해야 한다면, 오디오가 당신의 인프라를 떠날 수 없다면, 이미 튜닝한 특정 Qwen2.5-Omni 가중치에 의존한다면, 또는 호출량이 적어 직접 보유한 GPU가 종량 과금보다 더 낫다면 그대로 머무르세요.
불편한 요약은 이것이 대체라기보다 제품 라인의 분기라는 점이다. 알리바바는 18개월 동안 가능한 한 최고의 입력 모델을 만드는 데 공을 들였고, 출력 쪽의 후속 모델은 만들지 않았다. 당신의 업무가 입력 쪽에 있다면, 이번 업그레이드는 거의 강제적이다. 출력 쪽에 있다면, 2025년 모델이 여전히 당신에게 필요한 일을 해내는 가장 최신 모델이다 — 그리고 그것은 당신이 의존하는 기능을 조용히 삭제하게 될 마이그레이션을 계획하기 전에 알아 둘 가치가 있다.
