Qwen3.8-Omni-Flash용으로 생성된 히어로 타이틀 카드로, '문 하나, 가중치 없음'이라는 문구와 '이 모델은 단일 호스트를 사용하고, 공개 가중치가 없으며, 첫 비벤더 점수는 빈약합니다'라는 부제, 그리고 네 개의 칩이 있습니다: '실행 환경: Alibaba 전용', '가중치: 미공개', '독립 평가 점수: 없음', '컨텍스트: 1M 토큰'. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Qwen3.8-Omni-Flash 출시 5일째: 하나의 문, 가중치 없음, 그리고 알리바바의 것이 아닌 첫 점수들

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

벤더가 Qwen3.8-Omni-Flash를 API 고객에게 개방한 지 닷새가 지났지만, 이 모델이 자리한 곳은 여전히 단 한 곳뿐이다. 이 모델은 벤더 자체의 Qianwen 플랫폼과 Bailian 클라우드 서비스에서 실행된다. 출시 이후 등장한 서드파티 목록들은 바로 그 동일한 엔드포인트들 앞에 놓인 프록시일 뿐, 모델이 존재하는 두 번째 장소가 아니다. 가중치는 공개되지 않았다. 출시 당일의 수치 — 오디오 1시간 비용 98% 절감, 평균 26% 향상, Qwen3.5-Omni-Plus 대비, 100만 토큰의 컨텍스트, 텍스트 전용 출력 — 는 여전히 벤더 자체의 것이며 재현되지 않았다. 지난 닷새 동안 실제로 바뀐 것은 모델이 아니라 그 주변의 지형이다: 서드파티 점수라는 얇은 층이 나타났고, 프레임워크 지원은 첫날부터 이뤄졌으며, 모두가 찾는 비교 대상은 Gemini 3.8 Flash이지 Qwen3.8-Flash가 아니다. 이 모델은 Qwen3.8-Flash와 함께 개발되었다. 이들 각각은 출시 보도가 다룬 것보다 더 면밀히 들여다볼 가치가 있다.

그 문은 좋은 문이며, 유일한 문이다.

가용성은 확대됐지만 복수화되지는 않았다. 이 모델은 OpenAI 형태의 요청에 변경 없이 응답하며, 이는 기존 클라이언트 코드가 대부분 작동한다는 뜻이다. 깨지는 것은 엔드포인트인데, 국제 호스트와 중국 본토 호스트가 별도 과금 체계를 가진 별도 서비스이기 때문이다. 기본값을 가리키는 코드는 실패하거나 잘못된 통화로 과금될 것이며, 시간당 가격 이야기는 국제 쪽에서만 성립한다. 오픈소스 클라이언트 라이브러리들은 이 모델을 출시 첫날부터 지원했는데, 이는 정말 유용하면서도 두 번째 공급자는 아니다. Bailian과 통신하는 라이브러리는 동일한 단일 공급원을 감싼 편의 래퍼일 뿐이다.

이것이 바로 이름 붙일 가치가 있는 구조적 위험입니다. 단일 소스 모델에는 페일오버 경로가 없습니다. 엔드포인트가 속도 제한을 걸거나 성능이 저하되거나 특정 리전이 다운되면 갈 곳이 없으며, 클라이언트 라이브러리 지원이 아무리 뛰어나도 이 사실은 달라지지 않습니다. 또한 이것이 우리가 그렇지 않은 듯 암시하는 대신 우리 입장을 분명히 밝히는 이유이기도 합니다: Qwen3.8-Omni-Flash는 우리 카탈로그에 없습니다. 우리는 이 모델을 호스팅하지 않으며, 이 모델을 라우팅할 수 있을 것이라 기대하고 가입한 독자는 오해하게 될 것입니다. 라우팅할 수 있는 것은 같은 패밀리의 나머지입니다 — Qwen3.8-FlashQwen3.8-Max는 둘 다 우리 API에서 라이브 상태입니다 — 그리고 OrcaRouter는 제공업체 정가를 0% 마크업으로 그대로 전달하므로, 알리바바의 omni 가격이 바뀌거나 omni 모델을 라우팅할 수 있게 되는 날이 오면, 그 변경 사항이 다음 계약 갱신 시점이 아니라 같은 날 고객에게 도달합니다.

A generated single-model spec card for Qwen3.8-Omni-Flash with six rows reading 'Released: 18 Sep 2026', 'Context: 1M tokens', 'Media per call: up to 1 hour', 'Output: text only', 'Price: $0.15 in / $0.47 out per M', 'Independent score: none yet', and the footer 'Vendor-reported; no independent evaluation exists.' The OrcaRouter logo is composited in the bottom-right corner.

Alibaba의 것이 아닌 첫 점수는 빈약하고, 결코 보기 좋지 않다.

Artificial Analysis에는 이 모델에 관한 내용이 존재하지 않으며, 그 부재가 5일 차에 정직한 헤드라인이다: 인접 모델들에 대해 모두가 인용하는 리더보드에는 아직 옴니 모델의 행이 없다. 그 공백은 다른 무언가로 채워졌다. 한 제3자 평가 플랫폼이 이 모델에 대한 실행 결과를 게시하기 시작했는데, 그 요약은 말하지 않는 바가 얼마나 많은지 때문에 정확히 읽을 가치가 있다. 이메일 분류 99.0% 정확도(86번째 백분위), 윤리 95.0%(23번째 백분위), 추론 56.0%를 보고하며, 이 추론을 28번째 백분위에 놓고 두드러진 약점이라고 부른다; 속도는 21번째 백분위, 비용은 58번째 백분위에 들고, 전체 성공률은 89%다.

그것들은 정말 조심스럽게 다뤄야 한다. 표본이 작기 때문만은 아니다. 같은 페이지는 모델 출시일을 Alibaba가 이를 내놓은 지 이틀 뒤인 9월 20일로 적어 놓고, 어떤 결과에도 실행 날짜를 제시하지 않으며, 표에 들어 있지 않은 숫자들을 설명하는 요약 아래에 빈 벤치마크 표를 렌더링한다. 이는 측정된 평가라기보다 초기이고 감독이 거의 없던 하네스의 특징이며, 솔직히 해석하자면 이것들은 첫 신뢰할 만한 데이터 포인트라기보다 벤더가 아닌 쪽에서 나온 첫 데이터 포인트다. 이것들은 모델을 직접 테스트해 볼 이유이지, 무언가를 단정할 이유는 아니다. 다만 방향성은 벤더 자체 자료가 생략을 통해 암시하는 바와 일치한다. 이것은 인식 및 롱미디어 모델이며, 추론 비중이 높은 보드는 이것이 겨냥한 곳이 아니다.

검색 결과에는 앞으로 몇 주 동안 사람들을 걸리게 할 함정도 하나 있습니다. Qwen 3.8은 텍스트 모델로, Artificial Analysis Intelligence Index가 40대인데, 이 수치가 마치 옴니 모델을 설명하는 것처럼 여러 요약에서 인용되었습니다. 그렇지 않습니다. 두 모델은 하는 일이 다른 별개의 모델이며, 옴니 모델은 아직 지수가 전혀 없습니다.

A headless screenshot of Alibaba's own Qwen site (qwen.ai) showing the Qwen3.8-Omni-Flash 'Conducting Deep Research with Audio and Video' demo page, with the model workflow panel, the timeline of a 40-minute video, and the English UI navigation.

벤치마크 표는 여전히 한 업체가 자기 자신과 비교하는 것에 불과하다

출시 수치 — 약 30개 평가에 걸친 평균 26% 이상의 개선 — 는 전적으로 Qwen3.5-Omni-Plus를 기준으로 측정된다. 이는 이 제품군이 진전했다는 사실을 알려주지만, 이미 비용을 지불하고 있을 만한 무엇과 이 모델이 어디에 위치하는지는 알려주지 않으며, 그와 함께 유포된 선별적 비교들도 그 격차를 메우지 못한다. 벤더가 보고한 Gemini 3.8 Flash 대비 결과는 오디오 부문에서는 진정한 승리이고, 에이전트형 비디오 작업을 측정하는 부문에서는 패배다: 한쪽에서는 WildClawBench-MM 71.0 대 58.9, SpotSoundBench 67.2 대 39.7이고, 다른 쪽에서는 AgenticVBench 36.8 대 45.0, OmniGAIA 74.0 대 78.6이다. Alibaba 자체 요약 표현은 — 오디오-비디오 성능이 Gemini에 "근접"하고, 전체 오디오 성능은 이를 능가한다 — 그것이 만들어낸 헤드라인보다 더 신중하며, 신중한 버전이 정확한 버전이다.

• 컨텍스트 — 1M 토큰, 최대 입력 약 991K(사고 모드에서는 약 983K) 및 최대 출력 131K.

• 모달리티 — 텍스트, 이미지, 오디오, 비디오 입력; 텍스트 출력만 가능. 기본 모델에서는 음성 생성이 없습니다.

• 지속 시간 — 통화당 최대 1시간의 연속 오디오 또는 오디오·비디오로, 이를 통해 청킹 없이 회의 및 장시간 미디어 작업이 가능합니다.

• 언어 지원 범위 — 출시 자료에서는 74개 언어와 39개 중국어 방언에 걸친 인식을 제공하며, 다른 곳에서는 오디오 입력에 대해 더 넓은 수치(113개 언어 및 방언)를 제시합니다.

• 입력 세부 사항 — 스테레오 및 4채널 공간 오디오를 지원하며, Realtime 변형은 소리로 목표물을 찾아낼 수 있는 최초의 옴니모달 모델로 설명됩니다.

• 가격 — 국제 기준 입력 토큰 100만 개당 $0.15, 캐시된 경우 $0.016, 출력 $0.47이며, 본토 가격표는 별도로 제공되어 비교할 수 없습니다.

98%는 사실이며, 그것은 당신의 청구서가 아닙니다

Alibaba 자체 방법론에 따르면 — 2분 샘플에 30을 곱하고, 비디오는 720p로 초당 1프레임으로 샘플링 — 오디오 입력 1시간은 $0.28에서 $0.01 미만으로, 오디오와 비디오를 합친 1시간은 $3.27에서 $0.20으로 떨어진다. 이는 공급업체가 보고한 크고 구체적인 절감이며, 하나의 세부 항목에서의 절감이다. 중요한 산술은 그 세부 항목이 워크로드에서 차지하는 비중이다. 대부분의 토큰을 출력, 캐시된 컨텍스트, 또는 초당 1프레임보다 더 조밀하게 샘플링된 비디오 프레임에 쓰는 파이프라인은 청구서에서 헤드라인이 약속하는 것보다 훨씬 작은 비율 변화를 보게 될 것이며, 그 헤드라인은 총액이 아니라 입력 오디오에 관한 것이다. 텍스트 전용 출력을 더하면 격차는 다시 벌어진다: 응답을 말해야 하는 것은 무엇이든 두 번째 모델이 필요하고, 그 모델은 별도로 청구된다.

바로 이 부분에서 라우팅이 제값을 합니다. 패스스루 라우터의 가치는 할인이 아니라, 공급업체 자체의 가격표가 곧 여러분이 지불하는 가격이라는 점, 그리고 워크로드를 여러 모델에 분산할 수 있어 단일 소스 모델이 의존 대상이 아니라 구성 요소가 된다는 점입니다. 여러분이 호출할 수 있는 유일한 대상인 옴니 모델은 가용성 계층과 가격 책정 계층 모두에서 단일 장애점입니다.

A headless screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, showing the model grid and the 'one API key, one bill' framing over the English-language site navigation.

5일간의 프로덕션이 실제로 알려줄 수 있는 것

세 가지가 미해결 질문들을 해결해 줄 것이다. AliMeeting 화자 분리 결과에 대한 독립적 측정, 즉 오류율이 88.11에서 3.35로, cpWER이 89.61에서 17.18로 떨어졌다는 결과는 그것이 모델 덕분인지, 아니면 그 주변에 감싸진 화자 분리 및 프런트엔드 엔지니어링 덕분인지 보여줄 것이다. 적어도 하나의 중국 기술 분석은 개선의 대부분을 그 부분에 돌리고 있다. 에이전트 모드의 토큰 감소에 대한 재현 테스트, 즉 OmniVideoBench에서 정확도가 63.4에서 67.8로 오르는 동안 질의당 토큰이 145,736에서 79,117로 줄어든 사례는 이번 릴리스에서 가장 유용한 단일 주장, 즉 모델이 동시에 더 좋아지고 더 저렴해질 수 있다는 주장을 확인해 줄 것이다. 그리고 Artificial Analysis나 arena 순위표 항목은 위의 모든 공급업체 수치를 비교 가능한 것으로 만들어 줄 것이다. 이는 모델이 시험되는 것을 넘어 선택되기 위한 전제 조건이다.

그때까지 합리적인 태도는 호스트가 하나뿐이고 독립적인 평가가 없는, 출시된 지 닷새 된 모델에 적용되는 태도와 같습니다. 즉, 자체 오디오와 비디오로 측정해 볼 가치는 있지만, 파이프라인을 통과하는 유일한 경로로 삼을 가치는 없습니다. 워크로드가 중국어나 영어의 장시간 회의 또는 미디어 분석이고, 비용이 출력 토큰보다 입력 시간에 의해 좌우된다면, 여기의 경제성은 이번 주에 테스트를 정당화할 만큼 충분히 강력합니다. 워크로드가 음성 출력을 필요로 하거나, 제공자가 성능이 저하될 때 대체 수단이 필요하다면, 오늘날의 이 모델만으로는 전체 답이 될 수 없으며, 아무리 많은 출시 첫날 프레임워크 지원도 그것을 바꾸지 못합니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트