
Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash: 하나는 영상을 보고, 다른 하나는 영상을 만든다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
짧은 답변: 이 둘은 대체재가 아니며, "omni"를 하나의 범주로 취급하기를 그만둬야만 이 비교가 의미를 갖습니다. Qwen3.8-Omni-Flash는 벤더가 2026년 9월 18일 API 고객에게 개방한 모델로, 텍스트·이미지·오디오·비디오를 입력받아 텍스트를 반환합니다. 한 시간 분량의 회의나 영상을 읽고 무슨 일이 있었는지 알려주는 모델입니다. Gemini Omni 1.1 Flash는 벤더가 2026년 8월 27일 출시한 모델로, 텍스트나 이미지 프롬프트를 받아 오디오가 동기화된 비디오를 반환합니다. 영상을 만드는 모델입니다. 하나는 미디어를 소비하고, 다른 하나는 미디어를 생산합니다. 파이프라인에 둘 다 필요하다면 둘 다 있어야 하며, 정직한 질문은 어느 쪽이 이기느냐가 아니라 당신에게 실제로 부족한 것이 어느 쪽이냐입니다.
두 모델 모두 오픈 웨이트가 아니고, 어느 쪽도 OrcaRouter를 통해 라우팅할 수 없으며, 둘 다 서로 환산할 수 없는 축을 기준으로 가격이 책정되어 있다 — 한쪽은 토큰, 다른 쪽은 생성된 비디오의 초. 두 모델이 진정으로 겹치는 부분은 "omni vs omni"라는 구도가 시사하는 것보다 좁으며, 그 겹치는 부분은 가격 계산에 앞서 짚고 넘어갈 가치가 있다. 가격 계산이야말로 이 둘이 가장 자주 잘못 비교되는 지점이기 때문이다.
먼저 바로잡을 가치가 있는 범주 오류
알리바바의 출시 자료는 Qwen3.8-Omni-Flash를 Gemini 3.8 Flash와 비교 대상으로 삼았으며, 이후 이어진 수많은 보도는 이를 "Gemini를 앞섰다"로 압축했다. 이는 Gemini Omni 1.1 Flash와는 다른 구글 모델이며, 둘은 서로 바꿔 쓸 수 있는 기준점이 아니다. Gemini 3.8 Flash는 범용 멀티모달 모델이고, Gemini Omni 1.1 Flash는 별도의 가격표와 별도의 API 표면을 가진 영상 생성 모델이다. 출시 당시 떠돌던 모든 Qwen 대 Gemini 수치 — WildClawBench-MM 71.0 대 58.9, SpotSoundBench 67.2 대 39.7, AgenticVBench 36.8 대 45.0 — 는 Omni 영상 모델이 아니라 Gemini 3.8 Flash를 상대로 한 것이며, 어느 경우든 그중 독립적인 수치는 없다. 이 글에 등장하는 두 모델을 같은 축에 놓은 점수판을 들고 여기 오셨다면, 오른쪽 열에 있는 것은 거의 확실히 잘못된 구글 모델이다.
각각이 실제로 하는 일
• 입력으로 받는 것 — Qwen3.8-Omni-Flash는 텍스트, 이미지, 오디오, 비디오를 받으며, 스테레오 및 4채널 공간 오디오도 포함합니다. Gemini Omni 1.1 Flash는 텍스트와 이미지 프롬프트에 더해 최대 3초의 참조 비디오를 받습니다.
• 반환하는 것 — Qwen3.8-Omni-Flash는 텍스트만 반환합니다; Gemini Omni 1.1 Flash는 네이티브로 동기화된 오디오가 포함된 비디오를 반환하며, 장면은 10초 단위로 40초까지 연장할 수 있습니다.
• 제어 표면 — Qwen3.8-Omni-Flash는 컨텍스트, 샘플링, 그리고 무엇을 볼지 스스로 결정하는 에이전틱 모드를 제공합니다; Gemini Omni 1.1 Flash는 첫 프레임 및 마지막 프레임 제어, 연속성을 위한 10초 룩백, 그리고 Google이 대략 3분의 1의 비용이며 약 60% 더 빠르다고 설명하는 360p 드래프팅 티어를 제공합니다.
• 해상도 및 마감 — Qwen3.8-Omni-Flash는 미디어를 생성하지 않으므로 출력 해상도가 없습니다; Gemini Omni 1.1 Flash는 720p, 1080p, 4K로 출력합니다.
• 컨텍스트와 지속 시간 — Qwen3.8-Omni-Flash는 단일 호출에서 100만 토큰과 최대 1시간의 연속 오디오-비디오를 처리합니다. Gemini Omni 1.1 Flash는 입력 창이 아니라 생성 중인 클립에 의해 제한됩니다.
• 지불 방식 — Qwen3.8-Omni-Flash는 토큰당 과금됩니다: 국제 요금표 기준 입력 100만 개당 $0.15, 캐시 $0.016, 출력 $0.47; Gemini Omni 1.1 Flash는 생성된 동영상 1초당 과금되며, Google이 공개한 요율은 720p 기준 초당 $0.10입니다.
• 개방성 — 양쪽 모두 비공개. 두 모델 모두 가중치가 없으며, 오늘날 어느 것도 우리 API를 통해 라우팅할 수 없습니다.

겹치는 부분은 비디오 이해이며, 이는 비대칭적이다.
구매자가 이 둘을 합리적으로 나란히 놓고 비교할 수 있는 유일한 지점은 영상을 이해하는 동시에 영상을 만들어 내야 하는 파이프라인입니다. 예컨대 긴 녹음본을 읽고 남겨둘 가치가 있는 순간을 찾아 컷을 생성하는 편집 어시스턴트 같은 것이죠. 이해 쪽에서는, Qwen3.8-Omni-Flash가 바로 이를 위해 설계되었습니다. 호출당 1시간의 연속 오디오와 비디오, 화자 분리, 그리고 벤더의 OmniVideoBench에서 정확도를 63.4에서 67.8로 높이면서 쿼리당 토큰을 145,736에서 79,117로 줄이는 에이전트 모드까지 갖추고 있습니다. 생성 쪽에서는, Gemini Omni 1.1 Flash가 동기화된 오디오와 함께 결과 클립을 생성할 수 있는 모델이며, Qwen의 모델은 비디오 프레임을 전혀 만들어내지 못합니다.
비대칭은 반대 방향으로도 작동하며, 이쪽이 놓치기 더 쉽습니다. 비디오 생성 모델의 이해력은 수단적인 성격입니다. 즉, 10초짜리 연장 구간에서도 샷의 일관성을 유지하려면 장면에 대한 충분한 이해가 필요하지만, 이는 회의 세 번째 시간에 무슨 말이 오갔는지에 답하는 것과는 다른 요구사항입니다. Google의 모델은 생성 품질에서 더 긴 실적을 갖고 있고 장문 분석에서는 더 짧은 실적을 갖고 있으며, Alibaba의 모델은 그 반대입니다. 여러분의 과제가 "이 녹음에서 중요한 3분을 찾아내는 것"이라면, 생성 모델은 그 도구가 아닙니다. 여러분의 과제가 "이 브리프에 맞는 30초 클립을 만들어내는 것"이라면, 이해 모델 역시 그 도구가 아닙니다.
가격 비교가 계속 잘못되는 이유
초당 요율과 토큰당 요율은 서로 환산되지 않으며, 이를 환산하려는 시도는 이 맞대결을 지배하는 두 가지 오류를 낳는다. 첫 번째는 생성된 클립 전체를 토큰당 입력 요율과 비교하고 비디오 모델이 수백 배 더 비싸다고 결론짓는 것이다 — 이는 사실이지만 무의미하다. 둘은 같은 것을 파는 게 아니기 때문이다. 두 번째는 입력 가격만 비교하고, Alibaba의 98% 오디오 인하가 입력 오디오 시간에 적용되는 반면 Google의 요율은 출력 비디오 초에 적용된다는 점을 놓치는 것이다. 따라서 두 "인하"는 같은 계량기 쪽에 있지도 않다.
솔직히 말할 수 있는 것은 이렇다. 알리바바 자체 방법론 — 2분 샘플에 30을 곱하고, 영상은 720p에 초당 1프레임 — 에 따르면, 1시간 분량의 결합 오디오 및 비디오를 Qwen3.8-Omni-Flash에 입력하는 비용은 약 $0.20로 책정되며, 이전 세대의 $3.27에서 내려간 것이다. 720p 영상 40초를 Gemini Omni 1.1 Flash로 생성하는 경우 Google이 공개한 초당 $0.10 기준으로 $4.00이 들고, 같은 40초를 360p로 초안 제작하면 Google의 3분의 1 비용 산정 기준으로 약 $1.20에 이른다. 두 수치 모두 공급업체가 보고한 것이며 어느 쪽도 독립적으로 재현되지 않았다. 유용한 결론은 어느 숫자가 더 작은가가 아니라, 1시간 분량의 영상을 분석하는 일과 그중 40초를 생성하는 일이 같은 자릿수에 있다는 것이다 — 이것이 바로 둘 모두를 수행하는 프로덕션 파이프라인에 승자가 아니라 비용 모델이 필요한 진짜 이유다.
이것이 또한 두 개의 계약이 아니라 하나의 키에 두 모델을 유지하는 근거이기도 합니다. 두 옴니 모델 중 어느 것도 현재 OrcaRouter를 통해 라우팅할 수 없습니다: Qwen3.8-Omni-Flash는 알리바바 자체 플랫폼에서만 구동되며, 구글은 옴니 비디오 API를 서드파티 라우팅에 개방하지 않았습니다. 그래서 저희는 어느 쪽도 호스팅하지 않으며, 그런 척하지도 않을 것입니다. 저희 카탈로그에서 실제로 서비스 중인 것은 각 제품군의 형제 모델 — Qwen3.8-Flash와 Gemini 3.8 Flash — 둘 다 현재 하나의 엔드포인트를 통해 공급자 정가에 0% 마크업으로 호출할 수 있으며, 이것이 어느 벤더의 자체 수치와 비교하는 A/B 테스트를 두 번째 통합이 아니라 설정 변경의 문제로 만들어 주는 이유입니다.

각 항목이 앞서는 부분을 명확히 정리
Qwen3.8-Omni-Flash는 입력이 몇 시간 단위로 측정되는 모든 항목에서 우위를 점한다: 회의 전사 및 화자 분리, 장시간 녹음 요약, 오디오 비중이 큰 에이전트형 도구 사용, 그리고 처리된 미디어 시간당 비용이 그렇다. 벤더가 보고한 오디오 결과는 강력하며, 이 모델의 약점은 애초에 겨냥하지 않았던 곳에 있다 — 추론 비중이 높은 리더보드로, 최초의 제3자 실행에서는 추론 부문 28백분위, 속도 수치는 21백분위에 놓였는데, 표본이 작아 이 수치들은 결론이라기보다 테스트해 보라는 신호로 받아들여야 한다.
Gemini Omni 1.1 Flash는 출력에서 앞선다: 동기화된 오디오와 함께하는 샷 생성, 확장된 장면 전반에 걸친 연속성, 프레임 수준 제어, 그리고 딜리버리 파이프라인이 단순히 요구할 수 있는 4K 마감이다. 그 장점은 벤치마크 점수가 아니라, 다른 모델이 그 작업을 아예 해낼 수 없다는 점이다. 이 모델이 더 약한 부분은 한 시간 분량의 컨텍스트를 유지해야 하는 모든 작업인데, 애초에 그렇게 만들어지지 않았기 때문이다.
결정, 그리고 주시해야 할 것
둘 중에서 선택해야 한다면, 문제는 파이프라인의 어느 절반이 아직 충족되지 않았는가입니다. 이미 영상을 생성하고 있고 긴 녹음 내용을 이해해야 하는 팀이라면 이번 주에 자체 오디오로 Qwen3.8-Omni-Flash를 테스트해 봐야 합니다. 미디어를 분석하고 또 제작해야 하는 팀이라면 Gemini Omni 1.1 Flash를 테스트해 봐야 합니다. 둘 다 필요한 팀은 두 개의 공급업체, 두 개의 청구 모델, 두 개의 통합을 상대해야 하는데, 바로 이런 상황에서 단일 라우팅 계층은 더 이상 편의 기능이 아니라 비용 모델을 읽기 쉽게 유지해 주는 핵심 요소가 되기 시작합니다.
이 평가를 바꿀 두 가지가 있습니다. Qwen3.8-Omni-Flash에 대한 독립적 평가가 있다면 위의 모든 벤더 수치를 비교 가능한 수치로 대체할 수 있을 것입니다 — 아직 그런 평가는 존재하지 않으며, 그 부재는 이 비교에서 가장 큰 단일 공백입니다. 또한 Google이 1080p 및 4K 출력에 대해 공개한 요금이 있다면 하이엔드 계산을 검증할 수 있게 해 줄 것입니다. 오늘날 그 수치들은 Google 자체의 목록이 아니라 시장 추정치로만 유통되고 있습니다.

프레이밍에 관한 마지막 한마디. "Omni"는 더 이상 정확한 의미를 갖지 않습니다 — 이제는 한 시간 분량의 회의 오디오를 읽는 모델과 소리가 있는 40초 클립을 렌더링하는 모델을 아우르며, 이 단어를 하나의 범주로 취급하는 순간 구매자는 토큰당 요금과 초당 요금을 비교해 거기서 결론을 끌어내게 됩니다. 두 모델은 좁은 중첩을 가진 상호 보완재이며, 각각 출시된 지 5일과 4주가 지난 시점에 둘 모두에 취해야 할 올바른 태도는 같습니다: 직접 보유한 자료로 측정하고, 두 번째 경로를 열어 두십시오.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
