
Qwen3.8-Omni-Flash vs InternLumina U2: 임대된 감각 vs 소유한 가중치
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
를 비교하는 유용한 방법은Qwen3.8-Omni-Flash와 InternLumina U2 벤치마크 표의 행을 기준으로 하는 것이 아닙니다. 두 모델이 같은 표에 나오지 않기 때문입니다. 대신 누가 이들을 실행할 수 있는지를 묻는 것입니다. 벤더의 Qwen3.8-Omni-Flash는 2026년 9월 18일부터 API 고객에게 개방된, 벤더 자체 플랫폼에서 제공되는 폐쇄형 모델입니다: 100만 토큰의 컨텍스트, 호출당 최대 1시간의 연속 오디오와 비디오, 텍스트 전용 출력, 그리고 가중치 없음. Shanghai AI Laboratory의 InternLumina U2는 Apache 2.0 라이선스의 16B-A1B 전문가 혼합(MoE) 확산 모델로, Ascend 체크포인트는 지금 Hugging Face에서 내려받을 수 있으며 NVIDIA 체크포인트와 기술 보고서는 아직 공개 예정으로 표시되어 있습니다. 하나는 토큰 단위로 임대하는 서비스이고, 다른 하나는 현재 어떤 하드웨어에서 실행되는지에 대한 단서가 붙어 있는, 직접 보유할 수 있는 파일입니다. 이러한 차이가 어느 벤더의 표에 있는 어떤 점수보다도 더 많은 실제 배포를 좌우합니다.
InternLumina U2는 실제로 무엇인가
흥미로운 부분은 아키텍처인데, 이건 진짜로 색다르다. InternLumina U2는 총 160억 개의 파라미터와 10억 개의 활성 파라미터를 지닌 희소 MoE이며, 자기회귀 모델이 아니라 확산 언어 모델이다 — 토큰을 왼쪽에서 오른쪽으로 내보내는 대신 전체 시퀀스를 병렬로 정제한다. 시각적 표현은 완전히 이산적이다. Apple의 AToken을 기반으로 구축된 8개의 시각 토큰 코드북이 있으며, 이 덕분에 하나의 모델이 별도의 디코더를 끝에 덧붙이지 않고도 이미지를 읽고 생성할 수 있다. 텍스트 질의응답, 텍스트-이미지 생성, 이미지 이해, 이미지 편집, 비디오 이해, 3D 이해는 모두 같은 모델이 같은 어휘 위에서 같은 종류의 작업을 수행하는 것이다.
• 크기와 형태 — InternLumina U2는 총 16B, 활성 1B의 희소 MoE입니다; Qwen3.8-Omni-Flash의 파라미터 수는 공개되지 않았습니다.
• 생성 — InternLumina U2는 이미지를 생성하고 편집하며 3D 이해를 처리합니다; Qwen3.8-Omni-Flash는 미디어를 전혀 생성하지 않고 텍스트를 반환합니다.
• 디코딩 — InternLumina U2는 병렬로 디코딩하는 확산 LLM이고, Qwen3.8-Omni-Flash는 자기회귀 방식입니다.
• 맥락 및 지속 시간 — Qwen3.8-Omni-Flash는 단일 호출에서 1M 토큰 창과 최대 1시간의 연속 오디오-비디오를 지원합니다. InternLumina U2의 공개 자료에는 그중 어느 것도 설명되어 있지 않으며, 장시간 오디오는 나열된 기능에 포함되지 않습니다.
• 가중치 — InternLumina U2는 Apache 2.0이며 Ascend 체크포인트는 공개되었고 NVIDIA 체크포인트는 보류 중입니다. Qwen3.8-Omni-Flash는 가중치가 없으며 이에 대한 계획도 발표되지 않았습니다.
• 얻는 방법 — InternLumina U2는 Hugging Face에서 다운로드하며 GitHub에 추론 코드가 있고, Qwen3.8-Omni-Flash는 Alibaba Cloud Model Studio 또는 Qianwen 플랫폼에 대한 API 호출입니다.
• 독립적인 점수 — 어느 쪽에도 없음. InternLumina U2의 자체 카드는 자사의 벤치마크 표를 "예비적, 부분적 결과"라고 표시하며; Qwen의 점수는 모두 자체 이전 모델과의 비교이며 재현되지 않았다.

가중치 문제는 프리뷰 보도 이후 달라졌다
이전에 우리가 InternLumina U2에 관해, 코드가 처음 등장했을 당시에 쓴 글을 읽어 보셨다면, 상황은 한 방향으로는 바뀌었고 다른 방향으로는 그대로이며, 두 측면 모두 중요합니다. Hugging Face 리포지토리는 더 이상 스텁이 아닙니다: ascend/ 폴더에는 이제 7개의 safetensors 샤드와 구성 파일, 토크나이저 및 모델링 코드가 들어 있어, 적절한 하드웨어를 갖춘 사람이라면 누구나 이 모델을 실제로 다운로드해 실행할 수 있다는 뜻입니다. nvidia/ 폴더는 여전히 출시 예정으로 표시되어 있고, 기술 보고서도 아직 공개되지 않았으며, 리포지토리 자체의 벤치마크 섹션에는 여전히 "예비적, 부분적 결과"라고 적혀 있습니다. 따라서 오늘날 정확한 진술은 "가중치가 나왔다"거나 "가중치가 없다"가 아니라, 한 하드웨어 스택의 체크포인트는 공개되었고 다른 하나는 그렇지 않다는 것입니다. 이는 클러스터가 NVIDIA인 사람에게는 실질적인 제약입니다.
조용히 움직인 두 가지 다른 일도 있다. GitHub 저장소는 최초의 9월 1일 공개 이후에도 한참 동안 커밋이 계속 들어오고 있어, 공개된 코드가 방치된 것이 아니라 유지보수되고 있음을 보여준다. 그리고 Hugging Face 저장소의 다운로드 카운터는 여전히 0을 가리키는데, 이는 모델 자체보다 대상 사용자층에 대해 더 많은 것을 말해준다. Ascend 우선 체크포인트를 갖춘 16B-A1B 확산 모델은 이번 분기에 호스팅된 엔드포인트를 찾는 제품 팀이 아니라 연구소를 겨냥한 것이다.
두 가지가 실제로 겹치는 곳과 그렇지 않은 곳
이미지 이해는 두 모델이 겹치는 부분이며, 보기보다 좁습니다. 두 모델 모두 그림을 보고 그에 관한 질문에 답할 수 있는데, 이는 Qwen3.8-Omni-Flash에게는 전체 작업이고 InternLumina U2에게는 여섯 가지 작업 중 하나입니다. 그 이후의 모든 것은 크게 갈라집니다. InternLumina U2는 그런 다음 같은 모델 안에서, 해당 이미지를 읽는 데 사용한 것과 동일한 시각 어휘를 사용해 그 이미지를 편집하거나 프롬프트로부터 새 이미지를 생성할 수 있습니다. Qwen3.8-Omni-Flash는 픽셀 하나도 생성할 수 없지만, 한 번의 호출로 한 시간 분량의 오디오와 비디오를 받아들이고 누가 언제 말했으며 무엇이 결정되었는지 알려줍니다 — 이는 InternLumina U2의 공개 자료가 전혀 그렇게 한다고 주장하지 않는 일입니다.
사람들이 생각하는 것보다 덜 중요한 겹치는 부분은 비디오입니다. 둘 다 비디오를 다룬다고 설명되지만, 비디오를 두고 하는 일은 서로 다릅니다: 하나는 긴 녹화물을 문서로 이해하는 것이고, 다른 하나는 비디오를 3D와 나란히 하나의 시각적 양식으로 다루는 것입니다. 한 시간 분량의 영상을 요약해야 하는 팀에게 두 번째는 도움이 되지 않고, 프레임을 생성해야 하는 팀에게 첫 번째는 도움이 되지 않습니다.

비용, 통제, 그리고 실제로 무엇을 구매하는지
가격 비교는 애초에 같은 종류의 비교가 아닙니다. Qwen3.8-Omni-Flash는 토큰당 과금합니다. 국제 가격표 기준으로 입력 100만 토큰당 $0.15, 캐시 $0.016, 출력 $0.47이며, 비교 대상이 될 수 없는 별도의 중국 본토 가격표도 있습니다. 그리고 출시 당시의 헤드라인은 오디오 입력 1시간 비용을 98% 이상 절감했다는 벤더 자체 보고 수치였는데, 이는 2분짜리 샘플의 가격을 매긴 뒤 30을 곱해 계산한 것이며 영상은 720p, 초당 1프레임으로 샘플링한 것이었습니다. InternLumina U2는 아무것도 과금하지 않습니다. 과금할 것이 없기 때문입니다. 비용은 여러분의 하드웨어와 시간이며, 이 모델의 자체 카드에는 그것을 토큰당 수치로 환산할 수 있게 해 주는 처리량 수치가 공개되어 있지 않습니다.
그것이 이 트레이드오프를 한 줄로 요약한 것입니다. API는 직접 호스팅할 수 없는 기능과 사용량에 따라 확장되는 시간당 비용을 제공합니다. 반면 오픈 웨이트는 고정 비용과 데이터 경로에 대한 완전한 통제를 제공하는 대신, 직접 구축해야 하는 추론 스택과 현재로서는 Ascend 하드웨어를 의미하는 체크포인트 세트라는 대가를 치러야 합니다. 미디어가 건물 밖으로 나갈 수 없는 규제 대상 워크로드의 경우, 두 번째는 선호가 아니라 이 페이지에서 유일한 선택지입니다. 이번 달에 장시간 오디오 분석이 필요한 팀에게는 첫 번째가 이 페이지에서 유일한 선택지입니다.
OrcaRouter는 현재 두 모델 중 어느 것도 호스팅하지 않으며, 존재하지 않는 라우팅 경로를 암시하기보다는 이를 솔직히 밝히는 편을 택합니다: Qwen3.8-Omni-Flash는 알리바바 자체 플랫폼에서만 실행되며, InternLumina U2는 엔드포인트가 아니라 다운로드 파일입니다. 저희가 실제로 운영하는 것은 Qwen3.8 라인의 나머지 모델 — Qwen3.8-Flash와 Qwen3.8-Max — 하나의 API를 통해 제공업체 정가에 0% 마크업으로 제공하는 것입니다. 이는 오픈 웨이트 진영이 아직 NVIDIA 체크포인트를 정리하는 동안, 이 비교의 클로즈드 모델 진영에 대한 작동하는 기준선을 유지하는 실용적인 방법입니다.

실제로 어떤 것을 선택해야 할까요
다음 조건에 해당한다면 InternLumina U2를 선택하세요 — 이미지를 읽고, 생성하고, 편집하는 하나의 모델이 필요하고, 추론 스택을 직접 감당할 의향이 있으며, 가속기가 Ascend이거나 NVIDIA 체크포인트를 기다릴 수 있는 경우입니다. 두 모델 중 이미지를 생성할 수 있는 유일한 모델이며, 데이터를 벤더에 보내지 않고 실행할 수 있는 유일한 모델입니다. 기술 보고서가 공개될 때까지는 이 모델의 벤치마크 수치를 검증되지 않은 것으로 취급하세요. 모델 카드에 정확히 그렇게 적혀 있기 때문입니다.
를 선택하세요Qwen3.8-Omni-Flash — 당신의 문제가 픽셀 출력이 아니라 몇 시간 분량의 오디오와 비디오라면 — 회의 인텔리전스, 장시간 녹음 분석, 중국어와 영어로 하는 오디오 중심 에이전트 작업 — 그리고 단일 소스 의존성과 텍스트 전용 출력을 받아들일 수 있다면. 비용 측면에서는 입력 오디오 시간 기준으로는 강하지만 총 청구서 기준으로는 훨씬 약하고, 벤치마크는 벤더가 보고한 것이며 재현되지 않았습니다. 그리고 처음 등장한 제3자 실행 결과는 추론에서 28번째 백분위수에 놓았는데, 표본이 너무 작아 결정보다는 테스트를 촉구해야 합니다.
둘 다 필요하다면, 이들은 대안이 아니라 상호 보완재입니다. 직접 호스팅하는 오픈 웨이트 이미지 모델과 호출해서 쓰는 클로즈드 롱미디어 모델이죠. 현재로서는 둘 다 우리를 통해 라우팅할 수 없습니다. 한쪽에서 주목할 것은 NVIDIA 체크포인트와 기술 보고서이고, 다른 쪽에서 주목할 것은 첫 번째 독립 평가인데, 이는 아직 존재하지 않으며 지금까지 Qwen3.8-Omni-Flash에 대해 쓰인 모든 글에서 가장 큰 단일 공백입니다.
