InternLumina-U2와 Gemini Omni 1.1 Flash의 비교를 위한 히어로 타이틀 카드로, 부제는 '아직 실행할 수 없는 모델 vs 초당 비용을 지불하는 모델'이고, 세 개의 스탯 칩 — 'InternLumina-U2: 코드만 공개, 가중치는 곧 공개 예정', 'Gemini Omni 1.1 Flash: 2026년 8월 27일 GA', '동영상 초당 $0.03–$0.30' — 그리고 오른쪽 하단에 OrcaRouter 로고가 있다.
Guides & Insights

InternLumina-U2 vs Gemini Omni 1.1 Flash: 아직 실행할 수 없는 모델 vs 초 단위로 비용을 지불하는 모델

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

마감이 이번 주라면, 이 비교는 한 문장으로 답이 나온다. Gemini Omni 1.1 Flash는 Google이 일반에 공개한 비디오 생성 모델이다. API로 호출하면 오디오가 동기화된 클립을 반환하고, 출력 초 단위로 비용을 지불한다. InternLumina-U2는 Shanghai AI Laboratory가 조용히 공개한 Apache-2.0 연구 모델이다. 추론 코드는 내려받을 수 있지만 가중치는 아직 받을 수 없으며, 연구소는 이를 여전히 "coming soon"으로 표시한다. 하나는 지금 바로 구매할 수 있는 제품이고, 다른 하나는 실제로 실행조차 할 수 없는 논문 형태의 베팅이다. 흥미로운 질문은 애초에 왜 이 둘을 같은 문장에 넣는지, 그리고 2026년 후반 오픈 멀티모달 작업이 어디로 향하고 있는지 각각이 무엇을 말해주는가 하는 점이다.

아래의 모든 내용은 출처별로 표시되어 있습니다. InternLumina-U2의 세부 사항은 연구실이 2026년 9월 1일에 공개한 GitHub 저장소와 프로젝트 페이지에서 가져온 것입니다. 이는 빈 Hugging Face 스텁이 나타난 날과 같은 날이며, 해당 모델의 모든 벤치마크 수치는 공급업체가 보고한 예비 수치로, 아직 재현되지 않았습니다. Gemini Omni 1.1 Flash의 세부 사항은 2026년 8월 27일에 일반 공개된 모델에 대한 Google 자체 출시 자료와 가격 페이지에서 가져온 것입니다.

동일한 "멀티모달" 질문에 대한 두 가지 답변

두 모델 모두 "하나의 모델, 다양한 양식"이라는 느슨한 기치 아래 있으며, 그 공유된 꼬리표 때문에만 서로 비교됩니다. 그 아래에서는 거의 공통점이 없습니다. Gemini Omni 1.1 Flash는 폐쇄형 호스팅 비디오 우선 생성 서비스입니다. 텍스트, 이미지, 짧은 참조 클립 또는 오디오를 입력하면 음성, 음악, 음향 효과가 포함된 최대 10초 분량의 720p 비디오를 생성하며, 10초 단위로 확장하여 40초 장면까지 만들 수 있습니다. 이 서비스는 이미 보유한 클립을 이해합니다. 확장 패스는 이전과 달리 이제 최대 10초의 이전 컨텍스트를 검토하며, 첫 번째/마지막 프레임 제어를 지원하여 샷의 시작과 끝을 고정하고 모델이 중간을 채우게 할 수 있습니다. 이는 움직이는 영상을 만드는 도구로, 초 단위로 판매됩니다.

InternLumina-U2는 반대 방향의 도전입니다. 총 16B 파라미터 중 1B만 활성화되는 단일 희소 혼합 전문가(sparse mixture-of-experts) 모델로, 이미지, 비디오, 3D 자산을 이해하고 하나의 공유된 이산 토큰 인터페이스를 통해 이미지를 생성하고 편집할 수 있다고 주장합니다. 시각적 측면은 완전히 이산적입니다. 연구소가 AToken이라고 부르는 토크나이저에서 나온 8개의 상호 보완적 코드북을 사용하여, 각 시각적 위치가 하나가 아닌 여덟 개의 코드로 표현됩니다. 언어적 측면은 연구소가 LLaDA-2.0에서 확장한 확산(diffusion) 백본입니다. 핵심 주장은 이해와 생성이 전문 모델들을 이어 붙이는 대신 단일 가중치 집합에서 서로를 강화해야 한다는 것입니다. 그것이 실제로 작동하는지는 현재 답할 수 없습니다. 모델이 어디에서도 실행할 수 없고, 가중치가 공개적으로 존재하지 않기 때문입니다.

변변찮은 스코어보드

이 두 항목을 비교하는 정직한 점수판은 모든 행에 출처를 명시해야 한다. 한쪽 열은 공개된 가격이 있는 출시 제품이고, 다른쪽 열은 가격이 전혀 없는 미공개 연구 주장이기 때문이다.

• 개요 — Gemini Omni 1.1 Flash: 호스팅형 비디오 생성 및 편집 모델(모델 ID gemini-omni-1.1-flash), 2026년 8월 27일 GA(일반 공급). InternLumina-U2: 옴니 비주얼 이해, 이미지 생성·편집을 위한 오픈 사이언스 디퓨전 LLM, 코드는 2026년 9월 1일 공개.

• 가중치 — Gemini Omni 1.1 Flash: 없음, 비공개 및 호스팅 전용. InternLumina-U2: 아직 없음. 단, Apache-2.0 라이선스이며 "곧 제공 예정"으로 명시되어 있음.

• 얻을 수 있는 출력 — Gemini Omni 1.1 Flash: 오디오가 포함된 10초 720p 클립, 40초까지 확장 가능; 1080p 및 4K 업스케일; 텍스트도 함께 제공. InternLumina-U2: 아직 없음 — 추론 코드와 로드맵만.

• 입력 가능한 것 — Gemini Omni 1.1 Flash: 텍스트, 이미지, 비디오(프롬프트당 최대 ~131K 입력 토큰, 10초 클립 3개), 오디오. InternLumina-U2: 텍스트, 자연 이미지, 고밀도 차트, 64개 이상의 샘플링된 프레임으로 구성된 비디오, 그리고 64개의 컬러 및 깊이 뷰로 렌더링된 GLB/GLTF 3D 자산을 지원한다고 주장합니다.

• 실행 방법 — Gemini Omni 1.1 Flash: Google의 상태 저장형 Interactions API를 통한 Gemini API; 일반 사용자는 AI Plus, Pro, Ultra 구독자를 위한 Google Flow를 통해 접근할 수 있습니다. InternLumina-U2: 셀프 호스트 전용이며, 가중치가 공개된 이후에만 사용할 수 있습니다. 코드는 분할된 체크포인트 디렉터리, AToken 토크나이저 가중치, FlashAttention, 그리고 3D 경로용 Blender 4.5를 필요로 합니다.

• 비용 — Gemini Omni 1.1 Flash: 360p 초안 기준 초당 $0.03, 720p 기준 초당 $0.10, 1080p 기준 초당 $0.15, 4K 기준 초당 $0.30, 토큰 요율은 입력 100만 개당 $1.50, 텍스트 출력 100만 개당 $9.00입니다. InternLumina-U2: 출시되면 자체 GPU 비용만큼 듭니다.

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

두 열(column)은 같은 축을 측정하지 않습니다. Gemini 쪽은 가격이 책정되고 제공되며 즉시 유용한 반면, InternLumina 쪽은 아직 모델이 아닌 모델에 대한 명세(specification)입니다.

실제로 현재인 부분: Gemini Omni 1.1 Flash의 GA

Gemini Omni 1.1 Flash는 이번 주 그 자체로 중요합니다. Google의 옴니 비디오 라인이 더 이상 프리뷰가 아니게 된 순간이기 때문입니다. 기존 Gemini Omni Flash 프리뷰 엔드포인트는 2026년 9월 30일에 종료될 예정이며, 개발자들이 이전하게 될 대체 모델이 바로 이 GA 모델입니다. 업그레이드 목록은 구체적입니다. 10초 단위로 이어 붙여 만드는 40초 장면 확장, 첫 프레임과 마지막 프레임을 지정하면 모델이 그 사이의 영상을 생성하는 키프레임 제어, 캐릭터나 설정을 일관되게 유지하기 위한 최대 3초의 참조 클립, 그리고 720p의 3분의 1 가격으로 제공되고 비싼 최종 렌더링 전에 프롬프트를 반복 실험할 수 있도록 최대 60% 더 빠르게 동작하는 360p 초안 티어가 그것입니다. 비디오 파이프라인을 구축하는 사람이라면 가격표 — 720p 1초에 $0.10, 10초 클립에 $1.01, 4번의 확장 호출로 구성된 40초 720p 장면에 약 $4 — 가 비용 모델을 바꾸는 숫자입니다.

그 어떤 것도 실제 운용 측면에서 이것을 InternLumina-U2의 경쟁자로 만들지 않는다. Gemini Omni 1.1 Flash는 모션을 생성한다. 반면 InternLumina-U2는, 그 주장이 실제 가중치와 맞닥뜨려도 살아남는다면, 모션을 이해하고 정지 이미지를 생성할 것이다. 이번 분기에 제품 비디오가 필요한 팀은 둘 사이에서 선택하는 것이 아니다. — Gemini 모델은 둘 중 실제로 호출할 수 있는 유일한 모델이며, Google 자체 API와 여러 타사 플랫폼을 통해 이용할 수 있다.

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

Google AI 개발자 사이트의 Gemini API "Models" 문서, 2026년 9월 2일 캡처 — 현재 Gemini 제품군을 나열하는 페이지로, 사이드바 내비게이션에 Gemini Omni 라인이 포함되어 있습니다.

전혀 최신이 아닌 부분: InternLumina-U2

InternLumina-U2의 9월 1일 릴리스는 가장 조용한 종류였습니다. GitHub 저장소에 커밋 세 개, 프로젝트 페이지 하나, 전체 내용이 Apache-2.0 라이선스 헤더뿐인 28바이트 Hugging Face 스텁, 그리고 발표는 없었습니다. 실제로 공개된 것은 추론 하네스와 아키텍처이며, 모델 자체를 테스트할 수 있었던 사람이 아무도 없기 때문에 이는 신중히 읽을 가치가 있습니다. 저장소에는 작업별 진입점이 하나씩 있는 드라이버가 포함되어 있습니다 — 텍스트, 최대 1024×1024의 텍스트-이미지 생성, 자연 이미지와 조밀한 차트에 대한 이미지 이해, 선택적 이중 CFG 모드를 갖춘 지시 기반 이미지 편집, 64개 샘플 프레임에 대한 비디오 이해, Blender로 렌더링된 GLB/GLTF 뷰에 대한 3D 이해입니다. 이 설계의 핵심 가정은 다중 코드북 이산 시각 어휘(multi-codebook discrete visual vocabulary)가 시퀀스 길이를 늘리지 않고도 하나의 백본이 이 모든 작업을 수행하게 해준다는 것입니다. 이는 코덱 기반 비디오 모델을 추동하는 "시각 토큰은 더 많은 정보를 담아야 한다"는 직관을 통합된 이해·생성 인터페이스에 적용한 것입니다.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

2026년 9월 2일에 캡처된 InternLM/InternLumina-U2 GitHub 저장소 — Apache-2.0 저장소 랜딩 페이지에는 "Multi-Codebook Diffusion Large Language Model" 설명, 세 개의 커밋, 그리고 지금까지 공개된 전체 릴리스인 작업별 추론 스크립트가 있습니다.

프로젝트 페이지의 벤치마크 표는 해당 연구소 스스로 "예비적, 부분적 결과"라고 표시해 두었으며, 거기 있는 수치는 양날의 검이다. 강력한 차트 및 문서 수치(ChartQA 86.52, CharXiv-DQ 83.65, 공급업체 보고) 옆에는 GenEval 0.81이 있는데, 이는 연구소가 능가한다고 주장하는 적어도 하나의 모델의 0.89에 뒤처지는 수치다. 독립적인 평가는 없다. 평가할 모델이 없기 때문이다. 실제 품질에 관한 모든 것은 그 빈 Hugging Face 스텁에 safetensors 파일이 나타날 때까지 주장에 불과하다.

한쪽만 존재할 때 라우팅 계층이 하는 일

이 비교에서 라우팅의 관점은 사실 선택이 아니라 시간에 관한 것입니다. OrcaRouter가 InternLumina-U2를 서비스한다고 가장하지는 않겠습니다. 아무도 그럴 수 없습니다. 가중치가 아직 공개되지 않았기 때문입니다. Gemini Omni 1.1 Flash 역시 저희 카탈로그에 없습니다. 이 모델은 Google 자체 API를 통해서만 이용할 수 있습니다. 이러한 공백에서 라우팅 레이어가 진짜로 하는 일은 파이프라인을 두 번 다시 구축하지 않고도 선택지를 열어 두는 것입니다. 그 메커니즘은 패스스루(pass-through) 모델입니다. 호스팅된 벤더 모델이 카탈로그에 실제로 등록되면 공급업체 정가가 0% 마크업으로 그대로 통과됩니다. 따라서 벤더가 게시한 초당 요금이 곧 하나의 키로 지불하는 초당 요금이 되며, 공급업체별 계약은 필요하지 않습니다. 그리고 InternLumina-U2 같은 Apache-2.0 가중치 공개가 마침내 이뤄졌을 때, 합리적인 대응은 작동 중인 비디오 스택을 뜯어내는 것이 아니라 자동 장애 조치(failover) 뒤의 테스트 경로에 새 모델을 세워 두는 것입니다. 그래야 검증되지 않은 확산 모델이 처음으로 오작동해도 코드 변경 없이 이미 신뢰하는 모델로 호출이 폴백(fallback)됩니다. 해를 끼칠 수 없는 곳에서 새로운 것을 시도하고, 수익을 내는 것은 라우팅하십시오.

평결

이번 달에 영상 기능이 필요하다면 선택은 이미 정해져 있습니다. Gemini Omni 1.1 Flash는 실제로 존재하고, 가격이 책정됐으며, 일반에 공개(GA)되었습니다. 반면 InternLumina-U2는 아무도 호출할 수 없습니다. 오픈 멀티모달 연구가 어디로 향하는지 지켜보고 있다면, InternLumina-U2가 더 흥미로운 산출물입니다. 주요 연구소가 건 보기 드문 완전 이산형(fully-discrete)·멀티 코드북 도전이며, Apache-2.0이고, 아키텍처는 이미 공개되었고 가중치(weights)도 아마 멀지 않았습니다. 저장소(repo)는 연구 방향의 미리보기로 취급하고, GA 영상 모델은 오늘 바로 그 위에 구축할 수 있는 도구로 취급하세요. 그리고 '멀티모달'이라는 공유된 라벨 때문에 두 모델이 같은 작업을 놓고 경쟁한다고 믿게 두지 마십시오.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube