'InternLumina-U2 vs Qwen2.5 Omni' 비교를 위한 히어로 타이틀 카드 — 부제: '알리바바가 출시한 옴니 모델 vs 아직 약속만 된 모델' — 그리고 다음 세 개의 통계 칩: 'Qwen2.5 Omni: 프로덕션 17개월', 'InternLumina-U2: 코드 하루 분량', '양쪽 모두 Apache-2.0'. 오른쪽 하단 모서리에는 OrcaRouter 로고가 있다.
Guides & Insights

InternLumina-U2 vs Qwen2.5 Omni: 알리바바가 선보인 옴니 모델과 상하이 AI 랩이 여전히 기대 중인 모델

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

InternLumina-U2와 Qwen2.5 Omni는 모두 같은 야망에 대한 답이다. 전문가 모델의 동물원 대신 모든 양식을 처리하는 하나의 모델을 만들겠다는 야망 말이다. 다만 그 둘은 두 세대가 떨어져 있다. Qwen2.5 Omni는 실제로 출시된 답이다. 2025년 3월에 공개된 70억 파라미터 규모의 오픈 가중치 모델로, 이 글을 쓰는 시점 기준 17개월이 되었다. 텍스트, 이미지, 오디오, 비디오를 입력으로 받아 텍스트나 자연스러운 스트리밍 음성으로 응답한다. InternLumina-U2는 Shanghai AI Laboratory의 답으로, 2026년 9월 1일에 추론 코드로 공개되었다. 이미지, 비디오, 3D를 인식하고 하나의 공유된 이산 토큰 인터페이스를 통해 이미지를 생성·편집한다고 주장하는 160억 파라미터 규모의 희소 확산 모델이다. 옴니 아이디어의 한 세대는 1년 반 동안 실제 제품으로 운영되어 왔지만, 다른 세대는 하루밖에 되지 않았으며 아무도 실행할 수 없다. 가중치가 아직 존재하지 않기 때문이다. 이 둘 사이의 간극은 지켜진 약속과 맺어진 약속의 차이다.

출시된 Omni: Qwen2.5 Omni

Qwen2.5 Omni는 "모든 것을 인지하고 어떤 형태로든 답한다"는 슬로건을 실제로 구현한 보기 드문 오픈 모델이라는 점에서 기준(baseline)으로서 충분히 주목할 가치가 있습니다. Thinker-Talker 아키텍처는 텍스트 기반 thinker와 음성을 생성하는 talker를 결합하며, 시간 정렬 멀티모달 위치 인코딩을 통해 오디오와 비디오가 동기화된 상태를 유지합니다. 입력은 텍스트, 이미지, 오디오, 비디오를 포괄하고, 출력은 한 턴 안에서 텍스트와 음성을 동시에 제공할 수 있으며, 기본 제공 음성은 4가지입니다. 제약 사항은 기능만큼이나 명확하게 문서화되어 있습니다. 컨텍스트 길이는 32K 토큰이고, 함수 호출(function calling)과 구조화된 출력(structured output)은 지원하지 않으며, 에이전트라기보다는 전방위 대화형 모델입니다. 이번 비교에서 이 모델이 하지 못하는 일을 분명히 짚어두는 것이 중요합니다. 이미지, 오디오, 비디오를 인지하지만 이를 생성하지는 않습니다. Qwen2.5 Omni에서의 "omni"는 출력 측면의 음성 합성을 결합한 전방위 인지(omni-perception)를 뜻합니다. 픽셀이 입력되고, 단어가 출력되는 방식입니다.

실적은 실제입니다. 이 모델은 수십만 번 다운로드되었고, 개발자 자체 플랫폼과 여러 제3자 플랫폼을 통해 호스팅 API를 제공하며, 17개월 동안 양자화, 커뮤니티 도구, 그리고 알려진 가격을 축적해 왔습니다. 애그리게이터 목록에 따르면 텍스트는 입력 토큰 100만 개당 약 0.09달러, 출력 토큰 100만 개당 0.34달러이며, 오디오는 별도로 청구됩니다. 17개월이면 강점과 한계가 모두 잘 파악될 만큼 충분한 시간입니다. 그것이 성숙함이 주는 것입니다: 완벽함이 아니라 예측 가능성입니다.

약속된 옴니: InternLumina-U2

InternLumina-U2는 Qwen2.5 Omni보다 한 단계 더 나아가려고 하며, 그 단계가 바로 어려움이 존재하는 지점이다. 이 모델의 설계 철학은 지각(perception)과 생성(generation)이 하나의 이산 토큰 인터페이스를 공유해야 한다는 것이다. 비디오를 지각하는 언어 모델과 그림을 그리는 별도의 확산 모델 대신, 하나의 희소 MoE 확산 백본(총 16B, 활성 1B)이 이미지, 차트, 비디오, 3D 자산을 읽는 동시에 새 이미지나 편집 결과를 써낼 수 있어야 한다. 이를 위해 완전히 이산적인 8-코드북 시각 어휘를 사용함으로써 각 시각적 위치가 양방향을 모두 지원할 충분한 정보를 담는다. 이는 Qwen2.5 Omni보다 실질적으로 훨씬 더 큰 주장이다. 모든 입력 양식을 텍스트와 음성으로 라우팅하는 것과, 하나의 가중치 집합으로 하여금 추론만큼 유창하게 픽셀을 생성하게 하는 것은 다른 차원의 문제다.

또한 현재로서는 검증할 수 없는 주장이다. 연구소는 추론 코드와 "예비적이고 부분적인" 벤치마크 표가 있는 프로젝트 페이지, 그리고 빈 Hugging Face 스텁을 게시했다. 가중치, 학습 코드, 기술 보고서, Ascend-NPU 스택은 모두 "곧 공개 예정"으로 표시되어 있다. 평가할 것이 없기 때문에 독립적인 평가도 존재하지 않는다. Qwen2.5 Omni의 아키텍처는 출시된 주에 가중치가 함께 배포되었기 때문에 확인할 수 있었다. InternLumina-U2의 아키텍처는 오늘날에도 읽을 수 있지만, 그 품질은 여전히 공급업체의 약속일 뿐이다.

점수판

이 모델들 중 하나는 17개월의 이력을 갖고 다른 하나는 하루치의 코드만 갖고 있기 때문에, 행은 열이 대칭인 척하지 않고 출처를 담고 있다.

• 연령 — Qwen2.5 Omni: 2025년 3월 출시, 실사용 기간 17개월, 다운로드 수십만 건. InternLumina-U2: 2026년 9월 1일 추론 코드 공개, 다운로드 0건, 독립 실행 0건.

• 형태 — Qwen2.5 Omni: 약 7B 규모의 종단 간(end-to-end) 모델로, 시간 정렬 멀티모달 위치 인코딩을 갖춘 Thinker-Talker 구조. InternLumina-U2: 총 16B / 활성 1B 규모의 희소 MoE 확산 LLM으로, 8개 코드북으로 구성된 이산 시각 토크나이저를 사용.

• 입력: 두 모델 모두 텍스트와 이미지를 입력받으며, Qwen2.5 Omni는 옴니 채팅을 위해 오디오와 비디오도 추가로 입력받습니다. InternLumina-U2는 추가로 64개 샘플링 프레임에 대한 비디오 이해와 Blender로 렌더링된 GLB/GLTF 뷰에 대한 3D 이해가 가능하다고 주장합니다.

Output — Qwen2.5 Omni: 텍스트 및 스트리밍 음성, 네 가지 음성 지원. InternLumina-U2: 텍스트 출력, 최대 1024×1024 텍스트-이미지 생성, 명령 기반 이미지 편집 지원.

• 생성 프론티어 — Qwen2.5 Omni: 단어와 음성을 생성하며, 픽셀은 생성하지 않는다. InternLumina-U2: 읽는 것과 동일한 이산 토큰 모델 내에서 픽셀 생성 및 편집을 시도한다.

• 가중치 및 라이선스 — 원칙적으로 둘 다 Apache-2.0 오픈 가중치입니다. Qwen2.5 Omni의 가중치는 오늘 다운로드할 수 있는 반면, InternLumina-U2의 가중치는 아직 공개되지 않았습니다.

• 제공 — Qwen2.5 Omni: 호스팅 API 및 자체 호스팅(리소스가 많이 드는 전체 정밀도 배포) 지원; 알려진 32K 컨텍스트, 함수 호출 없음. InternLumina-U2: 서비스 불가 — 배포된 드라이버는 존재하지 않는 체크포인트를 요구함.

• 주요 수치 — Qwen2.5 Omni: OmniBench 리더보드에서 오랫동안 자리 잡음(현재 보드 기준 약 0.561점); InternLumina-U2: ChartQA 86.52, MathVision 33.22, GenEval 0.81 — 모두 벤더 보고 수치이며, 예비적이고 부분적인 결과임.

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

세대 차이가 진짜 이야기인 이유

출시 시기는 제쳐 두고, 실질적인 차이는 각 모델이 멈추는 경계선에 있다. Qwen2.5 Omni는 다루기 쉬운 버전의 옴니를 선택했다. 즉, 넓게 인지하고 언어나 음성으로 응답하며, 이미지·비디오 합성은 스택의 다른 곳에 있는 전용 생성 모델에게 맡긴다. 이런 분업은 2026년에 사실상 모든 상용 멀티모달 시스템이 구축되는 방식이며, Qwen2.5 Omni가 2025년에 출시되어 2026년에도 유용하게 쓰일 수 있는 이유이기도 하다. 자신의 몫을 잘 수행하면서 나머지와도 잘 결합되기 때문이다. InternLumina-U2는 분업 자체가 문제라고 보는 승부수다. 즉, 지각과 생성을 모두 하나의 공유된 이산 어휘로 표현해야 하는 모델이, 단지 그것을 묘사하기만 하면 되는 모델보다 시각에 대한 더 깊은 이해를 배울 것이라는 것이다. 그 승부수가 성공한다면, 그 자체가 더 중요한 결과가 된다. 그렇지 않다면, InternLumina-U2는 같은 가중치에 이미지 생성기를 어색하게 얹어 놓은, 더 느리고 더 많은 자원을 먹는 Qwen2.5 Omni로 끝나고 만다. 이 모든 경쟁은 — 그리고 이는 실행 가능한 두 모델 간의 경쟁이 아니라, 출시된 설계와 가설 간의 경쟁이다 — 더 어려운 아키텍처가 그 자체를 정당화하느냐에 관한 것이다.

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

2026년 8월 27일에 캡처된 Qwen/Qwen2.5-Omni-7B Hugging Face 카드 — Thinker-Talker 개요, Apache-2.0 라이선스, 및 모델의 텍스트·이미지·오디오·비디오 모달리티 태그.

다운로드 1년 반이 실제로 가져다주는 것

성숙함은 분위기가 아니라 아는 것들의 목록이다. Qwen2.5 Omni를 쓸 때면 32K 컨텍스트가 확고한 제약 조건이라는 것을 알고, 그에 맞춰 엔지니어링할 수 있다. 함수 호출 경로가 없다는 것을 알기에, 있는 척하지 않는다. 배포 비용이 대략 어느 정도인지도 안다. 호스팅 API를 통해서든 자체 GPU를 통해서든 말이다. 충분히 많은 사람들이 그 모델의 가격을 매기고 실행해 와서 수치가 자리를 잡았기 때문이다. OmniBench에서의 위치가 실제라는 것도 안다. 독립적인 리더보드들이 1년 넘게 추적해 왔기 때문이다. InternLumina-U2에는 그런 동사가 하나도 적용되지 않는다. 당신은 모르며, 알 수도 없다. 산출물이 없기 때문이다. 모델이 갓 하루가 되었고 아무런 무게도 지니지 못했을 때, 그 모델에 대한 모든 주장은 의도의 표명에 불과하다. 그 비대칭성은 과학을 폄하하는 것이 아니라, 무엇을 기반으로 구축할지를 선택하는 모든 사람에게 옳은 인식론적 태도다.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

2026년 9월 2일에 캡처된 InternLM/InternLumina-U2 GitHub 저장소 — 아키텍처를 공개하는 저장소 랜딩 페이지 — 설명, 라이선스 및 추론 스크립트가 포함되어 있지만, 트리에는 가중치 자체가 없습니다.

정직하게 제시된 라우팅 결정

우리는 가용성을 분명히 밝히겠습니다: OrcaRouter는 InternLumina-U2를 호스팅하지 않습니다. 호스팅할 가중치가 누구에게도 없기 때문이며, 현재 Qwen2.5 Omni도 제공하지 않습니다. 이 모델은 개발자 자체 API와 제3자 플랫폼을 통해 실행됩니다. 따라서 여기서의 라우팅 교훈은 자세에 관한 것이지, 오늘 이 두 모델을 하나의 키로 호출하는 것에 관한 것이 아닙니다. 지속 가능한 패턴은 모든 성숙한 모델 대 신규 진입자 결정이 결국 도달하는 바로 그 패턴입니다: 검증된 모델을 메인 경로에 유지하되, 200개 이상의 모델에 걸친 단일 API와 0% 마크업 전가(pass-through) 덕분에 공급자 목록 가격만 지불하고 그 이상을 내지 않는 것; 검증되지 않은 신규 모델은 자동 장애 조치가 있는 테스트 경로에 연결하여, 처음으로 멈추거나 표류하거나 무의미한 결과를 반환하면 호출이 17개월의 실적을 가진 모델로 대체되도록 하는 것입니다. 이것이 InternLumina-U2와 같은 야심 찬 새 아키텍처의 가중치가 공개되는 날, 이미 의존하고 있는 프로덕션 경로를 걸지 않고 평가할 수 있는 방법입니다.

평결

Qwen2.5 Omni는 오늘 바로 그 위에 구축할 수 있는 옴니 모델입니다. 배포되었고, 다운로드할 수 있으며, 문서화되어 있고, 알려진 한계와 확정된 가격이 있습니다. InternLumina-U2는 주목할 만한 옴니 모델입니다. 인식에서 창조로 나아가는 진정한 아키텍처적 진전이며, Apache-2.0 라이선스로 코드는 공개되었고 가중치는 아직 공개되지 않았습니다. 연구소의 다중 코드북 승부수가 독립적인 테스트에서도 유효하다면, InternLumina-U2는 Qwen2.5 Omni의 경쟁자라기보다 같은 아이디어의 차세대 버전이 될 것입니다. 그렇지 않다 하더라도, 실제로 출시된 17개월 된 범용 모델은 여전히 남아 지금까지 해온 일을 계속할 것입니다. Hugging Face의 스텁을 지켜보세요. 판결은 이 글이 아니라 safetensors 파일에 달려 있습니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube