
InternLumina-U2 미리보기: 이미지, 비디오 및 3D를 위한 16B 확산 모델 — 가중치는 아직 제공 예정
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
2026년 9월 1일 04:03 UTC에 상하이 인공지능 연구소(Shanghai AI Laboratory)는 GitHub 저장소 InternLumina-U2를 생성했습니다. 13분 후, 같은 기관은 Hugging Face에 동일한 이름의 저장소를 등록했습니다. 출시 게시물도, 모델 카드도, 어떤 종류의 발표도 없었습니다. 단지 InternLumina-U2의 추론 코드만 있었습니다. 이 모델은 16B 파라미터 혼합 전문가(mixture-of-experts) 모델(1B 활성)로, 연구소는 이 모델이 단일 이산 토큰 인터페이스를 통해 이미지 이해, 텍스트-이미지 생성, 이미지 편집, 비디오 이해, 3D 이해를 모두 다루는 하나의 모델이라고 설명합니다. 코드는 실제이며 공개되어 있습니다. 그러나 모델 자체는 아직 공개되지 않았습니다. 가중치는 "coming soon"으로 표시되어 있고, Hugging Face 저장소는 빈 자리 표시자이며, 약속된 기술 보고서도 아직 나오지 않았습니다. 그럼에도 9월 1일에 조용히 공개된 것은 현재 존재하는 이 모델에 대한 가장 완전한 공개 정보입니다.
InternLumina-U2에 대해 지금 처음 듣는 것이라면, 그게 바로 의도된 것입니다. 이번 릴리스에 대해 공개된 발표는 없었고, 독립적인 보도도 아직 존재하지 않는 것으로 보입니다. 초기 신호를 다루는 글들이 바로 이런 모델이 가장 먼저 모습을 드러내는 곳입니다. 출시 게시물보다도, 때로는 가중치(weights)보다도 먼저 말이죠. 아래의 모든 내용은 GitHub 저장소, 프로젝트 페이지, 그리고 연구소 자체가 9월 1일에 게시한 Hugging Face 스텁(stub)에서 가져온 것이며, 이러한 출처를 벗어난 내용은 명시적으로 추론(inference)으로 표시했습니다.
9월 1일에 실제로 출시된 것
GitHub 저장소 InternLM/InternLumina-U2는 2026년 9월 1일에 생성되었으며, 그날 커밋이 세 개 있었습니다. 첫 번째는 초기 커밋, 두 번째는 모델 링크가 "곧 제공 예정"이고 벤치마크 결과가 "예비"임을 표시하는 변경, 세 번째는 내비게이션 수정입니다. 이 저장소는 Apache-2.0 라이선스이며, "Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing"라는 제목의 README(영어 및 중국어 버전), 전체 추론 하네스, 로드맵을 포함합니다. 주목할 만한 특이점은 이렇습니다. 저장소 자체의 뉴스 항목에는 "[2026-08]"이라고 찍혀 있지만 초기 커밋과 저장소의 두 타임스탬프 모두 2026년 9월 1일입니다. 따라서 실제 출시일은 8월이 아니라 9월 초로 봐야 합니다. 아래의 저장소가 공개된 전체 릴리스입니다. 트리에서 볼 수 있는 모든 파일은 출시된 구성 요소의 일부이며, 그 밖에 더 존재하는 것은 아직 없습니다.

• GitHub — InternLM/InternLumina-U2, 2026-09-01에 Apache-2.0 라이선스로 생성됨. 텍스트, 텍스트-이미지, 이미지 이해, 이미지 편집, 비디오 이해 및 3D 이해를 위한 추론 코드 포함.
• Hugging Face — internlm/InternLumina-U2, 2026-09-01에 생성됨, 현재 .gitattributes 파일과 28바이트 README만 보유하고 있으며, README의 전체 내용은 Apache-2.0 라이선스 헤더입니다. 가중치, config, 토크나이저 파일은 없습니다.
• 프로젝트 페이지 — internlm.github.io/InternLumina-U2에는 아키텍처 다이어그램, 예비 벤치마크 표, 플레이스홀더 데모가 포함되어 있으며, 기술 보고서는 '곧 공개 예정'으로 표시되어 있습니다.
추론 코드는 작업별 섹션이 있는 하나의 드라이버 스크립트로 구성되어 있습니다: 일반 텍스트 생성, 최대 1024×1024 해상도의 텍스트-이미지 생성(CFG 및 타임스텝 설정 가능), 자연 이미지와 복잡한 차트에 대한 이미지 이해, 선택적 이중 CFG 모드를 사용한 지시 기반 이미지 편집, 64개의 샘플링된 프레임에 대한 비디오 이해, 그리고 토큰화 전에 번들된 Blender 파이프라인을 통해 64개의 색상-깊이 뷰로 렌더링되는 GLB/GLTF 자산에 대한 3D 이해입니다. 이러한 작업의 폭은 이 모델의 전체 설계 이념이며, 아키텍처에 깊이 들어가기 전에 잠시 숙고할 가치가 있습니다.
하나의 모델, 여섯 가지 작업, 하나의 토큰 어휘
InternLumina-U2는 언어와 비전이 별도의 이해·생성 스택에 나뉘어 존재하기보다 단일 이산 토큰 인터페이스를 공유해야 한다는 빠르게 진화하는 연구 계열에 속한다. 이 연구실이 앞서 동일한 방향으로 수행한 작업(Lumina-DiMOO, WAIC 2025에서 공개된 통합 이산 확산 모델)은 LLaDA2.0-Uni, Show-o2, MMaDA와 함께 InternLumina-U2가 기반을 두고 능가한다고 주장하는 선구적 시스템으로 인용된다. InternLumina-U2가 내리는 핵심 판단은 이러한 통합 모델의 병목이 아키텍처가 아니라 시각 어휘(vocabulary)라는 것이다. 단일 코드북은 하나의 시각 토큰이 전달할 수 있는 정보량을 제한하며, 이해와 생성을 서로 다른 표현으로 분리하는 이산-연속 하이브리드 방식은 어차피 모델이 두 개의 스택을 유지하도록 강제한다.
InternLumina-U2의 답변은 완전 이산형 다중 코드북 모델링입니다. 시각적 측면에서는 Apple의 AToken 토크나이저를 사용하여 각 시각적 위치를 8개의 보완적인 코드북으로 표현합니다. 이는 시퀀스 길이를 늘리지 않으면서 로컬 텍스처, 내장 텍스트, 기하 구조 및 고주파 세부 정보를 보존하려는 시도입니다. 입력 측면에서는 8개의 코드북 각각이 자체 임베딩을 유지하며, 위치별 8개 임베딩은 연결(concatenate)되어 단일 백본 토큰으로 투영됩니다. 출력 측면에서는 예측이 공간적으로는 병렬로 이루어지지만 코드북 깊이에서는 자기회귀적으로 수행됩니다. 확산 백본은 마스킹된 여러 공간 위치를 병렬로 노이즈 제거하며, 이후 다중 코드북 자기회귀 헤드가 각 위치의 8개 코드를 순서대로 예측합니다.
• Scale — 총 16B 파라미터, 활성 파라미터 1B(16B-A1B), 희소 MoE.
• 언어 백본 — LLaDA-2.0 MoE 확산 언어 모델로, 블록 확산 목적이 공동 멀티태스크 훈련을 통해 시각 작업으로 확장됩니다(공급업체 설명).
• 시각적 표현 — Apple의 AToken 토크나이저에서 생성된 8-코드북 완전 이산 토큰.
• 하드웨어 — NVIDIA GPU와 Huawei Ascend NPU 모두에 적용되며, 학습, 평가 및 추론 전반에 걸쳐 백엔드 간 연산자 수준의 수치 정합성을 지원합니다.

실제로 그 주장이 사실이라면, 그것이 실질적으로 제공하는 것은 멀티모달 분야의 가장 오래된 꿈이다. 즉, 하나의 가중치 집합으로 이미지를 읽고, 편집하고, 텍스트에서 새 이미지를 그리고, 비디오에 관한 질문에 답하며, 3D 자산을 설명할 수 있는 것 — 이해와 생성이 각각의 전문 모델을 억지로 이어 붙이는 대신 동일한 인터페이스를 통해 서로를 강화하는 방식이다. 또한 이는 가장 회의적인 시선을 보낼 만한 주장이기도 한데, 실제로 만들기 가장 어렵기 때문이다.
그 숫자들은, 있는 그대로다
InternLumina-U2가 보유한 모든 벤치마크는 개발사가 보고한 것으로, 예비적이고 부분적인 결과입니다. README와 프로젝트 페이지에도 그와 같이 명시되어 있습니다: "예비적이고 부분적인 결과입니다. 전체 비교 표는 곧 공개될 기술 보고서에 포함될 예정입니다." 가중치가 공개되어 있지 않기 때문에 독립적인 평가는 존재하지 않습니다. 아래의 수치는 실험실 자체의 주장으로 취급해야 하며, 검증된 점수가 아닙니다.
• 차트 / 문서 이해 — ChartQA 86.52, CharXiv-DQ 83.65 (벤더 제공).
• 시각적 수학 추론 — MathVision 33.22, DynaMath 56.37. 연구소에 따르면 이것은 이해 전용 InternVL3-8B를 두 벤치마크 모두에서 능가합니다.
• 환각 내성 — HallusionBench 62.15.
• 영상 이해 — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (프로젝트 페이지).
• 3D 이해 — 3D MM-Vet 41.8.
• 텍스트-이미지 생성 — DPG-Bench 87.10, TIIF-Bench Short/Long 84.60/85.95, GenEval 0.81 (프로젝트 페이지).
• 이미지 편집 — ImgEdit 3.83.
비교에 관한 대목은 정직한 독자라면 속도를 늦추고 읽어야 할 부분이다. README에는 InternLumina-U2가 세밀한 이해 및 생성 벤치마크에서 InternVL-U, LLaDA2.0-Uni, Show-o2, Lumina-DiMOO 같은 통합 모델들을 능가한다고 주장하지만, 프로젝트 페이지 자체의 표에는 InternLumina-U2가 GenEval에서 0.81, LLaDA2.0-Uni가 0.89로 나와 있어, 이 모델은 적어도 하나의 주요 생성 지표에서 최소한 한 명의 경쟁사에 뒤처진다. 부분적인 표에서 유리한 숫자 몇 개만 골라내는 것은, 기술 보고서의 전체 비교 표가 있다는 경고 문구가 완화하려고 하는 바로 그 행위다. 그 수치들은 연구실에서 나온 방향성 신호일 뿐, 그 이상도 아니다.
무엇이 실제이고 무엇이 약속된 것인가
이번 릴리스 범위는 유난히 명확하며, 오늘 이것을 사용해 볼 수 있는지 결정하려는 사람에게 중요합니다. 제공된 것: 추론 코드. 제공되지 않은 것: 가중치, 훈련 코드(별도 저장소로 제공 예정), Ascend 훈련 및 추론 스택, 기술 보고서. 추후 모델이 탑재될 Hugging Face 저장소는 현재 스텁(stub) 상태입니다. 아래 스크린샷은 README의 "Model (coming soon)" 링크를 클릭했을 때 도달하는 페이지의 현재 전체 내용입니다.

공개된 코드조차 아직 출력물을 생성할 수 없다. 추론 드라이버는 분할된 Hugging Face 체크포인트 디렉터리와 특정 경로에 있는 AToken 토크나이저 가중치를 요구하는데, 둘 다 저장소에는 없다. 따라서 지금 다운로드할 수 있는 것은 모델이 어떻게 실행될지에 대한 명세이지, 실행되는 모델이 아니다. 그리고 가중치가 실제로 공개되더라도 자체 호스팅은 일상적인 pip-install 작업이 아니다. 이 모델은 표준 Transformers 생성 인터페이스 대신 block-diffusion 생성 API를 사용하고, AToken 토크나이저는 FlashAttention이 필요하며, 코드는 import 시점에 GPU가 보여야 하고, 루트 드라이버는 단일 프로세스이며, 3D 파이프라인은 에셋 인코딩에 Blender 4.5를 기대한다. 이것은 주말 실험이 아니라 실제 배포 프로젝트다. 즉, 라우팅 계층이 대부분의 팀을 위해 흡수하도록 존재하는 바로 그런 종류의 마찰이다.
가중치가 도착하면, 그것을 아직 검증되지 않은 모델로 취급하라.
오늘날 누구도 InternLumina-U2를 실행할 수 없고, 어떤 제공업체도 이를 서비스할 수 없다. 가중치가 공개되어 있지 않기 때문이다. 그 상황은 언젠가 바뀔 것이다. Apache-2.0 라이선스와 해당 연구소의 2026년 공격적 오픈소스화 패턴(ArchSpace의 '모든 것 공개' 추진, InternVL3.5, Intern-S2 과학 모델들)은 가중치 공개를 단순한 가정이 아니라 매우 유력한 시나리오로 만든다. 그때가 되면 합리적인 첫 단계는 이례적인 서빙 요구사항과 독립적 평가가 전혀 없는 출시 직후의 확산 모델에 프로덕션 파이프라인을 걸어 도박하는 것이 아니다. 이미 신뢰하는 모델과 나란히 테스트 경로에서 실행하고, 새 모델이 오작동하는 즉시 검증된 모델로 자동 장애 조치하는 것이다. 이것이 바로 라우팅 계층이 만들어진 용도다. 200개 이상의 모델을 하나의 API로 제공하고, 제공업체 정가를 0% 마크업으로 전달하며, '새로운 것을 시도한다'는 일을 마이그레이션이 아닌 라우팅 규칙으로 바꿔주는 장애 조치. OrcaRouter는 그렇게 구성되어 있다. 그리고 분명히 말하지만, 우리는 InternLumina-U2를 라우팅하지 않으며, 할 수도 없다. 가중치가 공개되지 않았기 때문이다. 이 섹션은 가중치가 공개되었을 때의 워크플로우에 관한 것이지, 이 모델이 오늘날 어디에서든 이용 가능하다는 주장이 아니다.
다음에 볼 콘텐츠
InternLumina-U2가 프리뷰에서 실제 모델로 전환되기까지는, 실현 가능성이 대략 높은 순서로 네 가지 사건이 필요하다. 첫째, Hugging Face 리포지토리가 채워지는 것이다. safetensors 파일, config, AToken 토크나이저 가중치가 그 스텁(stub)에 나타나는 순간이 곧 모델이 실제로 존재하게 되는 순간이다. 둘째, 기술 보고서다. 전체 비교 표가 실려 있어야 하며, 앞서 공개된 벤더의 부분 수치를 검증 가능한 것으로 바꿔 줄 것이다. 셋째, 학습 코드 리포지토리와 Ascend 스택이다. 파인튜닝을 하거나 NVIDIA가 아닌 하드웨어에서 이 모델을 실행하려는 사람에게 중요하다. 넷째, 첫 번째 독립 평가다. 아레나 Elo, 재현된 ChartQA나 GenEval 실행 같은 평가가 실험실 자체의 선택 편향 없이 '하나의 모델, 여섯 가지 작업'이라는 약속을 시험한다. 코드가 9월 1일에 공개됐다는 것은 아키텍처를 이미 알 수 있다는 뜻이다. 반면 가중치가 없다는 것은 실제 품질에 관한 모든 것이 여전히 주장에 불과하다는 뜻이다. 발표 피드보다 모델 리포지토리를 주시하라. 흥미로운 부분은 이미 공개되어 있으며, 모델 자체도 아마 곧 따라올 것이다.
