
Ling-3.0-flash-VL vs InternLumina U2: 둘 다 출시됨, 서로 다른 실리콘
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
이 두 모델은 이제 실제로 존재하고 실행도 다운로드도 가능한데, 이는 불과 2주 전만 해도 사실이 아니었습니다 — 그리고 둘 사이의 차이는 벤치마크와는 거의 아무 관련이 없습니다. Ling-3.0-flash-VL은 앤트 그룹의 inclusionAI 연구소에서 2026년 9월 4일부터 8일 사이에 BF16 및 FP8 가중치를 Hugging Face에 올리고 SGLang과 vLLM 서빙 레시피를 함께 공개했으며, Artificial Analysis Intelligence Index v4.3에서 독립 평가 점수 25점을 받았습니다. InternLumina U2는 상하이 AI 연구소의 InternLM 팀이 추론 코드를 먼저 공개한 뒤 9월 10일에 Hugging Face에 Ascend로 학습된 모델 가중치를 공개했습니다 — safetensors 샤드 일곱 개가 ascend/ 하위 폴더에 들어 있어, 저장소는 열여섯 개 파일로 완성되었습니다.
함정은 그 두 가중치 다운로드가 무엇을 위해 만들어졌는가에 있다. Ling-3.0-flash-VL의 공개된 경로는 이미 모두가 가지고 있는 CUDA 경로다. 8개 가속기 노드가 FP8 빌드를 실행하며, 서빙 스택은 이미 실행 중인 것들이다. InternLumina U2의 공개 체크포인트는 Ascend용이며, README에는 추론을 어떻게 실행할 계획인지에 맞는 체크포인트를 다운로드하라고 명확히 나와 있다 — NVIDIA로 학습된 체크포인트는 여전히 출시 예정으로 기재되어 있다. 같은 주에 출시된 두 모델, 그리고 그중 하나만 대부분의 팀이 바로 앞에 두고 있는 하드웨어에서 실행된다.
그것은 이 비교를 유용하게 재구성한다. 이제 이 글은 출시 제품과 베이퍼웨어를 맞세우는 글이 아니며, InternLumina U2를 여전히 가중치 대기 중이라고 설명하는 사람은 일주일 전 README를 보고 있는 것이다. 이 글은 서로 다른 두 실리콘 생태계에 등장한 매우 상이한 두 통합 비주얼 설계에 관한 것이며, 각 릴리스에서 어떤 부분이 실제로 완성되었는지에 관한 것이다.
이제 각 릴리스에 포함된 내용
Ling-3.0-flash-VL은 124B 파라미터 규모의 희소 전문가 혼합(MoE) 모델로, 토큰당 약 5.5B 파라미터를 활성화하며, 42개 레이어로 구성된 하이브리드 트렁크에서 Kimi Delta Attention과 게이트된 MLA 블록을 5:1 비율로 교차 배치합니다. 임의 해상도 비전 인코더와 2계층 MLP 프로젝터가 이 트렁크에 입력을 공급하며, VideoRoPE가 공간 및 시간 위치를 처리합니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환합니다. BF16(64개 샤드)과 FP8(약 126GB, 비전 타워는 전문가 가중치보다 의도적으로 더 높은 정밀도로 유지됨) 모두 MIT 라이선스로 공개되어 있으며, 이번 릴리스는 독립 벤치마크 커뮤니티가 평가할 만큼 완성도가 높아 Intelligence Index v4.3에서 25점을 기록했고, 동일 크기 등급에서 중앙값 8인 가운데 64개 중 #2위에 올랐습니다. 공개하지 않은 것은 비전 모델의 토큰당 가격이며, API 예시에는 -rc1 식별자가 있어, 제공되는 체크포인트가 공개 가중치와 일치하는지 여부를 명확히 하지 않습니다.
InternLumina U2는 약 1B개의 활성 매개변수를 가진 16B 매개변수 희소 전문가 혼합(MoE) 모델로, LLaDA-2.0 MoE 확산 언어 모델 백본을 기반으로 구축되었으며, 하나의 모델에서 여섯 가지 작업군을 아우릅니다: 텍스트 QA, 텍스트-이미지 생성, 이미지 이해, 이미지 편집, 비디오 이해, 3D 이해. 그 모두에 대한 추론 코드는 main에 공개되어 있습니다. Ascend로 훈련된 체크포인트는 이제 Hugging Face에 공개되었습니다. 저장소 자체 로드맵에 따르면 아직 남아 있는 항목은 NVIDIA로 훈련된 체크포인트, 훈련 코드(별도 저장소), 그리고 기술 보고서입니다. 로드맵은 네 개 항목을 완료로 표시하고 두 개를 열어 둡니다 — 추론 코드, Ascend 가중치, Ascend 훈련 및 추론 스택은 완료; 훈련 코드와 기술 보고서는 아직.
그 두 문단 사이에 실무적인 세부 사항이 하나 있습니다. U2의 비전 경로를 실행하려면 AToken 토크나이저 가중치가 atoken_inference/checkpoints/atoken-sod.pt에 있어야 하며, 공개된 드라이버는 모델 자산이 한데 보관된 분할 체크포인트 디렉터리를 기대합니다. 코드는 실제로 동작하며 Python 3.11, PyTorch 2.6.0, 그리고 CUDA 경로에서는 flash-attn 2.7.2에 맞춰 설치됩니다. Ascend 지원은 별도의 ascend-npu-support 브랜치에 있으며 CUDA 툴체인 대신 CANN과 이에 맞는 torch_npu 빌드가 필요합니다. 그중 숨겨진 것은 하나도 없으며, 모두 문서화되어 있습니다. 다만 pip install과 모델 문자열
"비주얼 토큰이란 무엇인가"라는 질문에 대한 두 가지 답변
아키텍처들은 파라미터 수보다 더 깊은 어딘가에서 의견이 갈리는데, 그 불일치가 바로 이 둘을 나란히 놓았을 때 가장 흥미로운 점이다.
Ling-3.0-flash-VL은 표준 계약을 유지합니다. 이미지는 비전 인코더와 프로젝터를 통해 토큰 시퀀스가 되고, 그 토큰들은 트랜스포머 트렁크에 들어가며, 모든 것이 자기회귀적으로 실행됩니다. 새로움은 비전이 어떻게 표현되는지가 아니라 트렁크가 얼마나 저렴하게 실행되는지에 있습니다 — 전체 124B 중 토큰당 5.5B 활성 매개변수로, 이는 모델이 지능 대 활성 매개변수 프런티어에 나타나는 전체 이유입니다. VideoRoPE는 공간 및 시간 위치에 하나의 일관된 인코딩을 제공하므로 비디오에는 별도의 메커니즘이 필요하지 않습니다.
InternLumina U2는 표현 자체를 바꿉니다. 이는 Apple의 AToken 토크나이저를 사용하는데, 여기서 각 시각적 위치는 여덟 개의 상보적 코드북으로 설명됩니다 — 로컬 텍스처, 내장 텍스트, 기하학 및 고주파 디테일을 하나의 축소된 벡터가 아닌 별도의 스트림으로 다룹니다. 각 코드북은 입력 과정에서 자체 임베딩을 유지하며, 위치별 여덟 개의 임베딩은 연결되어 단일 백본 토큰으로 투영됩니다. 출력 과정에서는 팀이 공간 병렬, 코드북 깊이 자기회귀라고 부르는 방식으로 예측이 이루어집니다. 확산 백본이 여러 마스킹된 공간 위치를 한 번에 노이즈 제거한 다음, 다중 코드북 자기회귀 헤드가 각 위치에 대한 여덟 개의 코드를 순서대로 예측합니다. 이해와 생성은 동일한 메커니즘을 통해 이루어집니다 — 이것이 실제 주장입니다. 팀의 주장은 단일 코드북은 하나의 시각적 토큰이 담을 수 있는 정보량을 제한하는 반면, 이산-연속 하이브리드는 이해와 생성을 서로 다른 표현 및 디코딩 경로로 분할하며, 여러 코드북으로 완전히 이산적으로 가는 것이 두 개의 스택을 볼트로 결합한 것이 아니라 진정으로 통합된 모델을 얻는 방법이라는 것입니다.
두 입장 모두 일관성이 있으며, 각기 상반된 비용을 수반합니다. 다중 코드북 표현은 더 미세한 시각적 디테일을 담을 수 있지만, 이미지당 토큰 예산을 코드북 수만큼 배로 늘리고 디코딩을 상당히 더 복잡하게 만듭니다. 아마 이것이 16B-A1B가 규모로 선택된 이유 중 하나일 것입니다. Ling의 희소성은 토큰당 추론 비용을 저렴하게 만들어 주지만, 동시에 한 번의 순전파당 활성 용량이 더 작다는 뜻이기도 합니다. 이는 지능 지수에서 이 계열 중앙값인 8이 조용히 보여 주는 트레이드오프입니다. Ling-3.0-flash-VL은 25로 이를 여유 있게 넘어서지만, 순수 추론 능력에서 밀집형 프런티어 모델들과 경쟁하는 것은 아닙니다.
작업 표면은 부분적으로만 겹칩니다.
둘 다 “멀티모달 모델”로 분류하는 것은 겹치는 부분을 지나치게 부풀린다. 그 경계가 어디서 끝나는지 알면 잘못된 비교 구매를 많이 예방할 수 있다.
• 입력 — Ling-3.0-flash-VL은 텍스트, 이미지, 동영상을 입력받고 요청당 최대 40개 이미지까지 처리하며 텍스트를 반환합니다. InternLumina U2는 텍스트, 이미지, 동영상, 3D 자산을 입력받고 텍스트, 생성된 이미지 또는 편집된 이미지를 반환합니다.br /> • 이미지 생성 — Ling-3.0-flash-VL은 이미지를 전혀 생성하거나 편집할 수 없습니다. InternLumina U2의 핵심 주장은 이미지를 읽는 동일한 가중치로부터 최대 1024×1024까지 두 가지를 모두 수행한다는 것입니다.br /> • 3D — Ling-3.0-flash-VL에는 3D 경로가 없습니다. InternLumina U2는 GLB 및 GLTF 자산을 모델이 추론할 수 있도록 64쌍의 색상-깊이 뷰로 렌더링하는 Blender 기반 파이프라인을 제공합니다.br /> • 동영상 — Ling-3.0-flash-VL은 VideoRoPE 시간 인코딩을 통해 동영상을 처리합니다. InternLumina U2는 64프레임을 샘플링합니다.br /> • 컨텍스트 및 출력 — Ling-3.0-flash-VL은 모델 카드에 명시된 256K와 대비되는 262K 토큰 컨텍스트 창을 측정했으며, 최대 출력은 비교적 짧습니다. InternLumina U2는 두 수치 모두 공개하지 않았습니다.br /> • 활성 파라미터 — Ling-3.0-flash-VL은 토큰당 약 5.5B를 활성화합니다. InternLumina U2는 약 1B를 활성화하는데, 이는 그 5분의 1에 해당합니다.
그 목록을 읽어 보면 결론은 이 둘이 정확히 한 가지 작업 — 이미지를 읽고 그에 관한 질문에 답하는 일 — 에서는 대체재이고, 거의 다른 모든 영역에서는 보완재라는 것이다. 이미지를 생성하거나 편집하는 모델이 필요하다면 Ling-3.0-flash-VL은 후보가 아니며, 어떤 벤치마크도 그 사실을 바꾸지 못한다. 하나의 모델이 차트를 읽고, 변형을 생성하고, 3D 자산에 대해 추론하기를 원한다면 InternLumina U2가 바로 그 목표를 겨냥한 모델이며 Ling-3.0-flash-VL은 이를 다루지 않는다.

벤치마크: 제조사 수치가 가득한 페이지에 맞서는 독립적인 점수 하나
증거의 품질은 차이가 크며, 누가 이겼는지 단정하기보다 그 이유를 정확히 따져보는 것이 가치가 있습니다.
Ling-3.0-flash-VL의 Intelligence Index v4.3에서의 25점은 공개된 프로토콜에 대한 제3자 실행으로, 참고로 클래스 중앙값은 8이며, 측정된 처리량은 초당 출력 토큰 142.9개로 동종 중앙값 105.1개, 첫 토큰까지 2.21초입니다. 해당 공급업체 카드는 별도로 42를 폐기된 v4.1.1 프로토콜에서 주장하는데, 이는 다른 척도이며 모델이 하락한 것처럼 25 옆에 놓을 수 없습니다. 지수는 2026년 9월에 재진술되었고 전면적으로 재채점되었습니다. 공급업체는 또한 "linthium"이라는 핸들로 GPT-5.4에 대한 Image-to-WebDev Arena에서 1,441 대 1,440 승리를 보고했습니다 — Elo 노이즈 내의 1점 차이이며, 공급업체 보고입니다.
InternLumina U2의 수치는 연구소가 자체적으로 산출한 것이며, 예비 및 부분적이라고 표시되어 있습니다. 전체 비교 표와 기술 보고서는 아직 나오지 않았습니다. 이 수치들은 이제 벤치마크 리더보드가 아니라 저장소 README의 표에 실려 있으며, 제3자가 아직 실행 결과를 공개하지 않았기 때문에 독립적으로 검증될 수 없습니다. 연구소가 밝힌 그대로 말하자면:
• 이해 — ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15, MMMU-Pro 36.13, MathVision 33.22, DynaMath 56.37br /> • 비디오 — Video-MME 51.26, MVBench 59.74, MLVU 57.03br /> • 생성 및 편집 — GenEval 0.81, DPG 87.10, TIIF Short 84.60, TIIF Long 85.95, ImgEdit 3.83br /> • 출처 — 모든 InternLumina U2 수치는 벤더 보고 기준의 잠정치입니다. Intelligence Index를 제외한 모든 Ling-3.0-flash-VL 수치는 벤더 보고 기준이며, Intelligence Index는 Artificial Analysis 기준입니다
그중 두 가지는 따로 표시해 둘 만하다. GenEval 0.81은 연구소 자체 표에서 이름이 밝혀진 경쟁사의 0.89에 뒤처진다 — 벤더가 자사가 뒤지는 결과를 공개하는 드문 사례이며, 나머지 표를 조금 더 신뢰할 이유다. 그리고 ImgEdit의 3.83은 함께 제공되는 표 없이는 의미가 없다. 그 표는 곧 나올 기술 보고서가 담을 내용의 일부다. InternLumina U2 목록은 연구소가 방어하려는 결과로 취급하고, 당신이 실행에 옮길 수 있는 결과로 취급하지 마라. 또한 그 이해도 점수들과 Ling-3.0-flash-VL의 지수 점수는 비교 가능한 수치가 아니다. 하나는 과제별 벤더 수치 집합이고, 다른 하나는 제3자 종합 지수다.

라이선스, 하드웨어, 그리고 각각에 베팅할 때 실제로 드는 비용
Ling-3.0-flash-VL은 두 정밀도 형식 모두 MIT 라이선스를 따르며, 이는 오픈 웨이트가 가질 수 있는 가장 깔끔한 수준입니다 — 부가 조항도, 사용 분야 제한도, 상업적 배포에 대한 모호함도 없습니다. 약 126 GB인 FP8 빌드는 80GB급 가속기 8개로 구성된 노드에 들어갑니다. BF16은 대략 그 두 배입니다. SGLang과 Ant가 유지 관리하는 vLLM 포크에는 이미 서빙 지원이 존재합니다. 잔여 위험은 법적이라기보다 상업적입니다: Ant는 비전 모델에 대한 토큰당 요금을 공개하지 않으며, Ling Studio의 무료 액세스는 요금표라기보다 홍보용이고, Artificial Analysis가 입력 및 출력 1M 토큰당 $0.00로 표시하는 것은 단지 그것이 볼 수 있는 엔드포인트가 무료 엔드포인트이기 때문입니다.
InternLumina U2는 메인 저장소에서 Apache-2.0이며, 읽어볼 만한 두 가지 예외 조항이 있습니다. 번들로 포함된 VeOmni/ 디렉터리는 업스트림 Apache-2.0 라이선스를 유지하고, atoken_inference/는 Apple의 ml-atoken에서 파생되어 Apple의 원래 조건에 따라 재배포됩니다. 인프라 주장은 진지합니다 — NVIDIA GPU와 Huawei Ascend NPU를 모두 대상으로 하며 백엔드 간 연산자 수준의 수치 정렬을 지향하고, 팀은 1,000장 규모 Ascend 클러스터에서 종단 간 학습을 수행했으며 융합 연산자, 튜닝된 HSDP 샤딩, 그래디언트 체크포인팅을 통해 1.85배의 학습 효율 향상을 보고했습니다. 이는 실제 엔지니어링입니다. 또한 이는 모델이 얼마나 좋은지와는 별개의 문제입니다. Ascend에서의 학습 효율은 출력 품질에 대해 아무것도 말해주지 않으며, 오늘날 존재하는 체크포인트는 바로 그 스택을 겨냥한 것입니다.
따라서 실질적인 비대칭은 오픈 대 클로즈드가 아니다. 둘 다 오픈이고, 둘 다 허용적 라이선스로 배포되며, 둘 다 오늘 다운로드할 수 있다. 비대칭은 한 릴리스는 당신이 아마 가지고 있을 하드웨어를 전제로 하고, 다른 릴리스는 당신이 아마 가지고 있지 않을 하드웨어를 전제로 한다는 점이다. 당신의 플릿이 NVIDIA라면 Ling-3.0-flash-VL은 반나절이면 끝나는 작업이고 InternLumina U2는 기다림이다. 당신의 플릿이 Ascend라면 — 이 모델이 만들어진 중국 시장에서 점점 더 흔해지고 있다 — 그 방정식은 완전히 뒤집히며, InternLumina U2가 완성된 경로를 가진 쪽이고 Ling-3.0-flash-VL의 레시피는 CUDA를 전제로 한다.
사람들이 실제로 이 페어링에 대해 묻는 질문들
InternLumina U2의 가중치는 아직 다운로드할 수 있나요?
네, Ascend로 학습된 체크포인트는 — Hugging Face의 ascend/ 아래에 게시된 일곱 개의 safetensors 샤드이며, config, tokenizer, modeling 파일과 함께 제공됩니다. NVIDIA로 학습된 체크포인트는 별도의 하위 폴더에 있고 여전히 출시 예정으로 표시되어 있으며, 학습 코드와 기술 보고서는 아직 공개되지 않았습니다.
Ling-3.0-flash-VL은 독립적인 점수를 가지고 있기 때문에 엄밀히 더 우수한가요?
아니요 — 그것은 근거가 더 탄탄하고 일반 하드웨어에서 실행하기 더 쉽다는 것이며, 그건 별개의 주장입니다. Ling-3.0-flash-VL은 이미지를 생성하거나 편집할 수 없고, 3D 자산을 처리할 수 없으며, 공개된 가격도 없습니다. 당신의 작업이 이미지 생성, 이미지 편집 또는 3D 이해라면, InternLumina U2는 이를 다루지만 Ling-3.0-flash-VL은 Ling 모델이 아무리 많은 벤치마크를 갖고 있더라도 이를 전혀 다루지 않습니다.
Ling-3.0-flash-VL의 모델 카드에 있는 42는 Artificial Analysis의 25와 상충되나요?
직접적으로는 아닙니다. 42는 Intelligence Index 프로토콜 v4.1.1에 따라 측정되었고, 25는 v4.3에 따라 측정되었습니다. 해당 지수는 2026년 9월에 개정되어 전면적으로 다시 채점되었으며, 두 버전은 서로 다른 평가 세트로 구성되어 있습니다. 말할 수 있는 것은 42는 독립적으로 재현된 적이 없고, 25는 독립적으로 산출되었다는 것입니다.
이 둘 중 어느 것이든 호출될 수 있는 곳
Ling-3.0-flash-VL도 InternLumina U2도 우리 모델 카탈로그에 없습니다. 그렇지 않다고 말하는 것은 독자가 10초 만에 확인할 수 있는 주장이 됩니다. Ling-3.0-flash-VL은 Ant 자체 플랫폼을 통해 접근할 수 있는데, 이 플랫폼은 OpenAI 호환 엔드포인트와 Anthropic 호환 엔드포인트를 공개하며, Ling Studio의 무료 체험 액세스를 통해서도, 그리고 직접 서빙한다면 오픈 웨이트를 통해서도 접근할 수 있습니다. InternLumina U2는 Hugging Face 체크포인트와 해당 저장소의 추론 드라이버를 통해, 그 체크포인트가 대상으로 하는 하드웨어에서 접근할 수 있습니다.
우리가 실제로 라우팅하는 것은 이 조합이 실제로 가장 자주 견주어지는 비전 모델입니다: DeepSeek V4 Flash Vision Exp는 1M 토큰 컨텍스트 윈도우와 공개된 요금으로 카탈로그에 라이브 상태이며, 카탈로그의 나머지와 동일한 OpenAI 호환 엔드포인트에서 제공됩니다. 연구소가 오픈 가중치를 공개하면, 라우팅 계층은 보통 해당 연구소의 자체 호스팅 서비스가 안정화되기를 기다리지 않고도 모델을 제공할 수 있습니다 — 이것이 모델이 견적 가능한 것과 호출 가능한 것 사이의 실질적인 차이입니다. 그 차이는 Ling-3.0-flash-VL에서는 현실이고, 당장은 InternLumina U2에서는 이론적인 사안입니다. 후자의 출시 사안은 호스팅 문제라기보다 하드웨어 경로이기 때문입니다.

판정은 정말로 양분되어 있고, 그것은 품질이 아니라 하드웨어와 작업에 따라 갈린다. Ling-3.0-flash-VL은 완성된 릴리스다: MIT, 두 정밀도 형식 모두, 제3자 채점, CUDA 우선, 그리고 이해에 한정된다. InternLumina U2는 더 야심찬 설계이자 덜 완성된 릴리스다: 하나의 하드웨어 스택 체크포인트만 공개되었고, 생성과 3D를 포함하는 통합 6개 작업 표면을 갖췄으며, 기술 보고서는 아직 내야 한다. 이번 주에 NVIDIA 하드웨어에서 비전 모델이 필요하다면 선택은 자명하다. InternLumina U2의 멀티 코드북 설계가 관심사라면, 주목할 것은 NVIDIA 체크포인트다 — 그리고 그때까지 솔직한 입장은, 그것이 지는 행을 포함한 벤치마크 표가 아직 후반부가 출시되지 않은 모델을 설명한다는 것이다.
