Ling-3.0-flash-VL과 Ling 3.0 Flash의 비교를 위한 히어로 타이틀 카드로, 부제는 '하나의 124B 두뇌, 이제 눈을 달다'입니다. 헤드라인 위에는 두 개의 플랫 라인 아이콘(왼쪽에는 텍스트 문서, 오른쪽에는 액자 위에 놓인 눈)이 있고, 부제 아래에는 얇은 구분선으로 나뉜 두 개의 라벨('동일한 하이브리드-리니어 MoE 백본' 및 '하나는 네이티브 이미지 및 비디오 입력 추가')이 있습니다. 수치나 가격은 표시되지 않습니다. OrcaRouter 로고는 오른쪽 하단에 합성되어 있습니다.
Guides & Insights

Ling-3.0-flash-VL vs Ling 3.0 Flash: 하나의 124B 두뇌, 이제는 눈까지 갖췄다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Ling-3.0-flash-VL과 Ling 3.0 Flash는 경쟁 관계가 아니며, 이 둘의 조합을 모델 대결로 읽는 것은 잘못된 결론에 이르게 한다. Ling-3.0-flash-VL은 Ant Group의 inclusionAI 연구소가 이번 주에 공개한 비전-언어 체크포인트로, 가중치는 2026년 9월 4일부터 MIT 라이선스 하에 Hugging Face에 게재되어 있다. 이 모델은 연구소가 7월 말부터 빠른 티어를 지탱해 온 124B 파라미터의 오픈 가중치 텍스트 모델인 Ling 3.0 Flash 위에 직접 구축되었다. 둘은 동일한 하이브리드 리니어 MoE 설계, 동일한 희소 활성화 경제성, 동일한 256K 컨텍스트 서빙 레시피, 그리고 동일한 MIT 라이선스를 공유한다. VL 체크포인트가 추가한 것은 텍스트 모델이 결코 갖지 못했던 한 가지, 즉 ViT 인코더, 2계층 MLP 프로젝터, VideoRoPE 시간적 인코딩을 통해 처리되는 네이티브 이미지 및 비디오 입력이다. 따라서 이 비교는 단 하나의 실용적인 질문으로 귀결된다 — 워크로드가 결코 이미지를 보지 않는다면, 눈을 가진 모델이 전환할 가치가 있는가?

애초에 이 질문을 던질 가치가 있는 이유는 {{1}}inclusionAI가 Ling-3.0-flash-VL을 별도의 제품 라인으로 규정하지 않기{{/1}} 때문이다. 모델 카드는 이 모델을 “{{2}}우리의 차세대 네이티브 멀티모달 모델{{/2}}”로 소개한다. 즉 Ling-3.0-flash를 기반으로 해당 모델의 {{3}}언어·추론·장문맥 능력{{/3}}을 계승하고, 이해·추론·실행·검증의 전체 과정에 참여하는 비전으로 이를 확장한 모델이라는 뜻이다. {{4}}비전을 단순 부가 입력으로 보는 것이 아니라{{/4}}는 것이다. 초기 플래그십 릴리스가 명시적으로 텍스트 전용이었던 모델 제품군에게 {{5}}이는 실질적인 변화{{/5}}이며, 텍스트 및 도구 팀이 표준으로 삼아야 할 체크포인트도 바뀐다.

체크포인트 두 개, 백본 하나

이번 비교의 상대 모델인 Ling 3.0 Flash는 둘 중 더 성숙한 모델입니다. 2026년 7월 말에 발표되었고 8월 7일에 MIT 라이선스로 오픈소스화된 이 모델은 하이브리드-리니어 혼합 전문가(MoE) 모델로, 총 124B 파라미터와 토큰당 약 5.1B의 활성 파라미터를 보유하고 있습니다. 35개의 KDA 레이어와 7개의 Gated MLA 레이어가 5:1 비율로 적층되어 있으며, 512개의 라우팅 전문가 중 8개가 활성화되고, 256K 네이티브 컨텍스트가 262,144 토큰으로 제공됩니다. 텍스트 전용 모델로 도구 호출을 지원하며, 채팅 템플릿을 통해 기본적으로 thinking이 활성화되어 있고, 그 크기에 비해 이례적으로 낮은 비용 프로필을 갖추고 있습니다. 또한 이 두 모델 중 문서화된 쪽이기도 합니다. Artificial Analysis는 이 모델을 실시간 리더보드에 등재했으며, 동급 63개 모델 중 1위로 선정했고, 공급업체 API에서 초당 약 313토큰의 출력을 측정했습니다.

Ling-3.0-flash-VL은 해당 아키텍처를 유지하면서 그 위에 비주얼 스택을 추가한다. 카드에 따르면 ViT 비주얼 인코더의 특징이 2계층 MLP 프로젝터를 통해 텍스트 공간에 정렬되며, VideoRoPE가 공간 위치와 시간 순서를 모두 인코딩하여 모델이 이벤트 위치 파악과 장문 비디오 추론을 수행할 수 있게 한다. 백본은 동일한 5:1 KDA-to-MLA 하이브리드이며, 이번에는 총 124B / 토큰당 활성 5.5B, 42개 레이어 트렁크로 구성된다. 입력은 텍스트, 이미지, 비디오이고 출력은 텍스트다. 컨텍스트는 최대 1M 토큰으로 광고되며, 권장 SGLang 레시피는 YaRN 스케일링을 통해 256K를 서빙한다. 텍스트 형제 모델과 마찬가지로 기본적으로 thinking-on이 활성화되어 있으며(chat_template_kwargs로 요청별 비활성화 가능), SGLang 또는 사용자 지정 inclusionAI vLLM 포크에서 실행된다. BF16 릴리스는 64개의 safetensor 샤드에 걸쳐 디스크에서 약 250GB로, 텍스트 모델 가중치와 같은 1/4테라바이트급이다.

얼마나 최신 정보인가? 이 글을 작성하는 시점에 VL 저장소의 다운로드 수는 수십 건에 불과하고, 모델 카드는 아직 업데이트 중이며, Artificial Analysis에는 아직 등재되지 않았습니다. 아래 내용 중 Artificial Analysis에 출처를 둔 것으로 명시되지 않은 모든 것은 inclusionAI 자체의 보고입니다.

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash-VL, showing the header '@inclusionAI Ling-3.0-flash-VL', the 'Model card' and 'Files and versions' tabs, the introduction text 'We are introducing Ling-3.0-flash-VL, our next-generation native multimodal model' together with the 124B total / 5.5B activated / up to 1M context summary, and the right-hand sidebar noting License: mit, 42 downloads last month, Safetensors ~125B params, and 'This model isn't deployed — ask for provider support'.

점수판

여기서의 비대칭성은 품질의 문제가 아니라 양식(modality)의 문제입니다. 여섯 가지 차원이 그 결정을 포착합니다:

지능(벤더 카드, AA Index v4.1.1) — Ling-3.0-flash-VL: 42(벤더 보고 수치). Ling 3.0 Flash: 38(카드가 인용한 이전 인덱스 수치).

오늘의 AA 라이브 보드 (v4.3) — Ling-3.0-flash-VL: 아직 등재되지 않음. Ling 3.0 Flash: 추정 25, 동급 63개 중 1위.

입력 — Ling-3.0-flash-VL: 텍스트, 이미지 및 동영상. Ling 3.0 Flash: 텍스트 전용.

컨텍스트 — 둘 다 최대 1M 토큰까지 지원한다고 주장하지만, 실제로는 현재 256K(262,144)로 제공된다.

가격 — Ling-3.0-flash-VL: 아직 공개 가격 없음; MIT 오픈 가중치만 제공. Ling 3.0 Flash: 벤더의 퍼스트파티 API 기준 입력 100만 토큰당 약 $0.07, 출력 100만 토큰당 약 $0.22.

이런 용도로 선택하세요 — Ling-3.0-flash-VL: 문서, 스크린샷, 차트, 비디오 및 GUI 조작 에이전트. Ling 3.0 Flash: 텍스트 중심의 도구 호출 및 장기적 에이전트 파이프라인.

A two-column scoreboard titled 'Ling-3.0-flash-VL vs Ling 3.0 Flash — the scoreboard'. Left column 'Ling-3.0-flash-VL': 'Intelligence (vendor card, AA Index v4.1.1): 42 — vendor-reported', 'AA live board today (v4.3): not listed yet', 'Inputs: text, image, video', 'Context: up to 1M; 256K recipe', 'Price: no list price — MIT open weights', 'Pick it for: documents, video, GUI agents'. Right column 'Ling 3.0 Flash': 'Intelligence (vendor card, AA Index v4.1.1): 38 — earlier AA figure', 'AA live board today (v4.3): 25 estimated, #1 of 63 in class', 'Inputs: text only', 'Context: 256K native; 1M claimed', 'Price: $0.07 / $0.22 per 1M (vendor API)', 'Pick it for: text-heavy agentic pipelines'. Footer reads 'VL figures vendor-reported; Flash figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

텍스트 모델이 들어갈 수 없는 스코어보드

바로 이 지점에서 두 모델이 실제로 갈라집니다. 그 갈림은 경쟁 구도 때문이 아니라 구조적인 이유에서입니다. 이미지 및 비디오 벤치마크에서 텍스트 전용 Ling 3.0 Flash는 아예 항목이 없습니다. 입력을 받을 수 없기 때문입니다. Ling-3.0-flash-VL의 자체 차트 — inclusionAI의 평가로, 재현되지 않았고 일부는 사내에서, 일부는 공식 테스트 설정으로 경쟁사 API를 상대로 실행된 — 는 모델 카드가 강조하는 세 가지 범주에 걸쳐 수치를 제시합니다. 복잡한 이미지 이해에서는 MMMU-Pro 79.0, MathVision 84.87을 기록했고, Humanity's Last Exam-Multimodal에서는 19.88로 훨씬 낮은데, 이는 그 벤치마크가 모든 이에게 얼마나 어려운지를 보여줍니다. 문서 및 차트 작업에서는 OmniDocBench1.5 91.35, CharXiv_RQ 81.30으로 강합니다. 그리고 이번 출시를 흥미롭게 만드는 에이전트형 멀티모달 스위트 — ClawEval-MM 59.9, WebVoyager 90.83, Vision2Web 57.69 — 에서는 인터페이스를 읽고 그에 따라 행동해야 합니다. 이것이 바로 텍스트 모델이 맡을 수 없는 GUI 에이전트 작업입니다.

그 내용들을 맥락 속에서 읽으면 일관된 그림이 드러난다. 이는 이미지를 두고 퀴즈를 맞히는 데 특화된 모델이 아니라, 픽셀을 행동으로 바꾸도록 튜닝된 모델이다. 즉 레이아웃을 읽고, 차트를 따라가고, 페이지를 조작하는 것이다. 공급업체 자체 차트에서 이 모델은 OmniDocBench, WebVoyager, ClawEval-MM에서 세 모델과의 비교(Qwen3.8-27B(높은 추론 강도), Gemini 3.5 Flash-Lite, Kimi-K2.6)를 앞서며, MathVision이나 HLE-MM 같은 어려운 지식·추론 데이터셋에서는 뒤처진다. 그 모든 수치는 중립적인 연구소가 확인할 때까지는 inclusionAI의 주장으로 취급해야 한다. 다만 튜닝의 방향성만큼은 명확하고 일관적이다.

논쟁할 가치가 있는 단 하나의 숫자: 42 vs 38

텍스트 전용 팀이 전환을 결정하게 만들 가장 유력한 주장은 헤드라인에 내건 바로 그 주장이다. inclusionAI는 Ling-3.0-flash-VL이 Artificial Analysis Intelligence Index(v4.1.1)에서 42점을 기록했다고 밝히는데, 이는 동일한 인덱스 버전에서 Ling 3.0 Flash에 부여한 38점보다 4점 높은 수치다. 이 인덱스가 무엇을 측정하는지 주목하자. v4.1.1 합성 지표는 텍스트 및 에이전트 벤치마크 제품군을 기반으로 한다. GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam 등이 포함되며, 그중 어느 것도 이미지 과제가 아니다. 따라서 공급업체는 공유 백본에 시각 훈련을 추가함으로써 모델이 단순히 이미지를 설명할 수 있게 된 것에 그치지 않고, 텍스트 측면의 지능이 4점 향상되었다고 주장하는 셈이다. 이는 놀랍지만 전적으로 그럴듯한 주장이다. 멀티모달 지시 튜닝은 일반적으로 텍스트 능력을 향상시키기 때문이다.

두 가지 소싱 관련 주의사항이 그 수치를 적절한 맥락에 놓이게 한다. 첫째, 38은 더 이른 인덱스 세대의 수치로, Artificial Analysis는 이후 라이브 보드를 더 새로운 인덱스 버전(v4.3)으로 전환했으며, 현재 그 보드에서 Ling 3.0 Flash를 약 25로 평가하면서도 해당 등급의 63개 모델 중 1위로 유지하고 있다. 벤더의 42 대 38 쌍은 더 오래된 척도에 기반한 것이므로, "오늘날 AA가 텍스트 모델에 매기는 점수보다 4점 높다"고 읽어서는 안 된다. 둘째, 42는 inclusionAI가 자체적으로 산출한 수치로, Artificial Analysis가 아직 등재하지 않은 모델에 대한 것이며, inclusionAI는 자체 텍스트 모델 차트가 세부 구분으로 보여주는 개별 텍스트 스위트(SWE-Bench, Terminal-Bench)에 대한 VL 체크포인트 결과를 공개하지 않았다. 4점이야말로 텍스트 전용 파이프라인을 그 수치에 힘입어 전환하기 전에 재현하고 싶은 이득의 크기다.

A screenshot of the Artificial Analysis model page for Ling 3.0 Flash, showing the heading 'Ling 3.0 Flash — Intelligence, Performance & Price Analysis', 'Released August 2026', an estimated 25 on the Artificial Analysis Intelligence Index with a #1-of-63 rank in its class, pricing near $0.07 per 1M input and $0.22 per 1M output tokens, roughly 313 output tokens per second, and technical specs listing text-only input, a 262k context window, and 124B total / 5.1B active parameters.

가격: 하나는 정가가 있고, 다른 하나는 없다.

현재 비용 비교는 가격이 하나만 포함된 비교입니다. Ling 3.0 Flash는 지금 공급업체의 자사 API에서 호출할 수 있으며, 입력 1M당 약 $0.07, 출력 1M당 약 $0.22입니다. 이는 Artificial Analysis의 목록에서 확인된 공급업체 설정 가격으로, 캐시된 입력은 더 저렴하며 출시 기간 할인은 종료되었습니다. Ling-3.0-flash-VL은 어디에도 게시된 API 가격이 없으므로 아직 토큰당 지불할 수 없습니다. 이번 주에 사용하려면 자체 호스팅해야 합니다. BF16에서 약 250GB의 MIT 가중치를 사용하며, 텍스트 모델이 이미 요구하는 것과 동일한 하드웨어 등급 — 4× 141GB GPU(H20-3e 또는 H200), 또는 4-GPU Blackwell 노드(텐서 병렬 처리 4), 또는 TP8의 8× 80GB H100/H800 — 이 필요합니다.

이는 텍스트 전용 팀의 비용 구조를 다시 틀지운다. 토큰을 구매해 사용하는 상황이라면, $0.07/$0.22 가격의 텍스트 모델은 저렴하고 이미 검증된 선택이다. 이미 124B 텍스트 모델을 자체 호스팅하고 있다면, VL checkpoint는 두 번째 인프라 구매가 아니다. 같은 서버 등급에 약 250GB의 가중치(weights)가 추가될 뿐이며, 실제로 픽셀을 소비하는 워크로드가 있을 때만 정당화된다. 눈을 가진 모델은 그 눈이 실제 루프 안에 있을 때만 제 몫을 한다.

누가 어떤 것을 골라야 하나요

텍스트 전용 및 대용량 — Ling 3.0 Flash를 계속 사용하세요. 검증된 AA 등재 모델, 실제 토큰당 가격, 성숙한 tool-calling을 얻을 수 있습니다. VL 모델의 지수 4포인트 향상은 재현되지 않았고, 텍스트 처리량도 측정되지 않았습니다. 그것이 더 나은 텍스트 모델이라는 증거는 아직 없으며, 단지 그렇다는 주장만 있을 뿐입니다.

비전이 루프에 진입합니다 — 여러분의 에이전트가 읽고 클릭해야 하는 문서, 스크린샷, 차트, 사진, 비디오 프레임 또는 UI — Ling-3.0-flash-VL이 명백한 선택입니다. 이미 이해하고 있는 바로 그 추론 백본에 비전 스택이 더해진 모델이지, 처음부터 다시 평가해야 하는 별도의 멀티모달 모델이 아니기 때문입니다.

혼합 트래픽, 미정 — 위험도가 낮은 선택은 한쪽을 중심으로 재설계하는 대신 두 경로를 모두 접근 가능하게 유지하고 요청별로 라우팅하는 것입니다. 그것이 모델 게이트웨이가 제공하고자 하는 특성입니다: 200개 이상 모델에 걸친 단일 API, 공급자 정가를 0% 마크업으로 그대로 전달, 그리고 공급자 성능이 저하될 때의 자동 장애 조치. 아직 어떤 Ling 체크포인트도 OrcaRouter 엔드포인트 뒤에 있지 않습니다. 텍스트 모델의 가격은 공급업체 자체 가격이고, VL 모델에는 호스팅 가격이 아예 없습니다. 하지만 VL에 호스팅 가격이 생기면 그쪽으로 트래픽 일부를 옮겨 측정하는 것은 통합 프로젝트가 아니라 구성 변경일 뿐입니다.

아직 무엇이 빠졌나요?

• 현재 Artificial Analysis Intelligence Index에서 Ling-3.0-flash-VL을 독립적으로 실행한 결과 — 42는 inclusionAI가 이전 인덱스 버전에 대해 언급한 수치입니다.

VL 모델의 호스팅 API 가격 — 이는 캐주얼 채택을 막는 가장 큰 장애물입니다.

• VL 체크포인트용 텍스트 전용 스플릿(SWE-Bench Pro, Terminal-Bench 2.1)을 공개하여, 텍스트 중심 팀이 비전 스택이 성능 저하를 초래하지 않았는지 검증할 수 있게 했습니다.

• 이미지 부하 상태에서 VL의 종단 간 지연 시간 또는 처리량 수치 — 텍스트 모델의 속도는 측정되지만 비전 모델의 속도는 측정되지 않습니다.

• 비전 벤치마크 차트에 대한 중립적 확인: 해당 차트의 일부는 inclusionAI 자체 하네스로 실행되었으며, 적어도 하나의 사내 벤치마크는 추후 공개될 예정이다.

평결

이것은 모델 품질 경쟁이 아니라, 네 가지 요점의 주장이 붙어 있는 모달리티 결정입니다. 입력이 텍스트라면 Ling 3.0 Flash를 유지하세요. 더 저렴하고, AA 등재되어 있으며, 실측된 모델입니다. 그 모델에 대한 VL 모델의 우위는 현재로서는 예전 인덱스 척도에서 나온 공급업체 수치일 뿐입니다. 워크로드가 화면(문서 페이지, 스크린샷, 차트, 비디오 프레임, 에이전트가 조작해야 하는 GUI)에서 시작된다면, Ling-3.0-flash-VL은 여러분이 이미 잘 알고 있는 바로 그 124B 두뇌에 이제 볼 수 있는 능력이 더해진 것이며, 일주일 전만 해도 Ling fast 티어에는 존재하지 않았던 진정한 신규 옵션입니다. 비전이 실제로 필요한 곳에서는 이 모델을 채택하세요. 다만 그 우위에 기대어 무엇이든 전환하기 전에 그 '42'를 검증하고, 독립적인 점수와 공식 가격이 나올 때까지 라우팅 계층에서 선택을 되돌릴 수 있게 유지하세요.