Ling-3.0-flash-VL용으로 생성된 히어로 타이틀 카드. 자막: 'Ant, 패스트 링 라인에서 멀티모달 모델 공개'. 텍스트(Text), 이미지(Image), 숏 비디오(Short video)로 표시된 세 개의 입력 아이콘이 '124B 스파스 MoE · 5.5B 액티브'라고 적힌 칩을 거쳐 텍스트 출력 아이콘으로 이어진다. 푸터에는 'MIT 가중치', '라이브 API', 'FP8' 칩과 '가중치 공개일: 2026년 9월 4일' 메모가 있으며, 오른쪽 하단에는 OrcaRouter 로고가 있다.
Guides & Insights

Ling-3.0-flash-VL: Ant, 빠른 Ling 라인에서 멀티모달 모델 공개

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 4일, Ant Group의 inclusionAI 연구소는 Ling-3.0-flash-VL의 MIT 라이선스 가중치를 Hugging Face에 공개하고, 같은 날 이에 맞춰 Ant Ling 플랫폼 개발자 문서도 업데이트했습니다. Ling-3.0-flash-VL은 Ling-3.0-flash 제품군에서 처음으로 시각 처리가 가능한 체크포인트입니다. 텍스트 전용 Ling-3.0-flash를 늦여름 가장 주목받은 저비용 추론 모델로 만든 바로 그 약 1,240억 개 파라미터 규모의 희소 혼합 전문가(sparse mixture-of-experts) 백본을 그대로 사용하면서, 이제 텍스트뿐 아니라 이미지와 짧은 영상 클립도 읽어냅니다. FP8 양자화는 이 글을 쓰는 바로 그 아침인 9월 8일에 뒤이어 이뤄졌습니다. 이로써 출시 후 4일 만에 독자가 활용할 수 있는 세 가지 접점이 갖춰졌습니다. 공개 가중치, Ant의 Ling 플랫폼 공식 API, 그리고 공급업체가 보고한 Artificial Analysis Intelligence Index 프로토콜 버전 4.1.1 기준 42점(텍스트 전용 형제 모델의 독립 측정치인 38점보다 4점 높은 점수)이 바로 그것입니다. 아직 갖추지 못한 것은 공식 발표입니다. Hugging Face 카드와 개발자 튜토리얼이 출시의 전부이며, 그래서 이 글은 공급업체가 밝힌 내용과 외부인이 검증할 수 있는 내용을 구분해 다룹니다.

이번 릴리스가 중요한 이유는 Ant의 제품 지도에 미치는 영향 때문이다. 2026년 중반까지 Ant의 모델 포트폴리오에서 멀티모달 작업은 별도의 Ming 라인에 속해 있었고, 반면 Ling-3.0-flash는 — 이 블로그의 텍스트 모델 설명 자료에서도 — 에이전트, 코딩, 딥 리서치를 위한 빠른 텍스트·도구 계층으로 자리매김되어 있었다. Ling-3.0-flash-VL은 그 경계를 허문다. 비정상적으로 작은 활성 파라미터 규모와 긴 에이전트 실행을 중심으로 구축된 추론 모델에 시각 정보를 통합하며, 그 결과를 개발자에게 세 가지 방식으로 동시에 제공한다. 이는 가중치 없이 무료 API로 제공되었던 이전의 도메인 특화 변형 모델들(Ling-3.0-flash-Fin, Ling-3.0-flash-Sante)과는 확실히 다른 결정이다. 이번 모델은 오픈소스이고 Ant의 유료 플랫폼에서 실행되며, 출시된 지 얼마 안 되어 공급업체 외부에서는 아직 독립적인 실행 결과를 발표한 사람이 없다. 이 마지막 사실이 이 글에서 가장 중요한 부분이다.

무엇이 출시되었고, 언제였는가

아래의 모든 날짜는 저장소와 문서에서 확인할 수 있으며, 그 어느 것도 존재하지 않는 보도자료에 근거하지 않습니다.

• 9월 4일 — Hugging Face 저장소인 inclusionAI/Ling-3.0-flash-VL이 15:24 UTC에 생성되었는데, 64개의 bf16 가중치 샤드, 전체 커스텀 코드 스택(bailing_moe_v3_vl 아키텍처용), 기본적으로 추론이 활성화된 채팅 템플릿, MIT 라이선스를 갖추고 있었습니다. 작성 시점 기준 다운로드 수는 수십 건에 불과하며, 저장소를 주시하는 사람만이 첫날에 알아차렸을 법한 배포입니다.

• 9월 4일 — Ant의 Ling-platform 개발자 포털이 공식 API에서 모델을 문서화하는 멀티모달 이해 튜토리얼을 추가했습니다(페이지 자체의 "마지막 업데이트" 표시는 2026년 9월 4일로 되어 있습니다). 중국 개발자 미디어는 다음 날 이 기능을 보도하면서, 시각적 질문 응답 및 콘텐츠 분석을 위한 이미지 및 숏비디오 이해로 설명했습니다.

• 9월 5일 이후 — 서빙 및 배포 지원이 빠르게 등장했다: 해당 모델용 SGLang 배포 쿡북, inclusionAI 조직이 유지보수하는 맞춤형 vLLM 포크, 그리고 즉시 사용 가능한 chat-completions 엔드포인트를 갖춘 자체 가중치(BYOW) 배포 라이브러리 목록이 그것이다. 이들은 런타임과 인프라일 뿐 공식 발표는 아니지만, 이 모델이 단순히 공개된 것이 아니라 실제 서빙되도록 설계되었음을 보여준다.

• 9월 8일 — FP8 양자화를 적용한 inclusionAI/Ling-3.0-flash-VL-fp8이 공개됐다(64개 샤드, 약 126GB). 비전 타워는 의도적으로 더 높은 정밀도로 남겨 두고, MoE 가중치만 FP8 E4M3로 압축한 형태다. GPU가 적거나 사양이 낮은 환경에서 자체 호스팅하려는 사람들이 실제로 내려받게 될 체크포인트는 바로 이것이다.

An English screenshot of the Hugging Face model page for inclusionAI/Ling-3.0-flash-VL (captured September 8, 2026), showing the model tags text-generation, safetensors, bailing_moe_v3_vl, conversational and custom_code, a 'License: mit' badge, 'Downloads last month 42', model size 125B params, and an Inference Providers note that the model is not deployed by any provider. The card text introduces Ling-3.0-flash-VL as a 'next-generation native multimodal model' built on Ling-3.0-flash with 124B total parameters, only 5.5B activated per token, image and video inputs, and a context window of up to 1M tokens.

위 카드는 이번 릴리스에서 출시 공지에 가장 가까운 자료입니다. 모델 설명, 아키텍처, SGLang 및 vLLM 레시피 링크가 포함되어 있으며, 다른 곳에서는 출시 공지를 찾을 수 없습니다. 먼저 짚고 넘어가야 할 불일치가 하나 있습니다. 모델 카드에는 "토큰당 5.5B 파라미터만 활성화"라고 명시되어 있지만, 같은 시기에 작성된 SGLang 쿡북에는 "5.1B 활성" 모델로 설명되어 있습니다. 새로 출시된 체크포인트에서 이런 차이는 서로 다른 두 모델이라기보다는 비전 타워 계산 방식의 차이일 가능성이 높지만, 이런 세부 사항은 애매하게 덮어두기보다는 미해결 상태로 표시해야 한다는 점이 분명합니다.

124B 모델이 5.5B만 활성화 — 이제 시각 기능까지 갖췄습니다

Ling-3.0-flash-VL은 텍스트 계열 모델을 정의한 하이브리드 희소 MoE 방식을 그대로 유지합니다. 모델 카드에 따르면 42개 레이어로 구성된 백본은 Kimi-Delta-Attention과 Gated-MLA 레이어를 5:1 비율로 교차 배치하며, 이는 Ling-3.0-flash와 동일한 구조적 리듬입니다. 총 파라미터는 약 1,248억 개이고 토큰당 활성화되는 파라미터는 극히 일부에 불과합니다. 새로 도입된 부분은 지각 스택입니다. ViT 시각 인코더가 2계층 MLP 프로젝터를 통해 언어 백본에 입력을 전달하며, VideoRoPE가 공간 및 시간적 위치를 모두 인코딩하여 비디오 프레임이 모델이 추론할 수 있는 순서로 들어오게 합니다. 입력은 텍스트, 이미지, 비디오이며 출력은 텍스트입니다.

• 매개변수 — 벤더 카드에 따르면 총 124B, 토큰당 약 5.5B 활성화(위의 회계 유의사항 참조).

• 맥락 — "최대 1M 토큰"으로 광고되었지만, 현재 존재하는 배포 레시피들은 YaRN rope scaling을 통해 256K를 실행한다. 이는 누군가 검증된 더 긴 실행을 발표할 때까지 계획에 반영할 현실적이고 정직한 수치다.

• Thinking — 추론은 채팅 템플릿을 통해 기본적으로 활성화되어 있습니다. 공식 API 예제와 서빙 레시피 모두 요청별 enable_thinking: false 스위치를 지연 시간에 민감한 호출에 사용할 수 있음을 보여 줍니다.

• 라이선스 — MIT, 두 정밀도 형식 모두, 추가 조항 없음. 이는 텍스트 모델의 8월 오픈소스 공개를 주목할 만하게 만든 바로 그 깔끔한 라이선스이며, 자체 호스팅이 회색 지대가 아닌 현실적인 선택지가 되는 전적인 이유입니다.

설계 의도는 사양표만큼 중요하다. Ant는 Ling-3.0-flash-VL을 "이해, 추론, 행동, 검증의 전체 과정에 시각 정보를 통합하는" 모델로 자리매김하는데, 이는 이미지 캡셔닝이 아니라 에이전트형 워크로드의 언어다. 30초 분량의 화면 녹화를 지켜보고, 긴 도구 호출 세션을 컨텍스트에 담아 유지하면서 활성화 비용을 약 5B 파라미터 수준으로 억제할 수 있는 모델은 전적으로 컴퓨터 사용(computer-use) 및 짧은 동영상 기반 에이전트를 겨냥한다. 이는 단일 이미지 질의응답에 최적화된 비전-언어 모델과는 다른 성격의 제품이며, 아래의 모든 벤치마크는 바로 이 틀에서 읽어야 한다.

공식 API가 실제로 허용하는 것

Ant Ling 플랫폼 튜토리얼은 Ling-3.0-flash-VL을 두 가지 API 형태로 문서화합니다: OpenAI 호환 엔드포인트는 api.ant-ling.com/v1/chat/completions이고, Anthropic 호환 엔드포인트는 api.ant-ling.com/anthropic/v1/messages입니다. 이를 사용해 개발하기 전에 알아두어야 할 제약 사항은 다음과 같습니다:

• 이미지 — JPEG 및 PNG, base64만, 요청당 최대 40개의 이미지, 각 이미지는 최대 16,384 × 784 픽셀이고, 각 base64 문자열은 최대 32MB입니다. OpenAI 호환 image_url.detail 매개변수는 무시됩니다. 엔진이 내부적으로 해상도를 결정합니다.

• 비디오 — MP4, MOV 또는 WMV. 요청당 하나의 클립, 최대 30초, 고정 2fps로 샘플링되어 최대 32프레임, base64 최대 32MB. 비디오는 OpenAI 호환 엔드포인트에서만 작동합니다. Anthropic 호환 엔드포인트는 텍스트와 이미지는 허용하지만 비디오는 허용하지 않습니다.

• 모델 식별자 — 튜토리얼의 curl 예제가 호출하는 모델은 Ling-3.0-flash-VL-rc1이지, Ling-3.0-flash-VL이 아니다. 그 -rc1 접미사는 릴리스 후보 표시이며, 진짜 미해결 질문입니다. 문서에는 플랫폼이 어떤 가중치를 제공하는지 또는 API 체크포인트가 9월 4일 오픈 가중치 빌드와 일치하는지에 대해 아무것도 나와 있지 않습니다. API를 오픈 가중치와 비교하여 평가한다면, 그것이 가장 먼저 테스트할 사항이지, 가정할 일이 아닙니다.

An English screenshot of Ant's Ling-platform developer tutorial 'Multimodal Understanding' (captured September 8, 2026, cropped to the article column), which opens 'Ling-3.0-flash-VL is a vision-language model that supports multimodal inputs and understands text, images, and video', then lists the image-understanding limits: JPEG and PNG formats, each image up to 16,384 × 784 pixels, each base64 string up to 32 MB, up to 40 images per request and a 32 MB maximum request body, with OpenAI Chat Completions and Anthropic Messages API columns.

위 페이지는 입력 제약 조건이 정의된 곳입니다 — 이미지 및 비디오 형식, 요청당 상한, 그리고 두 가지 엔드포인트 형태가 그 내용입니다. 또한 해당 모델이 문서에만 존재하는 스텁이 아니라 실제 상용 API 제공물임이 확인되는 곳이기도 합니다.

그 숫자들 — 그리고 그것을 보고한 사람들

A generated single-column scoreboard titled 'Ling-3.0-flash-VL — the scoreboard', with rows 'Released: Sep 4 2026 — MIT weights plus live API', 'Architecture: 124B sparse MoE, ~5.5B active per token', 'Inputs: text, images, short video', 'Context: up to 1M tokens', 'AA Intelligence Index: 42 (vendor-reported)' and 'Text sibling Ling-3.0-flash: 38 (AA-measured)', with the footer 'VL figure per Ant model card; 38 measured by Artificial Analysis.' and the OrcaRouter logo bottom-right.

카드에 적힌 핵심 수치는 Artificial Analysis Intelligence Index 프로토콜 버전 4.1.1 기준 42점이다. Ant는 이 점수가 텍스트 전용 Ling-3.0-flash의 38점보다 4점 앞선 수치라고 밝혔다. 이 문장에서의 구분은 중요한 의미를 담는다. 38점은 Artificial Analysis 측정값으로, 독립적으로 실행되어 그들의 리더보드에 게재되었고, 해당 텍스트 모델에 대한 업계 보도 전반에서 호의적으로 인용된 수치다. 반면 42점은 Ant 자체 모델 카드에 기재된 주장으로, AA 인덱스 프로토콜을 따르기는 했지만 아직 Artificial Analysis에는 등재되지 않았다. 이 글을 쓰는 시점 기준 Artificial Analysis에는 Ling-3.0-flash-VL 페이지가 없다. Ant 외에는 아직 이 체크포인트를 실행한 사람이 없다. 42는 텍스트 모델의 실제 38점을 만들어낸 것과 같은 계열의 업체 제공 수치로 받아들여야 한다. 즉, 확인해 볼 이유가 되는 숫자이지, 확립된 수치로 인용할 숫자가 아니다.

릴리스의 나머지 내용은 질적이거나 방법론적 성격입니다. 모델 카드는 '이해, 추론, 행동' 역량 차트를 통해 모델을 설명하고, AA 스타일 프로토콜에 따라 실행된 에이전트형 Terminal-Bench 평가를 암시하지만, 여기서 재현할 수 있는 수치 텍스트 결과는 공개하지 않습니다. 배포 쿡북에는 특정 서빙 구성과 연계된 정확도 셀(MMMU-Pro, GSM8K)이 나열되어 있어 읽어볼 가치가 있지만, 이는 인프라에 인접한 측정값일 뿐 독립적인 평가는 아닙니다. 솔직한 요약은 짧습니다. 아직 공개된 독립 점수판이 없는, 그럴듯하고 서빙 비용이 저렴하며 비전 기능을 갖춘 추론 모델이라는 것입니다.

비용이 얼마인지, 그리고 가족력이 시사하는 바

Ant의 멀티모달 튜토리얼에는 Ling-3.0-flash-VL의 토큰당 가격이 명시되어 있지 않으므로, 여기 제시된 모든 내용은 추정치이며 그렇게 명확히 표기합니다. 유용한 기준점은 같은 플랫폼에 있는 텍스트 형제 모델입니다. Ling-3.0-flash의 자사 공시 가격은 입력 토큰 100만 개당 약 $0.075, 출력 토큰 100만 개당 $0.22이며, 캐시 읽기는 약 80% 저렴합니다. 또한 중국 콘솔에서는 8월 31일에 종료된 초기 75% 할인 프로모션 이후 인민폐(입력 100만 토큰당 ¥0.40 / 출력 100만 토큰당 ¥1.20)로 가격을 표시합니다. 124B-A5.5B 멀티모달 모델은 124B-A5.1B 텍스트 모델보다 서빙 비용이 더 높습니다. 비전 타워는 덴스 구조이며 모든 이미지 토큰에 대해 실행되기 때문입니다. 따라서 해당 가격대와 같거나 그보다 약간 높은 수준이 합리적인 사전 기대값입니다. 제품군의 이력은 반대 방향으로도 작용합니다. Fin 및 Sante 도메인 변형 모델은 무료 API로 출시되었으므로, Ant는 시장에 내놓고 싶은 Ling 변형 모델의 채택을 촉진하기 위해 제로 가격 책정을 사용할 의향이 있음을 보여주었습니다. VL이 유료 텍스트 모델 가격대를 따를지, 아니면 무료 변형 모델 패턴을 따를지는 아직 공개되지 않았습니다.

셀프 호스트 경로의 경우 파일이 공개되어 있으므로 수치는 구체적입니다. bf16 릴리스는 대략 64개 샤드에 걸쳐 250GB 다운로드로, 가장 큰 단일 노드가 아니라면 멀티 GPU가 필요한 수준입니다. 반면 FP8 릴리스(약 126GB, 비전 타워는 bf16 유지)는 8×80GB급 가속기를 갖춘 노드에 무리 없이 들어가며, 대부분의 팀이 실제로 실행할 버전입니다. 서빙 쿡북의 처리량 주장은 존재하지만 벤더와 관련된 것이므로, 실제 token/s는 하드웨어와 배치에 따라 달라진다는 흔한 단서가 붙는다고 생각하면 됩니다.

라우팅 계층이 어디에 맞는지 — 솔직히

출시 시점에 우리가 확인한 주요 타사 모델 게이트웨이 중 Ling-3.0-flash-VL을 등재한 곳은 없으며, 이 블로그가 속한 라우팅 플랫폼인 OrcaRouter도 이를 제공하지 않습니다. 이 글의 어떤 내용도 그런 의미로 읽혀서는 안 됩니다. 이는 출시 4일 된 모델의 솔직한 현실이며, 독자가 오늘 실제로 가진 선택지가 정확히 두 가지이기 때문에 분명히 밝힐 가치가 있습니다. Ant의 공식 API를 호출하거나 MIT 가중치를 자체 호스팅하는 것입니다. 라우팅 관점은 그다음에 이어질 이야기입니다. 이러한 모델이 타사 서빙에 도달하면, 패스스루 라우터의 경제 구조가 평가 시 이를 선호해야 하는 이유가 됩니다. 공급업체 공시 가격을 0% 마크업으로 그대로 전달하기 때문에, 공급업체의 가격 인하(또는 Fin 및 Sante 출시와 같은 무료 티어 실험)는 발표된 당일 바로 적용되며, 자동 장애 조치 덕분에 한 공급업체의 가동 시간이나 단일 체크포인트의 동작에 전체 스택을 걸지 않고도 며칠 된 오픈 모델에 실제 워크로드를 연결할 수 있습니다. 한 차례 가격을 재조정했고 6주 만에 네 가지 변형으로 분화된 모델 패밀리에게 이는 가상의 시나리오가 아닙니다. Ant가 움직일 때마다 수동으로 다시 테스트하는 것과 하나의 API를 통해 한 번만 다시 테스트하는 것의 차이입니다.

볼 것

이번 릴리스는 너무 최신이라 유용한 신호는 대개 누구나 직접 실행해 볼 수 있는 검증 항목들뿐이다. 첫째, Artificial Analysis(또는 다른 독립 연구소)가 Ling-3.0-flash-VL을 목록에 올려 42라는 수치를 확인하거나 수정하는지 여부 — 그 하나의 데이터 포인트가 "이 제품군의 최고 모델"과 "또 다른 벤더의 숫자"를 가른다. 둘째, 공식 API의 -rc1 식별자가 9월 4일자 오픈 가중치로 확인되는지 여부; 만약 그렇지 않다면 API와 자체 호스팅 경로는 서로 다른 모델이므로, 여러분이 읽는 모든 비교는 어느 쪽을 사용했는지 명시해야 한다. 셋째, 가격 책정: Ling 플랫폼에 공개된 VL 요금, 그리고 그 요금이 텍스트 모델의 유료 요금 구간을 따르는지 아니면 Fin/Sante의 무료 API 방식을 따르는지 여부. 넷째, FP8 체크포인트가 실제 서빙 환경에서 그 카드의 정확도를 유지하는지 — 비전 타워를 bf16으로 유지한 것은 좋은 신호지만, 양자화된 비전에 대한 주장은 설정(config)이 아니라 실행(run)으로 검증해야 한다. 다섯째, 제품 포트폴리오 문제: 이제 비전이 빠른 Ling 라인에 포함되었으니, Ant가 Ming을 별도의 멀티모달 브랜드로 유지하는지, 아니면 두 제품이 수렴하도록 두는지 지켜봐야 한다.

개발자에게 단기적인 답은 짧습니다. 오늘 이를 기반으로 구축하려면, 공식 API는 인프라 없이 시작할 수 있는 경로이고 FP8 가중치는 자체 호스팅 경로이며, 이번 주부터 둘 다 실제로 사용할 수 있습니다. ‘42’라는 숫자를 기반으로 구축하려면 Ant 외부에서 이를 재현할 때까지 기다리세요. Ling-3.0-flash-VL에 대해 진정으로 유용한 모든 것, 즉 MIT 가중치, 그럴듯한 아키텍처, 공격적인 가격 대비 활성화 설계, 그리고 진지하게 고려할 만한 벤더 점수는 모두 갖추어져 있습니다. 하지만 이 모델을 안전한 기본 선택으로 만들기 위한 것들은 여전히 미해결로 남아 있습니다.