Ling-3.0-flash-VL용 타이틀 카드로, 이 모델을 Ant Group의 inclusionAI 연구소가 만든 124B 파라미터, 5.5B 활성 네이티브 멀티모달 전문가 혼합(MoE) 모델이며 2026년 9월 MIT 라이선스로 공개되었고, Artificial Analysis Intelligence Index v4.3에서 25점을 기록하며 초당 142.9개의 출력 토큰을 제공하는 모델로 요약합니다.
Guides & Insights

Ling-3.0-flash-VL: Ant의 5.5B 활성 비전 모델, Intelligence Index에서 25위를 기록하다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Ling-3.0-flash-VL은 이제 앤트 그룹의 누구도 입력하지 않은 벤치마크 수치를 갖게 되었고, 그것이 바로 뉴스다. 앤트의 inclusionAI 연구소에서 나온 첫 네이티브 멀티모달 모델은 Artificial Analysis Intelligence Index에서 25점을 받았다 — 독립적으로 실행된 결과이며, 현재 v4.3 척도를 기준으로 하고, 모델의 속도, 지연 시간, 가격을 나열한 모델 페이지와 함께 공개되었다. 이는 벤더 자체의 모델 카드가 같은 지수에서 42점을 주장한 지 3주 후에 나온 것이며, 독자가 이 두 수치를 가지고 할 수 있는 가장 유용한 일은 그것들이 왜 모순이 아닌지 이해하는 것이다: 앤트는 Intelligence Index 프로토콜 v4.1.1을 기준으로 측정했고, Artificial Analysis는 v4.3을 기준으로 측정했으며, 이 둘은 서로 다른 평가 세트로 만들어진 서로 다른 자다. 벤더의 수치는 제3자와의 접촉에서 살아남지 못했다기보다는, 그것이 작성될 당시 존재하지 않았던 척도로 다시 측정된 것이다.

점수 밑에 있는 모델은 희소 전문가 혼합(MoE) 모델로 총 파라미터 124B, 토큰당 약 5.5B 활성이며, MIT 라이선스로 BF16 및 FP8 가중치와 함께 공개되었고, 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환한다. 그 활성 파라미터 수치가 바로 이 모델의 핵심 논거다. 5.5B 활성으로 Ling-3.0-flash-VL은 오픈 모델에서 가장 흥미로운 곡선, 즉 총 크기가 아니라 활성 파라미터에 대해 그려진 지능의 최전선에 자리한다. 그리고 그것은 이 모델이 거대하기 때문이 아니라 추론 컴퓨팅 단위당 상당한 작업을 해내기 때문에 그 자리에 있는 것이다.

이 글은 실제로 무엇이 언제 출시되었고, 독립 실행 결과는 무엇을 말하며, 파레토 주장이 대부분보다 더 잘 견디는 이유, 모델에 드는 비용과 실제로 어디에서 호출할 수 있는지를 다룬다. 그것만 원하는 독자를 위한 짧은 요약: Ling-3.0-flash-VL은 실존하고, 오픈 웨이트이며, 서빙 비용이 유난히 저렴하고, 동급 규모에서 측정 가능하게 평균 이상이며, 원점수가 시사하는 것보다 눈에 띄게 더 장황하고 출시가 더디다. 공급업체가 주장한 42는 독립적으로 재현된 적이 없고, 현재 보드에 있는 25와 비교할 수 없다.

실제로 출시된 것, 그리고 자꾸만 평탄화되는 타임라인

이 릴리스에 대한 보도는 여러 별개의 사건을 하나의 출시일로 뭉뚱그리는 경향이 있는데, 날짜가 중요한 이유는 초기 기사들이 Ant 외부에서는 아무도 점수를 매길 수 없었던 모델을 왜 다뤘는지 설명해 주기 때문입니다. Hugging Face 저장소인 inclusionAI/Ling-3.0-flash-VL2026년 9월 4일에 생성되었습니다 — BF16 가중치 64개 샤드, MIT 라이선스, bailing_moe_v3_vl 아키텍처를 위한 커스텀 코드 스택, 그리고 며칠 동안은 거의 아무도 다운로드하지 않았습니다. FP8 양자화는 9월 8일에 이어졌으며, 64개 샤드에 걸쳐 약 126GB이고, 비전 타워는 전문가 가중치보다 더 높은 정밀도로 유지되었습니다. Artificial Analysis는 이 릴리스를 2026년 9월 10일로 기재하는데, 이는 자체 페이지가 기준으로 삼는 날짜이며, 점수를 담은 모델 페이지가 그 무렵 공개되었습니다.

"2026년 9월 출시"는 정확하지만 쓸모는 없다. 실질적인 순서는 이랬다: 4일에는 가중치, 8일에는 두 번째 정밀도 형식, 10일에는 독립 측정이 나왔다. 이것이 중요한 이유는, 디스크에 가중치는 있지만 호스팅된 엔드포인트도 제3자 점수도 없는 모델은 대부분의 팀에게 아직 평가할 수 있는 대상이 아니기 때문이다 — 그것은 그에 맞춰 프로비저닝해야 하는 다운로드일 뿐이다. Ling-3.0-flash-VL은 API와 독립 점수가 모두 존재했을 때 그 선을 넘었다.

서빙 지원은 가중치 뒤가 아니라 가중치와 함께 도착했다. Ant는 SGLang 배포 쿡북을 공개했고 해당 아키텍처를 위한 Ling용으로 튜닝된 vLLM 포크를 유지 관리하는데, 이는 오픈 릴리스에서 보통 몇 주씩 뒤처지는 부분이다. 여기서는 뒤처지지 않았다.

보드에 있는 숫자, 그리고 카드에 있는 숫자

다음은 Artificial Analysis가 제공하는 독립적인 분석 결과로, 현재 존재하는 이 모델에 대한 유일한 제3자 측정치입니다:

• 인텔리전스 지수 — 25 v4.3 기준, 동급 크기 64개 중 #2위, 동급 중앙값은 8br /> • 총 파라미터 — 124Bbr /> • 활성 파라미터 — 토큰당 5.5Bbr /> • 출력 속도 — 초당 142.9토큰, 64개 중 #10위, 동종 중앙값 105.1 대비br /> • 첫 토큰까지의 시간 — 2.21초, 동종 중앙값 2.29 대비br /> • 컨텍스트 창 — Artificial Analysis 측정 기준 262K 토큰, 모델 카드 자체에 명시된 256K 대비br /> • 라이선스 — MIT, 오픈 웨이트

그리고 여기, 그것이 그토록 자주 나란히 인쇄되는 벤더 수치가 있습니다: Artificial Analysis Intelligence Index 프로토콜 v4.1.1에서 42로, 텍스트 전용 Ling-3.0-flash가 같은 프로토콜에서 기록한 점수보다 4점 높은 수치입니다. 그 주장은 모델 카드에 실려 있으며, 공개된 평가 기록이 없고, Artificial Analysis가 보고하는 수치도 아닙니다. 두 가지가 동시에 사실입니다: 42는 재현되지 않았으며, 그것이 부정직함의 증거는 아닙니다. 왜냐하면 v4.1.1과 v4.3은 같은 것을 측정하지 않기 때문입니다. Artificial Analysis는 2026년 9월에 자사 지수를 다시 산정하고 전체 보드를 재채점했습니다. v4.3에는 AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, Humanity's Last Exam을 포함한 열 가지 평가가 포함됩니다. 버전을 밝히지 않은 채 여전히 25 옆에 42를 인용하는 기사는 서로 다른 두 테스트를 비교해 놓고 그것을 하락이라고 부르는 셈입니다.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class ranking of #2 of 64, 124B total and 5.5B active parameters, a 262K-token context window, 142.9 output tokens per second, a 2.21 second time to first token, 160M output tokens from the Intelligence Index ranked #8 of 64, and a listed price of $0.00 per 1M tokens in and out.

헤드라인 점수 외에 주목할 만한 세부 사항은 장황함입니다. Artificial Analysis는 Ling-3.0-flash-VL이 지출한 1억 6천만 개의 출력 토큰으로 Intelligence Index를 완료했다고 기록하며, 중앙값 84M 대비 64개 중 8위이고, 이를 "매우 장황함"이라고 표시합니다. 활성 파라미터 수가 적어 추론 비용이 저렴하다는 점을 내세우는 모델에게 이는 그 홍보 문구에 정면으로 어긋납니다. 비용은 파라미터가 아니라 토큰당 지불합니다. 5.5B를 활성화하지만 같은 질문에 답하기 위해 중앙값의 거의 두 배에 달하는 토큰을 출력하는 모델은 그 구조적 이점의 일부를 계산대에서 되돌려줍니다 — 이는 바로 토큰당 가격표가 숨기고 작업당 비용 측정이 드러내는 종류의 상호작용입니다.

파레토 주장에 가해진 약간의 압박

Ling-3.0-flash-VL이 지능 대 활성 파라미터 파레토 프런티어에 있다는 주장은, 이례적으로도, 독립 데이터가 단지 허용하는 데 그치지 않고 뒷받침하는 주장이다. 이 지표에서 동급 중앙값은 8점이고, Ling-3.0-flash-VL은 25점을 기록하며, 토큰당 5.5B 파라미터를 활성화하면서 그렇게 한다. 서비스 가능한 처리량이 결정적 제약인 팀들—단일 가속기, 고정 요청 예산, 엣지 배포—에게 그 비율은 결정의 전부이며, 이는 진정으로 강력한 성과다.

두 가지 유의점 때문에 이것을 깔끔한 승리라고 하기는 어렵다. 첫째는 파라미터 수의 불일치다. 모델 카드에는 약 5.5B 활성이라고 적혀 있는데, SGLang 쿡북은 5.1B 활성 모델이라고 설명한다. 둘 다 Ant 문서이고 차이도 작으며, 방향이라기보다 곡선의 모양을 약간 바꿀 뿐이다. 둘째는 "frontier"가 매주 움직이는 분야에 대한 상대적 주장이라는 점이다. 특정 규모에서 활성 파라미터당 지능이 가장 뛰어나다는 것은 그 대역에서 다음 모델이 출시될 때까지 유지되는 위치일 뿐이며, 이 대역은 경쟁이 치열하다.

벤더가 직접 내세운 대표 시연 — 'linthium'이라는 핸들로 Image-to-WebDev Arena에 참가한 Ling-3.0-flash-VL이 1,441을 기록하며 GPT-5.4의 1,440과 맞붙었다는 — 은 결과가 아니라 눈길을 끌기 위한 장치로 읽어야 한다. 1점 차이는 아레나 Elo의 노이즈 범위 안에 있고, 벤더가 보고한 수치이며, 무언가를 결정지을 만한 격차가 아니다. 그 뒤에 깔린 능력 주장은 숫자보다 더 흥미롭다. 이 모델은 레이아웃에서 프런트엔드 코드를 생성하고, 자신의 출력을 렌더링하고, 그 렌더링 결과를 직접 보고, 교정하는 비전 피드백 루프를 위해 만들어졌다 — 한 번 설명을 달고 멈추는 것이 아니라 관찰하고, 행동하고, 검증하고, 교정하는 것이다.

A single-column scoreboard card for Ling-3.0-flash-VL listing six rows: Intelligence Index 25 on v4.3, active parameters 5.5B, total parameters 124B, context window 262K tokens, output speed 142.9 tokens per second, and license MIT open weights, with a footer noting the index figure is per Artificial Analysis and the vendor card claims 42 on the retired v4.1.1 protocol.

그것이 얼마나 드는지는 보기보다 명확하지 않다.

Artificial Analysis 페이지는 Ling-3.0-flash-VL을100만 입력 토큰당 $0.00, 100만 출력 토큰당 $0.00으로 기재하고 있는데, 이는 동종 모델 중위값인 $0.14 및 $0.40과 대비됩니다. 그것은 가격이 아닙니다. 가격처럼 보이는 것일 뿐입니다. Artificial Analysis는 자기가 볼 수 있는 엔드포인트에 가격을 매기며, 그 볼 수 있는 엔드포인트는 무료입니다. 즉 이 모델은 Ant의 Ling Studio에서 무료 체험판으로 돌아가고 있고, 이 목록이 반영하는 것은 바로 무료 프로모션 접근입니다. Ant 자체의 멀티모달 문서는 이 비전 모델의 토큰당 가격을 전혀 공개하지 않으므로, 이 0을 대조해 볼 벤더 요금표가 존재하지 않습니다. 규모를 가늠해 보자면, 텍스트 전용 형제 모델인 Ling-3.0-flash는 100만 입력 토큰당 약 $0.075, 100만 출력 토큰당 $0.22로 기재되어 왔으며, Ant의 도메인 특화 Ling 변형 모델들 역시 무료 API로 출시되었습니다.

제로 요금을 관세가 아니라 테스트 기간으로 취급하세요. 갓 출시된 모델의 무료 티어는 고객 확보 수단이며, 정직한 계획 가정은 Ling-3.0-flash-VL이 결국 텍스트 형제 모델과 비슷한 수준의 가격을 갖게 되리라는 것입니다. 또한 유료 엔드포인트의 등장으로도 해소되지 않을 모호성이 하나 있습니다. Ant 자체 API 예시는 모델 식별자 Ling-3.0-flash-VL-rc1를 사용하는데, 이는 릴리스 후보 표시이며, 제공되는 체크포인트가 9월 4일 공개 가중치와 바이트 단위로 동일한지는 여전히 불분명합니다. 호스팅 API를 대상으로 자체 프롬프트를 벤치마킹하면서 그 결과가 자체 호스팅 BF16 빌드로도 이어질 것이라고 기대한다면, 그 위에 무언가를 구축하기 전에 검증해야 할 가정입니다.

비용 구도는 어느 쪽에 서 있느냐에 따라 뒤집힌다. 이미 가속기를 보유한 팀이라면, 약 126GB인 FP8 빌드는 8-way 80GB급 노드 안에 들어가고, 5.5B 활성 파라미터 수는 매우 작은 토큰당 컴퓨팅 풋프린트에 대해 해당 노드의 상각 비용을 지불한다는 뜻이다. 이 모델의 가능한 가장 저렴한 버전은 직접 서빙하는 버전이다. 가속기가 없는 팀이라면, 유료 엔드포인트가 무료 티어가 닫히기 전에 도착하는지가 관건이다.

실제로 전화할 수 있는 곳, 우리가 아니라고 말하는 부분까지 포함해서

Ling-3.0-flash-VL은 Ant 자체 플랫폼을 통해 접근할 수 있습니다 — api.ant-ling.com/v1/chat/completionsOpenAI 호환 엔드포인트와, 그 옆에 나란히 있는 Anthropic 호환 엔드포인트를 통해서요 — 게다가 Ling Studio에서의 무료 체험 액세스, 그리고 직접 서빙할 수 있는 오픈 웨이트까지 제공됩니다. 독립 게이트웨이들도 이 모델을 목록에 올리기 시작했는데, 그것이야말로 아무것도 프로비저닝하지 않고 사용해 볼 수 있는 진정으로 가장 빠른 방법입니다.

분명히 짚고 넘어가야 할 점은 OrcaRouter는 현재 Ling-3.0-flash-VL을 라우팅하지 않는다는 것입니다. 저희 모델 카탈로그에 올라 있지 않으므로, 저희를 통해 이 모델을 호출하는 방법에 관해 여기서 읽으실 수 있는 내용은 모두 사실이 아닙니다. 이런 점은 미리 아시는 편이 좋겠습니다. 저희가 실제로 라우팅하는 것은 이 모델과 가장 직접적으로 비교되는 비전 모델인 DeepSeek V4 Flash Vision Exp, 즉 DeepSeek의 실험적 멀티모달 빌드이며, 1M 토큰 컨텍스트 윈도우와 공개된 요금으로 저희 카탈로그에 라이브로 올라와 있습니다. 만약 실제로 필요하신 것이 하나의 OpenAI 호환 엔드포인트 뒤에서 쓸 수 있는 유능한 비전 모델이라면 — 폴백 체인이 구성되어 있어 제공자 쪽에 문제가 생기면 응답이 시작되기 전에 재시도되고, 제공자 목록 가격이 아무것도 덧붙지 않은 채 그대로 전달되어 벤더 가격 변경이 발생한 당일 바로 반영되는 — Ling-3.0-flash-VL이 여전히 카탈로그 밖에 있는 동안 가장 먼저 시도해 볼 모델은 바로 그것입니다.

A release-timeline card for Ling-3.0-flash-VL covering four dated events: the Hugging Face repository created September 4 2026 with MIT-licensed BF16 weights, FP8 weights published September 8 at roughly 126 GB, the release anchored to September 10 by Artificial Analysis, and an independent Intelligence Index score of 25 published the same week, with a footer noting the model is not carried on the OrcaRouter catalogue.

앞으로 지켜봐야 할 것

이번 릴리스가 6개월 뒤에도 중요한 것으로 보일지를 결정할 세 가지가 있다. 첫째는 두 번째 독립 실행이다. 한 평가자의 점수 하나는 데이터 포인트일 뿐이며, 흥미로운 질문은 Ling-3.0-flash-VL이 지능 대 활성 파라미터 곡선에서 차지하는 위치가 다른 하네스에서도 유지되는지다. 둘째는 실제 가격이다. Ant가 비전 모델의 요금표를 공개할 때까지, 그와 관련된 모든 비용 비교는 숫자의 옷을 걸친 추정치일 뿐이고, 무료 등급은 가격이 했을 일을 대신하고 있다. 셋째는 FP8 품질 차이다. 그 빌드에서 비전 타워는 전문가 가중치보다 의도적으로 더 높은 정밀도로 유지되었으며, 양자화된 버전이 세밀한 시각 작업에서 BF16과 일치하는지는 사람들이 벤치마킹하는 대신 실제 프로덕션에서 실행하기 시작해야만 드러나는 종류의 질문이다.

오늘날 내릴 수 있는 평가는 출시 당시 보도가 시사했던 것보다 더 좁고, 점수만 보는 것보다 더 유용하다. Ling-3.0-flash-VL은 실제로 존재하는 MIT 라이선스의 자체 호스팅 가능한 비전 모델로, 124B 파라미터 중 작은 일부만 활성화하며, 현행 독립 지수에서 동급 중앙값 8점에 맞서 25점을 기록하고, 그 우위의 일부를 장황함으로 되돌려준다. 그것은 정직한 형태를 지닌 좋은 모델이다. 카드에 적힌 42는 더 이상 존재하지 않는 자로 잰 숫자다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트