'Ling-3.1-flash, AA Intelligence Index 41점 달성'의 히어로 타이틀 카드, 부제는 'Ant Group의 총 560B / 활성 25B MoE'. 큰 둥근 카드에는 숫자 '41'과 'Artificial Analysis Intelligence Index v4.3.2' 라벨이 들어 있고, 그 아래 두 번째 작은 카드에는 'vs 20'과 'Ling-3.0-flash' 라벨이 적혀 있다. 하단 줄에는 '지수 수치는 Artificial Analysis가 독립적으로 측정했으며, 모델은 2026-10-01에 공개됨.'이라고 쓰여 있다. OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

Ling-3.1-flash, Artificial Analysis Intelligence Index에서 41점 달성: 560B MoE, 전작 대비 두 배

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Ant Group의 5,600억 개 매개변수 전문가 혼합(MoE) 모델인 Ling-3.1-flash는 이제 자체 연구소가 직접 산출하지 않은 숫자, 즉 Artificial Analysis Intelligence Index에서 41을 달고 있다. 이 지수는 독립 평가자가 평가자가 통제하는 하드웨어에서 고정된 테스트 스위트를 대상으로 운영하며, 이 모델을 자사의 직계 전신인 Ling-3.0-flash보다 21점 높은 위치에 놓는다. Ling-3.0-flash는 같은 지수에서 여전히 20에 머물러 있다. Ant Group은 2026년 9월 말 Ling-3.1-flash를 발표했고, Artificial Analysis는 출시일을 10월 1일로 본다. 이 모델은 자신이 점수를 두 배로 끌어올린 모델보다 세 달 더 젊다.

그 격차가 바로 이 이야기의 핵심이다. 열 가지 서로 다른 평가가 반영되는 종합 지표에서의 21포인트 변동은 벤더의 차트가 조작할 수 있는 종류의 것이 아니며, 이 블로그가 2주 전에 다룰 수 있었던 종류의 것도 아니다. 당시 Ling-3.1-flash에 대해 유일하게 존재하던 측정치는 Ant 자체의 벤치마크 카드였다: GDPval-AA v2.1에서 1,673 Elo, FrontierSWE에서 75.16, HealthBench Professional에서 65.35. 그 수치들은 실제 연구소의 실제 주장이었지만 재현되지는 않았다. 41은 성격이 다르다. 그것은 이번 릴리스에서 제3자가 검증할 수 있는 첫 번째 수치다.

41이 실제로 측정하는 것

Artificial Analysis Intelligence Index v4.3.2는 열 가지 평가로 구성된 가중 복합 지표입니다: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1. 복합 지표를 단독으로 해석하는 것은 잘못이므로, 헤드라인 수치보다 평가별 행이 더 중요합니다:

• GDPval-AA — Ling-3.1-flash는 1,621.75로, Ling-3.0-flash의 948.35와 대비됩니다. 이는 이 세트에서 가장 큰 단일 상승 폭이며, 지수 변동의 대부분이 여기에 달려 있는 항목입니다.

• GDP.pdf — 전 항목 통과 0.100, 0.054에서 상승. 절대적인 수치로는 여전히 낮지만, 거의 두 배로 늘었다.

• AA-LCR v1.1 장문맥 추론 — 이전 모델의 0.73 대비 0.83, 그리고 DeepSeek V4.1 Flash(Max)의 0.84와 동일한 수준.

• SciCode — 0.541 대 0.420. 채팅 품질의 향상이 아니라 코딩 과학 분야의 향상이다.

• CritPt 물리 추론 — 0.180, 이전의 0.017 대비. 작은 기반에서 이전 모델보다 열 배.

• AA-Omniscience — +2.22, Ling-3.0-flash의 −17.88과 대비된다. 이 항목은 헤드라인에 어긋나기 때문에 아래에서 다룬다.

Ling-3.0-flash는 이 행들에서 Ling-3.1-flash에게 단순히 진 것이 아니라, 그중 두 행에서는 완전히 무너졌다. AutomationBench-AA에서 0.032를 기록했고 Terminal-Bench 4.0에서는 정확히 0.000을 기록했다. 41은 바로 이런 맥락에서 읽어야 한다 — 전신 모델은 사실상 에이전트형 터미널 능력이 전혀 없었던, 효율적이고 저렴한 오픈 가중치 모델이었다.

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

이득이 나온 곳: 대화가 아닌 에이전트 작업

Ling-3.1-flash의 지수 기여도를 가장 자주 나란히 비교되는 두 Flash 등급 모델과 대조해 보면, 총합이 감추고 있는 패턴이 드러난다. DeepSeek V4.1 Flash (Max)는 같은 지수에서 39를 기록하고 GLM 5.3 Flash는 42를 기록하므로, 세 모델 모두 3점 범위 안에 들어온다. 하지만 그들은 서로 다른 지점에서 거기에 도달한다.

• 에이전트형 터미널 작업 — Terminal-Bench 4.0에서 Ling-3.1-flash 0.333, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.

• 에이전트 기반 실제 업무 — GDPval-AA에서 Ling-3.1-flash 1,621.75 Elo, DeepSeek V4.1 Flash (Max) 1,600, GLM 5.3 Flash 1,646.86.

• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash(Max) 0.689, GLM 5.3 Flash 0.604.

• 코딩 과학 — SciCode에서 Ling-3.1-flash 0.541, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516.

좁게 읽으면 Ling-3.1-flash는 에이전트 벤치마크에서 경쟁력이 있고 SciCode에서는 약간 앞선다. 유용하게 읽으면, 사람들이 "툴 루프를 돌릴 수 있는가"라고 말할 때 대개 의미하는 두 가지 에이전트-터미널 지표에서 셋 중 가장 강하다 — 그리고 지식-신뢰성 지표에서는 그 둘 모두에게 뒤진다. 이는 일반적인 승리가 아니라 특정한 형태이며, 누구든 지수 숫자만 보고 워크로드를 사기 전에 짚고 넘어갈 가치가 있다.

더 큰 모델과 함께 오는 청구서

Ling-3.0-flash는 Ant 자체 API에서 백만 입력 토큰당 $0.07, 백만 출력 토큰당 $0.22로 가격이 책정되었으며, MIT 라이선스의 오픈 가중치였습니다. Ling-3.1-flash는 아직 이 두 가지 중 어느 것도 아닙니다. Artificial Analysis는 서빙 제공자로 InclusionAI 자체 API를 기준으로 측정한 실행 비용을 백만 입력당 $0.30, 백만 출력당 $0.90으로 기록하며, 캐시 적중률 요금은 $0.06으로 입력 대비 80% 할인입니다. 이는 대체하는 모델보다 입력 가격이 약 4배 오른 대가로 21포인트의 지수 상승을 얻은 것입니다.

그 거래가 좋은지는 전적으로 워크로드에 달려 있으며, 지수 자체가 그 비용을 매길 수 있습니다: 해당 요율로 Ling-3.1-flash에 대해 10개 Intelligence Index 평가를 모두 실행하면 약 $960이 드는 반면, DeepSeek V4.1 Flash (Max)는 약 $477, GLM 5.3 Flash는 $280입니다. 이유는 요율표만이 아닙니다. Ling-3.1-flash는 매우 말이 많은 추론 모델입니다 — 지수를 처리하는 동안 2억 2천만 개의 출력 토큰을 소모했는데, 이는 해당 가격 등급의 중앙값을 훨씬 웃도는 수준이며, 평가 실행은 작업당 평균 약 357초로, DeepSeek V4.1 Flash (Max)의 285초, GLM 5.3 Flash의 979초와 대비됩니다. 작업당 기준으로 Ling-3.1-flash는 약 $0.99가 드는 반면, DeepSeek는 $0.27, GLM 5.3 Flash는 $0.25입니다.

이 중 어느 것도 41에서는 보이지 않지만, 그 모두가 인보이스에 청구된다. 모델은 지수에서는 이기고 예산에서는 질 수 있다.

헤드라인에 반박하는 두 숫자

첫 번째는 지식 신뢰성이다. Ling-3.1-flash는 모델이 자신이 아는 것을 아는지 측정하는 AA-Omniscience에서 +2.22점을 기록한다: 정답은 점수를 얻고, 환각은 점수를 잃으며, 거부는 아무 비용도 들지 않는다. 정확도는 29.1%, 환각률은 37.9%다. 같은 계열 모델들과 나란히 놓으면 이는 그룹에서 가장 약한 프로필이다 — GLM 5.3 Flash는 환각률 27.6%로 +7.47점을 기록하고, DeepSeek V4.1 Flash (Max)는 답변한 질문 중 무려 96.5%의 환각률로 −5.30점을 기록한다. 이 종합 평가는 Ling-3.1-flash가 보여주는 능력에 보상을 주는 것이지, 그것을 보여주는 신뢰성에 보상을 주는 것이 아니다. 그리고 자신이 주장하는 것의 3분의 1을 만들어내는 모델은 프로덕션에서 주변에 검색(retrieval)을 필요로 한다.

두 번째는 컨텍스트입니다. Artificial Analysis는 Ling-3.1-flash를 1,000,000토큰 컨텍스트 창으로 표기합니다. Ant의 자체 릴리스 자료에서도 목표로 1M을 언급합니다. 하지만 패밀리의 창을 모델별로 열거하는 Ant의 개발자 문서는 Ling-3.0-flash에 네이티브 256K, 1M까지 확장 가능을 부여하고 있으며 Ling-3.1-flash에 대한 항목은 아직 전혀 싣고 있지 않습니다. 실제로 측정된 눈에 띄는 장문 컨텍스트 행 — AA-LCR 0.83 — 은 장문 컨텍스트에 대한 추론 점수이지, 제공되는 창 측정값이 아닙니다. 1M을 선언된 상한으로 취급하고, 이를 기준으로 설계하기 전에 직접 장문 컨텍스트 요청으로 실제 제공되는 창을 검증하십시오.

사양서상에서 어떻게 비교되는지

차원별 그림, 각 줄에 주체 먼저:

• 총 파라미터 — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.

• 모델별 활성 파라미터 — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash가 가장 많이 활성화되며, 이는 서빙 비용이 현재 수준에 머무는 이유 중 하나입니다.

• 가중치 및 라이선스 — Ling-3.1-flash는 공개되지 않음(독점, 라이선스 문구 없음) vs DeepSeek V4.1 Flash (Max)는 MIT 하에 공개 vs GLM 5.3 Flash는 MIT 하에 공개.

• 선언된 컨텍스트 — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. 세 모델 모두 같은 상한을 주장하지만, 그중 둘만이 그 주장을 검증할 수 있는 다운로드 가능한 체크포인트를 갖고 있다.

• 모달리티 — Ling-3.1-flash는 텍스트 입력, 텍스트 출력인 반면, DeepSeek V4.1 Flash (Max)는 텍스트 및 이미지 입력, GLM 5.3 Flash는 텍스트, 이미지 및 비디오 입력입니다. 이는 Ling-3.1-flash가 그저 뒤처져 있는 유일한 축이며, 어떤 벤치마크 행도 이를 상쇄하지 못합니다.

• 공급업체 API 가격 — Ling-3.1-flash $0.30 / $0.90 (입력/출력 100만 토큰당) vs DeepSeek V4.1 Flash (Max) $0.30 / $1.20 vs GLM 5.3 Flash $0.15 / $0.50.

• 인덱스 점수 — 41 대 39 대 42. 3자 비교에서 3점의 격차는 순위가 아니다. 그것은 독자의 작업 부하가 우연히 닮은 평가에 따라 동점이 깨지는 것일 뿐이다.

그것을 부를 수 있는 곳

Ling-3.1-flash는 오늘 OrcaRouter 카탈로그에 없습니다 — InclusionAI에 속한 해당 모델을 우리 공개 모델 API에서 조회하면 not-found가 반환되며, 우리는 그렇지 않은 것처럼 암시하지 않겠습니다. 현재 이 모델은 Ant 자체 API와 이 릴리스를 제공하는 타사 플랫폼에서 실행되며, 이것이 이 모델의 가용성에 대해 솔직하게 말할 수 있는 전부입니다. 위 세 모델을 비교하는 분들이 주목할 만한 점은 나머지 두 모델이 지금 바로 라우팅 가능하다는 것입니다: DeepSeek V4.1 Flash와 GLM 5.3 Flash는 모두 OrcaRouter 카탈로그에 각 공급사의 정가에 마크업을 붙이지 않고, 단일 API 키 하나로, 둘 사이 자동 페일오버와 함께 제공됩니다. 위 비교에서 여러분의 워크로드가 에이전트형 터미널 작업보다 지식 신뢰성을 더 중시한다면, GLM 5.3 Flash가 시도해 볼 만한 모델입니다 — 그리고 두 번째 계약이나 새 클라이언트 코드 한 줄 없이 동일한 키로 DeepSeek V4.1 Flash와 비교해 사용해 볼 수 있습니다.

41가지 변경 사항이 바꾸는 것과 바꾸지 않는 것

이것이 바꾸는 것은 이번 릴리스의 위상이다. Ling-3.1-flash는 더 이상 벤더 차트가 덧붙은 스펙이 아니다. 그것은 독립적으로 측정된 위치를 지닌 모델이며, 그 위치는 Ling-3.0-flash 대비 에이전트 역량에서 진정한 세대적 도약이다. 이는 동일한 레시피에 연산을 더 투입한 것이 아니라 설계 변경에서 비롯된 종류의 도약이다. 조달과 관련해서는 바뀌는 것이 없다. 가중치는 여전히 비공개이고, 라이선스는 여전히 작성되지 않았으며, 모달리티는 여전히 텍스트 전용이고, 가격은 전작의 약 네 배인데, 그 이득은 에이전트 및 터미널 작업에 집중되어 있다.

당신의 작업이 에이전트 루프, 도구 구동 및 긴 도구 체인이라면, 41은 지금까지 이 모델에 대해 공개된 숫자 중 가장 의미 있는 숫자이며, 가용성이 아직 확장 중일 때 진지하게 살펴볼 가치가 있습니다. 당신의 작업이 멀티모달이거나, 지식이 중요한 질의응답이거나, 예산에 민감한 대량 추론이라면, 41은 당신의 문제에 도달하지 못합니다 — 그리고 이미 라우팅 가능하고 MIT 하에 이미 공개되어 출력 가격이 절반인 GLM 5.3 Flash가 세 모델 중 더 나은 위치에 있는 모델입니다. 이 인덱스는 Ling-3.1-flash가 어디에 서 있는지 알려줍니다. 그것은 당신이 신경 써야 하는지 여부를 알려주지 않으며, 그 질문은 당신이 무엇을 만들고 있는지에 의해 답변됩니다.

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트