
Ling-3.1-flash, Artificial Analysis Intelligence Index에서 41점 달성: 560B MoE, 전작 대비 두 배
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Ant Group의 5,600억 개 매개변수 전문가 혼합(MoE) 모델인 Ling-3.1-flash는 이제 자체 연구소가 직접 산출하지 않은 숫자, 즉 Artificial Analysis Intelligence Index에서 41을 달고 있다. 이 지수는 독립 평가자가 평가자가 통제하는 하드웨어에서 고정된 테스트 스위트를 대상으로 운영하며, 이 모델을 자사의 직계 전신인 Ling-3.0-flash보다 21점 높은 위치에 놓는다. Ling-3.0-flash는 같은 지수에서 여전히 20에 머물러 있다. Ant Group은 2026년 9월 말 Ling-3.1-flash를 발표했고, Artificial Analysis는 출시일을 10월 1일로 본다. 이 모델은 자신이 점수를 두 배로 끌어올린 모델보다 세 달 더 젊다.
그 격차가 바로 이 이야기의 핵심이다. 열 가지 서로 다른 평가가 반영되는 종합 지표에서의 21포인트 변동은 벤더의 차트가 조작할 수 있는 종류의 것이 아니며, 이 블로그가 2주 전에 다룰 수 있었던 종류의 것도 아니다. 당시 Ling-3.1-flash에 대해 유일하게 존재하던 측정치는 Ant 자체의 벤치마크 카드였다: GDPval-AA v2.1에서 1,673 Elo, FrontierSWE에서 75.16, HealthBench Professional에서 65.35. 그 수치들은 실제 연구소의 실제 주장이었지만 재현되지는 않았다. 41은 성격이 다르다. 그것은 이번 릴리스에서 제3자가 검증할 수 있는 첫 번째 수치다.
41이 실제로 측정하는 것
Artificial Analysis Intelligence Index v4.3.2는 열 가지 평가로 구성된 가중 복합 지표입니다: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1. 복합 지표를 단독으로 해석하는 것은 잘못이므로, 헤드라인 수치보다 평가별 행이 더 중요합니다:
• GDPval-AA — Ling-3.1-flash는 1,621.75로, Ling-3.0-flash의 948.35와 대비됩니다. 이는 이 세트에서 가장 큰 단일 상승 폭이며, 지수 변동의 대부분이 여기에 달려 있는 항목입니다.
• GDP.pdf — 전 항목 통과 0.100, 0.054에서 상승. 절대적인 수치로는 여전히 낮지만, 거의 두 배로 늘었다.
• AA-LCR v1.1 장문맥 추론 — 이전 모델의 0.73 대비 0.83, 그리고 DeepSeek V4.1 Flash(Max)의 0.84와 동일한 수준.
• SciCode — 0.541 대 0.420. 채팅 품질의 향상이 아니라 코딩 과학 분야의 향상이다.
• CritPt 물리 추론 — 0.180, 이전의 0.017 대비. 작은 기반에서 이전 모델보다 열 배.
• AA-Omniscience — +2.22, Ling-3.0-flash의 −17.88과 대비된다. 이 항목은 헤드라인에 어긋나기 때문에 아래에서 다룬다.
Ling-3.0-flash는 이 행들에서 Ling-3.1-flash에게 단순히 진 것이 아니라, 그중 두 행에서는 완전히 무너졌다. AutomationBench-AA에서 0.032를 기록했고 Terminal-Bench 4.0에서는 정확히 0.000을 기록했다. 41은 바로 이런 맥락에서 읽어야 한다 — 전신 모델은 사실상 에이전트형 터미널 능력이 전혀 없었던, 효율적이고 저렴한 오픈 가중치 모델이었다.

이득이 나온 곳: 대화가 아닌 에이전트 작업
Ling-3.1-flash의 지수 기여도를 가장 자주 나란히 비교되는 두 Flash 등급 모델과 대조해 보면, 총합이 감추고 있는 패턴이 드러난다. DeepSeek V4.1 Flash (Max)는 같은 지수에서 39를 기록하고 GLM 5.3 Flash는 42를 기록하므로, 세 모델 모두 3점 범위 안에 들어온다. 하지만 그들은 서로 다른 지점에서 거기에 도달한다.
• 에이전트형 터미널 작업 — Terminal-Bench 4.0에서 Ling-3.1-flash 0.333, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.
• 에이전트 기반 실제 업무 — GDPval-AA에서 Ling-3.1-flash 1,621.75 Elo, DeepSeek V4.1 Flash (Max) 1,600, GLM 5.3 Flash 1,646.86.
• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash(Max) 0.689, GLM 5.3 Flash 0.604.
• 코딩 과학 — SciCode에서 Ling-3.1-flash 0.541, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516.
좁게 읽으면 Ling-3.1-flash는 에이전트 벤치마크에서 경쟁력이 있고 SciCode에서는 약간 앞선다. 유용하게 읽으면, 사람들이 "툴 루프를 돌릴 수 있는가"라고 말할 때 대개 의미하는 두 가지 에이전트-터미널 지표에서 셋 중 가장 강하다 — 그리고 지식-신뢰성 지표에서는 그 둘 모두에게 뒤진다. 이는 일반적인 승리가 아니라 특정한 형태이며, 누구든 지수 숫자만 보고 워크로드를 사기 전에 짚고 넘어갈 가치가 있다.
더 큰 모델과 함께 오는 청구서
Ling-3.0-flash는 Ant 자체 API에서 백만 입력 토큰당 $0.07, 백만 출력 토큰당 $0.22로 가격이 책정되었으며, MIT 라이선스의 오픈 가중치였습니다. Ling-3.1-flash는 아직 이 두 가지 중 어느 것도 아닙니다. Artificial Analysis는 서빙 제공자로 InclusionAI 자체 API를 기준으로 측정한 실행 비용을 백만 입력당 $0.30, 백만 출력당 $0.90으로 기록하며, 캐시 적중률 요금은 $0.06으로 입력 대비 80% 할인입니다. 이는 대체하는 모델보다 입력 가격이 약 4배 오른 대가로 21포인트의 지수 상승을 얻은 것입니다.
그 거래가 좋은지는 전적으로 워크로드에 달려 있으며, 지수 자체가 그 비용을 매길 수 있습니다: 해당 요율로 Ling-3.1-flash에 대해 10개 Intelligence Index 평가를 모두 실행하면 약 $960이 드는 반면, DeepSeek V4.1 Flash (Max)는 약 $477, GLM 5.3 Flash는 $280입니다. 이유는 요율표만이 아닙니다. Ling-3.1-flash는 매우 말이 많은 추론 모델입니다 — 지수를 처리하는 동안 2억 2천만 개의 출력 토큰을 소모했는데, 이는 해당 가격 등급의 중앙값을 훨씬 웃도는 수준이며, 평가 실행은 작업당 평균 약 357초로, DeepSeek V4.1 Flash (Max)의 285초, GLM 5.3 Flash의 979초와 대비됩니다. 작업당 기준으로 Ling-3.1-flash는 약 $0.99가 드는 반면, DeepSeek는 $0.27, GLM 5.3 Flash는 $0.25입니다.
이 중 어느 것도 41에서는 보이지 않지만, 그 모두가 인보이스에 청구된다. 모델은 지수에서는 이기고 예산에서는 질 수 있다.
헤드라인에 반박하는 두 숫자
첫 번째는 지식 신뢰성이다. Ling-3.1-flash는 모델이 자신이 아는 것을 아는지 측정하는 AA-Omniscience에서 +2.22점을 기록한다: 정답은 점수를 얻고, 환각은 점수를 잃으며, 거부는 아무 비용도 들지 않는다. 정확도는 29.1%, 환각률은 37.9%다. 같은 계열 모델들과 나란히 놓으면 이는 그룹에서 가장 약한 프로필이다 — GLM 5.3 Flash는 환각률 27.6%로 +7.47점을 기록하고, DeepSeek V4.1 Flash (Max)는 답변한 질문 중 무려 96.5%의 환각률로 −5.30점을 기록한다. 이 종합 평가는 Ling-3.1-flash가 보여주는 능력에 보상을 주는 것이지, 그것을 보여주는 신뢰성에 보상을 주는 것이 아니다. 그리고 자신이 주장하는 것의 3분의 1을 만들어내는 모델은 프로덕션에서 주변에 검색(retrieval)을 필요로 한다.
두 번째는 컨텍스트입니다. Artificial Analysis는 Ling-3.1-flash를 1,000,000토큰 컨텍스트 창으로 표기합니다. Ant의 자체 릴리스 자료에서도 목표로 1M을 언급합니다. 하지만 패밀리의 창을 모델별로 열거하는 Ant의 개발자 문서는 Ling-3.0-flash에 네이티브 256K, 1M까지 확장 가능을 부여하고 있으며 Ling-3.1-flash에 대한 항목은 아직 전혀 싣고 있지 않습니다. 실제로 측정된 눈에 띄는 장문 컨텍스트 행 — AA-LCR 0.83 — 은 장문 컨텍스트에 대한 추론 점수이지, 제공되는 창 측정값이 아닙니다. 1M을 선언된 상한으로 취급하고, 이를 기준으로 설계하기 전에 직접 장문 컨텍스트 요청으로 실제 제공되는 창을 검증하십시오.
사양서상에서 어떻게 비교되는지
차원별 그림, 각 줄에 주체 먼저:
• 총 파라미터 — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.
• 모델별 활성 파라미터 — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash가 가장 많이 활성화되며, 이는 서빙 비용이 현재 수준에 머무는 이유 중 하나입니다.
• 가중치 및 라이선스 — Ling-3.1-flash는 공개되지 않음(독점, 라이선스 문구 없음) vs DeepSeek V4.1 Flash (Max)는 MIT 하에 공개 vs GLM 5.3 Flash는 MIT 하에 공개.
• 선언된 컨텍스트 — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. 세 모델 모두 같은 상한을 주장하지만, 그중 둘만이 그 주장을 검증할 수 있는 다운로드 가능한 체크포인트를 갖고 있다.
• 모달리티 — Ling-3.1-flash는 텍스트 입력, 텍스트 출력인 반면, DeepSeek V4.1 Flash (Max)는 텍스트 및 이미지 입력, GLM 5.3 Flash는 텍스트, 이미지 및 비디오 입력입니다. 이는 Ling-3.1-flash가 그저 뒤처져 있는 유일한 축이며, 어떤 벤치마크 행도 이를 상쇄하지 못합니다.
• 공급업체 API 가격 — Ling-3.1-flash $0.30 / $0.90 (입력/출력 100만 토큰당) vs DeepSeek V4.1 Flash (Max) $0.30 / $1.20 vs GLM 5.3 Flash $0.15 / $0.50.
• 인덱스 점수 — 41 대 39 대 42. 3자 비교에서 3점의 격차는 순위가 아니다. 그것은 독자의 작업 부하가 우연히 닮은 평가에 따라 동점이 깨지는 것일 뿐이다.
그것을 부를 수 있는 곳
Ling-3.1-flash는 오늘 OrcaRouter 카탈로그에 없습니다 — InclusionAI에 속한 해당 모델을 우리 공개 모델 API에서 조회하면 not-found가 반환되며, 우리는 그렇지 않은 것처럼 암시하지 않겠습니다. 현재 이 모델은 Ant 자체 API와 이 릴리스를 제공하는 타사 플랫폼에서 실행되며, 이것이 이 모델의 가용성에 대해 솔직하게 말할 수 있는 전부입니다. 위 세 모델을 비교하는 분들이 주목할 만한 점은 나머지 두 모델이 지금 바로 라우팅 가능하다는 것입니다: DeepSeek V4.1 Flash와 GLM 5.3 Flash는 모두 OrcaRouter 카탈로그에 각 공급사의 정가에 마크업을 붙이지 않고, 단일 API 키 하나로, 둘 사이 자동 페일오버와 함께 제공됩니다. 위 비교에서 여러분의 워크로드가 에이전트형 터미널 작업보다 지식 신뢰성을 더 중시한다면, GLM 5.3 Flash가 시도해 볼 만한 모델입니다 — 그리고 두 번째 계약이나 새 클라이언트 코드 한 줄 없이 동일한 키로 DeepSeek V4.1 Flash와 비교해 사용해 볼 수 있습니다.
41가지 변경 사항이 바꾸는 것과 바꾸지 않는 것
이것이 바꾸는 것은 이번 릴리스의 위상이다. Ling-3.1-flash는 더 이상 벤더 차트가 덧붙은 스펙이 아니다. 그것은 독립적으로 측정된 위치를 지닌 모델이며, 그 위치는 Ling-3.0-flash 대비 에이전트 역량에서 진정한 세대적 도약이다. 이는 동일한 레시피에 연산을 더 투입한 것이 아니라 설계 변경에서 비롯된 종류의 도약이다. 조달과 관련해서는 바뀌는 것이 없다. 가중치는 여전히 비공개이고, 라이선스는 여전히 작성되지 않았으며, 모달리티는 여전히 텍스트 전용이고, 가격은 전작의 약 네 배인데, 그 이득은 에이전트 및 터미널 작업에 집중되어 있다.
당신의 작업이 에이전트 루프, 도구 구동 및 긴 도구 체인이라면, 41은 지금까지 이 모델에 대해 공개된 숫자 중 가장 의미 있는 숫자이며, 가용성이 아직 확장 중일 때 진지하게 살펴볼 가치가 있습니다. 당신의 작업이 멀티모달이거나, 지식이 중요한 질의응답이거나, 예산에 민감한 대량 추론이라면, 41은 당신의 문제에 도달하지 못합니다 — 그리고 이미 라우팅 가능하고 MIT 하에 이미 공개되어 출력 가격이 절반인 GLM 5.3 Flash가 세 모델 중 더 나은 위치에 있는 모델입니다. 이 인덱스는 Ling-3.1-flash가 어디에 서 있는지 알려줍니다. 그것은 당신이 신경 써야 하는지 여부를 알려주지 않으며, 그 질문은 당신이 무엇을 만들고 있는지에 의해 답변됩니다.


이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
