
Ling-3.1-flash vs Ling-3.0-flash: 1M 토큰 윈도우와 4.5배 파라미터가 실제로 바꾸는 것
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 262 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
Ant Group의 Ling 패밀리에 새로운 고속 등급이 등장했는데, 이번에는 겨우 한 문장짜리 발표에 불과하다. Ling-3.1-flash는 2026년 9월 30일에 발표됐다. 총 파라미터 약 5,600억 개, 토큰당 활성 파라미터 약 250억 개, 최대 100만 토큰으로 명시된 컨텍스트 윈도, 그리고 “곧 모델을 오픈소스로 공개할 계획입니다”라는 상투적인 문구가 붙었다. 고속 라인의 정점에서 이 모델이 대체하는 Ling-3.0-flash는 모든 면에서 전혀 다른 존재다. 총 파라미터 1,240억 개, 토큰당 활성 파라미터 51억 개, 제공되는 컨텍스트 262,144토큰, 8월 7일부터 Hugging Face에서 MIT 라이선스로 제공된 가중치, 그리고 독립적인 Artificial Analysis Intelligence Index 점수 20이다. 이 모델들 중 하나는 오늘 다운로드할 수 있다. 다른 하나는 읽어볼 수 있을 뿐이다. 둘을 비교하는 것은 정말 유용하지만, 그 비교가 바로 거기서 시작될 때만 그렇다.
헤드라인의 산술은 간단하고 약간 오해를 부른다. Ling-3.1-flash는 Ling-3.0-flash의 전체 파라미터 수의 약 4.5배이고, 활성 파라미터 수의 약 4.9배다 — 토큰당 25B 대 5.1B다. 대충 읽으면 "훨씬 더 큰 모델이니 훨씬 더 똑똑한 모델"이라고 말하게 된다. 더 신중하게 읽으면 Ant가 본체를 확장하면서 희소성 비율은 대략 유지했다는 것이고, 그것이 주는 것은 용량이지 반드시 토큰당 추론 깊이는 아니다. 560B 중 25B를 각 토큰에 라우팅하는 모델은 5.1B를 라우팅하는 모델보다 토큰당 더 많은 작업을 하지만, 그 대가로 토큰당 약 5배의 연산량을 지불한다. 이 트레이드오프가 어디에 귀결되는지는 전적으로 Ant의 아키텍처가 추가 파라미터를 효율적으로 처리하느냐에 달려 있다 — 그리고 그것은 발표문이 답하지 않는 질문이다.
두 모델, 나란히
공개된 사실들을 서로 나란히 놓으면 세대가 깔끔하게 구분됩니다. 아래의 각 줄은 Ant 또는 독립 평가자가 실제로 공개한 내용을 말합니다. 숫자가 빠져 있다면, 그것은 아무도 그 숫자를 공개하지 않았기 때문에 빠져 있는 것입니다.
• 총 파라미터 — Ling-3.1-flash: ~560B(공급업체). Ling-3.0-flash: 124B(모델 카드).
• 토큰당 활성 파라미터 — Ling-3.1-flash: ~25B (공급업체). Ling-3.0-flash: 5.1B (모델 카드).
• 컨텍스트 윈도우 — Ling-3.1-flash: 최대 1M 토큰(벤더). Ling-3.0-flash: 256K 네이티브, 262,144로 제공(모델 카드 및 추론 레시피).
• 가중치 및 라이선스 — Ling-3.1-flash: 공개되지 않음; 저장소 없음, 라이선스 없음 (2026년 9월 30일과 10월 1일 두 차례 확인). Ling-3.0-flash: MIT, 2026년 8월 7일부터 Hugging Face에 inclusionAI/Ling-3.0-flash로, ModelScope에도 공개됨.
• 가중치 형식 — Ling-3.1-flash: 제공되는 것 없음. Ling-3.0-flash: 연구소에서 제공하는 BF16(~255GB) 및 FP8(~128GB), 그리고 커뮤니티 퀀트.
• 벤치마크 출처 — Ling-3.1-flash: 전적으로 벤더 보고에 의존하며, 공개된 평가 하네스도 없고, 재실행할 가중치도 없습니다. Ling-3.0-flash: Artificial Analysis가 독립적으로 평가해 Intelligence Index 20을 기록했으며, 측정된 출력 속도와 토큰 생성량도 함께 공개되었습니다.
• 사용 가능 여부 — Ling-3.1-flash: Ant 자체의 Ling Studio 제품에서만 사용 가능. Ling-3.0-flash: 자체 호스팅 가능하며, Ant의 개발자 API를 통해 호출할 수도 있음.

추가 용량이 아마 무엇을 위한 것인지
Ant가 Ling-3.1-flash를 직접 한 줄로 설명한 것이 이번 릴리스에서 가장 많은 정보를 담고 있다. Ling Studio 앱은 이를 "범용 에이전트, 검색, 일상적인 사무 업무, 소프트웨어/코드 개발"에 내세우는데, 이는 추론 벤치마크 중심의 틀이 아니라 사무 업무 및 에이전트 중심의 틀이다. 이는 이 제품군이 구성된 방식과 일치한다. Ling은 범용 텍스트 및 도구 라인이고, Ring은 추론 라인이며, Ming은 멀티모달을 담당한다. Ling-3.0-flash는 한 세대 전에 같은 자리를 차지했으며, 플래그십이 아니라 명시적으로 빠르고 저렴한 등급이었다.
그런 관점에서 이번 스케일업을 보면 이해가 된다. 에이전트형 및 도구 호출 워크로드는 길고 반복적이며 컨텍스트를 많이 요구한다. 하나의 에이전트 루프는 행동을 취하기 전에 누적된 도구 출력으로 수만 토큰을 태울 수 있으므로, 100만 토큰 윈도는 스펙표의 과시용 문구가 아니라 기능적 요구사항이다. 총 파라미터 수를 늘리면서도 활성 비율을 크게 유지하는 것은, 여전히 루프 안에 들어갈 만큼 충분히 빨라야 하는 모델에 세계 지식과 지시 수행 깊이를 더하는 방식이다. Ant는 여기서 더 느리지만 더 똑똑한 플래그십을 만드는 것이 아니다. 더 큰 고속 티어를 만들고 있는 것이다.
반론은 비용이며, 그것은 반대 방향에서 도착하는 같은 산수다. 추가 용량은 추론 시점에 공짜가 아니다. 모든 토큰마다 비용을 치른다. 그런데 Ant는 Ling-3.1-flash의 가격을 전혀 공개하지 않았다. API 요금표도, 캐시 할인도, 이전 세대가 제시하는 백만 토큰당 $0.075/$0.22에 견줄 만한 것도 없다. 그것이 이 비교를 결정지을 빠진 숫자이며, 그것은 빠져 있다.
벤치마크, 그리고 누가 이를 실시했는가
Ling-3.1-flash는 개별적으로 보면 강해 보이는 세 가지 점수와 함께 등장한다: GDPVal-AA v2.1에서 1,673 Elo, FrontierSWE에서 75.16, HealthBench Professional에서 65.35. 세 점수 모두 Ant 자체 수치이며 발표문에서 가져온 것이고, 외부 연구소가 재현한 것은 아니다. 실질적인 결과는 이 수치들이 다른 벤더의 숫자와는 비교할 수 있지만 독립적인 숫자와는 비교할 수 없다는 것이다. 그리고 Ling-3.0-flash에 대한 Artificial Analysis의 20점 Intelligence Index는 다른 척도에 기반한 독립적인 숫자이므로, 둘을 나란히 놓는 것은 측정값과 주장을 비교하는 셈이 된다. 이 글을 쓰는 시점에 Artificial Analysis에는 Ling-3.1-flash 페이지가 없다.
Ant 자체 차트에 있는 각주 하나는 그 자체로 짚고 넘어갈 가치가 있다. 이 카드에는 HealthBench Professional 결과가 "AQ 환경"에서 평가되었으며, Ling-3.1-flash의 의료 역량은 현재 AQ에서만 경험할 수 있다고 적혀 있다. AQ가 무엇인지 설명하는 공개 문서는 없다. 이름이 밝혀지지 않은 환경 한정 조건을 달고 있는 대표 점수는, 가중치가 존재한다 해도 외부 팀이 재현할 수 있는 것이 아니다.
이번 주에 실제로 어떤 걸 써야 할까
세대 문제에 대한 답은 오늘 무엇이 필요한지에 따라 달라지며, 거의 모든 사람에게 지금 당장의 정답은 더 새로운 모델이 아닙니다.
이번 주에 뭔가를 실행해야 한다면, Ling-3.0-flash는 둘 중 실제로 사용 가능한 형태로 존재하는 유일한 모델입니다: 직접 호스팅할 수 있는 MIT 가중치, 더 작은 풋프린트를 원한다면 FP8, 공개된 자사 API 가격, 그리고 여러분이 무엇을 얻는지 알려주는 독립적인 점수까지. 이 모델은 해당 티어에서 정말로 훌륭한 모델입니다 — 독립 평가는 이 모델을 총 파라미터 대비 지능 면에서 오픈 가중치 파레토 프런티어에 올렸고, 속도도 높게 평가했지만, 유난히 장황해서 평가 과정에서 약 2억 6천만 개의 토큰을 생성했다는 단점이 있습니다. 이는 중앙값이 약 1억에 가까운 것과 대비됩니다.
다음 6개월을 계획하고 있다면, Ling-3.1-flash는 나아갈 방향이며 아직 구성 요소는 아닙니다. 그것이 구성 요소가 되기 전에 지켜볼 구체적인 사항은 다음과 같습니다: 가중치가 실제로 공개되는지와 어떤 라이선스로 공개되는지, 제공되는 윈도우가 정말 1M인지 아니면 더 짧은 네이티브 컨텍스트의 확장인지, 백만 토큰당 비용은 얼마인지, 그리고 독립 연구소가 FrontierSWE에서 75.16을 재현하는지. 그중 하나라도 실현된다면 비교를 다시 실행할 이유가 될 것입니다. 아직 아무것도 실현되지 않았습니다.

라우팅 스택에서 이것의 위치
오늘 우리 카탈로그에는 Ling 모델이 하나도 없습니다 — Ling-3.0-flash, Ling-3.0-flash-VL, Ling-3.1-flash 모두 not-found를 반환합니다 OrcaRouter 모델 API에 대해, 그래서 "당신을 통해 호출할 수 있나요"에 대한 솔직한 답은 현재로선 아니오입니다. 이런 한 주에 라우팅 레이어가 실제로 유용한 부분은 문제의 나머지 절반입니다. 바로 후보 모델을 비교 평가할 때 기준이 될 모델들이죠. Claude Opus 5, GPT-5.6 Sol, DeepSeek-V4.1-Flash는 모두 제공업체 정가에 마진 없이 라이브 라우트로 제공되며, 이들을 하나의 키 뒤에 묶어 자동 페일오버를 제공하는 라우터가 있으면 네 개의 통합을 유지보수하지 않고도 평가 하네스를 움직이는 표적에 계속 겨눌 수 있습니다. Ling-3.1-flash의 가중치가 공개되고 라이선스를 읽을 수 있게 되면, 그 결정의 형태도 마찬가지입니다. 스택을 다시 구축하는 것이 아니라 엔드포인트 하나를 추가하는 것입니다.
세대 요약은 짧다. Ling-3.0-flash는 이미 출시되었고 독립적으로 평가되었으며, 허용적 라이선스가 적용된 모델로 오늘날 자체 호스팅할 수 있다. Ling-3.1-flash는 더 크고 더 긴 컨텍스트를 가지며 실행 비용이 더 높은 약속으로, Ant가 개발자가 사용할 수 있는 어떤 형태로도 아직 내놓지 않았다. 두 번째를 첫 번째의 업그레이드로 취급하는 것이 이번 릴리스가 유도하는 실수이며, 수치들은 아직 그것을 뒷받침하지 않는다.

