
Ling-3.1-flash vs DeepSeek V4.1 Flash: 지수는 2점, 청구서는 3배
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Ling-3.1-flash와 DeepSeek V4.1 Flash (Max)는 Artificial Analysis Intelligence Index에서 2점 차이입니다 — 41 대 39 — 그리고 가격에서는 전혀 가깝지 않습니다. 해당 지수를 구성하는 열 가지 평가를 각 모델에 실행하면 Ling-3.1-flash는 작업당 약 $0.99이고, DeepSeek는 $0.27입니다. 둘 다 약 5,500억 개의 매개변수를 가진 mixture-of-experts 모델이며 1M 토큰 컨텍스트를 주장합니다. 하나는 Ant Group의 InclusionAI 연구소가 만든 폐쇄형 텍스트 전용 모델로, 2026-10-01에 공개되었으며 아직 가중치나 라이선스가 공개되지 않았습니다. 다른 하나는 2026-09-10부터 MIT 라이선스로 공개되어 있고, 텍스트는 물론 이미지도 처리하며, 23개 제공업체에서 실행되고, 대부분의 팀이 이미 설정 파일에 넣어 두었을 모델입니다. 대부분의 기준에서 두 모델은 서로 가깝지 않습니다. 흥미로운 질문은 왜 이 2점 차이가 애초에 존재하는가입니다.
Ling-3.1-flash가 진정으로 앞서는 부분
터미널을 다루고 실제로 실행되어야 하는 코드를 작성하는 능력을 측정하는 평가들에서 그것은 앞서 있으며, 그 격차는 총합 지표가 가려버리기에 정확히 짚고 넘어갈 만하다.
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs DeepSeek V4.1 Flash (Max) 0.268. 절대적인 수치로 보면 둘 다 그리 큰 숫자는 아니며, 격차는 DeepSeek 점수의 4분의 1이다.
• SciCode — 0.541 vs 0.519.
• CritPt 물리 추론 — 0.180 vs 0.143.
• GDPval-AA 에이전트 기반 실제 업무 — 1,621.75 Elo 대 1,600 Elo.
그 네 개 가운데 둘은 거의 동점이고, 하나는 근소한 승리이며, Terminal-Bench 4.0은 시드를 바꿔도 그 차이가 유지될 유일한 항목이다. 이를 DeepSeek가 앞서는 부분과 대조해 보면: AA-Briefcase v1.1 에이전트형 지식 작업에서 1,420.47 Elo 대 1,400.35, AutomationBench-AA에서 0.689 대 0.617, AA-LCR 장문맥 추론에서 0.84 대 0.83, 그리고 — 프로덕션에서 가장 중요한 항목 — 환각이 거부보다 더 나쁜 지표인 AA-Omniscience에서 −5.30 대 Ling-3.1-flash의 +2.22다. 그 지표에서 DeepSeek의 정확도는 46.4%이고, 답변하는 질문 중 환각률은 96.5%다; Ling-3.1-flash는 29.1%를 정확히 답하며 환각률은 37.9%다. 둘 다 검색을 앞에 두지 않고 지식 베이스에 그대로 대면시킬 모델은 아니다.
가격 격차는 지수 격차보다 크며, 이는 단순히 요금표 때문만은 아닙니다
겉으로 드러난 요금만 보면 거의 똑같아 보입니다. Artificial Analysis는 두 모델 모두 백만 입력 토큰당 $0.30으로 기록합니다. 그러나 나머지 두 수치에서는 크게 갈립니다:
• 출력 — Ling-3.1-flash 백만당 $0.90 vs DeepSeek V4.1 Flash (Max) 백만당 $1.20. 여기서 Ling-3.1-flash가 25% 더 저렴한, 단연 더 싼 모델입니다.
• 캐시 읽기 — Ling-3.1-flash는 백만당 $0.06, DeepSeek V4.1 Flash (Max)는 백만당 $0.006으로, 98% 할인 대 80% 할인입니다. 바로 이 지점에서 두 모델은 더 이상 비교할 수 없게 됩니다.
7:2:1의 캐시 적중/입력/출력 혼합에서 블렌디드 요율은 Ling-3.1-flash의 경우 $0.192, DeepSeek V4.1 Flash (Max)의 경우 $0.184로 나온다 — 거의 차이가 없다. 하지만 그 혼합은 모델을 어떻게 사용하는지에 대한 가정이며, 그 가정이 상당한 몫을 하고 있다. 프롬프트 재사용이 많은 워크로드 — 긴 시스템 프롬프트, 검색 프리앰블, 매 턴마다 누적 컨텍스트를 다시 보내는 에이전트 루프 — 는 실효 혼합을 캐시 읽기 쪽으로 밀어붙이고, 거기서는 캐시 가격의 10배 차이가 판가름한다. 토큰 볼륨도 같은 방식으로 증폭된다: Ling-3.1-flash는 말이 많은 추론 모델로, 인덱스 평가 전반에서 2억 2천만 개의 출력 토큰을 생성했으며 이는 DeepSeek의 2억 5천만 개와 대비된다. 또한 평가 작업당 평균 약 357초를 기록했고, 이는 DeepSeek의 285초와 대비된다. 이 모델은 답변당 더 많은 사고를 수행하며, 그렇게 하는 데 더 오래 걸린다.

구체적인 예시: 양쪽 모두에서 동일한 에이전트 루프
작업당 100만 입력 토큰을 실행하고 그중 90%가 캐시에서 제공되며 20만 출력 토큰을 반환하는 도구 구동 에이전트를 생각해 보자. 위 수치를 기준으로 Ling-3.1-flash에서는 캐시된 입력 토큰 900,000개에 $0.06, 신규 입력 100,000개에 $0.30, 출력 200,000개에 $0.90을 적용하면 작업당 약 $0.26이 된다. 동일한 루프를 DeepSeek V4.1 Flash (Max)에서 돌리면 약 $0.14로, 대략 절반 수준이다.
이제 DeepSeek의 스케줄을 적용해 보자. 대부분의 비교가 건너뛰는 부분이기 때문이다. DeepSeek의 오프피크 요금은 위에 나온 그대로이며, 오프피크는 주말과 하루 중 대부분의 시간을 포함한다. 하지만 평일 두 개의 시간대, 즉 01:00–04:00과 06:00–10:00 UTC 동안에는 입력 및 캐시 가격이 두 배가 된다. 같은 루프를 피크 시간대로 옮기면 DeepSeek의 비용은 약 $0.28에 이르게 된다 — 이때 Ling-3.1-flash의 고정된, 더 높은 요율표가 그 시간에는 더 저렴한 선택이 되고, 10× 캐시 할인은 시계에 의해 무력화된 셈이다.
결정의 전부가 숫자 한 쌍에 들어 있다. 에이전트 트래픽이 캐시 비중이 높고 일정을 조정할 수 있다면, DeepSeek V4.1 Flash (Max)는 2포인트 지수 차이를 대가로 Ling-3.1-flash 비용의 약 절반이다. 트래픽이 캐시 비중이 높고 DeepSeek의 피크 구간에 걸린다면, 두 모델의 비용은 거의 같아지고 Ling-3.1-flash의 약간 더 나은 터미널 에이전트 행이 결정적 기준이 된다.
비교할 대상이 없는 축
세 가지 차원은 차이가 크며, 이들은 가격이 논의되기 전에 아키텍처를 좌우하는 경향이 있는 요소들입니다.
• 가중치 및 라이선스 — Ling-3.1-flash는 가중치를 공개하지 않았고, 라이선스 문구도 없으며, Artificial Analysis는 이를 독점 모델로 분류합니다. DeepSeek V4.1 Flash (Max)는 MIT 라이선스의 오픈 가중치이며, Hugging Face에서 다운로드할 수 있고, 상업적 사용이 허용됩니다. 이 중 하나는 자체 호스팅, 파인튜닝, 에어갭 환경에서의 운영이 가능하지만, 다른 하나는 불가능합니다.
• 모달리티 — Ling-3.1-flash는 텍스트 입력, 텍스트 출력입니다. DeepSeek V4.1 Flash (Max)는 텍스트와 함께 이미지를 받아들이며 멀티모달 벤치마크에서 평가됩니다. 파이프라인의 어느 부분이든 모델에 스크린샷, 차트 또는 스캔본을 전달한다면, 비교는 거기서 끝입니다.
• 서빙 표면 — DeepSeek V4.1 Flash (Max)는 OrcaRouter를 포함한 23개 제공업체를 통해 사용할 수 있습니다. Ling-3.1-flash는 공급업체 자체 API와 해당 릴리스를 제공하는 타사 플랫폼을 통해 실행됩니다. 프로덕션 경로에서 제공업체 수는 인기 경쟁이 아니라 복원력 속성입니다.
그 목록들 어디에도 나타나지 않는 또 하나의 비대칭성이 있다. DeepSeek V4.1 Flash (Max)는 단일 응답에서 384,000개의 출력 토큰을 제공한다. Ant는 Ling-3.1-flash의 최대 출력 길이를 공개하지 않았으므로, 장문 생성 워크로드는 아직 그것을 기준으로 규모를 산정할 수 없다. 공개된 상한이 없다는 것이 상한이 작다는 뜻은 아니지만, 그렇다고 설계 기준으로 삼을 수 있는 숫자도 아니다.
둘 다 실행하는 것, 그리고 그것이 실제로 어떤 모습인지
Ling-3.1-flash는 오늘 OrcaRouter 카탈로그에 없습니다 — 공개 모델 API로 조회하면 InclusionAI 아래 해당 모델에 대해 not-found가 반환되며, 이 글은 그 사실을 다르게 포장하지 않습니다.정가로 마크업 없이, 따라서 공급업체 가격 변경이 적용되는 당일 우리 쪽에도 반영되며, 카탈로그의 나머지와 동일한 단일 API 키 뒤에 위치하고 업스트림 제공업체 간 자동 페일오버를 지원합니다.
그 비대칭성은 실질적인 형태를 지닙니다. 한 모델이 클로즈드 소스이고, 전작보다 대략 네 배 비싸며, 단일 공급업체를 통해 접근할 수 있는 비교를 감당하는 현명한 방식은, 개방형이고 폭넓게 서비스되는 모델을 기본 경로로 유지하고, 도전자를 확정적으로 선택할 대상이 아니라 테스트할 대상으로 취급하는 것입니다. DeepSeek V4.1 Flash (Max)는 오늘날 프로덕션 루프를 감당할 수 있습니다 — 오픈 가중치, 이미지 입력, 384K 출력, 98% 캐시 할인 — 반면 Ling-3.1-flash는 Terminal-Bench와 SciCode에서의 우위가 실제로 발휘되는 에이전트 특화 작업을 맡습니다. 둘 다 OpenAI 호환 chat-completions 형식을 사용하므로, 그 분할은 통합 프로젝트가 아니라 라우팅 결정입니다: 하나의 엔드포인트, 하나의 키, 그리고 각 모델이 측정 가능하게 더 잘하는 작업을 보내는 규칙입니다.
판결
이용 가능한 증거에 따르면, DeepSeek V4.1 Flash (Max)가 이번 맞대결에서 승리하며, 그 승리는 대부분 두 개의 Index 점수와는 무관한 요소들 덕분입니다: MIT 라이선스의 공개 가중치, 이미지 입력, 384,000 출력 토큰, 98% 캐시 할인, 그리고 서로 장애 조치할 수 있는 23개 제공자입니다. Ling-3.1-flash의 근거는 더 좁지만 실질적입니다 — 둘 중 더 나은 터미널·도구 에이전트이며, 이 둘 중 피크 시간 승수가 반영된 요금표를 공개하지 않은 유일한 쪽입니다.
이 평가를 바꿀 두 가지가 있다. Ant가 허용적 라이선스로 가중치를 공개한다면 개방성 격차는 사라지고, 비교는 역량과 비용만 따지는 논의가 된다. 그리고 Ant가 제공하는 장문 컨텍스트 윈도가 두 모델이 모두 명시한 100만 토큰에서 검증된다면, 컨텍스트 동등성 주장은 더 이상 주장에 그치지 않는다. 그때까지는 솔직한 요약컨대, 한 모델이 에이전트 벤치마크의 한 행을 이기고도 평가에서는 질 수 있으며, 이 두 모델 간의 2포인트 지수 격차는 작업당 비용의 약 3.6배에 해당하는데, 이는 특정 워크로드만 받아들여야 하는 트레이드오프라는 것이다.


