
Ling-3.1-flash vs Gemini 3.8 Flash: 256K 체험 모델 대 1M 토큰 라이브 모델
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Ling-3.1-flash와 Gemini 3.8 Flash를 나란히 놓고 보면, 불일치는 지능의 문제가 아니라 상태의 문제다. Ant Group이 2026년 9월 29~30일에 발표한 약 560B 파라미터 규모의 mixture-of-experts인 Ling-3.1-flash는 2주간 무료 체험판으로 제공되며, 256K 서빙 컨텍스트, 32,768토큰 출력 상한, 텍스트 전용 입력을 갖추고 있고 공개된 가중치나 라이선스, 가격은 없다. Google의 Flash 등급 추론 모델인 Gemini 3.8 Flash는 2026년 9월 2일 출시된 정식 제공(GA) API로, 1,048,576토큰의 전체 윈도, 65,536토큰 출력, 멀티모달 입력, 공개 요금표를 갖추고 있다. 서류상으로는 두 모델의 비교지만, 실제로는 오늘 바로 그 위에 구축할 수 있는 모델과 이번 달에만 테스트할 수 있는 모델의 비교다.
그것은 Ling-3.1-flash를 일축할 이유가 아니다. 에이전트 지향성을 띤 무료 560B MoE라면 누구든 2주를 들여 평가할 가치가 있다. 하지만 그것은 맞대결의 목적을 바꾼다. ‘무엇을 표준으로 삼아야 하는가’가 아니라 ‘그 시험 모델이 15일 뒤의 답을 헤지할 만큼 충분히 좋은가’이다. 이 둘은 서로 다른 질문이며, 아래의 모든 축에서 답도 다르다.
어떤 벤치마크가 결정하기 전에 그것을 좌우하는 세 가지
대부분의 비교는 점수에서 시작하지만, 이 비교는 가용성부터 시작해야 합니다. 그 격차는 정도의 문제가 아니기 때문입니다.
• 가격 — Ling-3.1-flash는 체험 기간 동안 무료이며, 체험 이후 요금표는 전혀 공개되지 않았습니다. Gemini 3.8 Flash는 프로모션 기간 동안 백만 입력 토큰당 $0.75, 백만 출력 토큰당 $3.75로 책정되어 있으며, 2027년 1월 1일에는 $1.50 / $7.50로 복귀합니다. 벤더가 보고한 정가이며, 두 제품 모두 변경될 수 있습니다.
• 맥락 — Ling-3.1-flash는 체험판에서 262,144 토큰을 제공하며, 1,000,000이 최종 목표로 제시됩니다. Gemini 3.8 Flash는 오늘 전체 1,048,576 토큰을 제공합니다. 워크로드가 백만 토큰 창에 의존한다면, 이 둘 중 지금 그것을 갖춘 것은 하나뿐입니다.
• 가중치 — Ling-3.1-flash는 공개한 것이 없다: 저장소도, 라이선스도, 체크포인트도 없고, 그저 시험 후 오픈소스로 공개하겠다는 의사 표명만 있을 뿐이다. Gemini 3.8 Flash는 폐쇄형이며 앞으로도 계속 그럴 것이지만, 오늘 당장 모호함 없이 호출할 수 있는 관리형 API다.
함께 읽으면 이 세 가지는 하나의 요점을 말해준다: Ling 모델의 대표적인 장점은 홍보성(무료)이거나 잠재적(100만 컨텍스트, 오픈 웨이트)인 반면, Gemini 모델의 장점은 계약상의 것이다. 이러한 비대칭성은 이후의 모든 내용에 걸쳐 나타난다.
Ling 모델이 진정으로 앞서는 지점
두 곳, 그리고 둘 다 실제로 존재한다.
첫 번째는 평가 중 발생하는 비용입니다. 이 규모의 모델을 2주간 무료로 체험해 보는 것은 마케팅용 기믹이라며 넘길 일이 아닙니다 — 560B mixture-of-experts가 여러분의 프롬프트를 처리할 수 있는지 알아내는 가장 저렴한 방법입니다. Gemini 3.8 Flash는 가격이 어찌 되든 무료가 아니며, 수천 건의 호출에 걸친 진지한 평가에는 실제 돈이 듭니다.
두 번째는 개방성 궤적입니다. Ling-3.1-flash는 MIT 라이선스 가중치를 실제로 출시했던 모델의 후속작이며, Ant는 이 모델도 오픈소스로 공개할 의도가 있다고 공개적으로 밝혔습니다. 만약 그것이 허용적 라이선스로 실현된다면, Gemini 3.8 Flash가 결코 제공할 수 없는 것을 얻게 됩니다: 560B 기본 모델을 셀프 호스팅하거나 파인튜닝하거나 증류할 수 있는 옵션입니다. 가장 중요한 함정은 이것입니다 — 당신은 약속에 베팅하고 있으며, 이전 세대의 약속은 보장이 아니라 2주 지연 끝에 지켜졌습니다.
Gemini 3.8 Flash가 패배와 거리가 먼 곳
재판을 빼놓고 보면 운영상 비교는 구글 쪽으로 크게 기울어져 있다.
• 입력 — Gemini 3.8 Flash는 텍스트, 이미지, 동영상, 파일, 오디오를 받습니다. Ling-3.1-flash는 텍스트를 받아 텍스트를 반환합니다. 문서, 스크린샷 또는 동영상 워크플로의 경우 이는 선호 사항이 아니라 기능적 경계입니다.
• 출력 상한 — 65,536 토큰 대 32,768. 보고서나 코드 파일, 또는 긴 구조화된 출력을 한 번에 생성하는 순간 바로 관련이 있습니다.
• 처리량 — 독립 테스트에서는 Gemini 3.8 Flash의 중앙값 출력 속도가 초당 약 249토큰에 가까운 것으로 나타났으며, OrcaRouter 자체 7일 텔레메트리에서는 첫 토큰까지 p50 4.95초에 초당 552토큰을 측정했습니다. Ling-3.1-flash의 체험용 호스팅은 초당 약 63토큰으로 보고되었습니다. Gemini 모델은 속도 등급이 다릅니다.
• 참조 깊이 — Gemini 3.8 Flash는 그 뒤에 독립적인 측정 결과가 상당히 축적되어 있습니다. Ling-3.1-flash의 수치는 모두 완전히 새로운 엔드포인트에서 나온 자사 측정값이며, 아직 제3자가 이를 재검증한 적이 없습니다.
• 멀티모달 에이전트 — 스크린샷, PDF, 녹음된 통화를 읽어야 하는 작업은 품질 때문이 아니라 구조상 Gemini의 작업이다.

벤치마크, 그리고 두 세트가 실제로 비교가 되지 않는 이유
Ling-3.1-flash에 대해 공급업체가 보고한 실적은 다섯 개 에이전트 벤치마크 전반에 걸친 81.0의 종합 점수이며, Terminal-Bench 4.0에서 40.4%, SWE-Atlas에서 55.9%, HealthBench Professional에서 65.35%입니다. Ant 자체 발표에는 GDPVal-AA v2.1에서 1,673 Elo와 FrontierSWE에서 75.16이 추가됩니다. 그 모든 수치는 Ant 자체 측정치입니다. 공개된 하네스가 없고, 더 중요한 점은 누구든 이 스위트를 다시 실행할 수 있는 가중치도 없다는 것입니다.
Gemini 3.8 Flash의 양상은 질적으로 다릅니다. Artificial Analysis의 현재 Intelligence Index 빌드(v4.3.2)에서 이 모델은 추론 노력이 높음일 때 40.9점, 중간일 때 39.8점, 낮음일 때 33.5점을 기록합니다. 그리고 이 지수가 최근 개정되었다는 점을 짚어둘 만합니다. 따라서 가을 초에 이 모델에 관해 발표된 수치들은 다른 빌드에서 산출된 것이며, 이 수치들과 직접 비교할 수 없습니다. 구글이 이 모델에 대해 자체적으로 내세우는 수치로는 HLE-Verified에서 54.9점, 그리고 80점대 후반의 강력한 Terminal-Bench 2.1 결과가 있습니다. 독립 수치와 벤더 수치를 나란히 놓으면, 둘 다 정당하지만 어느 쪽도 서로 대체할 수는 없습니다.
교차 비교해 볼 가치가 있는 깔끔한 비교가 하나 있다. 둘 다 같은 벤치마크 계열에 속하기 때문이다. Terminal-Bench 4.0에서 Ling-3.1-flash의 벤더 제시 수치는 40.4%다. Claude Sonnet 5.5 — 플래그십이 아닌 중간 등급 모델 — 는 같은 버전에서 70.6%를 기록한다. 그 단일 행은 Ant의 카드를 '프런티어 인접'으로 읽는 데 반대하는 가장 강력한 논거다. 그 모델은 Ant가 강조하기로 선택한 에이전트 관련 지표에서는 경쟁력이 있지만, 외부 수치가 존재하는 터미널 코딩 지표에서는 분명히 뒤처져 있다.

선택의 실질적 형태
앞으로 2주 안에 뭔가를 만들어야 한다면, 답은 접전이 아니며, 그건 Ling-3.1-flash를 깎아내리려는 것도 아닙니다. Gemini 3.8 Flash는 둘 중 안정적인 엔드포인트, 공개된 가격, 완전한 100만 토큰 윈도우, 멀티모달 입력, 그리고 읽어볼 수 있는 라이선스를 제공하는 유일한 모델입니다. 이는 프로덕션 Flash 등급 모델입니다.
Ling-3.1-flash는 평가 대상이다. 지금 이 모델의 가치는 평가가 무료라는 점, 그리고 모델 자체가 흥미롭다는 점이다. 토큰당 약 25B만 활성화되는 560B MoE는 희소성에 대한 베팅이며, Ant는 이를 Flash급 모델들이 경쟁하는 에이전트, 검색, 사무 자동화 워크로드에 정확히 겨냥해 포지셔닝했다. 체험 기간 동안 직접 프롬프트를 넣어 돌려보는 것은 가치가 있다. 바로 Ant 외부에서는 아직 아무도 해보지 않았기 때문이다 — 당신은 비벤더 의견을 가진 최초의 사람들 중 하나가 될 것이다.
이번 달에 말이 되는 의사결정 트리는 이렇다: 프로덕션은 Gemini 3.8 Flash로 라우팅하고, 무료 체험은 가장 어려운 프롬프트에 Ling-3.1-flash를 돌리는 데 쓰고, 오픈 웨이트 문제는 진짜 갈림길로 남겨 두라. 가중치가 허용적 라이선스로 공개되고 가격이 Flash 등급 근처로 책정된다면, Ling-3.1-flash는 진정한 두 번째 옵션이 된다 — 직접 호스팅할 수 있는 옵션이며, Gemini는 결코 그럴 수 없다. 만약 조건이 붙어서 공개된다면, 체험은 끝나고 비교도 끝난다.
하나의 키로 둘 다 실행하기, 그리고 빠진 부분에 대해 솔직해지기
Gemini 3.8 Flash는 오늘 OrcaRouter 카탈로그에 모델 ID google/gemini-3.8-flash(으)로, Google 자체 정가에 마크업 없이 등록되어 있습니다. 따라서 1월에 프로모션 요율이 원래대로 돌아가면, 여기서 지불하는 가격이 새 계약을 맺을 필요 없이 이를 자동으로 따라갑니다. 같은 실험에서 측정해 볼 만한 또 다른 저렴한 Flash 등급 모델인 DeepSeek-V4.1-Flash도 제공업체의 정가로 동일한 카탈로그에 있으므로, 시험 모델과 기존 Flash 등급 옵션을 비교하는 3자 테스트를 단일 API 키 하나로, 자동 장애 조치를 통해 이들 사이에서 실행할 수 있습니다.
Ling-3.1-flash는 우리 카탈로그에 없고, 우리 공개 모델 API로 조회하면 해당 모델과 이전 세대 모두 not-found를 반환합니다. 따라서 솔직한 설명은 이렇습니다. 이 체험은 벤더 자체 인터페이스와 제3자 추론 플랫폼을 통해, 그것이 운영되는 곳에서 운영되며, 우리가 이를 호스팅한다고 주장하지 않습니다. 이것이 이 비교에서 가장 빠르게 바뀔 수 있는 부분입니다. 가격이 발표되지 않은 무료 체험 모델은 Ant와 그 호스트들이 요금표를 공개하는 순간 라우팅 계층에 올라가는 바로 그런 유형이며, 제로 마크업 패스스루는 그렇게 되는 날 여기의 가격이 곧 거기의 가격이 된다는 뜻입니다.
그래서 평결은 파라미터 수가 시사하는 것보다 더 좁다. Ling-3.1-flash는 더 야심찬 모델이자 더 흥미로운 연구 결과이고, Gemini 3.8 Flash는 실제로 출시할 수 있는 쪽이다. 라이선스와 가격이 존재하기 전까지는 그것이 차이의 전부이며, 그것은 벤치마크 한 줄이 판가름할 문제가 아니다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
