
Claude Haiku 5.5 vs Ling 3.1 Flash: 답변당 비용이 네 배 더 비싼 5,600억 개 매개변수 모델
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
이들을 갈라놓는 것은 단 6일이다. InclusionAI는 Ling 3.1 Flash를 2026년 10월 1일에 출시했고, 벤더는 Claude Haiku 5.5를 10월 7일에 출시했다. 둘 다 플래시 등급 모델로 판매되고, 둘 다 100만 토큰 컨텍스트 윈도를 갖추고 있으며, 두 모델을 모두 돌려본 유일한 독립 평가 기관의 추론 항목에서 이 둘은 차이가 노이즈 범위 안에 들어갈 만큼 가깝다. 그런데 에이전트가 실제로 작업을 끝내는지를 측정하는 항목에 이르면 두 모델은 26점 차이가 나고, 끝난 작업에 드는 비용을 측정하는 항목에 이르면 파라미터가 5,600억 개인 모델이 파라미터 수를 아무도 공개하지 않은 모델보다 가격이 4.5배다.
어느 요금표도 그런 예측은 하지 않는다. Ling 3.1 Flash는 입력 토큰 100만 개당 $0.30, 출력 토큰 100만 개당 $0.90로 책정되어 있다. Claude Haiku 5.5는 최대 100,000토큰의 프롬프트에 대해 $0.10과 $0.50로, 그 이상에서는 $0.50과 $2.50로 책정된다. 토큰당 가격으로 보면 Ling은 입력에서 비용이 세 배, 출력에서는 두 배에 조금 못 미치는데, 이는 비교를 한 줄로 끝내버릴 만한 종류의 격차다.
그것은 이번 건을 끝내지 않는다. 요금표는 토큰당 가격이 매겨지고 결정은 작업당 가격이 매겨지기 때문이다. 그 두 수치는 이 맞대결에서 서로 반대 부호로 나오며, 그 이유는 장황함이 아니다.
토큰에 드는 비용이 아니라 완료된 작업에 드는 비용
Artificial Analysis Intelligence Index v4.3.2에서 인덱스 작업 하나를 완료하는 데 측정된 비용은 Claude Haiku 5.5의 경우 $0.21, Ling 3.1 Flash의 경우 $0.99입니다. 이는 4.6배 격차로, 3배인 입력 비율보다 더 크며 같은 방향입니다.
뻔한 설명, 즉 비싼 모델이 말을 더 많이 한다는 설명은 틀렸다. Ling 3.1 Flash는 인덱스 작업당 100,671개의 출력 토큰을 생성했고, Claude Haiku 5.5는 162,164개를 생성했다. 더 저렴한 모델이 60% 넘게 더 수다스럽다. 따라서 돈 역시 요금표가 시사하는 곳으로 가고 있지 않다.
작업당 비용을 분해해 보면, 그 비용은 지수 방법론이 실제로 지출하는 곳에 귀결된다. Claude Haiku 5.5의 $0.21 중 약 62%가 입력 측이고, Ling 3.1 Flash의 $0.99 중 약 91%가 그렇다. 이들은 캐시를 많이 쓰는 추론 실행이며, 두 공급업체는 캐시된 입력 토큰의 가격을 매우 다르게 책정한다: Claude Haiku 5.5는 백만 개당 $0.01인 반면 Ling 3.1 Flash는 백만 개당 $0.06으로, 청구서를 좌우하는 단일 항목에서 6배 차이다. 공개된 요금표는 $0.10과 $0.30을 비교한다. 청구서를 결정하는 항목은 $0.01과 $0.06을 비교한다.
저희 자체 카탈로그는 제공업체의 정가를 0% 마크업으로 그대로 전달하며, 이 점 덕분에 모델링된 청구서가 아니라 실제 청구서에서 두 상황을 구분할 수 있습니다. Ling 3.1 Flash는 저희가 확인할 수 있었던 어떤 벤더 경로 표기로도 카탈로그에 없습니다 — InclusionAI 아래에도, Ling 아래에도, 저희가 시도한 여덟 가지 형태 중 어디에도 없습니다 — 따라서 위의 $0.30과 $0.90은 벤더가 직접 공개한 요율이며 오늘 저희가 라우팅해 드릴 수 있는 것은 없습니다. Claude Haiku 5.5도 카탈로그에 없으며, Anthropic 자체 API를 통해 실행됩니다. 이번 비교의 인근 영역에서 카탈로그가 실제로 제공하는 것은 GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash, Gemini 3.8 Flash이며, 각각 제공업체 정가에 0% 마크업으로 제공됩니다. 따라서 벤더 요율 변경은 벤더 측에 반영되는 당일에 저희 측에도 도달합니다. 아래의 결론이 Ling 3.1 Flash의 에이전트형 프로필이 귀하의 워크로드에 필요한 것이라는 것이라면, 실질적인 다음 단계는 저희가 실제로 라우팅하는 에이전트 기능 지원 모델들과의 일대일 비교를, 하나의 키에 자동 페일오버를 아래에 두고 수행하는 것, 그리고 비용 상한이 애플리케이션 코드가 아니라 라우트에 속할 때는 라우팅 DSL을 사용하는 것입니다.

둘 다 측정된 7개 행
Artificial Analysis는 두 모델을 모두 실행해 본 유일한 보드이며, 겹치는 부분은 좁지만 유익합니다. 각 행은 서로 일치하지 않으며, 불일치의 방향은 무작위가 아닙니다.
• Intelligence Index v4.3.2 — Claude Haiku 5.5 (Max)의 43.40 대 Ling 3.1 Flash의 41.09. Anthropic이 2.31포인트 앞섰습니다.
• 완료된 Index 작업당 비용 — 동일 보드에서 $0.99 대비 $0.21.
• 인덱스 작업당 시간 — Claude Haiku 5.5는 424.6초인 반면 Ling 3.1 Flash는 360.4초입니다. 이 행이 바로 예상이 깨지는 지점입니다. 5,600억 개 매개변수 모델이 인덱스 전체에서 둘 중 더 빠른 쪽이며, 약 15% 더 빠릅니다.
• Terminal Bench 4.0 — 0.3283 대 0.3333. Ling 3.1 Flash가 반 점 앞서는데, 이는 두 업체가 모두 인용하는 벤치마크에서 동점이다.
• SciCode — 0.5405에 대비 0.5498. Claude Haiku 5.5를 0.9점 차로 앞섰다. 이 또한 동점이다.
• Humanity's Last Exam, 도구 없이 — 0.4439 대 0.3943. Claude Haiku 5.5가 5점 차로, 첫 실질적 격차.
• AutomationBench, 부분 점수 — 0.3541 대 0.6174. Ling 3.1 Flash가 26점 차로 앞섰고, 그 폭은 이 목록의 다른 모든 격차를 합친 것보다 더 큽니다.
그 공통 세트 밖에 두 개의 행이 더 있으며, 이는 기재할 가치가 있습니다. 구매자들이 가장 눈여겨보는 항목이기 때문입니다. Artificial Analysis가 44개 직업에 걸쳐 운영하는 GDPval-AA에서 두 수치는 1620.05와 1621.75입니다 — 통계적으로 막상막하입니다. Elo 등급이 매겨진 장문 전문 업무 평가인 AA-Briefcase v1.1에서 Claude Haiku 5.5는 1577.72를 기록한 반면 Ling 3.1 Flash는 1400.35를 기록해, Anthropic에 유리한 177점 차이입니다. 이는 보드 전체에서 두 모델 간 비에이전트 부문 최대 격차입니다.
이런 대화 대부분을 결정해야 하는 단 하나의 행
지수 수준 평균은 시간과 돈이 실제로 어디에 쓰였는지를 감춘다. 그리고 이 배치에서 이 쌍이 그 가장 명확한 사례다. Terminal Bench 4.0의 평가별 수치는 점수를 제외하면 어떤 차원에서도 서로 가깝지 않다.
• Terminal Bench 4.0, Ling 3.1 Flash — 작업당 $5.49와 작업당 1,283초로 0.3333.
• Terminal Bench 4.0, Claude Haiku 5.5 — 작업당 $0.65, 작업당 908초에 0.3283.
점수 5천분의 1점 차이가 이들을 갈라놓습니다. 비용은 8.4배, 실제 경과 시간은 1.4배입니다. 벤치마크 표를 읽고 0.3333점을 받은 모델을 선택하는 팀은, Artificial Analysis 자체 계산에 따르면, 같은 답을 얻기 위해 8배 더 많은 비용을 지불하고 3분의 1분 늦게 도착하기로 선택한 것입니다.
이것은 점수가 무의미하다는 주장이 아니다. 점수란 시도한 작업 대비 완료한 작업의 비율이며, 거기에 도달하기 위해 소비된 자원에 대해서는 아무것도 말해주지 않는다는 주장이다. 에이전트적 완수에 대한 벤치마크는 바로 이 구분이 가장 아프게 작용하는 상황이다. 왜냐하면 재시도하는 에이전트는 재시도할 때마다 전액을 지불하는 에이전트이고, 시도당 비용이 여덟 배나 되는 모델은 재시도 루프를 예산 항목으로 바꿔놓기 때문이다.

다운로드할 것이 없는 5,600억 개의 파라미터
다음은 Ling 3.1 Flash의 사양표에서 정말로 이례적인 부분인데, 그것은 크기가 아니다.
Ling 3.1 Flash는 희소 전문가 혼합 모델로, 총 5,600억 개의 매개변수와 토큰당 250억 개의 활성 매개변수를 갖추고 있으며, Artificial Analysis는 이를 독점으로 분류합니다. 가중치도, 라이선스 파일도, 저장소도 없습니다. 그러한 형태의 대규모 희소 모델은 일반적으로 오픈 릴리스로 등장합니다. 왜냐하면 이 등급의 나머지가 그렇게 하기 때문입니다: GLM 5.3 Flash는 총 3,200억 개, 활성 180억 개의 MIT 가중치를 제공하고, DeepSeek V4.1 Flash는 총 5,520억 개, 활성 160억 개의 MIT 가중치를 제공합니다. Ling 3.1 Flash는 동일한 규모 차수의 동일한 아키텍처 클래스이며, API로만 공개되었습니다.
그 선택에는 벤치마크 행이 보여주지 않는 결과가 따른다. 활성 파라미터가 250억인 모델은 어딘가에서 서빙되어야 하며, 체크포인트를 보유할 수 없다면 어디서, 어떤 마진으로 서빙할지 선택할 수 없다 — 공급업체가 제공하는 해당 모델 서빙을 임대하는 셈이다. 위의 $5.49 Terminal Bench 작업 가격은 주로 토큰 단가에서 비롯된 결과가 아니다. 그것은 그 모델을 실행할 수 있는 유일한 주체로부터 대형 희소 모델을 임대하는 데 드는 비용이다. 이 계층의 오픈 웨이트 형제 모델들은 그 숫자를 직접 바꿀 수 있는 선택지를 준다.
이것은 반대 방향으로도 작용하며, 같은 정직함이 적용됩니다. 오픈 릴리스가 자동으로 더 나은 제품인 것은 아닙니다. 가중치와 함께 서빙 부담, 양자화 선택, 그리고 끊임없는 업그레이드까지 물려받게 되며, 라이선스 파일은 지원 계약이 아닙니다. Anthropic은 Claude Haiku 5.5에 대해 2027년 10월 7일 이전에는 서비스를 종료하지 않겠다는 약속을 시스템 카드를 갖춘 퍼스트파티 API에서 공개합니다. 이 두 가지 방식 중 무엇을 원하는지는 두 모델 중 어느 쪽에 관한 질문이 아니라 여러분의 팀에 관한 질문입니다.
Ling 3.1 Flash의 용도
프로필을 전체적으로 읽어 보면, 그것은 타협된 제품이라기보다 일관성 있는 제품을 묘사한다. 이 가격대에서 측정된 그 무엇보다 자율적인 다단계 워크플로를 더 잘 끝내고, 어려운 단일 샷 추론에서는 별로 눈에 띄지 않으며, 프롬프트 길이 절벽 없이 정액 요금으로 그렇게 해내는 크고 희소한 장문맥 모델이다. AutomationBench에서 그것은 Claude Haiku 5.5보다 26점 앞서며, 그 AA-Briefcase 점수는 이 비교에서 그것이 선두가 아니라 중위권 뒤에 처지는 유일한 항목이다.
그것은 배치 에이전트형 작업자에 대한 정당화할 수 있는 설명이다: 각각 완료되어야 하는 구조화된 작업들의 대기열에 그것을 투입하고, 작업이 분 단위로 측정된다는 점을 받아들이며, 임계 단계가 처벌적일 만큼 프롬프트를 길게 유지하고, 단일 토큰의 비용보다 결승선에서의 신뢰성을 더 중시하라. 그것이 적합하지 않은 것은 플래시 등급 모델들이 일반적으로 구매되는 용도이다. 그것은 텍스트만 받아들인다 — 이미지 입력은 전혀 없다. 반면 Claude Haiku 5.5는 텍스트와 이미지를 모두 받아들인다. 그것의 인덱스 작업 시간은 더 짧지만, Terminal Bench 작업 시간은 더 길다. 그리고 완료된 인덱스 작업당 $0.99 대 $0.21로, 거의 동일한 종합 점수에 도달하기 위해 4.5배의 비용을 지출하고 있다.

현존하는 증거에 비추어 볼 때, 둘 중 어느 쪽인가?
당신의 작업이 텍스트 입력, 텍스트 출력이고 대량으로 토큰당 가격이 책정되는 방식이라면, Claude Haiku 5.5는 인보이스에 반영되는 모든 항목에서 이 비교에서 승리합니다: 더 낮은 지수 작업 비용, 에이전트에 가장 중요한 벤치마크에서 더 낮은 실제 작업 비용, 더 높은 종합 점수, 더 나은 장문 전문 작업 점수, 더 나은 충실도, 그리고 다른 모델이 전혀 제공하지 않는 이미지 입력까지.
귀하의 작업이 여러 단계로 이루어진 워크플로를 완료해야 하는 무인 에이전트라면, 바로 그것을 측정하는 단 하나의 공유 벤치마크에서 Ling 3.1 Flash는 Claude Haiku 5.5보다 26점 높은 점수를 내고 있으며, 이는 가격만 보고 일축하기보다 테스트해 볼 가치가 있습니다. 이 표가 아니라 귀하의 자체 트레이스에서 테스트하세요. 그리고 테스트 비용은 완료된 작업당으로 산정하세요. 에이전트가 재시도할 때 움직이는 숫자가 바로 그것이기 때문입니다.
가중치를 직접 보유해야 한다면, 이 둘 중 어느 것도 당신의 모델이 아닙니다. Ling 3.1 Flash는 5,600억 매개변수의 독점 모델이고, Claude Haiku 5.5는 공개된 수치가 없는 독점 모델입니다. 이 계층의 오픈 릴리스는 보드의 다른 곳에 있으며, 그 비교는 완전히 다른 행 집합에서 시작됩니다.
종합 점수는 2.31점이라고 말한다. 에이전틱 벤치마크는 반대 방향으로 26이라고 말한다. 요율표는 입력 기준 3배라고 말하고, 완료 작업 비용은 요율표와 같은 방향으로 4.6배라고 말한다. 네 개의 숫자, 두 개의 방향 — 그래서 이 문제를 확실히 정리하는 유일하게 신뢰할 수 있는 방법은 둘 다 자신의 작업 트레이스에 대해 실행해 보고, 토큰이 아니라 완료된 작업에서 비용을 읽어 내는 것이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
