
LongCat-2.5-Preview vs Kimi K3: 아직 아무도 답할 수 없는 장문맥 회상 질문
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 610 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 189 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Kimi K3는 Long-Context Recall에서 88.67점을 기록했습니다. 이는 모델이 긴 입력 깊숙한 곳에 묻힌 정보를 여전히 활용하는지라는 특정 질문에 대해 우리 카탈로그의 어떤 모델보다도 높은 수치입니다. LongCat-2.5-Preview는 Long-Context Recall 점수가 전혀 없습니다 — Artificial Analysis에서도, Meituan에서도, 어디에서도요. 그리고 LongCat-2.5-Preview는 100만 토큰 창을 대표 기능으로 내세우는 모델입니다. 중심 주장이 긴 문맥인데도 긴 문맥 측정이 존재하지 않는 모델이라는 이 불일치가 바로 이 비교의 전부입니다. 나머지는 부차적입니다.
빠진 숫자가 무엇을 의미하고 무엇을 의미하지 않는지는 정확히 따져볼 가치가 있습니다. 왜냐하면 '측정되지 않음'에서 '아마도 나쁨'으로 미끄러지기 쉽고, 어느 방향도 뒷받침되지 않기 때문입니다.
두 모델이 각각 공식적으로 밝힌 내용
MoonshotAI의 Kimi K3는 2026년 7월 15일에 출시되었습니다. 당사 카탈로그는 1,048,576토큰 컨텍스트 윈도우, 텍스트 및 이미지 입력, 그리고 백만 입력 토큰당 $3.00, 백만 캐시 입력 토큰당 $0.30, 백만 출력 토큰당 $15.00의 요금표로 이를 제공합니다. Artificial Analysis의 독립 프로필은 다음과 같습니다: Coding Index 76.2, 9위; Intelligence Index 43.6, 19위; GPQA Diamond 93.5%; Humanity's Last Exam 46.9%; SciCode 59.5%; Terminal-Bench v2.1 85.0; τ²-Bench banking 46.0. 그리고 Long-Context Recall 88.67로, 당사가 제공하는 제품 중 최고입니다.

메이투안의 LongCat-2.5-Preview가 2026년 9월 25일 LongCat API 플랫폼에 등장했다. 변경 로그 항목에는 세 가지 주장된 기능이 명시되어 있다 — 이미지 이해, 코딩, 그리고 "Claude Code 및 기타 주류 개발 환경"과의 호환성으로, Hermes, OpenClaw, OpenCode, Kilo Code를 나열한다. 가격 페이지에는 캐시되지 않은 입력 100만 토큰당 $0.30, 캐시된 입력 100만 토큰당 $0.006, 출력 100만 토큰당 $1.20이 제시되어 있으며, 한시적 할인으로 표시되어 있다. 컨텍스트 윈도우 1,000,000; 최대 출력 131,072. 약 1.6T 총 파라미터 / 약 48B 활성 파라미터 수치는 메이투안의 사이트 메타데이터와 중국 업계 보도에서 나온 것이지 문서에서 나온 것이 아니다. 벤치마크 표도, 모델 카드도, 기술 보고서도, HuggingFace나 메이투안의 GitHub 조직에 저장소도 없으며, 카탈로그 메타데이터는 오픈 가중치를 false로 기록하고 있다.
왜 빠진 숫자가 다른 어떤 맞대결에서보다 여기서 더 중요한가
Long-Context Recall은 이 두 모델에게 여러 점수 중 하나가 아니다. 그것은 두 모델이 모두 판매하는 것을 시험하는 점수다. 100만 토큰 창은 아키텍처 용량에 대한 진술이고, 회상은 모델이 토큰 900이 아니라 토큰 900,000에 놓인 사실을 여전히 검색하고 활용할 수 있는지를 측정한다. 공급업체는 첫 번째를 사양이기 때문에 공개한다. 독립 평가자들은 두 번째를 테스트이기 때문에 공개하며, 대부분의 모델은 자신의 창 크기가 시사하는 만큼 그 테스트에서 좋은 성과를 내지 못한다.
그래서 정직한 입장은 들리는 것보다 더 좁습니다. Kimi K3의 88.67은 Kimi K3가 LongCat-2.5-Preview보다 더 나은 장문맥 모델이라는 뜻이 아닙니다. 그것은 Kimi K3가 그 질문이 제기되고 답해진 쪽이라는 뜻입니다. LongCat-2.5-Preview가 더 나을 수도 있습니다. 상당히 더 나쁠 수도 있습니다. 핵심은 현재 Meituan 밖에서는 아무도 모른다는 것이며, 가격 페이지에 적힌 1M 창은 어느 쪽의 증거도 되지 않는다는 것입니다.

동일한 산술 경고와 함께 보는 비용 현황
공개된 요금 기준으로, LongCat-2.5-Preview는 캐시되지 않은 입력에서 Kimi K3보다 10배 저렴하고 출력에서는 12.5배 저렴합니다. 500,000토큰을 읽고 20,000토큰을 다시 쓰는 경우 Kimi K3에서는 약 $1.80, LongCat-2.5-Preview에서는 약 17센트에 해당합니다. 둘 다 측정값이 아니라 가격표를 바탕으로 한 계산이며, LongCat 수치에는 Kimi 수치에는 없는 추가 주의사항이 따릅니다. Meituan은 자사 요율을 한시적 할인이라고 표시하므로, 프로모션이 끝난 뒤에도 유지될 수치는 알 수 없습니다.
그것을 커버리지 문제에 견주어 보세요. 500,000토큰 입력을 처리하고 있는데 그 깊이에서 모델의 재현율이 측정되지 않았다면, 비용 차이는 절약이 아닙니다. 그것은 알 수 없는 실패율의 대가입니다. 관련 섹션을 조용히 놓치는 17센트 요청은 그것을 찾아내는 1.80달러 요청보다 더 비쌉니다. 어느 쪽이든 재실행과 디버깅 비용을 치르기 때문입니다. 이것이 바로 그 위험의 구체적인 형태이며, 누락된 벤치마크가 단지 마케팅 문제가 아니라 비용 문제인 이유입니다.
번호가 존재하지 않는 동안 해야 할 일
직접 만들어 보세요. 무료 창구가 이 공백에 정말로 잘 맞아떨어지는 드문 사례입니다. LongCat-2.5-Preview는 명시되지 않은 기간 동안 OpenCode를 통해 호출하는 데 비용이 전혀 들지 않으며, OpenCode가 문서화한 무보존 정책—모델 학습 "사용 안 함", 데이터 보존 "0일"—덕분에 데이터 처리 관련 대화를 먼저 거치지 않고도 비공개 저장소에 연결할 수 있습니다. 실제로 사용하는 깊이에서 바늘 찾기(needle-in-a-haystack) 테스트를 만들어 두 모델 모두에서 실행하면, 어느 벤더도 공개하지 않은 숫자를 손에 넣게 될 것입니다. 결과를 신뢰하기 전에 두 가지를 확인하세요. 하네스가 인터리브된 reasoning_content 필드를 노출하는지, 그리고 이미지 입력이 아예 작동하는지입니다. 메이투안의 변경 로그는 그렇다고 주장하지만 자체 "Retrieve Model" 예시는 여전히 input_modalities를 ["text"]로, text->text 문자열과 함께 보여줍니다.

이것에서 OrcaRouter의 역할
저희는 Kimi K3를 MoonshotAI의 정가로 마크업 없이 제공합니다. LongCat-2.5-Preview는 저희가 취급하는 경로 중 하나가 아닙니다 — 저희는 이를 제공하지 않으며, 이 글의 어떤 내용도 저희가 이를 제공한다고 주장하는 것으로 해석되어서는 안 됩니다.
이 특정 비교에서 라우터의 유용한 부분은 가격이 아니다. 그것은 평가 중인 모델과 의존하고 있는 모델이 같은 키 뒤에 나란히 있을 수 있다는 점이다. Kimi K3의 88.67 리콜은 그것을 오늘 장문맥 패스를 라우팅할 모델로 만들어 준다; LongCat-2.5-Preview는 그것과 맞붙여 테스트하고 싶은 모델이다. 왜냐하면 그 리콜이 출력 가격의 12분의 1에서도 유지된다면 장문서 작업의 경제성이 달라지기 때문이다. 모델 융합은 그것을 이론이 아닌 구체적인 것으로 만들어 주는 메커니즘이다: 장문맥 검색 패스와 최종 종합 단계가 하나의 요청에서 서로 다른 두 모델이 될 수 있으므로, 값싼 미측정 모델과 비싼 측정 완료 모델이 반드시 둘 중 하나일 필요는 없다. 그다음 자동 장애 조치가 둘 중 하나가 성능 저하를 일으키는 경우를 커버하는데, 이는 두 후보 중 하나에 검사할 수 있는 서빙 이력이 없을 때 평소보다 더 중요하다.
그 평결은, 그 자체의 불확실성을 붙인 채 진술되었다
이번 주에 롱컨텍스트 작업이 안정적으로 작동해야 한다면 Kimi K3가 정당화 가능한 선택이다: 88.67 리콜은 문제의 바로 그 능력에 대해 입수 가능한 최고 수치이며, 더 넓은 프로필은 — 코딩 76.2, 지능 43.6, GPQA Diamond 93.5% — 화려하기보다는 견실하고, 이 모든 것은 독립적인 출처에서 나온 것이다. 스스로 평가를 생성하는 데 오후 한나절을 쓸 의향이 있다면 LongCat-2.5-Preview가 더 흥미로운 승부수다: 100만 토큰 창, 131,072 토큰 출력 상한, 제로 리텐션 액세스, 그리고 Kimi K3보다 한 자릿수 낮은 요금표 — 이 모든 것이 아직 아무도 공개적으로 검증하지 않은 벤더 주장에 기대고 있다.
정당화될 수 없는 것은 둘 다 100만 토큰을 명시한다는 이유로 이들을 동등하게 취급하는 것이다. 그중 하나는 그 윈도에 숫자가 붙어 있고, 다른 하나에는 가격이 붙어 있다. 이것들은 서로 다른 종류의 근거이며, 그 둘 사이의 간극이야말로 이 비교가 실제로 다루는 유일한 것이다.
