
LongCat-2.5-Preview vs Grok 4.6: 하나는 벤치마크 카드를, 다른 하나는 후속작을 갖고 있다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 610 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 189 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
비교:LongCat-2.5-Preview와 Grok 4.6 — 이 비교가 어색한 데에는 두 모델 중 어느 쪽의 품질과도 무관한 이유가 있다: 이 질문에는 유통기한이 있기 때문이다. Grok 4.6은 2026년 8월 12일에 출시되었고, Grok 4.7은 이 글을 쓰는 시점에서 엿새 전인 2026년 9월 21일에 출시되었으며, 100만 토큰당 $2.00 / $6.00이라는 동일한 요금과 500,000토큰 컨텍스트 윈도우를 그대로 유지했다. 한편 LongCat-2.5-Preview는 2026년 9월 25일 메이투안의 LongCat API 플랫폼에 등장했지만, 발표된 후속 모델은 어디에도 보이지 않고 공개된 벤치마크도 전혀 없다. 따라서 진짜 선택은 '어느 모델이 더 나은가'가 아니다. 이미 그 뒤에 측정된 후속 모델이 서 있는 측정된 역량을 원하는지, 아니면 적어도 현행 최신작인 측정되지 않은 역량을 원하는지의 문제다.
그런 프레이밍은 점수판보다 덜 흥미진진하고 훨씬 더 유용하다.
Grok 4.6이 실제로 보유한 정보부터 시작하세요.
Grok 4.6은 문서가 잘 갖춰진 모델입니다. 우리 카탈로그에서는 500,000토큰 컨텍스트 윈도우, 텍스트, 이미지 및 파일 입력을 제공하며, 요금표는 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $6.00, 백만 캐시된 입력 토큰당 $0.50이고, 200,000 입력 토큰을 초과하면 $4.00 및 $12.00으로 인상됩니다. Artificial Analysis의 독립적인 프로필에는 코딩 지수 76.8(해당 지수가 추적하는 모델 중 5위), 지능 지수 44.3(18위), GPQA Diamond 94.9%, Humanity's Last Exam 42.9%, SciCode 56.5%, Terminal-Bench v2.1 88.4, τ²-Bench for banking 50.7이 포함됩니다. Long-Context Recall은 80.3입니다.

LongCat-2.5-Preview에는 그런 것이 전혀 없다. Meituan의 2026년 9월 25일 체인지로그 항목은 날짜가 명시된 제공 공지로, 세 가지 주장된 기능 — 이미지 이해, 코딩, 그리고 Hermes, OpenClaw, OpenCode, Kilo Code를 포함한 "Claude Code 및 기타 주류 개발 환경"과의 호환성 — 을 나열할 뿐이며, 결과라고 할 만한 것은 아무것도 없다. 공급업체의 가격 페이지는 캐시되지 않은 입력 100만 개당 $0.30, 캐시된 입력 100만 개당 $0.006, 출력 100만 개당 $1.20을 제시하며, 한시적 할인이라고 명시적으로 표시되어 있다. 컨텍스트 윈도는 1,000,000토큰이고 최대 출력은 131,072이다. 대략 총 1.6조 / 활성 480억 파라미터라는 수치는 문서가 아니라 Meituan 사이트 메타데이터와 중국 업계 보도에서 나온 것이다. HuggingFace나 Meituan의 GitHub 조직에는 이에 대한 저장소가 없으며, OpenCode가 제공하는 카탈로그 메타데이터는 오픈 가중치를 false로 기록한다.
스코어보드가 전혀 놓칠 차원
이 두 모델은 어떤 벤치마크도 측정하지 않는 부분에서 서로 다르고, 많은 팀에게는 그것만으로 이 질문의 답이 결정됩니다: 여러분이 보내는 프롬프트에 무슨 일이 일어나는지.
OpenCode의 자체 문서에 따르면 LongCat 2.5 Preview Free는 제로 리텐션 정책을 따르고 귀하의 데이터를 학습에 사용하지 않는 제공업체에 의해 제공됩니다. Zen 개인정보 보호 표는 이를 수치로 보여줍니다 — 모델 학습 "사용 안 함", 데이터 보존 "0일". 동일한 개인정보 보호 표에는 Grok 4.6 및 Grok 4.7에 대해 30일 보존이 나열되어 있습니다. 이 두 진술은 모두 OpenCode의 것이며 OpenCode의 페이지에 게시되었고, 무료 목록과 비교 목록을 구체적으로 설명합니다. 하지만 비공개 저장소에 에이전트를 향하게 하는 경우, 그것은 법무팀과 하지 않아도 되는 대화와 해야 하는 대화의 차이입니다 — 그리고 그것은 어떤 모델이 SciCode에서 더 높은 점수를 받는지와는 아무 관련이 없습니다.

"measured"가 주는 것과 주지 않는 것
Grok 4.6의 수치는 여기서 중요한 유일한 의미에서 LongCat-2.5-Preview의 수치보다 낫습니다: 바로 그것이 존재한다는 점입니다. 그렇다고 Grok 4.6이 더 나은 모델이라는 뜻은 아닙니다. Grok 4.6의 Coding Index 76.8은 Grok 4.7 세대의 수치보다 낮고, 비교 대상이었던 모델은 더 이상 자기 계열의 최전선이 아닙니다. 공개된 후속 모델은 Intelligence Index가 46.4로 Grok 4.6의 44.3보다 높고, Long-Context Recall은 76.67로 Grok 4.6의 80.33보다 낮습니다 — 따라서 후속 모델이 모든 축에서 더 나은 것은 아니며, 이는 바로 세대 번호가 숨기는 종류의 세부 사항입니다.
또한 두 모델 모두에 대한 호의적인 해석에 반하는, 실서비스 제공과 관련해 분명히 짚고 넘어갈 만한 단서가 있습니다. 우리 자체의 7일 플레이그라운드 샘플에서 Grok 4.6은 측정된 처리량도, 토큰 트래픽도 기록하지 않았는데, 이는 성능 판정이라기보다 해당 열에서 데이터 부재가 보이는 방식입니다. LongCat-2.5-Preview는 우리가 라우팅하지 않기 때문에 우리 측 서빙 샘플이 전혀 없습니다. 따라서 이 둘 사이의 지연 시간 비교는 산문이 흔히 덮어버리는 방식으로 한쪽으로 치우쳐 있습니다. 트래픽을 보내지 않는 모델은 벤치마크할 수 없습니다.
여기서 라우팅 계층이 실제로 도움이 되는 부분
위의 사실 중 세 가지는 라우터가 단지 호환되는 대상이 아니라 애초에 라우터가 만들어진 목적에 해당하는 종류다. Grok 4.6의 요금표는 입력 토큰 200,000개를 초과하면 요율이 올라가므로, 동일한 논리적 작업이 애플리케이션이 무엇이든 보내기 전에 이미 알고 있는 숫자에 따라 서로 다른 두 요율로 청구될 수 있다. Grok 4.6에는 동일한 요율의 후속 모델이 공개되어 있는데, 이는 한쪽에서 다른 쪽으로 전환할 때 한 줄만 바꾸면 되고 재통합은 결코 필요 없다는 뜻이다. 그리고 LongCat-2.5-Preview의 가장 매력적인 속성, 즉 가격은 공급업체가 명시적으로 한시적이라고 표시한 것이다.
OrcaRouter에서는 Grok 4.6을 xAI의 정가로 마크업 없이 제공합니다. 따라서 벤더의 요금 변경이 다음 갱신일이 아니라 같은 날 청구서에 반영되며, 자동 페일오버는 여러분의 코드가 어느 쪽이 응답했는지 알 필요 없이 저하된 요청을 정상 제공자로 옮겨 줍니다. 라우팅 DSL은 계층형 가격 책정 사례를 직접 처리하고, 모델 퓨전은 긴 내용을 읽을 때 원하는 모델이 최종 합성에 원하는 모델과 다른 경우를 처리합니다. LongCat-2.5-Preview는 우리의 라우트 중 하나가 아닙니다 — 우리는 그것을 제공하지 않으며, 여기 어느 내용도 그렇다고 주장하지 않습니다. 그 이름을 언급한 요점은 여러분을 다른 곳으로 라우팅하려는 것이 아닙니다. 그것은 실행 중인 모델이 아니라 평가 중인 모델이, 실행 중인 모델과 같은 키 뒤에 있어야 한다는 것입니다. 그래야 평가하는 데 프로젝트가 아니라 설정 항목 하나의 비용이 들기 때문입니다.

결정하는 방법
• 방어할 수 있는 답변이 필요하다면 Grok 4.6을 선택하십시오. Grok 4.6은 독립적인 카드, 문서화된 입력 프로필, 만료되지 않는 가격을 갖추고 있습니다. 주요 위험은 품질이 아니라 적합성입니다. Grok 4.7이 동일한 요금으로 존재하며, 관성 때문에 4.6에 머무는 대가는 추가 비용 없이 누릴 수 있었던 Intelligence Index 44.3과 46.4의 차이입니다.
• 결정적 요인이 보존이나 범위라면 LongCat-2.5-Preview를 선택하세요. OpenCode를 통한 제로 보존 접근, 100만 토큰 창, 131,072토큰 출력 상한, Grok 4.6의 약 7분의 1에 해당하는 요금표는 실질적 이점입니다 — 그중 첫 번째는 제3자의 개인정보 처리방침으로 검증되었고, 나머지는 공급업체가 단독으로 주장하는 것입니다.
• 벤치마크 표를 근거로 둘 중 하나를 선택하지 마세요. 왜냐하면 표는 하나만 존재하기 때문입니다. Grok 4.6의 76.8 코딩 점수와 80.3 롱컨텍스트 회상은 Grok 4.6을 설명합니다. LongCat-2.5-Preview를 설명하는 것은 아직 없습니다. 이번 주에 Grok 4.6 점수 옆에 LongCat-2.5-Preview 점수를 적어 내는 사람은 다른 LongCat 모델을 인용하고 있거나 그 숫자를 지어내는 것입니다.
• 그 위에 구축하기 전에 입력 측을 확인하세요. Meituan의 변경 로그는 이미지 이해를 앞세우지만, 자체 "Retrieve Model" 문서의 예시 응답은 여전히 input_modalities를 ["text"]로, text->text 모달리티 문자열과 함께 표시합니다 — 달리 말하는 공개 계약에 반하는 공급업체 주장입니다. Grok 4.6은 텍스트, 이미지, 파일을 받으며 그런 모호함이 없습니다. 그리고 하네스가 인터리브된 reasoning_content 필드를 노출하는지 확인하세요. LongCat-2.5-Preview의 추론 품질에 대해 결론을 내리기 전에 말입니다. 그 필드를 누락하는 클라이언트는 조용히 실패합니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
