생성된 히어로 타이틀 카드에는 'LongCat-2.5-Preview vs GPT-5.6 Sol'이라는 제목과 '1M 컨텍스트, 끝까지 동일한 가격'이라는 오버라인, 그리고 두 개의 패널이 있습니다: 'LongCat-2.5-Preview: 1M당 $0.30 / $1.20, 최대 출력 131,072' 및 'GPT-5.6 Sol: 1M당 $4.00 / $20.00, 272K 입력 초과 시 두 배'. OrcaRouter 로고는 오른쪽 아래에 있습니다.
Engineering & Research

LongCat-2.5-Preview vs GPT-5.6 Sol: 1M 토큰 윈도우가 양쪽에서 치르는 비용

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

에 관해 말할 수 있는 가장 유용한 것은 LongCat-2.5-Preview와 GPT-5.6 Sol어느 쪽이 더 똑똑한지가 아니다. 두 모델 모두 약 100만 토큰의 컨텍스트 윈도를 내세우지만, 그 윈도 전체에 같은 요율을 부과하는 쪽은 둘 중 하나뿐이라는 점이다. Sol의 가격은 입력 토큰이 272,000개를 넘으면 두 배가 된다. Meituan이 적어 놓은 바로는, LongCat-2.5-Preview의 공개 요금표에는 구간 구분이 전혀 없다. 이 단 하나의 구조적 차이가 벤치마크를 참고하기도 전에 대부분의 실제 장문서 워크로드를 좌우한다 — 그리고 이것은 스펙 시트 비교로는 결코 알 수 없는 종류의 차이인데, 두 모델 모두 "1M"을 같은 글자 크기로 써 놓기 때문이다.

각 항목에 대해 실제로 기록에 남아 있는 내용은 다음과 같으며, 물어볼 만한 질문별로 정리했습니다.

백만 토큰 윈도우가 양쪽에서 같은 제품인가요?

아니요, 차이는 창이 아니라 그 창을 채울 때 벌어지는 일에 있습니다. 우리 카탈로그에서 Sol은 1,050,000토큰 컨텍스트 창과 최대 128,000토큰 출력을 제공하며, 최대 272,000토큰 요청의 경우 입력 토큰 백만 개당 $4.00, 출력 토큰 백만 개당 $20.00이고, 캐시된 입력은 백만 개당 $0.40, 캐시 쓰기는 백만 개당 $5.00입니다. 그 임계값을 넘으면 요율이 백만 개당 $8.00와 $30.00로 올라갑니다. 따라서 Sol에서 500,000토큰 문서를 처리하는 요청은 혼합 요율이 아니라 전체 요청에 장문 컨텍스트 요율로 청구됩니다.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview는 1,000,000 토큰의 컨텍스트와 131,072 토큰의 최대 출력을 명시합니다. Meituan 자체 플랫폼에 공개되고 그곳에서 한정 기간 할인으로 표시된 요금표는 캐시되지 않은 입력 토큰 백만 개당 $0.30, 캐시된 입력 토큰 백만 개당 $0.006, 출력 토큰 백만 개당 $1.20입니다. Meituan은 두 번째 티어를 공개하지 않습니다. 그렇다고 해서 두 번째 티어가 존재하지 않는다는 뜻은 아닙니다 — 이는 벤더가 그런 티어를 설명하지 않았다는 뜻이며, 설명되지 않은 가격은 예산을 책정할 근거가 되는 가격이 아닙니다.

숫자로 말해 보자. 500,000토큰을 읽고 20,000토큰을 다시 쓰는 작업은 Sol의 롱컨텍스트 티어에서 약 $4.60, LongCat-2.5-Preview의 공개 프로모션 요금에서는 약 17센트가 든다. 두 수치는 측정값이 아니라 공개된 요금표에 대한 산술 계산이다. 이 비율은 경제적으로 시도하는 것이 합리적인 대상을 바꿔 놓을 만큼 크다. Sol의 롱컨텍스트 요금에서는 코드베이스를 모델에 입력하는 일이 하나의 결정이고, LongCat의 요금에서는 거의 기본값에 가깝다.

어느 쪽이 그 숫자 뒤에 근거를 가지고 있나요?

Sol, 큰 차이로, 그리고 바로 이 부분이 비교를 순전히 가격 논쟁으로만 끝나지 않게 합니다. Sol은 우리 카탈로그에 완전한 독립 프로필이 있는 2026년 7월 출시작입니다: 코딩 지수 77.4, Artificial Analysis가 추적하는 모델 중 3위; 지능 지수 47, 13위; GPQA Diamond 94.1%; Humanity's Last Exam 49.5%; SciCode 57.1%; Terminal-Bench v2.1 88.0; τ²-Bench 85.1. 이 모든 수치는 OpenAI가 아니라 Artificial Analysis에 출처를 두고 있습니다.

이 비교에서 가장 관련 있는 수치는 장문맥 회상(Long-Context Recall): 84입니다. 이는 우리가 제공하는 프런티어 모델 중 가장 높은 수치이며, 모델이 긴 입력 깊숙한 곳에 있는 정보를 여전히 활용하는지 — 큰 컨텍스트 창이 답해야 하는 바로 그 질문 — 를 측정한 값입니다. 또한 Sol 자체의 컨텍스트 길이에서, Sol 자체의 기준으로 측정한 값입니다.

LongCat-2.5-Preview에는 이에 상응하는 것이 없다. 메이투안의 2026년 9월 25일 변경 로그 항목은 이미지 이해, 코딩 능력, 그리고 "Claude Code 및 기타 주류 개발 환경"과의 호환성을 주장하며 Hermes, OpenClaw, OpenCode, Kilo Code를 명시한다. 벤치마크 표도, 모델 카드도, 기술 보고서도 공개하지 않는다. 총 약 1.6조 개 파라미터에 토큰당 약 480억 개가 활성이라는 점은 문서가 아니라 메이투안 사이트 메타데이터와 중국 기술 매체 보도를 통해 보고된다. HuggingFace에는 LongCat-2.5-Preview 저장소가 없고, 메이투안의 GitHub 조직에도 없으며, OpenCode가 제공하는 카탈로그 메타데이터는 오픈 웨이트를 false로 기록한다.

A screenshot of OrcaRouter's own model page for OpenAI GPT-5.6 Sol at /models/openai/gpt-5.6-sol, showing the openai/gpt-5.6-sol identifier, a 1.05M-token context window, 128K maximum output, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-09, a p50 first-token figure of 10.00 s, $4.00 and $20.00 rate tiles, and the OpenAI-compatible code samples.

입력 쪽도 일치하나요, 아니면 출력 쪽만인가요?

바로 이 지점에서 Sol의 프로필은 더 넓고 LongCat의 것은 논란의 여지가 있다. Sol은 우리 카탈로그에서 텍스트, 이미지, 파일을 입력으로 받고 텍스트를 반환한다. LongCat-2.5-Preview의 변경 로그는 이미지 이해를 대표적인 추가 기능으로 내세운다 — "교차 모달 질의응답, 콘텐츠 요약, 복잡한 시각적 추론을 위한 이미지 콘텐츠 파싱" — 하지만 Meituan 자체의 "Retrieve Model" 문서에 있는 예시 응답은 여전히 input_modalities를 ["text"]함께 text->text 모달리티 문자열로 표시한다. 그 샘플은 단순히 오래된 것일 수 있다. 그럼에도 그것은 벤더가 공개한 계약이며, 솔직한 해석은 테스트해 보기 전까지 이미지 입력이 확인된 것이 아니라 주장된 것에 불과하다는 것이다.

한 가지 실질적인 결과가 있습니다. LongCat-2.5-Preview의 추론 트레이스는 샘플링된 매개변수로 오는 것이 아니라 reasoning_content 필드에 인터리브되어 도착합니다. 해당 필드를 예상하지 않고 채팅 완료를 파싱하는 하네스는 모델의 사고 과정을 조용히 누락시킵니다. 오류도 없이, 그저 더 나쁜 답변만 나옵니다. 모델 자체에 대해 어떤 결정을 내리든, 먼저 이것을 확인하세요.

실제로 지킬 수 있는 경로는 어느 쪽인가요?

Sol은 저희가 제공하는 모델 중 하나입니다. OpenAI의 정가로 마크업 없이 제공하므로, 공급업체 가격이 바뀌면 다음 갱신 때가 아니라 같은 날 청구서에 반영되며, 자동 장애 조치는 성능이 저하된 요청을 애플리케이션이 알아차리지 못한 사이에 정상 제공업체로 옮깁니다. LongCat-2.5-Preview는 저희 경로 중 하나가 아닙니다 — 저희는 이를 제공하지 않으며, 이 글의 어떤 내용도 저희가 이를 제공한다고 주장하는 것으로 해석되어서는 안 됩니다.

그 비대칭성은 라우팅 계층이 일반적인 부가 설명이 아니라 바로 이 특정 비교에서 존재 가치를 갖는 지점이다. Sol의 계층형 가격 책정은 동일한 작업이 순전히 입력 길이 때문에 두 배의 비용이 들 수 있음을 의미하며, 그 임계값은 272,000 토큰에 있다 — 애플리케이션이 요청을 보내기 전에 이미 알고 있는 숫자다. 워크로드를 요청 크기에 따라 여러 공급자에 걸쳐 분할하는 것은 바로 라우팅 DSL이 존재하는 이유이며, 모델 퓨전은 한 걸음 더 나아간다: 두 모델을 하나의 요청 위에서 조합할 수 있어, 긴 컨텍스트 처리를 담당하는 패스와 고품질 합성 단계가 반드시 같은 모델, 같은 요율일 필요가 없다. 이 둘 중 어느 것도 공개된 벤치마크가 없는 모델을 선택해야 할 이유는 아니다. 둘 다 하나의 모델을 하드와이어하지 말아야 할 이유다.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GPT-5.6 Sol' with the subhead 'Two million-token windows, and only one of them prices the whole window the same'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, no second tier described by the vendor, $1.20 output flagged limited-time, long-context recall not published, no repo and catalogue open_weights false. Right column 'GPT-5.6 Sol' (OpenAI, released 2026-07-09, independently scored): 1,050,000-token context, 128,000 max output, text, image and file to text, $4.00 input up to 272K then $8.00, price doubles at 272,000 input tokens, $20.00 output up to 272K then $30.00, long-context recall 84, coding index 77.4 at rank 3 by Artificial Analysis. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

결론

워크로드가 짧다면 Sol이 단순한 선택이다: 코딩 지수에서 3위이고, 전반적으로 독립적인 수치를 갖추고 있으며, 입력 측면이 문서화되어 있다. 워크로드가 길다면 계산은 급격히 뒤집힌다 — Sol의 롱컨텍스트 계층은 동일한 500,000토큰 읽기에 대해 LongCat-2.5-Preview의 프로모션 요금의 약 26배에 달하며, 롱 윈도우가 실제로 작동하는지에 답하는 것은 리콜 점수 84를 가진 Sol이다. 당신은 프런티어 가격의 측정된 롱 윈도우를 사는 것이고, 그 반대편에는 공급업체가 이미 일시적이라고 표시한 할인 가격의 측정되지 않은 롱 윈도우가 있다.

피해야 할 실패 모드는 그것들을 비교 가능한 선택지로 취급하는 것이다. 그것들은 다른 가격에 팔리는 같은 제품이 아니다. 하나는 문서화된 역량이고 다른 하나는 약속이다. 이 간극을 메우는 올바른 방법은 LongCat-2.5-Preview가 OpenCode를 통해서는 무료이고 Meituan을 통해서는 저렴한 동안, 자체 롱컨텍스트 작업에서 그것을 실행하고, Sol은 라우터 뒤에 두어 프로모션 요금이 사라지거나 롱컨텍스트 티어가 예산을 넘어서는 날에 전환이 마이그레이션이 아니라 구성 한 줄이 되도록 하는 것이다.