Nex-N2.5 Pro vs GPT-5.6 Sol 히어로 — 'Nex-N2.5 Pro vs GPT-5.6 Sol'이라고 적힌 생성된 타이틀 카드, 부제는 '하루 된 오픈 모델 vs 업계에서 가장 깊은 프로덕션 기록', 오버라인은 'OpenAI vs Nex-AGI — 2026년 9월'.
Guides & Insights

Nex-N2.5 Pro vs GPT-5.6 Sol: 신규 업체의 벤더 번호는 기존 업체의 독립 번호에 뒤처진다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 쪽이 모두 숫자를 갖고 있는 유일한 벤치마크를 나란히 놓고 보면, 출시를 위해 밟아야 할 순서가 어긋나 있다. Nex-AGI의 카드에는 Nex-N2.5 Pro가 OSWorld-2에서 56.4점을 기록한 것으로 나오는데, 이는 공개된 적 없는 얼라이언스 자체 NexCUA 하니스로 측정된 수치다. BenchLM의 OSWorld 2.0 리더보드(8월 29일 업데이트)는 GPT-5.6 Sol을 62.6점으로 올려놓았다. 신인 모델의 공급업체 수치를 단박에 따돌린 독립 수치다. 하루 된 모델의 안방인 '화면을 읽으며 컴퓨터를 조작하는 작업', 즉 그 모델이 오로지 그것 하나만을 위해 만들어진 영역에서, 비교 대상인 성숙한 범용 모델은 애스터리스크조차 달 필요 없이 앞서 있다. Nex-N2.5 Pro와 GPT-5.6 Sol의 대결은 신인 모델 제작자가 아닌 다른 누군가가 측정한 어떤 항목에서도 접전이 아니다. 이는 프로덕션 기록이 무엇을 의미하는지 보여주는 사례 연구이며, 그 자체만으로도 읽을 가치가 있다.

두 모델은 지향하는 바가 거의 정면으로 겹치지 않는다. Nex-N2.5 Pro는 2026년 9월 8일에 발표된 3,970억 파라미터 규모의 희소 전문가 혼합(sparse mixture-of-experts) 모델로, 활성 파라미터는 약 170억 개이며, 텍스트·이미지 입력과 텍스트 출력을 지원하는 멀티모달 모델이다. Qwen3.5 계열에서 사후 학습되었고, 시각적 피드백 루프를 통해 컴퓨터와 브라우저를 작동하도록 구축되었다. Apache-2.0 가중치는 여전히 Hugging Face에서 "coming soon"으로 표시되어 있으며, 현재 제공되는 빌드는 Nex-AGI가 카드에서 링크하는 무료 호스팅 엔드포인트가 전부다. GPT-5.6 Sol은 OpenAI의 "가장 어려운 작업"을 위한 플래그십 모델로, 깊은 다단계 추론·대규모 소프트웨어 엔지니어링·장기적 에이전트 워크플로우를 처리하며 7월 9일부터 API에 공개된 폐쇄형 가중치 모델이다. 그리고 OpenAI가 9월 3일 GPT-6 Astra를 출시할 때까지 프런티어 기준점이었다는 무게를 지금도 짊어지고 있다. Nex-N2.5 Pro가 자체 가중치를 공개하지 못한 전문가 모델이라면, GPT-5.6 Sol은 두 달 동안 업계에서 가장 까다로운 프로덕션 트래픽을 소화하며 검증된 범용 모델이다.

GPT-5.6 Sol은 파일이 있는 모델입니다.

Sol이 Nex-N2.5 Pro에는 없는 것, 즉 검증 기록을 갖고 있다는 점부터 시작하자. 7월 9일 이후 GPT-5.6 Sol은 독립적인 테스트 하네스로 실행되고, 보안 연구자들의 강도 높은 테스트를 거쳤으며, 에이전트 프레임워크와 Codex 워크플로에 통합되었다. 그 독립적인 측정값들은 깊이 있고 공개적이다. 최대 추론 설정에서 Artificial Analysis Intelligence Index 61, 같은 독립 하네스로 측정한 Terminal-Bench 2.1 88.0, DeepSWE 73.0, 그리고 측정된 출력 속도는 초당 약 71토큰, Intelligence Index 작업당 비용은 약 $0.95였다. 그렇다고 해서 그것이 무적이라는 뜻은 아니다. OpenAI는 이후 GPT-6 Astra를 그 위에 배치했다. 그러나 그 숫자들 각각은 OpenAI가 아닌 다른 누군가가 측정한 값이다. Nex-N2.5 Pro는 어디에도 독립적인 기록이 없다. 구조적인 이유 때문이다. 동맹 밖에서는 아무도 그것을 실행할 수 없다.

둘 다 숫자를 가지고 있는 유일한 벤치마크

OSWorld 비교는 현재 나올 수 있는 가장 명확한 지표이므로, 사용하기 전에 그 한계를 먼저 밝혀둘 필요가 있다. Nex-N2.5 Pro의 56.4는 Nex-AGI가 자체 NexCUA 하네스를 통해 OSWorld-2에서 측정한 값이다. GPT-5.6 Sol의 62.6은 BenchLM의 OSWorld 2.0 리더보드에서 가져온 것으로, 2026년 8월 29일자 타사 스냅샷이며 15개 모델을 수록하고 있다. 해당 리더보드에서 Claude Opus 5가 70.6으로 1위, GPT-5.6 Sol이 62.6으로 2위, GPT-5.6 Terra가 50.2로 3위를 차지했다. 'OSWorld-2'와 'OSWorld 2.0'은 매우 유사하지만 동일한 것으로 입증된 것은 아니므로, 4~6포인트 차이는 정확한 수치라기보다 방향성을 보여주는 것으로 읽어야 한다. 이러한 한계를 감안해도 남는 것은 순서다: 각 측이 제시할 수 있는 최고 수치를 기준으로 볼 때, 독립적으로 측정된 Sol의 수치는 Nex가 발표하기로 선택한 벤치마크에서 벤더 측 Nex 수치를 앞선다. 자체 수치가 기존 제품의 독립 수치보다 낮은 신규 진입자는 전환을 고려할 만한 설득력 있는 근거를 제시하지 못한 것이다.

A two-column scoreboard titled 'Nex-N2.5 Pro vs GPT-5.6 Sol — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Weights Apache-2.0 pending; OSWorld 2.0 56.4 vendor-reported; AA Index no score yet; Context 262,144; Price free hosted / no list. Right column GPT-5.6 Sol: Released Jul 9 2026; Weights closed; OSWorld 2.0 62.6 independent; AA Index 61 (max); Context ~1.05M; Price $4.00 / $20.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Sol OSWorld per BenchLM Aug 29 and Index per Artificial Analysis.'

사양 봉투

사양서의 나머지 부분도 같은 방향으로 진행됩니다:

출시됨 — Nex-N2.5 Pro: 2026년 9월 8일 (호스팅 엔드포인트 활성화, 가중치 공개 대기 중). GPT-5.6 Sol: 2026년 7월 9일, 일반 공개.

규모 — Nex-N2.5 Pro: 총 397B / 활성 MoE 약 17B. GPT-5.6 Sol: 파라미터 수 비공개.

모달리티 — Nex-N2.5 Pro: 텍스트 및 이미지를 입력받아 텍스트를 출력하며, 컴퓨터 사용 비전 루프를 제공합니다. GPT-5.6 Sol: 텍스트, 이미지, 파일을 입력받아 텍스트를 출력하며, 도구 호출 및 JSON 모드를 지원합니다.

컨텍스트 / 출력 — Nex-N2.5 Pro: 262,144-토큰 컨텍스트. GPT-5.6 Sol: ~1.05M-토큰 컨텍스트, 128K 출력 상한.

추론 제어 — Nex-N2.5 Pro: 없음 / 중간(적응형, 기본값) / 높음. GPT-5.6 Sol: 추론 노력을 최대치까지 사용하며, 별도의 고속 처리 계층 포함.

가중치 — Nex-N2.5 Pro: Apache-2.0, 곧 출시 예정. GPT-5.6 Sol: 비공개.

1M 토큰당 가격 — Nex-N2.5 Pro: 무료 호스팅 티어, 정가 없음. GPT-5.6 Sol: 8월 21일부터 프로모션 정가 $4.00 / $20.00, 캐시 입력 $0.40, 272K 입력 토큰 초과 시 $8.00 / $30.00로 재조정.

Sol의 ~1.05M 토큰 컨텍스트와 128K 출력 상한은 장기(long-horizon) 작업에 있어 Nex-N2.5 Pro의 262K 윈도우를 압도합니다. Sol의 가격은 저렴하다고 하기에는 거리가 멀지만, 예산을 책정할 수 있는 확정된 수치입니다. Nex-N2.5 Pro에게 유리한 유일한 수치는 무료 티어뿐이며, 그것은 가격이 아닙니다.

하루 된 점수의 가치

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Nex-N2.5 Pro에 붙은 모든 벤치마크 주장 — OSWorld-2 56.4, Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2, BrowseComp 89.7 — 은 한 가지 공통점이 있다. Nex-AGI가, 연합이 오픈소스로 공개하겠다고 밝혔지만 아직 공개하지 않은 하네스를 통해 그 수치를 산출했다는 점이다. 그 수치 중 어느 것도 독립적으로 재현된 적이 없으며, 재현될 수도 없다. 가중치를 다운로드할 수 없고 '곧 공개' 배너에는 날짜가 없기 때문이다. 이 점은 대부분의 경우보다 이번 맞대결에서 더 중요하다. Nex-N2.5 Pro와 비교되는 모델은 업계에서 가장 오랜 독립 검증 기록을 갖고 있기 때문이다. 도전자의 증거 기반 전체가 자체 보고된 것이고 기존 모델의 증거 기반은 그렇지 않다면, 입증 책임은 전적으로 도전자에게 있으며 무료 엔드포인트가 그 책임을 면제해 주지 않는다. 가중치 샤드가 공개되고 독립 연구소가 Nex-N2.5 Pro를 실행하는 순간, 이 글의 수치는 검증 가능해지고 비교는 실제가 된다. 그때까지는 '하루 된 점수'가 정확한 표현이다 — 실행할 수 없는 모델에 대해서는 검증할 수 없는 점수.

가격, 경로, 그리고 결정의 형태

비용은 두 측면을 비교할 때 가장 비교하기 어려운 부분입니다. 한쪽에만 비용이 존재하기 때문입니다. GPT-5.6 Sol의 $4.00 / $20.00 요금은 OpenAI가 8월 21일부터 적용하고 최소 11월 21일까지 유지된다고 밝힌 프로모션 정가로, $5.00 / $30.00에서 인하된 것입니다. 이 인하로 플래그십 모델이 대량의 에이전트 작업에 훨씬 더 저렴해졌으며, 패스스루 라우터는 OpenAI가 인하를 적용하는 당일 바로 반영합니다. Sol은 OrcaRouter에서 해당 정가 그대로, 마크업 없이 제공되며, 배치 티어와 패스트 티어는 동일한 API 키로 200여 개의 다른 모델과 함께 사용할 수 있습니다. 따라서 팀은 OpenAI의 깊이가 필요한 요청은 Sol로 라우팅하고, 그 외의 요청에는 더 저렴한 모델을 사용할 수 있습니다. Nex-N2.5 Pro는 정가가 없고 무료 호스팅 엔드포인트만 제공합니다. 이는 모델을 평가하기에는 훌륭한 방법이지만 프로덕션 예산을 세우기에는 부적절한 기준입니다. 존재하지 않는 숫자로 지출 계획을 세울 수 없고, 공개되지 않은 가중치로 아키텍처를 계획할 수 없습니다.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), marked FEATURED, showing the header stats $4.00 input and $20.00 output per million tokens and the byline 'by OpenAI - 2026-07-09'.

이번 맞대결이 실제로 강요하는 결정은 성능이 아니라 리스크에 대한 것이다. 다음 분기에도 여전히 존재하고, 가격이 알려져 있으며, 실패 프로파일이 파악되어 있고, 수개월간의 적대적 테스트(adversarial testing)를 거친 모델이 필요하다면, GPT-5.6 Sol이 합리적인 선택이다. OpenAI가 그 위에 GPT-6 Astra를 출시한 것은 이 선택지를 더욱 강화할 뿐이다. Sol은 이제 프로덕션 볼륨을 정면으로 겨냥한 가격 인하를 앞세운, 검증된 주력 모델이기 때문이다. 오픈 가중치(open weights)로 컴퓨터 사용 에이전트를 구축하고 있고, 검증 가능한 결과를 기다릴 여유가 있다면, Nex-N2.5 Pro는 지켜볼 만하다. 17B 활성 파라미터(active) 멀티모달 전문 모델은 비용 면에서 폐쇄형 프론티어를 거듭해서 눌러온 바로 그 형태의 모델이기 때문이다. 하지만 여기서 핵심 단어는 '지켜보는 것'이다. 제조자가 아닌 다른 누군가가 측정한 모든 측면에서, Nex-N2.5 Pro는 파일(file)이 있는 모델에 뒤처져 있으며, 가중치가 공개되기 전까지 비교는 거기서 끝난다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube