
Nex-N2.5 Pro vs Kimi K3: 신인 자신의 벤치마크 카드가 심판이 되는 대결
- openaiNEWOpenAI: GPT-6 Astra2026-09-0455지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0247지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0247지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0157지능82코딩
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2646지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1849지능75코딩
- obsidianQwen3.8 27B2026-08-1541지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1251지능77코딩
- metaMeta: Muse Spark 1.22026-08-0547지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0347지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2140지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128지능49코딩
Nex-N2.5 Pro와 Kimi K3가 공통으로 갖는 수치를 확인해 보면, 누가 그 수치를 제공했는지 알 수 있다. Nex-AGI의 Nex-N2.5 Pro — 3,970억 개 파라미터와 약 170억 개의 활성 파라미터를 갖춘, 2026년 9월 8일 소개됐으며 가중치가 여전히 "coming soon"으로 표시된 멀티모달 에이전트 — 가 Moonshot AI의 Kimi K3를 같은 열에 나란히 올려놓은 벤치마크 표를 게시한다. Kimi K3는 Moonshot이 2026년 7월 16일 출시한 2.8조 파라미터 오픈웨이트 플래그십 모델로, 백만 토큰 컨텍스트를 지원하고, 11일 뒤 Modified MIT 라이선스로 전체 가중치를 공개했으며, Artificial Analysis Intelligence Index에서 57점을 받아 그 순위표에서 최고 오픈웨이트 모델이 된 모델이다. 그리고 그 표의 줄마다 Nex-N2.5 Pro는 Kimi K3에 뒤진다. Terminal-Bench 2.1에서는 82.7 대 K3의 88.3, BrowseComp에서는 89.7 대 91.2, SWE-Bench Pro에서는 61.2 대 63.3, AutomationBench에서는 44.2 대 46.7. 제공자가 자사 모델의 수치를 현재 오픈웨이트 선두주자 옆에 인쇄했는데 그 행 대부분에서 자사 모델이 지는 상황이라면, 이 맞대결에서 가장 흥미로운 점은 그 표가 아마 진실을 말하고 있다는 것이다.
이것이 이 비교의 특이한 형태입니다. 보통 신인 모델의 카드에서 과장된 표현을 찾게 마련입니다. 그런데 여기서 카드는 두 모델 모두에게 정직한 심판에 가장 가까운 존재입니다. Nex-AGI가 자사의 Pro 등급을 격하하는 표를 게시할 이유가 없었기 때문입니다. 그리고 Pro가 K3를 이기는 항목들은 정확히 소형 목적 특화 컴퓨터 사용 모델이 훨씬 더 큰 범용 모델을 이겨야 하는 항목들입니다. 따라서 이 페이지가 답하는 진짜 질문은 "어느 쪽이 더 나은가"보다 더 좁고 더 유용합니다. 즉, Nex-N2.5 Pro가 주장하는 틈새 — 활성 파라미터의 약 6분의 1로 K3에 근접한 에이전트 성능 — 가 Kimi K3가 이미 존재하고, 이미 가중치가 공개되었으며, 이미 이겨야 할 모델이라는 사실과 맞닥뜨려도 살아남는가 하는 것입니다.
상대 전체
Kimi K3는 틈새 모델이 아니며, 바로 그 점 때문에 올바른 기준이 된다. 이 모델은 Moonshot의 플래그십이다. Stable LatentMoE 설계 아래 2.8T 총 파라미터 중 104B가 활성화되고, 그에 걸맞은 출력 예산을 갖춘 1M 토큰 컨텍스트, 텍스트·이미지·비디오에 대한 네이티브 이해, 상시 작동하는 추론, 그리고 충분한 하드웨어를 가진 누구나 실제로 실행할 수 있는 오픈 가중치를 제공한다. 그 독자적 입지는 강력하다. 57 Intelligence Index(Artificial Analysis)는 다른 모든 오픈 가중치 모델을 능가하며, Frontend Code Arena에서는 Claude Fable 5와 GPT-5.6 Sol보다 앞선 1,679 Elo를 기록했다. 한편 가격은 입력 백만 토큰당 $3.00, 출력 백만 토큰당 $15.00, 캐시된 입력 백만 토큰당 $0.30으로, 오픈 가중치 계층의 프리미엄 끝자락에 위치한다. Kimi K3는 공급업체가 규모에 대해 타협하지 않을 때 '프론티어이자 오픈'이 무엇인지를 보여준다. 출력 부문에서 GPT-5.6 Sol과 같은 폐쇄형 경쟁사보다 토큰당 비용이 더 높고, 서비스 비용도 많이 들며, 리더보드에서 반박하기 매우 어려운 모델이다.
도전자의 산술
Nex-N2.5 Pro는 Kimi K3를 규모에서 앞서려는 것이 아니다. 서비스 측면에서 앞서려는 것이다. Nex-AGI는 Pro 티어를 Qwen3.5 계열 베이스에서 포스트트레이닝하여 컴퓨터와 브라우저를 조작하는 비전 네이티브 에이전트로 만들었고, 그 핵심 주장은 효율성이다: 총 397B / 활성 ~17B, 262K 컨텍스트, 단일 노드 8×H100 배포 구성으로, K3의 2.8T / 활성 104B와 그 크기의 모델이 요구하는 서빙 팜에 맞선다. 그 의미하는 바는, 시각 피드백 에이전트 루프에 특화되어 훈련된 17B 활성 전문가가 104B 활성 범용 모델의 에이전트 성능 대부분을 서빙 비용의 극히 일부로 제공할 수 있다는 것이다. Nex-AGI 자체 카드에서 그 주장은 그럴듯하지만 부분적이다: Pro는 OSWorld-G(87.4 vs 79.6)와 OmniDoc(92.2 vs 91.1)에서 K3를 이기거나 비기고, 나머지 공통 항목에서는 한 자릿수 차이로 진다. 397B 모델이 2.8T 모델에게 코딩과 브라우징에서 3~6포인트 차이로 지는 것은, 사실이라면, Nex가 말하고자 하는 효율성 스토리와 정확히 일치한다.
그게 사실이라면, 그 숫자들은 전부 Nex-AGI가 자체적으로 산출한 결과물이다. 적어도 일부는 자사 내부 NexCUA 하네스를 통해 만들어진 것이며, Nex-N2.5 Pro는 가중치를 내려받을 수 없어 현재 독립적으로 검증할 수 없다. Hugging Face 저장소에는 README와 figures 폴더, 그리고 '가중치는 곧 공개 예정'이라는 배너만 있을 뿐이다. 동일한 한계는 그 카드에 실린 K3 측 수치에도 적용된다. Nex는 그 수치의 대부분을 Moonshot이 발표한 보고서에서 취합했지 자체 측정한 게 아니기 때문이다. Nex-AGI의 표가 입증하는 것은 누가 이겼는가가 아니다. 벤치마크와 하네스를 직접 고른 Nex-AGI 엔지니어들조차 자사 Pro 등급으로 Kimi K3를 대부분의 공통 항목에서 꺾지 못했다는 것이다. 이는 어느 하나의 점수보다 더 유용한 데이터다. 마케팅이 과장될 수 있는 범위에 상한선을 그어 주기 때문이다.

중요한 행들, 나란히
• 스케일 — Nex-N2.5 Pro: 총 397B / 활성 ~17B, Qwen3.5 계열 멀티모달. Kimi K3: 총 2.8T / 활성 104B, Stable LatentMoE, 멀티모달.
• 가중치 — Nex-N2.5 Pro: 약속만 하고 출시되지 않음(카드에는 "곧 출시"라고 표기됨). Kimi K3: 7월 27일에 Modified MIT 라이선스로 게시됨 — 오늘부터 다운로드 가능.
• 컨텍스트 — Nex-N2.5 Pro: 262K. Kimi K3: 1M 토큰, 정액 요금.
• 가격 — Nex-N2.5 Pro: 아직 요금표 없음. 호스팅 미리보기 무료. Kimi K3: 백만 개당 $3.00 / $15.00, 캐시된 입력 $0.30.
• 독립적 입지 — Nex-N2.5 Pro: 아직 없음. Kimi K3: AA 인텔리전스 지수 57, 리더보드에서 최고 수준의 오픈 웨이트 모델.
• 코딩(벤더 카드) — Nex-N2.5 Pro: Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2. Kimi K3: 동일 항목에서 88.3 및 63.3.
• GUI / 컴퓨터 사용 — Nex-N2.5 Pro: OSWorld-G 87.4 (K3 자신의 카드에서 K3를 능가), OSWorld-2 56.4. Kimi K3: OSWorld-G 79.6, OSWorld-2 58.3 (Nex 컴파일).
• 자체 호스팅 구축 규모 — Nex-N2.5 Pro: 가중치가 공개되면 단일 노드 8×H100 구성으로 충분. Kimi K3: 2.8T — 단일 노드가 아닌 서빙 플릿(serving fleet)이 필요.
각 열에서 "open"이 의미하는 바가 어떻게 다른지
“open”이라는 단어는 양측에서 아주 다른 역할을 수행하며, 어떤 벤치마크보다도 이번 대결의 승패를 결정한다. Kimi K3는 운영상 중요한 의미에서 오픈이다. 가중치가 허브에 Modified MIT에 가까운 허용적 라이선스로 공개되어 있고, 추론 과정이 스트리밍 API를 통해 노출되며, 데이터 거버넌스 제약이 있는 기업도 자사가 통제하는 하드웨어에서 실행하고 모델이 무엇을 생각했는지 감사할 수 있다. 물론 비용이 드는 방식의 오픈이다. 2.8T 모델은 상당한 인프라를 요구하지만, 그 선택지는 오늘 존재한다. Nex-N2.5 Pro는 의도라는 의미에서 오픈이다. Nex-AGI는 제품군 가중치를 오픈소스로 공개하겠다고 밝혔고, 더 작은 형제 모델인 Nex-N2.5 Mini는 출시일에 Apache-2.0 가중치를 실제로 배포했다. 그러나 Pro의 가중치는 아직 나오지 않았다. 라이선스는 카드에 발표되었지만 아직 다운로드 가능한 어떤 것에도 구속력을 갖지 않으며, 체크포인트가 존재하기 전까지 “open”은 모델의 속성이 아니라 로드맵상의 항목이다. 둘 중 하나를 선택해야 하는 팀에게 이것은 각주에 불과한 일이 아니다. 이번 달에 소유할 수 있는 모델과 소유할 수 있다는 약속만 받은 모델 사이의 차이이기 때문이다.
다운로드 버튼을 기다리지 않고 평가 중
Nex-N2.5 Pro의 가중치가 공개될 때까지 이 결정을 확정하지 않아도 됩니다. 라우팅 계층이 바로 그 실험을 저비용으로 실행할 수 있는 곳입니다. Kimi K3는 OrcaRouter에서 Moonshot의 정가($3.00/$15.00, 마크업 0%)로 제공되며, Moonshot이 가격을 변경하면 당일 그대로 반영·업데이트됩니다. 따라서 이 오픈 가중치 선두 모델은 카탈로그의 다른 200여 개 모델 옆에서 키 하나만 있으면 사용할 수 있습니다. Nex-N2.5 Pro는 당사를 통해 제공되지 않으므로, 지금은 Nex-AGI의 호스팅 프리뷰에서, 이후에는 자체 H100 8대 스택에서 시험하게 됩니다. 여기에 들어맞는 패턴은 다음과 같습니다. 이미 사용 중인 단일 엔드포인트로 긴 컨텍스트와 감사(audit) 비중이 높은 작업을 Kimi K3에 맡기고, 테스트 브랜치를 Nex-N2.5 Pro의 프리뷰에 연결한 다음, 둘 중 하나가 성능이 저하되면 자동 장애 조치(failover)가 그쪽을 우회하게 하십시오. 이것이 바로 출시된 프런티어 모델과 가중치 공개를 앞둔 도전자를 비교하면서도 어느 쪽에도 프로덕션 경로를 걸지 않는 방법입니다. Pro의 가중치가 실제로 나오면 검증은 간단해집니다. 독립 연구소가 재현할 수 있는 공유된 행(rows)을 실행해 17B-active 효율성 스토리가 Nex-AGI 자체 테스트 환경 밖에서도 유지되는지 확인하면 됩니다.


이 매치업은 어디에 자리 잡는가
역대 최대 규모의 오픈 가중치 모델을 상대로, Nex-N2.5 Pro는 주목받기 위해 범용 성능 경쟁에서 이길 필요가 없다. 서빙 비용 논쟁에서 이겨야 하며, 자체 스펙 카드는 그 논쟁이 현실적이되 아직 입증되지는 않았음을 시사한다. Kimi K3는 오늘날 안전하면서도 확실히 강력한 선택이다: 오픈 가중치, 오픈 가중치 지수 최상위, 백만 토큰 컨텍스트, 그리고 예산 책정이 가능한 가격 — 단, 모델이 커질수록 더 버거워지는 인프라라는 대가를 치러야 한다. Nex-N2.5 Pro는 효율성에 거는 베팅이다: 아직 출시되지 않은 모델에 대한 벤더(vendor)의 표에 따르면, 단일 노드에서 활성 파라미터가 6분의 1에 불과하면서도 K3에 근접한 에이전트형 벤치마크 성적을 낸다. 지금 당장 실제로 소유하고 감사할 수 있는 프론티어 모델을 원한다면 Kimi K3를 선택하라. 가중치가 공개되고 제3자가 동일한 벤치마크 항목을 독립적으로 실행하는 날을 위해 Nex-N2.5 Pro를 주목하라 — 17B 활성 파라미터의 에이전트가 컴퓨터 사용(computer use) 벤치마크에서 104B 활성 파라미터의 플래그십 모델과 몇 포인트 차이 내에 머문다면, 그 결과는 이후 등장할 모든 오픈 에이전트의 서빙 비용 계산을 바꿔놓을 것이기 때문이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
