
I need to determine whether "Yardstick" is an entity name or a common noun. Given the title context and the lack of explicit markers, source likely intends "Yardstick" as a product/brand (the yardstick model), and it's capitalized. Standard practice in AI-benchmark blog headlines would retain the English name. But "the yardstick won" repeats the same word — need consistency. Since no {{KEEP}} markers exist, and given instruction "Preserve... brand/product names", I should treat the capitalized "Yardstick" as a proper name and keep it as-is while translating surrounding text. However, the phrase "Chose the Yardstick" — if the model's name is "Yardstick" then yes. Korean translation: "Nex-N2.5 Pro vs Claude Opus 5: Nex-AGI는 Yardstick을 선택했고, Yardstick이 승리했다" This keeps brand names and same structure. Does that sound natural? Slightly awkward but acceptable. Alternative if treating as common metaphor: "자" — "Nex-AGI는 자를 선택했고, 그 자가 이겼다" — but then loses Capitalization. The Korean title would read awkwardly. Given the sentence capitalizes "Yardstick" (/probably deliberate pun name), keep it. Output exactly: Nex-N2.5 Pro vs Claude Opus 5: Nex-AGI는 Yardstick을 선택했고, Yardstick이 승리했다.Nex-N2.5 Pro vs Claude Opus 5: Nex-AGI는 Yardstick을 선택했고, Yardstick이 승리했다
- openaiNEWOpenAI: GPT-6 Astra2026-09-0455지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0247지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0247지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0157지능82코딩
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2646지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1849지능75코딩
- obsidianQwen3.8 27B2026-08-1541지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1251지능77코딩
- metaMeta: Muse Spark 1.22026-08-0547지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0347지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2140지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128지능49코딩
Nex-AGI가 잣대를 들었고, 그 잣대가 이겼다. 상하이에 기반을 둔 오픈 모델 연합이 2026년 9월 8일 Nex-N2.5 Pro를 출시했을 때, 모델 카드의 컴퓨터 사용 표에는 비교 대상 열에 Claude Opus 5를, 도전자 자리에 Nex-N2.5 Pro를 넣었다. OSWorld-2에서 Claude Opus 5는 68.3, Nex-N2.5 Pro는 56.4였다. 두 수치 모두 Nex-AGI가 자체 카드에 인쇄한 것과 정확히 같다. 이후 독립 리더보드의 격차는 줄어들기는커녕 더 벌어졌다. BenchLM의 8월 29일자 OSWorld 2.0 스냅샷은 자사가 나열한 15개 모델 중 Claude Opus 5를 70.6으로 1위에 올렸다. 공개하기로 선택한 벤치마크에서 필드 선두에게 12포인트를 내주는 것은 일반적인 출시 안무가 아니다. 그래서 Nex-N2.5 Pro 대 Claude Opus 5의 흥미로운 부분은 점수가 아니다. 흥미로운 것은 그 점수의 양쪽이 실제로 무엇이냐는 것이다. 즉, 연합 외부에서는 아무도 실행하거나 검증하지 못한 3,970억 파라미터의 오픈 컴퓨터 사용 모델과, 벤치마크를 선도하며 7월 말부터 프로덕션 트래픽을 감당해 온 폐쇄형 Anthropic 플래그십 모델이라는 점이다.
먼저 솔직한 요약부터 하자면, 이것은 측정된 두 양 사이의 경쟁이 아닙니다. 어느 한쪽만이 제작자가 아닌 다른 사람에 의해 측정되었기 때문입니다. Nex-N2.5 Pro는 희소 혼합 전문가(sparse mixture-of-experts) 모델로, 총 397B 파라미터 중 약 170억 개의 활성 파라미터를 가지며, Qwen3.5 계열에서 사후 학습되었고, 시각적 피드백 루프를 통한 장기적인 컴퓨터 및 브라우저 조작을 정면으로 겨냥합니다. 현재 이 모델은 모델 카드의 Nex-AGI 링크를 통해 무료 호스팅 엔드포인트로 제공되고 있으며, 제품군의 기반이 되는 Apache-2.0 가중치는 날짜도 없이 '출시 예정'으로 표시된 채 남아 있습니다. Claude Opus 5는 까다로운 추론, 코딩, 에이전트 작업을 위한 Anthropic의 프로덕션 플래그십입니다. 폐쇄형 모델로서 1M 토큰 컨텍스트, 적응형 사고 다이얼, 문서화된 가격, 그리고 수 주간의 공개 리더보드 기록과 프로덕션 트래픽이라는 실적을 갖추고 있습니다. 이 대결에서의 모든 우위는 다음 두 가지 사실 중 하나에 속합니다. 한 모델은 실행 가능하고 검증 가능하지만, 다른 모델은 그중 어느 것도 아닙니다.
양측이 동의하는 벤치마크
컴퓨터 사용 벤치마크는 이들 모델이 판매를 위해 만들어진 바로 그 행동, 즉 화면을 보고, 행동을 결정하고, 실행한 다음, 변경된 화면을 읽어 그 행동이 효과가 있었는지 확인하는 에이전트에게 보상을 부여한다. Nex-N2.5 Pro는 정확히 그 루프를 중심으로 설계되었다. 비전은 덧붙여진 입력 방식이 아니라 에이전트가 검증의 기준으로 삼는 피드백 채널이다. Claude Opus 5는 동일한 루프를 여러 작업 중 하나로 취급하지만, 그 작업에 매우 능숙하다. 그래서 Nex-AGI가 처음부터 그것을 기준점으로 사용한 것이다.
두 숫자는 엄밀히 말해 동일한 하네스에서 나온 것이 아닙니다. Nex-AGI는 OSWorld-2 수치를 자체 NexCUA 평가 하네스를 통해 산출했으며, 이를 오픈소스로 공개할 예정이지만 아직 공개하지 않았습니다. 그리고 Nex-N2.5 Pro의 56.4는 재현되지 않은 벤더 결과물입니다. BenchLM에서의 Claude Opus 5의 70.6은 2026년 8월 29일자 OSWorld 2.0의 타사 스냅샷이며, Nex-AGI가 리더보드 출처에서 인용한 68.3과 일치합니다. 서로 다른 하네스와 약간 다른 벤치마크 버전은 정확한 격차(Nex-AGI 자체 카드에서는 12포인트, BenchLM에서는 14포인트에 가까움)를 방향성으로 읽어야 함을 의미합니다. 그러나 어느 쪽에서든 이용 가능한 최상의 수치로 볼 때 Nex-N2.5 Pro가 현재 최첨단 컴퓨터 사용 에이전트보다 아래에 있다는 것은 이견이 없습니다.

오늘 실행할 수 있냐는 질문에 대한 두 가지 답변

실무 팀의 승부를 실제로 가르는 것은 이 포크(fork)이며, 그것은 신규 진입자에게 유리하지 않습니다. Nex-N2.5 Pro의 Hugging Face 카드에는 여전히 Apache-2.0 라이선스로 가중치가 곧 공개될 예정이라는 배너가 걸려 있지만, 출시 날짜는 명시되어 있지 않습니다. 현재 실제로 가동 중인 빌드는 카드에서 Nex-AGI가 연결해 주는 무료 호스팅 엔드포인트뿐입니다. 호출은 가능하지만 타인이 소유한 것이고, 공시 가격도 없으며 팀이 계획을 세울 근거가 될 서비스 약관도 없고, 자체 하드웨어에서 벤치마크 수치 하나를 재현할 방법도 없습니다. 가중치가 실제로 공개되면, 문서화된 서빙 레시피는 맞춤형 SGLang 이미지에서 8개의 H100으로 구성된 단일 노드입니다. 397B MoE에게는 현실적이면서도 일상적인 규모이며, 이것이 바로 17B 활성(active) 설계가 흥미로운 이유입니다. 그때까지 Nex-N2.5 Pro는 질의해 볼 수 있는 프리뷰일 뿐, 무언가를 구축할 수 있는 모델은 아닙니다.
Claude Opus 5는 그 모든 항목에서 정반대입니다. 7월 24일부터 Anthropic의 API와 라우팅된 플랫폼을 통해 제공되었으며, 가격은 공개적이고 안정적이며, 가중치는 비공개이고 계속 비공개로 유지될 것입니다. 그리고 그 수치 중 어떤 것이든 오늘 실행해 확인할 수 있습니다. 주변 생태계 — Claude Code, MCP 도구, 그리고 6주 동안 이 모델을 쉴 새 없이 사용해 온 프로덕션 에이전트들의 무리 — 는 하루 된 모델이 내세울 수 없는 누적된 기록 그 자체입니다. "모델이 다음 분기에도 작동해야 한다"는 요구 사항을 가진 팀에게 그 기록이 곧 전부입니다.
그나마 있는 사양서
두 개의 봉투를 나란히 놓으세요:
• 출시 — Nex-N2.5 Pro: 2026년 9월 8일 (호스팅 엔드포인트 가동 중, 가중치 공개 대기 중). Claude Opus 5: 2026년 7월 24일, 일반 공개.
• 규모 — Nex-N2.5 Pro: 총 397B / MoE 활성 약 17B. Claude Opus 5: 매개변수 수 비공개.
• 모달리티 — Nex-N2.5 Pro: 텍스트와 이미지를 입력받고 텍스트를 출력하며, 컴퓨터 사용 루프에서 시각(비전)이 핵심입니다. Claude Opus 5: 텍스트와 이미지를 입력받고 텍스트를 출력하며, 강력한 시각 분석 기능을 갖추고 있습니다.
• 컨텍스트 / 출력 — Nex-N2.5 Pro: 262,144-토큰 컨텍스트, 문서화된 서빙 길이. Claude Opus 5: 1M-토큰 컨텍스트, 128K-토큰 출력 상한.
• 추론 제어 — Nex-N2.5 Pro: none / medium(adaptive, 기본값) / high 중에서 선택하는 reasoning_effort 스위치를 제공합니다. Claude Opus 5: adaptive thinking이 기본이며, low부터 max까지의 effort를 명시적으로 설정할 수 있는 다이얼을 제공합니다.
• 가중치 — Nex-N2.5 Pro: Apache-2.0, 출시 예정, 날짜 미정. Claude Opus 5: 비공개.
• 1M 토큰당 가격 — Nex-N2.5 Pro: 무료 호스팅 등급 제공, 공시 가격 미공개. Claude Opus 5: 입력 $5.00 / 출력 $25.00, 캐시 읽기 $0.50, 캐시 쓰기 $6.25.
이 두 모델의 사양은 차이가 충분히 커서 스펙 시트가 실질적인 역할을 한다. Opus 5는 백만 토큰 컨텍스트 윈도우와 128K 출력 상한을 긴 에이전트 세션에 제공하는 반면, Nex-N2.5 Pro의 262K 컨텍스트와 무료 티어는 더 작은 범위의 화면 기반 자동화에 적합하다. 어느 쪽의 사양도 다른 쪽을 불필요하게 만들지 않는다. 두 모델은 에이전트가 컨텍스트를 무엇에 사용하는지에 대해 서로 다른 관점을 보여준다.
Nex-AGI 자체 스코어보드를 정직하게 읽기
카드의 나머지 부분도 같은 필터로 읽을 가치가 있다. Nex-N2.5 Pro의 다른 컴퓨터 사용 항목들 — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — 및 코딩 항목들 — Terminal-Bench 2.1에서 82.7, SWE-Bench Pro에서 61.2, BrowseComp에서 89.7 — 은 모두 얼라이언스 자체 하네스를 통한 공급업체 측정값이며, 첫 48시간 동안에는 재현되지 않았다. 중립적인 독자가 이 카드에서 이끌어낼 수 있는 유일한 결론은, Nex-AGI가 Nex-N2.5 Pro를 가장 중요한 항목에서 최첨단 에이전트에 뒤처지는 강력한 중급 컴퓨터 사용 모델로 본다는 것이다. 이는 397B 오픈 모델에게 일관되고, 보수적이기까지 한 포지셔닝이다. 그리고 그 주장은 두 번째 실험실을 기다리는 것이기도 하다.
한쪽에 가격이 없을 때의 돈
여기서 정직한 가격 비교를 실행할 방법은 없습니다. 한쪽만 가격을 가지고 있기 때문입니다. Nex-N2.5 Pro의 무료 호스팅 티어는 그 모델의 가치에 대해 아무것도 알려주지 않습니다. 무료 미리보기 엔드포인트는 공급업체가 트래픽과 피드백을 수집하는 방식이며, Nex-AGI는 이 제품군에 대해 유료 토큰당 요금을 공개한 바 없습니다. Claude Opus 5는 Anthropic의 공시 가격 기준으로 입력 100만 토큰당 5.00달러, 출력 100만 토큰당 25.00달러이며, 캐시 읽기는 0.50달러입니다. 그리고 그것이 예산이 흡수해야 하는 숫자입니다. 오늘날 컴퓨터 사용 에이전트를 위해 그 비용을 지불하고 있고, 17B 활성 파라미터의 오픈 모델이 동일한 작업을 더 저렴하게 수행할 수 있는지 알고 싶다면, 대답은 다음과 같습니다: 가능할 수도 있지만, 가중치가 공개되고 제3자가 독립적으로 실행할 때까지는 알 수 없습니다. 가격 비교는 확정된 것이 아니라 유예된 것이며, 무료 엔드포인트를 저렴함의 증거로 취급하는 것은 범주 오류이며, 가격 비교는 확정된 것이 아니라 유예된 것이며, 무료 엔드포인트를 저렴함의 증거로 취급하는 것은 범주 오류입니다.

오늘 할 수 있는 것은, 그것이 가능해지는 날을 대비해 A/B를 설정해 두는 것입니다. Claude Opus 5는 OrcaRouter에서 Anthropic의 공시 가격 그대로 제공됩니다. 동일한 $5.00 / $25.00이며 마크업 없이 그대로 전달되므로, 이곳의 청구 금액은 Anthropic과 일치하고 Anthropic이 가격을 변경하는 날 함께 변경됩니다. API 키 하나면 200개 이상의 다른 모델과 동일한 엔드포인트 뒤에 놓이게 되며, 공급자에 장애가 생기면 자동 페일오버가 이루어지고, 까다로운 요청에는 Opus를, 일상적인 요청에는 더 저렴한 모델을 쓰고 싶다면 라우팅 DSL을 사용할 수 있습니다. Nex-N2.5 Pro는 OrcaRouter에 없습니다. 글을 쓰기 전에 모델 디렉터리를 확인했지만 아직 nex-agi 모델은 등재되어 있지 않습니다. 공급자가 공시 가격으로 서비스를 제공하는 순간, 그날 바로 여기에 나타날 것이며, 이 기사가 아직 실행할 수 없는 정직한 비교는 마이그레이션이 아닌 라우팅 규칙이 될 것입니다.
누가 행동해야 하고, 누가 기다려야 하는가
팀이 지금 프로덕션 computer-use 또는 agentic-coding 워크로드를 운영 중이고, 가격이 알려져 있고 장애 프로필이 파악되어 있으며 독립적으로 검증된 실적을 갖춘 모델이 필요하다면, 이번 맞대결에서 Claude Opus 5가 합리적인 선택입니다. Nex-N2.5 Pro가 출시 후 처음 48시간 동안 보여준 어떤 것도 그 사실을 바꾸지 않습니다. 팀이 향후 빌드를 위해 오픈 computer-use 모델을 평가 중이라면, Nex-N2.5 Pro는 주시 목록에 포함될 만합니다. 합리적인 자체 호스팅 풋프린트와 그럴듯한 중간급 벤치마크 성적을 갖춘 397B 멀티모달 MoE는, 가중치가 실제로 공개되고 성능 카드의 수치가 독립 실행을 견뎌낸다는 조건 아래에서, 비용 곡선을 재편하는 바로 그런 종류의 오픈 모델입니다. 합리적인 입장은 둘 다를 동시에 취하는 것입니다. 검증된 선두주자를 핵심 경로에 유지하고, 가중치가 도착하는 날 그 신인 모델이 평가받을 기회를 얻을지 결정하게 하는 것입니다. 그것이 이 맞대결에서 아직 일어나지 않은 유일한 비교이며, 실제로 중요해질 비교입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
