Step 5 Preview 대 NVIDIA Nemotron 3 Ultra 550B A55B를 위한 생성된 타이틀 카드에는 '20센트에 21 인덱스 포인트'라는 문구가 표시되어 있으며, 세 가지 통계 칩이 있습니다: Artificial Analysis Intelligence Index 44 대 23, 출력 가격 백만 토큰당 $2.70 대 $2.50, 인덱스 작업당 비용 $1.03 대 $0.60. OrcaRouter 로고는 오른쪽 하단의 흰색 띠에 있습니다.
Guides & Insights

Step 5 Preview vs Nemotron 3 Ultra: 20센트에 21개 지수 포인트

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 모델들 중 하나는 오늘 오후에 바로 내려받을 수 있는데, 바로 21점 차로 뒤지는 쪽입니다. Step 5 Preview, StepFun의 비공개 플래그십 모델은 2026년 9월 20일에 API를 공개했지만 직접 확인할 수 있는 라이선스 파일이 없습니다. NVIDIA Nemotron 3 Ultra 550B A55B는 2026년 6월 4일부터 허용적 라이선스 아래 학습 레시피까지 첨부된 채 Hugging Face에 올라와 있습니다. Artificial Analysis Intelligence Index에서 이 둘은 44 대 23을 기록합니다. 출력 가격은 백만 토큰당 $2.70 대 $2.50입니다. 20센트 차이에 21점이라니, 어느 방향으로도 깔끔하게 결론이 나지 않는 비교입니다. 그래서 두 개의 헤드라인 열만 훑어보고 편을 고르기보다 제대로 따져볼 가치가 있는 것입니다.

이 둘 중 어느 것도 이번 주에 출시된 것이 아니며, 그 점은 아래 숫자를 어떻게 읽어야 하는지에 중요하다. 둘 다 몇 달째 호출 가능했고, 둘 다 동일한 독립 하네스를 거쳤으며, 해당 기간에 요금표 변경도 없었다. 달라진 것은 더 작고 더 흥미롭다. 이들이 평가받는 지수가 9월에 재구축되었고, 이제 이 둘은 서로 다른 두 모집단에서 도출된 서로 다른 두 중앙값과 비교해 평가받는다. 이 비교의 승부는 사실 바로 그 지점에서 갈린다.

아주 다른 두 종류의 제품

스펙 시트를 나란히 놓고 읽어보면, 가장 먼저 눈에 띄는 것은 그것들이 같은 범주에 속한다고 보기 어렵다는 점이다.

• 파라미터 — Step 5 Preview는 StepFun 자체 문서 기준 총 약 6,000억 개이며 토큰당 활성 파라미터는 270억 개입니다; Nemotron 3 Ultra는 총 5,500억 개이고 활성 파라미터는 550억 개인데, 이는 독립 위원회가 해당 구성에 대해 기록한 수치에 따른 것입니다.

• 아키텍처 — StepFun은 Step 5 Preview에 대한 내부 구조 설명을 공개하지 않습니다. NVIDIA의 카드 문서에는 하이브리드 구성이 설명되어 있습니다: 인터리브된 Mamba-2 레이어, 선택된 어텐션 레이어, LatentMoE 배치, 그리고 Multi-Token Prediction 헤드.

• 컨텍스트 윈도우 — Step 5 Preview의 사양 표에는 1M 토큰, 최대 출력 64,000 토큰으로 기재되어 있으며, 이는 StepFun에서도 문서화했습니다. Nemotron 3 Ultra는 이를 실행한 평가자에 의해 262,144 토큰으로 기록되었습니다. 공급업체 카드는 최대 1M을 광고하며, 이는 기본값이 아니라 서빙 구성을 통해 도달할 수 있습니다.

• 입력 — Step 5 Preview에서 텍스트, 이미지, 동영상 지원, 요청당 최대 60개 이미지 및 128MB 미만의 MP4 파일. Nemotron 3 Ultra에서는 텍스트만 지원.

• 추론 제어 — StepFun 측의 문서화된 낮음, 중간, 높음 노력 설정; NVIDIA 측의 사고 추적을 켜거나 끄는 채팅 템플릿 플래그.

• 가중치 — Step 5 Preview의 경우 공개된 것이 없으며, 이는 독점적이고 API 전용이다. StepFun은 2026년 10월 15일에 BF16 체크포인트가 뒤이어 나올 것이라고 밝혔다. Nemotron 3 Ultra는 OpenMDW-1.1에 따라 Hugging Face에서 BF16 및 NVFP4 빌드와 GenRM 보상 모델을 제공한다.

• 배포 최소 기준 — API 모델에는 해당되지 않음; 오픈 모델 쪽에는 벤더의 최소 기준선에 따라 B200급 또는 GB200급 GPU 8개, 또는 H100 16개.

• 요금표 — Step 5 Preview의 경우 입력 $1.00, 캐시 적중 시 $0.10, 출력 $2.70이며, 이는 StepFun의 영어 가격 페이지에서 가져온 것입니다. Nemotron 3 Ultra의 경우 입력 약 $0.60, 캐시 적중 시 $0.16, 출력 $2.50이며, 그 두 수치가 어디서 나온 것인지 주의 깊게 보세요: NVIDIA는 요금표를 공개하지 않으므로, 이는 독립 위원회가 기록한 관측된 제공업체 가격이지 벤더가 제시한 수치가 아닙니다.

대부분의 사람들이 결정적이라고 여기는 행은 첫 번째 행이며, 그것은 여덟 개 중 정보량이 가장 적다. 두 총합은 서로 9퍼센트 이내에 있는데, 활성 파라미터는 두 배 차이가 나며, 생성된 각 토큰의 연산 비용을 좌우하는 것은 바로 활성 파라미터다. 어느 수치도 21포인트 격차를 예측하지 못한다.

Generated two-column comparison scoreboard for Step 5 Preview and NVIDIA Nemotron 3 Ultra 550B A55B across six shared rows: Artificial Analysis Intelligence Index 44 against 23; output price $2.70 against $2.50 per million tokens; cost per index task $1.03 against $0.60; output speed 87 against 135.6 tokens per second; weights, 'none, BF16 checkpoint promised 15 October' against 'BF16 and NVFP4 on Hugging Face today'; and input, 'text, image and video' against 'text only'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and that the Nemotron rate is the recorded provider listing rather than a vendor rate card. The OrcaRouter logo sits in a white strip at the bottom right.

중앙값은 점수를 읽기 전에 내리는 선택이다

독립 위원회는 모델을 단일 기준에 비추어 채점하지 않습니다. 모델을 구간별로 나누는데, 모델이 어느 구간에 속하느냐에 따라 점수 아래에 인쇄되는 문장이 달라질 뿐 점수는 바뀌지 않습니다.

Step 5 Preview는 일반 추론 클래스에 배치되는데, 리더보드는 이 클래스를 227개 모델로 집계하며, 비교 가능 모델 중앙값은 26이다. Nemotron 3 Ultra는 오픈 웨이트 클래스에 배치되는데, 이 클래스는 117개 모델로 집계되며, 중앙값은 18이다. 따라서 같은 리더보드에서 44는 "평균보다 훨씬 높음"으로, 23은 "평균보다 높음"으로 설명하는데, 두 설명 모두 사실이다. 왜냐하면 44는 자신의 중앙값보다 18점 높고, 23은 자신의 중앙값보다 5점 높기 때문이다.

이것은 속임수가 아니며, 리더보드가 불공정한 것도 아니다. 이것은 오픈 모델을 제시하는 올바른 방식이다 — 다운로드 가능한 체크포인트를 다른 다운로드 가능한 체크포인트와 비교하는 것이다. 왜냐하면 다운로드만 받을 수 있는 팀은 227개 중에서 선택하는 것이 아니기 때문이다. 하지만 이는 Nemotron 3 Ultra에 대해 "평균 이상"이라고 인용하는 사람과 44에 대해 "평균 이상"이라고 인용하는 사람이 서로 다른 두 문장을 비교하고 있다는 뜻이다. 이 둘에 대해 하나의 숫자를 원한다면 원시 인덱스를 사용하고 21점 격차를 받아들여라; 결정을 원한다면 클래스를 사용하고 이미 자신의 분야를 선택했음을 인정하라.

Screenshot of the Artificial Analysis model page for Nemotron 3 Ultra 550B A55B (Reasoning), showing an Intelligence Index of 23 in a class of 117 open-weights models with a comparable-model median of 18, pricing of $0.60 per million input tokens and $2.50 per million output tokens with a 73 percent cache discount, an average cost of $0.60 per index task, 110 million output tokens generated during the run against a 140 million median, 135.6 output tokens per second, and a 262,144-token context window.

하나의 하네스가 양쪽 모두에서 측정한 것

벤더 표는 서로 빼서 비교할 수 없습니다. StepFun과 NVIDIA가 서로 다른 날에 서로 다른 스위트를 실행했고, NVIDIA의 자료에는 StepFun이 보고하는 모든 벤치마크가 실려 있지 않기 때문입니다. 정직한 근거는 교집합, 즉 단일 평가자가 둘 모두에 대해 실행한 결과입니다.

Artificial Analysis Intelligence Index에서 그 교차점은 44 대 23입니다. 완료된 인덱스 작업당 비용은 $1.03 대 $0.60입니다. 출력 속도에서는 역전됩니다. 그것도 아주 크게요: Step 5 Preview는 초당 87토큰이고 Nemotron 3 Ultra는 135.6토큰이므로, 거의 두 배 높은 점수를 받은 모델이 토큰당 대략 0.5초 더 느리게 생성하는 모델입니다.

가장 극명하게 드러나는 단일 항목은 Terminal-Bench 4.0이다. Step 5 Preview는 거기서 33.3퍼센트를 기록한다. Nemotron 3 Ultra는 0.5퍼센트를 기록한다. 이는 어느 쪽도 반올림 오류가 아니고, 미묘한 차이도 아니다 — 그 특정 에이전트형 터미널 스위트에서 오픈웨이트 플래그십은 사실상 존재감을 드러내지 못한다. 함정은 같은 보드가 동일한 모델을 Terminal-Bench 2.1에서는 53.9퍼센트로 표기한다는 점이다. 거의 같은 이름의 두 벤치마크, 같은 작업군의 서로 다른 두 세대, 그리고 한 모델이 더 오래된 쪽에서는 53.9, 더 새로운 쪽에서는 0.5에 위치한다. Nemotron 숫자가 50대라고 인용된 것을 본 적이 있다면, 그것은 바로 거기서 나온 것이며, 현재 스위트가 아니다.

한 가지 일치 사례는 드물다는 바로 그 이유 때문에 언급할 가치가 있다. NVIDIA 자체 카드는 도구 없이 GPQA에서 87.0퍼센트를 주장한다; 독립 실행에서는 86.7퍼센트가 측정되었다. 벤더 수치와 외부 수치가 0.3점 차이로 나오는 것이야말로 신뢰할 수 있는 평가표의 모습이며, 이는 Terminal-Bench 4.0의 0.5퍼센트를 평가자 오류가 아닌 실제 값으로 받아들이기 쉽게 만든다.

인덱스 런에서 돈이 실제로 어디로 가는가

토큰당 가격은 워크로드 비용이 얼마인지 거의 예측하지 못하며, 이 두 모델 쌍은 그 점을 대부분의 사례보다 더 잘 보여줍니다. 이 보드는 각 모델의 전체 인덱스 실행에 대한 비용 분해를 게시하는데, 이 둘 모두에서 가장 큰 비중을 차지하는 항목은 생성이 아닙니다.

Step 5 Preview의 작업당 $1.03은 입력 $0.85와 출력 $0.17로 나뉩니다. 입력 수치 안에서 $0.62는 캐시 읽기, $0.22는 캐시 쓰기이고, 새로운, 캐시되지 않은 입력은 $0.014뿐입니다. 출력 수치 안에서 $0.12는 추론 트레이스이고 $0.06은 최종 답변입니다.

Nemotron 3 Ultra의 작업당 $0.60은 입력 $0.53과 출력 $0.07로 나뉘며, 입력 항목 내부의 구성은 거의 정반대입니다 — 캐시 쓰기가 $0.48인 반면 캐시 읽기는 $0.04에 불과합니다.

두 가지 결론이 나온다. 첫째는 접두사 재사용이 많은 장기 평가에서 지불하는 비용의 약 80%가 원장의 입력 측에 있다는 점이며, 이는 출력 길이보다 캐시 적중률과 컨텍스트 규율을 최적화할 숫자로 만든다. 둘째는 두 모델이 청구서에 도달하는 방식이 다르다는 점이다: Step 5 Preview는 큰 공유 접두사를 다시 읽는 데 비용을 지불하는 반면, Nemotron 3 Ultra는 처음부터 고유한 콘텐츠를 캐시에 쓰는 데 비용을 지불한다. 비슷한 대표 비용, 두 개의 다른 청구서 — 그리고 워크로드가 다른 패턴보다 그중 하나와 더 비슷하다면, $1.03과 $0.60의 순서는 뒤바뀔 수 있다.

장황함 수치는 출력 라인의 나머지를 설명한다. Step 5 Preview는 인덱스 스위트 전반에 걸쳐 약 1억 6,000만 개의 출력 토큰을 생성했는데, 이는 중앙값 8,200만 개와 대비되며 보드에서는 이를 매우 장황하다고 단호하게 표현한다. Nemotron 3 Ultra는 중앙값 1억 4,000만 개와 대비해 1억 1,000만 개를 생성했으며, 보드에서는 이를 꽤 간결하다고 부른다. 더 저렴한 모델이 간결한 쪽이며, 청구서에 중요한 방향으로 간결하다.

Screenshot of StepFun's English documentation page for Step 5 Preview showing the specification table - model ID step-5-preview, a 1M-token context window, text, image and video input with text output, a 1M maximum input and a 64k maximum output - together with the input and video format notes listing JPG, JPEG, PNG, WebP and static GIF at up to 60 images per request and MP4, QuickTime and Matroska video under 128MB per file.

다운로드가 주는 것, 그리고 그것을 유지하는 데 드는 비용

체크포인트를 받는 경우, Nemotron 3 Ultra의 가격은 백만 출력 토큰당 $2.50이 아니다. 그건 다른 누군가가 그것을 배포한 것을 임대하는 가격이다. 다운로드를 택하는 순간, 당신은 다른 비용 체계와 다른 권리 체계를 사들인 것이다.

권리는 구체적이며, 이는 API 전용 모델이 어떤 가격으로도 따라올 수 없는 부분이다. OpenMDW-1.1은 가중치와 함께 제공되며, NVIDIA는 사전 학습 및 사후 학습 데이터 컬렉션과 학습 레시피를 그와 함께 공개한다. 동일한 모델에 대해 크기가 대략 절반인 NVFP4 빌드가 있으며, Ultra 가중치는 나중에 양자화된 것이 아니라 NVFP4 레시피로 사전 학습되었다. 그렇기 때문에 소형 빌드는 커뮤니티 실험이 아니라 카드 상의 일급 아티팩트다. 상업적 입장은 분명히 명시되어 있다: 상업적 및 비상업적 사용을 위한 준비가 되어 있다.

비용도 똑같이 구체적이다. 최소 배포는 B200급 GPU 8개 또는 H100 16개이며, 이는 제안이 아니라 카드가 명시한 최저선이다. 실제로 확보되는 컨텍스트 윈도는 서빙을 어떻게 구성하느냐에 달려 있으며, 기본값은 256K이고 1M은 명시적 설정을 해야 사용할 수 있다. 랙 하나를 확보할 수 없는 팀은 입력 단가 $1.00와 $0.60의 이 두 모델 중에서 고르는 것이 아니다. 한 모델과 구매 주문 사이에서 고르는 것이다.

이 비교에는 오픈 모델이 사람들이 신경 쓴다고 말하면서도 좀처럼 값을 매기지 않는 축, 즉 의존성에서 승리하는 버전이 있습니다. Step 5 Preview는 당신이 호출하는 엔드포인트이자 신뢰하는 벤더이며, 체크포인트는 실제로 제공된 것이 아니라 약속된 상태입니다. StepFun이 요금표를 개정하거나, 한도를 조이거나, ID를 폐기하거나, 힘든 한 주를 보내면, 당신이 쓸 수 있는 유일한 지렛대는 당신 자신의 오류 처리뿐입니다. Nemotron 3 Ultra의 가중치는 이미 누군가의 클러스터 디스크에 저장되어 있으며, 같은 모델이 지수 21점 차로 뒤지고 있는 동안에도 그것은 실질적인 가치가 있습니다.

반대편에서 "약속했다"는 것이 무엇을 의미하는지 정확히 짚을 필요가 있다. 상황은 어느 진영이 인정하는 것보다 더 복잡하기 때문이다. 9월 20일, API가 열린 날 Hugging Face에 BF16 빌드의 여러 제3자 미러가 등장했으며, 그중 일부는 1테라바이트가 훨씬 넘는 safetensors였다. 이는 벤더 릴리스가 아니라 커뮤니티 재업로드이며, StepFun은 이와 함께 오픈 웨이트 발표를 내놓지 않았다. 이것들이 보여주는 것은 가중치가 유통되고 있다는 점, 그리고 약속된 10월 15일 체크포인트가 공개라기보다는 공식화에 해당할 것이라는 점이다.

우리가 그것을 읽는 동안 움직인 숫자

이 글에서 한 수치가 같은 페이지를 두 번 읽는 사이에 달라졌는데, 이는 꼭 짚어둘 만하다. 바로 그렇게 해서 비교가 조용히 낡아버리기 때문이다.

독립 위원회는 2026년 10월 9일자 보도에서 Step 5 Preview의 인덱스 태스크당 비용이 0.71달러라고 밝혔다. 10월 10일에 다시 읽어 보면, 같은 페이지는 1.03달러라고 말한다. 그 사이에 모델 자체에는 아무것도 달라지지 않았다. API 전용 모델의 가중치가 하룻밤 사이에 달라질 수는 없기 때문이다. 달라진 것은 평가 회계다. 벤더의 캐시 가격이 움직이거나, 평가자가 캐시 읽기 가정을 수정하거나, 실행이 다른 토큰 구성에 맞춰 재계산될 때, 태스크당 수치는 움직이지만 인덱스 점수는 움직이지 않는다.

그러므로 작업당 비용을 모델의 속성이라기보다 날짜가 찍혀 있는 실시간 변동 수치로 다루세요. 이 글의 모든 작업당 수치는 10월 10일 기준값이며 그렇게 표시되어 있습니다. 이 페이지를 바탕으로 예산을 세운다면, 약정하는 날 직접 끌어온 수치로 세우세요 — 그리고 서로 다른 주에 작성된 두 글을 비교한다면, 모델이 더 저렴해졌다고 결론 내리기 전에 캡처 날짜를 확인하세요.

당신이 실제로 전화할 쪽은 어느 쪽인가요?

불편한 부분부터 말씀드리죠: OrcaRouter는 이 두 모델 중 어느 것도 라우팅하지 않습니다. Step 5 Preview는 StepFun 자체 API와 소수의 서드파티 플랫폼을 통해 접근할 수 있으며, Nemotron 3 Ultra는 NVIDIA 자체 엔드포인트와 여러 제공업체를 통해 제공됩니다. 그리고 두 가지 주장 모두 지금 읽으시는 그 1분 안에 저희 카탈로그에서 확인하실 수 있습니다.

그렇게 하고 나면 남는 것은 모델 선택이 아니라 의존성의 형태이며, 바로 이 지점에서 라우팅 레이어가 제값을 합니다. 단일 벤더 경로에 대한 API 전용 프리뷰는 제공자 쪽의 안 좋은 오후가 곧 당신의 장애가 되는 바로 그런 구조이고, 값싼 보험은 제공자 경로가 성능 저하를 일으키는 순간 요청을 적격한 대체 경로로 페일오버할 수 있는 컨트롤 플레인입니다. 그것이 자동 페일오버의 용도입니다: Step 5 Preview를 대신하는 것이 아니라, 실제로 호출할 수 있는 모델들 앞에 두는 것으로, 벤더별 엔드포인트가 프로덕션으로 들어가는 유일한 길이 되지 않게 하는 것입니다. 그렇게 하는 동일한 카탈로그가 하나의 키와 하나의 청구서 뒤에 200개 이상의 모델을 제공하며, 제공자 정가를 0퍼센트 마크업으로 그대로 전달합니다 — 이것이 논거의 나머지 절반인데, 업스트림 어디에서든 요금표가 바뀌면 다음 계약 갱신 때가 아니라 같은 날 우리 쪽에 반영되기 때문입니다.

두 모델 중 어느 것도 당신이 호출할 모델이 아니라면, 짧게 요약하면 이렇습니다. 점수, 비디오 및 이미지 입력, 90퍼센트 캐시 할인을 원할 때는 Step 5 Preview를 선택하고, 가중치에 대한 라이선스가 없으며 아직 보지 못한 10월 체크포인트가 있는 프리뷰를 임대하는 것임을 받아들이십시오. 가중치가 점수보다 더 중요할 때 — 온프레미스 제약, 파인튜닝, 읽을 수 있는 라이선스를 위해서 — Nemotron 3 Ultra를 선택하고, 토큰 예산을 잡기 전에 랙 예산을 먼저 잡으십시오. 백만 입력 토큰당 0.60달러라면 5,500억 매개변수 배포는 다른 누군가가 이미 GPU 비용을 지불하고 있을 때만 저렴하기 때문입니다.

주목해야 할 것은 10월 15일이다. StepFun이 약속한 BF16 체크포인트를 공개한다면, 이 글의 핵심 비대칭성 — 이 둘 중 하나만 다운로드 가능하다는 점 — 은 더 이상 사실이 아니게 되고, 21개의 지수 포인트는 상당히 더 반박해 무마하기 어려워진다. 날짜가 밀리면 오픈 웨이트 모델을 위한 논거는 자동으로 강화되는데, 이는 능력 격차가 좁혀지는 이상한 방식이자 매우 흔한 방식이다.