
Step 5 Preview vs A.X-K2: 690B 다운로드에 맞선 600B API 모델
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
Step 5 Preview와 A.X-K2는 이번 가을에 계속 떠오르는 결정의 두 갈래다: API에서 최전선급 모델을 빌릴 것인가, 아니면 오픈 웨이트 플래그십을 집으로 가져와 직접 실행할 것인가. StepFun의 Step 5 Preview는 임대형이다 — 2026년 9월 20일에 발표되어 같은 날 호출 가능하며, 백만 입력 토큰당 $1.00, 백만 출력 토큰당 $2.70, 총 약 6,000억 개 파라미터에 270억 개 활성, 100만 토큰 컨텍스트, 독립적인 Artificial Analysis Intelligence Index 점수 44를 갖는다. SK Telecom의 A.X-K2는 다운로드형이다 — 2026년 8월 12일 Apache 2.0으로 공개되었고, 총 약 6,880억~6,920억 개 파라미터에 330억 개 활성, 262K 토큰 컨텍스트, 지수 점수 21을 갖는다. 하나는 더 크고, 하나는 유료이며, 유료인 쪽이 훨씬 더 높은 점수를 받는 쪽이다. 그 역전이 이 비교의 전부이며, 원칙에 따라 편을 선택하기 전에 이해해 둘 가치가 있다.
이 두 모델에 대한 흔한 프레이밍은 국가적이다: 한국의 소버린 AI 플래그십 대 중국에서 가장 공격적인 연구소 중 하나. 그 프레이밍은 배포 결정에는 유용하지 않다. 유용한 점은 A.X-K2가 이 둘 중 유일하게 보유할 수 있는 모델이고, Step 5 Preview가 이 둘 중 유일하게 토큰 단위로 구매할 수 있는 모델이라는 것이다. 나머지는 모두 그 구분에서 비롯된다.
출처에 비추어 검증된 수치
유일하게 동일 기준으로 비교할 수 있는 측정치는 Intelligence Index이며, 양쪽 모두에서 독립적이다: Step 5 Preview는 비교 가능한 모델들의 중앙값 26에 맞선 44이고, A.X-K2는 오픈 웨이트 비교군의 중앙값 18에 맞선 21이며, 둘 다 동일한 제3자가 동일한 척도로 측정한 것이다. 작성 시점에 읽은 이 수치들은 오늘의 값이다 — 이 지수의 점수는 평가자가 재보정하면 변동하며, 같은 A.X-K2 페이지를 이전에 읽었을 때는 더 높은 숫자가 나왔다. 이 대결에서 다른 모든 항목에는 항상 함께 들고 다녀야 하는 출처 표기가 딸려 있다.
• 독립적인 지능 — Step 5 Preview: Artificial Analysis Intelligence Index에서 44점, A.X-K2: 동일 지수에서 21점, 독립적으로 측정됨.
• 총 / 활성 파라미터 — Step 5 Preview: StepFun에 따르면 총 약 600B, 활성 27B vs A.X-K2: SK Telecom 자료 및 인덱스 카드에 따르면 총 약 688–692B, 활성 33B
• 컨텍스트 윈도우 — Step 5 Preview: StepFun당 1M 토큰 vs A.X-K2: 262K 토큰.
• 모달리티 — Step 5 Preview는 텍스트와 이미지를 지원하고, A.X-K2는 텍스트만 지원합니다.
• 가격 — Step 5 Preview: 공급업체가 공개한 백만 입력당 $1.00, 백만 출력당 $2.70 vs A.X-K2: 상용 API 가격은 전혀 공개되지 않음.
• 실행 위치 — Step 5 Preview: StepFun 자체 API 및 Studio, 그리고 프로모션 기간 동안 파트너 채널 vs A.X-K2: 다운로드만으로 여러분의 하드웨어에서.
• 출시 — Step 5 Preview는 2026년 9월 20일 발표, A.X-K2는 2026년 8월 12일 출시.
• 라이선스 — Step 5 Preview: 2026년 10월 15일 BF16 가중치 제공을 예고한 비공개 프리뷰 vs A.X-K2: Apache 2.0
A.X-K2: 더 무거운 장비, 더 빈약한 근거
SK Telecom은 A.X K1의 후속 모델로 A.X-K2를 구축했으며, 이 아키텍처는 롱컨텍스트 비용을 정면으로 겨냥한다: 전문가 256개와 토큰당 활성 전문가 8개를 두는 전문가 혼합(MoE) 구조에, FP8로 네이티브 학습되었고, 회사가 Sparse Gated Attention이라고 부르는 메커니즘을 갖췄다. 이는 상당한 엔지니어링 성과이며, 하이퍼스케일러가 아닌 조직이 총 파라미터가 거의 7,000억 개에 달하는 모델을 아예 서빙할 수 있는 이유다.
이 모델에 없는 것은 독립적인 검증이다. SK텔레콤은 A.X K1 대비 14개 벤치마크에서 평균 32.2점 상승, 장문맥 및 에이전트 평가에서 약 83.9점 상승, AIME 2026에서 97.1점, 한국어 지식 벤치마크 KMMLU-Pro에서 80.5점, CLIcK에서 91.6점을 기록했으며 수학 및 한국어 작업에서 최근 Qwen과 DeepSeek 릴리스와 동등하거나 능가한다고 밝혔다. 이 모든 수치는 벤더 자체 수치다. 독립적인 점수, 즉 Intelligence Index에서의 21점은 오픈 웨이트 비교군의 중앙값 18점을 넘어서지만 Step 5 Preview보다 23점 낮으며, A.X-K2의 강점 영역은 바로 그 지수가 크게 비중을 두지 않는 부분이다. 그 지수의 9개 평가는 대부분 영어 기반이고 추론 및 에이전트 중심이며, 그중 단 하나도 한국어 벤치마크가 아니다.
그 어떤 것도 A.X-K2를 자기 점수보다 더 나쁜 모델로 만들지는 않는다. 그것은 벤더의 말에 따르면, 독립 연구소가 그 평가들을 공개할 때까지는, A.X-K2의 점수를 한국어 또는 수학 비중이 높은 워크로드에서 그것이 해내는 일의 하한으로 만든다. 비용 측면은 더 구체적이다. 이 가중치 등급의 레퍼런스 배포에는 B300급 GPU 네 대와 FP8 기준 약 656 GiB가 필요하다. 그것이 다운로드에 드는 비용이며, 토큰 청구서와 달리 실험이 끝나도 다시 줄어들지 않는다.
스텝 5 프리뷰: 오늘 HTTP로 사용해 볼 수 있는 것
Step 5 Preview의 장점은 더 크거나 더 개방적이라는 점이 아니다 — 둘 중 어느 쪽도 아니다 — 가격이 책정되어 있고, 호출할 수 있으며, 독립적으로 평가된다는 점, 그리고 10월 한 달 동안 세 개의 파트너 서피스에서 무료로 사용해 볼 수 있었다는 점이다. 자체 호스팅하기보다 평가하는 팀에게는 그 조합이 Apache 2.0 라이선스보다 더 가치가 있다. 하드웨어 결정을 API 호출로 바꿔 주기 때문이다. 하지만 해당 모델에 관한 StepFun의 기록은 여느 때처럼 빈약한 부분이 있다: 600B/27B 파라미터 조합과 1M 토큰 컨텍스트는 벤더 자체 수치이고, 약속한 가중치는 아직 배포되지 않았으며, 독립 위원회가 제시한 이 모델에 관한 가장 유용한 수치는 아마도 44점이라는 점수가 아니라 장황함 — 인덱스의 태스크 스위트 전반에서 생성된 약 1억 6,000만 개의 출력 토큰으로, 중앙값 약 8,200만 개와 대비된다 — 일 것이며, A.X-K2는 약 2억 3,000만 개로 1억 4,000만 개 중앙값과 대비해 훨씬 더 멀리 벗어나 있다. 백만 출력 토큰당 $2.70를 청구하는 모델에서 이 격차는 저렴한 평가와 값비싼 프로덕션 습관 사이의 차이다.
왜 더 큰 모델이 더 낮은 점수를 받는가
파라미터 수는 점수가 아니며, 이 조합은 이를 명확히 보여준다. A.X-K2의 추가 약 3,000억 개 전체 파라미터는 자체 평가 스위트가 보상하는 영역 — 한국어 심층성, 수학, 폭넓은 지식 — 에서 드러나는 밀도를 확보한다. 반면 두 모델이 함께 등장하는 지수는 대부분 영어 중심이고 추론 비중이 높으며 에이전트 중심적인데, Step 5 Preview의 개발자들은 바로 이 지점을 의도적으로 튜닝한 것으로 보인다. 27B 활성 설계는 또한 StepFun 모델을 주어진 처리량에서든 현저히 더 저렴하게 서빙할 수 있게 해주며, 호스팅 가격이 아예 존재하는 이유도 여기에 있다.
덜 호의적이면서 정반대 방향으로 작용하는 두 번째 해석이 있다. A.X-K2는 8월 12일부터, Step 5 Preview는 9월 20일부터 나와 있었다. 더 새로운 모델은 독립적인 검증을 받은 기간이 몇 주 더 짧고, 그 44는 더 많은 평가가 나오면 아직 달라질 수 있다. 두 수치 모두, 어떤 모델이든 1분기 점수가 잠정적인 것과 같은 방식으로 잠정적이다. 차이는 A.X-K2의 잠정 점수는 SK Telecom 외부의 누군가가 가진 최선의 증거인 반면, Step 5 Preview의 잠정 점수는 제3자가 적어도 부분적으로 재현한 공급업체 사양서 위에 놓여 있다는 점이다.
서빙 경제성, 바로 그곳에 결정이 실제로 달려 있다
호출할 수 있다면 백만 토큰당 입력 $1.00, 출력 $2.70을 내면 끝이다 — 조달도, GPU도, 운영도 필요 없다. 다운로드한다면 하드웨어, 전력, 양자화 작업, 평가 하네스 비용을 치러야 하고, 프롬프트와 데이터를 자체 경계 안에 보관할 수 있다. A.X-K2의 33B 활성 구성은 노트북용 모델이 아니다; 기준 구성은 소규모 클러스터다. Step 5 Preview의 비공개 프리뷰는 10월 15일까지 아무런 경계도 제공하지 않으며, 그때 BF16 가중치가 약속되어 있다 — 그리고 그 파일들이 리포지토리에 나타나기 전까지 그 날짜는 선택 사항이 아니라 약속이다.

바로 이 지점에서 라우팅 레이어는 단지 자신을 광고하는 데 그치지 않고 존재 가치를 입증합니다. 대부분의 팀은 "임대할까, 소유할까"라는 질문에 한 번 답하고 영원히 끝내고 싶어 하지 않습니다. 그보다는 하드웨어를 구매하기 전에 자신의 트래픽에서 모델이 어떤 성능을 내는지 알고 싶어 하고, 그 답이 바뀌면 옮길 수 있는 능력을 계속 유지하고 싶어 합니다. OrcaRouter는 Step 5 Preview를 라우팅하지 않으며, A.X-K2도 라우팅하지 않습니다. 이 둘 모두 현재 저희 카탈로그 밖에 있습니다. OrcaRouter가 하는 일은 200개가 넘는 모델을 단일 API 키와 하나의 청구서 뒤에 두고, 0% 마크업으로 제공업체 정가를 그대로 전달하는 것입니다. 따라서 새로운 플래그십 모델을 무엇과 비교하든, 그 비교 세트는 오늘 오후에 바로 호출할 수 있는 세트이며, 자동 페일오버가 여러분이 아직 결정을 내리는 동안에도 프로덕션 경로를 살아 있게 유지합니다.


어느 걸 고를까?
워크로드가 일반 추론, 에이전틱 코딩 또는 긴 컨텍스트가 필요한 무엇이든이라면, 실리콘을 사는 대신 토큰당 지불하고 싶다면, 그리고 이미지 입력이 중요하다면 Step 5 Preview를 선택하세요 — 이 모델은 독립 점수, 컨텍스트 길이, 첫 답변까지의 지연 시간, 모달리티 다양성에서 앞서며, 이번 달에 조달 없이 파일럿으로 운영할 수 있는 두 가지 중 유일한 하나입니다.
당신의 언어가 한국어라면, 워크로드가 수학 집약적이라면, 또는 데이터가 당신의 인프라를 떠날 수 없다면 A.X-K2를 선택하십시오 — 그리고 SK Telecom의 벤치마크 표를 신뢰로 받아들인다는 점, 하드웨어 청구서는 실제라는 점, 당신이 가리킬 수 있는 독립 점수는 23점 더 낮다는 점을 알고 선택하십시오. 그 트레이드오프가 잘못되어 보인다면, 정직한 답은 다른 플래그십을 고르는 것이 아닙니다. 두 제품 모두를 당신의 자체 트래픽으로 벤치마킹하는 것이며, 이는 어느 벤더의 수치도 대신할 수 없는 유일한 비교입니다.
Step 5 Preview는 저렴하고 신중하게 검증된, 호출 가능한 선택지이며 그 가중치는 아직 오는 중이고, A.X-K2는 더 무겁고 주권적이며 다운로드 가능한 선택지이지만 그 근거는 아직 제시되지 않았다. 어느 모델도 안전한 기본값이 아니다. 실제로 당신 팀을 묶는 제약 — 경계냐 청구서냐 — 을 고르고, 다른 하나는 놓아주라.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
