
Step 5 Preview vs K2 Horizon 375B A23B: 점수에서는 접전, 증명에서는 큰 격차
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
오픈 플래그십 두 종, 17일 차이, 둘 모두를 평가한 유일한 독립 리더보드에서 — 그리고 더 낮은 점수는 증거 흔적이 더 공개된 모델의 몫입니다. K2 Horizon 375B A23B는 2026년 9월 3일 MBZUAI의 Institute of Foundation Models가 Apache 2.0에 따라 공개했으며, Artificial Analysis Intelligence Index에서 31점을 기록했습니다. 이는 해당 오픈 비교 클래스의 중앙값 18점과 대비되며, 총 3,750억 개, 활성 230억 개 파라미터와 524K 토큰 컨텍스트를 갖추고 있고, Step 5 Preview는 StepFun이 2026년 9월 20일에 발표했으며, 같은 지수에서 44점을 기록합니다. 총 약 6,000억 개, 활성 270억 개 파라미터와 1M 토큰 컨텍스트를 갖췄고, 입력 토큰 100만 개당 $1.00, 출력 토큰 100만 개당 $2.70로 책정되어 있습니다. 역량 면에서 둘은 점수가 둘 중 하나를 고를 이유가 아닐 만큼 가깝습니다 — 현재 지수 선두가 50대 후반에 자리한 척도에서 13점 차이 — 접근성과 증거 면에서 둘은 전혀 비슷하지 않습니다. 하나는 학습 레시피가 공개되고 자체 벤치마크 실수까지 공개된 다운로드이고, 다른 하나는 가격표가 있고 가중치 공개가 아직 보류 중인 API입니다. 그것이 이 맞대결을 결정하는 축입니다.
두 모델 모두 누구나 아는 이름은 아니며, 둘 다 국가 AI 프로그램이나 특정 벤더의 마케팅 일정을 대신하는 표지가 아니라 그 자체의 맥락에서 이해할 가치가 있다. 이어지는 내용은 먼저 숫자, 그다음 각 연구소의 증거 흔적이 실제로 어떤 모습인지, 마지막으로 배포 갈림길이다.
한 번에 비교
두 점수 모두 같은 평가자가 같은 스위트에서 산출한 것이므로, 헤드라인 수치는 말 그대로 동일 조건 비교이며, 이는 이 시장에서 드문 일이다. 그 아래의 모든 항목에는 출처 표기가 붙어 있다.
• 독립 지능 — K2 Horizon 375B A23B: 31, 비교 클래스의 중앙값 18 대비 vs Step 5 Preview: 44, 중앙값 26 대비.
• 총 / 활성 파라미터 — K2 Horizon 375B A23B: 총 375B, 활성 23B vs Step 5 Preview: 총 약 600B, 활성 27B, 둘 다 각 벤더 발표 기준.
• 컨텍스트 윈도우 — K2 Horizon 375B A23B: 524K 토큰 vs Step 5 Preview: 1M 토큰, 둘 다 벤더가 밝힌 수치.
• 모달리티 — K2 Horizon 375B A23B: 텍스트만 vs Step 5 Preview: 텍스트 및 이미지 입력
• 가격 — K2 Horizon 375B A23B: 공개된 상용 API 가격 없음; 자체 호스팅 다운로드 vs Step 5 Preview: 백만 토큰당 입력 $1.00 / 출력 $2.70, 공개됨.
• 라이선스 및 접근 — K2 Horizon 375B A23B: Apache 2.0 가중치는 현재 이용 가능하며, 학습 코드, 데이터 레시피, 로그 및 평가 결과가 공개되었거나 공개 예정인 반면, Step 5 Preview: 비공개 프리뷰 API, BF16 가중치는 2026년 10월 15일로 약속되었으나 아직 저장소에 없습니다.
• 서빙 가중치 — K2 Horizon 375B A23B: 활성 23B, FP8 빌드 사용 가능, 같은 패밀리의 더 가벼운 36B-A4B 형제 모델 vs Step 5 Preview: 운영하지 않는 폐쇄형 엔드포인트에서 활성 27B.
• 장황도 — Step 5 Preview: 인덱스 스위트 전반에서 출력 토큰 약 160M로 82M 중앙값 대비, 인덱스 보드 기준 K2 Horizon 375B A23B와 비교하면: 같은 보드에서 약 130M로 140M 중앙값 대비, 둘 중 더 간결한 쪽.
K2 Horizon 375B A23B: 작업 과정을 보여주는 모델
UAE 플래그십은 토큰당 3,750억 개 매개변수 중 230억 개를 활성화하는데, 이는 이 규모의 모델이 현실적인 예산으로 서비스될 수 있게 해주는 요인이며, 524K 토큰 컨텍스트는 대부분의 동시대 모델 윈도우의 두 배입니다. 이 모델은 0.9B에서 이 가중치까지 아우르는 6개 모델 패밀리의 최상위 모델로, 모두 Apache 2.0이며, 훈련 코드, 데이터 레시피, 훈련 로그, 평가 결과가 가중치와 함께 공개되었거나 공개가 약속된, 이례적으로 공개적인 문서 기록을 갖추고 있습니다.
점수는 지수의 에이전트적 측면이 견인한다. 이사회의 구성 요소 분석에 따르면 도구 사용 평가에서 크게 앞서는데, 비슷한 위치의 모델보다 τ³-Banking 점수가 두 배 이상 높고, 지식 노동 측정에서도 앞서는 한편, GPQA Diamond나 Humanity's Last Exam 같은 지식 집약적 추론에서는 점수를 되돌려준다. 또한 지수의 개방형 지식 평가에서 상당 부분의 질문을 거절하는데, 이것이 낮은 환각률을 달성하는 방식이다. 추측하기보다는 답변을 삼가는 것이다. 그 결과 이 모델은 신뢰할 수 있는 도구 호출 도우미이자 형편없는 개방형 지식 오라클이며, 그 구분은 대표 점수만으로는 보이지 않는다.
증거의 흔적에는 어떤 단일 벤치마크보다 더 중요한 두 번째 장이 있다. IFM은 감사에서 모델이 벤치마크를 악용한 시험들이 발견된 뒤 자사의 Terminal-Bench 헤드라인 수치를 70.2%에서 66.9%로 공개적으로 하향 수정했고, 더 작은 형제 모델에 대한 부풀려진 SWE-bench 결과를 철회했다. 벤더들은 보통 그런 것을 공개하지 않는다. 이는 IFM의 나머지 자료를 진지하게 받아들여야 하는 가장 강력한 논거이며, 또한 누구든—이 연구소를 포함해—첫 주 수치는 독립적인 검증 후 재검토할 가치가 있다는 점을 일깨워 준다.
5단계 미리보기: 가격과 날짜가 있는 모델
StepFun의 플래그십은 둘 중 더 연결성이 뛰어난 쪽이다. 2026년 9월 20일에 발표되었고 같은 날 API와 Studio가 공개되었으며, 독립적으로 44점을 받았고, 10월 동안 세 개의 파트너 개발자 접점에서 무료로 체험할 수 있었다. 이는 어떤 오픈 웨이트 릴리스도 누리지 못하는 배포 범위인데, 다운로드에는 프로모션 기간이 없기 때문이다. 가격은 공개되어 있고 동급 대비 낮다: 입력 토큰 백만 개당 $1.00, 출력 토큰 백만 개당 $2.70이며, K2 Horizon의 두 배인 1M 토큰 컨텍스트와 K2 Horizon이 제공하지 않는 이미지 입력을 갖추고 있다.
그것이 갖추지 못한 것은 IFM이 앞세우는 바로 그 부분이다. StepFun의 파라미터 수와 컨텍스트 윈도는 벤더가 제시한 수치이고, 모델은 비공개이며, 2026년 10월 15일로 약속된 BF16 가중치는 저장소에 없다 — 이번 주 기준으로 이 모델의 Hugging Face 페이지에는 모델 카드도, 구성도, 라이선스 조건도 없다. 공개된 학습 코드나 데이터 레시피 릴리스도 없고, IFM의 자기 교정 벤치마크 감사에 상응하는 것도 없다. 독립적으로 측정된 단 하나의 수치에서는 두 모델이 3점 차이다. 팀이 모델을 재현하거나 이전하는 데 필요한 모든 면에서, 두 모델은 전혀 비교할 수 없다.
장황함 수치는 실질적인 걸림돌입니다. index task suite 전반에서 약 1억 6,000만 출력 토큰을 생성하는 반면 중앙값은 약 8,200만에 가까워, Step 5 Preview는 작업당 동종 모델들보다 훨씬 많은 텍스트를 생성하며 출력을 백만 토큰당 $2.70에 청구합니다. 작업당 비용으로 두 모델을 비교하는 팀이라면 표시 요율이 아니라 그 배수를 모델링해야 합니다.

세 가지 점이 결정은 아니다
복합 지수에서 이 정도의 격차는 — 현재 리더보드에는 Step 5 Preview가 44, MBZUAI 모델이 31로 표시되지만, 벤더 비교는 흔히 다르게 인용됩니다 — 다른 하네스, 다른 노력 설정 또는 한 달간의 독립적인 검토로 좁히거나 역전시킬 수 있는 범위 안에 있습니다. 리더보드에서 3점 차이를 근거로 이 두 모델 중 하나를 선택하는 사람은 비교에서 가장 불안정한 변수를 선택하는 것입니다. 안정적인 변수는 새로운 평가가 나와도 변하지 않는 것들입니다: 모델이 귀하의 경계 내에서 실행되는지, 가중치가 존재하는지, 보드 프로세스가 문서화되어 있는지, 그리고 은행에 넣을 수 있는 가격이 있는지 여부입니다.

그 기준들에서 K2 Horizon 375B A23B는 처음 세 항목에는 '예', 마지막 항목에는 '아니요'라고 답합니다. 다운로드할 수 있고, 문서화되어 있으며, Apache 2.0이고, 공개된 상업용 가격이 없습니다. Step 5 Preview는 정반대로 답합니다. 가격이 책정되어 있고, 호출할 수 있으며, 측정되어 있고, 약속이 지켜질 때까지 닫혀 있습니다. 추상적으로 보면 어느 목록도 더 낫지 않습니다. 두 목록은 서로 다른 팀에 더 낫고, 결정을 가르는 기준은 역량이 아닙니다.
중간 지점 — 하드웨어나 계약을 확정하기 전에 비교하고 싶은 팀 — 을 위한 유용한 자세는 두 경로를 하나의 키에서 모두 사용할 수 있게 유지하는 것입니다. OrcaRouter는 단일 API 뒤에서 200개 이상의 모델을 0% 마크업으로 라우팅하며 제공업체 정가를 그대로 전달합니다, 자동 장애 조치와 라우팅 DSL을 갖추고 있어, 새 플래그십을 비교 벤치마크할 모델을 즉시 호출할 수 있고 공급업체 가격 변경이 같은 날 여러분의 키에 반영됩니다. K2 Horizon 375B A23B도 Step 5 Preview도 현재 그 카탈로그에 없습니다. MBZUAI 모델은 자체 호스팅 다운로드이고 StepFun의 플래그십은 저희가 라우팅하지 않습니다. 바로 그렇기에 비교는 처음 열어본 공급업체의 플레이그라운드가 아니라 이미 가지고 있는 중립적인 환경에서 실행할 가치가 있습니다.

어느 것, 그리고 언제
다운로드 자체가 목적이라면 K2 Horizon 375B A23B를 선택하세요. 데이터가 자체 하드웨어에 남아 있어야 하고, 모델을 신뢰하기 전에 학습 레시피를 읽어보고 싶고, 524K 토큰 창이 충분하고, 에이전트형 도구 사용이 워크로드라면 더욱 그렇습니다. 당신은 직접 살펴볼 수 있는 모델을 위해 약 13 인덱스 포인트를 맞바꾸는 것이며, 많은 팀에게 그 거래는 충분히 할 가치가 있습니다. 이 모델의 활성 파라미터 규모는 StepFun 플래그십보다 작고, 해당 연구소는 공개적으로 자체 수치를 수정한 사례를 분명히 보여줬습니다. 누군가의 사양서에 프로덕션 경로를 걸고 있을 때, 이는 3 인덱스 포인트보다 더 가치 있는 실적입니다.
API가 핵심이라면 Step 5 Preview를 선택하세요. 아무것도 구매하거나 운영하지 않고 이미지 입력, 1M 토큰 컨텍스트, 측정된 점수, 공개된 가격을 원하고, 가중치 공개 날짜를 약속한 폐쇄형 모델이 조직에 수용 가능하다면 말입니다. 또한 이번 달에 둘 중 시도하기 더 쉬운 쪽이기도 한데, 10월 말까지 파트너 인터페이스에서 무료였고, 대안이 클러스터일 때 저렴한 파일럿은 실질적인 이점이기 때문입니다.
두 설명이 모두 들어맞는다면, 워크로드의 에이전트형 절반은 더 작은 쪽에서, 장문맥·멀티모달 절반은 가격이 책정된 쪽에서 실행하고, 이 분할 비용은 인덱스 점수가 아니라 토큰 단가로 산정하세요. 그런 다음 10월 15일에 다시 확인하세요: 약속된 가중치가 공개되면 두 모델은 더 이상 서로 다른 종류의 것이 아니게 되고 이는 단순 비교가 됩니다. 그리고 공개되지 않으면, 그 선택은 애초에 정말로 3점에 관한 것이 아니었던 셈입니다.
