헤드라인은 'GPT-6 Astra Ultrafast vs MiMo v2.6 Pro Ultraspeed', 서브헤드는 '같은 수법, 서로 다른 두 거래', '가격 배수: 6배 vs 10배'와 '속도 주장: 8배 vs 20배'라고 적힌 두 장의 카드, 하단에는 '공급업체 보고 수치, 2026년 9월~10월'이라고 적힌 생성된 타이틀 카드
Guides & Insights

GPT-6 Astra Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed: 같은 수법, 다른 조건

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 연구소가 같은 2주 동안 동일한 전략을 펼쳤는데, 흥미로운 점은 고객이 무엇을 구매하는지에 대해 상반된 가정을 바탕으로 그것을 실행했다는 것이다. GPT-6 Astra Ultrafast는 Ultrafast 서빙 티어를 통해 판매되는 벤더의 플래그십이다. 이 모델은 2026년 9월 3일에 출시되었고, 해당 티어는 2026년 9월 29일부터 폭넓게 제공되었으며, NVIDIA의 10월 1일 게시물에서 Blackwell GPU에서 실행되는 것으로 언급되었다. Xiaomi MiMo v2.6 Pro Ultraspeed는 Xiaomi의 버전으로, 2026년 9월 22일에 출시되었다: MiMo-V2.6-Pro와 동일한 1.02조 매개변수 체크포인트를 표준 속도의 약 10배로 더 빠르게 제공한다.

그중 하나는 프런티어 모델을 호출하는 가장 빠른 방법이다. 다른 하나는 현존하는 가장 저렴한 고속 티어다. 이들은 일반적인 의미의 경쟁자가 아니다 — 백만 토큰당 300달러의 비공개 플래그십과 백만 토큰당 8.70달러의 오픈 웨이트 모델 중에서 고르는 애플리케이션을 작성하려면 아주 기이한 애플리케이션이어야 할 것이다. 이 둘을 묶어 한 페이지를 할애할 가치가 있는 이유는 둘 다 모델이라기보다 속도 티어라는 점이다. 따라서 이들을 비교하면 속도 티어가 던지는 단 하나의 질문, 즉 당신은 그 몇 배의 비용을 정확히 무엇에 지불하고 있는가라는 질문이 분리되어 드러난다.

두 티어 모두 똑같은 비(非)사물을 판다

두 이름 중 어느 것도 체크포인트가 아니다. 이 부분은 출시 보도가 흐리기 쉬운 대목이므로, 기계적으로 따져볼 만하다.

• 이름이 가리키는 것 — GPT-6 Astra Ultrafast는 요청 필드 service_tier: "ultrafast"가 설정된 GPT-6 Astra입니다. 요청에 담기는 모델 id는 여전히 gpt-6-astra입니다. Xiaomi MiMo v2.6 Pro Ultraspeed는 더 빠른 경로로 제공되는 MiMo-V2.6-Pro 체크포인트로, 별도의 항목으로 가격이 책정됩니다.

• 무엇이 바뀌는가 — 배칭, 추측 디코딩, 하드웨어 할당, 동시성 제한, 연결 처리. 가중치와 HTTP 요청 사이에 있는 모든 것, 그리고 가중치 내부에는 아무것도.

• 무엇이 변하지 않는가: 답변. 동일한 설정에서 동일한 체크포인트는 동일한 내용을 생성해야 합니다. 동일한 설정에서 동일한 내용을 생성해야 합니다. 동일한 설정에서 동일한 내용을 생성해야 합니다...

• 이 비교에서 그것이 중요한 이유 — 어느 등급도 자체 표준 라인 대비 벤치마크 개선을 주장하지 않기 때문에, 구매 결정 전체가 절약된 시간 대비 토큰당 가격으로 귀결된다. 즉, 두 거래는 평가가 아니라 산술로 결정된다.

다만 이 프레이밍에는 한 가지 비대칭이 있는데, 그것은 티어에 있는 것이 아니다. 샤오미의 UltraSpeed는 공개 라이선스 모델 위에 올라가 있다 — 샤오미 자체 모델 카드에 따르면 MiMo-V2.6 가중치는 MIT 라이선스를 따르며, 이 제품군은 RL 학습 환경과 함께 공개되었다. OpenAI의 Ultrafast는 API를 통해서만 접근할 수 있는 비공개 플래그십 위에 올라가 있다. 오픈 가중치에 속도 배수를 지불하는 것은 되돌릴 수 있는 결정이다. 체크포인트를 언제든 직접 서빙할 수 있기 때문이다. 비공개 플래그십에 그렇게 지불하는 것은 그렇지 않다.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Pro-RL model card on Hugging Face, showing 64 likes, the TextGeneration, Transformers, Safetensors, English, Chinese, conversational, custom_code, 8-bit precision and fp8 tags, an MIT licence tag, a Safetensors model size of 524B params and the model card's opening description of MiMo-V2.6-Pro-RL as the flagship checkpoint of the MiMo-V2.6 series, covering native omnimodal input and 1M-token context.

두 가지 주가 배수, 그리고 그것이 사들이는 것

바로 여기서부터 이 쌍은 더 이상 대칭이 아니게 되며, 양쪽 숫자가 유난히 깔끔한 것은 각 업체가 절대값이 아니라 배수를 기준으로 가격을 책정했기 때문이다.

• GPT-6 Astra Ultrafast — 입력 토큰 100만 개당 $60.00, 캐시된 입력 $6.00, 캐시 쓰기 $75.00, 출력 $300.00이며, 표준 티어의 $10.00 및 $50.00과 대비됩니다. 일률적으로 6.00배가 모든 열에 걸쳐 적용되며, 입력 토큰이 272,000개를 초과하면 $120.00 및 $450.00으로 올라갑니다. 표준 티어는 OpenAI의 정가로 저희 카탈로그에서 판매 중이며, 이는 플래그십 모델을 이용하는 가장 저렴한 방법입니다.

• Xiaomi MiMo v2.6 Pro Ultraspeed — 백만 토큰당 입력 $4.35, 출력 $8.70이며, 표준 Pro 라인의 입력 $0.44, 출력 $0.87과 대비됩니다. 이는 입력 기준 약 9.9배, 출력 기준으로는 정확히 10배입니다.

• 그 배수들에 붙은 속도 주장 — OpenAI와 NVIDIA는 모두 Astra Ultrafast의 토큰 생성 속도를 Astra 표준 모드보다 "최대 8배" 빠른 것으로 못박고 있다. Xiaomi 자체 자료에서는 표준 Pro 서비스 대비 최대 20배의 출력 속도를 주장하지만, 같은 날 같은 모델을 설명한 제3자 카탈로그 목록에는 대략 10배라고 적혀 있다. 이 두 수치를 서로 맞춰 주는 측정 결과는 공개된 적이 없다.

• 배수 대 속도 비율 — OpenAI의 6배 가격이면 8배라는 주장된 상한을 얻으므로, 이 등급의 가격은 자기 최상의 시나리오보다 낮게 책정되어 있다. 누구의 숫자를 믿느냐에 따라, Xiaomi의 10배 가격이면 10배에서 20배라는 주장된 상한을 얻으므로, 벤더가 주장하는 상한에서는 이 거래가 유리하고 더 낮은 수치에서는 완전히 본전이다.

그것이 두 제품 사이에서 의사 결정에 가장 결정적으로 관련된 단 하나의 차이이며, 이는 헤드라인 가격이 시사하는 것보다 좁습니다. 공급업체 자체 주장에 따른 제거된 지연 시간 단위당으로 보면, Astra Ultrafast가 두 거래 중 더 나은 쪽입니다. 작업 토큰당으로 보면, Xiaomi UltraSpeed는 Ultrafast 요금 대비 입력 기준 약 14배, 출력 기준 약 34배 더 저렴하며, Astra의 표준 라인보다 2배에서 6배 더 저렴합니다. 하지만 이는 다른 모델이고, 상당히 성능이 떨어지는 모델이기도 합니다. 바로 이것이 여러분이 실제로 감수하는 절충입니다. Xiaomi가 이 제품군에 대해 자체적으로 제공하는 모델 카드는 독립적인 종합 점수 대신 아키텍처와 학습 관련 사실을 공개하며, OpenAI의 플래그십이 측정되는 지표에서 나온 판독값은 이 모델에 대해 전혀 공개된 바 없습니다.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes on the 10% regional-processing uplift and on GPT-5.6 Sol's promotional pricing running at least through November 21, 2026.

두 공급업체가 공개하기로 선택한 것

속도 등급은 성능 테스트라기보다는 공개 테스트에 가깝다. 그 주장을 검증하는 데 필요한 것 — 명시된 동시성 수준에서의 지연 시간 분포 — 이 전적으로 벤더의 손에 달려 있기 때문이다.

NVIDIA의 10월 1일 게시물은 Astra 티어를 뒷받침하는 가장 구체적인 공개 발언이며, 그것이 제공하는 것은 측정치가 아니라 귀속 정보다. 즉 Blackwell GPU, OpenAI API 및 자격을 갖춘 ChatGPT Work와 Codex 사용자에게 제공된다는 점, 그리고 두 명의 OpenAI 엔지니어가 그 루프를 설명한다는 점이다. OpenAI의 추론 책임자인 Philippe Tillet은 Astra가 "그 지식을 NVIDIA 하드웨어를 매력적으로 만드는 고성능 커널로 전환할 수 있다"고 말한다. OpenAI의 컴퓨팅 최고기술책임자인 Uday Ruddarraju는 "우리는 내부 모델을 사용해 NVIDIA GPU에서의 추론을 최적화했다"고 말한다. 어느 문장에도 해당 티어의 처리량 수치는 없다. 8x는 '최대' 외에는 아무런 조건이 붙지 않은 채 독자적으로 서 있다.

샤오미의 공개는 다른 방향으로 갔다 — 강화학습 환경과 코드를 포함한 학습 경제성을 공개했고, 모델 카드에는 서빙 관련 사실이 아니라 아키텍처 관련 사실이 담겨 있었다. UltraSpeed 티어 자체는 20배라는 주장과 함께 나왔지만 공개된 지연 시간 곡선은 없었다. 이는 속도 티어가 답하기 위해 존재하는 질문에 대해 두 업체 모두 똑같이 도움이 되지 않는다는 뜻이며, 그 지점의 무승부가 정직한 발견이다.

선택하기, 정말로 해야만 한다면

두 등급은 크게 겹치지 않으므로, 이 결정은 승자를 고르는 문제라기보다 두 구매 중 어느 쪽이 자신의 것인지 인식하는 문제에 가깝습니다.

작업이 에이전트형이고 모델 선택이 이미 끝났다면 Astra Ultrafast를 선택하세요. 40,000 출력 토큰 작업의 비용은 $2.00에서 $12.00로 오르며, 이 티어는 더 빠른 속도로 최첨단 모델 품질을 얻을 수 있는 유일한 방법입니다. OpenAI 자체 문서에서도 운영상의 전제 조건을 분명히 밝히고 있습니다. 즉, WebSockets를 "특히 빠르게 연속으로 많은 도구 호출을 하는 에이전트형 애플리케이션에" 권장하며, "지속적 연결이 없으면 네트워크 오버헤드가 지연 시간 개선 효과를 줄일 수 있다"고 경고합니다. 티어를 켜 놓고 그 아래에 요청별 HTTP를 그대로 두면, 속도 향상의 일부만 얻으면서 6배를 지불한 셈입니다. 연결하기 전에 알아 둘 만한 점도 있습니다. 이 티어는 미국 데이터 레지던시와 글로벌 처리만 지원하며, EU나 기타 비미국 지역 처리 엔드포인트는 없습니다. 또한 원래라면 더 높은 한도를 받을 자격이 있는 계정에도 낮은 초기 속도 제한으로 출시되었습니다.

직접 호스팅할 수 있는 파이프라인에 모델이 범용 입력으로 들어간다면 MiMo v2.6 Pro Ultraspeed를 선택하세요. MIT 라이선스는 표준 Pro 레인이 유일한 대안이 아니라는 뜻입니다 — 자체 호스팅도 대안입니다. $4.35와 $8.70이라면 충분히 저렴하므로, 더 빠른 티어를 작업별로 정당화하기보다는 추측성으로 활성화할 가치가 있으며, 100만 토큰 컨텍스트는 플래그십과 동일합니다. 다만 무엇을 사는지 이해하세요: 프런티어에 뒤처지는 모델에 대해 대략 10배의 요율을 내는 것이며, 이는 대량 추출에는 올바른 선택이지만 답변 품질이 워크플로를 좌우하는 모든 경우에는 잘못된 선택입니다.

어느 쪽 빠른 티어도 OrcaRouter에는 없으며, 이 점은 빙빙 돌려 암시하기보다 분명히 말할 가치가 있다. OrcaRouter에 있는 것은 openai/gpt-6-astra — 표준 티어의 플래그십으로, 백만 토큰당 $10.00과 $50.00, 롱 컨텍스트 구간에서는 $20.00과 $75.00이며, 컨텍스트 1,050,000토큰에 최대 출력 128,000토큰, OpenAI 호환 엔드포인트를 통해 제공된다. 여기에는 샤오미 모델이 전혀 호스팅되지 않으므로, MiMo-V2.6-Pro와 그 UltraSpeed 레인은 샤오미 자체 API와 여러 서드파티 플랫폼을 통해서만 접근할 수 있다. 그 실용적 용도는 200개 이상의 모델을 갖춘 엔드포인트가이 비교에서 빠른 티어에 대한 접근을 제공한다는 것이 아니다. 그보다는, 비싼 레인이 그 몇 배의 값을 하고 있는지 알고 싶을 때, 같은 자격 증명과 같은 키로, 바로 다음 요청에서 더 저렴한 모델에 동일한 프롬프트를 보내 확인할 수 있다는 점이다. 이것이 가능한 가장 저렴한 실험이며, 바로 이 실험이 그 질문에 답한다 — 어떤 벤더도 측정 없이 답할 수 있게 해 주는 지연 시간 곡선을 공개하지 않았기 때문이다.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

솔직한 해석

두 공급업체 모두 지난 3주 안에 지연 시간에 대한 요금표를 내놓았지만, 어느 쪽도 측정치를 내놓지 않았다. 이 대칭성이 바로 이 이야기의 핵심이며, 여기에는 실질적인 결과가 따른다. 오늘 당장 근거로 삼을 수 있는 수치는 가격뿐인데, 양측이 맞춤형 숫자가 아니라 깔끔한 배수를 책정했기에 그 가격은 유난히 많은 것을 알려준다.

OpenAI의 고속 티어는 자사 표준 요금의 6배를 받으며 상한을 8배라고 주장한다. Xiaomi의 고속 티어는 자사 표준 요금의 10배를 받으며, 누구의 숫자를 믿느냐에 따라 10배에서 20배 사이 어딘가의 상한을 주장한다. 각 업체가 내세운 수치를 산술로 따져 보면 둘은 거의 차이가 없다. OpenAI의 티어는 가격 1단위당 속도 1.33단위에 해당하는 주장된 상한을 사는 셈이고, Xiaomi의 티어는 같은 계산으로 1.0에서 2.0 사이를 사는 셈이다. 둘 다 방어 가능한 이유는 두 티어가 서로의 선택지를 진지하게 고려할 일이 없는 서로 다른 구매자에게 팔리고 있기 때문이다. 또한 두 거래 모두에서 오늘날 감사 가능한 부분은 가격뿐이다. 요금표는 공표된 사실이지만 지연 시간 주장은 그렇지 않기 때문이다.