"Unbiased의 Pareto 26.10 Preview"라는 제목과 "동일한 모델 문자열 뒤의 1M 컨텍스트 교체"라는 부제가 달린 생성된 타이틀 카드가 "출시: 2026년 10월 1일", "컨텍스트: 1,048,576 토큰", "라우팅 가격: 1M당 $0.80 / $3.20"이라고 적힌 세 장의 카드 위에 있으며, 하단에는 "벤더가 실행한 예비 벤치마크; 2026년 10월 1일 기준으로 독립적인 점수는 공개되지 않았습니다."라고 적혀 있습니다.
Guides & Insights

Unbiased의 Pareto 26.10 프리뷰: 동일한 모델 문자열 뒤에 숨은 1M 컨텍스트 교체

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

통합은 바뀌지 않습니다. 그 뒤의 모델은 바뀝니다. 2026년 10월 1일, Unbiased는 모델 문자열인 pareto를 Pareto 26.10 Preview로 옮겼습니다. 이는 컨텍스트 창이 네 배 더 크고, 라우팅된 카탈로그에서 가격이 더 낮으며, 벤더 스스로 인정한 대로 아직 예비 단계이고 최종 형태로는 공개되지 않은 벤치마크 시트를 갖춘 새 릴리스입니다. 오늘 Pareto를 이름으로 호출한다면, 26.10 Preview를 호출하는 것이며, 벤더의 변경 로그도 이를 가장 분명한 표현으로 말합니다: "Pareto 26.10 Preview가 이제 현재 Pareto 릴리스입니다… 모델 문자열은 pareto로 유지됩니다."

Pareto를 스택에 둔 사람이라면 그 한 줄이 전부다. 이것은 첫 제품과 나란히 출시된 두 번째 제품이 아니다. 이것은 바뀌지 않은 이름 아래, 제자리에서 대체된 첫 제품이다. 즉, 당신이 받는 버전은 당신의 요청에 있는 그 무엇이 아니라 릴리스 캘린더에 의해 결정된다는 뜻이다.

10월 1일에 실제로 무엇이 바뀌었나요?

네 가지가 움직였는데, 그것들이 모두 같은 방향을 가리키지는 않는다.

• 컨텍스트 창 — 9월 Pareto 릴리스에서는 262,144토큰이었고, 이제는 1,048,576입니다. Unbiased 자체 문서에는 이 수치가 전혀 나와 있지 않습니다. 이 숫자는 모델의 공개 기술 목록에서 나온 것으로, 더 작은 티어는 제공되지 않는 요청당 한도입니다.
• 라우팅 기준 가격 — Pareto에 대해 흔히 인용되는 두 가지 가격은 입력 토큰 100만 개당 $2.50, 출력 토큰 100만 개당 $7.50이며, 캐시된 입력은 $0.25입니다. 26.10 Preview 목록에는 각각 $0.80, $3.20, $0.03이 기재되어 있습니다 — 대략 입력 요율의 3분의 1이고 출력 요율의 40%를 조금 웃도는 수준입니다.
• 벤치마크 점수 — 이번 릴리스에서 처음 공개되었으며, 벤더 자체 표기에 따르면 잠정치입니다.
• 안정적인 옵션 — 26.10 Preview는 프리뷰입니다. Unbiased의 카탈로그 문구에는 "예고 없이 변경될 수 있음"이라고 되어 있으며, 예측 가능한 동작이 필요한 사람에게는 대신 이전 릴리스를 가리킵니다.

나머지 모든 것은 그대로였다. 최대 출력은 여전히 131,072 토큰이다. 입력은 여전히 텍스트와 이미지이고, 출력은 여전히 텍스트뿐이다. 리스팅에 여전히 Hugging Face 식별자가 없으므로 가중치는 여전히 비공개로 남아 있다. 그리고 리스팅 안에는 두 번째 호스트가 없으며, 서빙 제공자는 여전히 정확히 하나, Unbiased 자체뿐이다.

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

가격은 두 번 읽어볼 가치가 있는 부분이다

Unbiased 자체 플랫폼에서는 요금표가 그대로였다. 모델 카드와 가격 페이지 모두 여전히 입력 100만 개당 $2.50, 캐시된 경우 $0.25, 출력 $7.50으로 표시되어 있었다 — 9월 릴리스가 담고 있던 바로 그 세 숫자 그대로였다 — 그리고 모델 문자열이 pareto로 유지되었기 때문에, 공급업체의 API를 사용하는 고객은 26.10 Preview에 대해 그 요금을 지불하고 있다. 더 낮은 수치는 라우팅된 카탈로그 목록에 있는 수치이며, 두 수치 사이의 격차는 바로 마이그레이션 여부를 결정짓는 종류의 것이다.

두 가지 해석이 가능하며, 공급업체는 어느 쪽이 사실인지 밝히지 않았습니다. 26.10 Preview가 도입 홍보를 위해 그 경로를 통해 실제로 더 저렴하게 제공되고 있거나, 아니면 해당 리스팅이 직접 플랫폼과는 다른 상업적 계약을 나타내는 것입니다. Unbiased는 프로모션 종료일을 공개하지 않으며, 출시 당일 책정된 가격은 확약이 아닙니다.

이 이야기에서 라우터가 판도를 바꾸는 단 한 부분입니다. OrcaRouter는 공급자의 정가를 0% 마크업으로 그대로 전달합니다 따라서 공급업체의 가격 인하는 계약 주기가 아니라 시행되는 당일에 우리 쪽에서 바로 반영됩니다 — 그리고 자동 페일오버 덕분에 다음 주에 다르게 동작하는 프리뷰 릴리스도 코드 변경 없이 교체할 수 있습니다. 우리는 Unbiased의 Pareto 26.10 Preview를 제공하지 않으므로, 솔직히 말하면 이렇습니다: 이 특정 모델을 원하신다면 Unbiased 자체 API를 통해 호출하세요. 요점은 단지 프리뷰 릴리스에서는 가격과 버전이 모두 변수이며, 어느 것도 코드에 고정해서는 안 된다는 것입니다.

벤치마크 시트, 함께 제공된 라벨 그대로

Unbiased는 26.10 Preview에 대해 네 개의 점수를 발표했으며, 각 점수에는 작업당 측정된 비용이 함께 제시되고, 각각에는 공급업체가 직접 작성한 유의사항이 붙어 있습니다. 이것들은 공급업체가 실행했고 재현되지 않은 결과로 읽으십시오. 실제로 그러하니까요:

• DeepSWE v1.1 (에이전트형 코딩) — 69.9%, 작업당 $0.24
• Terminal-Bench 4.0 (에이전트형 터미널 사용) — 50.8%, 작업당 $0.48
• Humanity's Last Exam, 텍스트 전용 (전문가 추론) — 49.9%, 작업당 $0.008
• GPQA-Diamond (과학 추론) — 92.4%, 작업당 $0.004

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

벤더의 주장은 26.10 Preview가 "네 가지 벤치마크 모두에서 Pareto frontier를 따라잡거나 새로 설정한다"는 것입니다. 그 주장과 함께 공개된 표는 더 구체적이며, 그것이 아예 공개된다는 점은 Unbiased의 공으로 돌릴 만합니다. Terminal-Bench 4.0에서 GPT 6 Astra는 58, Fable 5.1은 56으로 기재되어 있고, 둘 다 Pareto의 50.8보다 높으며, 벤더 자체의 "다른 모델이 더 높은 점수를 받는 부분" 섹션에서 이를 직접 밝히고 있습니다. DeepSWE v1.1에서는 이번 릴리스가 한 군집에 속합니다 — GLM-5.3과 Kimi K3는 각각 69.0으로 Pareto의 69.9에 맞서는데 — 이는 사실상 동점이며 단일 실행이 지니는 어떤 오차 범위 안에 들어갑니다.

비교 수치에는 첫 번째보다 더 중요한 두 번째 주의사항이 있다. 그것들은 9월 21일 비교에서 옮겨 적은 것이며, 공급업체의 표현대로 “독립적으로 검증되지 않았고”, 개별 모델에 대한 별도 평가에서 산출된 것이다. 따라서 둘 다 같은 벤치에서 나온 것처럼 Pareto의 작업당 비용 수치와 짝지어서는 안 된다. 공급업체는 평가 세부 정보에서 그렇게 밝힌다. 그 문장을 건너뛴 독자는 차트를 과대 해석하게 된다.

이 중 독립적인 것은 하나도 없다. 가격표에 새 이름을 신뢰하기 전에 대부분의 팀이 확인하는 리더보드인 Artificial Analysis에는 Pareto에 대한 페이지가 전혀 없다. 위의 모든 수치는 모델을 판매하는 회사가 만들어낸 것이다. 이를 다소 누그러뜨리는 한 가지는 평가 하네스가 공개되어 있다는 점이다. 즉, 공급업체가 누구나 엔드포인트를 대상으로 실행해 볼 수 있는 재현 가능한 일대일 비교 스위트를 공개하는데, 이는 "우리 점수를 믿으라"를 "우리 점수를 다시 돌려보라"로 바꿔 놓는다. 그것은 실질적인 제안이며, 검증된 숫자와는 같지 않다. 아직 아무도 그 재실행 결과를 공개하지 않았다.

계약서에서 "preview"가 의미하는 것

여기서 그 단어는 릴리스 노트보다 더 많은 일을 하고 있습니다. Unbiased 자체 문서에서는 현재 접근을 자사 약관에 따른 평가용 접근으로 설명하며, 상업적 또는 프로덕션 사용에는 별도의 서면 계약이 필요하다고 명시합니다. 새 계정은 API 키가 발급되기 전에 수동으로 검토됩니다. 이 API는 OpenAI 및 Anthropic과 호환됩니다 — 기본 URL, 키, 모델 문자열만 바꾸면 되고 코드를 재작성할 필요는 없습니다 — 하지만 문서화된 API 표면은 chat completions와 messages뿐이며, 공급업체가 공개적으로 나열한 알려진 공백이 있습니다: GET /v1/models는 구현되지 않았고 알 수 없는 모델 식별자도 거부되지 않으므로, 호출자는 pareto를 명시적으로 보내야 합니다. 사용 가능한 것을 알아내는 대신 말입니다.

프리뷰 라벨과 프라이빗 베타 계약을 나란히 놓으면 운영 조언은 저절로 나온다. 이것은 라우팅 레이어 뒤에서 자체 워크로드와 비교 평가할 모델이지, 수익 트래픽 앞에 세워 두고 잊어버릴 모델이 아니다. 그렇게 하기 위한 메커니즘은 별로 화려하지 않다. 한 번 구성해 두는 폴백 체인, 그래서 주중에 당신 밑에서 바뀌는 릴리스가 장애가 아니라 설정 변경이 되게 하는 것이다. Unbiased는 9월에 자기 쪽에서 바로 이 부류의 문제를 고치는 데 시간을 썼다. 9월 16일 변경 로그 항목에는 긴 비스트리밍 요청의 약 13%가 120초 타임아웃에 걸리고 있었고, 게이트웨이 상한이 300초로 올라갔다는 기록이 있다. 이는 한 공급업체가 거친 부분을 솔직하게 인정한 것이다. 동시에 프리뷰의 운영 프로필은 아직 쓰이는 중이라는 점을 상기시켜 주기도 한다.

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

커밋하기 전에 주의할 점

세 가지 구체적인 사항이 미해결 질문들을 해결해 줄 것이며, 각각은 확인 가능하다.

첫 번째는 독립적인 점수입니다. 제3자가 공개된 하네스에서 26.10 Preview를 실행하기 전까지는, GPQA-Diamond에서의 92.4와 Terminal-Bench에서의 50.8은 벤더가 자사 작업에 대해 내놓은 주장일 뿐입니다 — 테스트할지 결정하기에는 충분하지만, 마이그레이션할지 결정하기에는 충분하지 않습니다.

두 번째는 미리보기가 가격에 미치는 영향입니다. 라우팅된 리스팅이 $0.80과 $3.20에 머무는 반면 공급업체 자체 플랫폼이 $2.50과 $7.50을 유지한다면, 그 차이는 두 숫자 중 어느 쪽에든 비용 모델을 구축하기 전에 이해할 가치가 있는 채널 결정입니다.

세 번째는 "예고 없이 변경될 수 있음"이 실제로 무엇을 뜻하는지다. 한 달에 두 번 개정되는 프리뷰는 분기 말에 동결되고 이름이 바뀌는 프리뷰와는 다른 도구이며, 변경 로그가 바로 그것을 가장 먼저 보여 줄 곳이다.

이 모든 것은 그것을 시도해 보는 데 반대하는 근거가 되지 않는다. 작업당 0.24달러에 최전선에 근접한 점수를 보고하는 100만 토큰 멀티모달 모델이라면, 자신의 프롬프트로 오후 한나절을 들여 진짜로 작업해 볼 가치가 있으며, 그 평가 비용은 그것을 둘러싼 논쟁 비용보다 적다. 이는 이번 주에 벤치마크한 모델이 다음 주에 얻게 될 모델이라고 가정하는 것에는 반대한다. 그리고 공급업체 스스로 프리뷰라고 부르는 릴리스의 경우, 그것이야말로 반드시 맞아야 하는 유일한 가정이다.

릴리스는 바로 자동 페일오버가 만들어진 대표적인 상황입니다: 자동 페일오버는 주중에 발밑에서 바뀌는 모델을 장애가 아니라 설정 변경으로 바꿔 줍니다.