"Pareto 26.10 Preview vs Pareto"라는 제목의 생성된 타이틀 카드와 "동일한 모델 문자열, 두 개의 서로 다른 릴리스"라는 부제목이 있고, 그 위에 "컨텍스트: 1M vs 262K", "가격: $0.80 / $3.20 vs $2.50 / $7.50", "안정성: 프리뷰 vs 안정"이라고 적힌 세 장의 카드가 있으며, 하단에는 "두 릴리스 모두 Unbiased에서 모델 문자열 pareto로 제공되며, 수치는 공개 목록 기준입니다."라고 적혀 있습니다.
Guides & Insights

Pareto 26.10 Preview vs Pareto: 동일한 모델 문자열, 두 개의 서로 다른 모델

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Unbiased가 출시한 Pareto 26.10 Preview는 2026년 10월 1일에 나왔고 이전 릴리스인 Pareto를 그 옆에 남겨 두었습니다. 이 둘은 플래그 하나로 선택하는 한 제품군의 변형이 아닙니다. 하나의 브랜드 아래에 있는 두 개의 릴리스이며, 벤더 자체의 모델 문자열 — pareto — 이제는 더 새롭고 명시적으로 불안정한 쪽으로 해석됩니다. 그래서 비교 질문은 사실 “어느 쪽이 더 나은가”가 아닙니다. 질문은 이것입니다: 당신의 요청이 실제로 도달하는 쪽은 어느 쪽이며, 그게 당신 발밑에서 바뀔 때 그 답은 어떻게 되는가?

두 제품이 한 호흡에 함께 설명되는 유일한 곳은 모델의 공개 기술 목록이다. Unbiased 자체의 모델 카드, 가격 페이지, FAQ는 하나의 스택형 제품을 설명하며 그 분할에 대해서는 전혀 언급하지 않는다. 한쪽에는 상세한 공개 차이 내역이 있고 다른 쪽에는 침묵이 있다는 이 비대칭성은 일대일 비교를 위한 정직한 출발점이다. 왜냐하면 그것은 아래의 모든 숫자가 어디서 나왔는지 알려주기 때문이다.

6차원, 양쪽

두 릴리스의 차이를 만들어내는 모든 요소는 이 여섯 줄에 담겨 있습니다. 왼쪽은 Pareto 26.10 Preview이고, 오른쪽은 9월 17일자 Pareto 릴리스, 즉 이 프리뷰의 카탈로그 문구에서 안정적인 선택이라고 부르는 릴리스입니다.

• 컨텍스트 창 — 1,048,576 토큰 대 262,144 토큰. 서류상으로는 4배의 여유이지만, 어느 쪽에도 더 작은 등급은 제공되지 않습니다.
• 최대 출력 — 131,072 토큰 대 131,072 토큰. 변동 없음. 더 큰 창이 더 큰 답변을 가져오지는 않았습니다.
• 라우팅 기준 입력 가격 — 백만 토큰당 $0.80 대 $2.50. 프리뷰는 해당 리스팅에서 가격이 대략 3분의 1입니다.
• 라우팅 기준 출력 가격 — 백만 토큰당 $3.20 대 $7.50. 절반 미만.
• 라우팅 기준 캐시된 입력 — 백만 토큰당 $0.03 대 $0.25. 가장 긴 에이전트 궤적이 여기서 가장 큰 이득을 봅니다.
• 공개된 벤치마크 시트 — 네 개의 점수, 명시적으로 "예비"이며 "최종 공개 전 변경될 수 있음" 대 공개된 벤치마크 표가 전혀 없음.

그 행들 중 두 개는 실제 업무를 좌우하는 항목이다. 컨텍스트 윈도는 벤더가 자사 사이트에는 밝히지 않는 헤드라인이며 — 그것은 모델 카드가 아니라 리스팅에 적혀 있다 — 캐시된 입력 가격은 에이전트의 상한이 아니라 청구서를 바꾸는 항목이다. 나머지는 모두 마케팅상의 차이이거나, 출력 점수의 경우에는 일종의 인정이다. 프리뷰의 수치를 "preliminary"라는 라벨과 함께 공개하는 것은 대안보다 더 정직하며, 그것은 경고이기도 하다.

A generated two-column scoreboard titled "Pareto 26.10 Preview vs Pareto - the scoreboard". The left column, "Pareto 26.10 Preview", reads "Context: 1,048,576 tokens", "Max output: 131,072 tokens", "Input price: $0.80 / 1M", "Output price: $3.20 / 1M", "Cached input: $0.03 / 1M" and "Scores: four, preliminary". The right column, "Pareto", reads "Context: 262,144 tokens", "Max output: 131,072 tokens", "Input price: $2.50 / 1M", "Output price: $7.50 / 1M", "Cached input: $0.25 / 1M" and "Scores: none published". A footer reads "Both columns per the public listing; the vendor's own site lists $2.50 / $7.50 for both releases."

당신이 보는 가격은 어디에서 보는지에 따라 달라집니다

두 요금표를 나란히 놓고 보면 서로 맞지 않는데, 바로 그 부분이 이 비교에서 아무도 설명하지 않은 부분이다.

Unbiased의 자체 플랫폼은 26.10 Preview가 현재 릴리스가 된 날에도 여전히 입력 100만 개당 $2.50, 캐시된 경우 $0.25, 출력 $7.50을 명시하고 있다. 이는 9월 수치로, 가격 페이지와 모델 카드 모두에서 변경되지 않았다. 더 낮은 세트인 $0.80, $0.03, $3.20은 동일한 preview에 대한 라우팅된 카탈로그 목록에 나타난다. 따라서 고객이 pareto를 벤더의 API를 통해 곧바로 호출하면 새 모델에 대해 예전 요금표대로 지불하게 되는 반면, 라우팅된 목록은 그 대략 3분의 1을 광고한다. 둘 다 활성 상태다. 벤더는 프로모션 종료일도, 이 둘을 서로 일치시키는 설명도 게시하지 않았다.

그것은 채널 질문이고, 프리뷰 릴리스에서는 타이밍 질문이기도 합니다. 비용을 어느 숫자로 모델링하든, 다른 쪽 숫자는 릴리스 노트 한 줄만 나오면 정답이 됩니다. 공급자의 정가를 0% 마크업으로 그대로 전달하는 라우터는 바로 이 마찰을 없애 줍니다 — 벤더 가격 변경이 다음 계약 검토 시점이 아니라 같은 날 바로 반영되니까요 — 그리고 그것이 여기서 OrcaRouter에서 빌려올 가치가 있는 단 하나의 구조적 요소입니다. 우리는 오늘 두 Unbiased 릴리스 중 어느 것도 취급하지 않으므로, "어디로 호출해야 하나"에 대한 직접적인 답은 Unbiased 자체 API이며, 구매하는 리스팅이 어느 쪽 가격 세트를 갖고 있든 그쪽 기준입니다. 이 말을 굳이 꺼내는 이유는 그 차이가 세 배에 달하고, 프리뷰는 잘못된 쪽으로 가격을 책정했다는 사실을 발견할 자리가 아니기 때문입니다.

미리보기가 주는 이점과 그에 따르는 대가

프리뷰 자체의 카탈로그 설명이 조건을 정한다. 그것은 “예고 없이 변경될 수 있음”이며, 예측 가능한 동작이 필요한 사람은 누구든 9월 릴리스로 다시 안내된다. 이는 상투적인 문구가 아니라 제품 정의다. 이를 장시간 에이전트 세션의 실제 양상과 비교해 보면 그 트레이드오프는 구체화된다.

대화를 계속 이어가는 에이전트는 컨텍스트를 축적하고, 긴 대화야말로 프롬프트 캐싱이 제값을 하는 곳이다. 변경되지 않은 엔드포인트 뒤에서 모델이 바뀌는 것은 그것을 잃는 전형적인 방식이다: 캐시는 토큰을 생성한 모델에 키가 맞춰지므로, 궤적 중간에 조용히 버전이 교체되면 캐시해 둔 것을 무효화하고 이미 지불했다고 생각한 작업에 다시 요금을 청구할 수 있다. Unbiased 자체 문서는 이 점을 다른 방향에서 주장한다 — 자사의 블렌드를 캐시 안정적이라고 내세우며, 전환 라우터는 그렇지 않다고 말한다 — 따라서 이것은 벤더가 잘 이해하고 있으며, 프리뷰를 출시하는 대가로 그냥 감수하는 위험이다. 이것은 이름 붙일 가치가 있다. 왜냐하면 그 실패는 대시보드에서 보이지 않기 때문이다: 토큰은 여전히 청구되고, 답변은 여전히 반환되며, 숫자는 지난주보다 그저 더 클 뿐이다.

프리뷰의 장점은 실재하며, 단점도 그와 똑같이 실재합니다. 컨텍스트는 4배, 라우팅된 목록에서 안정 릴리스 요율의 8분의 1인 캐시된 입력, 그리고 벤치마크 표도 아예 있습니다 — 9월 릴리스는 공개된 점수가 전혀 없었습니다. 워크로드가 롱컨텍스트이고 비용에 민감하다면 프리뷰가 바로 원하는 것이며, 스택 전체를 걸지 않고 그것을 택하는 방법은 의도적으로 고정하는 것입니다: 프리뷰용 명명된 엔드포인트, 안정 릴리스용 명명된 엔드포인트, 그리고 둘 사이의 폴백을 한 번 구성하는 것입니다. 라우팅 DSL은 바로 이런 형태의 문제를 위해 존재합니다 — 둘을 별도 레그로 구성하고, 실제 트래픽의 일부를 각각으로 보내고, 요청 로그가 각각의 실제 비용을 알려주게 하세요. 프리뷰는 설정 한 줄로 되돌릴 수 있는 결정이어야 하며, 청구서를 보고 알게 되는 엔드포인트의 속성이어서는 안 됩니다.

A generated three-card graphic titled "Where the version reaches you", with cards reading "Vendor API: model string pareto leads to 26.10 Preview", "Vendor pricing card: $2.50 / $7.50, unchanged" and "Listing: $0.80 / $3.20, may change without notice", and a footer reading "Read Oct 1, 2026; which release pareto points at is set by the release calendar."

신뢰할 만큼 안정적이지 않은 성과 양상

위의 모든 수치는 공개 리스팅에서 나온 것이며, 해당 리스팅 자체의 성능 패널은 출시 당일 읽는 시점에 따라 달라졌습니다. 26.10 Preview 페이지를 한 번 읽었을 때는 중앙값 지연 시간 5.28초와 초당 35토큰이 보고되었습니다. 같은 날 게시된 나란히 보기에서는 preview의 경우 3.54초와 초당 21토큰, September release의 경우 1.05초와 초당 45토큰이 보고되었습니다. 이는 작은 불일치가 아닙니다. 단일 제공자가 서비스하는 완전히 새로운 서비스는 측정 기반이 얇고, 몇 시간에 걸친 롤링 윈도는 움직일 수밖에 없습니다.

솔직한 입장은 두 릴리스 모두 계획을 세울 만큼 충분히 안정적인 처리량이나 지연 시간 수치를 갖고 있지 않다는 것입니다. 그리고 프리뷰의 경우 이는 스냅샷 문제라기보다 제품 자체에 내재된 성격입니다. 9월 릴리스는 적어도 몇 주간의 트래픽을 겪었습니다 — 해당 목록은 여러 날에 걸친 가용성이 90%대 후반임을 보여주며, 그 뒤에는 전체 제공자 이력이 있습니다. 프리뷰는 몇 시간에 불과합니다. 두 릴리스 중에서 선택하는 이유가 가격이나 맥락이 아니라 속도라면, 선택의 근거가 될 증거는 아직 존재하지 않습니다. 책임 있는 행동은 어느 페이지에서 숫자를 읽는 것이 아니라 자신의 프롬프트로 측정하는 것입니다.

A screenshot of the OrcaRouter models catalogue headed "Models" and subtitled "208 models · 16 providers · one API key, one bill", with input-modality, context-length, input-price, status, series and supported-parameter filter rows, tabs for Models, Leaderboard, Offers and Playground, a "How to call any model" panel showing a POST to an OpenAI-compatible endpoint, and model cards including OpenAI: GPT-6.1 Sol.

어느 쪽에 전화해야 할지, 그리고 신경 쓰지 않는 방법

작업이 롱컨텍스트이고 비용에 민감하며 평가 가능하다면 — 에이전트 세션, 배치 처리, 윈도가 네 배이고 입력 가격이 3분의 1인 것이 주중 변경 위험을 상쇄해 주는 모든 경우 — 프리뷰를 호출하세요. 그 아래에 설정 줄을 둔 시험판으로 취급하고, 자체 수치를 유지하세요. 벤더의 수치는 바뀔 테니까요.

워크로드가 프로덕션이거나 지연 시간에 민감하거나, 예고 없이 변경될 수 있다고 설명되는 모델을 원하지 않는 규정 준수 검토의 적용을 받는다면, 안정적인 Pareto를 호출하세요. 당신은 1M 창, 더 저렴한 캐시, 공개된 점수를 포기하는 대신, 실적 기록이 있는 엔드포인트와 다음 주에도 같은 의미를 지닌 이름을 유지합니다. 많은 팀에게 그것이 바로 요구 사항의 전부입니다.

실수는 이것을 영구적인 포크로 취급하는 것이다. Unbiased는 이 분리를 일시적인 것으로 만들었다 — 프리뷰는 평가된 뒤 흡수되기 위해 존재한다 — 그리고 중요한 결정은 두 가지 중 어느 것을 고르느냐가 아니라, 그들 사이를 전환하는 것이 5분짜리 변경인지 분기별 프로젝트인지 여부다. 하나의 엔드포인트에 하나의 모델 문자열을 두고 보면, 현재 그것은 둘 다 아니다: 그것은 당신이 포착해야 하는 공지다. 대신 그 선택을 라우팅 결정으로 구성하면, 당신이 호출하는 버전은 하나의 노브가 되며, 이것이 프리뷰 릴리스가 지금까지 실제로 보상해 온 유일한 자세다.