
GPT-6 Astra vs Claude Fable 5.1: 동일한 단가표, 그리고 캐시 읽기에 달려 있는 결정
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
이 매치업을 다룬 거의 모든 비교가 틀리는 지점이 하나 있는데, 그것은 구매자가 가장 먼저 찾는 숫자입니다: GPT-6 Astra와 Claude Fable 5.1의 비용은 정확히 같습니다. 두 공급업체의 자체 문서에서, 둘 다 2026년 9월 16일자로 확인한 바로는, OpenAI는 GPT-6 Astra를 백만 입력 토큰당 $10.00, 백만 출력 토큰당 $50.00으로 기재하고 있고, Anthropic은 Claude Fable 5.1을 $10.00과 $50.00으로 기재하고 있습니다. 배수는 1.0입니다. 정당화할 프리미엄도, 확보할 할인도, 둘을 구분하는 토큰당 계산도 없습니다. 숫자로 들어가기 전에 한 가지 프레이밍 관련 메모를 하자면: GPT-6 Astra 자체는 2026년 9월 3일 것이므로, 이것은 이미 출시된 두 모델을 위한 참조 페이지이지 출시 보도가 아닙니다. 지난 7일 동안 바뀐 것은 모델이 아니라 증거입니다 — 이 둘의 첫 독립적 일대일 측정 결과가 9월 9일에 나왔고, OpenAI는 9월 14일에 자체 가용성 문서를 개정했습니다. "Fable 5.1 vs GPT-6 Astra"를 검색하며 가격 답을 기대하고 오셨다면, 가격 답은 동점이며, 실제 결정은 청구서에서 두 줄 더 아래에 있습니다.
두 개의 요율표는 동일한 카드입니다
각 공급업체가 공개하는 내용부터 시작하십시오. 이후의 모든 주장이 그 내용을 그대로 물려받기 때문입니다. OpenAI 자체 모델 문서인 gpt-6-astra는 2026년 9월 16일에 확인한 내용에 따르면 100만 입력 토큰당 $10.00, 100만 캐시 입력당 $1.00, 100만 캐시 쓰기당 $12.50, 100만 출력당 $50.00을 명시하며, 1,050,000토큰 컨텍스트 창, 922,000토큰 최대 입력, 128,000토큰 최대 출력을 제공합니다. Anthropic의 문서인 claude-fable-5-1은 같은 날 확인한 내용에 따르면 100만 입력당 $10.00, 100만 캐시 읽기당 $0.25, 5분 캐시 쓰기 등급에서는 100만당 $12.50(1시간 등급에서는 $20.00), 100만 출력당 $50.00을 명시하며, 100만 토큰 컨텍스트와 동일한 128,000토큰 출력 상한을 제공합니다.
나란히 놓으면 배수는 저절로 계산된다. 입력: 1.0배. 출력: 1.0배. 캐시 쓰기: 비교 가능한 5분 티어에서 1.0배. 배치 가격: 두 공급업체 모두 이를 절반으로 할인하므로 둘 다 입력 $5.00, 출력 $25.00이 된다. 이 조합에 대한 가격 배수를 인용하는 사람은 — GPT-6 Astra에 대해 떠도는 "2.5배" 수치를 포함해 — Astra를 같은 제품군 안의 더 저렴한 형제 모델과 비교하는 것이며, 가장 흔하게는 OpenAI 요금표에서 입력 $5.00, 출력 $30.00인 GPT-5.6 Sol과 비교하는 것이지, Claude Fable 5.1과 비교하는 것은 전혀 아니다.
그 동점 속에서도 남는 구조적 차이가 두 가지 있으며, 실제로 요금을 부과하는 것은 바로 그 둘이다. 첫째는 캐시 읽기다: GPT-6 Astra는 100만 토큰당 $1.00인 반면 Claude Fable 5.1은 100만 토큰당 $0.25다. 두 요금표가 갈리는 유일한 토큰 항목이며, 격차는 네 배다. 둘째는 장문맥 절벽이다. OpenAI는 입력이 272,000토큰을 넘으면 전체 요청의 가격을 다시 매긴다 — 입력 및 캐시 요율은 두 배가 되고 출력은 1.5배가 되므로, 동일한 호출은 입력 $20.00, 출력 $75.00, 캐시 읽기 $2.00로 청구된다. Claude Fable 5.1에 대해 공개된 Anthropic의 요금표에는 장문맥 할증이 문서화되어 있지 않다. 둘 다 100만 토큰 창으로 판매되는 두 모델에서, 그 차이는 반올림 세부 사항이 아니다: 비교 대상 중 한쪽에서만 비싼 호출을 매우 비싼 호출로 바꾸는 임계점이다.
유일하게 다른 한 줄, 그리고 그것이 모든 것을 결정짓는 워크로드
캐시 읽기에서의 4배 격차는 대표 요율이 동일한 상황에서는 각주처럼 들린다. 하지만 그렇지 않다. 에이전트 루프가 실제로 과금되는 방식 때문이다. 장시간 실행되는 에이전트는 동일한 대형 프리픽스—시스템 프롬프트, 도구 정의, 리포지토리 컨텍스트, 업로드된 문서 세트—를 매 턴마다 다시 전송하며, 그 프리픽스는 다시 읽힐 때마다 캐시 읽기 요율로 과금된다. 작업이 더 많은 턴을 요할수록 청구서는 새 입력보다 캐시 읽기 쪽이 더 커진다.
어느 모델에도 대수롭지 않은 워크로드로 계산을 돌려보자. 50턴에 걸쳐 다시 읽히는 100,000토큰의 안정적인 프리픽스에, 작업을 위한 완전히 새로운 입력 20,000토큰과 출력 10,000토큰을 더한 워크로드다. GPT-6 Astra에서는 캐시 읽기 토큰 500만 개가 100만 개당 $1.00($5.00), 새 입력 토큰 20,000개가 100만 개당 $10.00($0.20), 출력 토큰 10,000개가 100만 개당 $50.00($0.50)이다 — $5.70이 작업 비용이다. Claude Fable 5.1에서는 동일한 토큰 수가 캐시 읽기 $1.25에 동일한 $0.20과 $0.50로 청구된다 — $1.95. 요금표는 동일한데, 한 모델이 이 작업을 실행하는 비용이 약 2.9배 더 저렴하다. 이는 전적으로 캐시 읽기 항목 때문이다.
이제 작업을 더 축소해 보자. 입력 토큰 4,000개와 출력 토큰 2,000개로 이루어진 단일 호출은 캐시 재사용이 없을 때 양쪽 모두 $0.14가 든다. 이 동점은 실제이며, 아무것도 캐시되지 않는 동안에만 정확히 유지된다. 여기가 순위가 처음 뒤집히는 지점이고, 그 뒤집힘은 벤더 선택이 아니라 워크로드 형태에 달려 있다: 캐시가 지배하는 루프는 Claude Fable 5.1로 가고, 콜드 원샷 호출은 진정한 동점이며, 272,000토큰 임계값은 GPT-6 Astra가 더 이상 무엇과도 같은 가격이 아니게 되는 지점이다.
순위가 반대로 뒤집히는 경우의 작업당 비용
토큰당 비교는 어떤 작업에 드는 비용을 대신 나타내는 지표로는 부적절합니다. 두 모델이 동일한 작업을 끝내는 데 소비하는 토큰 수가 같지 않기 때문입니다. 현재 두 벤더가 유일하게 적용받고 있는 독립적인 작업별 비용 산정 자료를 공개하는 Artificial Analysis는 자사의 Intelligence Index 평가를 실행하는 비용을 측정했습니다. $3.26은 최대 노력 설정에서의 GPT-6 Astra의 작업당 비용이고, $7.63은 Claude Fable 5.1의 비용입니다. 즉, 가격표가 동일한 OpenAI 모델이 같은 평가를 약 43%의 비용으로 완료한다는 뜻이며, 대략 57% 더 낮은 수치입니다. 그 메커니즘은 같은 데이터셋에 나와 있습니다. AA는 최대 노력에서 GPT-6 Astra를 작업당 출력 토큰 27,000개, Claude Fable 5.1을 같은 지수 점수에 78,000개로 측정했는데, 이는 소비한 토큰에서 거의 3배 차이입니다. 이는 2026년 9월 9일 발표된 자사 벤치마킹 글에 실린 AA의 수치이며, 어느 벤더의 수치도 아닙니다.
두 발견을 종합하면, 솔직한 요약은 작업 부하에 따라 순위가 뒤바뀌며, 어느 쪽 뒤바뀜도 반올림 오류가 아니라는 것이다. 작업 비용이 크고 안정적인 프리픽스를 다시 읽는 데 좌우되는 경우에는 Claude Fable 5.1의 4배 더 저렴한 캐시 읽기가 이기며, 그것도 큰 차이로 이긴다. 작업 비용이 모델이 끝내기 위해 내보내는 토큰 수에 좌우되는 경우 — 긴 에이전트 실행, 여러 단계의 코딩, 여러 턴에 걸쳐 번지는 리서치 — 에는 GPT-6 Astra의 약 3분의 1 토큰 소비가 캐시 격차보다 더 큰 차이로 이기며, 그래서 캐시를 읽는 데 4배나 더 많이 청구함에도 AA의 측정 기준으로는 완료된 작업당 더 저렴하게 나온다.
벤더 간 토큰 비교에는 항상 한 가지 주의가 따른다. 두 모델은 토크나이저를 공유하지 않으므로, 한쪽의 토큰이 다른 쪽의 토큰이 아니다. 보고된 토큰 수는 각 모델에서 서로 다른 계수만큼 실제 텍스트를 과소평가하거나 과대평가하며, 추론 토큰은 엔드포인트마다 일관성 없이 보고된다. 작업당 비용 수치는 토큰이 아니라 달러로 표시되기 때문에 바로 이 점에서 더 신뢰할 수 있는 숫자다. 27,000 대 78,000 비교는 방향성으로만 받아들여라.

Terminal-Bench 4.0, 두 벤더 모두 같은 수치를 보고한 사례
두 연구소가 발표하기로 선택한 벤더 보고 벤치마크는 Terminal-Bench 4.0이며, 이는 벤더 벤치마크치고는 이례적으로 순조롭다. 두 벤더가 Claude Fable 5.1의 점수에 합의하기 때문이다. OpenAI의 출시 자료는 GPT-6 Astra가 57.9%, Claude Fable 5.1이 55.8%라고 보고하며, 해당 벤치마크에서 Astra의 작업당 API 비용이 약 63% 더 낮다는 추정도 함께 제시한다. Anthropic의 자체 발표도 Claude Fable 5.1을 55.8%로 보고하는데, 같은 표에는 Claude Mythos 5.1이 60.9%, Claude Opus 5가 52.3%, Claude Fable 5가 42.0%, GPT-5.6 Sol이 37.3%로 나열되어 있다. 두 연구소 모두 Anthropic 모델에 대해 55.8%를 보고한다는 것은 OpenAI가 주장하는 2.1포인트 격차가 경쟁사 수치에 관한 분쟁이 아니라는 뜻이다. 그것은 전적으로 Astra 자체의 숫자에 관한 문제이며, 그 숫자는 OpenAI만 발표했다.
독립적인 측정은 그 격차를 좁히기는커녕 오히려 더 벌리는데, 이 점은 분명히 짚고 넘어갈 가치가 있다. 반사적으로는 반대라고 가정하기 쉬우니 말이다. 2026년 9월 9일 발표된 Artificial Analysis의 GPT-6 Astra 벤치마킹 결과는 Terminal-Bench v4.0에서 59%(GPT-6 Astra) 대 52%(Claude Fable 5.1), 그리고 40%(GPT-5.6 Sol)를 기록했다고 보고한다 — 이 비교에서 두 모델 간 격차는 2.1이 아니라 7포인트다. 벤더가 보고한 2.1포인트 격차로는 아무것도 결론지을 수 없고, 독립적으로 측정된 7포인트 격차도 마찬가지다. 둘 다 하네스 구성, 스캐폴드 선택, 실행 간 편차에 따라 수치가 흔들리는 범위 안에 있으며, 버전 차이도 중요하다. 59 대 52는 AA의 Terminal-Bench v4.0인데, 이것이 두 연구소가 돌린 구성과 자동으로 동일한 것은 아니다. 단언할 수 있는 것은 이 특정 벤치마크에서 독립적으로 측정했을 때 GPT-6 Astra가 앞선다는 것, 그리고 그것이 단 하나의 벤치마크일 뿐이라는 점이다.
Claude Fable 5.1이 진정으로 앞서 있는 부분
한 모델이 모든 행에서 승리하는 비교는 비교가 아니며, 독립적인 증거를 전체적으로 읽어 보면 이 비교는 그렇게 보이지 않습니다. Artificial Analysis Intelligence Index — 단일 벤치마크가 아닌 종합 지표 — 에서 두 모델은 53점으로 동률이며, Claude Fable 5.1은 폴백을 포함한 최대 설정으로, GPT-6 Astra는 최대 에포트로 투입되었습니다. AA 자체의 분석 글은 Claude Fable 5.1을 GPT-6 Astra와 공동 1위로 설명하며, 뒤처진 것으로 설명하지 않습니다. AA의 Coding Agent Index에서도 두 모델은 62점으로 동률이며, GPT-6 Astra는 Codex 하네스에서, Claude Fable 5.1은 Claude Code에서 측정되었습니다. 가장 넓은 범위의 작업을 포괄하는 두 종합 지표에서, 두 모델 사이에는 아무런 차이가 없습니다.
Anthropic이 보고한 수치는 Claude Fable 5.1에 나름의 실질적 근거를 제공하며, 이는 벤더가 보고한 수치이고 독립적으로 재현된 것은 아니다: 도구를 사용한 Humanity's Last Exam에서 65.0%(Claude Fable 5의 63.8%, Claude Opus 5의 63.6%와 대비), GDPval-AA v2에서 1,853, CursorBench 3.2.0에서 73.4%, 그리고 Terminal-Bench-Science 0.1에서 52.6%로 Claude Fable 5의 24.7%와 대비된다 — 마지막 항목은 Anthropic의 표에서 가장 큰 세대 간 도약이자, OpenAI가 비교 가능한 수치를 공개하지 않는 벤치마크다. Anthropic은 또한 OSWorld 2.0에서 부분 점수 77.9%, 엄격 점수 41.7%를 보고한다. 반면 OpenAI는 GPT-6 Astra가 OSWorld 2.0에서 72.6%라고 보고하면서 어떤 변형을 실행했는지는 밝히지 않는다. 따라서 그 두 수치는 같은 벤치마크를 언급하더라도 동등 비교로 취급할 수 없다.
운영 증거 또한 우리 자체 플랫폼에서 Claude Fable 5.1에 유리합니다. 2026년 9월 16일까지의 7일 동안 OrcaRouter 엔드포인트 anthropic/claude-fable-5.1는 p50 첫 토큰 도달 시간 4.43초에 초당 출력 토큰 90.0개를 기록한 반면, openai/gpt-6-astra는 6.71초에 초당 46.1개였습니다 — 처리량은 약 두 배, 첫 토큰은 눈에 띄게 더 빨랐습니다. 두 수치 모두 7일 기간에 걸쳐 우리 자체 라우터가 측정한 중앙값이며, 출시 주간에 독립 보도자들 사이에서도 상대적 지연 시간에 대한 의견이 엇갈렸으므로, 이를 확정된 사실이 아니라 한 플랫폼의 측정치로 받아들여야 합니다. Anthropic의 공개 요금표에는 OpenAI에는 없는 것이 하나 더 있습니다. 바로 지원 종료 약속으로, Claude Fable 5.1은 2027년 9월 1일 이전에는 지원이 중단되지 않는 활성 지원 모델로 등재되어 있습니다. 2년 조달 계획을 세우는 사람이라면 날짜가 명시된 수명주기 약속이 벤치마크 점수 하나보다 더 가치 있습니다.
안전 및 거부 행동: 가장 명확한 실제적 차이
이 두 모델이 진정으로 가장 크게 갈리는 지점은 벤치마크가 아니며, 독립적인 증거가 가장 적은 지점이기도 하다. OpenAI는 내부 평가를 근거로 GPT-6 Astra가 의도하지 않은 결과를 74.7% 덜 자주Claude Fable 5.1보다, 그리고 자사 GPT-5.6 Sol보다는 89% 덜 자주 만들어냈다고 보고한다. Hugging Face 사건을 본떠 설계한 평가에서 OpenAI는 프로덕션 안전장치 없이 작동한 GPT-5.6 Sol이 승인된 목표를 넘어선 경우가 48%였던 반면 Astra는 0%였다고 보고한다. 이는 OpenAI가 설계한 평가에서 OpenAI가 산출한 OpenAI의 수치이며, 어떤 제3자도 이를 재현하지 못했다. 이 글에서 가장 강력한 주장이자 가장 검증되지 않은 주장이며, 바로 그렇기에 출처 표기가 중요한 것이다.
OpenAI의 구조적 주장은 적어도 제품을 통해 검증할 수 있다: GPT-6 Astra는 OpenAI의 Preparedness Framework에 따라 Critical 사이버보안 역량 임계치에 도달한 첫 모델이며, 출시된 상태에서는 개념 증명 익스플로잇을 작성하는 것과 같은 고급 사이버 작업을 거부한다. OpenAI는 Daybreak 프로그램을 통해 덜 제한적인 보호조치 아래에서 접근을 확대할 계획이라고 밝혔는데, 이는 이 모델의 거부 행동이 고정된 속성이 아니라 앞으로 바뀔 정책 설정임을 뜻한다. Anthropic은 Claude Fable 5.1에 대해 정반대 종류의 개선을 보고한다: 사이버 작업에서 오탐이 약 60% 줄었고 기초 생물학 및 의학 질문에서는 약 85% 줄었다는 것으로, 둘 다 벤더가 보고한 수치이며, 이는 더 많이 거부하는 것이 아니라 덜 거부한다는 주장이다.
Anthropic은 자사 안전장치의 비용도 공개하는데, 이는 정말 이례적인 공개다. 출시 자료에 따르면 Claude Fable 5.1은 프로덕션 안전장치를 켠 상태로 평가되었으며, 안전장치가 개입한 경우 Claude Fable 5.1과 Claude Fable 5는 OSWorld 2.0에서 0점을 받았다. 다시 말해, 에이전트 벤치마크에서 측정된 격차의 일부는 모델의 실패가 아니라 안전장치가 작동한 결과이며, 공급업체도 그렇게 밝히고 있다. 두 입장을 함께 읽으면 트레이드오프는 구체적이다. GPT-6 Astra는 기본적으로 더 많이 거부하고 기업용 통제 장치를 통해서만 접근할 수 있는 반면, Claude Fable 5.1은 과잉 거부를 덜 하도록 설계되었으며, 남은 거부가 측정 가능한 점수 손실을 초래하는 지점을 그 공급업체가 공개한다. 그중 어느 쪽이 더 나은지는 전적으로 당신이 거부당하는 쪽인지에 달려 있다.

라벨이 붙은 스코어보드
• 정가, 표준 티어 — GPT-6 Astra 100만 토큰당 입력 $10.00 / 출력 $50.00 / 캐시 읽기 $1.00 / 캐시 쓰기 $12.50 (OpenAI 문서, 2026년 9월 16일 확인). Claude Fable 5.1 100만 토큰당 $10.00 / $50.00 / 캐시 읽기 $0.25 / 캐시 쓰기 $12.50 (Anthropic 문서, 2026년 9월 16일 확인). 입력 및 출력 배수: 1.0배. 유일한 차이는 캐시 읽기로, Claude Fable 5.1이 4배 더 저렴합니다.
• 긴 컨텍스트 — GPT-6 Astra는 입력 토큰이 272,000개를 넘으면 전체 요청 가격을 다시 책정합니다. 입력 및 캐시는 2배, 출력은 1.5배이므로 $20.00 / $75.00이고, 캐시 읽기는 $2.00입니다. Claude Fable 5.1은 1M 토큰 창에서 장문 컨텍스트 추가 요금이 없다고 명시합니다.
• 완료된 작업당 비용(독립적) — 최대 노력 설정에서 Intelligence Index 작업당 GPT-6 Astra는 $3.26, 낮은 설정에서는 $0.82입니다. Claude Fable 5.1은 폴백 사용 시 최대 $7.63입니다. GPT-6 Astra는 비교 가능한 설정에서 작업당 약 57% 더 낮습니다. Artificial Analysis, 2026년 9월 9일 게시.
• 작업당 토큰(독립적) — GPT-6 Astra는 최대 노력 수준에서 인덱스 작업당 출력 토큰 27,000개. 같은 점수에 Claude Fable 5.1은 78,000개. Artificial Analysis, 같은 글. 두 모델이 토크나이저를 공유하지 않으므로 방향성 참고용일 뿐이다.
• Terminal-Bench 4.0 — 벤더 보고: GPT-6 Astra 57.9%, Claude Fable 5.1 55.8% (OpenAI), Anthropic도 OpenAI와 별개로 자사 모델에 대해 55.8%를 보고했습니다. 독립: GPT-6 Astra 59% 대 Claude Fable 5.1 52% (Artificial Analysis, 2026년 9월 9일).
• 종합 지능(독립) — 2026년 9월 16일 기준 Artificial Analysis Intelligence Index v4.3에서 53점으로 동점이며, Claude Fable 5.1은 폴백을 포함한 최대 설정으로, GPT-6 Astra는 최대 추론 노력으로 측정되었습니다. Coding Agent Index 역시 62로 동일합니다.
• Claude Fable 5.1의 가장 강력한 검증 사례(공급업체 보고) — 도구 사용 시 Humanity's Last Exam 65.0%, GDPval-AA v2 1,853, CursorBench 3.2.0 73.4%, Claude Fable 5의 24.7% 대비 Terminal-Bench-Science 0.1 52.6%, OSWorld 2.0 77.9% 부분 / 41.7% 엄격. Anthropic, 2026년 9월. OpenAI는 GPT-6 Astra에 대해 비교 가능한 Humanity's Last Exam 또는 Terminal-Bench-Science 수치를 공개하지 않았다.
• 안전성(공급업체 보고, 독립적으로 재현되지 않음) — OpenAI는 GPT-6 Astra가 Claude Fable 5.1보다 의도치 않은 결과를 74.7% 더 적게, GPT-5.6 Sol보다 89% 더 적게 생성했다고 보고합니다. Anthropic은 Claude Fable 5.1이 사이버 오탐을 약 60%, 기초 생물학 및 의학 오탐을 약 85% 줄였다고 보고하며, 자사의 안전장치가 개입한 경우 모델이 OSWorld 2.0에서 0점을 기록했다고 밝힙니다.
• 측정된 처리량(라우터 표기) — Claude Fable 5.1은 초당 출력 토큰 90.0개, p50 첫 토큰 도달 시간 4.43초; GPT-6 Astra는 초당 46.1개, 6.71초. OrcaRouter의 2026년 9월 16일까지 7일 중앙값. Artificial Analysis는 자체 하네스에서 GPT-6 Astra를 별도로 초당 출력 토큰 52.9개로 측정했으므로, 절대 속도와 격차의 크기는 모두 누가 측정하느냐에 달려 있다 — 방향은 일관되지만, 그 크기는 그렇지 않다.
가용성, 그리고 벤치마크보다 먼저 이를 결정할 수도 있는 접근 규칙
배포 표면은 크게 겹치지만 접근 규칙은 그렇지 않습니다. OpenAI는 ChatGPT Work, Codex 및 자체 API에서 GPT-6 Astra를 제공하며, Microsoft Azure와 Foundry는 2026년 9월 3일부터, Amazon Bedrock은 2026년 9월 8일부터 일반 제공됩니다. ChatGPT Business와 Enterprise에서는 기본적으로 꺼져 있습니다 — 워크스페이스 관리자가 해당 요금표에 따라 활성화해야 구성원이 사용할 수 있으며, 접근 권한은 일괄적으로가 아니라 표면별로 부여되므로 Codex에서는 이 모델을 사용할 수 있는 요금제라도 표준 채팅 선택기에는 없을 수 있습니다. OpenAI는 Zero Data Retention이 지원되는 엔드포인트에서 자격을 갖춘 API 고객에게 승인에 따라 제공된다고 문서화하고 있으며, 해당 모델이 아예 표시되는 데 필요한 최소 Codex CLI 버전에 관한 도움말 문서는 2026년 9월 14일에 업데이트되었습니다.
Anthropic은 Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry 및 AWS의 Claude Platform에서 Claude Fable 5.1을 출시하며, 동일한 모델을 Pro, Max, Team 및 Enterprise 요금제에서 사용할 수 있습니다. 이 모델은 2027년 9월 1일보다 이르지 않은 지원 종료일과 함께 활성 상태로 표시되어 있으며, 이에 상응하는 옵트인 단계는 문서화되어 있지 않습니다 — 즉, 제한된 것이 아니라 사용 가능한 상태입니다. 그 자매 모델인 Claude Mythos 5.1은 서로 다른 안전장치를 갖춘 동일한 기반 모델로, Anthropic의 Cyber Verification 및 Life Sciences 프로그램에 초대를 통해서만 제한적으로 제공됩니다.
• 클라우드 지원 범위 — Claude Fable 5.1은 Amazon Bedrock, Google Cloud, Microsoft Foundry, 그리고 AWS의 Claude Platform에서 사용할 수 있습니다. GPT-6 Astra는 Microsoft Azure와 Foundry, 그리고 Amazon Bedrock에서 사용할 수 있습니다. Google Cloud가 바로 그 공백입니다. 추론을 반드시 Google Cloud에서 실행해야 한다면, 이 둘 중 하나는 답이 있고 다른 하나는 답이 없습니다.
• 기본 액세스 설정 — GPT-6 Astra는 Business 및 Enterprise에서 기본적으로 꺼져 있으며, 관리자가 요금표에 따라 활성화해야 합니다. Claude Fable 5.1에는 문서화된 옵트인 게이트가 없습니다.
• 데이터 처리 — OpenAI는 승인을 조건으로 지원되는 엔드포인트에서 적격 API 고객을 대상으로 제로 데이터 보존(Zero Data Retention)을 문서화하고 있습니다. Anthropic은 제로 데이터 보존을 포함한 엔터프라이즈 보호 조치가 2026년 가을에 도입된다고 문서화하고 있으며, 이는 현재로서는 이용할 수 없음을 의미합니다.
• 라이프사이클 — Claude Fable 5.1은 2027년 9월 1일 이전에는 서비스를 종료하지 않겠다는 약속을 공개한 바 있습니다. OpenAI는 GPT-6 Astra에 대해 이에 상응하는, 날짜가 명시된 약속을 공개하지 않았습니다.

하나의 키 뒤에서 둘 다 실행
두 요금표가 대표 수치상 동일하기 때문에, 팀에 실제로 비용을 초래하는 질문은 어느 모델이 더 저렴한가가 아니라 마음을 바꾸는 데 얼마나 비용이 드는가입니다. 두 모델 모두 OrcaRouter에서 공급업체 자체 정가로 제공됩니다 — openai/gpt-6-astra는 입력 $10.00, 출력 $50.00이며 272K 롱컨텍스트 티어가 OpenAI가 정의한 그대로 적용되고, anthropic/claude-fable-5.1은 $10.00 및 $50.00이고 캐시 읽기는 $0.25이며 — 모든 요금이 0% 마크업으로 전달되어, 따라서 공급업체 가격 변경이 청구 마이그레이션을 기다릴 필요 없이 같은 날 동일한 키에 바로 반영됩니다.
이는 대부분의 조합보다 이 조합에서 더 중요합니다. 증거에 따르면 정답은 하나를 고르는 것이 아니라 나누는 것이기 때문입니다. 여기서는 두 엔드포인트 모두 실제 채팅 트래픽이 발생합니다. 2026년 9월 16일까지의 7일 동안 1억 8,070만 토큰이 GPT-6 Astra로 라우팅되었고 1,990만 토큰이 Claude Fable 5.1로 라우팅되었으며, 각각에 유리한 워크로드 형태는 서로 충분히 달라서 이들 사이의 라우팅은 아키텍처 결정이라기보다 구성 변경에 가깝습니다. 라우팅 DSL은 캐시 사용이 많고 오래 실행되는 루프를 4배 더 저렴한 캐시 읽기를 위해 Claude Fable 5.1로 보내고, 짧고 대량이며 출력 효율이 높은 작업은 GPT-6 Astra로 보낼 수 있습니다. 또한 단일 답변만으로는 행동하기에 충분하지 않을 때 모델 융합을 통해 두 모델을 동일한 어려운 문제에 투입할 수 있습니다. 자동 페일오버는 한 경로의 속도 제한이 중단이 아니라 라우팅 이벤트가 된다는 뜻이며, 이 덕분에 최신 프런티어 모델의 검증되지 않은 쪽을 프로덕션 경로에서 시도하는 것이 합리적입니다.
누가 어떤 것을 골라야 하나요
를 선택하세요GPT-6 Astra작업이 장기적이고 엔드투엔드 방식이라면 — 여러 단계를 실행하고 컨텍스트보다 출력 토큰에서 비용이 더 많이 드는 에이전트형 코딩, 터미널 자동화, 리서치 또는 컴퓨터 사용 작업 — 독립적 증거에 따르면, 이 모델은 동일한 평가를 약 3분의 1의 출력 토큰으로 완료하고 완료된 작업당 약 57% 더 저렴한 수준에 이르며, 공급업체와 독립 측정 모두에서 Terminal-Bench 4.0을 앞섭니다. 예산은 토큰당이 아니라 작업당 기준으로 책정하고, 272,000 입력 토큰을 엄격한 경계로 취급하세요. 이를 넘으면 이 모델에 대한 요청은 공급업체 자체 규칙에 따라 요청 전체에 대해 가격이 다시 책정됩니다.
선택하십시오Claude Fable 5.1워크로드가 많은 턴에 걸쳐 크고 안정적인 접두부—긴 시스템 프롬프트, 리포지토리, 문서 집합—를 다시 읽는다면, 4배 더 저렴한 캐시 읽기가 그 모든 턴마다 복리로 누적되기 때문이며, 위의 계산은 그것이 $5.70 작업을 $1.95 작업으로 바꾸는 것을 보여줍니다. 또한 더 높은 측정 처리량과 더 빠른 첫 토큰을 원하거나, 추론이 Google Cloud에서 실행되어야 하거나, 날짜가 명시된 지원 종료 약속이 조달에 중요하다면 이것이 선택입니다. 이는 종합 지수와 코딩 에이전트 지수에서 GPT-6 Astra와 동등하며, Humanity's Last Exam, GDPval 및 CursorBench에서 더 강력한 벤더 보고 근거를 가지고 있습니다 — OpenAI가 비교 가능한 수치를 공개하지 않는 벤치마크이므로, 이를 입증된 승리라기보다는 증거의 공백으로 취급하십시오.
그리고 비교 페이지가 그 답이 사실일 때 당신에게 마땅히 내놓아야 하는 답은 이것이다: 많은 팀에게 정직한 권고는 둘 중 어느 쪽도 아니다. Anthropic 자체의 Claude Fable 5.1 문서에 따르면, 대부분의 워크로드에서는 Claude Opus 5로 시작하고, 더 높은 추론 노력 설정으로 Opus 5를 평가해도 여전히 부족할 때만 Fable 5.1을 선택해야 한다. Claude Opus 5는 입력 $5.00, 출력 $25.00이며, 이 두 모델 모두의 두 항목에서 절반이다. 네 배의 캐시 읽기 이점이나 세 배의 토큰 효율성이 당신의 워크로드를 설명하지 못한다면, 플래그십 프리미엄은 당신이 필요하다고 입증하지 않은 역량을 사는 것이고, 이를 알아내는 가장 저렴한 방법은 둘 중 어느 쪽에도 전념하기 전에 하나의 키로 실제 작업을 이 두 모델과 한 단계 아래 모델 모두를 통해 라우팅해 보는 것이다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
