Claude Fable 5의 생물학 안전장치 업데이트를 위한 히어로 타이틀 카드로, '안전장치 업데이트 · 2026년 8월 7일' 배지, 'Claude Fable 5가 마침내 생물학에 대해 말할 수 있다'는 헤드라인, 'Anthropic의 안전장치 업데이트는 생물학 폴백을 약 85% 줄입니다'라는 부제, 그리고 플랫 라인 실험실 플라스크 아이콘을 보여줍니다.
Guides & Insights

Claude Fable 5, 드디어 생물학을 말할 수 있다: Anthropic, 오탐지 폴백 85% 감소

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

6월 9일 출시 이후, Claude Fable 5는 회사가 제공하는 모델 중 가장 뛰어난 모델이며, 사용자의 질문을 더 약한 모델로 넘길 가능성이 가장 높은 모델입니다. 출시 당시 생물학 안전장치가 너무 광범위해서 세포막을 설명하거나, 미토콘드리아를 묘사하거나, 검사 결과를 해석하라는 요청이 조용히 생물학적 능력이 부족한 모델로 우회되곤 했습니다. 8월 7일, 회사는 그러한 안전장치를 업데이트했고, 회사 자체 테스트에서 생물학 관련 폴백은 제품 전반에 걸쳐 약 85% 감소했습니다.

이것은 두 달 동안 운영되어 온 모델의 개선으로, 출시가 아닙니다. 그러나 6월에 Anthropic이 전 세계에서 모델을 철수하도록 만든 수출 통제 사건 이후 Fable 5가 겪은 가장 큰 동작 변경입니다. 다음은 실제로 변경된 사항, Anthropic이 발표한 수치, 잠금 상태로 유지된 사항, 그리고 API를 통해 모델을 호출하는 개발자에게 이 업데이트가 의미하는 바입니다.

실제로 무엇이 바뀌었나

Fable 5의 생물학 안전장치는 안전 분류기에 기반해 작동합니다. 안전 분류기는 모델 앞에 위치해 요청이 '보호 대상' 생물학 작업인지 판단하는 소형 AI 시스템입니다. 분류기가 작동하면 요청은 재라우팅됩니다. Anthropic의 발표에 따르면 "모델이 사용자의 요청을 Claude Opus 5로 재라우팅합니다" — 즉, 생물학적 역량이 낮은 모델로 보내는 것입니다. 출시 당시 Anthropic은 이중 용도 영역에서의 실수가 치명적일 수 있기 때문에, 오탐이 쏟아지는 것을 알면서도 의도적으로 거의 모든 생물학 질의를 차단했습니다.

이번 업데이트는 미세 조정이 아니라 재학습이었다. Anthropic에 따르면 지난 수 주 동안 분류기의 '헌법'—보호 대상 생물학과 허용 대상 생물학을 구분하는 규칙—을 다시 작성해 무해한 용도를 상세히 규정했고, 내부 및 외부 전문가의 피드백을 받았으며, 그 헌법을 바탕으로 새로운 훈련 데이터를 구축하고 분류기를 재학습시킨 다음, 유해하거나 이중 용도로 쓰일 수 있는 콘텐츠에는 여전히 반응하면서 더 많은 무해한 용도는 통과시키는지 재검증했다. Anthropic의 설명에 따르면 실질적인 효과는 분류기의 결정 경계가 이동했다는 점이다. 정당한 요청을 과도하게 차단하던 '안전 마진'이 줄어든 것이다.

숫자들 — 그리고 그것들이 다르게 떨어지는 곳

Anthropic은 자체 테스트에서 생물학 관련 폴백(fallback)이 85% 감소했다고 보고합니다. 폴백은 덜 유능한 모델로 안내하기 때문에, 이는 요청이 Fable 5가 답변할 수 있었던 것보다 약한 결과로 돌아오는 빈도가 줄어들었음을 의미하기도 합니다. 이 수치는 공급업체가 보고한 것으로, Anthropic이 자체 플랫폼에서 측정한 결과이며 독립적인 감사는 없습니다.

Scoreboard card contrasting Claude Fable 5's biology safeguards before and after the August 7, 2026 update: before, everyday health and education questions often fell back, biology-related fallbacks were the baseline with nearly all biology blocked, Claude.ai/Claude Code/API fallbacks at baseline, and all dual-use research blocked; after, everyday questions are mostly answered by Fable 5, biology fallbacks are ~85% fewer, Claude.ai total fallbacks ~67% fewer, Claude Code ~17% fewer, API ~7% fewer, and virology, toxicology, and molecular design still fall back. Footer: 'Fallback reductions per Anthropic's internal testing, announced Aug 7, 2026.'

감소폭은 고르지 않습니다. Anthropic은 생물학 또는 기타 어떤 이유로든 총 폴백(fallback)이 Claude.ai에서 약 67%, Claude Cowork에서 55%, Claude Code에서 17%, 그리고 API인 Claude Platform에서 단 7%로 감소할 것으로 예상합니다. API 수치가 가장 작은 데는 분명히 밝혀야 할 이유가 있습니다. 대부분의 API 트래픽은 생물학이 아니므로, 분류기의 생물학 오탐지(false positive)가 전체에서 차지하는 비중이 더 작았기 때문입니다. Claude Code 사용자에게 17%라는 수치는 핵심입니다. 작업공간 맥락의 생물의학 용어는 오탐지를 유발하는 요인으로 문서화되어 있으며, Claude Code 저장소의 GitHub 이슈(#76620 및 #81074)에서는 무해한 건강 말뭉치 프로젝트가 더 제한적인 모델로 에스컬레이션된 사례를 설명하고 있습니다.

구체적으로 무엇이 열렸느냐 하면: 일상적인 건강·교육 질문 — 검사 결과 해석, 증상 이해, 생물학 학습 — 이제 대부분 Fable 5 자체가 답변하며, Anthropic은 의료 전문가들이 임상 업무에서 더 많은 지원을 받는다고 말한다. 바로 이런 범주들이 출시 당시 Fable 5를 농담거리로 만든 바로 그것이었다: 생물학은 전부 알면서 프리온 설명은 거부하던 모델.

아직 잠긴 것은 무엇인가요?

이번 완화에는 분명한 한계가 있다. Anthropic은 Fable 5가 "바이러스학, 독성학, 분자 설계를 포함하여 이중 용도로 간주하는 요청에 대해서는 여전히 Claude Opus 5로 대체된다"고 말한다. 따라서 이 모델은 전문 생물학 연구나 신약 개발에는 여전히 사용할 수 없으며, Anthropic은 검증된 연구자들을 위해 "신뢰할 수 있는 접근 경로를 통해 그 격차를 해소하겠다"고 약속하고 있지만, 시간표는 제시하지 않았다.

Anthropic은 또한 분류기의 안전 마진 안에 속하는 요청, 즉 위험도는 매우 낮지만 여전히 플래그가 지정되는 요청에 대해 잔여 오탐(false positive)이 남아 있을 것임을 인정합니다. 회사는 지속적인 피드백을 요청하고 있습니다. 다시 말해, 이번 수정은 실질적인 효과가 있지만 명시적으로 완전하지는 않습니다.

애초에 가드레일이 존재하는 이유

이런 경계심은 능력에서 비롯됩니다. Anthropic은 Fable 5가 "이제 일부 매우 복잡한 생물학적 작업에서 전문가를 능가할 수 있다"고 말하며, 자체 능력 평가에서는 이 모델이 생물학적 무기를 개발하는 악의적 행위자에게 "상당한 향상을 제공할 수 있다"고 결론 내렸습니다. — "다른 어디에서도 찾을 수 없는" 향상입니다. 이 회사는 이 분야의 이중 용도적 특성과, 합성 생물학과 유전체 편집을 새로운 생물학적 위협의 잠재적 원천으로 지목하는 미국 정보 공동체의 2026 연례 위협 평가를 인용합니다.

이러한 맥락은 Fable 5의 짧은 수명 중 가장 험난했던 2주를 설명해 주기도 한다. 6월 12일, 출시 사흘 만에 미국 상무부 산업안보국은 Anthropic에 외국 국적자를 대상으로 한 Fable 5 접근을 중단하라고 명령했다. Anthropic은 이 지시를 선택적으로 적용할 수 없었기에 모든 사용자에 대해 모델을 비활성화할 수밖에 없었다. 통제가 해제된 후 7월 1일에 전 세계적으로 접근이 복구되었으며, Anthropic은 해당 명령을 촉발한 특정 탈옥(jailbreak) 기법을 겨냥한 새 분류기를 출시했다. 8월 7일 업데이트는 같은 이야기의 제2막이다. 최대한의 경계 속에서 안전 태세를 갖추었던 모델이 이제 조금씩 재조정되고 있는 것이다.

이것이 API 개발자에게 의미하는 바

API를 통해 Fable 5를 호출하는 경우, 이번 업데이트는 주로 어떤 요청이 분류기에 도달하는지를 변경합니다. 그러나 거부 규약은 완벽히 숙지할 가치가 있습니다. 출시 이후 줄곧 조용한 혼란의 원인이 되어 왔기 때문입니다.

분류기가 요청을 차단하면 API는 stop_reason "refusal"과 함께 200을 반환하며, stop_details 객체의 category는 "bio", "cyber" 또는 "reasoning_extraction"입니다. stop_reason에 따라 분기하고 메시지 내용에 의존하지 마십시오. stop_details는 정보용이며 null일 수 있습니다. 또한 이 처리를 더 저렴하게 만드는 청구 세부 사항이 있습니다. 직접 분류기 차단은 무료입니다. 출력 토큰이 반환되기 전에 요청이 차단되면 입력 토큰은 청구되지 않으며, 이는 Anthropic에 따르면 모든 프로덕션 모델에 자동 적용됩니다.

폴백 요청은 다르게 청구됩니다. 일반적으로 대화 중 모델을 전환하면 새 모델의 입력 토큰이 캐시 쓰기로 청구됩니다 — 5분 TTL에서는 기본 입력 요금의 1.25배, 60분 TTL에서는 2배입니다. 반면 Anthropic은 폴백 입력 토큰을 캐시 읽기로 청구하며, 이는 기본 입력 가격의 10%입니다. 네이티브 Claude API와 AWS의 Claude Platform에서는 서버 측 폴백 매개변수가 이를 자동으로 적용합니다. 클라이언트 측에서는 stop_details의 fallback_credit_token을 사용하여 5분 이내에 캐시 읽기 요금으로 폴백 모델에 요청을 재시도할 수 있습니다. Anthropic SDK에는 이 기능을 연결해 주는 거부-폴백 미들웨어가 포함되어 있습니다.

폴백 대상에 관한 한 가지 참고 사항입니다. 현재 생태계가 이에 대해 의견이 분분하기 때문입니다. Anthropic의 발표는 재라우팅 대상을 Claude Opus 5로 명명하는 반면, Artificial Analysis는 여전히 해당 구성을 "Opus 4.8 fallback"으로 표기하고 있으며, Claude 플랫폼의 폴백 문서는 Claude Opus 4.8을 참조하고 있습니다. 어느 쪽이든 원칙은 동일합니다. 즉, 거부된 요청은 생물학적 능력이 더 낮은 모델로 전달됩니다. 그러나 폴백 모델의 정체성을 기준으로 구축하는 경우, 액세스 경로에 대한 문서를 통해 이를 확인하세요. 호출하는 표면이 다를 수 있기 때문입니다.

Screenshot of the Artificial Analysis model page for Claude Fable 5, listing the model as 'Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)' with an Intelligence Index of 62, an output speed of 68.1 tokens per second, and $10.00 input / $50.00 output pricing per million tokens.

두 번째 폴백 스위치를 받습니다.

이 이야기에서 대부분의 보도가 놓치는 부분은 폴백 결정을 Anthropic의 분류기와 독립적으로 스스로 내릴 수 있다는 점입니다. Anthropic은 요청이 재라우팅할 만큼 위험하다고 판단할 때를 결정하지만, 모델을 전환해야 할 전혀 다른 이유가 있을 수 있습니다 — 비용, 지연 시간, 동의할 수 없는 거부, 속도 제한 등이 그 예입니다.

Screenshot of the OrcaRouter model page for Claude Fable 5, showing the model ID anthropic/claude-fable-5, a Featured badge, $10.00 input / $50.00 output per million tokens, a 1,000,000-token context window, TTFT statistics, and an OpenAI-compatible code sample pointing at api.orcarouter.ai.

OrcaRouter는 Claude Fable 5를 Anthropic의 공식 가격 그대로, 마크업 없이 라우팅합니다 — 입력 토큰 100만 개당 $10, 출력 100만 개당 $50, 캐시 읽기 $1, 캐시 쓰기 $12.50, 모든 비용이 그대로 전가되며 — 추가로 자체 장애 조치 체인을 제공합니다. Fable 5 호출이 거부되거나, 시간 초과되거나, 오류가 발생하면 요청이 다음에 갈 곳을 직접 결정할 수 있습니다: 재시도, 다른 추론 모델, 또는 더 저렴한 일반 모델 중에서 선택하는 방식으로, 벤더의 기본 동작을 따르는 대신 말입니다. 이는 Anthropic의 생물학 분류기와 독립적인 제어 수단이며, 대부분의 팀이 실제로 사용하는 에스컬레이션 패턴과도 자연스럽게 결합됩니다 — 일상적인 작업은 저렴한 모델로 라우팅하고, 어렵고 중대한 호출은 Fable 5로 에스컬레이션하며, 이 모든 것을 200개 이상의 모델을 지원하는 단일 API로 처리합니다.

요점

일상적인 건강 및 교육 용도로는 8월 7일 업데이트가 확실한 개선이다. Anthropic의 플래그십 모델에서 가장 비판받던 동작이 실질적으로 줄었고, 회사는 분위기 대신 수치를 공개했다. 바이러스학, 독성학, 분자 설계 연구자들에게는 아직 바뀐 것이 없다. 그런 요청은 여전히 폴백되며, "신뢰할 수 있는 접근 경로"는 여전히 날짜가 없는 약속에 불과하다. 개발자에게 중요한 교훈은 거부 계약을 API의 일부로 취급하는 것이다. stop_reason "refusal"을 명시적으로 처리하고, 차단된 요청은 무료이며 폴백은 캐시 읽기로 청구된다는 점을 인지하며, 통제할 수 있는 장애 조치 체인을 유지하여 보이지 않는 분류기가 가용성을 결정하지 못하게 하라.

자주 묻는 질문

Claude Fable 5가 여전히 제 생물학 질문을 거부할까요?

도메인에 따라 다릅니다. 일상적인 건강 및 교육 질문(검사 결과 해석, 증상 이해, 생물학 학습)은 지금 대부분 Fable 5가 답변합니다. Anthropic이 이중 용도로 분류하는 요청(바이러스학, 독성학, 분자 설계)은 여전히 생물학적 능력이 떨어지는 모델로 폴백되며, 전문 연구나 신약 개발 작업은 계속 차단되어 있습니다.

Claude Fable 5가 내 요청을 차단하거나 폴백할 때 비용이 청구되나요?

직접 분류기 차단은 무료입니다: 출력 토큰이 반환되기 전에 요청이 차단되면 입력 토큰은 청구되지 않습니다. 요청이 더 약한 모델로 폴백되는 경우, 폴백 입력 토큰은 Anthropic의 플랫폼 문서에 따라 캐시 쓰기가 아닌 캐시 읽기(기본 입력 가격의 10%)로 청구됩니다.

폴백 모델이 Claude Opus 5로 변경되었나요?

Anthropic의 발표는 재라우팅 대상으로 Claude Opus 5를 지목하는 반면, Artificial Analysis는 해당 구성을 여전히 "Opus 4.8 fallback"으로 표시하고 플랫폼 폴백 문서는 Claude Opus 4.8을 참조한다. 본인의 액세스 경로에 대한 문서를 통해 확인하라. 원칙 — 거부된 요청은 생물학적 능력이 낮은 모델로 떨어진다는 것 — 은 어느 쪽이든 동일하다.

Anthropic 대신 제가 직접 폴백을 선택할 수 있나요?

네. OrcaRouter를 통해 Claude Fable 5용 자체 장애 조치 체인을 정의할 수 있습니다. 거부, 시간 초과 또는 오류 발생 시 재시도, 더 저렴한 모델, 또는 다른 추론 모델로 라우팅할 수 있으며, 이는 Anthropic의 분류기와 독립적입니다. Fable 5는 Anthropic의 공시 가격에 마크업 없이 제공됩니다(토큰 100만 개당 $10/$50).

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube