
Claude Fable 5의 'Kettle' 유출: 서명된 사고 속에 숨겨진 내부 모델 ID — 현재까지 알려진 사실
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
8월 16일 오후 11:29:45 PDT, X에 게시한 한 연구원의 주장은 Anthropic API의 볼품없는 한 구석을 '지금까지 알려진 것' 이야기로 바꿔 놓았습니다. 그들은 모든 Claude 사고 블록에 실려 있는 서버 서명 "signature"를 해독하면, 실제로 응답한 모델을 포함한 여섯 개의 이름을 담은 필드가 나온다고 말했습니다. 그들의 해석에 따르면, 2026년 6월 9일부터 Anthropic이 토큰 100만 개당 $10/$50에 광범위하게 제공해 온 Mythos급 Claude Fable 5인 claude-fable-5로 공개적으로 표시된 응답에는 Anthropic의 공개 문서 어디에도 나타나지 않는 내부 식별자 claude-kettle-e2c95a10-v2-prod가 포함되기 시작했습니다. 응답 레이블은 아무것도 바뀌지 않았습니다. 청구, API의 최상위 모델 필드, Anthropic의 고정 스냅샷 보장 역시 바뀌지 않은 것으로 드러났습니다. 바뀐 것은 문서가 개발자에게 구문 분석하지 말라고 명시적으로 지시하는 필드에 숨겨진 문자열뿐이었습니다.
이것은 유출 보고서이지, 평결이 아닙니다. 해당 발견은 나흘 전의 것으로, 독립적으로 재현되지 않은 한 연구자의 해독에 의존하고 있으며, 그리고 Anthropic은 "Kettle" — 또는 그와 함께 있는 라벨 MYCRO_MODEL_MANATEE — 가 무엇을 가리키는지에 대해 언급하지 않았습니다. 유용한 질문은 "Anthropic이 Fable 5를 교체했는가?"가 아닙니다. 증거는 그것을 입증하지 못합니다. 유용한 질문은 공개 모델 ID 아래에 나타난 내부 모델 ID가 실제라면 무엇을 의미할지, 그리고 무엇을 의미하지 않을지입니다. 지금까지 우리가 아는 것은 다음과 같습니다.
유출이 실제로 밝혀낸 것
신호는 @chetaslua의 단일 X 게시물(상태 2089783170896179632, 2026년 8월 16일 게시)이며, 이 게시물은 해당 계정의 평소 스타일인 "증거 먼저" 방식으로 작성되었습니다. 그 주장을 간단히 요약하면 다음과 같습니다.
Claude의 thinking 블록은 서명 필드에 서버 서명 protobuf를 담고 있습니다.
• 연구자에 따르면, 그 protobuf의 여섯 번째 필드는 실제로 응답을 생성한 모델의 식별자를 담고 있습니다.
• 8월 16일 오후 11:29:45 PDT부터 시작하여, 샘플링된 서명 2,582개 중 2,582개가 동일한 값을 가졌습니다: claude-kettle-e2c95a10-v2-prod.
• 두 번째 내부 라벨인 MYCRO_MODEL_MANATEE도 동일한 메타데이터에 나타났습니다.
“2,582 of 2,582”라는 수치는 수사적 역할을 한다. 즉, 이것은 연구자가 이 사건이 일회성이거나 A/B 테스트의 일부가 아니라 그 식별자가 가리키는 대상의 전면적인 전환임을 보여주는 증거라는 뜻이다. 그 게시물에 포함되지 않은 것은 디코딩의 방법, 즉 원본 서명도, 디코딩 스크립트도, 추론된 protobuf 스키마도, 전체 응답 메타데이터도 없다는 점이다. 공개된 증거는 요약 그래픽뿐이다. 그 때문에 이 발견은 그럴듯하면서도 동시에 현재로서는 검증이 불가능하다.

왜 서명에 '여섯 번째 필드'가 있는 건가요?
Claude가 반환하는 모든 thinking 블록에는 signature 필드가 포함됩니다. Anthropic의 thinking 문서에 따르면, 해당 signature는 "전체 추론의 암호화된 사본"으로, 다중 턴 및 도구 사용 대화에서 변경 없이 그대로 다시 전달해야 하며, API는 이를 "thinking 블록이 Claude에 의해 생성되었는지 확인"하는 데 사용합니다. Claude Fable 5에서 기본 동작은 signature를 유일하게 보이는 흔적으로 만듭니다. display가 "omitted"로 설정된 경우 — Fable 5, Mythos 5, Opus 5, Sonnet 5의 기본값 — thinking 블록은 빈 thinking 필드와 signature만 채워진 채 반환됩니다.
그런 다음 문서는 이 필드를 기반으로 구축된 모든 누출에 중요한 문장을 덧붙인다: "서명 필드는 불투명하다. 해석하거나 파싱하지 마라." Kettle의 주장은 바로 그것을 파싱하는 것이다. 그것은 그 주장이 틀렸다는 증거가 아니다 — 서명은 Anthropic 자체 서빙 스택이 기계 판독할 수 있어야 하기 때문이다 — 그러나 이는 디코딩이 공급업체의 명시적 지시에 반하여, 문서화되지 않은 프로토콜을 대상으로 수행되었으며, 연구자가 그 프로토콜을 재구성한 내용은 공개되지 않았음을 의미한다. "여섯 번째 필드는 서빙 모델을 의미한다"는 전제 위에 세워진 모든 추론은 그 불확실성을 물려받는다.
그것이 증명하지 못하는 것
증거가 실제로 무엇인지부터 시작합시다. 공개적으로 claude-fable-5로 라벨이 붙은 응답에는 이전에 보고되지 않은 내부 식별자가 포함되어 있었습니다. 그게 전부입니다. 식별자만으로는 Anthropic이 Fable 5의 가중치를 교체했다거나, 더 유능한 후속 모델이 존재한다거나, 응답이 좋아졌거나 나빠졌다거나, 어떤 요청이 더 작은 모델로 라우팅되었다는 것을 입증하지 못합니다. "Kettle"은 동일한 Fable 5 스냅샷의 내부 서빙 배포 이름일 수도 있고, 라우터 구성 요소의 이름일 수도 있으며, 안전 스택의 분류기일 수도 있습니다. 코드명만으로는 이들을 구분할 수 없습니다.
Anthropic의 자체 버전 관리 정책은 왜 이번 유출이 아무것도 변하지 않은 것과 양립하는지 설명합니다. "Model IDs and versioning" 문서에는 두 가지 진술이 나란히 있습니다.
Anthropic은 기존 모델 ID의 가중치나 구성을 업데이트하지 않습니다. 업데이트된 버전이 제공되면 새 모델 ID로 출시됩니다.
모델 가중치는 주어진 ID에 대해 고정되어 있지만, 모델을 둘러싼 서빙 인프라는 시간이 지남에 따라 변경될 수 있습니다. 이 인프라에는 요청 라우터, 안전 분류기, 샘플링 로직과 같은 구성 요소가 포함됩니다.

그 두 번째 문장이 "Kettle은 스캔들이다"와 "Kettle은 평범한 월요일이다" 사이의 개념적 간극의 전부다. 문서들은 심지어 동작 변화를 예상한다: "때때로 인프라 업데이트는 모델 ID와 가중치가 변경되지 않았더라도 관찰 가능한 동작에서 사소한 차이를 만들어낸다." Kettle이라는 이름의 새 라우터 또는 서빙 배포는 그 문장 안에 정확히 들어맞을 것이다. 그 유출이 진정으로 치명적이려면, 정책에도 불구하고 ID 뒤에 새 모델이 있음을 보여주거나, 아래의 가시성 규칙을 위반한 메커니즘을 보여줘야 할 것이다.
문서화된 폴백 라우팅은 Fable 5가 이미 가지고 있습니다.
Claude Fable 5에는 이미 실제로 작동하고 문서화되어 있으며 가시적으로 드러나도록 의도된 모델 전환 메커니즘이 포함되어 있습니다. 안전 분류기는 요청을 검사하여 일부 요청 — Anthropic은 공격적 사이버 보안, 이중 용도 생물학, 모델 증류, 일부 최첨단 칩 개발 작업을 언급 — 을 Claude Opus 5 모델로 라우팅할 수 있습니다. 소비자 대상 인터페이스에서 이 대체(fallback)는 눈에 띄게 표시되어야 합니다: 공지, 답변에 표시된 서빙 모델 이름, 그리고 Opus로 전환되는 모델 선택기가 그것입니다. API에서 응답은 최상위 model 필드와 전용 대체 콘텐츠 블록을 통해 서빙 모델을 노출합니다.
Kettle 주장은 다른 무언가를 설명하며, 그 차이가 바로 중요할 부분입니다: 공개 Fable 5 라벨을 유지한 응답 아래에 나타나는 내부 식별자입니다. 연구원의 게시물에는 폴백 공지, 변경된 API 모델 필드, 또는 폴백 블록이 표시되지 않습니다 — 만약 그랬다면, 그 이야기는 "문서화된 폴백이 작동했다"였을 것이지 "Anthropic이 조용히 라우팅하고 있다"가 아니었을 것입니다. 그것이 없다면, 그 유출은 어떤 가시성 보장이 위반되었음을 보여주지 못했습니다. 왜냐하면 그것이 Kettle이 무엇인지 보여주지 않았기 때문입니다.
변한 게 없어도 왜 중요한가
고정 모델 ID는 신뢰 메커니즘입니다. Anthropic의 문서는 "API 요청에서 모델 ID를 사용하면 해당 ID의 수명 기간 동안 기본 모델이 일정하게 유지된다"고 약속합니다 — 이것이 팀이 claude-fable-5를 기준으로 벤치마킹하고 그 결과가 다음 분기에도 의미가 있으리라고 기대할 수 있는 바로 그 이유입니다. 그 ID 아래에 숨어 있는 식별자는, 그것이 무엇이든 간에, 보장이 가중치와 구성에만 적용되며 요청에서 토큰까지의 전체 경로에는 적용되지 않는다는 사실을 상기시켜 줍니다. 공개된 ID 아래에서 공개 없이 진정으로 다른 모델이 실행된 적이 있다면, 해당 ID에 연결된 모든 평가, 모든 비용 예측, 모든 품질 회귀 테스트는 조용히 무효화될 것입니다.
청구 측면에서 보면 더 예리해진다. Claude Fable 5는 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러이다 — Anthropic이 공개한 최고 요율이다. 제공되는 모델이 청구된 ID와 다른 적이 있다면, 어떤 요율이 적용되고 누가 결정하는지가 문제가 된다. 그 유출은 그러한 일이 있었다는 증거를 제시하지 않는다. 요점은 서명 필드가 그런 징후를 가장 먼저 찾아볼 곳이라는 것뿐이다.
시점도 주목할 만하다. 이는 9일 만에 나온 세 번째 Anthropic 신호다. 8월 7일, 회사는 Fable 5의 생물학 분류기를 재훈련했으며 내부 테스트에서 생물학 관련 폴백(fallback)을 약 85% 줄였다고 발표했다. 8월 14일에는 Responsible Scaling Policy Risk Report에서 아직 출시되지 않은 내부 'Model 2'의 존재를 인정했는데, Anthropic은 이를 Claude Mythos 5보다 "눈에 띄게 개선된 것"이라고 부르며 출시할 계획이 없다고 밝혔다. 둘 다 공급업체의 발표이지만, 함께 보면 Anthropic이 claude-fable-5 ID를 고정한 채 Claude Fable 5 주변 시스템을 적극적으로 변경하고 있음을 보여준다 — 7일에는 분류기, 14일에는 인정된 내부 후속 모델이다. Kettle도 공개가 없다는 점만 빼면 같은 형태의 이야기가 될 것이다.
그것에 대해 어떻게 해야 할까요
API 호출자에게 실용적인 입장은 지루하면서도 정확합니다. 단일 식별자는 스왑의 증거가 아니며, 유출에서 아직 취할 수 있는 조치는 없습니다. 여러분이 할 수 있는 것은 직접 증거를 만드는 것입니다. 실제로 수신한 응답에서 최상위 모델 필드와 모든 폴백 블록을 기록하고, 고정된 워크로드에서 토큰 및 비용 델타를 주시하세요. 문서화된 폴백이 발생하면 정확히 그 지점에서 확인할 수 있습니다. 그것이 여러분의 워크로드에 유일하게 중요한 테스트이며, 누군가 Anthropic의 서명 형식을 해독할 필요가 없습니다.
OrcaRouter를 통해 Claude Fable 5로 라우팅하는 경우, Anthropic이 반환하는 것과 동일한 응답 형태가 반환됩니다. 공급업체의 정가를 마크업 없이 그대로 통과시키므로 조정할 두 번째 가격 세트가 없습니다. — Anthropic이 Fable 5의 요율을 변경하면 새 숫자는 같은 날 저희 쪽에서도 바로 반영됩니다. 이와 같이 검증되지 않은 상황에서, 소문에 프로덕션 경로를 걸지 않고 모델을 계속 사용하는 저위험 방법은 실제 트래픽의 일부를 Claude Fable 5로 라우팅하되, 입증된 폴백(Claude Opus 5, 백만 토큰당 $5/$25, 또는 더 저렴한 코딩 티어 모델)으로 자동 장애 조치되도록 하는 것입니다. 이렇게 하면 품질 회귀가 장애가 아닌 라우팅 결정이 됩니다. 동일한 키, 별도의 계약 없음, 그리고 장애 조치는 재작성이 아니라 라우팅 DSL 변경일 뿐입니다.

우리가 보고 있는 것
Anthropic이 논평할지 여부. 가장 깔끔한 해결책은 Kettle과 Manatee가 무엇인지 한 줄로 인정하는 것이다. 침묵 그 자체도 정보를 제공한다.
• 독립적인 재현. 누군가 원시 서명, 디코딩 방법, 그리고 추론된 protobuf 스키마를 게시한다면, 이는 한 사람의 그래픽에서 검증 가능한 주장으로 바뀔 것입니다. 그때까지는 이것은 발견이 아니라 현재까지 알려진 사실일 뿐입니다.
가시성 표면. claude-fable-5 응답에 폴백 공지, 변경된 API 모델 필드 또는 폴백 블록이 나타나기 시작하면 '문서화된 폴백' 해석이 더 유력해진다. 그렇지 않으면 '문서화되지 않은 경로' 해석이 유력해진다.
• 새로운 모델 ID. Anthropic의 버전 정책에 따르면 진정한 새 버전은 새 ID로 출시됩니다. 따라서 Kettle이 진짜 후속작임을 가장 확실하게 확인하는 방법은 Anthropic이 무언가를 출시하는 것입니다 — 즉, 기존 모델을 그대로 대체하는 것이 아니라요. claude-fable-5.1이나 유사한 모델을 주목하세요.
• "Manatee"가 설명되는지 여부. 두 번째 라벨은 아직 아무도 건드리지 않은 실마리다.
자주 묻는 질문
Anthropic이 실제로 Claude Fable 5를 다른 모델로 라우팅하고 있나요?
입증되지 않았다. 유출 자료는 claude-fable-5로 표시된 응답이 서명된 thinking 시그니처에 claude-kettle-e2c95a10-v2-prod라는 내부 식별자를 포함했음을 보여줄 뿐이다. 가중치가 변경되었거나 후속 모델이 배포되었거나 어떤 요청이 다운그레이드되었음을 보여주지는 않는다. "Kettle"은 동일한 Fable 5 스냅샷을 위한 내부 서빙 배포의 이름일 수도 있다.
Kettle 식별자는 어떻게 발견되었나요?
Researcher @chetaslua는 Claude의 thinking 블록 서명 필드 안에 있는 protobuf를 디코딩했고, 필드 6에서 모델 식별자를 읽었다고 말한다. Anthropic의 문서는 그 서명을 "불투명하다"고 부르며 개발자들이 그것을 파싱하지 말라고 안내한다. 그리고 연구자의 디코딩 방법은 아직 공개되지 않았으므로, 그 주장은 아직 독립적으로 재현할 수 없다.
이것이 Anthropic의 고정 모델 보장을 위반합니까?
알 수 없음. Anthropic의 버전 관리 문서에 따르면 기존 모델 ID의 가중치나 구성은 절대 업데이트하지 않으며, 새 버전은 새 ID로 출시된다고 합니다. 그러나 문서에서는 모델 주변의 서빙 인프라(요청 라우터, 안전 분류기, 샘플링 로직)가 변경되는 것은 명시적으로 허용합니다. Kettle 식별자는 정확히 그런 종류의 변경일 수 있으며, 이는 보장을 위반하지 않을 것입니다.
모델이 나를 위해 바뀌었다는 걸 어떻게 알 수 있을까요?
API 응답의 최상위 model 필드를 확인하고, 폴백 콘텐츠 블록을 찾아보며, 고정 워크로드에서 토큰 및 비용 델타를 추적하세요. Anthropic의 문서화된 폴백은 해당 위치에 표시되도록 설계되었습니다. Kettle 식별자를 노출하는 공개 API 필드는 없습니다.
솔직한 해석은, 유출이 무언가의 이름을 밝혀냈을 뿐 그것이 무엇인지 증명하지는 못했다는 것이다. Kettle 식별자는 유출된 문자열이 실재할 수 있는 유일한 의미에서 실재한다. 즉, 한 연구자가 8월 16일 밤부터 2,582회 중 2,582회 모두 그것이 존재한다고 말한다. 그것이 가리키는 대상, 즉 새 모델, 이름이 변경된 배포, 라우터 구성 요소, 분류기 등은 여전히 검증되지 않았으며, Anthropic의 자체 문서는 이 모든 것에 대해 지극히 평범한 설명을 제공한다. 이것이 이 글의 가치이자 한계다. 원본 시그니처가 공개되거나 Anthropic이 Kettle이 무엇인지 밝히기 전까지, 올바른 자세는 이를 '현재까지 알려진 것'으로 취급하는 것이다. 즉, 주목할 가치가 있고, 자신의 트래픽을 기록할 가치가 있으며, 모델 선택을 바꿀 만큼의 가치는 없다는 것이다. 특히 라우팅 계층이 어느 쪽이든 선택지를 열어둘 수 있게 해줄 때는 더욱 그렇다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
