'Claude Opus 5.5와 수박 테스트'라는 제목이 붙은 히어로 타이틀 카드, '지금까지 가장 읽기 쉬운 Claude — 그런데도 여전히 핵심을 묻어버린다'라는 부제, Flesch-Kincaid 6.95, Reading Ease 68.4, 2026년 9월 22일이라고 적힌 세 개의 배지, 그리고 오른쪽 아래 모서리에 OrcaRouter 로고.
Guides & Insights

Claude Opus 5.5와 수박 테스트: Anthropic은 문체를 고쳤지만, 핵심은 여전히 묻혀 있다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

출시 주간을 지나 가장 멀리까지 퍼져 나간 샘플 중 하나는 수박에 관한 단편 소설이었습니다. 몇백 단어 분량에, 붙은 벤치마크도 그래프도 없이 — 그저 모델에게 작은 글 하나를 써보라고 시켰고, 그 모델이 그것을 대체로 제대로 해낸 결과였습니다. 플래그십 릴리스의 한가운데에 자리하기에는 이상한 결과물이지만, 이것은 벤더가 Claude Opus 5.5를 2026년 9월 22일에 출시하면서 무엇을 앞세우기로 했는지를 가리킵니다: Terminal-Bench의 또 하나의 점수가 아니라 산문입니다. 회사 측의 설명은 이 모델이 "Claudish"를 덜 쓴다는 것입니다 — Claude Opus 5가 불만을 샀고 Claude Fable 5.1, GPT-6 AstraGPT-5.6 Sol이 이후 각각 비교 측정 대상이 되어 온, 정형적이고 완곡을 남발하며 서두를 늘어놓는 문체를 가리키는 회사 자체의 말입니다. 따라서 답할 가치가 있는 질문은 그 데모가 매력적이었는지가 아닙니다. 산문이 측정 가능하게 개선되었는지, 얼마나 개선되었는지, 그리고 여전히 어디에서 실패하는지입니다.

Anthropic이 수정했다고 말하는 것

Screenshot of Anthropic's Claude Platform release-notes page, showing the Claude Opus 5.5 entry dated September 22, 2026, with the model ID claude-opus-5-5, a 1M-token context window and 128K maximum output.

Anthropic의 주장은 검증할 수 있을 만큼 구체적이다. Opus 5.5는 가장 중요한 정보를 먼저 배치하고, 전문용어를 덜 사용하며, 이전 Opus 모델보다 사용자가 명시한 작성 규칙을 더 잘 따른다고 한다. 뒷받침 자료는 공급업체가 보고한 것이며 재현되지 않았다: Anthropic이 말하는 내부 팩트체킹 테스트에서 18회 시도 중 16회를 통과했고, 18회 중 0회를 통과한 두 모델은 Claude Fable 5.1Claude Opus 5였다. 출시 자료의 고객 인용문도 같은 방향을 가리킨다 — Ramp의 John Ruelas는 출력이 "좋은 동료처럼 쓴다"고 묘사했고, Box는 자사 워크로드에서 약 40% 더 간결하다고 보고했다.

여기서는 두 가지를 분리해서 볼 필요가 있다. 첫째, "덜 클로드다운(less Claudish)" 것은 마케팅상의 발명품이 아니라 실제로 이름 붙일 수 있는 실패 모드라는 점이다. 실무자들은 4.6 이후 Opus 세대부터 압축되고 구조가 엉망인 Claude 문체에 대해 불평해 왔으며, 그 불만은 구체적이다. 너무 많은 서두, 프롬프트를 너무 많이 되풀이하는 습관, 독자가 필요로 한 시점보다 두 문단 늦게 핵심에 도달하는 습관이다. 둘째, 그것을 고쳤다는 Anthropic 자체의 수치는 바로 그것, 즉 Anthropic 자체의 수치라는 점이다. 18개 중 16개라는 수치는 독립적으로 재현된 바 없고, "40% 적은 장황함"은 고객의 내부 측정치일 뿐 공개된 방법론이 아니다.

이번 릴리스에는 글쓰기와는 무관하지만 알아 둘 만한 변경도 포함됩니다: Opus 5.5는 Claude Fable 5.1에 적용된 것과 동일한 사이버보안, 생물학, 프런티어 LLM 개발 보호장치를 갖추고 출시되는 첫 Opus 모델입니다. Anthropic에 따르면 요청이 이 중 하나에 걸리면 곧바로 거부하지 않고 해당 요청을 다른 모델로 투명하게 라우팅합니다.

Anthropic의 것이 아닌 숫자들

A single-column readability scoreboard for Claude Opus 5.5: Flesch-Kincaid grade 6.95 versus Opus 5 at 7.97; Reading Ease 68.4 versus 61.35; Fable 5.1 and GPT-6 Astra at 7.43 and 7.52 grade; GPT-5.6 Sol at 8.74 grade and 56.62 ease; ranked 4th of 5 tested as an editor; and an AA Intelligence Index of 58, first of 212 models, with a sourcing footer.

글쓰기 주장에 관한 가장 유용한 독립적 평가는 Every의 Vibe Check에서 나왔는데, 이는 동일한 프롬프트를 다섯 개 프런티어 모델에 실행하고 그 출력을 두 가지 표준 가독성 측정 도구로 채점한 것입니다. 그 프롬프트 세트에서 Claude Opus 5.5는 그룹 중 가장 읽기 쉬운 것으로 나타났으며, 그것이 대체한 모델과의 격차가 바로 핵심입니다:

• Flesch-Kincaid 학년 수준 — Claude Opus 5.5는 6.95로, Claude Opus 5의 7.97과 대비된다

• 플레시 읽기 용이도 — Opus 5.5는 68.4, Opus 5는 61.35

• Claude Fable 5.1 — 7.43 학년 수준, 66.09 읽기 용이도

• GPT-6 Astra — 7.52 학년 수준, 64.55 읽기 용이도

• GPT-5.6 Sol — 8.74 학년 수준, 56.62 읽기 용이도

두 지표를 함께 읽어 보세요. 두 지표는 서로 반대 방향으로 움직이며, 바로 그 점이 핵심입니다. 더 낮은 학년 수준과 더 높은 용이성 점수는 둘 다 더 단순한 문장을 의미합니다. Opus 5.5는 Opus 5보다 약 한 학년 낮고, Claude Fable 5.1과 GPT-6 Astra보다는 대략 반 학년 낮으며, GPT-5.6 Sol보다는 거의 두 학년 낮습니다. 쉽게 말해, 8학년이 아니라 7학년 읽기 수준입니다.

그것은 실질적인 개선이며, 동시에 범위가 좁은 개선이기도 합니다. 이것은 한 매체의 프롬프트 세트일 뿐, 고정된 작업 목록과 그 뒤를 받치는 리더보드를 갖춘 벤치마크가 아닙니다. 그것은 나아가는 방향과 대략적인 진전의 크기를 알려줍니다. Opus 5.5가 당신의 작업에서 잘 쓴다는 점을 알려주지는 않으며, Every 자체의 정성적 노트는 리뷰어도 그렇게 생각하지 않았음을 분명히 합니다.

여전히 요점을 묻어버리는 부분

가독성 수치를 산출한 바로 그 리뷰는 수정 후에도 남은 결함에 대해 거침없이 말한다. 에세이의 서두를 쓰라는 요청을 받았을 때, Opus 5.5는 리뷰어가 21문장으로 다룬 내용을 다루는 데 37~39문장이 걸렸고, 리뷰어가 여덟 단어로 제시한 논점에 꼬박 한 문단을 썼다. 리뷰어의 요약은 그 모델이 "여전히 핵심을 묻어버린다"는 것이며, 이 불만의 더 날카로운 표현은 모델이 문단에 무엇이 필요한지 정확히 진단해 놓고도 자신의 진단을 무시한 수정안을 만들어낼 수 있다는 점이다.

편집자로서는 작가로서보다 성적이 더 나빴다. 편집 작업에서 다른 모델들과 비교했을 때, Opus 5.5는 Claude Opus 5, GPT-5.6 Sol, GPT-6 Astra에 뒤처졌다. 이 모델은 어떤 문장이 앞에 왔어야 하는지를 알아보는 것보다 읽을 만한 문장을 만들어내는 일을 더 잘한다. 리뷰어의 평은 인용할 만한 한 문장으로 귀결되는데, 그것이 리뷰 전체에서 가장 유용한 부분이다. "나는 그것이 만들어내는 산문보다 협업자로서의 그것이 더 마음에 든다."

실용적인 해석은 그로부터 바로 이어집니다. 그것으로 초안을 작성하되, 높은 에포트 이상으로 작성하세요 — 낮은 에포트 설정에서 군더더기가 가장 심해집니다. 그것이 예시를 지어내게 하기보다는 직접 예시를 제공하세요. 그런 다음 핵심을 직접 맨 위로 옮기거나, 그렇게 해 줄 무언가에 초안을 넘기세요. Opus 5.5가 주는 것은 깔끔한 첫 초안에 더 빨리 도달하는 길과, 그 이후의 퇴고를 위한 진정으로 더 나은 협업자입니다. 그것은 편집자를 주지는 않습니다.

추가 단어가 치르는 대가

Screenshot of the Artificial Analysis model page for Claude Opus 5.5, showing an Intelligence Index of 58 ranked first of 212 models, a cost rank of 93 of 212 at $4.00 per million input and $20.00 per million output with a 95% cache discount and $5.98 per Index task, and a verbosity rank of 95 of 212 at 260 million output tokens against a median of 88 million.

장황함 문제에는 대부분의 글쓰기 리뷰가 건너뛰는 비용 차원이 있으며, 이는 출시 서사에 어긋난다. 공급업체 수치에 의존하지 않고 자체 평가를 수행하는 Artificial Analysis가 순위를 매기면, Claude Opus 5.5는 자사의 Intelligence Index에서 212개 모델 중 1위(점수 58)이지만, 장황함에서는 212개 중 95위로, 해당 Index 실행에서 출력 토큰 2억 6천만 개를 생성했으며 중앙값은 8,800만 개였다. Intelligence Index 과제당 평가 비용은 $5.98이었고 총 $8,708.20이었다.

그것을 Anthropic 자체의 효율성 주장과 나란히 놓아 보면, 두 주장이 분명히 일치하지는 않는다. 벤더가 보고한 입장은 Opus 5.5가 Opus 5보다 토큰을 더 적게 사용하고 출력을 30% 이상 더 빠르게 생성한다는 것이다. Artificial Analysis의 독립 실행에서는 이 모델이 동종 모델들에 비해 매우 장황하다는 점을 발견했다. 둘 다 동시에 사실일 수 있다 — 과제 구성이 다르고, 노력 설정이 다르며, "토큰을 더 적게"의 정의도 다르기 때문이다 — 하지만 누구도 출시 프레이밍을 토큰 경제성에 관한 확립된 사실로 읽어서는 안 된다. 가격 측면의 그림은 더 깔끔하다. 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로, 5달러/25달러에서 인하되었으며, Artificial Analysis 수치에서는 95% 캐시 할인이 적용된다.

출력 토큰당 비용을 지불하고 있다면, 장황한 산문은 문체 선호가 아니다. 그것은 청구 항목이다.

이미 가지고 있는 것과 비교해 실행하기

실전 부분에 들어가기 전에 솔직히 한 가지 밝히자면: Claude Opus 5.5는 저희 라우트 중 하나가 아닙니다. 저희는 이를 호스팅하지 않으며, 아래의 어떤 내용도 저희가 호스팅한다는 주장으로 해석되어서는 안 됩니다. 이 모델은 Anthropic 자체 API와 여러 서드파티 플랫폼을 통해 이용할 수 있습니다.

오늘 OrcaRouter에 올라와 있는 것은 그것이 대체한 모델과 그 위 등급의 모델입니다. Claude Opus 5는 오늘 OrcaRouter에 있고, Claude Fable 5.1도 마찬가지입니다. 둘 다 공급자의 정가에 0% 마크업이 그대로 적용된 가격으로 제공됩니다 — 즉, 공급업체의 가격 변경이 재판매업체가 처리할 때까지 기다릴 필요 없이 같은 날 우리 쪽에 반영된다는 뜻입니다. Opus 5.5의 문장력이 이전할 만한 가치가 있는지 판단하려는 중이라면, 이는 유용한 조합입니다. 두 번째 계약이나 코드 변경 없이 하나의 키로 비교를 실행할 수 있기 때문입니다. 두 모델 모두 200개 이상의 모델을 아우르는 하나의 API만큼만 떨어져 있는, 같은 엔드포인트에 있으니까요.

두 번째 모델을 루프에 두는 또 다른 이유는 이 글에서 다루는 실패 모드입니다. 요점을 묻어버리는 모델은 작업 도중에 우회하고 싶은 모델이며, 자동 장애 조치는 잘못된 생성이 중단된 파이프라인이 되지 않도록 하기 위해 바로 존재합니다. 모델을 아예 하나로만 정하고 싶지 않다면, 라우팅 DSL은 여러 모델을 단일 호출로 구성하고 모델 퓨전은 여러 모델이 함께 답하는 패널을 실행합니다 — 이는 실패가 역량이 아니라 판단에 있는 편집 작업에 합리적인 형태입니다.

누가 행동해야 하고, 누가 기다려야 하는가

Claude Opus 5에 대한 불만이 그 도입부를 다시 써야 한다는 것이었다면, Opus 5.5는 그 문제를 대략 한 학년 수준만큼 실제로 해결해 주며, 가독성 데이터는 그 개선이 분위기가 아니라 측정 가능한 것임을 보여 준다. 불만이 요점에 도달하기까지 세 문단이 걸린다는 것이었다면, 독립적인 증거 어디에도 그것이 바뀌었다고 말하는 내용은 없다. 이 둘은 서로 다른 불만인데, 출시 보도는 이를 하나로 취급해 왔다.

특히 창작 작업의 경우, 수박 이야기는 사람들이 새 모델을 가늠해 보고 싶을 때 작고 따뜻하며 부담 없는 프롬프트에 손을 뻗는다는 것 외에는 아무것도 증명하지 못한다. 그렇게 하는 것은 합리적이다. 또한 그것은 요점을 묻어버리는 경향이 가장 덜 드러나는 바로 그 상황이기도 하다. 수박 이야기를 논지 때문에 읽는 사람은 아무도 없기 때문이다. 독자가 첫 두 문장 안에서 결론을 필요로 하는 문서 앞에 모델을 세워 보라. 그러면 실제로 두 가지 문제 중 어느 쪽을 가지고 있었는지 알게 될 것이다.

다음으로 주목할 점은 이 제품군의 다음 모델 — Sonnet 5.5와 Haiku 5.5가 모두 앞으로 몇 주 안에 나올 것으로 예상된다 — 이 가독성 향상을 물려받는지, 그리고 누군가 초안 작성이 아니라 편집에 대한 가독성 수치를 공개하는지다. 초안 작성 수치는 쉬운 쪽이다. 편집 수치에서는 Opus 5.5가 여전히 경쟁사 세 곳보다 뒤처진다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트