Claude Sonnet 5.5 vs Tencent HY4 Preview라는 제목의 히어로 카드가 생성됨, 부제는 두 연구소 모두 토큰 청구서를 판매 중, 세 개의 통계 카드: 100만 개당 출력 가격 $10.00 vs $2.50, 가중치 비공개 vs Apache 2.0, 측정된 출력 속도 초당 138.7 vs 22.3 토큰, 하단에는 Tencent HY4 Preview 가격 및 속도는 OrcaRouter 카탈로그 기준, 공급업체 목록 100만 개당 6 / 18 위안; Claude Sonnet 5.5는 Anthropic 기준.
Guides & Insights

Claude Sonnet 5.5 vs Tencent HY4 Preview: 두 연구소 모두 토큰 청구서를 팔고 있다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

6주 간격을 두고 이루어진 두 번의 출시가 서로 다른 말로 같은 약속을 내걸었다. 벤더의 주장은 Claude Sonnet 5.5가 2026년 9월 28일 출시되었으며, 변경되지 않은 토큰당 요금에서 Claude Sonnet 5보다 "작업당 최대 30% 더 저렴하다"는 것이다. 두 번째 주장은 2026년 8월 28일 최초 출시되어 오픈소스화된 Tencent HY4 Preview의 호스팅 빌드에 대한 9월 7일 최적화가 동일한 작업 품질을 유지하면서 추론 턴 수와 작업당 토큰 소비량을 줄인다는 것이다. 두 벤더 모두 그런 주장을 하기 위해 가격을 올리거나 내리지 않았다. 둘 다 이제 토큰이 곧 제품이라고 말하고 있으며, 이번 맞대결에서 흥미로운 점은 두 주장 중 하나만이 공개된 작업당 수치와 대조해 검증될 수 있다는 것이다. 왜냐하면 이 두 모델 중 하나만이 그것을 검증할 독립적인 측정치를 갖고 있기 때문이다.

그 비대칭성은 T​encent를 깎아내리는 것이 아니다. HY4 Preview에는 Artificial Analysis 모델 페이지도, 독립적인 Intelligence Index 점수도, 제3자로부터 나온 작업당 비용 수치도 없다. 있는 것은 벤더 벤치마크 표 — Terminal-Bench 2.1에서 85.4, DeepSWE 64.3, 203개 엔지니어링 작업에 걸친 내부 블라인드 평가에서 평균 2.99로 GLM-5.3의 2.92와 Kimi K3의 2.94를 앞선 기록 — 그리고 WebDev Arena 리더보드에서의 대중 투표 데뷔인데, T​encent는 여기서 종합 약 5위, 오픈웨이트 모델 중 3위에 올랐다고 보고한다. 이 모든 것은 실제 신호다. 그러나 어느 것도 작업당 비용은 아니며, 이는 두 벤더가 겨루고 있는 정확한 숫자가 HY4 Preview의 경우 이용할 수 없음을 의미한다.

양측이 실제로 출시한 것

Tencent HY4 Preview는 7700억 개 파라미터의 전문가 혼합(MoE) 모델로, 토큰당 490억 개가 활성화되고, 78개 층과 256개의 라우팅된 전문가에 하나의 공유 전문가가 더해지며, 추측 디코딩을 위한 네이티브 MTP 층, 그리고 100만 토큰을 넘어서는 컨텍스트 윈도우를 갖추고 있습니다. 설계상 텍스트 전용입니다 — Tencent는 이미지가 아니라 코딩 에이전트, 복잡한 도구 사용 및 생산성 작업을 위해 이를 만들었습니다 — 또한 기본적으로 무거운 추론을 수행하며, 세 가지 구성 가능한 수준(높음, 낮음, 없음)과 공급업체 권장 샘플링 설정인 temperature 0.9 및 top_p 1.0을 제공합니다. 가중치는 Apache 2.0이며 Hugging Face, GitHub, ModelScope, GitCode에서 다운로드할 수 있습니다. Tencent는 당초 이 프리뷰에서 두 가지 미흡한 점을 지적했습니다. 바로 필요 이상으로 오래 생각하는 것과 자체 작업을 과도하게 검증하는 것이었으며, 9월 7일 업데이트는 정확히 그 부분을 겨냥합니다.

Claude Sonnet 5.5는 Anthropic의 두 번째 5.5세대 모델이며, Anthropic이 라인업에서 속도와 지능의 최상의 조합으로 내세우는 모델입니다. 100만 토큰의 컨텍스트, 동기식 128,000 출력 토큰과 Message Batches API에서 300,000 출력 토큰, 텍스트·이미지·파일 입력, 선택한 노력 수준에서의 적응형 사고, 2026년 6월 지식 컷오프, 출시 시점부터 제공되는 제로 데이터 보존, 그리고 2027년 9월 28일의 지원 종료 하한을 갖추고 있습니다. 요금표는 Claude Sonnet 5에서 변동 없이 유지되었습니다: 입력 100만 토큰당 $2.00, 출력 100만 토큰당 $10.00, 캐시에는 $0.20, 캐시 쓰기에는 $2.50입니다. 가중치는 비공개이며, Anthropic API와 Bedrock, Google Cloud, Microsoft Foundry에서 제공됩니다.

둘을 서로 맞세워 보면 위치가 거의 대칭이다:

• 가격 — Claude Sonnet 5.5는 백만 토큰당 입력 $2.00 / 출력 $10.00, Tencent HY4 Preview는 자사 카탈로그 기준 입력 $0.83 / 출력 $2.50이며, 공급업체 목록 가격은 ¥6 / ¥18

• 캐시 읽기 — Claude Sonnet 5.5 백만 토큰당 $0.20 vs Tencent HY4 Preview 백만 토큰당 $0.042 (당사 카탈로그 기준)

• 가중치 — Claude Sonnet 5.5 클로즈드 vs Tencent HY4 Preview Apache 2.0, 다운로드 가능

• 컨텍스트 — Claude Sonnet 5.5 1,000,000 토큰 vs Tencent HY4 Preview 1,048,576 토큰, 사실상 동일

• 최대 출력 — Claude Sonnet 5.5는 동기식 128,000, Batches에서는 300,000 vs Tencent HY4 Preview는 자사 카탈로그 기준 64,000

• 입력 모달리티 — Claude Sonnet 5.5 텍스트, 이미지 및 파일 vs Tencent HY4 Preview 텍스트 전용

• 독립 점수 — Claude Sonnet 5.5 Intelligence Index 56, 작업당 $7.60, 리비전 v4.3.2 대 Tencent HY4 Preview, 공개된 항목 없음

• 측정된 출력 속도 — 자체 트래픽 기준 Claude Sonnet 5.5 초당 138.7 토큰 대 Tencent HY4 Preview 초당 22.3 토큰

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

두 연구소가 내놓고 있는 주장, 그리고 그중 하나가 검증 가능한 이유

A​nthropic의 "작업당 30% 절감"과 T​encent의 "추론 턴 감소, 토큰 소비 감소"는 동일한 엔지니어링 프로젝트를 두 방향에서 설명한 것입니다: 모델이 같은 답에 도달하는 데 더 적은 토큰을 쓰도록 만드는 것이죠. A​nthropic은 요금이 변하지 않았다는 점을 분명히 밝혔는데, 이는 작업당 절감이 토큰 수에서 나와야 한다는 뜻입니다 — 그리고 독립적인 보드는 해결책의 크기가 아니라 문제의 형태를 볼 수 있게 해줍니다. Claude Sonnet 5.5는 Intelligence Index 평가 전반에 걸쳐 4억 1천만 개의 출력 토큰을 생성하는데, 이는 MiniMax M3의 1억 1천 7백만 개, Grok 4.5의 7천 7백만 개와 대비됩니다. 이는 숫자를 공개하는 보드에서 측정된 장황한 모델입니다. Claude Sonnet 5 대비 30% 개선이 무엇을 의미하든, 그것은 매우 큰 기반에 적용되고 있습니다.

HY4 Preview의 경우, 이에 상응하는 수치는 공개적으로 존재하지 않는다. T'encent's 자체 최적화 노트가 이에 대한 유일한 설명이며, 숫자 없이 결과를 제시한다: 더 적은, 더 낮은 입력 및 출력 토큰, 동일한 출력 토큰, 이중 패스에서 벤치마크와 인간 평가로 검증됨. 이는 엄밀한 의미에서 공급업체의 주장, 즉 진술되었고 그럴듯하지만 재현되지 않은 주장이며, 여기서도 그렇게 표시되어 있다. 토큰 경제성이 바로 외부에서 측정할 수 없는 것일 때, 공급업체의 토큰 경제성 주장을 근거로 프리뷰 모델을 채택하는 것은 프리뷰 릴리스가 당신에게 요구하는 바로 그 베팅이다.

자체 호스팅 배포를 그 최적화에 맞춰 계획하기 전에 알아 둘 만한 변수가 하나 더 있다. Tencent의 9월 7일 변경은 Tencent가 자체 호스팅 엔드포인트에서 제공하는 빌드에 적용된다. 오픈 웨이트 스냅샷은 갱신되지 않았다 — Hugging Face 저장소의 마지막 수정 날짜는 여전히 8월 28일이다 — 따라서 가중치를 자체 호스팅한 사본은 프리뷰 노트가 지적한 원래의, 더 긴 추론 동작을 실행한다. 최적화된 버전과 다운로드 가능한 버전은 같은 아티팩트가 아니다.

오픈이 실제로 이득이 되는 곳은 같은 곳이다: API를 사용할 수 없는 배포 환경. 49B가 활성인 770B 파라미터 모델은 30B 모델이 아니라 데이터센터용 모델이다. 이것은 30B 모델이 말해 주는 바가 아니다 — 자체 경계가 필요한 구매자에게, 그 규모의 Apache 2.0은 Sonnet 5가 어떤 가격으로도 제공하지 않는 옵션이다.

프로덕션 경로를 걸지 않고 미리보기를 시험해 보는 것

프리뷰 모델은 라우팅이 더 이상 비용 최적화가 아니라 리스크 통제가 되는 경우입니다. 프리뷰 빌드를 직접 호출하는 대신 라우터 뒤에 두는 이유는, 프리뷰란 당신 밑에서 바뀔 가능성으로 정의되기 때문이며, 그 앞에 놓인 레이어에서 원하는 두 가지는 비율 분할과 실패를 잡아낼 무언가입니다.

그것이 OrcaRouter가 제공하는 형태입니다: 200개 이상의 모델을 지원하는 하나의 OpenAI 호환 엔드포인트, 제공업체의 정가가 마크업 없이 그대로 전달되며, 업스트림 제공업체 간의 자동 페일오버, 그리고 여러 모델로 호출을 구성하기 위한 라우팅 DSL. Tencent HY4 Preview는 오늘 여기에서 다음과 같이 라우팅할 수 있습니다: tencent/hy4-preview 백만 토큰당 입력 $0.83, 출력 $2.50, 캐시 읽기 $0.042 (1,048,576 토큰 윈도우 전반) — 동일한 빌드, 제공업체 요율로, 카탈로그의 다른 모든 항목에 이미 사용 중인 키로 접근할 수 있습니다. Claude Sonnet 5도 여기에서 라우팅할 수 있습니다, A​nthropic의 $2.00 및 $10.00에, 그리고 6월 30일부터 그렇게 되어 왔습니다; 하루된 모델이 프로덕션 증거를 축적하는 동안 명백한 페일오버 파트너가 됩니다.

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5 자체는 우리 카탈로그에 없습니다. 어제 출시되었고, 그것으로 가는 경로는 Anthropic 자체 API이며, 이 페이지는 달리 제안하지 않습니다 — 라우팅 조언의 요점은 새로운 티어를 프로덕션에서 운영하는 안전한 방법이 그 뒤에 검증된 무언가를 둔 채 트래픽의 일부를 할당하는 것이며, 그 구성의 양쪽 끝이 한 곳에서 도달할 수 있는 곳에 있을 때만 그것이 작동한다는 것입니다. HY4 Preview는 여기서 주당 37만 2천 토큰의 트래픽을 처리하고 있는데, 이는 누구도 그것에 전념하기 전의 이틀 된 프리뷰가 보이는 모습입니다. Claude Sonnet 5는 6월 30일부터 주당 790만 토큰을 처리해 왔으며, 그것이 후보와 하한선의 차이입니다.

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

돈이 실제로 어디로 가는가

요금만 놓고 보면 HY4 Preview는 출력에서 Claude Sonnet 5.5보다 네 배 저렴하고 캐시 읽기에서는 거의 다섯 배 저렴하며, 윈도우도 동일합니다. 실측 측면에서는 Claude Sonnet 5.5가 우리 자체 트래픽에서 출력을 여섯 배 더 빠르게 생성합니다 — 초당 138.7토큰 대 22.3토큰 — 이는 네 배의 요금 우위를 훨씬 더 작은 실제 경과 시간 이점으로, 그리고 대기열을 고려하면 때때로 손실로 바꾸는 종류의 격차입니다.

두 가지 사실 사이에서 결정은 오직 독자만이 답할 수 있는 네 가지 질문에 달려 있다. 작업에 프롬프트 안의 이미지나 파일이 필요한가? HY4 Preview는 텍스트 전용이며, 그것으로 논의는 끝난다. HY4 Preview의 Terminal-Bench 2.1 점수 85.4가 T​encent 자체 수치이고 재현되지 않은 상황에서, 다단계 소프트웨어 작업을 완료해야 하는가? 그렇다면 프리뷰 상태는 당신이 감수하는 위험이며, 9월 7일 최적화는 믿기보다 다시 테스트해 볼 가치가 있다. 워크로드가 자신의 경계 내에서 실행되어야 하는가? 그렇다면 Apache 2.0 가중치가 결정적 사실이다. 그리고 종합 능력 수준이 요율보다 더 중요한가? 그렇다면 Claude Sonnet 5.5의 독립적으로 측정된 56이 따져봐야 할 수치이며, Index 작업당 $7.60이고, T​encent 쪽에는 비교할 동등한 수치가 존재하지 않는다는 단서가 붙는다.

두 출시가 정말로 보여주는 것은 프런티어가 이제 요금표에서 벗어났다는 점이다. 두 연구소가 6주 간격으로 모델을 출시했고, 백만 개당 가격이 아니라 작업당 토큰 소비량을 앞세웠다. 그리고 구매자에게 실질적인 결과는 유용한 숫자가 더 이상 어느 공급업체의 가격 페이지에도 없다는 것이다. 그것은 바로 자신의 워크로드가 만들어내는 토큰 수이며, 두 모델 모두에서 측정한 값이고, 이 글에서 어느 공급업체도 알려줄 수 없는 단 하나의 수치다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트