Claude Sonnet 5.5 vs Kimi K3라는 제목의 히어로 카드, 부제는 두 모델 모두 당신의 temperature 설정을 받지 않는다는 내용, 필에는 $2 / $10 폐쇄형 vs $3 / $15 오픈 웨이트, Index 56 vs 44, 그리고 둘 다 temperature를 받지 않음이라고 표시되어 있으며, 푸터에는 Artificial Analysis v4.3.2와 공급업체 가격이 인용되어 있습니다.
Guides & Insights

Claude Sonnet 5.5 대 Kimi K3: 어느 모델도 당신의 온도 설정을 따라주지 않습니다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

다음은 두 모델이 어느 쪽이든 여러분의 코드를 망가뜨릴 한 가지 사안에 동의하는 비교입니다. 2026년 9월 28일 출시된 Claude Sonnet 5.5는 temperature, top_p 또는 top_k를 기본값이 아닌 값으로 설정하는 모든 요청을 400 오류로 거부합니다. Kimi K3는 2026년 7월 중순부터 Moonshot AI에서 일반 제공되며, 샘플링 매개변수를 전혀 받지 않습니다 — temperature도, top_p도, seed도 없습니다 — 추론 깊이는 reasoning_effort 제어를 통해서만 노출합니다. 서로 다른 두 연구소, 서로 다른 두 아키텍처, 하나의 공통된 결론: 대부분의 통합이 여전히 습관적으로 설정하는 샘플링 노브들은 두 모델 모두에서 사라졌습니다.

그것은 사람들이 쓰는 비교가 아니다. 모두가 쓰는 비교는 가격이다: Kimi K3는 백만 입력 토큰당 3달러, 출력 토큰당 15달러이고, Claude Sonnet 5.5는 각각 2달러와 10달러로, 요금표상 Anthropic의 명백한 승리다. 하지만 Kimi K3는 다운로드해 자체 경계 내에서 실행할 수 있는 오픈 웨이트 2조 8천억 개 파라미터의 전문가 혼합 모델이고, Claude Sonnet 5.5는 네 개의 클라우드에서 제공되는 폐쇄형 모델이다. 더 저렴한 폐쇄형 모델과 더 비싼 다운로드 가능 모델 사이에서, 그 결정은 토큰당 가격으로 전혀 내려지지 않는다.

각각이 무엇인지, 각각 한 문단으로.

Claude Sonnet 5.5는 Anthropic의 5.5 세대에서 두 번째 모델로, Claude Opus 5.5가 Claude API에 출시된 지 5일 후 그 뒤를 이어 등장했습니다. 이 모델은 claude-sonnet-5-5로 Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry 전반에서 제공되며, 100만 토큰 컨텍스트 창과 128K 동기 출력 상한을 유지하고, Claude Sonnet 5의 가격을 그대로 유지합니다: 입력 $2, 출력 $10, 캐시 읽기 100만 토큰당 $0.20. 적응형 사고는 기본적으로 high 수준의 노력으로 켜져 있습니다. 제로 데이터 보존으로 제공되며, Artificial Analysis는 자사의 v4.3.2 개정판에서 이 모델에 Intelligence Index 56을 부여했습니다 — 측정 대상 216개 모델 중 3위입니다.

Two-column scoreboard for Claude Sonnet 5.5 and Kimi K3 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, closed weights on four clouds. Right column Kimi K3: input $3.00 per million, output $15.00 per million, 1M-token context, AA Intelligence Index 44, cost per Index task $2.00, open weights under the Kimi K3 License. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Kimi K3는 Moonshot AI의 플래그십입니다: 2.8조 개의 매개변수를 가진 전문가 혼합 모델로, 토큰당 약 1040억 개의 매개변수를 활성화하며, 100만 토큰 컨텍스트 창과 네이티브 시각 이해를 갖추고 있습니다. 장기적인 코딩과 다단계 지식 작업을 위해 설계되었으며, Moonshot은 프로그래밍 에이전트 하네스를 위해 이를 명시적으로 포지셔닝합니다. OpenAI API 형식을 사용하고, 노출하는 것은 reasoning_effort를 유일한 추론 제어 수단으로 하며, Kimi K3 라이선스에 따라 오픈 웨이트입니다 — 이는 오픈 소스와는 다른 것이며, 그 차이는 이 위에 구축하기 전에 읽어야 할 부분입니다.

요율표, 그리고 그 아래에 있는 숫자

헤드라인이 아니라 법안을 결정하는 기준 위에 두 가지를 나란히 놓아 보세요:

• 입력 가격 — Claude Sonnet 5.5 백만 토큰당 $2 vs Kimi K3 백만 토큰당 $3

• 출력 가격 — Claude Sonnet 5.5 백만 토큰당 $10 vs Kimi K3 백만 토큰당 $15

• 캐시 읽기 — 백만 개당 $0.20 vs 백만 개당 $0.30

• 컨텍스트 윈도우 — 1,000,000 토큰 vs 1,048,576 토큰

• 가중치 — 독점, 네 개의 호스팅 플랫폼 대 Kimi K3 라이선스 하의 오픈 가중치

• 인텔리전스 지수 — 동일한 v4.3.2 리비전에서 Claude Sonnet 5.5 56 대 Kimi K3 44

• 인텔리전스 인덱스 작업당 비용 — Claude Sonnet 5.5 $7.60 vs Kimi K3 $2.00

• Index에서의 장황함 — Claude Sonnet 5.5 410M 출력 토큰 vs Kimi K3 160M

그 마지막 쌍은 곱씹어 볼 만한 반전이다. Anthropic의 모델은 입력 비용이 50% 더 저렴하고 출력 비용은 3분의 1 더 저렴한데도, 동일한 평가를 완료하는 데는 여전히 3.8배의 비용이 든다. 거기까지 도달하는 데 2.6배의 토큰을 쓰기 때문이다. 종합 점수에서는 12점 더 높기도 하다. 따라서 이것은 낭비적인 모델이 아무것도 얻지 못하는 사례가 아니다. 두 모델의 비용 특성을 요율표 두 장을 읽는 것만으로는 비교할 수 없다는 사례이며, 그래서 index-task 수치가 존재하는 것이다.

그 토큰 수 중 어느 것도 당신의 토큰 수가 되지는 않습니다. Moonshot 자체 문서에 따르면 K3의 추론 깊이는 reasoning_effort로 설정되며 샘플링으로 설정되는 것이 아니고, Claude Sonnet 5.5의 effort 매개변수도 사실상 마찬가지입니다. 따라서 두 모델 모두에서 청구서에 가장 영향력이 큰 단일 요인은 가격 협상이 아니라 effort 설정입니다.

Anthropic Claude Platform documentation page for Claude Sonnet 5.5 showing the summary line the best combination of speed and intelligence, the model ID claude-sonnet-5-5, a 1M-token context window, a 128K maximum output, an input price of $2 per million tokens and an output price of $10 per million tokens, with links to the What is new and Migration guide pages.

400 오류, 자세히 살펴보기

OrcaRouter model page for kimi/kimi-k3, attributed to MoonshotAI and dated 2026-07-15, showing a 1M-token context window, text and image input, Vision, Tools, JSON and Reasoning capability tags, an input price of $3.00 and output price of $15.00 per million tokens, a p50 time to first token of 8.20 seconds, and 371.9M tokens of traffic in the last seven days.

샘플링 파라미터에 대한 공통된 거부는 여기서 가장 실용적인 겹침 지점이다. 왜냐하면 그것은 모델을 교체한 다음 날 아침에 드러나는 실패이기 때문이다.

Claude Sonnet 5.5에서는 규칙이 명시적이고 타협이 없습니다. 기본값이 아닌 temperature, top_p 또는 top_k는 400을 반환합니다. 다음을 보내면 thinking: {"type": "disabled"}은 between_tools를 가리키는 400을 반환합니다. 이는 새로운 최저 사고 설정으로, low, medium, high effort에서는 허용되지만 xhigh 또는 max에서는 거부됩니다. 강제 도구 사용 — tool_choice를 "any" 또는 명명된 도구로 설정하면 — "tool_choice: type \"tool\" and \"any\" are not supported for this model"라는 메시지와 함께 400을 반환하며, 해결책은 auto에 엄격한 도구 사용 또는 구조화된 출력을 추가하는 것입니다. 더 나아가, 사고 블록은 이제 이를 생성한 모델과 계정에 묶여 있으므로, 대화를 Claude Sonnet 5에서 Sonnet 5.5로 추론을 그대로 유지한 채 옮길 수는 있지만 그 추론을 다른 모델 패밀리로 가져갈 수는 없으며, 편집된 프리픽스는 리플레이를 400으로 만들 수 있습니다.

Kimi K3에서는 표면은 더 작지만 그 결과는 비슷합니다. 전송할 샘플링 파라미터가 없으므로, 하나를 하드코딩하는 모든 클라이언트는 이미 모델이 읽지 않는 파라미터를 보내고 있는 셈입니다. 대신 추론 깊이는 최상위 reasoning_effort 필드입니다.

두 변화 모두 같은 방향을 가리킵니다: 프롬프트 제어에 대한 결정론적 노브 접근법이 모델 측의 에포트 다이얼로 대체되고 있습니다. temperature 0.2와 고정 시드로 자체 튜닝하던 모든 파이프라인은 이 두 모델 모두에서 에포트 수준에 따라 다시 튜닝해야 하며, 그 재튜닝이 곧 마이그레이션입니다.

여기서 오픈 웨이트가 실제로 가져다주는 것

더 저렴하면서 더 높은 점수를 받은 폐쇄형 모델과 견주어 Kimi K3를 고려하는 이유는 성능도, 가격도 아니다. 바로 경계다.

K3를 자체 인프라에서 실행한다는 것은 프롬프트, 문서, 출력이 당신이 통제하는 네트워크를 결코 떠나지 않는다는 뜻이며, 이는 공급업체와의 제로 데이터 보존 합의와는 다른 규정 준수 논의입니다. 또한 이는 모델이 당신 발밑에서 갑자기 지원 종료될 수 없다는 뜻입니다 — Claude Sonnet 5.5는 2027년 9월 28일 이전에는 지원을 종료하지 않겠다는 Anthropic의 약속과 함께 제공되며, 다운로드한 체크포인트에는 그런 날짜가 없습니다. 그리고 이는 한계 비용 곡선이 평탄해진다는 뜻입니다: 하드웨어 이후에는 토큰이 무료이며, 이것이 2.8조 개 매개변수 모델이 비로소 저렴한 선택지가 되는 유일한 구조입니다.

실제로 서명하는 것은 라이선스입니다. Kimi K3는 오픈 가중치일 뿐 오픈 소스가 아니며, Moonshot은 후자라는 용어를 사용하지 않습니다. Kimi K3 라이선스는 대부분의 사용에 폭넓게 적용되지만, 일정 롤링 매출 기준을 초과하는 모델 서비스(MaaS) 사업에는 별도의 상업 계약이 필요하고, 대규모 사용자 또는 매출 기준을 넘는 제품에는 "Kimi K3" 출처 표시를 해야 합니다. 이를 MIT 라이선스라고 부르는 것은 아직도 떠도는 K2 시대의 부정확한 표현입니다. API를 호출하는 대신 가중치 위에 구축할 계획이라면, 이는 각주가 아니라 법률 검토 대상입니다.

그리고 가중치는 자체 호스팅이 자본 투자 결정이 될 만큼 충분히 큽니다. 약 104B의 활성 파라미터를 가진 2.8T 파라미터 MoE는 단일 서버 배포가 아니며, 이를 구축하는 데 드는 노력이 이 옵션의 진짜 비용입니다. 이는 출력 요율의 백만당 5달러 차이를 압도합니다.

OrcaRouter가 적합한 위치

이 두 가지를 평가하는 대부분의 팀은 관리형 API와 하드웨어 조달 중 하나를 선택하려 하지 않습니다. 그들이 원하는 것은 라우팅입니다.

OrcaRouter는 200개 이상의 모델을 아우르는 단일 OpenAI 호환 엔드포인트로, 공급자 정가를 그대로 적용하고 마크업이 없기 때문에 어느 쪽이든 벤더 요금이 변경되면 다음 청구 주기가 아니라 같은 날 바로 반영됩니다. Kimi K3는 7월부터 Moonshot 자체의 $3 / $15 가격으로 카탈로그에 올라 있었고, 측정된 p50 첫 토큰 시간은 약 8초이며 지난 한 주 동안 약 3억 7,190만 개의 토큰이 이를 통해 처리되었습니다. Claude Sonnet 5 — Claude API 트래픽 대부분이 여전히 사용하는 모델로, 측정된 출력 속도는 초당 150토큰 — 는 6월 30일부터 Anthropic의 $2 / $10 가격으로 라우팅할 수 있었습니다.

Claude Sonnet 5.5는 아직 우리 카탈로그에 없습니다. 그런 경우에는 그렇다고 밝히고 우회하십시오. 벤더 자체 API가 그것에 이르는 길이며, 약정 없이 테스트하는 방법은 자동 장애 조치 뒤에 트래픽의 일정 비율을 두는 것입니다, Claude Sonnet 5 또는 Kimi K3를 폴백으로 삼아. K3를 검토하는 이유가 요금이 아니라 경계 때문이라면, 가중치는 오늘 다운로드할 수 있고 API는 임시방편입니다 — 이는 모델 비교가 아니라 인프라에 관한 결정입니다.

실제로 무엇을 구매하는지에 따라 나뉜 결론

작업이 긴 컨텍스트이고 출력이 많을 때, 구매 대상이 종합 지수 12포인트일 때, 그리고 데이터 보존이 전혀 없는 관리형 API가 검토를 통과할 때에는 Claude Sonnet 5.5를 선택하십시오. 토큰 사용 습관을 감안해 예산을 잡으십시오 — Index에서 410M 토큰은 K3의 160M 대비 실질적인 배수입니다 — 그리고 도구 사용 및 사고 블록 변경을 위해 하루를 배정하십시오.

경계가 요구사항일 때, 어떤 벤더도 폐기할 수 없는 체크포인트를 원할 때, 또는 인덱스 작업당 $2.00 대 $7.60이 복리로 누적되는 대량의 에이전트형 코딩 워크로드를 처리할 때 Kimi K3를 선택하세요. 호스팅해야 하는 2.8T 파라미터 모델이라는 점, 라이선스에 저작자 표시 및 수익 조항이 있다는 점, 그리고 종합 점수에서 Anthropic 계층보다 낮다는 점을 받아들이세요.

두 선택지 중 어느 쪽도 피할 수 없는 것은 첫 번째 문단입니다: 두 경우 모두 샘플링 매개변수는 사라졌고, 이를 대체한 컨트롤은 effort 다이얼입니다. 이 둘 중 어느 쪽을 선택하든, 그것이 바로 여러분의 코드에 필요한 변경입니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트