Fugu Ultra v2 대 Kimi K3 대결을 위한 히어로 카드로, 토큰을 전문가에게 라우팅하는 모델 옆에 작업을 모델로 라우팅하는 오케스트레이터를 보여줍니다.
Guides & Insights

Fugu Ultra v2 vs Kimi K3: 두 개의 라우터, 두 개의 고도

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 두 시스템은 모두 라우터이며, 이것이 대부분의 보도가 놓치는 첫 번째 사실입니다. Kimi K3는 약 2조 8천억 개의 파라미터를 가진 전문가 혼합(Mixture-of-Experts) 모델로, 토큰당 약 1,040억 개의 파라미터를 활성화합니다. 즉, 생성하는 토큰 하나하나마다 라우팅 결정을 내려 896개 전문가 중 16개를 선택해 작업을 수행하게 합니다. Fugu Ultra v2는 2026년 9월 11일 Sakana AI가 발표한 것으로, 전혀 다른 차원의 라우터입니다. 들어온 작업을 받아 조각내어 여러 개별 모델 풀에 분배하죠. 하나는 순전파 내부에서 라우팅하고, 다른 하나는 모델 군단 전체에 걸쳐 라우팅합니다. 이 둘이 서로 다른 규모에서 같은 아이디어라는 점을 이해하는 것이, 두 모델의 가격이 입력에서 2배, 출력에서 5배 차이 나는 이유를 가장 빠르게 파악하는 길입니다.

두 개의 라우터, 나란히

Kimi K3 — Moonshot AI의 플래그십 모델로, 2026년 7월 중순에 출시되었으며 가중치는 2026년 7월 27일에 공개되었습니다. 이 아키텍처는 2026년 기준으로도 이례적입니다. 69개의 Kimi Delta Attention 레이어가 24개의 Gated MLA 레이어와 교차 배치되고, Attention Residuals, "Stable LatentMoE" 설계, 그리고 4억 100만 파라미터의 MoonViT-V2 비전 인코더로 구성되어 있습니다. 가중치는 양자화 인식 학습(quantisation-aware training) 하에 MXFP8 활성화와 함께 MXFP4로 제공됩니다. 호스팅 API는 추론 강도를 정확히 하나의 지원 값 — max.

Fugu Ultra v2 — Sakana AI의 최고 역량 오케스트레이션 계층으로, 일반적인 의미의 파운데이션 모델이 아닙니다. 작업을 분해해 오픈 웨이트 및 특화 모델 풀 전반에 분배하는 단일 OpenAI 호환 엔드포인트입니다. Sakana는 Claude Fable 5, Claude Fable 5.1, GPT-6 Astra가 그 풀에서 제외된다고 밝히며, 학습 컷오프를 20260828로 제시합니다. 공개된 파라미터 수는 없는데, K3에서처럼 셀 수 있는 파라미터가 존재하지 않기 때문입니다. 역량은 스케줄링 정책에 있습니다.

그 결과 K3는 구성 요소이고 Fugu Ultra v2는 어셈블리입니다. 그래서 이 비교는 이례적입니다: 이 둘은 경쟁자일 뿐만 아니라 잠재적인 재료이기도 합니다. K3 같은 모델은 오케스트레이터가 충분히 임대할 만한 바로 그런 종류의 오픈 웨이트, 긴 컨텍스트, 도구 호출 시스템입니다. Sakana는 풀의 구성원을 공개하지 않으므로 K3가 Fugu Ultra v2 내부에 있는지는 알 수 없습니다 — 하지만 만약 그렇다면, Fugu의 요금을 내고 얻는 것 중 일부는 마크업이 붙은 K3의 토큰입니다.

가격 차이가 실제로 무엇인지

입력 — Fugu Ultra v2는 보도된 기준 100만 토큰당 $5.00(제3자 목록 기준이며, Sakana의 발표 페이지에는 자체 요율이 공개되지 않음)인 반면, Kimi K3는 100만 토큰당 $3.00이고 캐시 적중 시 $0.30입니다.

출력 — Fugu Ultra v2는 보고된 바 100만 토큰당 $30.00, Kimi K3는 100만 토큰당 $15.00입니다. 절반 가격에, 다운로드도 가능한 모델입니다.

캐시된 입력 — 캐시 적중 시 Fugu Ultra v2는 100만 건당 $0.50, Kimi K3는 100만 건당 $0.30입니다. 안정적인 시스템 프롬프트가 있는 긴 에이전트 루프에서는 이 격차가 매 턴마다 누적됩니다.

컨텍스트 계층화 — Kimi K3는 전체 1,048,576토큰 윈도우에 걸쳐 편차 없이 균일하며 장문 컨텍스트 페널티가 없습니다. Fugu Ultra v2는 약 272,000 입력 토큰을 초과하는 구간에 보고된 티어가 적용되어 전체 요청 비용이 약 $10.00 / $45.00으로 올라갑니다.

마지막 행이 바로 실제 청구서를 좌우하는 행이다. 장기 호라이즌 에이전트 실행은 수명의 대부분을 272K 토큰 이후에 보내는데, 바로 그 지점에서 K3의 정액 요율은 그대로 유지되고 Fugu Ultra v2의 요율은 두 배가 된다. 워크로드가 그런 형태라면, 입력 측의 실효 격차는 1.7×보다 3.3×에 더 가깝다.

Two-column comparison scoreboard for Fugu Ultra v2 and Kimi K3 covering type, release date, input price ($5.00 vs $3.00 per million tokens), output price ($30.00 vs $15.00), cached input ($0.50 vs $0.30) and long-context pricing (reprices above roughly 272K vs flat to 1M).

그들이 공유하는 단 하나의 숫자

두 공급업체 모두 DeepSWE를 보고하며, 그 비교는 Fugu의 출시 당시 프레이밍이 시사하는 것보다 Fugu에 덜 호의적이다. Sakana는 Fugu Ultra v2를 74.3으로 기재한다. Moonshot은 Kimi K3를 67.5로 기재한다 — 모델 카드에서 공급업체가 보고한 수치다. 이는 코딩 에이전트 벤치마크에서 6.8점 차이로, 실재하는 차이지만 훨씬 더 큰 공개 세트 중 하나의 테스트에 불과하며, Sakana가 GPT-5.6 Sol을 상대로 1.6점 앞서는 바로 그 테스트다. 서로 다른 세 공급업체가 모두 7점 이내에 몰려 있는 벤치마크는 실재하는 무언가를 측정하고 있지만, 이들을 결정적으로 분리하지는 못한다.

그 외에도, 두 모델이 결과를 공개하는 위치는 완전히 다릅니다. Moonshot의 K3 수치에는 Terminal-Bench 2.1 88.3, GPQA Diamond 93.5, HLE-Full 43.5(도구 사용 시 56.0), SWE-Marathon 42.0, OSWorld-Verified 84.8, MCPMark-Verified 94.5가 포함되며 — 모두 벤더가 보고한 수치이고, 모두 모델 카드에 실려 있습니다. Sakana의 Fugu Ultra v2에 대한 여덟 개 벤치마크에는 두 개의 내부 벤치마크인 SWEFish와 Toolathon이 포함되는데, 이는 Sakana 외부에서는 누구도 재현할 수 없습니다.

독립적으로 보면, 그중 단 하나만이 조금이라도 측정된 상태입니다. Kimi K3는 Artificial Analysis Intelligence Index v4.3에서 44점으로 오픈 웨이트 모델 중 2위이며(45점의 GLM-5.3 다음), Vals AI의 표준화된 에이전트 하네스에서 SWE-bench Verified 93.40%를 기록해 Claude Opus 5와 DeepSeek V4 Pro에 뒤지지만 근접했습니다. 또한 Frontend Code Arena에서 1679 Elo로 선두이며, 1631의 Fable 5와 1618의 GPT-5.6 Sol을 앞섰습니다. K3가 57 또는 60으로 인용된 것을 보셨다면, 그것은 더 이상 사용되지 않는 지수 척도이며 반복해서는 안 됩니다.

Fugu Ultra v2는 어떤 종류의 독립적인 점수도 없습니다. 2026년 9월 11일에 발표되었으며, Sakana 밖에서는 아무도 이를 실행해 본 적이 없습니다.

속도: 하나는 측정되고, 하나는 그렇지 않음

Kimi K3는 느리며, 이는 주장이 아니라 측정된 사실이다: Artificial Analysis는 초당 37.9토큰과 첫 토큰까지 걸리는 시간 3.80초를 기록했고, 이를 눈에 띄게 장황하다고 지적한다. 장기 지평의 에이전트형 코딩을 중심으로 만들어진 모델에게 처리량은 실질적인 제약이다 — 긴 루프에서 느린 모델은 비용뿐 아니라 실제 소요 시간도 잡아먹는다.

Sakana는 Fugu Ultra v2에 대해 지연 시간이나 처리량 수치를 전혀 공개하지 않았다. 오케스트레이터 입장에서 이는 회피라기보다 솔직하다고 할 만한데, 응답 시간이 어떤 모델을 호출하기로 결정하는지와 몇 번의 패스를 거치는지에 전적으로 달려 있기 때문이다. 하지만 이는 또한 직접 측정하지 않고서는 그것으로 전환할 때의 실제 소요 시간 비용을 모델링할 수 없다는 뜻이기도 하다. 이전 Fugu Ultra의 경우 테스터들은 실행 시간이 30분에 가까워졌다고 공개적으로 보고했다. 그것은 2026년 6월 모델이며 v2에 관한 증거는 아니지만, 벤치마크할 때 넘어서야 할 수치다.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

오픈 웨이트, 읽어볼 만한 조건이 하나 있다

Kimi K3의 가중치는 다운로드할 수 있으며, 이는 Fugu Ultra v2의 호스팅 전용 모델과는 실질적인 차이입니다. 그러나 라이선스는 "오픈 가중치"라는 표현이 일반적으로 함축하는 것보다 더 좁습니다. K3는 OSI 승인 MIT 또는 Apache 허가가 아닌 Kimi K3 License로 배포되며, 그것이 "수정된 MIT"라는 널리 반복되는 주장에는 논란이 있습니다. 약관에 따르면 어떤 연속된 12개월 동안이든 매출이 2천만 달러를 초과하는 model-as-a-service 사업의 경우 Moonshot과 별도 계약이 필요하고, 월간 사용자 1억 명 초과 또는 월간 매출 2천만 달러 초과 제품의 경우 저작자 표시가 필요합니다. 내부 사용은 면제됩니다.

그래서 솔직하게 정리하자면 이렇다: K3는 매출 기준이 걸린 상업적 조건이 붙는 대신, 직접 보유하고 검사하고 미세 조정하고 자체 호스팅할 수 있는 가중치를 제공한다. Fugu Ultra v2는 그중 어느 것도 제공하지 않는다 — 가중치도, 검사 가능한 풀도, 자체 호스팅도 — 하지만 매출 조건도 부과하지 않는다. 라이선스할 것이 없기 때문이다. 이들 중 어느 쪽이 더 허용적인지는 전적으로 당신이 K3 라이선스가 겨냥하는 부류의 회사인지에 달려 있다.

자체 호스팅이 계획이라면 실질적인 주의점이 하나 있습니다: K3의 체크포인트는 약 1.5테라바이트이고, 벤더는 64개 이상의 가속기를 권장합니다. 여기서 "오픈 웨이트"는 노트북 차원의 결정이 아니라 추론 클러스터 차원의 결정을 뜻합니다. 대부분의 팀에게는 어느 쪽이든 API가 합리적인 경로입니다 — 그래서 vLLM과 SGLang의 출시 당일 지원이 다운로드보다 더 중요합니다.

우리 자체 트래픽이 말해주는 것

어느 벤더도 공개하지 않지만, 겉보기보다 훨씬 가치 있는 데이터 포인트가 하나 있습니다: OrcaRouter 게이트웨이 전체에서 Kimi K3는 이 글에서 논의된 어떤 모델보다 압도적으로 많이 사용되며, 지난 7일 동안 약 32억 7천만 토큰을 처리했습니다.

그것은 벤치마크가 아니며 품질에 관해 어떤 결론도 내리지 않는다. 하지만 이는 개발자들이 토큰 가격 외에는 아무 비용도 들지 않는 상황에서 실제로 무엇을 선택하는지를 보여주는 큰 표본이며, K3가 100만 토큰 정액 윈도우와 오픈 웨이트, 그리고 코딩 아레나에서의 강력한 순위를 결합한 것이 이미 실제 장문맥 에이전트 작업의 상당한 몫을 차지했음을 말해준다. Fugu Ultra v2는 오늘 출시되었기 때문에 이에 견줄 만한 신호가 없다.

Screenshot of the OrcaRouter model page for Kimi K3 showing the kimi/kimi-k3 identifier, a 1M token context window, and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

각각에 도달하기

Kimi K3가 Moonshot 자체 요율로 OrcaRouter에 있습니다 — 백만 입력 토큰당 $3.00, 캐시 적중 시 $0.30, 백만 출력 토큰당 $15.00 — 마크업 없이 그대로 전달되므로, 벤더 가격 변경이 마이그레이션 일정에 따라 늦게가 아니라 같은 날 바로 여기에 반영됩니다. 나머지 카탈로그와 동일한 베이스 URL에서 OpenAI와 호환되며, 다른 모든 것과 같은 게이트웨이 뒤에 있기 때문에 페일오버 체인에 넣거나 조건부로 라우팅할 수 있어, 프로덕션 경로에 단일 공급자를 하드코딩할 필요가 없습니다. 여기서는 이 점이 평소보다 더 중요합니다: 초당 37.9 토큰으로 서빙되는 2.8T 파라미터 모델은 바로 뒤에 폴백을 두고 쓸 만한 바로 그런 의존성입니다.

Fugu Ultra v2는 저희가 라우팅하지 않습니다. 이 모델은 Sakana AI 자체의 OpenAI 호환 API에서 사용할 수 있으며, 회사 측은 기존 Fugu 통합이 단일 파라미터 변경만으로 이 모델로 전환된다고 말합니다. 두 모델은 동일한 요청 형식을 사용하므로, 둘을 하나의 플래그 뒤에 두는 평가는 재작성이 아니라 base-URL 교체에 불과합니다.

어느 것을 고를까?

Kimi K3는 거의 모든 워크로드에서 더 정당화할 수 있는 구매입니다. 입력과 출력 모두에서 Fugu Ultra v2 가격의 절반이며, 1M 창 전체에서 가격이 동일하고 긴 컨텍스트 절벽이 없으며, 현재 Artificial Analysis 지수에서 독립적으로 44점을 받았고, 매출 기준 라이선스 아래 자체 호스팅이 가능하며, 이미 이 비교에서 가장 높은 트래픽을 기록한 모델입니다 — 큰 차이로 앞서 있습니다. 그 대가는 속도와 장황함입니다: 초당 37.9 토큰은 에이전트 루프에 정말로 느리고, 대규모 모델-as-a-service 사업자라면 이 라이선스는 실질적인 제약이 됩니다.

Fugu Ultra v2는 Sakana가 판매하는 특정 속성을 원한다면 구매해야 할 제품입니다 — 즉, 프런티어 벤더를 구조적으로 배제하는 풀 전반에 걸쳐 어려운 다단계 작업을 분해하는 역량 계층으로, 어떤 단일 업스트림 모델도 당신 발밑에서 회수되거나 가격이 재책정되거나 차단될 수 없게 합니다. K3 대비 DeepSWE 우위는 실제이며 벤더가 보고한 것입니다; 8개 벤치마크 중 7개에서의 톱2 진입 역시 벤더가 보고한 것이며, 부분적으로는 다른 어디에도 존재하지 않는 테스트에서도 그렇습니다.

주목할 점은 이 둘 모두 라우팅 결정이며, 당신은 어느 층위를 선택하라는 요청을 받고 있다는 것입니다. K3는 당신이 다운로드하고 제어할 수 있는 모델 내부의 전문가들에게 토큰을 라우팅합니다. Fugu Ultra v2는 당신이 볼 수 없는 모델들에게 작업을 라우팅합니다. 두 번째는 더 크고 더 강력한 아이디어입니다. 그것은 또한 오직 믿음으로만 받아들일 수 있는 것이며 — 그 믿음을 갖는 데는 토큰당 다섯 배의 비용이 듭니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트