
Fugu Max 대 Kimi K3: Sakana가 이 기준을 선택했으니, 함께 살펴보자
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
Sakana AI의 Fugu Max 발표는 가격 책정을 정당화하기 위해 정확히 세 모델을 명시하며, Moonshot AI의 Kimi K3도 그중 하나다. 주장은 Fugu Max의 출력 단가가 그 세 모델보다 40~60퍼센트 낮다는 것이며, 이로 인해 Kimi K3가 — Grok 4.6도, Qwen3.8-Max도 아닌 — Sakana 스스로가 가성비의 기준으로 고른 모델이 된다. 이는 공급업체가 하기에는 이례적으로 후한 행동이다. 잣대를 건네주고 어디에 대라고 알려주는 셈이기 때문이다. 그래서 이 페이지는 뻔한 일을 한다. 그 잣대를 그대로 대본다. Fugu Max는 2026년 9월 11일에 출시되었으며, 입력 100만 토큰당 $2.00, 출력 100만 토큰당 $6.00이다. Kimi K3는 $3.00와 $15.00로 책정돼 있다. 출력에 관한 60퍼센트 주장은 산술적으로 맞다. 그 문장이 언급하지 않는 것은, Fugu Max가 가격을 밑도는 대상인 모델은 독립적으로 측정된 결과의 전체 기록을 공개하지만, 가격을 밑도는 모델은 아무것도 공개하지 않는다는 점이다.
40~60퍼센트 문장, 검토
• 입력 — Fugu Max는 100만 토큰당 $2.00, Kimi K3는 100만 토큰당 $3.00으로, 릴리스가 앞세운 40~60퍼센트가 아니라 33퍼센트 절감이다
• 출력 — Fugu Max는 100만 토큰당 $6.00, Kimi K3는 100만 토큰당 $15.00이며, 이는 Sakana가 밝힌 범위의 상한보다 60퍼센트 낮습니다.
• 캐시된 입력 — Fugu Max는 100만 토큰당 $0.25, Kimi K3는 100만 토큰당 $0.30으로, 캐시를 많이 사용하는 루프에서는 눈치채기 어려울 만큼 작은 차이입니다
• 컨텍스트 윈도우 — 릴리스에서 수치가 공개되지 않은 Fugu Max vs Kimi K3 1,048,576 토큰
• 장문 프롬프트 요금 재조정 — Fugu Max는 등급 미표기, Kimi K3는 길이에 관계없이 추가 요금 없이 전체 구간 동일 요금
• 배포 — Fugu Max는 벤더 API 전용으로 풀 멤버십이 비공개인 반면, Kimi K3는 Kimi K3 라이선스에 따라 가중치를 다운로드할 수 있음
• 독립 평가 — Fugu Max 없음, 그리고 어떤 Fugu 모델에도 Artificial Analysis 페이지가 존재하지 않음. Kimi K3와 비교하면 Artificial Analysis Intelligence Index 44, Vals AI의 SWE-bench Verified에서 표준화된 93.40%
첫 번째 행의 형태에 주목하세요. 헤드라인 범위인 40~60퍼센트는 이름이 언급된 세 경쟁사에 걸친 범위이며, 60을 만들어 내는 쪽은 Kimi K3입니다. 입력만 놓고 보면 비교 수치는 33퍼센트로, 이는 여전히 실질적인 절감이지만 다른 문장이 됩니다. 그것은 가격 책정에 대한 비판이 아닙니다. $2.00과 $6.00은 최전선에 근접한 결과를 주장하는 시스템치고 정말로 낮은 숫자입니다. 이는 발표 자료에서 어떤 숫자가 설득을 담당하고 있는지, 그리고 그 문단이 그 숫자를 중심으로 어떻게 배치되었는지에 대한 지적입니다.
Kimi K3는 Moonshot 자체 요율로 저희 카탈로그에 올라 있습니다 — 백만 입력 토큰당 $3.00, 캐시 적중 시 $0.30, 백만 출력 토큰당 $15.00 — 0% 마크업으로 그대로 전달되므로, Moonshot이 가격을 변경하면 새 요율이 같은 날 동일한 키에 바로 적용됩니다 마이그레이션 주기를 거치는 대신에 말이죠. 이 점은 여기서 평소보다 더 중요합니다. 업스트림의 가격 인하는 바로 이 전체 비교의 근간이 되는 60퍼센트 격차를 좁히거나 넓히는 요인이기 때문입니다.
그 기준이 발표하는 것
Kimi K3의 기록은 빈약하기는커녕 그 반대다. Moonshot 자체 모델 카드에 따르면 Terminal-Bench 2.1은 88.3, GPQA Diamond는 93.5, HLE-Full은 43.5에서 도구를 사용하면 56.0으로 상승, SWE-Marathon은 42.0, OSWorld-Verified는 84.8, MCPMark-Verified는 94.5, DeepSWE는 67.5다. 모두 벤더가 보고한 수치이며, 그 양도 상당하다.
독립 레이어도 존재합니다. 이것이 이 비교에서 중요한 부분입니다. Artificial Analysis는 v4.3 Intelligence Index에서 Kimi K3에 44점을 부여했으며, 이는 오픈 웨이트 모델 중 2위로, 45점의 GLM-5.3에 이어집니다. 기록된 처리량은 초당 출력 토큰 37.9개, 첫 토큰까지 걸리는 시간은 3.80초입니다. Vals AI의 표준화된 에이전트 하네스는 이를 SWE-bench Verified에서 93.40%로 평가하며, Claude Opus 5와 DeepSeek V4 Pro에 뒤지지만 근접합니다. 또한 Frontend Code Arena에서 1679 Elo로 1위이며, 1631의 Claude Fable 5와 1618의 GPT-5.6 Sol을 앞섭니다. 한 가지 주의할 점: Intelligence Index에서 Kimi K3가 57 또는 60으로 인용된 것을 보셨다면, 이는 Artificial Analysis가 2026년 9월에 척도를 재보정하기 전의 재산정 이전 수치이므로 현재 수치와 함께 언급해서는 안 됩니다.
사용량 신호도 있으며, 이는 누구의 마케팅이 아니라 우리 자체 게이트웨이에서 나옵니다. Kimi K3는 지난 7일 동안 OrcaRouter를 통해 약 32억 7천만 토큰을 처리했는데, 이는 이 비교에서 어떤 모델보다도 많은 트래픽입니다. 그것은 품질 측정이 아닙니다. 선택의 유일한 비용이 토큰 가격일 때 개발자들이 무엇을 선택하는지를 보여주는 큰 표본이며, 고정 1M 윈도와 오픈 웨이트가 이미 실제 장기 작업에서 상당한 몫을 확보했음을 말해줍니다.

숫자가 없는 점수판
Sakana는 Fugu Max가 6개 벤치마크—Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench, SWEFish—에서 종합 최고 점수를 기록했다고 보고한다. 또한 Max가 10개 벤치마크 중 7개에서 비용 대비 성능 파레토 프런티어를 확장한다고 말한다. 둘 다 차트상의 순위에 관한 진술이다. 어느 쪽에도 값이나 격차, 경쟁사 수치가 함께 제시되지 않는다.
두 목록은 거의 겹치지 않으며, 이것이 실질적인 문제다. Kimi K3는 Terminal-Bench 2.1에서 88.3을 보고한다. Sakana는 Fugu Max가 Terminal Bench 2.1에서 종합 최고를 차지한다고 말하면서도, 그에 비교할 수 있는 수치는 아무것도 내놓지 않는다. 그 단 하나의 행이 전체 맞대결을 가장 깔끔하게 보여주는 예시다. 두 업체 모두 같은 테스트를 언급하는데, 한쪽은 숫자를 내놓고 다른 쪽은 "best"라는 단어를 내놓는다. Sakana가 그 수치를 공개할 때까지, Sakana가 앞세우기로 선택한 벤치마크에서 Fugu Max가 Kimi K3를 이기는지에 답하는 공개된 근거는 없다.
이번 릴리스에 대해서는 언급할 가치가 있는 공정한 해석이 하나 있다. Fugu Max는 비용 등급이다 — 입력 $5.00, 출력 $30.00의 성능 확장판인 Fugu Ultra v2와 같은 날 출시되었으며 — 그 주장은 점수가 아니라 달러당 점수를 기준으로 삼는 파레토 플롯 위에 그려져 있다. 그런 구도에서 보면, 벤치마크 수치만 덩그러니 제시하는 것은 덜 정직한 통계일 것이다. 문제는 이 릴리스가 분모도 빠뜨렸다는 점이다: Sakana 자체의 설명도 작업 중간에 모델을 바꾸면 컨텍스트 캐시 재사용이 줄어들고 추가 오케스트레이션 토큰이 발생할 수 있음을 인정하며, 회사가 Max의 캐시 적중률이나 작업당 총 토큰 비용을 공개하지 않았다는 점을 확인해 준다. 따라서 비용 등급 논쟁을 결판낼 바로 그 측정치가 제공되지 않은 것이다.
들 수 있는 무게, 혹은 볼 수 없는 풀장
바로 이 지점에서 두 제품은 더 이상 비교 자체가 불가능해진다.
Kimi K3는 다운로드 가능한 가중치를 제공하는데, 이는 진정한 탈출구입니다. 가격이나 조건이 바뀌더라도 모델을 자체 인프라에서 서빙할 수 있습니다. 라이선스는 '오픈 웨이트'가 보통 함의하는 것보다 더 협소합니다. OSI 승인 라이선스가 아니라 Kimi K3 라이선스이며, 이를 수정된 MIT로 설명하는 흔한 표현은 논란이 있습니다. 약관은 연속 12개월 동안 매출 2천만 달러를 초과하는 모델 서비스(MaaS) 사업의 경우 Moonshot과 별도 계약을 요구하며, 월간 사용자 1억 명 또는 월 매출 2천만 달러를 초과하는 제품에는 출처 표시를 요구합니다. 내부 사용은 예외입니다. 그리고 실질적인 규모는 실제로 만만치 않습니다. 체크포인트는 약 1.5테라바이트이고 Moonshot은 64개 이상의 가속기를 권장하므로, 자체 호스팅은 노트북으로 결정할 일이 아니라 추론 클러스터로 결정할 일입니다.
Fugu Max는 그중 아무것도 제공하지 않는다 — 가중치도, 검사 가능한 풀도, 셀프 호스팅 옵션도 — 그 대신 라이선스 조건을 부과하지 않는데, 라이선스할 것이 없기 때문이다. Sakana가 내세우는 이점은 통제의 반대다: 오픈 가중치와 특화 모델에 걸쳐 있는 풀은, Max를 위해 NVIDIA Nemotron 제품군으로 확장되어, 단일 업스트림 공급업체의 지원 중단이나 가격 변경이 당신의 제품을 무너뜨릴 수 없음을 의미한다. 그것은 실질적인 헤지다. 또한 외부에서는 검증할 수 없는데, 멤버십이 의도적으로 공개되지 않기 때문이며, 이는 Fugu Max 결과가 Kimi K3 결과에는 없는 만료 기한을 지닌다는 뜻이다.
오픈 웨이트와 비공개 풀은 같은 두려움에 대한 서로 다른 두 가지 답이다. 하나는 떠날 수 있다고 말한다. 다른 하나는 떠날 것이 없다고 말한다.
평면 창이 결정을 내리는 곳
Kimi K3의 1,048,576토큰 컨텍스트는 균일합니다 — 장문 컨텍스트 등급도 없고, 어떤 길이에서도 추가 요금이 없습니다. Fugu Max의 릴리스는 윈도우를 전혀 명시하지 않으므로, 비교할 대상도 없고 계획을 세울 기준도 없습니다. 두 제품이 겨냥하는 장기 과제형 에이전트 코딩에서는 세션이 수명의 대부분을 컨텍스트 깊은 곳에서 보내는데, 그 비대칭성은 요금표보다 더 중요합니다.
속도는 같은 문제의 거울상이다. Kimi K3의 초당 37.9토큰과 첫 토큰까지 걸리는 시간 3.80초는 측정된 수치이며, 이는 느리다 — 긴 루프를 중심으로 만들어진 모델에게는 실질적인 제약이고, Artificial Analysis는 이를 특히 장황하다고 지적한다. Sakana는 Fugu Max에 대해 지연 시간이나 처리량 수치를 전혀 공개하지 않았는데, 오케스트레이터의 경우 이는 회피라기보다 오히려 정직한 태도라고 할 수 있다: 응답 시간은 어떤 모델을 선택하고 몇 번의 패스를 거치는지에 달려 있기 때문이다. 하지만 그 때문에 직접 측정하지 않고서는 전환의 실제 소요 시간을 모델링할 수 없다. 이전 Fugu Ultra의 경우, 사용자들은 실행 시간이 30분에 육박했다고 공개적으로 보고했다. 그것은 2026년 6월 모델이며 Max에 관한 증거는 아니지만, 벤치마크할 때 넘어서야 할 숫자다.

사카나 자신의 표현으로 본 평결
Sakana는 Kimi K3를 Fugu Max가 더 낮은 가격을 제시하는 세 모델 중 하나로 꼽았고, 출력 요금에서는 그 주장이 성립한다: $6.00 대 $15.00은 60퍼센트 더 낮으며, 이는 명시된 범위의 정확히 상단이다. 발표 내용을 그대로 믿으면 Fugu Max가 더 저렴한 제품이다.
이제 그 릴리스가 피했던 잣대를 적용해 보자. Kimi K3는 입력에서 33퍼센트, 출력에서 150퍼센트 더 비싸다. 그런데 그 돈을 내면 재가격 절벽이 없는 1M 토큰 윈도, 수익 조건부 라이선스 아래의 다운로드 가능한 체크포인트, 독립적인 Intelligence Index 순위 44위, 표준화된 SWE-bench Verified 점수 93.40%, Frontend Code Arena 1위, 그리고 이 비교에 포함된 어떤 모델보다 가장 많은 실제 트래픽을 얻는다. Fugu Max는 토큰의 입력과 출력 양쪽 모두에서 더 낮은 요율, 정량화되지 않은 벤치마크 승리 6개, 공개된 적중률 없이 K3의 절반인 캐시 요율, 그리고 검사할 수 없는 풀을 제공한다.
솔직한 결론은 Sakana가 가격에서 자신에게 유리하게 작용하는 잣대를 골랐고, 능력에 관해서는 당신이 확인할 수 있는 어떤 것도 주지 않았다는 것입니다. 당신의 워크로드가 대용량이고, 당신의 작업이 코디네이터가 안정적으로 분해할 수 있는 종류라면, 요율 차이는 실질적인 비용이며 Fugu Max는 첫 요청부터 토큰 회계를 켠 상태로 범위를 정한 파일럿을 진행할 가치가 있습니다. 이번 분기에 정당화할 수 있는 프로덕션 결정이 필요하다면 — 계획을 세울 수 있는 기간, 제시할 수 있는 점수, 그리고 공급업체가 사라져도 여전히 실행할 수 있는 모델 — Kimi K3가 답이며, 그것은 OrcaRouter에서 Moonshot의 정가로, 제공업체의 요율이 그대로 전달된 채로 제공됩니다.

