
Ember-1, Kimi K3의 추론 능력 40% 감축 — 진짜 핵심은 세부 조항에 있다
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
회자될 숫자는 40%다. Fireworks Research는 2026년 9월 23일 Ember-1을 공개하며, 이를 Moonshot AI의 Kimi K3를 특화한 파생 모델로서 K3의 정확도를 유지하면서도 그 수준에 도달하는 데 약 40% 더 적은 토큰을 쓴다고 설명했다. 이는 실재하고 유난히 구체적인 주장이며, 여기에는 세 가지가 함께 따라온다. 토큰 절감 열이 포함된 전체 벤치마크 표, 프로덕션 코딩 트래픽에서 나온 두 건의 고객 A/B 테스트, 그리고 일반 제공(GA)이 아닌 출시 상태다. Ember-1은 연구 프리뷰로, 벤더 자체의 서버리스 플랫폼에서, 2주간의 접근 기간과 수요에 따라 달라지는 영구 제공 여부 결정과 함께 나왔다. 이 중 어느 부분이 출시된 제품이고 어느 부분이 잘 논증된 연구 결과인지 이해하는 것이 이 모든 작업의 핵심이다.
또한 무엇보다 먼저 해소해 둘 가치가 있는 이름 충돌이 있습니다. Slow Lit Labs의 별도 공개 연구 프로젝트인 Ember(v0.1.5)는 2026년을 장기 지평 일관성 평가들을 발표하는 데 보냈으며, 이 모델과는 전혀 관련이 없습니다. 추론 설정을 동일하게 맞췄을 때 Ember가 Qwen3-8B를 이기지 못했다는 내용을 어디에서 읽든, 그것은 그 프로젝트에 관한 것입니다. 여기서 다루는 Ember-1은 Fireworks Research의 Kimi K3 파생 모델입니다.
Ember-1이 실제로 무엇인가
Ember-1은 새로운 아키텍처도 아니고 새로운 베이스 모델도 아닙니다. 이것은 Kimi K3이며, 더 간결하게 추론하도록 재훈련되었습니다. Fireworks Research는 자사의 서버리스 훈련 스택에서 50개 이상의 훈련 실험과 200개 이상의 평가를 수학, 코딩, 지시 따르기, 대화, 검색, 도구 사용 및 소프트웨어 공학에 걸쳐 실행했으며, 명시적인 목표는 답을 바꾸지 않는 추론을 제거하는 것이었습니다. 연구소는 일곱 개의 벤치마크와 두 개의 고객 프로덕션 트래픽 세트에서 정확도 손실 없이 추론 길이를 35~50% 줄일 수 있다고 말합니다. 그 수치 중 어느 것도 벤더가 보고한 것이며 독립적으로 재현되지 않았습니다. 작성 시점 기준으로 제3자가 Ember-1의 실행 결과를 발표한 적이 없습니다.
프레이밍이 중요한 이유는 뻔한 대안이 이미 존재했기 때문이다. Kimi K3에는 추론 노력 설정이 기본으로 제공되며, 토큰을 더 적게 쓰는 저렴한 방법은 노력 수준을 낮추는 것이다. Fireworks Research는 그 방법을 시도했지만 낮은 설정이 품질을 너무 많이 희생했다고 말한다 — 이는 추론 모델에서 노력 수준을 조정해 본 사람이라면 누구나 익숙한 결과다. Ember-1의 주장은 노력 다이얼은 거칠고 재학습은 세밀하다는 것이다.

추론 토큰이 이만큼의 노력을 들일 가치가 있는 이유
추론 모델의 비용은 답변이 대부분을 차지하지 않는다. Fireworks Research에 따르면 K3는 사용자가 보는 내용을 쓰기 전에 생성된 토큰의 90% 이상을 내부 추론에 사용할 수 있다. 단일 요청에서는 그저 비용이 많이 들 뿐이다. 멀티턴 에이전트 루프에서는 이 비용이 누적되는데, 각 턴이 이전 대화를 재생하기 때문에 이전 턴의 추론 흔적이 이후 호출마다 다시 읽히고 다시 청구되기 때문이다. Fireworks Research는 컨텍스트가 턴 수에 따라 대략 제곱으로 증가한다고 설명한다. 바로 그것이 이번 릴리스의 실제 목표이며, 대표 지표가 품질 도약이 아니라 약 40% 더 적은 토큰인 이유이다.
이 메커니즘은 위험도 설명한다. 낭비되는 숙고를 제거하는 압축은 비용이 들지 않지만, 모델이 필요로 했던 단계를 제거하는 압축은 그렇지 않다. 지나치게 공격적인 추론 축소의 널리 보고된 실패 모드는 모델이 중간 점검을 건너뛰고 결론으로 도약하는 것이며, 이는 에이전트에서는 잘못된 문장이 아니라 훨씬 나중에 잘못된 도구 호출로 나타난다. Fireworks Research가 동등한 품질을 거듭 강조하는 것은 그 우려에 대한 답으로 읽히며, A/B 수치들은 그것을 뒷받침하는 가장 가까운 증거에 해당한다 — 다만 테스트 세트와 통과 기준, 표본 크기가 모두 주장을 하는 측에 의해 선택되었다는 늘 있는 주의점이 따른다.
출처가 함께 첨부된 벤치마크 시트
재현되지 않은 Fireworks Research의 수치입니다. 오른쪽 열이 눈여겨볼 만한 부분인데, 각 점수를 K3 Max 대비 얼마나 많은 토큰과 달러가 들었는지와 짝지어 보여줍니다.
• Terminal Bench 2.1(n=89) — Ember-1 82.0% vs K3 Max 80.9%, K3 High 77.6%, K3 Low 76.4%; 토큰 51.9% 감소, 작업당 $23.10 절감.
• SWE-bench Verified(n=500) — Ember-1 92.2% vs K3 Max 93.2%; 토큰 15.5% 더 적음, 작업당 $68.10 절감.
• SWE-Interact (n=75) — Ember-1 20.0% 대비 K3 Max 21.3%, K3 High 13.3%, K3 Low 6.7%; 토큰 32.5% 감소.
• DeepSWE 1.1 (n=113) — Ember-1 75.2% 대 K3 Max 66.4%; 토큰 23.7% 더 적음, 작업당 $126.90 더 적음.
• τ-2 Bench Airline (n=50) — Ember-1 66% vs K3 Max 64%, K3 High와 Low 모두 64%; 토큰 5.9% 감소, 작업당 $0.30 절감.
두 가지가 눈에 띕니다. 첫째, Ember-1은 Terminal Bench 2.1과 DeepSWE 1.1에서는 완승을 거두지만 SWE-bench Verified와 SWE-Interact에서는 근소하게 뒤집니다. 이는 모델이 역량을 잃었다기보다는 어떤 작업에 숙고를 쏟는지가 바뀌었음을 시사하는 양상입니다. 둘째, 토큰 절감 폭은 극도로 불균일합니다. Terminal Bench에서는 51.9%인 반면 τ-2 Airline에서는 5.9%입니다. Ember-1이 무엇을 학습했든, 그것은 사고에 대한 일률적인 40% 삭감이 아닙니다. 헤드라인의 "약 40%"는 대략 6%에서 약 52%에 이르는 범위에 걸친 평균이며, 워크로드가 τ-2 Airline과 비슷한 팀은 그 효과를 체감할 것으로 기대해서는 안 됩니다.
프로덕션 A/B 테스트가 더 설득력 있는 증거다. 그것들이 벤치마크로 만들어진 것이 아니라는 점이 바로 그 이유다. 한 고객의 코딩 워크로드에서 Ember-1은 K3의 0.751에 맞서 0.753점을 기록했고, 23.8단계 대비 21.4단계를 걸렸으며, 49.3K 대비 29.9K 출력 토큰을 생성했다 — 추론 토큰은 71.3%, 총 토큰은 39% 줄었고 품질은 대략 동등했다. 두 번째 고객은 비슷한 품질에서 작업당 토큰이 약 35% 줄어든 것을 확인했으며, Fireworks Research는 자사 내부 코딩 및 코워킹 트래픽에서 먼저 전환을 실행했다고 말하는데, 보고된 결과는 아무도 눈치채지 못했다는 것이었다. 이 모든 것을 벤더 보고로 간주하되, 벤더 보고 중 가장 강력한 형태로 간주하라. A/B 선호도와 작업 완료 데이터는 리더보드보다 조작하기가 더 어렵다.
한 가지 평가가 더 있습니다. Doximity의 Bedside Bench — 열 개 범주에 걸친 500개의 의사 검증 임상 사례 — 에서 Fireworks Research는 Ember-1이 작업당 비용에서 새로운 파레토 프런티어를 세웠다고 주장하며, GPT-5.6 Sol, GPT-6 Astra, Claude Opus 5를 포함한 오픈 및 클로즈드 모델과 비교합니다. 이는 파레토 위치에 관한 벤더 주장이고, 이는 단일 점수가 아니라 2차원적 트레이드오프에 관한 주장이며, 그 배후의 비용 가정만큼만 타당합니다. 그 가정은 Kimi K3의 공개 API 요금표에서 나왔습니다. 그렇다면 이제 오늘날 독자가 실제로 검증할 수 있는 이야기의 대목으로 넘어가 보겠습니다.

베이스 모델은 이미 라우팅할 수 있는 부분입니다.
Ember-1의 전체 비용 논거는 Kimi K3의 공개 요율을 기준으로 측정됩니다. Kimi K3는 OrcaRouter에서 서비스 중입니다. 입력 토큰 100만 개당 $3.00, 캐시된 입력 토큰 100만 개당 $0.30, 출력 토큰 100만 개당 $15.00이며, 컨텍스트 창은 1,048,576토큰입니다. 이는 Fireworks Research 비교에서 사용하는 것과 동일한 요율표이며, 해당 토큰 절감 열의 절감액이 공급업체의 내부 비용 모델이 아니라 직접 확인할 수 있는 수치를 기준으로 계산된다는 점을 알아 둘 가치가 있습니다.
Ember-1 자체는 OrcaRouter에 없습니다. 그것은 벤더 자체의 서버리스 플랫폼을 통해서만 연구 프리뷰로 이용할 수 있으며, Fireworks Research는 이에 대한 가격을 공개하지 않았습니다 — 따라서 벤치마크 표의 달러 수치는 실제로 존재하는 Ember-1 요금표가 아니라 K3 요율과 토큰 수에서 도출된 것입니다. 관심 있는 것이 산술이라면, 정직한 순서는 오늘 K3의 경로로 워크로드 가격을 책정하고, 토큰 감소 비율을 전환이 얻을 수 있는 것의 상한으로 삼고, 절감액을 금액으로 모델링하기 전에 공개된 요율을 기다리는 것입니다.
이 지점에서 OrcaRouter가 도움이 되는 부분은 바로 헤지입니다. 2주짜리 접근 기간이 있는 리서치 프리뷰는 프로덕션 경로를 걸지 않고 시험해 보고 싶은 바로 그런 종류의 모델이며, 별도의 계약 없이 그렇게 하는 방법은 호출하는 다른 모든 대상과 동일한 엔드포인트 뒤에 두는 것입니다. OrcaRouter는 200개 이상의 모델을 자동 페일오버를 갖춘 하나의 API 뒤에서 제공하므로, 다음 달에 사용할 수 없게 되는 프리뷰 모델은 마이그레이션이 아니라 라우팅 변경에 그칩니다. Ember-1에 그것이 반드시 필요한 것은 아니지만, 2주짜리 기간이 그것을 반대할 이유도 되지 않습니다.
이 릴리스를 어떻게 처리할지
이미 에이전트 루프에서 Kimi K3를 실행하고 있다면, Ember-1의 수치는 여러분의 청구서를 그대로 보여줍니다. 멀티턴 리플레이 문제는 실재하며, 긴 에이전트 실행에서 가장 큰 비용을 차지합니다. 그리고 답변을 바꾸지 않으면서 자체 트레이스를 단축하는 모델은 평가할 시간을 들일 가치가 있습니다. 올바른 테스트는 벤치마크 표가 아니라, 섀도우로 실행하는 자체 트래픽입니다 — 실제 요청의 일부를 두 모델 모두에 보내고, 출력을 비교하고, 무엇이든 바꾸기 전에 1~2주 동안 라이브 결과는 그대로 두세요. 그것은 또한 이번 릴리스의 비판적인 독자층이 하고 있는 조언이며, 타당합니다.
지연 시간이 짧은 단일 턴 호출이 주를 이루는 워크로드나 숙고가 적은 워크로드를 실행한다면 절감 효과는 대부분 사라지고, τ-2 Airline 행이 현실적인 기대치입니다. 그리고 가격, 서비스 수준, 6개월 후에도 엔드포인트가 존재한다는 보장 같은 프로덕션급 약속이 필요하다면, Ember-1은 아직 그런 것을 제공하지 않습니다. 이는 연구 프리뷰로, Fireworks Research가 그 지속성을 수요에 명시적으로 연결하고 있습니다. 다음 달의 흥미로운 질문은 2주짜리 윈도가 영구적인 서빙 옵션이 될지, 그리고 제3자가 이 수치 중 일부를 재현할 수 있을지입니다. 그중 하나가 실현되기 전까지, 이는 읽기에는 강력한 결과지만 예산을 세우기에는 빈약한 결과입니다.

그중 어느 것도 이 작업을 깎아내리는 것으로 읽혀서는 안 된다. 추론을 제거하되 정확도는 제거하지 않는 것은 추론을 추가하는 것보다 더 어려운 문제이며, 그것을 자체 모델을 훈련하는 대신 다른 누군가의 프런티어 모델 위에서 하는 것은 2026년의 많은 역량 연구가 취해 온 형태다. Ember-1은 Fireworks Research가 계속 이어질 시리즈가 될 것이라고 밝힌 것의 첫 번째 릴리스이며, 그 템플릿 — 이미 좋은 모델을 가져와 그 행동의 한 축을 재훈련하고, 그 델타를 토큰으로 판매하는 — 은 이 특정 프리뷰가 어떻게 귀결되든 주목할 가치가 있다.
