
Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: 저렴한 쪽은 질문에 답하지 못한다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
조달 스프레드시트가 가장 중요하게 여기는 두 가지 수치만 놓고 보면, 더 저렴하고 더 빠른 모델이 이깁니다. Nemotron 3.5 Lightning 30B A3B Base는 초당 출력 토큰 298.9개로 작동해 독립적으로 추적된 142개 모델 중 가장 빠르며, 백만 입력 토큰당 비용은 $0.06으로 Claude Haiku 5.5의 $0.10과 대비됩니다. 또한 이름에 있는 ‘Base’라는 단어가 경고하듯, 이것은 어시스턴트가 아닙니다. 이는 사전 학습된 체크포인트입니다 — 지도 미세 조정도, 강화 학습도, 이름값을 하는 채팅 템플릿도 없으며 — 2026년 8월 11일 OpenMDW-1.1 라이선스로 공개되어 다른 사람들이 그 위에 구축할 수 있게 했습니다. 2026년 10월 7일 출시된 Claude Haiku 5.5는 질문을 보낼 수 있는 완성된 제품입니다. 이 둘을 가격으로 비교하는 것은 밀가루 가격과 빵 가격을 비교하는 것과 같으며, 이 맞대결에서 흥미로운 부분은 여러분의 워크로드가 실제로 어느 쪽을 필요로 하는지 알아내는 것입니다.
출시 보도 어디에서도 그 부분을 명확히 말하지 않는다. "Claude Haiku 5.5보다 더 저렴하고 빠르다"가 "더 저렴하고, 더 빠르지만, 파인튜닝 실행 없이는 사용할 수 없다"보다 더 좋은 헤드라인이기 때문이다. 두 진술 모두 사실이다. 유용한 것은 그중 하나뿐이다.
각 모델이 실제로 무엇인지
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, 2026년 10월 7일 출시. 텍스트와 이미지 입력, 텍스트 출력. 1M 토큰 컨텍스트, 최대 출력 128,000 토큰(Batch API에서 베타 헤더를 사용하면 300,000), 2026년 6월 학습 컷오프, 지원 종료는 2027년 10월 7일 이전에는 없음. 노력 수준은 Low, Medium, High, Xhigh, Max로 조정 가능하며 기본값은 Medium이고, 적응형 사고가 기본적으로 켜져 있습니다. 종량제 API, 캐시 읽기는 100만 토큰당 $0.01, Batch는 절반 요금. Anthropic의 API를 통해 제공되며, 거기에서 Anthropic 모델이 재판매되는 모든 곳에서 이용 가능합니다.
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, 2026년 8월 11일 발표. 토큰당 약 30억 개의 활성 파라미터를 갖춘 300억 파라미터 하이브리드 전문가 혼합(MoE) 체크포인트로, Mamba-2 + MoE + 어텐션 스택을 기반으로 하며 Nemotron 3 Ultra에서 증류되었고 MTP, DFlash, DSpark 추측 디코딩을 제공합니다. 컨텍스트는 100만 토큰까지 지원하지만, 단일 H100에서 실질적인 상한은 약 256,000입니다. 텍스트 전용입니다. 가중치는 OpenMDW-1.1에 따라 공개되어 있습니다. 그리고 이는 베이스 체크포인트입니다: 명령 튜닝이 없는 원시 사전 학습 가중치로, 지시를 따르기보다 텍스트를 완성합니다.

• 치수, 각각 한 줄씩
• 입력 가격 — Claude Haiku 5.5는 100K 토큰까지 백만 토큰당 $0.10, 이후 $0.50; Nemotron 3.5 Lightning 30B A3B Base는 백만 토큰당 $0.06.
• 출력 가격 — 100만 토큰당 $0.50에서 10만 토큰까지, 이후 $2.50, 100만 토큰당 $0.20 대비.
• 완료된 작업당 비용 — Claude Haiku 5.5의 경우 독립적인 인덱스 작업당 $0.21로, Nemotron의 $0.09와 대비된다 — 더 저렴한 모델은 토큰당 비용만이 아니라 작업당 비용도 더 저렴하다.
• 출력 속도 — Claude Haiku 5.5의 경우 초당 243.4 토큰, 182개 중 9위; Nemotron의 경우 초당 298.9 토큰, 142개 중 1위.
• 첫 토큰까지 걸리는 시간 — Claude Haiku 5.5는 약 0.3초, Nemotron은 0.54초.
• 독립 점수 — Claude Haiku 5.5의 Artificial Analysis Intelligence Index는 43, 182개 중 2위이며, Max 구성에서는 43.40; Nemotron의 Index는 13, 142개 중 29위.
• 컨텍스트 윈도우 — 각각 1,000,000토큰이며, 단일 H100에서 Nemotron의 경우 실용적으로는 대략 256,000토큰입니다.
• 모달리티 — Claude Haiku 5.5는 텍스트와 이미지 입력 지원, Nemotron은 텍스트만.
• 가중치 — OpenMDW-1.1에 따른 오픈과 대비되는 독점, 총 30B 및 활성 3B 하이브리드 MoE.
• 인스트럭션 튜닝 — Claude Haiku 5.5에는 있지만, Base checkpoint에는 없습니다.
"Base" 문제, 쉽게 말하면
베이스 체크포인트는 다음 토큰을 예측한다. 여기에 질문을 던지면, 답변을 하기보다는 그러한 질문이 들어 있을 법한 문서의 문체로 텍스트를 이어가는 경우가 많다. "Summarise this contract"라고 프롬프트하면, 베이스 모델은 당신의 계약서 요약이 아니라 법률 학습 문서를 그럴듯하게 이어 쓴 결과를 내놓을 수 있다. NVIDIA가 별도의 BF16 체크포인트와 별도의 인스트럭션 튜닝된 형제 모델들을 공개하는 이유는 바로 베이스 가중치가 원재료이기 때문이다.
NVIDIA 자체 모델 카드에서 — 공급업체가 보고한 수치이며 독립적으로 재현된 것이 아님 — 기본 체크포인트는 MMLU 78.59, MMLU-Pro 67.94, GSM8K 91.28, HumanEval 77.44, 그리고 1M 토큰에서 RULER 69.62를 기록한다. 튜닝된 형제 모델에 대한 Lightning 카드는 MMLU-Pro 81.94, GPQA Diamond 75.44, SWE-Bench Verified 51.56, PinchBench 86%를 보고하며, 대체한 모델보다 추론 속도가 약 30% 더 빠르다. 튜닝된 수치조차 NVIDIA 자체 수치이며, 이 글 제목에 명시된 체크포인트에 적용되는 것은 기본 수치다. 이에 비해 Claude Haiku 5.5의 독립적으로 측정된 43.40 — Artificial Analysis 지수에서 182개 중 2위이며, 다른 것을 측정하는 다른 지수다 — 은 직접 비교할 수 없고, 솔직한 해석은 30B 기본 체크포인트와 완성된 소형 모델이 서로 다른 목적을 위해 서로 다른 도구로 채점되고 있다는 것이다.
유보 없이 말할 수 있는 것은 격차의 형태다. 무엇이든 답하기 전에 파인튜닝 파이프라인, 서빙 스택, 평가 하네스가 필요한 베이스 체크포인트는 백만 개당 $0.10인 호스팅 모델의 대체재가 아니다. 그것은 모델을 직접 소유하고자 하는 사람을 위한 출발점이다.
Nemotron이 진정으로 승리하는 곳, 그리고 그것은 위로상이 아니다
속도가 먼저다. 초당 298.9개의 출력 토큰은 142개 모델 순위표에서 1위에 올려놓는다 — Claude Haiku 5.5의 243.4보다 23% 더 빠르다. 지연 시간에 민감한 파이프라인에게 이것은 실질적이고 측정 가능한 차이이며, "Lightning"이라는 이름이 박스에 붙어 있는 이유다.
오픈 웨이트가 두 번째이고, 이쪽이 더 큰 사안입니다. OpenMDW-1.1에 따라 체크포인트를 내려받고, 자체 데이터로 파인튜닝한 뒤, 직접 서빙할 수 있습니다. Claude Haiku 5.5는 파인튜닝이 전혀 불가능하고, 어떤 가격을 지불하더라도 셀프 호스팅할 수 없습니다. 독자적인 과업, 특이한 입력 분포, 또는 트래픽이 자체 인프라를 절대 떠나지 않아야 한다는 규정 준수 요건을 가진 팀에게는, 벤치마크 페이지가 뭐라고 하든 그 차이가 결정적입니다. 총 30B에 활성 3B라는 점도 경제적으로 서빙할 수 있을 만큼 작습니다 — 아키텍처는 바로 그런 용도를 위해 설계되었습니다.
가격, 세 번째: 백만 토큰당 입력 $0.06, 출력 $0.20에 17% 캐시 할인과 인덱스 작업당 $0.09로, Claude Haiku 5.5의 $0.21의 대략 절반 수준이다. 두 모델 모두 저렴하지만, Nemotron이 더 저렴하다.
Claude Haiku 5.5가 앞서는 부분, 바로 답이 필요한 모든 차원
지시 수행 — 이를 위해 훈련되었기 때문이다. 독립적 역량 — Index 43 대 13, 두 항목 모두 점수를 매긴 평가표에서 30점 격차로, 이 비교 세트에서 가장 큰 격차다. 이미지 입력 — Nemotron은 이를 전혀 받지 않는다. 최대 출력 128,000토큰 대 비공개 수치, Batch에서 300,000토큰 베타 경로 제공. 그리고 노력 다이얼 — 모델을 다시 구축하는 대신 추론 노력도를 낮춰 비용을 되찾을 수 있게 한다.
장황함에 관한 주의점은 여기서 양방향으로 작용한다. Artificial Analysis의 평가 스위트에서 Claude Haiku 5.5는 약 4억 4천만 개의 출력 토큰을 생성하는데, 이는 중앙값 약 1억 개와 대비된다 — 그것은 생각을 무척 많이 한다. Nemotron은 약 1억 2천만 개를 생성하는데, 같은 출처는 이를 자체 크기에 비해 다소 장황하다고 설명한다. 그럼에도 Haiku 5.5의 작업당 비용은 $0.21로, Nemotron의 $0.09와 대비된다. 따라서 말이 많은 모델조차 비싼 쪽은 아니다. 이것이 시사하는 바는 토큰당 가격은 양방향으로 오해를 낳으며, 예산을 책정할 기준은 작업당 수치라는 것이다.
셀프 호스팅 대 하나의 엔드포인트
Nemotron 3.5 Lightning 30B A3B Base는 오픈 웨이트로 배포되며 여러 추론 제공업체에서 서빙됩니다. NVIDIA는 튜닝된 형제 모델들도 공개합니다. Claude Haiku 5.5는 Anthropic의 API를 통해 이용할 수 있으며, 거기서부터 Anthropic의 모델이 재판매되는 곳이라면 어디든 제공됩니다. 둘 다 OrcaRouter의 카탈로그에 없으며, 우리는 그렇지 않은 척하지 않겠습니다 — 이 인근에서 우리가 라우팅하는 것은 anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 그리고 anthropic/claude-fable-5.1, 이 글의 주제보다 한 단계 위 티어입니다.
이 비교가 설명하는 두 경로는 실제로 근본적으로 다른 배관을 갖추고 있으며, 이름을 붙여둘 가치가 있습니다. 셀프 호스팅 경로는 GPU, 서빙 프레임워크, 양자화 결정, 그리고 운영 교대 근무를 의미합니다. 호스팅 경로는 키 하나와 모델 문자열 하나를 의미합니다. OrcaRouter는 두 번째 경로를 위해 존재합니다: 200개 이상의 모델을 위한 하나의 API, 하나의 키와 하나의 청구서, 벤더의 가격 인하가 같은 날 반영되도록 0% 마크업으로 그대로 전달되는 공급자 정가, 그리고 그 밑에 깔린 자동 장애 조치. 이것은 30B 기본 체크포인트로 가는 경로가 아니며, DGX급 장비를 구매하는 것도 호스팅된 소형 모델로 가는 경로가 아닙니다.

누가 무엇을 골라야 할까
작업이 잘 정의되어 있고, 학습 데이터가 충분히 많아 중요하며, 트래픽이 자체 인프라를 벗어날 수 없다면, Nemotron 3.5 Lightning 30B A3B Base가 더 흥미로운 대상입니다: 출력 속도에서 142개 중 가장 빠르고, 토큰당 가격은 절반이며, 직접 수정할 수 있습니다. 절감액을 계산하기 전에 파인튜닝 실행과 서빙 비용을 예산에 넣으세요. $0.06 입력 요금은 누군가가 이미 체크포인트를 어시스턴트로 바꾸는 작업을 해두었다고 가정하기 때문입니다.
오늘 오후에 프롬프트를 보내고 답을 받고 싶다면, Claude Haiku 5.5가 바로 그 일을 해냅니다 — 독립 지수에서 13에 맞선 43, 이미지 입력, 128,000토큰 출력 상한, 그리고 정말로 저렴한 가격. 비교는 가격표에서만 비슷해 보입니다. 문서를 이어 쓰는 것이 아니라 질문에 답하는 것이 과제가 되는 순간, 더 이상 비슷해 보이지 않습니다.

