
LLM 라우터란 무엇인가? 모델 선택 계층, 실제 수학, 그리고 이를 건너뛰어야 할 때
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
LLM 라우터는 애플리케이션과 모델 제공자 사이에 위치하는 소프트웨어 계층으로, 모든 요청에 대해 어떤 모델이 응답할지 결정합니다. 즉, 값싸고 빠른 모델(예: DeepSeek V4 Flash)은 쉬운 작업에 사용되고, 프론티어 모델(예: Claude Opus 5)은 정말 어려운 작업에 사용됩니다. 핵심은 비용입니다. DeepSeek V4 Flash는 입력 토큰 100만 개당 $0.09이고 Claude Opus 5는 $5.00입니다. 2026-08-10 기준 OrcaRouter 모델 카탈로그의 제공자 직접 요금으로, 같은 호출에서 55배 차이입니다. 쉬운 트래픽의 80%를 아래로 보내고 어려운 20%를 위로 유지한다면, 대부분의 팀이 손대지 않는 가장 큰 비용 절감 수단을 활용하는 것입니다.
LLM 라우터가 실제로 무엇인지
마케팅을 걷어내면 모델 라우터가 하는 일은 세 가지인데, 모두 지루하면서도 모두 가치 있는 일입니다. 단일 엔드포인트입니다. 각 제공업체별 SDK 대신 하나의 OpenAI 호환 URL을 호출하면 됩니다. 요청을 평가하여 난이도를 추정한 다음 라우팅합니다. 쉬운 작업은 저렴한 모델로, 진짜 어려운 추론은 프론티어 모델로 보냅니다. 그리고 장애 조치도 처리합니다. 선택한 제공업체가 요청을 제한하거나 5xx 오류를 반환하면, 라우터가 정상 모델로 재시도하므로 애플리케이션이 오류를 보지 못합니다.
의사 결정 단계에서 라우터는 서로 달라지며, 그 스펙트럼은 익숙한 모습입니다. 규칙 기반 라우터는 키워드나 프롬프트 길이를 모델에 매칭합니다. 밀리초 미만으로 동작하고 예측 가능하지만, 가격이나 모델이 바뀌면 취약합니다. 의미 기반 라우터는 프롬프트를 임베딩하여 의미로 라우팅하므로, "내 잔액이 얼마야?"와 "돈이 얼마나 있어?"는 같은 경로로 향합니다. 학습 기반 라우터는 실제 트래픽을 관찰하고 품질 대비 비용에서 우위를 보이는 모델 쪽으로 전환합니다. 각 메커니즘의 작동 방식(다양한 분류기 유형의 정확도 범위와 모든 프롬프트를 평가하는 자동 모드 포함)은 가이드 Auto Router for LLMs에서 자세히 다룹니다. 여기서 핵심은 라우팅 지능이 스펙트럼 위에 존재하며, 어떤 지점이 필요한지는 기능 체크리스트가 아닌 제품 결정이라는 점입니다.

Wi-Fi 하드웨어에 NPU가 내장된 제품에도 "AI 라우터"라는 이름이 사용되는 것을 보셨을 수도 있습니다. 이는 이름만 같은 전혀 다른 제품이며, 이에 대한 설명은 AI 라우터 가이드에서 다룹니다. 이 글의 모든 내용은 소프트웨어 범주에 관한 것입니다.
가격 스프레드가 바로 수익을 내는 이유입니다.
라우터는 모델 간 가격 차이가 클 때만 제 역할을 하며, 지금 그 차이는 엄청납니다. 아래의 모든 요금은 2026-08-10에 조회한 OrcaRouter 모델 카탈로그 기준 프로바이더 직접 가격으로, 1M 토큰당 가격입니다.

스프레드를 읽으면 논쟁이 저절로 쓰인다. DeepSeek V4 Flash의 $0.09와 Claude Opus 5의 $5.00는 입력 토큰만으로도 약 55배 차이이며, 저가 티어와 최전선 티어 사이의 격차는 이제 일회성 할인이 아니라 시장의 영구적 특징이 되었다. 트래픽이 전형적인 혼합 — 대부분의 짧고 명확하게 지정된 요청과 소수의 진짜 어려운 추론 —이라면, 모든 것을 최전선에서 실행하는 것은 쉬운 80%에 대해 최고 가격을 지불하는 것을 의미한다.
이것이 바로 현재 "llm router"에 대한 첫 페이지 결과가 실망스러운 이유입니다. 예를 들어 Decagon의 용어집 항목은 "GPT-4o, Claude 3.5 Sonnet 및 Gemini 1.5 Pro"를 "백만 입력 토큰당 $5–15"로 인용합니다. 이는 2년 전에 최신이었고 가격이 오늘날의 약 두 배였던 모델들입니다. 시장은 움직였지만 정의는 그대로입니다. 이것이 날짜가 없는 LLM 라우터 설명을 신뢰하지 말아야 하는 가장 큰 이유입니다.
저축 연구가 실제로 말하는 것
위의 계산은 실제이며, 연구도 실제입니다. 하지만 정직한 그림은 단일 숫자가 아니라 범위입니다.

다음은 계산 과정을 정리한 내용입니다. 가정을 명시해 두었으니 필요에 따라 조정하시면 됩니다. 월 100,000건의 대화를 처리하는 지원 봇이 있고, 각 대화는 1,000개의 입력 토큰을 보내고 200개의 출력 토큰을 생성한다고 가정합니다. 모든 것을 Claude Sonnet 5로 처리하면 월 비용은 약 400달러입니다. 쉬운 80%는 DeepSeek V4 Flash로 라우팅하고 어려운 20%는 Claude Sonnet 5에 유지하면, 동일한 트래픽 비용은 약 90달러로 줄어듭니다. 대략 78% 더 저렴한 셈이며, 프롬프트 캐싱을 적용하기 전 기준입니다. 캐싱을 적용하면 그 차이는 더욱 벌어질 것입니다.
핵심 요점: 트래픽이 대부분 쉬운 경우 공격적 라우팅은 60~85%를 절약하고, 균형 라우팅은 35~45%를 절약하며, 보수적 라우팅도 10~15%를 절약합니다. 여러분의 정확한 수치는 트래픽의 속성에 따라 달라지며, 직접 프롬프트로 측정한 값입니다 — 블로그 게시물에서 복사할 수 있는 상수가 아닙니다.
라우팅이 숨기는 세 가지 비용
아무도 용어집 항목에 넣지 않는 두 가지 비용은 지연 시간과 정확도이며, 더 미묘한 세 번째 비용이 있습니다.
지연 시간. 모든 라우팅 요청은 모델이 시작되기도 전에 분류 비용을 지불합니다. 규칙 기반 분류기는 1밀리초 미만이고, 소규모 임베딩이나 분류 모델은 약 50~200ms를 추가하며, 훈련된 도메인 분류기는 그보다 더 많은 시간이 걸립니다. 좋은 라우터는 업스트림 요청을 준비하면서 분류를 수행하여 이러한 비용의 대부분을 숨겨 줍니다. 실제 프로덕션 라우팅 엔드포인트 하나는 엔드투엔드 오버헤드를 중앙값 약 55ms로 측정했으며, 이는 일반 응답 시간의 1% 미만입니다. 하지만 트래픽이 실시간인 경우, 즉 음성 에이전트나 300ms 이내에 응답해야 하는 UI라면, 수백 밀리초의 라우팅 홉은 사용 가능 여부를 가르는 차이가 될 수 있습니다. 이 하나의 제약이 바로 정당한 라우팅 사용 사례가 있는 팀이 라우팅을 하지 않기로 결정하는 가장 흔한 이유입니다.
정확성. 라우터는 라우팅하는 판단만큼만 유용합니다. 일반 벤치마크로 훈련된 분류기는 도메인에 대해 자신 있게 틀릴 수 있습니다. 당신의 "쉬운" 요약 작업은 최첨단 모델에게는 쉬울 수 있지만 저렴한 모델에게는 불가능할 수 있습니다. 실패 모드는 조용합니다. 사용자는 더 나쁜 출력을 받을 뿐이고 아무도 기록하지 않습니다. 따라서 모든 신뢰할 수 있는 라우터는 품질 하한선 또는 균형 모드를 제공합니다.
캐시 무효화.OpenAI와 Anthropic 모두 반복되는 프롬프트 접두사에 대해 할인을 제공하며, 일반적으로 캐시 읽기 시 입력 토큰의 약 90%를 할인해 줍니다. 라우팅 계층이 프롬프트를 다시 쓰거나, 순서를 바꾸거나, 회전 타임스탬프를 주입하면 접두사가 무효화되어 그 할인 혜택을 잃게 됩니다. 좋은 라우터는 프롬프트를 바이트 단위로 그대로 전달하고 공급업체의 자체 캐싱이 작동하도록 합니다.
권장 사항: 품질 하한선을 갖춘 관리형 라우터
프로덕션에서 둘 이상의 모델을 운영한다면, 트래픽은 쉬운 요청과 어려운 요청이 섞여 있고, 볼륨이 충분히 커서 몇 퍼센트만 해도 실제 돈이 되는 규모라면, 품질 하한선을 유지하면서 토큰에 마크업을 부과하지 않는 관리형 라우터를 추천합니다. 저희 자체 제품은 OrcaRouter이며, 이 제품에 대해서만 상세히 설명할 수 있습니다. 아래에 이어지는 체크리스트는 평가 대상인 모든 라우터에 적용됩니다.
OrcaRouter의 자동 모드 — 모델 이름 orcarouter/auto를 표준 OpenAI 호환 엔드포인트에서 요청하세요 — 각 프롬프트를 평가하여 200개 이상의 모델에 걸쳐 라우팅합니다. 네 가지 라우팅 정책을 제공하며 기본값은 Balanced입니다: Cheapest는 답변할 수 있는 가장 저렴한 모델로 보내고; Balanced는 품질 기준을 충족하는 가장 저렴한 모델로 보내며; Quality는 가격과 관계없이 가장 높은 점수의 모델로 보내고; Adaptive는 실시간 트래픽에서 학습하며 그때그때 라우팅을 조정합니다. 평가에는 1밀리초 미만이 소요되고, 총 추가 지연 시간은 50ms 미만으로 유지되며, 선택한 공급자가 속도 제한을 걸거나 오류를 반환하면 라우터는 스트림 도중 50ms 이내에 정상 모델로 장애 조치합니다. 어떤 계층에서도 마크업이 없습니다: 각 공급자에게 공시된 정확한 가격만 지불합니다 — 위의 $0.09 또는 $5.00 수치가 바로 지불 금액입니다 — 그리고 라우팅 자체는 무료입니다.
정확도 측면에서 2026년 6월 RouterArena 리더보드는 OrcaRouter를 가장 가깝게 추적되는 대안의 74.0%에 비해 75.5%로 평가합니다(orcarouter.ai 기준). 하나의 리더보드는 어떤 것의 증거가 아닙니다 — 단일 데이터 포인트로 취급하고, 프로덕션 트래픽에 어떤 라우터(우리 것을 포함)를 신뢰하기 전에 자체 프롬프트로 직접 평가를 실행하세요. 그리고 라우터 기능이 필요한지 게이트웨이 기능이 필요한지 결정하려 한다면, 라우터 대 게이트웨이의 구분은 우리 가이드인 AI API Gateway in 2026에서 다룹니다.
이 추천이 잘못된 경우
정직한 스킵 리스트를 쉽게 말하면:
간략 버전
LLM 라우터는 각 요청에 어떤 모델이 응답할지를 선택하는 계층입니다. 쉬운 요청이 대다수일 때는 저렴하고 빠른 모델을, 어려운 요청이 소수일 때는 최첨단 모델을 사용하며, 공급자가 중단되면 장애 조치(failover)를 제공합니다. 모델 간 가격 차이가 클 때(DeepSeek V4 Flash는 입력 토큰 100만 개당 $0.09, Claude Opus 5는 $5.00로 55배 차이) 그리고 트래픽이 쉬운 요청과 어려운 요청으로 혼합되어 있을 때 이점이 있습니다. 연구에 따르면 품질 하한선을 전제로 한 절감 상한은 약 85%이며, 하한선은 자체 평가가 정하는 수준입니다. 이 방식은 지연 시간과 일부 정확도 제어를 희생하며, 단일 모델만 사용하는 조직, 300ms 미만의 지연 시간 예산, 소액 지출, 출력 품질을 측정할 수 없는 팀에는 적합하지 않습니다. 적합한 상황이라면, 토큰 마크업 없이 품질 하한선을 설정하고 실행하되, 먼저 일부 트래픽에만 적용하고, 라우팅 로그를 읽은 후에 절감 효과를 믿으세요.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
