
Spark3 유출: iFLYTEK의 1.7B 및 4B 소형 모델이 vLLM에 연결되고 있다
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
Spark3에는 공개된 가중치도, 모델 카드도, 공식 발표도 없습니다. 그런데 이번 주 vLLM 추론 엔진에 Spark3-1.7B와 Spark3-4B 두 모델을 놀라울 정도로 상세히 설명하는 풀 리퀘스트가 올라왔습니다. vLLM 저장소의 풀 리퀘스트 #53373 "[Model] Add Spark3 Model"은 Spark3 아키텍처에 대한 네이티브 서빙 지원을 추가합니다: 슬라이딩 윈도우 어텐션, 4단계로 조절 가능한 thinking 예산, 두 크기 모두에서 기본 제공되는 100만 토큰 컨텍스트, 그리고 iFLYTEK를 가리키는 모델 ID. 이 중 어떤 것도 공급업체가 확인하지 않았으며, 출시된 것도 없습니다. 이 글은 지금까지 알려진 내용을 정리한 것입니다. 풀 리퀘스트는 실제이며, 모델이 한다고 알려진 모든 것은 iFLYTEK(또는 Spark3를 출시하는 주체)가 실제로 가중치를 공개하기 전까지는 검증되지 않았습니다.
유출: 스펙 시트처럼 읽히는 풀 리퀘스트
이 신호는 오픈 상태인 vLLM PR로, GitHub 사용자 KnightYao(허페이에 거주하며 중국과학기술대학(University of Science and Technology of China)을 프로필에 기재한 기여자)가 제출했으며, 2026년 8월 23일 현재 병합되지 않았습니다. vLLM 유지관리자는 8월 22일 '논의를 위해 보류'라는 메모와 함께 변경을 요청했습니다. 이 PR은 초기 단계이고 논쟁이 진행 중이며, 이런 종류의 통합에서는 정상적인 일입니다. 또한 실험실 밖의 누구도 다운로드할 수 없는 모델에 관한 프레임워크 PR로서는 이례적으로 상세합니다.
이 diff는 8개의 파일을 수정합니다. vLLM의 model executor에 Spark3ForCausalLM 구현을 추가하고, vLLM의 config 및 model registry에 네이티브 Spark3Config를 등록하며, sliding-window attention과 full attention 및 head별 attention 출력 게이팅을 지원하고, tensor- 및 pipeline-parallel 가중치 로딩과, 모델의 도구 호출을 구조화된 방식으로 디코딩할 수 있게 하는 Spark3 XML 툴 파서를 추가합니다. 또한 vLLM의 지원 모델 문서에 XHToken/Spark3-1.7B 체크포인트를 나열하는 행을 추가합니다. 설명에는 이 통합이 벤치마킹되었다고도 주장합니다: 작성자의 테스트 환경에서 500개의 동시 요청, 100% 성공률, 초당 약 106개의 요청 및 초당 13.5K개의 출력 토큰. 이 수치는 PR을 작성한 사람이 직접 보고한 것이지 독립적인 벤치마크가 아니며, 정확히 그렇게 해석되어야 합니다.
iFLYTEK이 유력하지만 확인되지 않은 모기업인 이유
PR에는 어떤 공급업체도 이름이 나오지 않습니다. 그러나 PR이 등록하는 체크포인트 ID인 XHToken/Spark3-1.7B는 Hugging Face의 XHToken 조직 아래에 있으며, 그 조직은 iFLYTEK의 것입니다. 조직 페이지에는 회사로 명시되어 있고, opensource.iflytek.com으로 연결되며, 현재 공개 모델 0개와 공개 데이터셋 0개를 표시합니다. "XH"는 iFLYTEK의 모델 패밀리인 星火(Xinghuo, "Spark")의 자연스러운 약어입니다. 저자의 위치가 허페이(Hefei)라는 점을 더하면 — iFLYTEK는 허페이에 본사를 두고 있습니다 — 이 추론은 공급업체가 확인하기 전에 얻을 수 있는 가장 강력한 추론에 가깝습니다.
이는 iFLYTEK의 최근 패턴과 일치합니다. 2026년 2월에 출시된 Spark X2는 교육, 의료, 자동차 및 에이전트 사용 사례를 명시적으로 겨냥했으며, 온디바이스 모델 라인인 SparkAuto-EMM은 0.5B에서 7B까지의 소형 크기로 제공됩니다. 이 보도자료가 공개되기 이틀 전인 8월 21일 중간 실적 컨퍼런스에서 iFLYTEK는 국산 컴퓨팅으로 완전히 구축된 새로운 플래그십 범용 모델이 곧 출시될 예정이며, 단계적 버전은 '8월 말까지' 공개되고 10월 1024 Developer Day에서 정식 출시될 것이라고 밝혔습니다. Spark3-1.7B와 Spark3-4B가 이 단계적 출시의 일부인지, 아니면 별도의 엣지 중심 트랙인지는 보도자료가 답하지 않은 미해결 질문입니다.

모델들이 무엇이라고 여겨지는지
PR의 주장들은 모두 검증되지 않았습니다:
• 두 가지 크기. Spark3-1.7B와 Spark3-4B. 둘 다 밀집 전체 어텐션(dense full-attention) 구조 대신 슬라이딩 윈도우 어텐션(sliding-window attention)을 사용하는 효율성 우선 설계로 설명됩니다.
• 두 모델 모두 네이티브 1M 토큰 컨텍스트를 지원합니다. 확장 모드를 통한 지원이 아닙니다 — PR에 따르면 컨텍스트가 아키텍처에 네이티브로 내장되어 있어, 단일 GPU에서도 구동 가능할 정도로 작은 모델에 백만 개의 토큰을 담을 수 있다는 뜻입니다.
• 4단계 추론 예산. 추론 수준은 없음, 낮음, 중간, 높음으로 설정할 수 있으며, 이는 애플리케이션이 호출당 지연 시간 및 비용과 추론 깊이를 맞바꿀 수 있게 해주는 전환 가능한 사고 설계입니다.
• 200개 이상의 언어와 중국 대입시험 대비 강점. 이 보도자료는 강력한 K-12 및 가오카오(중국 대학입학시험) 문제 풀이 성능—iFLYTEK의 교육 사업을 고려할 때 이 회사의 시그니처라 할 수 있는—과 200개 이상의 언어에 걸친 다국어 지원을 주장합니다.
• 코딩 및 에이전트 지향. 강력한 코드 생성, 도구 사용, 다단계 실행, 그리고 그 크기 대비 긴 컨텍스트 추론을 주장하며, 동일한 PR에 포함된 XML 도구 파서가 이를 뒷받침한다.
1.7B 모델에서 네이티브 1M 컨텍스트는 주목할 만한 부분이다
컨텍스트 길이는 소형 모델이 오랫동안 정체되어 있던 분야입니다. 현재 오픈웨이트 환경에서 1.7B~4B급 모델은 일반적으로 32K~256K 네이티브 윈도우를 갖추고 있습니다. Qwen3의 소형 체크포인트는 네이티브 32K에 rope 스케일링으로 131K를 지원하며, Qwen3.5가 소형 변형 모델에서 네이티브 256K로 개선한 것도 최근의 진전입니다. 백만 토큰 컨텍스트는 지금까지 대형 모델의 전유물이었습니다. GLM의 1M 컨텍스트 체크포인트는 수천억 개의 파라미터를 가집니다. Spark3가 정말로 4B 모델에서 네이티브 1M 윈도우를 제공한다면, 이는 정말 이례적인 사양이 될 것이며, 슬라이딩 윈도우 어텐션 아키텍처가 바로 메모리 비용을 낮추는 핵심입니다. 여기에 덧붙여야 할 주의점: 네이티브 1M이라는 헤드라인 수치는 PR 자료에 쓰기는 쉽지만 실제로 유용하게 만드는 것은 어렵습니다. 긴 컨텍스트 품질, 즉 모델이 실제로 70만 토큰 이전의 사실을 찾아내어 활용할 수 있는지 여부는 윈도우에 몇 개의 토큰이 들어가는지와는 별개의 문제이며, 아직 독립적인 평가도 존재하지 않습니다.
통제 가능한 사고 예산은 같은 이유로 중요합니다. 네 가지 추론 수준(없음/낮음/중간/높음)은 Qwen3의 온/오프 사고 모드 정신을 계승한 전환형 사고 설계이지만, 더욱 풍부합니다. 이진 선택 대신 애플리케이션은 요청별로 수준을 선택할 수 있습니다. 번역에는 사고 없음, 다단계 에이전트 턴에는 높음으로 설정하고, 필요한 추론에 대해서만 비용을 지불하면 됩니다. 에이전트 또는 배치 워크로드의 경우, 이것이 바로 '유능하지만 비싼' 소형 모델을 비용 관리가 가능한 모델로 바꿔주는 손잡이입니다.
포스트 트레이닝 레시피는 2026년 패턴에 부합한다
PR에 따르면 Spark3는 "Scaled Reinforcement Learning and MOPD"로 포스트트레이닝되었다. MOPD(Multi-Teacher On-Policy Distillation, 다중 교사 온정책 증류)는 실제로 현재 사용되는 기법으로, arXiv 논문(2606.30406)에 설명되어 있다. 즉, 도메인 특화 RL 교사들을 병렬로 학습시킨 다음, 학생 모델 자신의 롤아웃에서 이들을 다시 하나의 학생 모델로 증류하고, 프롬프트별 올바른 교사에 대해 토큰별 역방향 KL을 최소화한다. 이는 2026년의 레시피로, 하나의 RL 실행이 다른 실행과 충돌하지 않으면서 단일 모델이 수학, 코딩, 에이전트 기술을 상속받을 수 있게 해주며, MiMo Flash V2, DeepSeek V4, Nemotron 3 Ultra 같은 모델들의 포스트트레이닝에 공개적으로 기여한 것으로 인정받았다. Spark3가 동일한 레시피를 인용함으로써 이 세대에 속하게 된다—소형 모델에 최첨단 포스트트레이닝 기법을 적용한 것이다. 이는 또한 "강력한 코딩 및 에이전트 주장" 뒤에 그럴듯한 메커니즘이 있음을 의미한다. 그럴듯함은 입증된 것과 같지 않다. 가중치가 공개되고 독립적인 평가가 실행되기 전까지 해당 주장은 공급업체가 보고한 상태로 남아 있다.
진정으로 알려지지 않은 것
달력이 있는 거의 모든 것:
• 출시일. Hugging Face에 가중치가 없고, 발표도 없으며, 일정도 없습니다. XHToken 조직은 오늘 비어 있습니다.
• 공급업체 확인. iFLYTEK는 Spark3에 대해 아무것도 밝히지 않았습니다. XHToken 조직 링크는 강력한 증거이지만 공식 성명은 아닙니다.
• 그것이 단계적 플래그십인지 여부. iFLYTEK의 '8월 말' 신형 플래그십 단계적 버전이 이것일 수도 있고 — 또는 관련이 없을 수도 있다. 보도자료에는 날짜가 전혀 명시되어 있지 않다.
• 가격 및 라이선스.아무것도 공개되지 않았습니다. iFLYTEK의 Spark 제품군은 역사적으로 대부분 오픈 가중치(open-weights)가 아닌 API로 제공되어 왔습니다. 따라서 Spark3-1.7B와 Spark3-4B가 공개 체크포인트인지 아니면 내부 서빙 대상인지는 여전히 미해결 과제입니다.
• 모든 벤치마크. PR의 처리량 수치는 작성자 본인의 서빙 테스트일 뿐 독립적인 평가가 아니며, 공개된 모델이 없기 때문에 어떤 리더보드도 이 모델을 평가한 적이 없습니다.

볼 것
XHToken Hugging Face 조직은 주목해야 할 릴리스 채널입니다. 모델이 진짜라면, 그 가중치 — 또는 최소한 모델 카드 — 가 거기에 나타나야 하며, 조직이 공개 리포지토리를 0개에서 1개로 만드는 것이 가장 중요한 신호입니다. 그렇게 될 때 확인할 몇 가지 사항:
• 컨텍스트 번호. 1M이 네이티브인가요, 아니면 품질 트레이드오프가 있는 RoPE 확장인가요? PR은 네이티브라고 말하지만, 그 내용은 모델 카드에서 확정됩니다.
• The thinking-budget API. 네 가지 추론 수준이 샘플링 매개변수, 채팅 템플릿 필드, 또는 별도의 모델 변형으로 노출되는 방식이 실제 사용 용이성을 결정합니다.
• 라이선스.가중치를 공개하면 Spark3는 자가 호스팅이 가능한 네이티브 1M 컨텍스트를 갖춘 최초의 5B 미만 모델이 될 것입니다. API 전용 출시라면 다른 종류의 제품이 될 것입니다.
• iFLYTEK의 발표 일정. 단계적으로 출시되는 플래그십은 8월 말까지로 예정되어 있으며, 정식 출시는 10월 1024 개발자 데이에서 이루어집니다. Spark3가 둘 중 하나에 포함된다면, 공식 설명은 PR이 남겨둔 부분을 밝혀줄 것입니다.
• PR 병합 여부. vLLM 지원은 품질 신호이자 인프라로서 중요합니다. 네이티브 Spark3 지원을 갖춘 최초의 런타임이므로, 가중치가 공개되는 당일 모델을 프로덕션에서 실행할 수 있습니다.
지금 개발자가 해야 할 일
아무것도 없습니다. 호출할 모델도, 다운로드할 가중치도, 준비할 API 키도 없습니다. 오늘날 Spark3를 서빙한다고 주장하는 어떤 도구든 다른 무언가를 서빙하고 있는 것입니다. 여러분이 할 수 있는 일은 그것이 등장하는 날 어떻게 평가할지를 결정하는 것입니다. 이 모델은 확인하기 쉬운 약속을 지니고 있기 때문입니다. 백만 개의 토큰을 읽고 네 가지 깊이로 추론하는 1.7B 또는 4B 모델은 진정한 새로운 소형 모델 범주이거나 사양서상의 이야기에 불과하며, 그 차이는 여러분의 워크로드에서 오후 하나로 측정 가능합니다.
라우팅 계층이 제 몫을 하는 곳이 바로 여기입니다. OrcaRouter에서 모델은 여러분이 준수해야 할 계약이 아니라 하나의 API를 통해 호출하는 카탈로그의 항목이며, 공급업체 공시 가격은 마크업 없이 그대로 전달됩니다. 따라서 새 모델이 공급업체 카탈로그에 나타나면 실제 가격이 당일 우리 쪽에도 반영되고, 이를 시도하는 데 두 번째 통합이나 재협상 비용이 들지 않습니다. Spark3처럼 검증되지 않은 모델의 경우 합리적인 패턴은 유망한 유출 모델에 적용하는 것과 동일합니다. 라우팅 DSL에서 자동 장애 조치 뒤에 배치하고 트래픽 일부가 해당 모델을 거치게 하며, 규칙의 반대편에는 검증된 모델을 유지하는 것입니다. 그래야 잘못된 평가, 예상치 못한 라이선스 문제, 실망스러운 긴 컨텍스트 결과가 인시던트가 아닌 라우팅 변경으로 처리됩니다. 키 하나, 엔드포인트 하나, 200개 이상의 모델 — 그리고 Spark3-1.7B나 Spark3-4B가 실제로 실행 가능해지면 패스스루와 장애 조치는 다른 모델과 마찬가지로 적용됩니다.
![A screenshot of vLLM pull request 53373 titled '[Model] Add Spark3 Model' on GitHub (captured August 23, 2026) showing the open PR status, the author KnightYao, the 'new-model' label, the reviewers including youkaichao, and the description 'This PR adds native support for the Spark 3 model architecture'.](https://cms.orcarouter.ai/api/media/file/4-438.png)
정직한 요약은 평결이 아니라 하나의 문장입니다. 이번 주에 작성된 프레임워크 PR은 iFLYTEK가 기본 백만 토큰 컨텍스트와 4단계 추론 예산을 갖춘 두 개의 소형 모델을 보유하고 있다고 주장하지만, 이를 뒷받침할 어떤 증거도 공개되지 않았습니다. XHToken 조직을 주시하고, iFLYTEK의 8월 말 약속을 주시하십시오. 그리고 가중치가 실제로 공개되면, 프로덕션 경로에 베팅하기 전에 페일오버가 있는 라우팅 규칙에 통과시키십시오. 이것이 유출에 대한 전체 플레이북입니다 — 인프라는 믿되, 모델은 검증하고, exit는 저렴하게 유지하십시오.
