
AstaBrief 8B vs Qwen3-8B: Ai2 파인튜닝이 자체 베이스 모델에 더하는 것
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 220 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
여기에는 아키텍처 이야기가 없습니다. 그게 핵심입니다. AstaBrief 8B는 Qwen/Qwen3-8B의 파인튜닝이며, 두 모델은 마지막 어텐션 헤드까지 구성을 공유합니다: Qwen3ForCausalLM, 36개 레이어, 히든 크기 4096, 8개 키-값 헤드를 가진 32개 어텐션 헤드, 151,936개 토큰 어휘, 40,960개 토큰 위치 상한. Ai2의 2026-10-02 릴리스를 2025년 4월 베이스와 구분 짓는 모든 것은 포스트트레이닝입니다. 따라서 흥미로운 질문은 일반적으로 어느 쪽이 더 나은가가 아니라 — 이미 무료로 다운로드할 수 있는 베이스 모델 위에 특정하고 자금이 넉넉한 포스트트레이닝 실행이 무엇을 더해 주는지, 그리고 그 대가로 무엇을 잃게 되는지입니다.
Ai2의 답은 약 51초 만에 인용이 포함된 다중 섹션 종합을 생성하는 보고서 작성기로, Asta 플랫폼 내에서 대체한 Claude 기반 파이프라인의 178.5초와 대비된다. 약 3.5배 더 빠르며, Ai2는 추적한 지표에서 보고서 품질이 유지되었다고 주장한다. Qwen3-8B의 답은 하이브리드 사고 및 비사고 모드, 100개 이상의 언어, 1년 반의 다운스트림 사용을 갖춘 범용 모델이다. 둘 다 Apache-2.0이다. 이 맞바꿈은 좁은 역량 + 속도 대 넓은 역량 + 유연성이며, 아래 데이터는 그 형태를 상당히 구체적으로 보여준다.
아키텍처 행은 no-op이므로 프롬프트는 그렇지 않습니다.
체크포인트 구조가 동일하기 때문에 Qwen3-8B에 대해 여러분이 가진 모든 서빙 직관은 AstaBrief 8B에 그대로 전이됩니다. 이 모델은 BF16의 dense 8B이고, 24GB 카드에 들어가며, 커스텀 커널 없이 vLLM이나 Transformers에서 서빙되고, 베이스의 40K 위치 상한을 물려받습니다 — 두 모델 모두 장문맥 모델이 아니며, 32K 학습 윈도는 베이스와 정확히 동일하게 YaRN으로 확장됩니다. 이 파인튜닝을 위한 배포 계획은 곧 베이스를 위한 배포 계획입니다. 이는 파인튜닝에 항상 해당하는 것은 아니기 때문에 분명히 말할 가치가 있으며, 따라서 여러분이 평가하는 유일한 것은 동작입니다.
행동이야말로 락인(lock-in)이 깃든 곳이다. AstaBrief의 카드에는 굵은 글씨로 경고가 실려 있다: 이 모델은 하나의 특정 프롬프트 형식에 맞춰 미세 조정되었으며, 그 형식은 AstaBrief_prompts 데이터셋에 sft_prompt.txt로 공개되어 있고, Ai2는 다른 프롬프트나 상호작용 형식을 사용하면 성능이 저하되거나 일관성 없는 행동으로 이어질 수 있다고 말한다. 그 프롬프트는 캐주얼한 채팅 템플릿이 아니다. 읽어 보면 엄격한 계약이 드러난다 — 대괄호로 표시된 쿼리 슬롯, 식별자로 키가 지정된 인용문들의 section_references 블록, 지원하는 문장 뒤에 참조 키가 오도록 요구하는 명시적 인용 구문, 다른 출처와 결합해서는 안 되는 모델 지식용 지정 마커, 그리고 각 섹션을 두 문장 TLDR로 시작하라는 지침이다. Qwen3-8B는 당신이 입력하는 무엇이든 받아들일 것이다. AstaBrief 8B는 한 가지 형태의 입력에 맞춰 조정되어 있어 다른 것을 건네면 성능이 떨어질 것이다.
47,000개의 예시와 6,000개의 선호도가 사들인 것
이 파인튜닝은 전적으로 포스트트레이닝에 속하며, 그 방식은 의도적으로 전통적입니다: 지도 미세 조정 후 오프라인 직접 선호 최적화이며, 강화학습은 없습니다. Ai2는 자사의 Asta 시스템을 통해 제출된 실제 쿼리에서 시작해, 연구 중심 프롬프트 90,000개를 품질, 관련성, 프라이버시 기준으로 필터링하고, Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, GPT-4.1을 사용하는 다단계 ScholarQA 파이프라인으로 보고서 타깃을 생성한 뒤, 47,000개의 예시를 남겼습니다. 그런 다음 선호 단계에서 약 6,000개의 쌍을 구축했으며, GPT-4.1과 DeepSeek-R1이 심사하여 합의된 쌍만 살아남았습니다.
SQABench-CS2 — 사용자가 작성한 컴퓨터 과학 연구 질문 100개 — 를 기준으로 기본 모델과 비교해 측정했을 때, 그로 인해 얻은 것은 다음과 같습니다. 모든 수치는 공급업체가 보고한 것이며, 독립적으로 재현된 것은 하나도 없습니다:
• 전체 평균 — AstaBrief 8B 87.0 vs Qwen3-8B 77.3, 9.7포인트 향상.
• 성분 재현율 — 90.2 대 77.8
• 인용 정밀도 — 90.5 vs 76.2.
• 인용 재현율 — 78.2 vs 64.6.
• 답변 정밀도 — 89.0 대 90.6, 베이스 대비 1.6점 손실.
마지막 행이 바로 기대치를 형성해야 하는 행이다. 보고서 품질을 위한 파인튜닝은 모든 것을 일률적으로 개선하지는 않았다. 그것은 문단별 관련성을 조금 희생하는 대신 커버리지와 인용 근거에서 큰 이득을 얻었다. 당신의 작업이 무엇보다 관련성 있는 문단을 보상한다면, 기본 모델이 확실히 더 나쁜 선택은 아니며, 파인튜닝이 자동으로 당신의 답이 되는 것도 아니다.
돈으로 살 수 없었던 두 가지 다른 사실이 있다. AstaBrief 8B는 DeepScholarBench에서 Ai2 자체 대안들보다 높은 점수를 보고한 적이 없으며 — 53.50은 Asta ScholarQA의 60.25와 DR-Tulu-8B의 56.26에 뒤처진다 — 인간 검증은 세 연구자가 낸 열네 개 질문으로 이루어졌고, 여기서 DR-Tulu가 전체 선호도에서 이겼다. 특화 모델은 특화 모델 자신의 벤치마크에서 범용 연구 모델에게 질 수 있으며, Ai2는 그 사실을 공개했다.

베이스가 여전히 더 잘하는 것
그 비교는 일방향적이지 않으며, 그중 제너럴리스트의 측면은 과소평가되기 쉽다.
Qwen3-8B는 하이브리드 사고 모드와 비사고 모드를 갖추고 있어, 문제가 추론을 필요로 할 때는 추론에 토큰을 사용하고 그렇지 않을 때는 곧바로 답할 수 있습니다. AstaBrief 8B는 원샷 보고서 작성을 위해 학습되었으며, 그러한 의도적 추론 동작을 제품 기능으로 물려받지 않았습니다. Qwen3-8B는 또한 기본 모델의 다국어 지원 범위, 즉 100개 이상의 언어를 갖추고 있는 반면, AstaBrief는 영어 과학 질의만 명시적으로 필터링된 코퍼스로 학습되었기 때문에 해당 영역 밖에서의 역량은 단순히 검증되지 않은 것이 아니라 알 수 없습니다.
그다음에는 지시 표면이 있습니다. 범용 모델은 다음 주에 작업이 바뀔 때, 도구 호출이 필요할 때, 출력 스키마가 Ai2의 것이 아니라 당신의 것일 때, 또는 프로토타이핑 중이라 최종 프롬프트가 어떻게 생겼는지 아직 모를 때 원하는 것입니다. 그리고 근본적인 출처 문제 — 누군가 왜 그 모델을 신뢰하는지 물을 때 중요한 문제 — 에 관해서는, Qwen3-8B는 1,100만 회 이상 다운로드되었고 1년 반 동안 독립적으로 사용되어 왔습니다. AstaBrief 8B는 출시한 지 일주일밖에 되지 않았습니다.
AstaBrief 8B가 베이스가 따라올 수 없는 것은 인용 규율이다. 인용 정밀도와 재현율은 파인튜닝의 우위가 가장 크고 훈련 서사와 가장 일관되게 맞아떨어지는 두 지표다 — Ai2의 데이터 파이프라인에서 가장 강력한 단일 필터는 인용 밀도, 즉 최소 하나의 인용을 포함하는 진술의 비율이었고, 그 결과로 나온 모델은 그 우선순위를 반영한다. 일반 모델이 고정 키 형식으로 인라인 인용을 안정적으로, 주장에 대한 뒷받침을 빠뜨리지 않고 하게 만드는 것은 당신이 작성하고 유지 관리하는 프롬프트 엔지니어링이다. Ai2의 파인튜닝은 그것을 모델의 기본 동작으로 만든다.

Qwen 라인은 2025년 4월 이후로 한층 더 발전했습니다.
한 가지 복잡한 점이 더 있는데, 이는 실무적인 문제입니다: Qwen3-8B는 나온 지 1년 반이 되었고, 새로운 파인튜닝 모델과 비교하는 것은 경쟁력 있는 현역 모델과 비교하는 것과 같지 않습니다.
Qwen의 라인은 이제 Qwen3.5, Qwen3.6, Qwen3.7, Qwen3.8을 거쳐 이어지며, 현재 세대는 아무것도 다운로드하지 않고도 사용할 수 있습니다. Qwen3.8 27B는 262,144토큰 컨텍스트 창을 갖춘 저희 카탈로그의 라이브 라우트로, 백만 입력 토큰당 $0.33, 백만 출력 토큰당 $2.40입니다. Qwen3.8 Flash는 백만 토큰 창을 $0.15와 $0.47에 제공하고, Qwen3 VL 8B Instruct는 131,072토큰 창으로 멀티모달 케이스를 백만 토큰당 $0.18과 $0.70에 커버하며 2025년 10월부터 라우팅되어 왔습니다. Qwen3-8B 자체는 저희가 서비스하는 라우트가 아니며, AstaBrief 8B도 마찬가지입니다. 둘 다 다운로드해서 실행하는 가중치이고, 솔직히 말하자면 베이스는 사용자의 하드웨어에 두는 것이 맞으며 최신 Qwen 세대는 그럴 필요가 없습니다.
그러면 Ai2가 실행할 수 없었던 평가를 위한 세 번째 축이 생깁니다. AstaBrief 8B를 자체 GPU에 올리고, 그 옆에 Qwen3-8B 베이스를 세워 보고된 델타를 확인한 다음, 규모 확장을 위해 동일한 하네스를 호스팅된 Qwen3.8 모델에 연결하세요. 세 축 모두 엔드포인트 하나만 떨어져 있으므로, 이 점이 이것을 조달 프로젝트가 아니라 구성 작업으로 만듭니다 — 200개 이상의 모델을 아우르는 하나의 API, 공급자 정가가 0% 마크업으로 그대로 전달되어 공급업체 가격 인하가 같은 날 귀하 쪽에도 반영되는 것, 자동 장애 조치, 그리고 여러 모델이 한 질문에 함께 답하게 하려는 경우를 위한 라우팅 DSL. 자체 호스팅 축은 데이터 민감성 이유로 자체 호스팅으로 남고, 호스팅되는 모든 것은 교체 가능하게 유지됩니다. 이는 다음 Qwen 세대가 한 분기 안에 출시될 때 중요합니다.
결정하는 방법
제품이 인용 문헌 종합이고 인용 동작이 프롬프트의 책임이 아니라 모델의 기본값이기를 원한다면 AstaBrief 8B를 선택하세요. 기본 모델의 구조적 특성은 서빙에서 예상치 못한 일이 전혀 없음을 뜻하고, Apache-2.0 라이선스와 공개된 SFT 및 DPO 믹스는 이를 감사 가능하게 만들며, 인용 정밀도와 재현율에서의 우위는 Ai2의 표에서 가장 크고 가장 설명 가능한 결과입니다.
Qwen3-8B에 머무르거나, 작업이 다양하거나, 사고 모드나 도구, 다국어 지원이 필요하거나, 아직 프롬프트를 탐색 중이거나, 자신이 작성하지 않은 16,000자 분량의 지시 블록에 묶이고 싶지 않다면 현재의 Qwen3.x로 이동하세요. 베이스는 관련성이 아니라 커버리지와 인용 근거에서 뒤졌고, 파인튜닝이 포기한 무언가를 간직했습니다.
피해야 할 것은 87.0 대 77.3 평균을 전부인 양 다루는 것입니다. Ai2 자체 표는 파인튜닝이 인용 규율을 얻기 위해 답변 정확도를 포기한다는 것을 보여주고, 자체 연구 노트는 훈련과 평가의 대부분이 2025년에 완료되었으며 현재 프런티어에 대해 다시 실행되지 않았다고 지적하며, 그것이 개선하는 기반 모델은 이 비교 외에는 더 이상 선택할 세대가 아닙니다. 파인튜닝이 실증적으로 추가하는 것은 출력의 형태입니다. 그 형태가 협소함을 감수할 가치가 있는지는 전적으로 그것이 당신 제품의 형태와 일치하는지에 달려 있습니다.
