
AstaBrief 8B vs ContextPilot 8B: 동일한 8B 베이스 모델에 대한 두 가지 답
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 220 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
AstaBrief 8B와 ContextPilot 8B를 하나의 사양서에 올려놓으면 처음 여섯 행은 동일하다. 둘 다 Qwen/Qwen3-8B에서 파인튜닝된 dense 8B 체크포인트다. 둘 다 동일한 아키텍처를 물려받았다 — 36개 레이어, 히든 크기 4096, 8개의 키-값 헤드를 가진 32개의 어텐션 헤드, 151,936개 토큰 어휘, 그리고 기본 모델의 40,960개 토큰 위치 상한이다. 어느 쪽도 새로운 아키텍처가 아니며, 그럴 생각도 없다. 이들은 동일한 동결된 기본 가중치를 가져다가 서로 다른 두 가지 작업을 가르치는 두 연구소이며, 그 작업들은 장기적 연구 에이전트의 양 극단을 가리킨다. AstaBrief 8B는 인용이 포함된 완성된 보고서를 작성하고, ContextPilot 8B는 에이전트가 자료를 수집하는 동안 작업 컨텍스트가 무너지지 않도록 유지한다.
그 한 줄이 이 비교의 전부이며, 이 비교를 승자독식으로 읽어서는 안 되는 이유이기도 합니다. 라이선스, 근거, 런타임 요구 사항에서 두 모델은 완전히 갈리며, 그 차이는 두 연구소가 발표한 어떤 점수보다도 더 많은 것을 말해줍니다.
동일한 체크포인트 지오메트리, 두 가지 다른 상속
진정으로 공유되는 것에서 시작하십시오. 그것이 다른 모든 것의 한계를 규정하기 때문입니다. Ai2의 AstaBrief 8B와 Tencent의 ContextPilot 8B는 모두 Qwen3-8B를 기반 모델로 선언하며, 둘 다 대략 80억 개 파라미터에 해당합니다. ContextPilot 8B의 저장소에는 네 개의 safetensors 샤드에 걸쳐 16.38GB의 BF16 가중치가 기록되어 있으며, 이는 8B 덴스 모델의 무게와 같습니다. 컨텍스트 상한은 기반 모델의 것이며 두 모델 모두에서 변하지 않았습니다. 구성상 40,960개 위치이고, 32K에서 훈련되었으며 YaRN으로 확장할 수 있습니다. 어느 모델도 롱컨텍스트 모델이 아닙니다. AstaBrief 8B는 코퍼스가 아니라 발췌문을 넘겨받기 때문에 그럴 필요가 없습니다. ContextPilot 8B는 작은 윈도우를 더 열심히 일하게 만드는 것이 논지이기 때문에 의도적으로 그렇지 않습니다.
각 연구소가 바꾼 것은 훈련 목표였으며, 그 목표들은 더 이상 다를 수 없을 정도로 서로 달랐다.
• 포스트 트레이닝 방법 — AstaBrief 8B: 지도 미세 조정 후 오프라인 직접 선호 최적화, 47K개의 SFT 예시와 약 6K개의 선호 쌍, H100 8대에서.
• 포스트트레이닝 방법 — ContextPilot 8B: 능동적 컨텍스트 관리 프레임워크에 적용한 강화 학습으로, 세 차례의 특화 SFT 실행을 태스크 벡터 병합 방식으로 기본 베이스 위에 얹은 구성입니다.
• 작업 — AstaBrief 8B: 질문과 검색된 문헌 발췌문을 바탕으로 인라인 인용이 포함된 여러 섹션의 보고서를 한 번에 작성하기.
• 하는 일 — ContextPilot 8B: 계획을 세우고, 장기 기억을 유지하고, 인덱스에서 검색하고, 에이전트가 현재 필요로 하지 않는 컨텍스트를 오프로드하며, 그와 동시에 계속 추론하고 도구를 호출합니다.
• 런타임 — AstaBrief 8B: 표준 vLLM 또는 Transformers 서빙, 그리고 AstaBrief_prompts 데이터셋에서 권장하는 프롬프트 형식.
• 런타임 — ContextPilot 8B: Tencent/ContextPilot 저장소의 Tencent 에이전트 런타임, 도구 정의, 평가 파이프라인입니다. 체크포인트만으로는 작동하는 에이전트가 아닙니다.
• 라이선스 — AstaBrief 8B: Apache-2.0. ContextPilot 8B: 연구 및 개발 용도로의 사용을 제한하는 섹션 0이 추가된 맞춤형 Apache-2.0 텍스트.
• 근거 — AstaBrief 8B: 벤더가 보고한 벤치마크 표와 Ai2의 Asta 플랫폼에서 나온 초기 프로덕션 사용 수치. ContextPilot 8B: EMNLP 2026 메인 트랙에 채택된 arXiv 논문에 담긴 주장이며, 모델 카드에는 수치가 없고 제3자가 이를 재현한 적도 없다.
그 목록에서 두 행은 나머지보다 더 많은 역할을 한다. 라이선스 행은 모델을 제품에 넣을 수 있는지 자체를 결정한다: AstaBrief 8B의 Apache-2.0 조건은 상업적 사용을 허용하지만, ContextPilot 8B의 추가 조항은 허용하지 않는다. 런타임 행은 가중치와 함께 랩의 얼마나 많은 부분을 도입해야 하는지를 결정한다. AstaBrief 8B는 기존 서빙 스택에 바로 넣을 수 있는 체크포인트다. ContextPilot 8B는 프레임워크의 구성 요소이며, 프레임워크를 작동하게 만드는 부분들 — 도구 계약, 롤아웃 로직, 크레딧 할당 — 은 다운로드하는 샤드가 아니라 Tencent의 코드에 있다.

각각이 실제로 제자리를 얻는 곳
이들을 비교하는 유용한 방법은 두 연구소가 서로 반대 방향에서 수렴하고 있는 파이프라인 내 인접 하위 에이전트로서 비교하는 것이다.
문헌 종합 에이전트에는 검색 계층, 컨텍스트 계층, 생성 계층이 있다. ContextPilot 8B는 컨텍스트 계층을 공격한다: 에이전트에 계획 수립, 노트 쓰기/업데이트/읽기를 포함하는 구조화된 장기 메모리, 인덱스에 대한 검색, 소프트 컨텍스트 오프로딩을 제공하여, 적당한 윈도가 긴 궤적에 걸쳐 작동 가능하게 유지되도록 한다. 논문의 주장은 기존 컨텍스트 편집 모델들이 세 가지 약점을 공유했으며, 이 프레임워크가 그것들을 함께 해결한다는 것이다 — 더 넓은 도구 세트, 실제로 궤적을 바꾸는 편집에 탐색을 집중하는 컨텍스트 인식 부분 롤아웃, 그리고 세밀한 크레딧 할당. 평가 대상은 장문맥 QA와 딥 서치이다: InfBench, NovelQA, LongMemEval, BrowseComp+, 우리가 앞서 저장소를 읽은 바에 따르면.
AstaBrief 8B는 생성 계층을 공략하며, 컨텍스트 문제는 이미 업스트림에서 해결되었다고 가정한다. 이 모델은 검색하거나, 발췌문을 요약하거나, 주제를 군집화하거나, 어떤 근거를 유지할지 결정하지 않는다. Ai2는 그 모든 것을 모델의 역할에서 제거하고, 다른 누군가가 고른 발췌문으로부터 보고서를 단일 패스로 작성하도록 훈련시켰다. 이 betting은 값비싼 스캐폴딩에 품질이 있지 않았다는 것이다: Ai2는 단일 패스 재작성이 추적된 지표에서 다단계 Claude 기반 파이프라인과 맞먹으면서 전체 파이프라인 생성 시간을 178.5초에서 51.1초로 줄였다고 보고한다.
두 모델을 합쳐 보면, 어느 연구소든 그렸을 법한 분업을 설명한다. 하나는 작업 세트를 작게 유지하고 증거가 계속 흐르게 한다. 다른 하나는 살아남은 증거를 인용을 붙인 산문으로 바꾼다. 실패 모드는 겹치기보다 상호 보완적이다. 잘못된 발췌를 버리는 컨텍스트 관리자는 좋은 작성자를 망치고, 나쁜 발췌를 건네받은 좋은 작성자는 엉뚱한 것에 관한 유창한 보고서를 만들어 낸다.
그러한 상호 보완성은 각각을 하나의 약속이 아니라 교체 가능한 부품으로 취급해야 한다는 근거가 된다. ContextPilot 8B로 컨텍스트 절반을 구축한다면, 보고서 생성 절반은 그 뒤에 어떤 모델이 있든 신경 쓰지 않는 인터페이스 뒤에 놓여야 한다. 한쪽에는 자체 호스팅 AstaBrief 8B, 다른 쪽에는 호스팅형 프런티어 모델을 두고, 파이프라인을 다시 작성하지 않고도 둘 사이를 오갈 수 있어야 한다. 두 갈래를 하나의 엔드포인트로 실행하는 것이 바로 그것을 마이그레이션이 아니라 구성 변경으로 만들어 준다: 공급자 정가가 0% 마크업으로 그대로 전달되는, 200개 이상의 모델을 아우르는 단일 API, 공급자 성능이 저하될 때의 자동 장애 조치, 그리고 여러 모델을 하나의 호출로 구성하고 싶을 때 쓰는 라우팅 DSL. 자체 호스팅 작성기는 자체 호스팅으로 남는다. 데이터 민감성 이슈가 있는 부분이 바로 거기이기 때문이다. 그 주변의 모든 것은 라우팅 가능한 상태로 남는데, 유연성이 저렴한 곳이 바로 거기이기 때문이다.

증거의 솔직한 현황
어느 모델도 독립적인 스코어보드를 갖추고 있지 않으며, 두 연구소는 애초에 같은 것을 측정하고 있지도 않다.
• AstaBrief 8B, SQABench-CS2 평균(벤더 보고): 테스트 분할에서 87.0으로, 자체 SFT 체크포인트의 83.7과 기본 Qwen3-8B의 77.3에 대비됩니다.
• AstaBrief 8B, DeepScholarBench(공급업체 보고 기준): 53.50으로, Ai2 자체의 Asta ScholarQA(60.25)와 DR-Tulu-8B(56.26)에 뒤처짐.
• AstaBrief 8B, Ai2의 Claude 기반 파이프라인 대비 쌍별 승률(공급업체 보고 기준): SQABench-CS2 dev에서 55%, test에서 72%.
• ContextPilot 8B: 수치는 논문에만 존재하며, 장문맥 QA와 딥서치 벤치마크에 한정된다. 모델 카드 수치도, 제3자 재현 결과도 없다.
한 가지 주의점은 AstaBrief 칼럼 전체에 적용되며, Ai2는 블로그 자체에서 이를 언급합니다: 대부분의 훈련과 평가는 2025년에 완료되었으므로, 비교 모델들은 당시의 프런티어를 반영하며, 연구소는 현재의 프런티어 모델에 대해 평가를 다시 실행하지 않았습니다. 그 백분율은 당시의 설계 선택에 대한 증거로 읽어야 하며, 현재의 순위로 읽어서는 안 됩니다. ContextPilot 8B의 수치는 일반적인 논문의 주의점을 담고 있습니다 — 자체 선택한 벤치마크 제품군, 자체 실행 하네스, Tencent 외부에서의 재현 없음.
두 번째 주의사항은 AstaBrief 8B에 특화된 것이며 실제에서는 쉽게 발을 헛디딜 수 있습니다. 이 모델의 카드는 체크포인트가 하나의 프롬프트 형식에 맞춰 미세 조정되었고, 그 형식이 데이터셋 파일로 공개되었으며, 다른 형식은 동작을 저하시킬 수 있다고 경고합니다. 일반적인 채팅 하네스로 이 모델을 벤치마킹한다면, 모델만큼이나 여러분의 하네스도 측정하고 있는 셈입니다.
어느 거 원해?
산출물이 문서일 때는 AstaBrief 8B를 선택하라. 이는 Apache-2.0이며, 8B BF16급 단일 GPU에서 실행되고, 주변에 에이전트 프레임워크가 필요 없으며, 다른 누군가가 검색해 온 근거로 구성된 인용 보고서라는 단 하나의 출력을 위해 목적 학습되었다. 대부분의 팀에게 상업용 라이선스가 결정적 요인이며, 가중치, SFT 믹스, DPO 믹스, 프롬프트 형식이 모두 공개된 Ai2 자체의 오픈 저장소 태도가 단지 무료인 것을 넘어 감사 가능하게 만든다.
산출물이 작동하는 궤적이고 당신의 문제가 에이전트가 잊어버리거나 압도되는 것이라면 ContextPilot 8B를 선택하세요. 연구 전용 라이선스는 대부분의 기업에서 이를 프로덕션 고려 대상에서 제외하며, 런타임 요구 사항은 단순히 모델이 아니라 Tencent의 프레임워크를 도입한다는 뜻입니다. 능동적 컨텍스트 관리를 하나의 기법으로 조사하고 있다면, 이는 잘 문서화된 출발점입니다. 출시해야 한다면, 그렇지 않습니다.
그리고 두 가지 능력이 모두 필요하다면, 답은 어느 한 모델 단독이 아니라, 각각 교체될 수 있도록 연결된 두 모델의 조합입니다. 이 비교가 도출해서는 안 되는 단 하나는 단일 승자입니다. 왜냐하면 두 체크포인트는 시스템에서 같은 자리를 두고 경쟁하는 것이 아니기 때문입니다.
