기사 'AstaBrief 8B: Ai2의 오픈 리포트 라이터, 대체하는 파이프라인보다 3.5배 빠르게 실행'을 위한 히어로 타이틀 카드로, 51.1초 대 178.5초 타이밍, Apache-2.0 라이선스, Qwen3-8B 베이스가 표기되어 있고, 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

AstaBrief 8B: Ai2의 오픈 리포트 작성기, 대체하는 파이프라인보다 3.5배 빠르게 실행

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Ai2의 AstaBrief 8B 발표에서 가장 눈에 띄는 숫자는 벤치마크 점수가 아니라 스톱워치 판독값이다. 전체 Asta 파이프라인에서 새 모델은 인용이 포함된 연구 보고서를 평균 51.1초에 생성하는데, 이는 이제 나란히 자리한 Claude 기반 경로의 178.5초와 대비된다. 이는 약 3.5배 빠른 것이며, 단 하나의 아키텍처 결정에서 비롯된다 — 요약하고 클러스터링한 뒤 섹션별로 작성하는 대신 전체 보고서를 한 번에 작성하는 것이다. AstaBrief 8B는 Apache-2.0 라이선스의 8B 오픈 웨이트 모델로, Qwen3-8B에서 파인튜닝되었으며, 연구 질문과 검색된 문헌 발췌를 입력받아 인라인 인용이 포함된 보고서를 반환한다. 2026-10-02에 Ai2의 Asta 플랫폼에 "Fast mode"로 출시되었으며, 가중치와 학습 데이터, 그리고 예시 로컬 워크플로가 같은 날 공개되었다.

저장소는 발표보다 오래되었으며, 그것이 중요합니다

이번 릴리스에서 한 가지 세부 사항은 분명히 짚고 넘어갈 가치가 있습니다. 그것은 나머지 모든 내용을 어떻게 읽어야 하는지를 바꾸기 때문입니다: allenai/AstaBrief_8B의 Hugging Face 리포지토리에는 2026-02-09이라는 내부 생성 타임스탬프가 있고, 함께 제공되는 DPO 데이터셋은 2025년 11월로 거슬러 올라갑니다. 10월 2일 발표는 사실입니다 — 블로그 글, AI2 트윗, 모델 카드가 모두 그날 공개되었습니다 — 하지만 리포지토리 기록은 뉴스 주기가 시사하는 것보다 더 깁니다.

10월 2일에 일어난 일은 Ai2가 그것을 출시하고 문서화했으며, 그에 맞춰 리포지토리를 손봤다는 것입니다: 출시일 UTC 16:18:06부터 16:18:20 사이에 모델 카드에 세 개의 커밋이 올라왔고, 채팅 템플릿에 응답 템플릿을 추가하고 no-op 토큰을 제거했습니다. 이는 카드에 대한 잡무일 뿐, 재훈련이 아닙니다. Ai2는 또한 블로그에서 "설명된 훈련과 평가의 대부분은 2025년에 완료되었다"라고 명확히 밝히고, 훈련 데이터를 생성하고 비교 지점으로 사용된 독점 모델들이 "당시의 프런티어를 반영한다"라고 합니다. 이 연구소는 오늘날의 프런티어 모델에 대해 전체 평가를 다시 실행하지 않았다고 말합니다.

A screenshot of the Ai2 blog post 'Open-sourcing AstaBrief, the fast report-generation model in Asta', dated October 2, 2026, showing the opening paragraphs about grounding scientific answers in evidence.

그래서 이것은 2025년에 대부분 완료된 작업의 GA 릴리스입니다. 즉, 연구소 계정에 몇 달째 존재해 온 체크포인트 위에, 출시다운 문서와 출시다운 플랫폼 통합을 갖춘 하나의 출시인 셈입니다. 그 안에 부정직한 부분은 없으며, 이 모델은 Ai2 외부의 모든 사람에게 새로운 모델입니다. 하지만 이는 아래의 비교 수치가 2025년의 최전선을 설명한다는 뜻이며, Ai2도 스스로 그렇게 말합니다.

AstaBrief 8B이 실제로 하는 일

Ai2의 Asta 플랫폼에는 연구자들이 상당한 질문과 문헌 자료를 가져오면 인용된 종합 결과를 받아 작업 산출물로 취급하는 보고서 생성 기능이 있습니다. 그 기능은 이전에 Ai2가 Thinking mode라고 부르는 것 위에서 전적으로 실행되었습니다: 검색된 스니펫을 요약하고, 주제별로 클러스터링하고, Claude 모델의 지원을 받아 답변을 섹션별로 작성하는 다단계 파이프라인입니다. Thinking mode는 철저하지만 느립니다.

AstaBrief 8B는 Fast 모드입니다. 동일한 질문과 동일한 검색 발췌문이 주어지면, 단일 포워드 패스로 최종 보고서를 작성합니다. 흥미로운 부분은 Ai2의 주장입니다. 스니펫 요약, 클러스터링, 섹션별 반복 루프를 건너뛰어도 보고서 품질이 떨어지지 않았습니다. 적어도 해당 연구소가 추적한 지표에서는요. 이 모델은 검색 엔진이 아니며 검색을 수행하지 않습니다. 이는 검색 파이프라인 끝에서 작성자 역할을 하며, 증거를 건네받을 것으로 기대합니다.

그로 인해 이것은 제품이라기보다 구성 요소가 됩니다. Ai2가 가중치와 함께 예제 워크플로를 공개한 이유이기도 합니다. ai2-scholarqa-lib 저장소에 있는, 자신의 PDF를 보고서로 바꿔 주는 작은 라이브러리가 로컬 생성을 위한 출발점을 제공합니다.

훈련 레시피는 의도적으로 지루하며, 바로 그게 핵심이다

Ai2의 자체 선행 연구인 DR Tulu는 강화학습이 오픈웨이트 모델에서 장문 보고서 생성을 개선할 수 있음을 보여주었다. AstaBrief 팀은 그 경로를 고려했지만, RL이 불안정하고 비용이 많이 들며 디버깅하기 더 쉬운 무언가를 원했기 때문에 택하지 않았다. 대신 그들이 구축한 것은 지도 미세조정 후 오프라인 직접 선호 최적화이다. 두 단계 모두 전통적이다.

SFT 단계는 합성 프롬프트가 아니라 Ai2의 Asta 시스템을 통해 제출된 실제 쿼리에서 시작되었습니다. 수집된 로그에서 팀은 품질, 관련성, 개인정보 보호를 기준으로 필터링했습니다. 즉, 봇 및 베타 테스터 트래픽을 제거하고, 의미를 갖기에는 너무 짧은 쿼리를 버리고, LLM 패스를 실행해 비영어 쿼리, 비과학적 요청, 개인정보가 포함된 프롬프트를 걸러냈습니다. 그 결과 90,000개의 연구 중심 쿼리 풀이 남았습니다. 해당 쿼리에 대한 전체 보고서 타깃은 다단계 ScholarQA 파이프라인으로 생성되었으며, 백킹 모델로 Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, GPT-4.1을 사용했습니다. 품질 필터링 후: 사용 가능한 학습 예시 47,000개.

DPO 단계에는 뭔가 다른 것이 필요했습니다 — 보고서 쌍과 그 사이의 선호도였습니다. 쿼리당 한 보고서는 ScholarQA 파이프라인에서 나왔고, 경쟁 보고서는 ScholarQA가 검색한 발췌문을 o3, o4-mini, DeepSeek-V3, DeepSeek-R1 중에서 선택한 다른 모델에 입력해 만들어졌습니다. GPT-4.1과 DeepSeek-R1 두 심사자가 각 쌍에서 승자를 골랐고, 두 심사자가 모두 동의한 쌍만 살아남았습니다. Ai2는 LLM 심사자와 인간 선호도 사이의 일치율이 95%라고 보고합니다. 최종 선호도 세트는 약 6,000개 예시로 구성되었습니다. SFT 믹스와 DPO 믹스는 모두 Hugging Face에서 검토할 수 있습니다.

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration and PyTorch tags, the apache-2.0 licence line, the qwen3 and deep-research tags, the Ai2 organisation badge and the start of the model card text about supervised fine-tuning and offline DPO.

가장 전이 가능한 발견은 또한 가장 매력적이지 않은 발견이기도 하다. 초기 SFT 실행은 더 나은 보고서를 작성했지만 답변 정밀도와 인용 품질에서는 뒤처졌다. 그래서 팀은 합성 훈련 데이터에 네 가지 통계 기반 필터를 테스트했다: 출력 대 입력 토큰 비율, 인용된 논문의 평균 검색 관련성, 인용 밀도(적어도 하나의 인용을 포함하는 진술의 비율), 그리고 인용 다양성. 가장 큰 향상은 인용 밀도가 낮은 합성 보고서를 걸러내는 데서 나왔다. 그리고 더 공격적인 필터링, 필터 조합, 학습률 스윕은 의미 있는 향상을 더하지 못했다. Ai2의 결론은 이 모델을 넘어 적용할 가치가 있다: 특화는 사전 학습에 더 많은 과학 텍스트를 쏟아붓는 문제가 아니라, 사후 학습 데이터의 구성과 품질의 문제였다.

Ai2가 공개한 스코어보드, 그리고 이를 읽는 방법

A screenshot of the Hugging Face dataset page for allenai/AstaBrief_DPO_Mix showing the cc-by-nc-4.0 licence, the json format tag and the dataset viewer with a 6.62k-row train split and prompt, chosen and rejected columns.

아래의 모든 수치는 공급업체가 보고한 것입니다. 이는 Ai2의 모델 카드와 블로그에서 나온 것으로, 연구소 자체 평가 하네스에서 산출되었으며, 그중 어느 것도 독립적으로 재현되지 않았습니다. 주요 목표 대상은 SQABench-CS2였으며, 이는 100개의 사용자 작성 컴퓨터 과학 연구 질문 세트로, 네 가지 지표로 추적되었습니다: 구성 요소 재현율(필요한 내용의 포함 범위), 답변 정밀도(각 문단이 관련성이 있는지 여부), 인용 정밀도(각 인용이 자신의 주장을 뒷받침하는지 여부), 인용 재현율(제시된 인용으로 주장이 완전히 뒷받침되는지 여부).

• 전체 평균 — AstaBrief 8B 87.0, 자체 SFT 체크포인트 83.7, 베이스 Qwen3-8B 77.3

• 성분 재현율 — AstaBrief 8B 90.2, SFT 85.2, Qwen3-8B 77.8

• 답변 정밀도 — AstaBrief 8B 89.0, SFT 90.4, Qwen3-8B 90.6

• 인용 정밀도 — AstaBrief 8B 90.5, SFT 87.7, Qwen3-8B 76.2

• 인용 재현율 — AstaBrief 8B 78.2, SFT 71.3, Qwen3-8B 64.6

행들을 함께 읽어 보면 DPO 단계는 일률적으로 더 나은 것이 아니라 표적화된 것으로 보인다. 전체 평균은 상승하고, 성분 재현율과 두 인용 지표 모두 급격히 오르며, 답변 정밀도는 SFT 체크포인트와 베이스 모델 모두보다 소폭 낮아진다. 사용 사례에서 무엇보다 문단별 관련성이 중요하다면, 파인튜닝이 자동으로 정답이 되는 것은 아니다.

2차 평가에서 Ai2는 최종 모델을 자체 ScholarQA 파이프라인 및 DR-Tulu-8B와 비교해 테스트했다. SQABench-CS2 dev에서 Asta ScholarQA는 87.6, DR-Tulu-8B는 86.5, AstaBrief 8B는 86.3을 기록했고, 테스트 분할에서는 ScholarQA 86.2, DR-Tulu-8B 88.8, AstaBrief 87.0이었다. 63개 쿼리로 구성된 장문 합성 벤치마크인 DeepScholarBench에서 ScholarQA는 60.25, DR-Tulu-8B는 56.26, AstaBrief는 53.50을 기록했다 — 오픈 보고서 작성기가 두 대안 모두에 뒤처진 유일한 항목이다. Claude 기반 파이프라인과의 LLM 판정 쌍대 비교 두 건에서 AstaBrief는 dev 비교의 55%, 테스트 비교의 72%를 차지했다. 별도의 인간 연구는 세 명의 연구자가 제시한 질문 14개만을 다뤘으며, 전반적 선호도에서는 DR-Tulu가 이겼지만 세 연구자 중 두 명은 인용 정확도에서 AstaBrief를 선호했다. 세 사람이 낸 질문 14개는 판결이 아니라 신호일 뿐이며, Ai2도 그렇게 제시한다.

그 연구소는 또한 Asta 통합에서 나온 초기 사용 데이터를 공개했다: Fast mode를 시도한 374명의 사용자 중 29.1%가 이틀 이상 사용했고, 사용자들은 평균 3.67개의 보고서 스레드를 생성했으며, 23%는 Thinking mode로 다시 전환하지 않았고, 18%는 작업에 따라 두 모드 사이를 오갔다. 긍정 피드백은 Fast mode의 경우 84.2%, Thinking mode의 경우 85.2%로 나타났다 — 두 수치가 충분히 가까워 Ai2는 이 피드백이 강한 결론을 내리기에는 너무 희박하다고 평가한다. 이것이 정직한 표현이므로 그대로 유지하라.

직접 실행하기

AstaBrief 8B는 Apache-2.0이며 Qwen/Qwen3-8B를 기반으로 하므로 데이터센터 등급이 아니라 단일 GPU 등급에 속합니다: Qwen3 아키텍처의 덴스 8B 모델로, 36개 레이어, 히든 크기 4096, 8개의 key-value 헤드를 가진 32개의 어텐션 헤드, 151,936개 토큰 어휘, 그리고 베이스의 40,960토큰 위치 상한을 갖습니다. BF16에서는 24GB 카드에 넉넉히 들어가며, 해당 카드 자체의 예시는 temperature 0.7, top-p 0.95, 4096토큰 출력 상한으로 vLLM을 사용합니다.

모델 카드에 굵은 글씨로 인쇄된 운영 경고가 하나 있는데, 쉽게 지나치기 쉽습니다. 바로 그 체크포인트가 특정 프롬프트 형식 하나에 맞춰 미세 조정되었으며, 이 형식은 AstaBrief_prompts 데이터셋에 sft_prompt.txt로 공개되어 있다는 점입니다. 다른 프롬프트나 상호작용 형식을 사용하면 Ai2는 성능 저하 또는 일관성 없는 동작을 예상합니다. 자체 하네스로 이 모델을 평가하여 좋지 않은 결과를 얻었다면, 가중치에 대해 어떤 결론을 내리기 전에 프롬프트를 확인하십시오.

카드는 범위에 대해서도 솔직합니다. AstaBrief는 범용 어시스턴트가 아니라 연구 및 교육용으로 의도되었으며, Ai2에서 제공하는 호스팅 추론 엔드포인트는 없습니다. 직접 다운로드하거나 Asta 안에서 사용하는 것입니다. 우리 카탈로그의 어떤 제공자도, 우리 자신을 포함해, 그것을 제공하지 않으므로 가리킬 경로가 없습니다. 그것을 사용하는 정직한 방법은 자신의 하드웨어에서 또는 자신의 방화벽 뒤에서 사용하는 것이며, 이는 바로 Ai2가 애초에 오픈 웨이트를 위해 내세우는 논거입니다.

라우터가 보고서 파이프라인에 들어가는 위치

AstaBrief는 더 긴 체인에서 한 슬롯을 차지합니다. 무언가가 문헌을 검색하고, 무언가가 어떤 발췌문을 다음 단계로 전달할 가치가 있는지 결정하며, 무언가가 완성된 보고서를 판단하거나 검증할 수 있습니다. 이러한 호출은 일반적인 호스팅 모델 호출이며, 여러분이 실제로 공급업체를 선택하고 싶어 하는 스택의 부분입니다: 200개 이상의 모델을 지원하는 단일 API, 공급업체 정가가 0% 마크업으로 전달됩니다 따라서 공급업체의 가격 인하가 같은 날 청구서에 반영됩니다, 공급업체가 성능 저하를 보이면 자동 장애 조치, 그리고 여러 모델을 하나의 호출로 구성하려는 경우 라우팅 DSL. 작성기는 데이터 민감성 영향과 고정 비용이 있는 부분이므로 자체 호스팅하십시오; 오케스트레이션은 유연성이 소유권보다 더 가치 있는 부분이므로 라우팅하십시오.

여기에는 값싼 실험도 하나 있다. Ai2 자체의 비교 세트는 Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, GPT-4.1로, 의도적으로 2025년 최전선을 고른 것이며, 연구소는 이를 아직 다시 실행하지 않았다고 말한다. 자신의 질문에 대해 AstaBrief의 출력을 오늘날의 호스팅 모델들 옆에 놓는 것은 두 쪽 모두 같은 엔드포인트를 통해 접근할 수 있다면 키 하나만 누르면 되는 작업이고, 이는 블로그 글에서 열어 둔 질문에 답한다.

무엇이 상황을 바꿀까요?

세 가지가 갖춰지면 이번 공개는 잘 문서화된 공개를 넘어 확고한 결과가 될 것이다. 위의 모든 수치가 자체 보고된 것이므로, SQABench-CS2 수치의 독립적 재현이 필요하다. 연구소 스스로 인정한 바와 같이 비교 집합이 1년이나 지났으므로, 현재의 프런티어 모델들을 대상으로 한 재실행도 필요하다. 그리고 세 연구자가 제시한 열네 개 질문보다 더 큰 규모의 인간 평가도 필요하다. Ai2의 자체 블로그는 모델이 출처의 증거적 범위를 보존하는지, 나아가 표본 특정적 발견을 광범위한 일반화로 슬그머니 바꾸지는 않는지까지 묻기 위해, 이 분야가 인용 뒷받침을 넘어서는 평가를 필요로 한다고 주장하며 끝맺는다. 이는 전체 평가 범주에 대한 정당한 비판이며, 이번 공개에도 적용된다.

당장은 실용적인 판단이 간단하다. 문헌에서 인용이 포함된 보고서를 생성하면서, 작성 모델을 자체 하드웨어에서, Apache-2.0 라이선스로, 학습 데이터가 공개된 상태로 원한다면, AstaBrief 8B는 지금까지 누구든 공개한 것 중 가장 직접적으로 목적에 맞게 만들어진 오픈 옵션이며, 3.5배의 실제 경과 시간 단축이 그것이 존재하는 이유다. 작업이 가능한 가장 예리한 종합에 달려 있다면, Ai2 자체 표에서 DR-Tulu가 전반적인 인간 선호도에서 앞서고 ScholarQA가 DeepScholarBench에서 앞선다는 점, 그리고 바로 그 이유로 Thinking 모드가 같은 제품에 여전히 있다는 점을 기억해 두라.