생성된 타이틀 카드에는 'AREX-2 vs Qwen3.8-Max - 기반재와 그 위에서 실행되는 것'이라고 적혀 있으며, 두 개의 패널이 있습니다. 왼쪽 패널은 Qwen3.8-Max라는 제목 아래 다음과 같이 나열합니다: 2026년 8월 3일부터 라이브; 1M 토큰 컨텍스트, 멀티모달; 1M당 $2 입력 / $6 출력; 오늘 호출 가능. 오른쪽 패널은 AREX-2라는 제목 아래 다음과 같이 나열합니다: 2026년 9월 29일 생성된 저장소; 가중치 없음, 모델 카드 없음; 어디에도 요금표 없음; 어디에서도 호출 불가. 하단에는 '최초의 AREX 세대는 Qwen 백본에서 포스트트레이닝되었습니다.'라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

AREX-2 vs Qwen 3.8: 하나는 기반이고, 다른 하나는 아마 그 위에 구축된 것

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

의 맞대결은 AREX-2와 Qwen3.8-Max두 중국 연구소의 플래그십 시스템 간의 정면 승부처럼 보이지만, 실은 그렇지 않다. AREX-2가 검증되지 않았기 때문이 아니라 — 물론 검증되지 않은 것은 사실이지만 — 두 시스템이 같은 스택의 서로 다른 계층에 자리하기 때문이다. Qwen3.8-Max는 2026년 8월 3일부터 서비스 중이며, 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러에 100만 토큰 컨텍스트 윈도를 제공한다. 오픈 웨이트 형제 모델인 Qwen3.8-27B와 Qwen3.8-Flash는 8월 13일과 8월 26일에 공개된 벤치마크와 공개된 가격과 함께 출시되었다. AREX-2는 BAAI가 2026년 9월 29일 17:56 UTC에 Hugging Face에 만든 저장소로, .gitattributes 파일 하나만 들어 있고 그 외에는 아무것도 없다. 그리고 이 둘이 라이벌이 아닌 이유는 어느 벤더도 크게 알리지 않는 근본적인 사실에 있다. 지금까지 BAAI가 출시한 모든 AREX 모델은 Qwen 백본 위에 구축되어 있다.

그것은 AREX-2에 관한 추측이 아니다. 그것은 현존하는 세대에 대해 문서화된 내용이다. AREX-Base는 Qwen3.5-122B-A10B를 기반으로 구축된, 활성 매개변수 100억 개를 가진 1,220억 매개변수 전문가 혼합(mixture-of-experts) 모델이고, AREX-Turbo는 Qwen3.5-4B를 기반으로 구축된 밀집형 4B이다. 둘 다 2026년 7월 23일에 Apache 2.0으로 공개되었다. 따라서 이 비교의 정직한 구도는 에이전트 대 플래그십이 아니다. 그것은 다음과 같다. 알리바바라는 기반이 오늘날 당신에게 무엇을 제공하는가, BAAI의 에이전트 계층이 그 위에 무엇을 더하는가, 그리고 BAAI가 파일을 업로드하기 전에 두 번째 질문의 얼마나 많은 부분에 답할 수 있는가?

Q 쪽에서 라이브로 제공되는 것은 무엇이며, 비용은 얼마인가요?

Qwen3.8 세대는 완전히 공개적으로 명세되고 세 가지 뚜렷한 등급으로 가격이 책정되어 있어, 유난히 추론하기 쉽다.

• Qwen3.8-Max — 2026년 8월 3일 출시. 100만 토큰 컨텍스트 윈도, 네이티브 텍스트·이미지·비디오 입력, 사고 모드, 함수 호출 및 구조화된 출력, 그리고 5개 리전에 걸친 세 가지 와이어 형식(OpenAI 호환, Anthropic 호환, 네이티브 DashScope)을 지원합니다. 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00이며, 캐시 읽기는 $0.25입니다.

• Qwen3.8-27B — 2026년 8월 13일 출시. 덴스(dense) 27B 파라미터, 256K 컨텍스트(262,144 포지션), 텍스트·이미지·비디오 입력, Apache 2.0 가중치. Qwen 자체 카드에 공개된 수치는 LiveCodeBench v6 90.3, GPQA Diamond 89.2, OSWorld-Verified 84.3, QwenSWEBench 79.0 — 벤더 보고 수치이지 독립적으로 재현된 것이 아니다. 독립 측정에서는 Artificial Analysis Intelligence Index 33.7, AA Coding index 68.1을 기록했다.

• Qwen3.8-Flash — 2026년 8월 26일 출시. 동일한 100만 토큰 윈도우와 동일한 멀티모달 입력을 제공하며, 입력 토큰 100만 개당 0.15달러, 출력 토큰 100만 개당 0.47달러입니다. 이 제품군의 저렴한 티어이자, 대용량 에이전트 트래픽을 감당할 수 있게 해주는 모델입니다.

태그가 지정되지 않은 Qwen3.8 항목도 있습니다. 바로 알리바바가 가중치 공개를 예고했지만 아직 어디에서도 호출할 수 없는 2.4조 파라미터 플래그십 모델입니다. "Qwe​n 3.8"을 검색하면서 하나의 모델을 기대하고 있다면, 바로 그 때문에 답이 하나가 아니라 네 개의 패밀리인 것입니다.

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

그 모든 것과는 대조적으로, AREX-2의 명세는 한 줄에 불과하다: 저장소 하나, 타임스탬프 하나, 그리고 BAAI가 이미 한 번 구축한 무언가의 2세대임을 암시하는 이름 하나.

전체 비교를 새롭게 바라보게 하는 세부 사항

AREX는 Qwen의 경쟁자가 아니라 Qwen의 소비자입니다. 1세대 AREX 모델 두 가지는 모두 Qwen3.5 백본 위에서 포스트 트레이닝된 다음, 채팅 모델이 아니라 에이전트로 만들어 주는 프레임워크로 감싸집니다. 그 안에는 검색하고, 브라우징하고, 증거를 신뢰도 수치를 담은 후보 답변에 통합하는 내부 루프가 있고, 그 답변을 원래 제약 조건에 비추어 확인한 뒤 수용하거나, 다듬거나, 궤적을 폐기하고 처음부터 다시 시작하는 외부 루프가 있습니다. AREX에서 흥미로운 엔지니어링은 네트워크가 아닙니다. 그것은 루프와, 장기적 지평에 걸쳐 검증된 발견, 열린 후보, 미해결 제약을 혼동 없이 유지하는 컨텍스트 업데이트 메커니즘, 그리고 검색과 브라우징을 모델에 일급 액션으로 노출하는 도구 인터페이스입니다.

그렇기 때문에 이 패밀리가 자체 공개한 수치 — 122B Base의 경우 BrowseComp 82.5, GAIA 85.4, xbench-2510 71.0, DeepSearch QA 89.9, WideSearch-en 82.0이고, 4B Turbo의 경우 70.7 / 81.6 / 57.0 / 78.5 / 68.5 — 는 Qwen3.8-27B의 코딩 및 에이전트 점수와 비교할 수 없다. 두 모델이 아키텍처 계보를 공유하더라도 마찬가지다. 그것들은 서로 다른 것을 측정한다. QwenSWEBench는 모델이 저장소 이슈를 해결할 수 있는지 묻는다. BrowseComp는 에이전트가 의도적으로 찾기 어렵게 만든 사실을, 수많은 검색을 거치면서도 질문을 놓치지 않고 찾아낼 수 있는지 묻는다. 가공되지 않은 Qwen3.5 체크포인트는 두 번째에서는 낮은 점수를 받고 첫 번째에서는 좋은 점수를 받는데, 이것이 바로 BAAI의 사후 학습과 하네스가 메우고자 존재하는 격차다.

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

2세대가 가장 그럴듯하게 무엇일지

AREX-2가 이 패턴을 이어간다면, 가장 가능성 높은 해석 — 사실이 아닌 추론 — 은 현재 AREX 모델들이 사용하는 3.5 세대보다 더 새로운 Qwen 백본으로 사후 학습된 2세대 연구 에이전트라는 것입니다. Qwen3.8-27B는 dense(고밀도)이고 멀티모달이며 Apache 2.0이므로 품질 티어 에이전트의 자연스러운 후보가 됩니다. Qwen3.8-Flash는 토큰당 저렴하며, 이는 에이전트가 쿼리마다 수십 번 호출하고 매 단계마다 커지는 컨텍스트를 다시 읽을 때 엄청나게 중요합니다.

그중 어느 것도 확인되지 않았다. 그 이름에는 크기도, 백본도, 날짜도 담겨 있지 않으며, 제품 라인의 "2"는 명세라기보다 명명 관례일 뿐이다. 확인된 것은 훨씬 더 협소하며, 그렇게 말해야 한다: BAAI는 2026년 9월 29일에 저장소를 만들었고, 그 안에 아무것도 넣지 않았으며, 아무것도 발표하지 않았다. 가중치도, 모델 카드도, 파라미터 수치도, 라이선스 태그도, 벤치마크도, 이를 서빙하는 제공자도 없다. 이번 주에 어디에서든 AREX-2 수치가 인용된 것을 본다면, 그것들은 측정값이 아니다.

오늘 오후에 실제로 살 수 있는 것

이 둘 사이의 실질적인 비대칭은 품질이 아니라, 한쪽은 요금표를 갖고 있고 다른 한쪽은 디렉터리 항목을 갖고 있다는 점이다.

당신의 작업이 에이전트 기반이고 AREX 제품군이 기반으로 삼은 토대를 원한다면, 그 정확한 백본을 바로 호출할 수 있습니다: Qwen3.5-122B-A10B 는 OrcaRouter 카탈로그에 100만 입력 토큰당 $0.115, 최대 128K 토큰까지 100만 출력 토큰당 $0.917에 올라 있으며, 그 이상은 $0.287 / $2.294로 오르고, 비전, 도구 사용, 추론이 활성화되어 있습니다. 바로 그 모델이 AREX-Base가 포스트 트레이닝하는 모델이며, 아무것도 기다릴 필요 없이 사용할 수 있습니다.

최신 세대를 원하신다면, 두 가지 오픈 Qwen3.8 티어가 모두 카탈로그에 있습니다: Qwen3.8-27B 백만 입력당 $0.33, 출력 $2.40이며, 자체 인프라에서 실행됩니다 가중치가 공개되어 있어 전가할 공급업체의 토큰당 비용이 없기 때문이며, Qwen3.8-Flash 볼륨 티어의 경우 $0.15 / $0.47입니다. 하나의 API가 둘 모두를 지원하며, 제공업체 정가가 토큰당 아무것도 추가되지 않은 채 그대로 전달되므로, Alibaba가 가격을 변경하면 여기의 숫자도 같은 날 변경됩니다.

그리고 AREX-2가 실제로 출시될 때, 그것이 바로 그 동일한 계층 뒤에 놓여야 하는 이유는 홍보가 아니라 구조적인 것이다. 질의당 스무 번의 호출을 수행하는 에이전트 루프는 모든 제공자의 실패율을 스무 배로 증폭시킨다. 런타임에 결정을 내리는 자동 장애 조치 기능을 갖춘 라우팅 규칙은 타임아웃이 재시도가 되는 것과 타임아웃이 자신 있게 틀린 답이 되는 것의 차이다. 그 논리는 모든 리서치 에이전트에 적용되며, 라우팅할 AREX-2가 존재할 때마다 AREX-2에도 적용될 것이다.

누가 행동해야 하며, 무엇에 대해 행동해야 합니까?

오늘 연구 에이전트가 필요하다면, AREX-Base는 존재하는 AREX 모델이며, 7월에 Apache 2.0으로 출시되었고, 그 에이전트 벤치마크는 공급업체 자체의 것이지만 적어도 다운로드 가능한 모델에 함께 제공됩니다. 오늘 최전선 멀티모달 추론이나 대량 에이전트 트래픽이 필요하다면, Qwen3.8 티어는 출시되어 있고 가격이 책정되어 있으며 일부는 독립적으로 평가되어 있고, AREX-2의 존재 여부는 그 결정을 바꾸지 않습니다.

이번 주에 당신이 내리는 결정에서 AREX-2가 중요해지는 유일한 시나리오는 파인튜닝을 위한 백본을 고르는 경우뿐입니다. 그리고 그 답은 이미 카탈로그에서 보입니다: AREX가 사용한 3.5 백본은 여전히 저렴하고 구할 수 있으며, 3.8 세대는 더 우수하고 역시 구할 수 있습니다. 그리고 2세대 AREX는 — 언제 등장하든 — 거의 확실히 BAAI가 어느 Qwen 베이스를 기반으로 구축할 가치가 있다고 생각하는지에 대한 증거일 뿐, 그것을 대체하는 것은 아닐 것입니다.

나머지를 정리해 줄 세 가지가 있다. 트리 안의 파일, 파라미터 수와 베이스 모델 필드가 있는 카드, 그리고 라이선스 태그다. 이 중 첫 번째가 중요한데, 그것이 반영되기 전까지 이 비교는 가격이 매겨진 패밀리와 임시 자리표시자를 맞대는 셈이기 때문이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트