
AREX-2 vs LFM2.5 2.6B Base: 빈 저장소와 지침이 없는 체크포인트
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 507 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 194 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
를 놓고 보면AREX-2 옆에 LFM2.5 2.6B Base 가장 먼저 눈에 띄는 공통점은, 둘 다 오늘 당장 쓸 수 있는 제품이 아니라는 것인데, 그 이유는 서로 아무 관련이 없다. AREX-2는 BAAI가 2026년 9월 29일 17:56 UTC에 만든 Hugging Face 리포지토리로, .gitattributes 파일 하나를 담고 있을 뿐 모델 데이터는 0바이트이고, 모델 카드도 라이선스 태그도 어떤 공지도 없다. Liquid AI가 2026년 8월에 공개한 LFM2.5 2.6B Base는 정반대 종류의 미완성이다. 즉 LFM Open License(lfm1.0) 아래 완전히 다운로드할 수 있는 26억 9천만 파라미터 텍스트 전용 체크포인트이며, 질문을 받기보다 파인튜닝되도록 만들어진 것이기 때문에 의도적으로 인스트럭션 튜닝 없이 제공된다.
하나는 아티팩트의 부재다. 다른 하나는 애초에 가질 필요가 없었던 단계가 빠져 있는 아티팩트다. 대충 훑어볼 때만 둘은 같은 범주이고, 둘을 같은 범주로 취급하는 것은 바로 팀이 엉뚱한 것을 기다리게 되는 방식이다. 이 둘 사이의 유용한 비교는 역량이 아니다 — 측정할 AREX-2가 없다 — 오히려 각각이 무엇을 위한 원료인지, 그리고 그것이 쓸 만한지 알아내는 데 비용이 얼마인지다.
종류의 차이를 먼저 말하자면
LFM2.5 2.6B Base는 하나의 실체입니다. 이는 Liquid AI의 LFM2.5 하이브리드 패밀리에서 사전 학습된 체크포인트로, 30개 레이어 중 22개는 이중 게이트 숏 컨볼루션 블록이고 8개는 그룹화된 쿼리 어텐션이며, 16개 언어에 걸쳐 약 34조 토큰으로 학습되었고, 131,072토큰 컨텍스트 윈도와 Q4_K_M에서 약 1.67GB에 이르는 양자화 빌드를 갖추고 있습니다. 명령어 튜닝은 되어 있지 않습니다. 질문을 넣으면 텍스트를 이어 쓸 뿐, 답하지는 않습니다. Liquid AI 자체 카드는 집중적인 파인튜닝을 의도된 용도로 지목하며, 프롬프트에 응답하는 모델을 원하는 사람을 위한 사후 학습된 형제 모델도 있습니다. 이는 토대이며, 프롬프트 따르기 벤치마크에서 낮은 점수를 받는다는 사실은 결함이 아닙니다 — 그것이 바로 이 모델의 정의입니다.
AREX-2는 실체나 제품이 아니라 네임스페이스입니다. 확인 가능한 유일한 사실은 조직(BAAI), 생성 타임스탬프(2026년 9월 29일), 그리고 이름뿐입니다. 아무것도 업로드되지 않았고 아무 말도 없습니다. 그 이름 자체는 실제로 존재하는 계열에 속합니다: 2026년 7월 23일 BAAI는 Qwen3.5-122B-A10B를 기반으로 구축된, 활성 파라미터 100억 개를 갖춘 1,220억 파라미터 mixture-of-experts 모델 AREX-Base와, Qwen3.5-4B를 기반으로 구축된 dense 4B 모델 AREX-Turbo를 공개했습니다 — 둘 다 Apache 2.0이고, 둘 다 증거를 수집하고 신뢰도 수치와 함께 후보 답변을 생성한 다음 원래 제약 조건에 비추어 그 답변을 검증하고 개선하거나 재시작하는 2중 루프 설계를 갖춘 딥 리서치 에이전트입니다. 공개된 수치는 벤더가 보고한 것으로 독립적으로 재현되지는 않았으며, Base의 경우 BrowseComp에서 82.5, GAIA에서 85.4이고, Turbo의 경우 70.7 / 81.6입니다.
• 가용성 — LFM2.5 2.6B Base는 지금 다운로드할 수 있습니다. AREX-2는 리포지토리에 파일이 없습니다.
• 크기 — Liquid 모델의 2.69B dense 파라미터로, 체크포인트에서 모두 확인할 수 있습니다. AREX-2의 경우 알 수 없음. 이 제품군은 122B MoE와 4B dense를 아우르므로, "2"가 예측해 주는 것은 없습니다.
• 컨텍스트 — LFM2.5 2.6B Base의 경우 131,072 토큰. AREX-2에 관해서는 공개된 내용이 없습니다.
• 라이선스 — LFM Open License v1.0으로, 연간 매출 1,000만 달러 미만에서는 무료이고 그 이상부터는 별도 라이선스가 필요합니다. AREX-2에는 아직 라이선스 태그가 없으며, 첫 번째 AREX 세대는 Apache 2.0이었습니다.
• 무엇인가 — 파인튜닝 기반 vs. 이 제품군을 기준으로 보자면, 가치가 자체 가중치가 아니라 검색-검증 루프에 있는 호스팅된 에이전트.

서로 반대 의미를 지닌 빈 스코어카드
두 모델 모두 당신이 계획을 세울 때 기준으로 삼아야 할 벤치마크가 없으며, 그 이유는 완전히 다릅니다.
Liquid AI가 자사의 Base를 채점하지 않은 채 남겨둔다고 해서 무엇인가를 숨기고 있는 것은 아닙니다. 사전 학습된 체크포인트를 지시 따르기 벤치마크로 채점하는 것은 기반의 품질이 아니라 파인튜닝의 부재를 측정하는 셈이기 때문입니다 — 그래서 이 회사는 후속 학습된 형제 모델을 벤치마킹하고 Base는 평가하지 않은 채 둡니다. 그 공백은 여러분 쪽에서 검증할 수 있으며, 바로それが 핵심입니다: 1.67 GB를 다운로드하고, 여러분의 작업에 대해 직접 평가를 실행하고, 서빙에 비용을 쓰기 전에 답을 알 수 있습니다.
AREX-2의 공백은 설계 결정이 아니라 아직 아닌 것이다. 다운로드할 것이 없으므로 테스트할 것도 없고, 이번 주에 실행할 수 있는 어떤 평가도 그것에 대해 아무것도 알려주지 못한다. 앞으로 며칠 안에 AREX-2 벤치마크 수치를 발표하는 사람은 누구든, 자신이 측정할 수 없었을 것을 발표하는 것이다.

두 가지 서로 다른 파인튜닝 질문
이 둘은 모두 완성된 서비스가 아니라 출발점이므로, 각각 무엇을 위한 출발점이 될 것인지 정확히 따져볼 가치가 있습니다. 바로 그 지점에서 둘은 진정으로 서로 닮지 않게 되니까요.
2.69B 하이브리드 체크포인트는 작고 저렴한 특화 모델을 만드는 도구입니다. 흥미로운 활용은 화려하지 않은 쪽에 있습니다. 규제 워크플로에서 문서 유형을 판독하는 분류기, 양식을 구조화된 JSON으로 바꾸는 추출 모델, 데이터 가까이에서 단일 카드로 실행되는 도메인 특화 재작성기 같은 것이죠. 가치는 이후에 결과물을 직접 소유한다는 점과 호출의 한계 비용이 전기료라는 점에서 나옵니다. 훈련 루프가 바로 그 작업이며, 오늘 시작할 수 있는 작업입니다.
AREX-2는 다른 방향을 가리킵니다. AREX 제품군은 제품으로 미세 조정되도록 설계된 것이 아니라 호출되도록 검색을 실행하고 증거를 통합하며 자신의 답을 제약 조건에 비추어 검증하는 에이전트로서 설계되었습니다. 2세대가 그 흐름을 이어간다면, 여러분이 평가하게 될 것은 궤적입니다 — 몇 단계를 거치는지, 모순을 알아차리는지, 후보 답변의 신뢰도 수치가 의미가 있는지. 그것은 미세 조정 질문이 아니고 가중치 질문도 아닙니다. 그것은 서빙 질문이며, 누군가 가중치와 카드를 공개하는 것에서 시작합니다.
이것들은 어떤 크기에서도 대체재가 아니다. 자체적으로 소유하고 재훈련할 수 있는 모델이 필요한 팀은 AREX-2를 기다리지 않는다. 연구 에이전트가 필요한 팀은 2.6B 하이브리드를 미세 조정해 연구 에이전트로 만들지 않을 것이다.
각각에 대해 라우팅 계층이 어디에 맞는지
이 둘 사이의 실질적인 차이는 모델이 애플리케이션에 들어가는 순간 드러나는데, 이 둘은 호스팅과 정반대의 관계를 맺고 있기 때문이다.
LFM2.5 2.6B Base는 OrcaRouter의 카탈로그에 없고 LFM2.5 변형도 없습니다. 따라서 Liquid AI 자체 배포판과 일반적인 서드파티 호스트에서 오는 것으로, 라우팅된 엔드포인트가 아니라 로컬 아티팩트입니다. AREX-Base와 AREX-Turbo도 우리 카탈로그에는 없습니다. 그렇다면 이 그림에서 라우팅 계층이 진정으로 무엇을 위한 것인지는 아키텍처의 다른 측면입니다. 즉, 여러분의 파인튜닝을 그것이 반드시 이겨야 하는 모델들과 비교하는 날, 그 비교가 조달 주기가 아니라 구성 변경 하나로 끝나기를 바라게 됩니다. 200개가 넘는 모델 앞에 놓인 단일 API, 제공업체 정가가 토큰당 아무것도 더해지지 않고 그대로 전달되는 것, 전체 패널에 키 하나, 그리고 한 제공업체의 안 좋은 오후가 여러분 평가의 안 좋은 오후가 되지 않도록 하는 페일오버. 이것이 검증되지 않은 모델에 대한 A/B 테스트를 실제로 실행할 만큼 저렴하게 만드는 조건입니다.
그것은 AREX-2 자체에 대해서도 정직한 프레이밍이다. AREX-2가 출시될 때 — 두 전작이 그랬던 것처럼 오픈 웨이트로 출시된다고 가정하면 — 완전히 새로운 에이전트를 실제 워크로드에서 시험하는 현명한 방법은 사이드 경로에서, 페일오버 뒤에서 시험하는 것이지, 프로덕션 루프가 의존하는 단일 제공자로 삼는 것이 아니다.
합리적인 사람이 이번 주에 각각에 대해 하는 일
작고 범위가 좁은 작업이 있고 데이터가 자사 인프라를 벗어날 수 없다면, Liquid 체크포인트를 사용할 수 있으며, 크기가 작고, 수익 임계값 이하에서는 허용적 라이선스가 적용되고, 오늘 오후에 바로 테스트해 볼 수 있습니다. 다운로드해서 자체 평가 세트에서 실행하고, 결과가 결정하게 하세요. AREX-2에 관한 어떤 것도 그 계획을 바꾸지 않습니다.
오늘 장기 지평(long-horizon) 연구 행동이 필요하다면, 선택해야 할 모델은 이미 존재하는 것입니다: 7월에 출시된 AREX-Base이며, 최소한 논문과 대조해 확인할 수 있는 공개된 에이전트 벤치마크가 있습니다. AREX-2는 타임스탬프가 붙은 이름일 뿐이고, 그 위상을 바꿔 놓을 두 가지는 외부에서도 보입니다 — 트리에 파일이 나타나는지, 그리고 그와 함께 파라미터 수와 라이선스가 적힌 카드가 나타나는지.
이 글이 방지하고자 하는 실패 양상은 예약된 이름이 로드맵 항목으로 취급되는 경우입니다. 그렇지 않습니다. 그것은 BAAI가 어제 만든 리포지토리이며, 지금 당장 그와 관련해 세워야 할 계획의 적정량은 없습니다.
