'TwIL-LM3-Pro vs Qwen 3.8'라는 제목의 생성된 타이틀 카드가 있고, 부제는 '카드가 실제로 실행한 비교'이며, 두 개의 둥근 카드에는 각각 'TwIL-LM3-Pro - 3.66B, 로컬, 비상업용'과 'Qwen3.8-Max - 호스팅됨, 1M 컨텍스트, $2 / $6'라고 적혀 있습니다. 하단 줄에는 'webAI는 Qwen3.8-Max가 아닌 Qwen3-8B를 기준으로 측정되었습니다.'라고 적혀 있습니다. OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

TwIL-LM3-Pro vs Qwen 3.8: 잘못된 비교, 그리고 실제로 중요한 비교

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

TwIL-LM3-Pro와 Qwen3.8-Max는 같은 페이지에 있어서는 안 됩니다. 그 이유는 한쪽이 더 낫기 때문이 아닙니다. 문제는 webAI의 3.66B 형식 논리 모델에 대해 공개된 근거가 Qwen 모델과의 비교에 기반을 두고 있다는 점인데, 문제의 그 Qwen 모델은 헤드라인에 이름이 오른 모델이 아닙니다. webAI의 트랙 A 및 트랙 B 표는 TwIL-LM3-Pro를 이전 세대의 덴스 8B 오픈 가중치 모델인 Qwen3-8B와 비교해 측정하며, Qwen3.8-Max에는 전혀 주목하지 않습니다. TwIL-LM3-Pro가 이길 것이기 때문이 아니라, Qwen3.8-Max가 Alibaba의 플래그십 호스팅 시스템이기 때문입니다. 보고된 바로는 2.4조 파라미터에 토큰당 약 950억 개가 활성화되는 희소 전문가 혼합(mixture-of-experts) 모델이며, 100만 토큰 멀티모달 컨텍스트 윈도우를 갖추고, 요금표는 입력 100만 토큰당 $2.00, 출력 100만 토큰당 $6.00입니다. 2.09 GiB 랩톱 GGUF를 그 옆에 놓는 것은 대결 페이지로 포장된 범주 오류입니다.

그래서 이 글은 두 가지를 한다. 검색 결과가 잘못 알고 있는 비교를 바로잡고, 그다음에는 독자가 아마 실제로 품고 있을 질문의 버전에 답한다. 즉, 프런티어 모델은 API 호출 한 번이면 닿을 수 있고 형식 논리 전문가는 자신의 컴퓨터에서 실행된다면, 각각은 언제 제자리를 얻는가?

카드가 실제로 측정한 모델

관련 비교 대상은 Qwen3-8B이며, 이에 대한 webAI 자체 요약은 간접적인 글들이 시사하는 것보다 더 겸손합니다. TwIL-LM3-Pro의 인도메인 매크로 게이트는 Qwen3-8B의 0.5336에 맞서 0.5539이고, 모델 카드에는 마케팅 페이지라면 삭제했을 문장이 들어 있습니다: 게이트 우위는 0.020으로, "레인당 n = 200에서의 샘플링 노이즈보다 작으므로, 그것은 승리가 아니라 동등으로 읽어야 합니다."

비교가 동전 던지기가 아닌 부분: strict-7, 0.2879 대 0.2093 — 어디에서도 느슨한 일치 가점을 사용하지 않아 포맷팅으로 만들어낼 수 없는 행입니다. 엄격한 다지선다형, 0.4100 대 0.0000. 규칙 귀납, 0.4195 대 0.3680. 그리고 파라미터 비율 — 3.66B 대 대략 8B — 바로 "절반도 안 되는 크기"라는 주장의 전부입니다.

홀드아웃 스위트에서 webAI는 더 직설적이다. "TwIL-LM3-Pro는 그것을 앞서지 못한다." 10개 데이터셋 매크로는 0.7901로, 자체 Granite 베이스와 같은 수준이며 Qwen3-8B의 0.8493에는 뒤진다. 형식 논리에서 두 배 크기의 범용 모델과 동점을 이루면서도 일반 역량에서는 그 모델에 뒤지는 작은 전문 모델은 예상되는 모양새이며, 그것을 그렇게 보고하는 것이 strict-7 수치를 믿을 수 있게 만든다.

Qwen3.8-Max의 실제 정체

Qwen3.8-Max는 Qwen3-8B의 반복 버전이 아닙니다. 이는 Alibaba의 프리미엄 티어로, OrcaRouter 카탈로그 페이지에서 `qwen/qwen3.8-max`로 표시되며 출시일은 2026년 8월 3일, 100만 토큰 컨텍스트 창, 텍스트·이미지·비디오 입력, 텍스트 출력, 그리고 사고 모드, 함수 호출, 내장 도구 및 구조화된 출력을 완전히 지원합니다. 이는 5개 리전에서 OpenAI 호환, Anthropic 호환 및 네이티브 대시보드를 통해 제공되며, 사고 기능은 `enable_thinking` 매개변수로 전환합니다. 요금은 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00입니다.

날짜가 지정된 스냅샷 `qwen/qwen3.8-max-0902`는 2026년 9월 2일에 동일한 기능과 동일한 가격으로 공개되었으며, 재현 가능한 실행을 위해 동작을 고정할 수 있도록 특별히 배포된 것입니다. 오래 유지될 무언가를 위해 Qwen3.8-Max를 기반으로 개발하고 있다면, 구성 파일에는 계속 변하는 별칭이 아니라 바로 그 스냅샷 식별자를 넣어야 합니다.

그 설명에서 빠져 있는 것에 주목하라. 바로 다운로드할 수 있는 파라미터 수, 라이선스 파일, 그리고 직접 실행해 볼 수 있는 경로다. Qwen3.8-Max는 호스팅 제품이다. 출시 당시 언론 보도는 다음 주에 오픈 웨이트가 공개될 것이라는 약속을 전했으며, techsy의 표현 — "2.4T 파라미터, 1M 컨텍스트, 아직 웨이트 없음" — 은 독자가 가정하기보다 확인해야 하는 현황이다. 왜냐하면 출시 당시 보도된 약속은 공개된 체크포인트가 아니기 때문이다.

네 개의 차원, 그리고 그중 어느 것도 가깝지 않다

• 매개변수 — TwIL-LM3-Pro는 3.66B 밀집형으로 전부 활성인 반면, Qwen3.8-Max는 희소 전문가 혼합(MoE) 설계에서 총 2.4T, 토큰당 약 95B 활성으로 보고됩니다. 총량에서는 세 자릿수, 활성에서는 두 자릿수 차이입니다.

• 실행 환경 — TwIL-LM3-Pro는 6.82 GiB bf16으로 다운로드되거나 CPU 또는 4 GB VRAM용 2.09 GiB Q4_K_M GGUF로 다운로드될 수 있는 반면, Qwen3.8-Max는 호스팅된 엔드포인트로만 존재합니다.

• 컨텍스트 — TwIL-LM3-Pro 131,072 토큰, Granite 기반에서 물려받았으며, 1,000,000 토큰의 Qwen3.8-Max와 비교한 자체 평가에서 8,192를 넘어 검증된 적이 없습니다.

• 모달리티 — 텍스트 입력, 텍스트 출력 vs 텍스트, 이미지, 비디오 입력, 텍스트 출력.

• 라이선스 — webAI 비상업적 라이선스 ver. 1.0, 수익 창출 용도에는 별도 계약이 필요하며, 라이선스할 가중치가 없는 호스팅형 상업 API와는 대조적입니다.

• 비용 — TwIL-LM3-Pro: 토큰당 요금도 없고 호스팅 엔드포인트도 없는 반면, Qwen3.8-Max는 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00이며 캐시된 입력 요율은 100만 개당 약 $0.25입니다.

3.66B 모델이 저렴한 것은 작기 때문이고, 작은 것은 한 가지 일만 하기 때문이다. Qwen3.8-Max가 비싼 것은 범용적이고 호스팅되기 때문이다. 어느 쪽 가격도 판결은 아니다.

질문 뒤에 숨은 질문

이름 짓기의 혼란을 걷어내면 공학적인 질문이 남는데, 그건 좋은 질문이다: 프런티어 호스티드 모델이 형식 논리를 추론할 수 있다면, 애초에 왜 좁은 전문가를 돌려야 할까?

세 가지 이유가 타당하다. 첫째는 라이선스와 네트워크다. 비상업적 연구 그룹, 에어갭 환경, 또는 연결이 없는 노트북에서 실행해야 하는 배치 라벨링 작업은 호스팅된 엔드포인트를 호출할 수 없으며, 2.09 GiB GGUF는 그 제약에 직접적으로 부응한다. 둘째는 대량 처리에서의 비용 구조다. 백만 개의 짧은 입력에 대한 형식 논리 라벨링 작업은 호스팅된 프런티어 모델에서는 토큰당 비용을 지불하지만, 로컬 모델에서는 월클록 시간 외에는 아무것도 지불하지 않는다. 셋째는 출력 형태다. TwIL-LM3-Pro는 산문이 아니라 기계가 검사할 수 있는 구조를 출력하도록 튜닝되었으며, 함의 레이블과 의미 구문 분석의 경우 이는 범용 모델에 프롬프트를 넣고 그 답변을 파싱하는 것보다 더 작은 파이프라인이다.

그에 반해, Qwen3.8-Max의 경우는 단순하다. 그것은 이미지와 비디오를 인식하고, 100만 토큰을 보유하며, 문서화된 API를 통해 도구와 구조화된 출력을 처리하고, 그 뒤에는 공개된 벤치마크와 독립적인 평가가 있다. 좁은 분야의 전문가라는 점이 그것을 위협하지 않는다. 둘은 서로 다른 제약 조건 집합에 대응하고 있다.

둘 다 사용하는 스택

실제 파이프라인과 접촉해도 살아남는 패턴은 2계층 구조이며, 이는 이국적이지 않다. 프런티어 호스팅 모델은 지저분한 입력 — 스캔한 교과서 페이지, 혼합 모달리티 소스, 긴 사양서 — 을 읽고 이를 깔끔한 구조화 텍스트로 변환한다. 그 텍스트는 당신이 소유한 하드웨어에서 레이블, 파싱 또는 Lean 비평을 내보내는 것이 전부인 로컬 형식 논리 모델로 전달된다. 그 두 번째 계층이 유지 비용을 감당할 가치가 있는지에 대한 판단은 strict-7 스타일 비교이지, 게이트가 아니다. 왜냐하면 전문가는 지표가 관대한 채점을 허용하지 않는 영역에서 자신의 자리를 얻기 때문이다.

webAI 자체 카드에서 얻을 만한 단서도 있다: 이 파이프라인은 서로 다른 다섯 개의 베이스 모델에서 실행되었고, 모델마다 바뀐 것은 병합 계수뿐이었으며, webAI는 가장 적게 변한 모델들을 포함해 각각의 결과를 보고한다. 이는 어떤 단일 벤치마크 수치보다 레시피에 대한 더 강한 주장이며, 하나의 체크포인트가 운 좋게 잘된 것이 아니라 어떤 방법이 일반화된다는 것을 알려주는 종류의 증거다.

여기서 라우팅 가능한 것은 무엇이고, 라우팅 가능하지 않은 것은 무엇인가요?

솔직히 두 모델이 같은 문장에 나란히 등장하는 유일한 대목이다. Qwen3.8-Max는 하나의 라우트다: OrcaRouter를 통해 `qwen/qwen3.8-max`로 제공되며, 플랫폼이 공급자 정가를 마크업 0%로 그대로 전달하기 때문에, $2.00/$6.00 요금은 벤더 자체의 것이고 벤더 가격 인하는 계약 주기가 지난 뒤가 아니라 같은 날 바로 적용된다. 날짜가 명시된 `qwen/qwen3.8-max-0902` 스냅샷도 이와 함께 라우팅할 수 있으므로, 재현 가능한 모델 ID를 고정하는 것은 별도의 벤더 관계가 아니라 구성 선택이다.

TwIL-LM3-Pro는 경로가 아니며, 그렇다고 암시하는 것은 정직하지 않을 것입니다. 이 모델은 비상업적 라이선스로 제공되고 공개된 호스팅 엔드포인트도 없으며, 현재 사용 방법은 체크포인트를 내려받아 직접 실행하는 것입니다. 라우터가 이 모델을 중심으로 구축된 파이프라인에 해 주는 일은 주변 텍스트 작업, 즉 프롬프트 확장, 코퍼스 생성, 필터링 패스이며, 이는 동일한 OpenAI 호환 엔드포인트에서 200개가 넘는 모델을 대상으로 실행되므로, 평가 데이터를 생성하는 모델을 이를 평가하는 모델로 바꾸는 데 드는 비용은 설정 편집뿐이고, 공급자가 문제를 일으킬 때 긴 배치를 계속 살려 두는 자동 페일오버.

두 가지를 함께 사용하는 가장 정당화하기 쉬운 방식은 바로 이것입니다: 라우팅 가능한 프런티어 티어가 일반 추론과 구조화된 추출을 담당하고, 다운로드한 전문 모델이 형식 논리 판단을 맡으며, 그 사이의 모든 작업에는 단일 키를 사용하는 것입니다.

어떤 모델을 비교할지, 그리고 언제

작은 형식 논리 모델을 평가하고 있다면, TwIL-LM3-Pro 옆에 둘 만한 Qwen은 Qwen3-8B이며, webAI는 이미 그 비교를 주의사항과 함께 게시했습니다. 프로덕션 워크로드를 어디서 실행할지 선택하고 있다면, Qwen3.8-Max는 전혀 다른 결정입니다 — 요금표가 있고 다운로드가 없는 호스팅형 프런티어 시스템 — 그리고 올바른 질문은 어느 것이 더 나은가가 아니라 어떤 제약이 걸리는가입니다: 한쪽은 연결성과 라이선스이고, 다른 쪽은 컨텍스트, 모달리티, 규모입니다. 대부분의 실제 시스템은 결국 두 답이 모두 필요합니다.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트