
Perceptron Mk1.5 vs Qwen 3.8: 로봇에게는 둘 다 필요하며, 어느 하나도 대체재가 아니다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 610 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 189 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
무언가를 집어 들어야 하는 로봇은 모델로부터 두 가지를 필요로 하는데, 이 조합에 있는 어떤 단일 모델도 두 가지를 모두 제공하지 않는다. Perceptron Mk1.5는 기하 정보를 반환한다. 비디오 프레임이 주어지면 점, 박스, 다각형 또는 타임스탬프가 붙은 <track> 요소를 돌려줄 수 있으며, 컨텍스트 윈도는 36,864 토큰이다. Qwen 3.8 — 해당 벤더의 오픈 웨이트 Qwen3.8-2.4T-A95B 코어를 가리키는 이름 — 은 네이티브 262K 윈도가 100만 쪽으로 확장되는 2.4조 매개변수 전문가 혼합(mixture-of-experts) 추론기이며, 텍스트 전용이라 프레임을 전혀 볼 수 없다. 하나는 백만 토큰당 $0.15와 $1.50의 비용이 드는 지각 계층이고, 다른 하나는 입력에 약 13배, 출력에 4배의 비용이 드는 추론 코어이며, Artificial Analysis Intelligence Index에서 독립 점수 40을 받았지만 지각 모델은 어디에도 독립 점수가 없다.
경쟁 제품으로 나란히 놓으면, 이들은 서로 반대 방향에서 상대에게 밀리고, 그 비교는 쓸모 있는 것을 아무것도 만들어 내지 못한다. 하나의 파이프라인을 이루는 두 반쪽으로 나란히 놓으면, 이들은 체화된 스택에서 거의 모든 비용과 신뢰성 결정을 설명해 준다: 프레임이 어디에서 해석되는지, 계획이 어디에서 수립되는지, 그리고 추론을 담당하는 반쪽이 작업에 필요한 것보다 더 많은 토큰을 쓸 때 청구서에 무슨 일이 일어나는지까지.
이 페어링이 말이 되도록 만드는 분할
Perceptron Mk1.5는 2026년 9월 25일 Perceptron Mk1의 후속 제품으로 출시되었으며, 그 역할은 범위가 좁게 정의되어 있다. 텍스트, 이미지, 비디오, 오디오를 입력으로 받아들이고, 텍스트와 선택적 구조화 주석 — 점, 바운딩 박스, 폴리곤, 클립, 트랙 — 을 반환한다. <track> 출력은 공간적 관측값과 그것이 속한 타임스탬프를 모두 담고 있어, 60초 클립은 하나의 평균화된 추측이 아니라 시간에 따른 위치들로 반환된다. asset_idx 필드를 사용하면 단일 요청이 여러 이미지나 비디오를 개별적으로 다룰 수 있으며, 이는 기준 프레임 대 라이브 프레임 비교에 필요한 바로 그 기능이다. 제한된 응답은 JSON Schema와 regex 두 가지 형태로 제공되며, 둘 다의 핵심은 출력이 타입화된다는 점이다.
Qwen 3.8은 정반대 종류의 도구다. 2.4T 코어는 세밀한 MoE로, 92개 레이어, 레이어당 512개 전문가(라우팅 10개 + 공유 1개)로 구성되며, 그 92개 레이어 중 69개가 선형 어텐션을 사용한다. 이는 그렇게 거대한 아키텍처가 긴 컨텍스트에 도달하는 방식이다. 이 모델이 강한 부분은 많은 텍스트에 걸친 추론이다. 복잡한 다단계 분석, 긴 유도, 에이전트형 계획 같은 작업이다. 이 모델이 능력이 없는 부분은 입력 측이다. 공개 코어는 텍스트 전용이며, 그 추론은 끌 수 없다. 모든 응답은 원하든 원하지 않든 사고 블록으로 시작한다.
그것은 추론 모델의 결함이 아니다; 그것은 지각 모델의 결함이며, Qwen 3.8은 지각 모델이 아니다. 두 모델을 순서대로 놓으면 형태가 분명해진다 — Mk1.5는 "지게차가 어디에 있고 언제 움직였는가"에 답하고, Qwen 3.8은 "그것을 전제로 팔이 무엇을 해야 하는가"에 답한다. 어느 질문도 다른 모델이 답할 수 없다.

실제로 청구되는 요율 기준, 각 절반에 드는 비용
• 입력 — Perceptron Mk1.5는 백만 토큰당 $0.15입니다. Qwen 3.8은 독립 하네스가 측정하는 호스팅 빌드에서 백만 토큰당 $2.00이며, 88% 캐시 할인이 적용되어 캐시 적중 시 비용이 대략 $0.24로 낮아집니다.
• 출력 — Mk1.5 백만 토큰당 $1.50. Qwen 3.8 백만 토큰당 $6.00.
• 캐시 — Mk1.5의 캐시된 입력은 백만 토큰당 $0.0375이며, 이는 표준 입력 요율의 정확히 4분의 1입니다. Qwen 3.8의 할인은 비율 기반이지만 더 깊어 88%이므로, 캐시된 요율은 절대 금액 기준으로 둘 중 더 저렴하고, 캐시되지 않은 요율은 Mk1.5의 10배가 넘습니다.
• 완료된 작업당 비용 — 바로 여기서 순위가 뒤집힌다. Artificial Analysis는 Qwen 3.8의 Intelligence Index 작업당 비용을 $2.16으로 산정하며, 동급 115개 중 32위에 올리고 비용 부문에서 4개 단위 만점(4/4)을 부여했다 — 토큰은 비싸지만 완료된 작업당으로는 저렴한데, 이는 이 모델이 인덱스 실행 전반에서 1억 7천만 개의 출력 토큰을 생성했기 때문이며, 비교 대상군은 그보다 더 장황하게 늘어놓는다. Mk1.5에는 누구도 공개한 이에 상응하는 수치가 없다.
• 컨텍스트 — Mk1.5는 36,864 토큰으로, Qwen 코어의 네이티브 262K와 대비되며, 적절한 서빙 구성으로 100만까지 확장 가능합니다.
• 추론 제어 — Mk1.5는 reasoning_effort를 high, medium, low, minimal 또는 none으로 노출하며 기본값은 high입니다. Qwen 3.8은 사고를 항상 켜 두므로, 매 호출마다 사고 토큰 비용을 지불하게 됩니다.
그 목록을 두 번 읽어 보세요. 두 모델은 비용 기준이 뒤바뀌기 때문입니다. 토큰당으로는 Mk1.5가 훨씬 더 저렴합니다. 독립적인 벤치마크에서 완료된 작업당으로는 Qwen 3.8이 저렴한 것으로 측정되고, Mk1.5는 측정되지 않았습니다. 이 두 진술은 두 모델이 같은 작업을 수행한다고 가정할 때만 모순되며, 실제로는 그렇지 않습니다.

여기서는 증거가 오히려 반대 방향을 가리킨다
이 배치의 대부분 비교에서는 오픈 웨이트 쪽이 공급업체가 보고한 수치를 잔뜩 쌓아 둔 쪽이고, 클로즈드 API가 제3자 페이지를 가진 쪽이다. 여기서는 그 반대이며, 이러한 반전은 무엇을 검증할 수 있고 무엇을 검증할 수 없는지를 바꾸기 때문에 정확히 짚을 가치가 있다.
Qwen 3.8에는 독립적인 측정이 있다. Artificial Analysis Intelligence Index는 2.4T 코어를 40으로 평가하며, 작성 시점 기준 해당 등급의 115개 모델 중 5위이고, 출력 속도는 초당 39.6토큰으로 115개 중 56위다. 이는 중간권이며, 누구든 이를 중심으로 대화형 루프를 계획하기 전에 알아둘 가치가 있다. 지수 개정은 스냅샷마다 달라지고, 이런 수치를 정직하게 읽는 방법은 방향성으로 보는 것이다. 하지만 요점은 여전히 유효하다: 알리바바 외부의 누군가가 이 모델을 실행해 수치를 공개했다는 것이다.
Perceptron Mk1.5에는 그런 것이 없다. Mk1.5나 그 전작에 대한 Artificial Analysis 항목도, 아레나 점수도 없으므로, 현존하는 모든 성능 수치는 Perceptron이 자사 모델에 대해 산출한 것이다. 그 수치 세트는 유난히 구체적인데, 이는 장점이다 — 공급업체 자체 실행에서 egocentric hand_box 0.9433 대 Gemini 3.1 Pro의 0.4467; EgoSchema 80.40 대 같은 경쟁자의 81.20, 넓은 이해도 벤치마크에서는 근소한 패배이면서 더 어려운 EgoSchema 하위 집합에서는 63.75로 12% 우위를 주장한다; Molmo2-Track에서 0.647 centre-F1과 0.628 point-HOTA — 하지만 구체적이라는 것과 독립적으로 검증되었다는 것은 서로 다른 속성이며, 오직 후자만이 당신의 영상에서 무슨 일이 일어날지 알려준다.
Perceptron의 표를 읽을 때의 두 가지 주의사항이 있으며, 둘 다 이 표를 인용할 때 적용된다. 도구를 활성화한 LiveVQA-W의 56.0 수치는 4개 샘플 다수결 투표에서 나온 반면, Google Search 그라운딩을 사용한 Gemini 3.8 Flash에 대해 이와 대비되는 53.2는 다수결 투표가 아니다; 이 기법은 정당하며, 단일 그리디 패스에 비해 점수를 유리하게 보이게 한다. 그리고 tracking 행은 해당 모델의 논문에서 가져온 Qwen3-VL-8B의 0.180 centre-F1을 기재하고 있으며, 이는 다른 체크포인트 계열에 대한 측정 수치들과 같은 열에 놓여 있다. 측정 열에 있는 논문 수치는 동일 조건 비교 행이 아니며, 이는 바로 출처 없이 인용되기 딱 좋은 종류의 항목이다.
2.4T 코어는 우리에게서 호출할 수 있는 게 아닙니다 — 하지만 그 아키텍처는 그렇습니다

이것은 비교에서, 솔직한 답이 모델의 명성이 시사하는 것과 달라지는 부분입니다. Qwen 3.8이라는 이름은 흔히 오픈 코어를 뜻하는 데 널리 쓰이며, 오픈 코어는 엔드포인트가 아니라 다운로드입니다. 알리바바의 맞춤형 Qwen3.8-Max 라이선스 하에 2026년 8월에 공개된 2.4TB의 BF16 가중치입니다. 우리는 이를 제공하지 않으며, 오늘날 우리 진영에서 이를 제공하는 제공자도 없습니다. 카탈로그 항목은 라이브 경로라기보다는 발표만 되고 아직 이용할 수 없는 추적 페이지로 존재합니다.
우리가 실제로 제공하는 것은 동일한 2.4T 아키텍처 위에 구축된 플래그십 API입니다. 이는 qwen/qwen3.8-max로 라이브 상태이며, 백만 토큰당 $2.00 및 $6.00, 알리바바 자체 요율을 그대로 적용한 가격으로 토큰당 추가되는 것은 없습니다. 1M 토큰 멀티모달 윈도우(텍스트, 이미지, 비디오 입력)와 오픈 코어와 동일한 하이브리드 어텐션 설계를 갖추고 있습니다. 추론 담당 쪽에서 무언가를 봐야 한다면 바로 그 경로이며, 벤더 요율 변경이 다음 결제 주기가 아니라 같은 날 우리 쪽에 반영되는 경로이기도 합니다. 이와 함께 우리는 알리바바의 덴스(dense) 형제 모델 qwen/qwen3.8-27b를 자체 인프라에서 백만 토큰당 $0.33 및 $2.40에 제공하며, 262,144 토큰 윈도우와 텍스트, 이미지, 비디오 입력을 지원합니다. 27B 추론기로 충분하고 2.4T의 40 인덱스가 작업에 필요 이상인 경우를 위한 것입니다.
두 번째 계약 없이 두 반쪽을 연결하기
이 조합이 벤치마크 논쟁보다 더 중요한 실질적 이유는, 임바디드 스택이 이미 두 개의 모델로 구성되어 있고, 세 번째 모델의 통합 비용이 바로 그 설계를 조용히 무너뜨리는 요소라는 점이다. Mk1.5는 우리 카탈로그에 없으므로, 거기에 도달하려면 벤더 자체 API를 써야 한다 — pip install "perceptron>=0.4.0", 키는 PERCEPTRON_API_KEY에, 엔드포인트는 api.perceptron.inc. Qwen 쪽은 키 하나만 있으면 된다.
게이트웨이가 제값을 하는 곳은 바로 그 이음새 지점이다. 질문이 달린 모든 프레임은 지각 모델로, 텍스트 전용 계획은 모두 추론 모델로 보내는 라우팅 규칙은 둘 다 하나의 OpenAI 호환 엔드포인트 뒤에 있을 때에는 설정 한 줄에 불과하며, 자동 페일오버 덕분에 어느 한쪽의 공급자 장애는 멈춰버린 로봇이 아니라 폴백으로 이어진다. 200개가 넘는 모델을 아우르고 정가를 0% 마크업으로 그대로 전달하는 하나의 API는, 이 기사가 답할 수 없는 질문 — 즉 여러분의 객체 추적 작업에 Mk1.5의 좌표가 정말 필요한지, 아니면 훨씬 더 큰 윈도우와 독립적인 점수를 갖춘 범용 비전 모델로 충분했을지 — 에 답하는 가장 저렴한 방법이기도 하다. 후보들 사이에 실제 트래픽의 일부를 라우팅하고 여러분 자신의 프레임에서 측정하는 비용은, 여러분이 의뢰할 수 있는 어떤 벤치마크 연구보다도 적게 든다.
이걸 가지고 구체적으로 어떻게 해야 하나요?
물리적 시스템에 지각을 구축하고 있다면, 이 조합에서 좌표로 답하는 모델은 Perceptron Mk1.5뿐이며, 이는 점수가 아니라 역량입니다 — hand-box 주장을 자신의 영상으로 직접 테스트하고, 높은 기본값을 그대로 받아들이지 말고 reasoning_effort를 의도적으로 설정하며, 36,864토큰 창을 소프트 제약이 아닌 하드 제약으로 예산에 넣으세요. 그 위의 추론 계층을 구축하고 있다면, Qwen 3.8은 Mk1.5가 측정되지 않는 곳에서 측정되며, 계획의 기준으로 삼아야 할 수치는 $2.00라는 헤드라인이 아니라 완료된 작업당 비용입니다 — 단, 그 사고는 끌 수 없다는 전제가 따르므로, 사고 연쇄가 필요 없는 작업도 어차피 그 비용을 지불하게 됩니다.
이걸 잘못하는 팀은 하나의 모델이 둘 다 하도록 만들려는 팀이다. 36,864토큰 인식 전문가는 운영 이력을 담지 못하고, 텍스트 전용 2.4T 추론기는 프레임을 결코 보지 못한다. 이 페어링은 두 제품 사이의 타협이 아니다. 그것은 실제적인 분업이며, 유용한 질문은 당신의 각 호출이 그중 어느 쪽에 속하는지뿐이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
