
Perceptron Mk1.5 vs Gemma 4 12B: 하나는 문장으로 답하고, 다른 하나는 좌표로 답한다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 610 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 189 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
먼저 멈춰 서게 할 숫자는 이것입니다: Perceptron Mk1.5는 비디오와 임바디드 에이전트를 위해 만들어진 모델이며, 컨텍스트 윈도우는 36,864 토큰입니다. Gemma 4 12B는 256K 윈도우를 갖춘 12B 오픈 웨이트 범용 모델입니다. 대부분의 사람들이 비전 모델을 비교할 때 사용하는 축, 즉 얼마나 많은 영상 푸티지를 맡길 수 있는가라는 축에서, 더 작고 폐쇄적이며 특정 목적을 위해 만들어진 모델은 다운로드 가능한 모델보다 7배나 뒤처집니다. 그 역전은 두 제품 중 어느 쪽의 결함도 아닙니다. 그것은 각 제품이 실제로 무엇을 하도록 만들어졌는지 말해 주며, 두 작업은 두 제품의 스펙 시트에 공통으로 적힌 "멀티모달 입력"이라는 한 줄이 시사하는 것보다 훨씬 더 멀리 떨어져 있습니다.
Perceptron Mk1.5는 2026년 9월 25일에 Perceptron이 출시한 체화 추론(embodied-reasoning) 모델로, 5월의 Perceptron Mk1의 후속작이며, 텍스트, 이미지, 비디오, 오디오를 입력받아 텍스트와 기계가 파싱할 수 있는 기하 정보를 출력합니다. Gemma 4 12B는 Google DeepMind의 11.96B 인코더 없는 멀티모달 오픈 가중치 모델로, 2026년 6월 3일 Apache 2.0 아래 출시되었으며, 텍스트, 이미지, 오디오, 비디오를 입력받아 텍스트를 반환합니다. 둘 다 저렴하고, 둘 다 카메라 피드를 읽지만, 별도의 파싱 단계 없이 컨트롤러에 바운딩 박스를 넘겨줄 수 있는 것은 둘 중 하나뿐입니다. 이 둘 사이의 선택은 무엇이 돌아와야 하는지에 대한 선택입니다.
각 항목이 반환하도록 만들어진 것
두 가지를 나란히 놓고 보면, 차이는 정확도가 아니다. 그것은 출력 유형이다. Gemma 4 12B에게 지게차가 어디에 있는지 물어보면 문장 하나가 돌아오고, 대부분의 애플리케이션에서 그 문장이 곧 결과물이다 — 설명, 요약, 사진에 관한 질문에 대한 답변. Perceptron Mk1.5에게 물어보면, 그 산문과 함께 점, 바운딩 박스, 폴리곤, 클립, 또는 <track>공간적 관측과 그것이 속한 타임스탬프
그것이 Mk1.5가 존재해야 하는 이유에 대한 전체 논거이며, 그것이 왜 중요한지는 정확히 짚어볼 가치가 있습니다. 장면에 대한 설명은 완성된 산출물입니다. 좌표는 다른 무언가, 이를테면 파지 계획기, 결함 검사, 타임스탬프가 찍힌 감사 추적에 대한 입력입니다. 다운스트림 코드가 산문을 읽고 그로부터 위치를 추론해야 한다면, 여러분은 두 모델 사이에 파서를 만든 것이며, 이제 그 파서가 여러분의 실패 지점입니다. Mk1.5의 제안은 기하 정보가 타입이 지정된 상태로 도착한다는 것입니다.
Gemma 4 12B의 반론은 "그것도 이걸 한다"는 것이 아니다. "당신이 가중치를 가질 수 있다"는 것이다. Apache 2.0, 11.96B 파라미터, 사전 학습 및 명령 튜닝 변형으로 공개되고, 당신이 통제하는 하드웨어에서 실행되며, 공개된 평가 카드와 이를 뒷받침하는 제3자 인덱스가 있다. 그것들은 서로 다른 종류의 자산이며, 어느 것도 다른 하나를 대체하지 못한다.
두 가지가 실제로 맞아떨어지는 지점
“multimodal 2026”이라는 라벨이 시사하는 것보다 장소는 적지만, 공통분모는 실재하며, 바로 그곳이 구매자의 체크리스트가 보통 시작되는 지점이기에 정확히 짚고 넘어갈 가치가 있다.
• 입력 양식 — 둘 다 진정한 4중 모달리티입니다. Perceptron Mk1.5는 텍스트, 이미지, 비디오, 오디오(WAV, MP3, FLAC)를 입력받습니다. Gemma 4 12B는 인코더가 없는 하나의 통합 경로를 통해 텍스트, 이미지, 오디오, 비디오를 입력받습니다.
• 출력 모달리티 — 둘 다 오디오나 이미지를 생성하지 않습니다. 둘 다 텍스트 출력입니다. 차이는 Mk1.5의 텍스트는 구조화된 공간 주석을 담을 수 있지만 Gemma 4 12B의 텍스트는 그렇지 않다는 점입니다.
• 함수 호출 — 둘 다 이를 지원합니다. Mk1.5는 채팅 완성에서 함수 호출을 제공하며 JSON Schema와 정규식을 통해 제약된 응답을 받아들입니다. Gemma 4 12B는 명령 튜닝된 형태와 구성 가능한 사고 모드에서 함수 호출을 제공합니다.
• 추론 제어 — Mk1.5는 기존 vision_config.enable_thinking 불리언을 reasoning_effort 필드로 대체하며, 이 필드는 high, medium, low, minimal 또는 none을 받고 기본값은 high입니다. Gemma 4 12B는 동일한 하네스에서 서로 다르게 점수화되는 사고 및 비추론 변형을 제공하는데, 이는 수행하는 작업량이 다르기 때문입니다.
• 컨텍스트 — Mk1.5의 36,864 토큰 대 Gemma 4 12B의 256K입니다. 이는 목록에서 가장 큰 격차이며 다음 섹션에서 이에 대해 다룹니다.
• 가중치와 라이선스 — Mk1.5는 SDK를 제공하는 폐쇄형 호스팅 모델이며, 다운로드할 수 있는 모델이 아닙니다. Gemma 4 12B는 Apache 2.0이므로, 호스팅 가격은 이를 실행하는 유일한 방법이 아니라 여러 선택지 중 하나일 뿐입니다.

36K 윈도우는 부족한 점이 아니라 설계상의 결정입니다
36,864토큰 창을 가진 체화된 모델은 Perceptron이 그와 함께 만든 것을 보기 전까지는 실수처럼 들린다. Mk1.5는 asset_idx 필드를 받아들이므로, 하나의 요청이 여러 이미지나 비디오를 참조하고 각각을 개별적으로 다룰 수 있다. 이 모델은 항목당 오디오를 16,384토큰으로 제한한다 — Perceptron 문서에 따르면 이는 분당 약 750토큰 기준으로 대략 21.8분의 음성에 해당한다. 그리고 창을 작게 유지할 수 있는 이유는 작업이 좁기 때문이다: 프레임에서 특정 대상을 찾아 추적하고, 그에 대해 답하고, 멈춘다.
그것은 Gemma 4 12B와는 다른 형태의 작업입니다. 256K 윈도는 문서, 리포지토리, 또는 긴 대화를 담고 그 전체에 걸쳐 추론하기 위한 것입니다. Mk1.5의 윈도는 구조화된 답변이 있는 단일 인식 작업을 위한 예산이며, Perceptron은 그것을 리더보드가 아니라 바로 그 작업에 맞춰 크기를 정했습니다. 그 차이가 실제로 문제가 되는 지점은 여러분의 작업이 "이 40분짜리 점검 영상 전체를 보고 모든 것을 알려줘"인 순간입니다. 36K 윈도는 녹취록과 프레임, 그리고 답변을 한 번에 담지 못하며, Gemma 4 12B의 윈도와 그 장문맥 회상 점수가 바로 그것을 위한 정직한 도구입니다.
그 트레이드의 나머지 절반은 속도다. Perceptron은 단일 H100에서 세 번 실행한 중앙값 기준 엔드투엔드가 최대 4.7배 더 빠르다고 보고하는데, 단서를 달자면 4.7배는 세 측정값 중 최고이며 일반적인 경우는 아니다: 채팅 답변은 5.2초에서 1.1초로, 이미지 QA는 1.7초에서 0.51초로(약 3.3배), 8방향 동시성에서의 60초 영상은 19초에서 9.1초로(약 2.1배) 줄었다. 임바디드 에이전트가 실제로 실행하는 영상 워크로드에서 정직한 배수는 대략 2배다.
이들 중 하나는 다른 사람에 의해 측정되었습니다.

이것은 이 맞대결에서 가장 명확한 비대칭이며, 그 격차는 크다.
Gemma 4 12B에는 공급업체 평가 카드와 제3자 지수가 있습니다. 카드에는 공급업체가 보고한 수치 — MMLU Pro 77.2, GPQA Diamond 78.8, MMMU Pro 69.1, LiveCodeBench v6 72.0, 도구 없이 AIME 2026 77.5, 세 번의 실행에 걸쳐 평균을 낸 Tau2 69.0 — 가 실려 있으며, 128k에서의 MRCR v2 8-needle에 솔직한 약점 하나가 있는데, 이는 43.4로 나오며 256K 창이 끝부분에서도 그렇게 작동한다고 가정하기 전에 읽어야 할 행입니다. 그 위에 독립적인 측정이 있습니다: Artificial Analysis는 Gemma 4 12B를 Intelligence Index 14로 평가하며, 해당 클래스의 142개 모델 중 22위, 초당 출력 토큰 113.7개 — 속도 부문에서 142개 중 20위 — 이고, 백만 토큰당 입력 $0.10, 출력 $0.30의 정가가 있습니다.
퍼셉트론 Mk1.5에는 그런 것이 전혀 없습니다. Mk1.5나 Mk1에 대한 Artificial Analysis 지수 항목도, 아레나 점수도 없습니다. 따라서 이 모델에 대해 존재하는 모든 성능 수치는 이를 판매하는 회사가 만들어낸 것입니다. 그 수치 집합은 모호하기보다 구체적이며, 읽어볼 가치가 있습니다: 자기중심적 hand_box에서 0.9433으로, Gemini 3.1 Pro의 0.4467과 퍼셉트론 자체 실행에서 최고였던 Gemini의 0.6179를 상대로 한 결과입니다. EgoSchema는 같은 경쟁 모델의 81.20에 맞서 80.40으로, 광범위한 이해도 벤치마크에서 0.80점 뒤처졌지만 EgoSchema-hard 하위 집합에서는 63.75로 12% 우위를 주장했습니다. Molmo2-Track에서는 centre-F1 0.647과 point-HOTA 0.628, 오디오 쪽에서는 DailyOmni 74.67과 AVHBench 80.56입니다. 이 수치들에 나타나는 패턴, 즉 세밀한 기하학에서는 압도적이고 일반 비디오 이해에서는 대략 동등하거나 약간 뒤처지는 양상은 일관성이 있으며 제품 서사와도 부합합니다. 그러나 자사 모델에 대한 공급업체의 벤치마크는 주장일 뿐이며, 이 기사에 등장하는 두 모델은 같은 종류의 증거로 설명되고 있지 않습니다.
그 표의 한 행에는 특별한 경고가 붙을 만하다. Perceptron의 추적 비교는 Qwen3-VL-8B를 0.180 centre-F1으로 기재하면서 그 수치의 출처를 해당 모델의 논문으로 밝히고, 바로 옆에는 자사 모델의 실측 수치를 놓고 있으며, 서로 다른 체크포인트와 평가 설정에 걸쳐 Qwen3.5-27B의 0.530과 0.476을 나란히 배치한다. 실측값 열에 들어간 논문 수치는 동등 조건의 행이 아니며, 이런 줄은 출처가 빠진 채로 인용되기 십상이다. 같은 주의는 반대 방향으로도 적용된다. 도구를 활성화한 상태의 LiveVQA-W에서 56.0을 기록한 Mk1.5 게시물이 그렇다. 그 수치는 네 샘플 다수결 투표에서 나온 값인 반면, 검색 그라운딩을 적용한 Gemini 3.8 Flash의 53.2는 그렇지 않으며, 네 샘플에 대한 다수결 투표는 단일 그리디 패스에 비해 점수를 부풀리는 정당한 기법이기 때문이다.
실제 워크로드 비용 산정
요금표는 제품보다 더 비슷합니다. Perceptron Mk1.5는 백만 입력 토큰당 $0.15, 백만 출력당 $1.50이며, 캐시된 입력은 $0.0375입니다 — 이는 표준 입력 요금의 정확히 4분의 1이고, 캐시된 토큰당 Gemma 4 12B의 $0.10 표준 입력보다 더 저렴합니다. Gemma 4 12B는 이를 측정하는 서드파티 하네스에서 $0.10 및 $0.30에 등재되어 있으며, Apache 2.0이므로 하드웨어가 있다면 자체 호스팅으로 한계 비용을 완전히 제거할 수 있습니다.
두 가지가 직접 비교를 복잡하게 만들며, 그것들은 서로 반대 방향을 가리킨다. 첫째, Mk1.5의 reasoning_effort의 기본값은 high입니다. 즉, 구성하지 않은 모든 호출은 모델이 제공하는 가장 비싼 추론 경로를 구매하는 셈입니다; medium 또는 low로 낮추는 것은 한 줄 변경으로 청구서에 직접적인 영향을 주며, 이 릴리스에서 가장 저렴한 실험입니다. 둘째, Gemma 4 12B는 사고 단계를 완전히 끌 수 있게 해 주는데, 이는 청구서와 지연 시간을 모두 바꾸며, 프레임 수준 분류와 같은 고정된 작업에서는 비추론 패스가 종종 올바른 선택입니다.
실제 사례에 대해 계산해 보세요: 하루 40,000프레임을 처리하는 비전 파이프라인이 있고, 각 프레임이 대략 1,000토큰의 이미지 입력이라면. 이는 하루 40M 입력 토큰입니다. Mk1.5의 $0.15 입력 요율에서, 같은 장면이 반복될 때 프레임을 캐시하면 입력 비용은 하루 한 자릿수 달러 초반대입니다 — 어느 기준으로 봐도 저렴합니다. $0.10 입력의 Gemma 4 12B는 더 저렴하고, 셀프 호스팅하면 한계 비용은 무료입니다. 어느 모델도 비싸지 않습니다. 여기서의 결정은 예산 결정이 아니라, 좌표가 필요한지, 256K 윈도우가 필요한지, 아니면 둘 다 필요한지의 문제입니다.
두 번째 통합 없이 둘 모두를 호출하기

이 비교를 실행하는 데 있어 실질적인 장애물은 가격이 아니라, Perceptron Mk1.5와 Gemma 4 12B가 같은 카탈로그에 없다는 점입니다. 현재 OrcaRouter에서는 둘 다 라우팅되지 않습니다. 저희가 제공하는 Gemma 4 항목은 31B Instruct와 26B-A4B 변형이며, Mk1.5는 라우트 자체가 없습니다. 따라서 정직한 안내는 Mk1.5의 경우 벤더 자체 API인 api.perceptron.inc를 통해 접근하고 — pip install "perceptron>=0.4.0", 키는 PERCEPTRON_API_KEY에 설정 — Gemma 4 12B는 서드파티 호스트를 통하거나 Apache-2.0 가중치를 직접 서빙하는 것입니다.
이 상황에서 라우팅 계층이 진정으로 필요한 이유는 아직 내리지 않은 결정에 있습니다. Mk1.5의 구조화된 출력이 애플리케이션에 필요하고 Gemma 4 12B의 컨텍스트 창이 다른 워크로드에 필요하다면, 그것은 두 개의 통합이자 두 개의 장애 도메인입니다. 이들을 뒤에 두는 대상은하나의 OpenAI 호환 엔드포인트이며, 자동 장애 조치를 갖추면 어느 한쪽 공급자에 문제가 생기더라도 작업이 실패하는 대신 폴백으로 귀결된다는 뜻입니다. 또한 라우팅 규칙은 애플리케이션이 어느 것이 어느 것인지 알지 못한 채 지오메트리 작업과 긴 컨텍스트 작업을 서로 다른 모델로 보낼 수 있습니다. 공급업체가 요금표를 변경할 때, 패스스루 라우터는 공급자의 정가를 청구하고토큰당 아무것도 더하지 않으며, 따라서 변경은 다음 청구 주기가 아니라 같은 날 반영됩니다. 라우팅 DSL은 또한 비교를 설계하는 방법이기도 합니다 — 벤치마크 논쟁 대신, 자체 프레임에서 측정한 실제 트래픽의 일부를 각 모델로 보내는 방식입니다.
어느 걸 진짜 원해
답변이 기계 판독 가능해야 한다면 Perceptron Mk1.5를 선택하세요. 무엇인가를 운전 중이거나, 위치와 시간이 핵심인 무언가를 기록 중이라면, 아무리 많은 추가 컨텍스트 윈도도 타입이 지정된 좌표를 대신할 수 없으며, Mk1.5는 이 조합에서 그러한 좌표를 생성하는 유일한 모델입니다. 세 가지를 염두에 두고 시작하세요: 36,864토큰 예산, 높은 추론 기본값, 그리고 그에 딸린 모든 성능 수치가 벤더 자체의 것이라는 사실입니다.
이를 판가름하는 가장 저렴한 방법은 실제 트래픽의 일부를 각각으로 라우팅하고 여러분의 자체 프레임에서 측정하는 것입니다. 둘 다하나의 OpenAI 호환 엔드포인트 뒤에 있으며 OrcaRouter에서 호스팅됩니다. 이 덕분에 나란히 비교하는 테스트가 두 번째 통합이 아니라 설정 한 줄로 가능해집니다.
많은 자료를 담아야 하거나, 가중치가 필요하거나, 공급업체 벤치마크를 맹신하지 않는 사람에게 선택을 정당화해야 한다면 Gemma 4 12B를 택하라. 이 모델에는 독립 지표가 있고, 공개된 평가 카드가 있으며, Apache 2.0 라이선스가 적용되고, 창이 일곱 배 더 크다 — 그리고 장면을 측정하기보다 묘사할 것이다. 마지막 구절이 결정의 전부다. 이 모델들 중 하나는 직접 소유하고 감사할 수 있는 범용 모델이고, 다른 하나는 기하를 반환하기 때문에 빌려 쓰는 전문 모델이며, 전문 모델이 더 작은 창과 제3자 점수 없음을 가진 사실은 모순이 아니다. 그것은 좁게 만들어진 도구가 밖에서 보이는 모습이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
