
Perceptron Mk1.5, 임바디드 에이전트에 구조화된 공간 출력 제공 — 그리고 같은 날 Isaac을 은퇴시키다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 578 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Perceptron Mk1.5가 이제 정식 출시되었는데, 흥미로운 점은 벤치마크 표가 아니라 응답 본문에 담겨 돌아오는 내용입니다. 일반적인 비전-언어 모델에 지게차가 어디 있느냐고 물으면 문장 하나가 나옵니다. Perceptron Mk1.5에 비디오 프레임을 주고 물으면, 산문과 함께 기계가 파싱할 수 있는 기하 정보도 얻을 수 있습니다. 점, 바운딩 박스, 폴리곤, 클립, 또는 파일 전체에 걸친 타임스탬프가 찍힌 공간 관측값을 담은 <track> 요소까지요. 이것이 장면을 묘사하는 모델과, 별도의 파싱 단계 없이 로봇 제어기가 곧바로 소비할 수 있는 모델의 차이입니다. 이는 2026년 5월에 나온 이 회사의 첫 릴리스인 Perceptron Mk1의 직계 후속작이며, 그보다 앞선 Isaac 0.1과 0.2 체크포인트의 지원 종료와 함께 9월 25일에 출시되었습니다.
Mk1.5가 실제로 반환하는 것
이 모델은 물리적 에이전트를 위한 체화된 추론 시스템이다. 입력 측면에서는 텍스트, 이미지, 비디오, 오디오를 받는다. 출력 측면에서는 텍스트와 선택적 구조화 주석, 즉 점, 상자, 다각형, 클립, 트랙을 생성한다. 트래킹 출력은 특히 곱씹어 볼 만한 부분이다. Perceptron의 문서는 <track> 블록을 설명하는데, 그 항목들은 공간적 관측과 그것이 속한 타임스탬프를 모두 담고 있어서, 60초 클립은 장면에 대한 하나의 평균적인 추측이 아니라 시간에 따른 객체 위치들의 시퀀스로 돌아온다.
둘 이상의 자산을 사용하는 파이프라인에 이것을 연결하는 모든 사람에게 중요한 두 번째 세부 사항: Mk1.5는 asset_idx 필드를 지원하므로, 단일 요청에서 여러 이미지나 비디오를 참조하고 각각을 별도로 지정할 수 있습니다. 참조 사진을 라이브 카메라 프레임과 비교하는 작업 — 결함 검사 루프, 조립 검증 단계 — 이라면, 이는 두 번이 아니라 한 번의 호출로 처리해야 합니다.
이 모델은 JSON 스키마와 정규식 모두를 아우르는 제약 응답도 지원하는데, 바로 이 기능으로 "대략 맞는" 결과를 다운스트림 코드에서 검증할 수 있는 스키마로 바꿀 수 있습니다. 함수 호출은 채팅 완성에서 지원되며, Perceptron의 호스팅 MCP 서버는 이제 기본적으로 perceptron-mk1.5를 사용합니다. 이전 기본값을 고정하려면 model: "perceptron-mk1"을 명시적으로 전달하면 됩니다.
스펙 시트, 그리고 그 비용

여기 나오는 숫자들은 독자가 예상하지 못할 대목에서 작은 값들이므로 분명히 밝혀 둘 가치가 있다. 컨텍스트 창은 36,864 토큰이다 — 100만도, 256K도 아니다. 최대 출력은 8,192 토큰이다. 이것은 두 시간짜리 영상과 300페이지 매뉴얼을 맡기는 모델이 아니다. 구조화된 답변이 필요한 빡빡한 인식 작업에 맞춰진 크기다.
Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.
• 컨텍스트 — 36,864 토큰, Perceptron Mk1이 함께 제공한 32K 창과 비교
• 최대 출력 — 8,192 토큰
• 입력 — 텍스트, 이미지, 동영상, 오디오(WAV, MP3, FLAC)
• 캐시된 입력 — $0.0375/M, 표준 입력 요금 $0.15/M의 4분의 1
• 출력 — $1.50/M
• 추론 제어 — reasoning_effort를 high, medium, low, minimal 또는 none으로 설정하며 기본값은 high
마지막 행은 겉보기와 달리 호환성을 깨뜨리는 변경입니다. Mk1.5는 기존 vision_config.enable_thinking 불리언을 reasoning_effort로 대체하므로, 이전 모델에 맞춰 작성한 모든 요청은 단순히 대상을 바꾸는 것이 아니라 수정해야 합니다. 기본값 high는 다른 이유로 주목할 만합니다: 이 필드를 설정하지 않으면, 매 호출마다 가장 비싼 추론 경로를 이용하는 셈입니다.
오디오, 그리고 자체 사운드트랙이 있는 비디오
오디오 입력은 여기서 정말 새로운 기능입니다. Perceptron은 이를 세 가지 방식으로 받습니다 — 인라인 input_audio, audio_url, 또는 audio_file_id — 항목당 최대 16,384개의 오디오 토큰이라는 상한이 있습니다. 문서에 따르면 이는 분당 약 750토큰 기준으로 약 21.8분의 음성에 해당하며, 교대 인수인계 녹음이나 유지보수 로그에 합리적인 예산입니다.
더 이례적인 것은 비디오 경로입니다. 기본적으로 Mk1.5는 비디오를 프레임으로 읽고 오디오 트랙은 무시합니다. 다음을 설정하면 vision_config.enable_audio_in_video: true 사운드트랙이 다시 켜집니다. 이는 잡음이 곧 신호인 모든 경우에 원하는 설정입니다 — 겉보기로 이상해지기 전에 소리로 먼저 이상을 보이는 기계, 카메라 밖에서 내려지는 음성 지시, 현장 둘러보기 배경의 경보음 같은 경우 말입니다. 기본값은 꺼짐이므로, 청각적 결함이 있는 비디오는 별도로 요청하지 않는 한 무성 영화처럼 소리 없이 분석됩니다.
출처를 명시한 벤치마크 그림

아래의 모든 수치는 Perceptron의 자체 발표에서 나왔으며 Perceptron이 측정한 것입니다. Mk1.5나 그 이전 제품 모두에 대해 Artificial Analysis 지수 항목도, 아레나 점수도 없으므로, 이 비교에는 이들과 견줄 제3자 수치가 어디에도 없습니다. 이 수치들은 중립적인 결과가 아니라 자사 제품에 대한 공급업체의 주장으로 취급하십시오.
자기중심적 손 추적에서 격차는 크고 구체적입니다: Mk1.5는 hand_box에서 0.9433점을 기록한 반면, Gemini 3.1 Pro는 0.4467점, Perceptron의 실행에서 최고 성능을 낸 Gemini는 0.6179점이며, 발표에서는 이를 Gemini 3.8 Flash라고 밝힙니다. 이는 출시 게시물이 앞세운 +111%와 +53%이며, 이번 릴리스에서 가장 강력한 단일 수치입니다.
일반적인 자기중심적 비디오 이해에서는 상황이 훨씬 더 가깝다. Perceptron은 Mk1.5의 EgoSchema가 80.40, Gemini 3.8 Flash가 81.20이라고 보고한다 — 0.80점 뒤지는 수치다 — 한편 EgoSchema-hard 하위 집합에서는 63.75로 12% 우위를 주장한다. 미세한 손 기하학에서는 결정적으로 이기고 폭넓은 이해력 벤치마크에서는 근소하게 지는 모델은 특정한 종류의 도구이며, 바로 그러한 도구로 팔리고 있다.
비디오 객체 분할은 Molmo2-Track에서 center-F1 0.647과 point-HOTA 0.628을 기록합니다. Perceptron에 따르면 이는 Molmo2-Track, Ref-DAVIS17, ReasonVOS를 앞서는 반면, MeViS valid_u에서는 MolmoPoint-8B에 뒤처집니다. Qwen 비전 라인과 비교한 트래킹 비교는 신중히 읽어 볼 가치가 있습니다: 발표에서는 논문에서 가져온 Qwen3-VL-8B의 center-F1을 0.180으로, Qwen3.5-27B를 0.530과 0.476으로 나열합니다 — 서로 다른 체크포인트, 서로 다른 평가 설정, 그리고 측정값과 같은 열에 놓인 논문 수치입니다. 이는 동일 조건으로 비교한 행이 아닙니다.
오디오 결과는 DailyOmni 74.67, WorldSense 50.32, OmniBench 51.05, AVHBench 80.56으로 보고되며, 비교 행은 함께 제시되지 않는다. 도구를 활성화한 멀티모달 검색에서 Mk1.5는 4개 샘플 다수결 투표로 LiveVQA-W에서 56.0을 기록했는데, 이는 Google Search 그라운딩을 사용한 Gemini 3.8 Flash의 53.2, OpenAI 웹 검색을 사용한 GPT-6 sol의 51.0, GPT-5.2 online의 33.2와 대비된다. Perceptron은 또한 도구를 켜면 MMSearch에서 36.1점 향상을 주장한다. 4개 샘플에 대한 다수결 투표는 정당한 기법이며 단일 그리디 패스에 비해 점수를 좋게 부풀리므로, 56.0과 53.2는 같은 방식으로 측정된 것이 아니다.
지연 시간, 그리고 4.7×가 어떻게 측정되었는지
속도 주장은 문맥 없이 인용될 가능성이 가장 높은 주장이므로, 그 문맥을 여기에 제시한다. Perceptron은 단일 H100에서 세 번 실행한 중앙값을 기준으로 엔드투엔드 최대 4.7배 더 빠르다고 보고하는데, 이는 256토큰 답변으로 제한된 LMArena 프롬프트와 Perception Test가 포함된 MIA-Bench 및 Video-MME를 사용한 결과다. 4.7배는 채팅 사례로, 5.2초에서 1.1초로 단축된다. 이미지 질의응답은 1.7초에서 0.51초로 줄어들며, 이는 약 3.3배이다. 60초 비디오를 한 번에 8개씩 처리하면 19초에서 9.1초로 줄어들며, 대략 2.1배이다.
그래서 헤드라인에 내세운 배수는 세 가지 중 가장 좋은 값이며, 일반적인 경우는 아니다. 단일 H100에서 짧은 답변에서는 채팅 경로가 실제로 4.7배 더 빠르다. 임바디드 에이전트가 실제로 실행할 비디오 워크로드에서는 2배에 가깝다. 둘 다 좋은 수치지만, 헤드라인에 오르는 것은 그중 하나뿐이다.
Isaac 0.1과 0.2는 같은 날 폐기되었습니다

Mk1.5 변경 로그에는 9월 25일자 두 번째 항목이 실려 있으며, 이는 이미 프로덕션 환경에서 운영 중인 사람이라면 누구나 주의해야 할 항목입니다. 해당 isaac-0.1, isaac-0.2-1b 및 isaac-0.2-2b-preview 모델 ID는 Perceptron API에서 사용 중단되었습니다. 더 이상 GET /v1/models에 나타나지 않으며, 호스팅된 MCP 서버에서도 사라졌고, 이를 이름으로 지정한 요청은 이제 HTTP 404 model_not_found.
같은 항목에 숨겨진 두 번째 동작 변경이 있는데, 이는 Isaac 모델을 전혀 언급한 적 없는 코드에도 영향을 미칩니다: 알 수 없는 모델 ID는 이제 이전의 400 대신 404를 반환합니다. 잘못된 모델 이름에 대해 400으로 매칭하던 모든 재시도 로직, 오류 분기 또는 경고 규칙은 이제 아무것도 매칭하지 못합니다. Perceptron이 제공하는 마이그레이션 경로는 perceptron-mk1.5.
대체 모델을 출시하는 바로 그날 모델 패밀리를 단종한다는 건 깔끔한 마이그레이션 서사이자 가혹한 서사다. Isaac이 잘 작동했기 때문에 Isaac을 고정해 두었다면, 이미 지나가 버린 마감일이 있는 셈이다.
어디에서 실행할지, 그리고 그것에 베팅하지 않고 시도하는 방법
이용은 벤더 자체 API와 여러 서드파티 플랫폼을 통해 가능합니다. OrcaRouter는 현재 Perceptron Mk1.5를 라우팅하지 않으며, 이 모델은 저희 카탈로그에 없습니다. 따라서 솔직한 안내는 api.perceptron.inc로 직접 가는 것이며, 이는 바로 SDK와 PERCEPTRON_API_KEY 환경 변수가 존재하는 이유입니다.
어쨌든 말할 가치가 있는 것은, 이것이 모델보다는 결정에 적용되기 때문입니다: 36,864토큰 창에 추론 기본값이 high로 설정된 이틀 된 체크포인트는 바로, 프로덕션 경로에 미리 확인하지 않고 올려서는 안 되는 것의 전형입니다. 먼저 자체 프레임에 대해 실행하고, 특히 두 가지를 측정하세요 — 구조화된 출력이 실제 엣지 케이스를 견디는지, 그리고 reasoning_effort: "high"의 호출당 비용이 얼마인지, 다음 옵션으로 낮출 때와 비교해: medium 또는 low. 두 번째는 청구서에 직접 영향을 주는 한 줄 변경이며, 이번 릴리스에서 가장 저렴한 실험입니다.
이것이 속하는 더 넓은 패턴, 즉 지각 모델이 형용사가 아니라 기하학을 반환하는 패턴은 바로 OrcaRouter가 흡수하도록 만들어진 것입니다. 하나의 API가 200개 이상의 모델을 지원하며 제공업체 정가를 0% 마크업으로 그대로 전달하므로, 그중 어느 모델의 공급업체 가격이 바뀌든 당일 우리 쪽에 반영되며, 자동 장애 조치 덕분에 지각 호출이 요청을 실패시키는 대신 두 번째 모델로 폴백할 수 있습니다. Mk1.5가 귀하의 정확도 기준을 통과하는 유일한 모델이라면, 오늘날 그 어떤 것도 도움이 되지 않습니다. 그것이 여러 후보 중 하나라면, 단일 엔드포인트를 통해 비교를 돌리는 편이 이를 확인하기 위해 두 번째 SDK를 연결하는 것보다 저렴합니다.
이 릴리스가 무엇이고 무엇이 아닌지
Perceptron Mk1.5는 이례적으로 솔직한 한계 목록이 붙어 있는, 초점이 분명한 도구입니다. 이는 설명만이 아니라 좌표를 반환합니다. 오디오를 읽으며, 기능을 켜면 동영상의 사운드트랙까지도 읽습니다. 짧은 채팅 답변에서는 빠릅니다. 또한 36,864토큰 모델에 출력 상한은 8,192토큰이고, 가격은 $0.15와 $1.50이며, 전적으로 자사 벤더가 벤치마크했고, 같은 변경 로그 항목에서 이전 세대를 단종시킨 회사가 판매합니다.
당신의 문제가 "손을 찾고, 클립 전체에서 추적하며, 언제 어디로 갔는지 알려 달라"는 것이라면, hand-box 수치가 테스트해야 할 값입니다. 당신의 문제가 프런티어 범용 모델과 겨루는 폭넓은 비디오 이해라면, EgoSchema 라인 — 80.40 대 81.20 — 은 당신이 거의 동등한 수준의 전문 모델을 사고 있음을 시사하며, 전환을 주장하려면 정확도가 아니라 구조화된 출력과 지연 시간에서 근거가 나와야 합니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
