
Perceptron Mk1.5 Mang Đến Đầu Ra Không Gian Có Cấu Trúc Cho Các Tác Nhân Có Thân Xác — và Cho Isaac Nghỉ Hưu Cùng Ngày
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 578 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 182 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Perceptron Mk1.5 hiện đã được phát hành rộng rãi, và điều thú vị ở nó không nằm ở bảng điểm chuẩn — mà là những gì được trả về trong phần thân phản hồi. Hỏi một mô hình thị giác - ngôn ngữ thông thường xem xe nâng ở đâu và bạn sẽ nhận được một câu. Hỏi Perceptron Mk1.5 trên một khung hình video và, song song với phần văn xuôi, bạn có thể nhận được hình học mà máy có thể phân tích: một điểm, một hộp giới hạn, một đa giác, một clip, hoặc một <track> phần tử mang các quan sát không gian có gắn dấu thời gian xuyên suốt toàn bộ tệp. Đó chính là khác biệt giữa một mô hình mô tả cảnh và một mô hình mà bộ điều khiển robot có thể sử dụng trực tiếp mà không cần giai đoạn phân tích cú pháp thứ hai. Đây là sản phẩm kế nhiệm trực tiếp của Perceptron Mk1, bản phát hành đầu tiên của công ty vào tháng 5 năm 2026, và nó ra mắt vào ngày 25 tháng 9, cùng lúc với việc ngừng sử dụng các checkpoint Isaac 0.1 và 0.2 có trước nó.
Điều mà Mk1.5 thực sự trả về
Mô hình là một hệ thống suy luận hiện thân dành cho các tác nhân vật lý. Ở đầu vào, nó nhận văn bản, hình ảnh, video và âm thanh. Ở đầu ra, nó tạo ra văn bản cùng các chú thích có cấu trúc tùy chọn: điểm, hộp, đa giác, clip và track. Đầu ra theo dõi là phần đáng để bàn kỹ. Tài liệu của Perceptron mô tả <track>, một khối mà các mục của nó mang cả một quan sát không gian lẫn mốc thời gian mà nó thuộc về, nên một clip dài 60 giây được trả về dưới dạng một chuỗi vị trí đối tượng theo thời gian thay vì một phỏng đoán trung bình duy nhất về cảnh.
Một chi tiết thứ hai đáng lưu tâm đối với bất kỳ ai đang tích hợp thứ này vào một pipeline có nhiều hơn một tài nguyên: Mk1.5 hỗ trợ một asset_idx — một trường, nên một yêu cầu duy nhất có thể tham chiếu nhiều ảnh hoặc video và xử lý chúng riêng biệt. Nếu công việc của bạn là so sánh một ảnh tham chiếu với một khung hình camera trực tiếp — một vòng kiểm tra lỗi, một bước xác minh lắp ráp — thì điều đó thuộc về một lệnh gọi, không phải hai.
Mô hình cũng hỗ trợ các phản hồi có ràng buộc, cả JSON Schema và regex, đây là cách bạn biến "gần đúng" thành một schema mà mã nguồn phía sau của bạn có thể xác thực. Gọi hàm được hỗ trợ trên chat completions, và máy chủ MCP được lưu trữ của Perceptron giờ đây mặc định là perceptron-mk1.5; việc truyền model: "perceptron-mk1" một cách tường minh là cách bạn cố định mặc định trước đó.
Bảng thông số kỹ thuật, và giá của nó

Những con số ở đây đáng được nói rõ ràng, vì chúng khá khiêm tốn ở những chỗ mà người đọc có thể không ngờ tới. Cửa sổ ngữ cảnh là 36.864 token — không phải một triệu, không phải 256K. Đầu ra tối đa là 8.192 token. Đây không phải là mô hình mà bạn giao cho nó một video dài hai giờ và một cuốn sổ tay 300 trang. Nó được thiết kế cho một tác vụ nhận thức gọn gàng với câu trả lời có cấu trúc.
Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.
• Ngữ cảnh — 36,864 token, so với cửa sổ 32K mà Perceptron Mk1 đi kèm
• Đầu ra tối đa — 8,192 token
• Đầu vào — văn bản, hình ảnh, video, âm thanh (WAV, MP3, FLAC)
• Đầu vào được lưu đệm — $0.0375/M, bằng một phần tư mức giá đầu vào tiêu chuẩn $0.15/M
• Đầu ra — $1.50/M
• Kiểm soát suy luận — reasoning_effort ở mức high, medium, low, minimal hoặc none, mặc định là high
Dòng cuối cùng đó là một thay đổi phá vỡ tương thích được ngụy trang. Mk1.5 thay thế giá trị boolean cũ của vision_config.enable_thinking bằng reasoning_effort, nên bất kỳ yêu cầu nào bạn đã xây dựng dựa trên mô hình trước đó đều cần chỉnh sửa thay vì chỉ trỏ lại. Giá trị mặc định của high đáng chú ý vì một lý do khác: nếu bạn không đặt trường này, bạn đang mua con đường suy luận tốn kém nhất trong mỗi lần gọi.
Âm thanh và video có nhạc nền riêng
Đầu vào âm thanh thực sự là điểm mới ở đây. Perceptron chấp nhận nó theo ba cách — nội tuyến input_audio, một audio_url, hoặc một audio_file_id — với giới hạn 16.384 token âm thanh cho mỗi mục. Tài liệu ước tính con số đó vào khoảng 21,8 phút nói với khoảng 750 token mỗi phút, một ngân sách hợp lý cho bản ghi bàn giao ca hoặc nhật ký bảo trì.
Điều khác thường hơn nằm ở luồng xử lý video. Theo mặc định, Mk1.5 đọc video dưới dạng các khung hình và bỏ qua rãnh âm thanh. Việc đặt vision_config.enable_audio_in_video: true sẽ bật lại phần âm thanh, đây chính là cài đặt bạn cần cho bất cứ thứ gì mà ở đó tiếng ồn chính là tín hiệu — một cỗ máy phát ra âm thanh sai lệch trước khi trông sai lệch, một chỉ dẫn bằng lời nói được đưa ra ngoài khung hình, một tiếng báo động ở phía sau trong một buổi tham quan hiện trường. Tính năng này mặc định tắt, nên một video có lỗi nghe thấy được sẽ bị phân tích trong im lặng như một thước phim câm, trừ khi bạn yêu cầu khác.
Bức tranh điểm chuẩn, với nguồn dữ liệu được nêu rõ ràng

Mọi con số dưới đây đều đến từ thông báo của chính Perceptron và do Perceptron đo lường. Không có mục nào trong chỉ số Artificial Analysis và cũng không có điểm đấu trường nào cho cả Mk1.5 lẫn phiên bản tiền nhiệm của nó, vì vậy không có bất kỳ con số nào từ bên thứ ba trong phép so sánh này để đối chiếu với chúng. Hãy coi những con số này là tuyên bố của nhà cung cấp về sản phẩm của chính họ, chứ không phải là một kết quả trung lập.
Về theo dõi bàn tay góc nhìn thứ nhất, khoảng cách rất lớn và cụ thể: Mk1.5 đạt 0.9433 trên hand_box so với 0.4467 của Gemini 3.1 Pro và 0.6179 của Gemini tốt nhất trong lần chạy của Perceptron, mà thông báo nhận diện là Gemini 3.8 Flash. Đó là mức +111% và +53% mà bài đăng ra mắt dẫn đầu bằng, và đây là con số đơn lẻ mạnh nhất trong bản phát hành.
Về hiểu video góc nhìn thứ nhất tổng quát, bức tranh gần hơn nhiều. Perceptron báo cáo EgoSchema đạt 80,40 đối với Mk1.5 so với 81,20 của Gemini 3.8 Flash — kém 0,80 điểm — đồng thời tuyên bố vượt trội 12% trên tập con EgoSchema-hard ở mức 63,75. Một mô hình thắng quyết định về hình học bàn tay chi tiết nhưng thua sát nút trên phép đo hiểu biết tổng quát là một loại công cụ đặc thù, và nó đang được bán như đúng một công cụ như thế.
Phân đoạn đối tượng video đạt 0,647 center-F1 và 0,628 point-HOTA trên Molmo2-Track. Perceptron cho biết kết quả đó dẫn đầu trên Molmo2-Track, Ref-DAVIS17 và ReasonVOS, đồng thời xếp sau MolmoPoint-8B trên MeViS valid_u. So với dòng Qwen vision, phần so sánh theo dõi này đáng để đọc kỹ: thông báo liệt kê Qwen3-VL-8B ở mức 0,180 center-F1 theo bài báo của nó, và Qwen3.5-27B ở mức 0,530 và 0,476 — các checkpoint khác nhau, thiết lập đánh giá khác nhau, và một con số từ bài báo lại nằm cùng cột với những con số đo lường được. Đó không phải là một hàng so sánh tương đương.
Kết quả âm thanh được báo cáo là DailyOmni 74,67, WorldSense 50,32, OmniBench 51,05 và AVHBench 80,56, mà không kèm hàng so sánh nào. Về tìm kiếm đa phương thức khi bật công cụ, Mk1.5 đạt 56,0 trên LiveVQA-W nhờ bỏ phiếu đa số trên bốn mẫu, so với 53,2 của Gemini 3.8 Flash với nền tảng Google Search, 51,0 của GPT-6 sol với tìm kiếm web của OpenAI, và 33,2 của GPT-5.2 trực tuyến. Perceptron cũng tuyên bố mức tăng 36,1 điểm trên MMSearch khi bật công cụ. Bỏ phiếu đa số trên bốn mẫu là một kỹ thuật hợp lệ và nó làm đẹp điểm số so với một lượt greedy đơn lẻ, nên 56,0 và 53,2 không được đo theo cùng một cách.
Độ trễ, và cách 4.7× được đo như thế nào
Tuyên bố về tốc độ là thứ dễ bị trích dẫn mà không kèm ngữ cảnh nhất, nên đây là ngữ cảnh. Perceptron báo cáo nhanh hơn tối đa 4,7× từ đầu đến cuối, tính theo trung vị của ba lần chạy trên một H100, sử dụng các prompt LMArena được giới hạn ở câu trả lời 256 token, cùng với MIA-Bench và Video-MME với Perception Test. Mức 4,7× là trường hợp chat: từ 5,2 giây xuống 1,1. Hỏi đáp hình ảnh đi từ 1,7 giây xuống 0,51, tức khoảng 3,3×. Một video 60 giây được xử lý tám video cùng lúc đi từ 19 giây xuống 9,1, khoảng 2,1×.
Vậy nên bội số được đưa lên tiêu đề là con số tốt nhất trong ba con số, chứ không phải trường hợp điển hình. Trên một H100 đơn lẻ, với các câu trả lời ngắn, luồng chat thực sự nhanh hơn 4.7×. Còn với khối lượng công việc video mà một tác nhân thể nhập thực sự sẽ chạy, con số gần với 2× hơn. Cả hai đều là những con số tốt; chỉ một trong số đó là con số tiêu đề.
Isaac 0.1 và 0.2 đã bị ngừng hỗ trợ cùng một ngày

Nhật ký thay đổi Mk1.5 có mục thứ hai đề ngày 25 tháng 9, và đây là mục đáng quan tâm đối với bất kỳ ai đã chạy trong môi trường sản xuất. Các isaac-0.1, isaac-0.2-1b và isaac-0.2-2b-preview ID mô hình đã bị rút khỏi Perceptron API. Chúng không còn xuất hiện trong GET /v1/models, chúng không còn trên máy chủ MCP được lưu trữ, và các yêu cầu nêu tên chúng giờ đây thất bại với HTTP 404 model_not_found.
Có một thay đổi hành vi thứ hai ẩn trong cùng một mục sẽ gây hại cho mã vốn chưa từng đề cập đến các mô hình Isaac: ID mô hình không xác định giờ trả về 404 thay vì 400 trước đây. Bất kỳ logic thử lại, nhánh lỗi hoặc quy tắc cảnh báo nào khớp với 400 cho tên mô hình sai giờ đang không khớp với gì cả. Đường di trú mà Perceptron đưa ra là perceptron-mk1.5.
Việc khai tử một dòng mô hình ngay cùng ngày bạn ra mắt bản thay thế vừa là một câu chuyện di trú gọn gàng, vừa là một câu chuyện phũ phàng. Nếu bạn ghim Isaac chỉ vì nó chạy tốt, thì bạn đang có một hạn chót đã trôi qua mất rồi.
Chạy nó ở đâu và làm cách nào để thử nó mà không phải đặt cược vào nó
Tính khả dụng được cung cấp thông qua API riêng của nhà cung cấp và một số nền tảng bên thứ ba. OrcaRouter hiện không định tuyến Perceptron Mk1.5 — mô hình này không có trong danh mục của chúng tôi — vì vậy hướng dẫn trung thực là truy cập trực tiếp vào api.perceptron.inc để có nó, đó chính xác là việc mà SDK và biến môi trường PERCEPTRON_API_KEY dùng để làm.
Dù sao, điều đáng nói là vì nó áp dụng cho quyết định chứ không phải mô hình: một checkpoint hai ngày tuổi trên cửa sổ 36.864 token với mặc định reasoning được đặt thành high chính xác là kiểu thứ bạn không nên đưa vào production mà chưa kiểm chứng. Hãy chạy thử nó với chính các frame của bạn trước, và đo cụ thể hai thứ — liệu các đầu ra có cấu trúc có trụ được qua các trường hợp biên thực tế của bạn không, và reasoning_effort: "high" tốn cho bạn bao nhiêu mỗi lần gọi so với khi hạ xuống medium hoặc low. Điều thứ hai là một thay đổi một dòng có ảnh hưởng trực tiếp đến hóa đơn của bạn, và đó là thí nghiệm rẻ nhất trong bản phát hành này.
Mô hình rộng hơn mà điều này nằm trong đó — các mô hình nhận thức trả về hình học thay vì tính từ — chính là thứ mà OrcaRouter được xây dựng để đảm nhận. Một API duy nhất bao phủ hơn 200 mô hình với giá niêm yết của nhà cung cấp được chuyển nguyên ở mức 0% phụ phí, nên khi giá của bất kỳ nhà cung cấp nào thay đổi, phía chúng tôi sẽ cập nhật ngay trong cùng ngày, và cơ chế chuyển đổi dự phòng tự động nghĩa là một lệnh gọi nhận thức có thể chuyển sang mô hình thứ hai thay vì làm hỏng yêu cầu. Nếu Mk1.5 là thứ duy nhất đáp ứng được ngưỡng độ chính xác của bạn, thì hôm nay tất cả những điều đó đều không giúp gì được. Nếu nó chỉ là một ứng viên trong số nhiều lựa chọn, việc chạy so sánh qua một điểm cuối duy nhất sẽ rẻ hơn là kết nối thêm một SDK thứ hai chỉ để tìm hiểu.
Bản phát hành này là gì và không phải là gì
Perceptron Mk1.5 là một công cụ tập trung với một loạt giới hạn trung thực đến bất thường đi kèm. Nó trả về tọa độ, chứ không chỉ mô tả. Nó đọc âm thanh, kể cả phần âm thanh của một video nếu bạn bật tính năng đó. Nó nhanh với các câu trả lời trò chuyện ngắn. Nó cũng là một mô hình 36,864-token với giới hạn đầu ra 8,192-token, có giá $0.15 và $1.50, được đánh giá hoàn toàn bởi nhà cung cấp của chính nó, và được bán bởi một công ty đã khai tử thế hệ trước ngay trong cùng một mục nhật ký thay đổi.
Nếu vấn đề của bạn là "tìm bàn tay, theo dõi nó xuyên suốt clip, cho tôi biết nó đã đi đâu và khi nào", thì con số hand-box chính là thứ cần kiểm tra. Nếu vấn đề của bạn là hiểu video một cách tổng quát so với một mô hình tổng quát tiên tiến, thì dòng EgoSchema — 80.40 so với 81.20 — gợi ý rằng bạn đang mua một chuyên gia ở mức gần ngang bằng, và lý lẽ để chuyển đổi phải đến từ đầu ra có cấu trúc và độ trễ, chứ không phải từ độ chính xác.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
