Thẻ tiêu đề được tạo để so sánh Perceptron Mk1.5 và Gemma 4 12B, với tiêu đề chính là 'Perceptron Mk1.5 vs Gemma 4 12B' và tiêu đề phụ là 'Một bên trả lời bằng câu. Bên kia trả lời bằng tọa độ.', cùng ba thẻ ghi 'Ngữ cảnh Mk1.5: 36.864 token', 'Ngữ cảnh Gemma 4 12B: 256K' và 'Đầu ra Mk1.5: hộp và vệt', có chú thích cuối 'Số liệu Mk1.5 do nhà cung cấp báo cáo.'
Guides & Insights

Perceptron Mk1.5 vs Gemma 4 12B: Một bên trả lời bằng câu, bên kia trả lời bằng tọa độ

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây là con số đáng để bạn dừng lại trước tiên: Perceptron Mk1.5 là một mô hình được xây dựng cho video và các tác nhân embodied, và cửa sổ ngữ cảnh của nó là 36.864 token. Gemma 4 12B là một mô hình tổng quát trọng số mở 12B với cửa sổ 256K. Trên trục mà hầu hết mọi người dùng để so sánh các mô hình thị giác — tôi có thể đưa cho nó bao nhiêu cảnh quay — mô hình nhỏ hơn, đóng, chuyên dụng lại thua kém gấp bảy lần so với mô hình có thể tải về. Sự đảo ngược đó không phải là lỗi của sản phẩm nào trong hai sản phẩm. Nó cho bạn biết mỗi mô hình thực sự được xây dựng để làm gì, và hai công việc đó cách xa nhau hơn nhiều so với dòng "đầu vào đa phương thức" chung trên bảng thông số kỹ thuật của chúng.

Perceptron Mk1.5 là mô hình suy luận hiện thân mà Perceptron phát hành vào ngày 25 tháng 9 năm 2026, là phiên bản kế nhiệm của Perceptron Mk1 từ tháng 5, nhận đầu vào văn bản, hình ảnh, video và âm thanh rồi trả về văn bản cùng hình học có thể phân tích bằng máy. Gemma 4 12B là mô hình đa phương thức trọng số mở, không dùng bộ mã hóa, 11.96B tham số của Google DeepMind, phát hành ngày 3 tháng 6 năm 2026 theo Apache 2.0, nhận đầu vào văn bản, hình ảnh, âm thanh và video rồi trả về văn bản. Cả hai đều rẻ, cả hai đều đọc luồng camera, và chỉ một trong số chúng sẽ đưa cho bộ điều khiển của bạn một hộp bao mà không cần giai đoạn phân tích thứ hai. Lựa chọn giữa chúng là lựa chọn về thứ phải được trả về.

Mỗi cái được xây dựng để trả về điều gì

Đặt hai mô hình cạnh nhau, và khác biệt không nằm ở độ chính xác. Mà ở kiểu đầu ra. Hỏi Gemma 4 12B xem xe nâng ở đâu thì bạn nhận được một câu, và trong hầu hết ứng dụng, câu đó chính là sản phẩm — một mô tả, một bản tóm tắt, một câu trả lời cho câu hỏi về một bức ảnh. Hỏi Perceptron Mk1.5 thì, bên cạnh phần văn xuôi, bạn có thể yêu cầu một điểm, một hộp bao, một đa giác, một đoạn cắt, hoặc một <track> phần tử mang theo một quan sát không gian và dấu thời gian mà nó thuộc về. Một đoạn clip 60 giây được trả về dưới dạng một chuỗi các vị trí theo thời gian thay vì một phỏng đoán trung bình duy nhất về khung cảnh.

Đó là toàn bộ lý lẽ cho việc Mk1.5 tồn tại, và đáng để nói chính xác vì sao điều đó quan trọng. Một bản mô tả về một cảnh là một thành phẩm đã hoàn thiện. Một tọa độ là đầu vào cho một thứ khác — một bộ lập kế hoạch gắp, một kiểm tra khuyết tật, một dấu vết kiểm toán có dấu thời gian. Nếu mã hạ nguồn của bạn phải đọc văn xuôi và suy ra vị trí từ đó, bạn đã dựng một bộ phân tích cú pháp giữa hai mô hình, và bộ phân tích cú pháp đó giờ đây là bề mặt lỗi của bạn. Lời chào hàng của Mk1.5 là hình học đến ở dạng đã được định kiểu.

Lập luận phản bác của Gemma 4 12B không phải là nó cũng làm được điều này. Mà là bạn có thể có được các trọng số. Apache 2.0, 11.96B tham số, được công bố ở các biến thể đã huấn luyện trước và tinh chỉnh theo chỉ dẫn, chạy trên phần cứng do bạn kiểm soát, với một thẻ đánh giá đã công bố và một chỉ số của bên thứ ba đứng sau nó. Đó là những loại tài sản khác nhau, và không cái nào thay thế được cái kia.

Nơi hai thứ thực sự khớp với nhau

Ít nơi hơn so với hàm ý của nhãn “multimodal 2026”, nhưng điểm chung là có thật và đáng được nêu chính xác, bởi vì đó là nơi danh sách kiểm tra của người mua thường bắt đầu.

• Phương thức đầu vào — cả hai đều thực sự có bốn phương thức. Perceptron Mk1.5 chấp nhận văn bản, hình ảnh, video và âm thanh (WAV, MP3, FLAC). Gemma 4 12B chấp nhận văn bản, hình ảnh, âm thanh và video thông qua một đường dẫn hợp nhất không dùng bộ mã hóa.

• Phương thức đầu ra — cả hai đều không tạo ra âm thanh hay hình ảnh. Cả hai đều chỉ xuất ra văn bản. Khác biệt nằm ở chỗ văn bản của Mk1.5 có thể mang các chú thích không gian có cấu trúc, còn Gemma 4 12B thì không.

• Gọi hàm — cả hai đều hỗ trợ. Mk1.5 cung cấp gọi hàm trên chat completions và chấp nhận phản hồi bị ràng buộc thông qua JSON Schema và regex. Gemma 4 12B cung cấp gọi hàm ở dạng tinh chỉnh theo chỉ dẫn cùng chế độ suy nghĩ có thể cấu hình.

• Kiểm soát suy luận — Mk1.5 thay thế vision_config.enable_thinking boolean cũ bằng trường reasoning_effort nhận các giá trị high, medium, low, minimal hoặc none, và mặc định là high. Gemma 4 12B cung cấp các biến thể có suy luận và không suy luận, đạt điểm khác nhau trên cùng một harness vì chúng thực hiện khối lượng công việc khác nhau.

• Ngữ cảnh — 36,864 token cho Mk1.5 so với 256K của Gemma 4 12B. Đây là khoảng cách lớn nhất trong danh sách và phần tiếp theo sẽ bàn về điều đó.

• Trọng số và giấy phép — Mk1.5 là một mô hình được lưu trữ đóng với SDK, không phải bản tải về. Gemma 4 12B là Apache 2.0, nên mức giá lưu trữ chỉ là một lựa chọn trong số nhiều cách để chạy nó, chứ không phải cách duy nhất.

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Gemma 4 12B - the scoreboard', comparing six dimensions: context window 36,864 tokens vs 256K tokens; input text, image, video, audio vs text, image, audio, video; output text plus boxes, tracks and timestamps vs text only; reasoning control 'reasoning_effort, high default' vs thinking on and off; price $0.15 in / $1.50 out per 1M tokens vs $0.10 in / $0.30 out; and independent score 'none yet' vs AA Index 14 of 142. Footnoted that Mk1.5 figures are vendor-reported with no independent index and that the Gemma index is per Artificial Analysis.

Cửa sổ 36K là một quyết định thiết kế, không phải là một thiếu sót

Một mô hình hiện thân với cửa sổ 36.864 token nghe như một sai lầm cho đến khi bạn nhìn vào những gì Perceptron đã xây dựng song song với nó. Mk1.5 chấp nhận một asset_idx trường, nên một yêu cầu có thể tham chiếu đến nhiều hình ảnh hoặc video và xử lý riêng từng cái. Nó giới hạn âm thanh ở 16.384 token mỗi mục — tài liệu của Perceptron ước tính đó vào khoảng 21,8 phút nói với tốc độ khoảng 750 token mỗi phút. Và lý do cửa sổ có thể vẫn nhỏ là vì nhiệm vụ hẹp: tìm và theo dõi những thứ cụ thể trong các khung hình, trả lời về chúng, dừng lại.

Đó là một dạng công việc khác với Gemma 4 12B. Cửa sổ 256K là để chứa một tài liệu, một kho mã nguồn, hoặc một cuộc trò chuyện dài và suy luận xuyên suốt toàn bộ nội dung đó. Cửa sổ của Mk1.5 là một ngân sách cho một tác vụ nhận thức đơn lẻ với câu trả lời có cấu trúc, và Perceptron đã định cỡ nó theo tác vụ đó chứ không theo bảng xếp hạng. Điểm khác biệt trở nên rõ rệt vào đúng lúc tác vụ của bạn là "xem toàn bộ video kiểm tra dài 40 phút này và cho tôi biết mọi thứ" — một cửa sổ 36K sẽ không thể chứa bản bóc băng, các khung hình và câu trả lời cùng một lúc, còn cửa sổ của Gemma 4 12B cùng điểm nhớ ngữ cảnh dài của nó mới là công cụ trung thực cho việc đó.

Nửa còn lại của sự đánh đổi đó là tốc độ. Perceptron báo cáo tốc độ nhanh hơn tới 4,7× từ đầu đến cuối, tính theo trung vị của ba lần chạy trên một H100, kèm lưu ý rằng 4,7× là kết quả tốt nhất trong ba phép đo và không phải trường hợp điển hình: câu trả lời chat giảm từ 5,2 giây xuống 1,1, hỏi đáp hình ảnh giảm từ 1,7 giây xuống 0,51 (khoảng 3,3×), và một video dài 60 giây ở mức đồng thời tám luồng giảm từ 19 giây xuống 9,1 (khoảng 2,1×). Trên khối lượng công việc video mà một embodied agent thực sự chạy, bội số trung thực là khoảng hai.

Một trong số này đã được người khác đo.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing the Apache 2.0 licence, Google DeepMind authorship, the gemma4_unified image-text-to-text pipeline tag, and the card text that Gemma 4 models handle text, image and audio input (audio supported on E2B, E4B and 12B) and generate text output, with a context window of up to 256K tokens and multilingual support in over 140 languages.

Đây là sự bất đối xứng rõ rệt nhất trong cặp đấu này, và nó không hề sát nút chút nào.

Gemma 4 12B có một thẻ đánh giá của nhà cung cấp và một chỉ số của bên thứ ba. Thẻ này mang các số liệu do nhà cung cấp báo cáo — MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 không dùng công cụ 77,5, Tau2 lấy trung bình qua ba lần chạy 69,0 — cùng một điểm yếu được nêu thẳng thắn ở MRCR v2 8-needle tại 128k, đạt 43,4, và đây chính là dòng cần đọc trước khi cho rằng một cửa sổ 256K sẽ hành xử giống như vậy ở phía cuối. Trên hết, còn có một phép đo độc lập: Artificial Analysis xếp Gemma 4 12B ở Chỉ số Trí tuệ 14, đứng thứ 22 trong số 142 mô hình cùng lớp, với 113,7 token đầu ra mỗi giây — thứ 20 trong số 142 về tốc độ — cùng giá niêm yết 0,10 USD cho đầu vào và 0,30 USD cho đầu ra mỗi triệu token.

Perceptron Mk1.5 không có bất cứ thứ gì tương tự. Không có mục nào trong chỉ số Artificial Analysis và cũng không có điểm arena nào cho Mk1.5 hay Mk1, nên mọi con số về năng lực hiện có của mô hình này đều do chính công ty bán nó tạo ra. Bộ số liệu đó cụ thể chứ không mơ hồ, và đáng để xem xét: 0,9433 trên egocentric hand_box so với 0,4467 của Gemini 3.1 Pro và 0,6179 của Gemini tốt nhất trong chính lần chạy của Perceptron; EgoSchema 80,40 so với 81,20 của cùng đối thủ đó, tức thua 0,80 điểm trên bài kiểm tra hiểu tổng quát, kèm tuyên bố nhỉnh hơn 12% trên tập con EgoSchema-hard ở mức 63,75; 0,647 centre-F1 và 0,628 point-HOTA trên Molmo2-Track; DailyOmni 74,67 và AVHBench 80,56 ở phần âm thanh. Xu hướng trong những con số đó — dứt khoát trên khía cạnh hình học chi tiết, còn ngang bằng hoặc hơi kém hơn ở hiểu video tổng quát — là mạch lạc và khớp với câu chuyện sản phẩm. Nhưng việc nhà cung cấp tự đo benchmark cho mô hình của chính mình chỉ là một lời khẳng định, và hai mô hình trong bài viết này không được mô tả bằng cùng một loại bằng chứng.

Một hàng trong bảng đó đáng được cảnh báo cụ thể. Phần so sánh theo dõi của Perceptron liệt kê Qwen3-VL-8B ở 0,180 centre-F1, lấy nguồn từ bài báo của chính mô hình đó, đặt cạnh các con số đo được cho mô hình của họ, rồi ghép nó với Qwen3.5-27B ở 0,530 và 0,476 qua các checkpoint và thiết lập đánh giá khác nhau. Một con số từ bài báo nằm trong một cột toàn số đo được thì không phải là một hàng so sánh tương đương, và đây chính là kiểu dòng dễ bị trích dẫn mà bỏ qua nguồn gốc của nó. Cảnh báo tương tự cũng áp dụng theo chiều ngược lại cho các bài đăng 56,0 Mk1.5 trên LiveVQA-W với công cụ được bật — con số đó đến từ bỏ phiếu đa số bốn mẫu, trong khi mức 53,2 mà nó được đem ra so sánh cho Gemini 3.8 Flash với search grounding thì không, và bỏ phiếu đa số trên bốn mẫu là một kỹ thuật hợp lệ nhưng làm đẹp điểm số so với một lượt greedy đơn lẻ.

Tính chi phí cho một khối lượng công việc thực tế

Các bảng giá thì sát nhau hơn so với chính các sản phẩm. Perceptron Mk1.5 có giá 0,15 USD cho mỗi triệu token đầu vào và 1,50 USD cho mỗi triệu token đầu ra, với đầu vào được lưu đệm ở mức 0,0375 USD — đúng một phần tư mức giá đầu vào tiêu chuẩn, và rẻ hơn trên mỗi token được lưu đệm so với mức đầu vào tiêu chuẩn 0,10 USD của Gemma 4 12B. Gemma 4 12B được niêm yết ở mức 0,10 USD và 0,30 USD trên harness của bên thứ ba dùng để đo nó, và nó là Apache 2.0, nên việc tự host loại bỏ hoàn toàn chi phí biên nếu bạn có phần cứng.

Hai điều khiến cho một so sánh trực tiếp trở nên phức tạp và chúng chỉ về hai hướng ngược nhau. Thứ nhất, ở Mk1.5, reasoning_effort mặc định là high, nghĩa là mọi lệnh gọi bạn không cấu hình đều đang mua con đường suy luận đắt đỏ nhất mà mô hình cung cấp; việc hạ xuống medium hoặc low chỉ là thay đổi một dòng, có ảnh hưởng trực tiếp đến hóa đơn, và đây là thử nghiệm rẻ nhất trong bản phát hành. Thứ hai, Gemma 4 12B cho phép bạn tắt hẳn bước suy nghĩ, điều này thay đổi cả hóa đơn lẫn độ trễ, và với một tác vụ cố định như phân loại ở mức khung, một lượt không suy luận thường là lựa chọn đúng.

Hãy thử tính toán với một thứ có thật: một pipeline thị giác xử lý 40.000 khung hình mỗi ngày với khoảng một nghìn token đầu vào hình ảnh cho mỗi khung. Đó là 40 triệu token đầu vào mỗi ngày. Với mức giá đầu vào $0.15 của Mk1.5, cùng với các khung hình được cache khi cùng một cảnh lặp lại, bạn chỉ tốn ở mức vài đô-la một ngày cho đầu vào — rẻ theo bất kỳ tiêu chuẩn nào. Gemma 4 12B với giá đầu vào $0.10 còn rẻ hơn nữa, và miễn phí ở phần cận biên nếu bạn tự host. Cả hai mô hình đều không đắt. Quyết định ở đây không phải là quyết định về ngân sách; mà là câu hỏi liệu bạn cần tọa độ, cửa sổ 256K, hay cả hai.

Gọi cả hai mà không cần tích hợp thứ hai

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, and JSON Schema and regex constrained responses) and the Pricing table beneath it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Trở ngại thực tế khi chạy so sánh này không phải là giá — mà là Perceptron Mk1.5 và Gemma 4 12B không nằm trong cùng một danh mục. Hiện tại, cả hai đều không được định tuyến trên OrcaRouter: các mục Gemma 4 mà chúng tôi phục vụ là các biến thể 31B Instruct và 26B-A4B, còn Mk1.5 hoàn toàn không có route, nên hướng dẫn trung thực là truy cập Mk1.5 qua API riêng của nhà cung cấp tại api.perceptron.inc — pip install "perceptron>=0.4.0", khóa nằm trong PERCEPTRON_API_KEY — còn Gemma 4 12B thì hoặc qua một nhà cung cấp bên thứ ba, hoặc tự phục vụ các trọng số Apache-2.0.

Điều mà một lớp định tuyến thực sự dùng để làm trong tình huống này chính là quyết định mà bạn vẫn chưa đưa ra. Nếu đầu ra có cấu trúc của Mk1.5 là thứ ứng dụng của bạn cần và cửa sổ của Gemma 4 12B là thứ khối lượng công việc khác của bạn cần, thì đó là hai tích hợp và hai miền lỗi; đặt chúng phía sau một endpoint tương thích OpenAI với cơ chế tự động chuyển đổi dự phòng nghĩa là một trục trặc từ phía nhà cung cấp ở bên nào cũng sẽ suy giảm thành một phương án dự phòng thay vì một tác vụ thất bại, và một quy tắc định tuyến có thể gửi phần việc hình học và phần việc ngữ cảnh dài đến các mô hình khác nhau mà ứng dụng của bạn không cần biết cái nào là cái nào. Khi một nhà cung cấp thay đổi bảng giá của mình, một router chuyển tiếp thẳng sẽ tính theo giá niêm yết của nhà cung cấp với không cộng thêm gì trên mỗi token, nên thay đổi đó có hiệu lực ngay trong cùng ngày thay vì vào kỳ thanh toán tiếp theo của bạn. DSL định tuyến cũng là cách bạn triển khai một phép so sánh — chia một phần lưu lượng thật cho mỗi mô hình, đo lường trên chính các frame của bạn, thay vì tranh luận dựa trên benchmark.

Bạn thực sự muốn cái nào?

Hãy chọn Perceptron Mk1.5 nếu câu trả lời phải ở dạng máy đọc được. Nếu bạn đang điều khiển thứ gì đó, hoặc ghi log thứ gì đó mà vị trí và thời gian là điểm mấu chốt, thì không lượng cửa sổ ngữ cảnh bổ sung nào thay thế được cho một tọa độ đã được nhập, và Mk1.5 là mô hình duy nhất trong cặp này tạo ra được một tọa độ như vậy. Hãy cân nhắc kỹ ba điều: ngân sách 36.864 token, caovà việc mọi con số năng lực gắn với nó là của nhà cung cấp, mặc định suy luận

Cách rẻ nhất để giải quyết việc này là định tuyến một phần lưu lượng thực đến từng bên và đo trên chính các khung của bạn; cả hai đều nằm sau một endpoint tương thích OpenAI trên OrcaRouter, và chính điều đó khiến một thử nghiệm song song chỉ còn là một dòng cấu hình thay vì một tích hợp thứ hai.

Hãy chọn Gemma 4 12B nếu bạn cần chứa nhiều tài liệu, nếu bạn cần trọng số, hoặc nếu bạn cần biện minh cho lựa chọn này với người không tin tuyệt đối vào benchmark của nhà cung cấp. Nó có một chỉ số độc lập, một phiếu đánh giá được công bố, giấy phép Apache 2.0 và cửa sổ lớn hơn gấp bảy lần — và nó sẽ mô tả một cảnh thay vì đo đạc nó. Vế cuối đó chính là toàn bộ quyết định. Một trong những mô hình này là mô hình đa dụng mà bạn có thể sở hữu và kiểm toán; mô hình kia là chuyên gia mà bạn thuê vì nó trả về hình học, và việc chuyên gia có cửa sổ nhỏ hơn và không có điểm số bên thứ ba không phải là mâu thuẫn. Đó là dáng vẻ của một công cụ được xây dựng cho phạm vi hẹp khi nhìn từ bên ngoài.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày