การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับการเปรียบเทียบ Perceptron Mk1.5 กับ Gemma 4 12B โดยมีพาดหัวว่า 'Perceptron Mk1.5 vs Gemma 4 12B' พร้อมคำโปรยว่า 'ตัวหนึ่งตอบเป็นประโยค แต่อีกตัวตอบเป็นพิกัด' และการ์ดสามใบที่ระบุว่า 'บริบทของ Mk1.5: 36,864 โทเค็น' 'บริบทของ Gemma 4 12B: 256K' และ 'เอาต์พุตของ Mk1.5: กล่องและแทร็ก' โดยมีเชิงอรรถว่า 'ตัวเลขของ Mk1.5 เป็นข้อมูลที่ผู้จำหน่ายรายงานเอง'
Guides & Insights

Perceptron Mk1.5 vs Gemma 4 12B: ตัวหนึ่งตอบเป็นประโยค อีกตัวตอบเป็นพิกัด

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

นี่คือตัวเลขที่ควรทำให้คุณสะดุดตั้งแต่แรก: Perceptron Mk1.5 เป็นโมเดลที่สร้างขึ้นสำหรับวิดีโอและเอเจนต์แบบ embodied และหน้าต่างบริบทของมันคือ 36,864 โทเคน Gemma 4 12B เป็นโมเดลอเนกประสงค์แบบ open-weights ขนาด 12B ที่มีหน้าต่าง 256K บนแกนที่คนส่วนใหญ่ใช้เปรียบเทียบโมเดลวิชัน — คือเราป้อนฟุตเทจให้มันได้มากแค่ไหน — โมเดลขนาดเล็กกว่า แบบปิด และสร้างมาเพื่อจุดประสงค์เฉพาะ แพ้ให้กับตัวที่ดาวน์โหลดได้ด้วยปัจจัยเจ็ดเท่า การกลับกันเช่นนี้ไม่ใช่ข้อบกพร่องของผลิตภัณฑ์ใด มันบอกคุณว่าแต่ละตัวถูกสร้างขึ้นมาเพื่อทำอะไรจริง ๆ และสองงานนี้ห่างกันมากกว่าที่บรรทัด "multimodal input" ที่เหมือนกันบนสเปกชีตของพวกมันจะบอกเป็นนัย

Perceptron Mk1.5 คือโมเดลการให้เหตุผลแบบ embodied ที่ Perceptron เปิดตัวเมื่อวันที่ 25 กันยายน 2026 เป็นรุ่นสืบทอดจาก Perceptron Mk1 เมื่อเดือนพฤษภาคม รับข้อความ รูปภาพ วิดีโอ และเสียงเข้า และส่งออกข้อความพร้อมเรขาคณิตที่เครื่องแยกวิเคราะห์ได้ Gemma 4 12B คือโมเดลมัลติโมดัลแบบเปิดน้ำหนักที่ไม่มีเอนโคเดอร์ ขนาด 11.96B ของ Google DeepMind เปิดตัวเมื่อวันที่ 3 มิถุนายน 2026 ภายใต้ Apache 2.0 รับข้อความ รูปภาพ เสียง และวิดีโอเข้า และส่งออกข้อความ ทั้งสองมีราคาถูก ทั้งสองอ่านฟีดกล้อง และมีเพียงตัวเดียวเท่านั้นที่จะส่ง bounding box ให้คอนโทรลเลอร์ของคุณโดยไม่ต้องมีขั้นตอนการแยกวิเคราะห์ที่สอง การเลือกระหว่างทั้งสองคือการเลือกว่าอะไรต้องส่งกลับมา

สิ่งที่แต่ละอันถูกสร้างขึ้นมาเพื่อคืนค่า

ลองวางสองตัวนี้เคียงข้างกัน แล้วความแตกต่างจะไม่ใช่เรื่องความแม่นยำ แต่เป็นประเภทของเอาต์พุต ถาม Gemma 4 12B ว่าโฟล์กลิฟต์อยู่ที่ไหน คุณจะได้หนึ่งประโยค และในแอปพลิเคชันส่วนใหญ่ ประโยคนั้นก็คือตัวผลิตภัณฑ์ — คำอธิบาย บทสรุป คำตอบของคำถามเกี่ยวกับภาพถ่าย ถาม Perceptron Mk1.5 บ้าง และนอกจากข้อความร้อยเรียงแล้ว คุณยังขอจุด กรอบล้อม (bounding box) รูปหลายเหลี่ยม คลิป หรือ <track> องค์ประกอบที่หอบหิ้วข้อสังเกตเชิงพื้นที่ และ แสตมป์เวลาที่มันสังกัดอยู่ คลิปความยาว 60 วินาทีจะถูกส่งกลับมาเป็นลำดับของตำแหน่งเมื่อเวลาผ่านไป แทนที่จะเป็นการเดาแบบเฉลี่ยครั้งเดียวเกี่ยวกับฉากนั้น

นั่นคือเหตุผลทั้งหมดของการมีอยู่ของ Mk1.5 และคุ้มค่าที่จะพูดให้ชัดเจนว่าทำไมมันจึงสำคัญ คำอธิบายของฉากหนึ่ง ๆ คือชิ้นงานที่เสร็จสมบูรณ์ พิกัดหนึ่งค่าคืออินพุตสำหรับสิ่งอื่น — ตัววางแผนการหยิบจับ การตรวจสอบข้อบกพร่อง ร่องรอยการตรวจสอบที่ประทับเวลา ถ้าโค้ดปลายน้ำของคุณต้องอ่านข้อความร้อยเรียงและอนุมานตำแหน่งจากข้อความนั้น คุณได้สร้างตัวแยกวิเคราะห์ระหว่างโมเดลสองตัวขึ้นมา และตัวแยกวิเคราะห์นั้นก็กลายเป็นพื้นผิวความล้มเหลวของคุณในตอนนี้ จุดขายของ Mk1.5 คือเรขาคณิตมาถึงในรูปแบบที่มีชนิดกำกับแล้ว

ข้อโต้แย้งตอบโต้ของ Gemma 4 12B ไม่ใช่ว่ามันก็ทำแบบนี้เช่นกัน แต่คือคุณสามารถเป็นเจ้าของเวตได้ Apache 2.0, พารามิเตอร์ 11.96B, เผยแพร่ทั้งในรูปแบบ pre-trained และ instruction-tuned, รันบนฮาร์ดแวร์ที่คุณควบคุมเอง, พร้อมการ์ดประเมินผลที่เผยแพร่และดัชนีจากบุคคลที่สามรองรับอยู่เบื้องหลัง สิ่งเหล่านี้เป็นสินทรัพย์คนละประเภท และไม่มีสิ่งใดทดแทนอีกสิ่งหนึ่งได้

จุดที่ทั้งสองตรงกันจริง ๆ

จำนวนแห่งน้อยกว่าที่ป้าย "multimodal 2026" บ่งนัยไว้ แต่จุดร่วมนั้นเป็นของจริง และควรค่าแก่การระบุให้ชัดเจน เพราะนั่นคือจุดที่เช็กลิสต์ของผู้ซื้อมักเริ่มต้น

• รูปแบบอินพุต — ทั้งคู่เป็นสี่รูปแบบอย่างแท้จริง Perceptron Mk1.5 รองรับข้อความ รูปภาพ วิดีโอ และเสียง (WAV, MP3, FLAC) Gemma 4 12B รองรับข้อความ รูปภาพ เสียง และวิดีโอผ่านเส้นทางรวมที่ไม่ใช้ตัวเข้ารหัสเพียงหนึ่งเส้นทาง

รูปแบบเอาต์พุต — ทั้งสองไม่ได้สร้างเสียงหรือรูปภาพ ทั้งคู่เป็นเอาต์พุตแบบข้อความ ความแตกต่างคือข้อความของ Mk1.5 สามารถมีคำอธิบายเชิงพื้นที่แบบมีโครงสร้างได้ ส่วนของ Gemma 4 12B ไม่มี

• การเรียกใช้ฟังก์ชัน — ทั้งสองรองรับ Mk1.5 เปิดให้ใช้การเรียกใช้ฟังก์ชันบนแชทคอมพลีชัน และรับการตอบสนองแบบจำกัดผ่าน JSON Schema และ regex ส่วน Gemma 4 12B มาพร้อมการเรียกใช้ฟังก์ชันในรูปแบบที่ปรับแต่งด้วยคำสั่ง และโหมดคิดที่กำหนดค่าได้

• การควบคุมการให้เหตุผล — Mk1.5 แทนที่vision_config.enable_thinkingแบบบูลีนเดิมด้วยฟิลด์reasoning_effortที่รับค่า high, medium, low, minimal หรือ none และมีค่าเริ่มต้นเป็นhigh Gemma 4 12B มีรูปแบบที่คิดและไม่คิดให้ใช้งาน ซึ่งให้คะแนนต่างกันบนชุดทดสอบเดียวกัน เนื่องจากทำงานในปริมาณที่ต่างกัน

• บริบท — 36,864 โทเคนสำหรับ Mk1.5 เทียบกับ 256K สำหรับ Gemma 4 12B นี่คือช่องว่างที่กว้างที่สุดในรายการ และส่วนถัดไปจะกล่าวถึงเรื่องนี้

น้ำหนักโมเดลและสัญญาอนุญาต — Mk1.5 เป็นโมเดลโฮสต์แบบปิดที่มี SDK ไม่ใช่ไฟล์ดาวน์โหลด Gemma 4 12B อยู่ภายใต้ Apache 2.0 ดังนั้นราคาแบบโฮสต์จึงเป็นเพียงหนึ่งในหลายทางเลือก ไม่ใช่วิธีเดียวในการรันมัน

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Gemma 4 12B - the scoreboard', comparing six dimensions: context window 36,864 tokens vs 256K tokens; input text, image, video, audio vs text, image, audio, video; output text plus boxes, tracks and timestamps vs text only; reasoning control 'reasoning_effort, high default' vs thinking on and off; price $0.15 in / $1.50 out per 1M tokens vs $0.10 in / $0.30 out; and independent score 'none yet' vs AA Index 14 of 142. Footnoted that Mk1.5 figures are vendor-reported with no independent index and that the Gemma index is per Artificial Analysis.

หน้าต่าง 36K เป็นการตัดสินใจด้านการออกแบบ ไม่ใช่ข้อบกพร่อง

โมเดลแบบ embodied ที่มีหน้าต่าง 36,864 โทเคนดูเหมือนเป็นความผิดพลาด จนกว่าคุณจะดูสิ่งที่ Perceptron สร้างขึ้นมาควบคู่กัน Mk1.5 ยอมรับฟิลด์ asset_idx ดังนั้นคำขอเดียวสามารถอ้างอิงภาพหรือวิดีโอหลายรายการและระบุแต่ละรายการแยกกันได้ มันจำกัดเสียงไว้ที่ 16,384 โทเคนต่อรายการ — เอกสารของ Perceptron ระบุว่าประมาณ 21.8 นาทีของคำพูดที่ราว 750 โทเคนต่อนาที และเหตุผลที่หน้าต่างสามารถเล็กอยู่ได้ก็คือ งานนั้นแคบ: ค้นหาและติดตามสิ่งเฉพาะในเฟรม ตอบเกี่ยวกับสิ่งเหล่านั้น แล้วหยุด

นั่นเป็นงานที่มีรูปแบบแตกต่างจากของ Gemma 4 12B หน้าต่าง 256K ใช้สำหรับเก็บเอกสาร รีโพซิทอรี หรือบทสนทนายาว ๆ และใช้ให้เหตุผลครอบคลุมทั้งหมดนั้น ส่วนหน้าต่างของ Mk1.5 เป็นงบประมาณสำหรับงานด้านการรับรู้หนึ่งงานที่มีคำตอบแบบมีโครงสร้าง และ Perceptron ได้กำหนดขนาดให้เหมาะกับงานนั้น มากกว่าจะให้เหมาะกับลีดเดอร์บอร์ด จุดที่ความแตกต่างนี้แสดงผลชัดคือตอนที่งานของคุณคือ "ดูวิดีโอตรวจสอบความยาว 40 นาทีนี้ทั้งหมดแล้วบอกฉันทุกอย่าง" — หน้าต่าง 36K จะเก็บทั้งข้อความถอดเสียง ทั้งเฟรม และคำตอบไว้พร้อมกันไม่ได้ และหน้าต่างของ Gemma 4 12B บวกกับคะแนนการระลึกถึงบริบทแบบยาวของมันคือเครื่องมือที่ตรงไปตรงมาสำหรับงานนั้น

ครึ่งหลังของข้อแลกเปลี่ยนนั้นคือความเร็ว Perceptron รายงานว่าเร็วขึ้นแบบ end-to-end สูงสุดถึง 4.7× จากค่ามัธยฐานของการรัน 3 ครั้งบน H100 ตัวเดียว โดยมีข้อแม้ว่า 4.7× เป็นค่าที่ดีที่สุดจากการวัด 3 ครั้ง ไม่ใช่กรณีทั่วไป: คำตอบแชตลดจาก 5.2 วินาทีเหลือ 1.1, image QA ลดจาก 1.7 วินาทีเหลือ 0.51 (ประมาณ 3.3×) และวิดีโอ 60 วินาทีที่ทำงานพร้อมกันแปดทางลดจาก 19 วินาทีเหลือ 9.1 (ประมาณ 2.1×) สำหรับงานวิดีโอที่ embodied agent ใช้งานจริง ตัวคูณที่ตรงไปตรงมาคือประมาณสองเท่า

หนึ่งในสิ่งเหล่านี้ถูกวัดโดยคนอื่นแล้ว

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing the Apache 2.0 licence, Google DeepMind authorship, the gemma4_unified image-text-to-text pipeline tag, and the card text that Gemma 4 models handle text, image and audio input (audio supported on E2B, E4B and 12B) and generate text output, with a context window of up to 256K tokens and multilingual support in over 140 languages.

นี่คือความไม่สมมาตรที่ชัดเจนที่สุดในการจับคู่นี้ และมันไม่ได้ใกล้เคียงเลย

Gemma 4 12B มีการ์ดประเมินจากผู้ขายและดัชนีจากบุคคลที่สาม การ์ดนี้มีตัวเลขที่ผู้ขายรายงาน — MMLU Pro 77.2, GPQA Diamond 78.8, MMMU Pro 69.1, LiveCodeBench v6 72.0, AIME 2026 โดยไม่ใช้เครื่องมือ 77.5, Tau2 เฉลี่ยจากการรันสามครั้ง 69.0 — และจุดอ่อนที่ตรงไปตรงมาหนึ่งจุดใน MRCR v2 8-needle ที่ 128k ซึ่งได้ 43.4 และเป็นแถวที่ต้องอ่านก่อนที่จะสันนิษฐานว่าหน้าต่าง 256K ทำงานเหมือนกับที่ปลายสุด เหนือสิ่งนั้นขึ้นไปมีการวัดผลอิสระ: Artificial Analysis จัดให้ Gemma 4 12B อยู่ที่ดัชนีความฉลาด 14 อยู่ในอันดับที่ 22 จาก 142 โมเดลในคลาสเดียวกัน ที่ 113.7 โทเค็นเอาต์พุตต่อวินาที — อันดับที่ 20 จาก 142 ในด้านความเร็ว — โดยมีราคาตั้งไว้ที่ $0.10 สำหรับอินพุตและ $0.30 สำหรับเอาต์พุตต่อล้านโทเค็น

Perceptron Mk1.5 ไม่มีอะไรในลักษณะนั้นเลย ไม่มีรายการดัชนีของ Artificial Analysis และไม่มีคะแนน arena สำหรับ Mk1.5 หรือ Mk1 ดังนั้นตัวเลขความสามารถทุกตัวที่มีอยู่สำหรับโมเดลนี้ล้วนผลิตขึ้นโดยบริษัทที่ขายมัน ชุดตัวเลขนั้นเจาะจงเฉพาะเจาะจงมากกว่าจะคลุมเครือ และน่าอ่านอยู่: 0.9433 บน egocentric hand_boxเทียบกับ 0.4467 สำหรับ Gemini 3.1 Pro และ 0.6179 สำหรับ Gemini ที่ดีที่สุดในการรันของ Perceptron เอง; EgoSchema 80.40 เทียบกับ 81.20 สำหรับคู่แข่งรายเดียวกัน เป็นการแพ้ 0.80 คะแนนบนเกณฑ์วัดความเข้าใจภาพรวม พร้อมข้ออ้างว่าดีกว่า 12% บนชุดย่อย EgoSchema-hard ที่ 63.75; 0.647 centre-F1 และ 0.628 point-HOTA บน Molmo2-Track; DailyOmni 74.67 และ AVHBench 80.56 ในส่วนของเสียง รูปแบบที่เห็นในตัวเลขเหล่านั้น — เด็ดขาดบนเรขาคณิตละเอียดยิบ ใกล้เคียงหรือตามหลังเล็กน้อยในการเข้าใจวิดีโอโดยทั่วไป — มีความสอดคล้องกัน และสอดรับกับเรื่องราวของผลิตภัณฑ์ แต่การวัดผลโมเดลของตัวเองโดยผู้ขายเป็นเพียงข้ออ้าง และโมเดลสองตัวในบทความนี้ไม่ได้ถูกอธิบายด้วยหลักฐานชนิดเดียวกัน

แถวหนึ่งในตารางนั้นสมควรได้รับคำเตือนเฉพาะเจาะจง การเปรียบเทียบการติดตามของ Perceptron ระบุค่า Qwen3-VL-8B ไว้ที่ centre-F1 0.180 ซึ่งอ้างอิงจากบทความของโมเดลนั้น วางเรียงข้างตัวเลขที่วัดได้ของโมเดลของตัวเอง และจับคู่กับ Qwen3.5-27B ที่ 0.530 และ 0.476 ซึ่งมาจาก checkpoint และรูปแบบการประเมินที่ต่างกัน ตัวเลขจากบทความที่อยู่ในคอลัมน์ของตัวเลขที่วัดได้นั้นไม่ใช่แถวที่เทียบกันได้แบบเดียวกัน และมันเป็นบรรทัดประเภทที่มักถูกอ้างต่อโดยไม่ระบุที่มา ข้อควรระวังเดียวกันนี้ใช้ในทางกลับกันกับโพสต์ 56.0 Mk1.5 บน LiveVQA-W เมื่อเปิดใช้เครื่องมือเช่นกัน เนื่องจากตัวเลขนั้นมาจากการลงคะแนนเสียงข้างมากจากสี่ตัวอย่าง ขณะที่ค่า 53.2 ที่นำมาเปรียบเทียบกับ Gemini 3.8 Flash เมื่อใช้ search grounding ไม่ได้มาจากวิธีดังกล่าว และการลงคะแนนเสียงข้างมากจากสี่ตัวอย่างเป็นเทคนิคที่ชอบด้วยเหตุผล ซึ่งทำให้คะแนนดูดีขึ้นเมื่อเทียบกับการรันแบบ greedy เพียงครั้งเดียว

การคิดต้นทุนภาระงานจริง

ตารางราคาใกล้เคียงกันมากกว่าที่ตัวผลิตภัณฑ์จะเป็น Perceptron Mk1.5 อยู่ที่ $0.15 ต่ออินพุตหนึ่งล้านโทเคน และ $1.50 ต่อเอาต์พุตหนึ่งล้านโทเคน โดยอินพุตที่แคชไว้ราคา $0.0375 — คิดเป็นหนึ่งในสี่ของอัตราอินพุตมาตรฐานพอดี และถูกกว่าต่อโทเคนที่แคชไว้เมื่อเทียบกับอินพุตมาตรฐาน $0.10 ของ Gemma 4 12B Gemma 4 12B ถูกระบุราคาที่ $0.10 และ $0.30 บนฮาร์เนสของบุคคลที่สามที่ใช้วัด และมันเป็น Apache 2.0 ดังนั้นการโฮสต์เองจะกำจัดต้นทุนส่วนเพิ่มได้ทั้งหมดหากคุณมีฮาร์ดแวร์

สองสิ่งทำให้การเปรียบเทียบตรง ๆ ซับซ้อนขึ้น และทั้งสองชี้ไปในทิศทางตรงกันข้าม อย่างแรก Mk1.5 มี reasoning_effortที่มีค่าเริ่มต้นเป็น high ซึ่งหมายความว่าทุกการเรียกใช้ที่คุณไม่ได้กำหนดค่าจะเป็นการซื้อเส้นทางการให้เหตุผลที่แพงที่สุดที่โมเดลมีให้; การลดลงเป็น medium หรือ low เป็นการแก้ไขเพียงบรรทัดเดียวที่ส่งผลโดยตรงต่อบิล และเป็นการทดลองที่ถูกที่สุดในรีลีสนี้ อย่างที่สอง Gemma 4 12B ให้คุณปิดขั้นตอนการคิดได้ทั้งหมด ซึ่งเปลี่ยนทั้งบิลและความหน่วง และบนงานแบบตายตัวอย่างการจำแนกระดับเฟรม การรันแบบไม่ใช้การให้เหตุผลมักเป็นตัวเลือกที่ถูกต้อง

ลองคำนวณกับอะไรที่จับต้องได้จริง: ไปป์ไลน์วิชันที่ประมวลผล 40,000 เฟรมต่อวัน โดยแต่ละเฟรมมีอินพุตภาพราวหนึ่งพันโทเคน นั่นคือ 40 ล้านโทเคนอินพุตต่อวัน ที่อัตราอินพุต $0.15 ของ Mk1.5 เมื่อมีแคชเฟรมในกรณีที่ฉากเดิมเกิดขึ้นซ้ำ คุณจะจ่ายเพียงหลักไม่กี่ดอลลาร์ต่อวันสำหรับอินพุต — ถูกตามมาตรฐานใด ๆ Gemma 4 12B ที่อินพุต $0.10 ยังถูกกว่า และฟรี ณ ส่วนเพิ่มหากคุณโฮสต์เอง ไม่มีโมเดลไหนแพง การตัดสินใจตรงนี้ไม่ใช่การตัดสินใจด้านงบประมาณ แต่เป็นคำถามว่าคุณต้องการพิกัด หน้าต่าง 256K หรือทั้งสองอย่าง

การเรียกทั้งสองตัวโดยไม่ต้องมีการผสานรวมครั้งที่สอง

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, and JSON Schema and regex constrained responses) and the Pricing table beneath it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

อุปสรรคในทางปฏิบัติต่อการเปรียบเทียบนี้ไม่ใช่ราคา — แต่เป็นเพราะ Perceptron Mk1.5 และ Gemma 4 12B ไม่ได้อยู่ในแค็ตตาล็อกเดียวกัน ทั้งคู่ยังไม่ถูกจัดเส้นทางบน OrcaRouter ในตอนนี้: รายการ Gemma 4 ที่เราให้บริการคือรุ่น 31B Instruct และ 26B-A4B และ Mk1.5 ไม่มีเส้นทางเลย ดังนั้นคำแนะนำที่ตรงไปตรงมาคือให้เข้าถึง Mk1.5 ผ่าน API ของผู้จำหน่ายเองที่ api.perceptron.inc — pip install "perceptron>=0.4.0" โดยใส่คีย์ใน PERCEPTRON_API_KEY — และ Gemma 4 12B ไม่ว่าจะผ่านโฮสต์ของบุคคลที่สาม หรือโดยการให้บริการเวท Apache-2.0 ด้วยตัวเอง

สิ่งที่ routing layer มีไว้เพื่อจริง ๆ ในสถานการณ์นี้ คือการตัดสินใจที่คุณยังไม่ได้ตัดสินใจ ถ้า structured output ของ Mk1.5 เป็นสิ่งที่แอปพลิเคชันของคุณต้องการ และ window ของ Gemma 4 12B เป็นสิ่งที่ workload อีกงานของคุณต้องการ นั่นคือการอินทิเกรตสองครั้งและโดเมนความล้มเหลวสองโดเมน การวางสองตัวนี้ไว้เบื้องหลังendpoint เดียวที่เข้ากันได้กับ OpenAIพร้อม automatic failover หมายความว่าการสะดุดของ provider ฝั่งใดฝั่งหนึ่งจะกลายเป็น fallback แทนที่จะเป็นงานที่ล้มเหลว และกฎการ routing สามารถส่งงาน geometry และงาน long-context ไปยังโมเดลที่ต่างกันได้ โดยที่แอปพลิเคชันของคุณไม่รู้ว่าอันไหนเป็นอันไหน เมื่อผู้ขายปรับ rate card ของตน router แบบ pass-through จะคิดราคาตาม list price ของ provider โดยมีไม่มีการบวกเพิ่มต่อ tokenดังนั้นการเปลี่ยนแปลงจึงมีผลในวันเดียวกัน แทนที่จะรอรอบบิลถัดไปของคุณ routing DSL ยังเป็นวิธีที่คุณจะจัดฉากการเปรียบเทียบ — แบ่งทราฟฟิกจริงส่วนหนึ่งให้แต่ละโมเดล วัดผลบนเฟรมของคุณเอง แทนที่จะเป็นข้อโต้แย้งจาก benchmark

คุณอยากได้อันไหนจริงๆ

เลือก Perceptron Mk1.5 หากคำตอบต้องอยู่ในรูปแบบที่เครื่องอ่านได้ หากคุณกำลังขับเคลื่อนบางสิ่ง หรือบันทึกบางอย่างที่ตำแหน่งและเวลาเป็นประเด็นสำคัญ ไม่ว่าหน้าต่างบริบทเพิ่มเติมจะมีมากเพียงใดก็ไม่อาจทดแทนพิกัดที่พิมพ์ระบุได้ และ Mk1.5 เป็นโมเดลเดียวในคู่นี้ที่สร้างพิกัดดังกล่าวได้ เข้าไปโดยตระหนักถึงสามสิ่งนี้: งบประมาณ 36,864 โทเคน ค่าเริ่มต้นการให้เหตุผลแบบสูง และข้อเท็จจริงที่ว่าตัวเลขความสามารถทุกตัวที่แนบมากับมันเป็นของผู้จำหน่ายเอง

วิธีที่ประหยัดที่สุดในการหาข้อสรุปก็คือการกระจายทราฟฟิกจริงส่วนหนึ่งไปยังแต่ละตัว แล้ววัดผลจากเฟรมของคุณเอง ทั้งสองต่างทำงานอยู่เบื้องหลังเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI บน OrcaRouter ซึ่งเป็นสิ่งที่ทำให้การทดสอบแบบเทียบเคียงกันเป็นเพียงการตั้งค่าหนึ่งบรรทัด ไม่ใช่การผสานรวมครั้งที่สอง

เลือก Gemma 4 12B ถ้าคุณต้องเก็บเนื้อหาปริมาณมาก ถ้าคุณต้องใช้เวตของโมเดล หรือถ้าคุณต้องอธิบายเหตุผลในการเลือกให้กับคนที่ไม่เชื่อผลทดสอบจากผู้ขายแบบไม่ตรวจสอบ มันมีดัชนีอิสระ มีการ์ดผลการประเมินที่เผยแพร่ มีสัญญาอนุญาต Apache 2.0 และมีหน้าต่างบริบทที่ใหญ่กว่าเจ็ดเท่า — และมันจะบรรยายฉากแทนที่จะวัดมัน ประโยคสุดท้ายนั้นคือการตัดสินใจทั้งหมด โมเดลหนึ่งในนี้เป็นผู้เชี่ยวชาญทั่วไปที่คุณเป็นเจ้าของและตรวจสอบได้ ส่วนอีกโมเดลเป็นผู้เชี่ยวชาญเฉพาะทางที่คุณเช่าเพราะมันให้เรขาคณิตกลับมา และการที่ผู้เชี่ยวชาญเฉพาะทางมีหน้าต่างที่เล็กกว่าและไม่มีคะแนนจากบุคคลที่สามนั้นไม่ใช่ความขัดแย้ง นั่นคือสิ่งที่เครื่องมือที่สร้างมาแคบ ๆ ดูจากภายนอก

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube