
Perceptron Mk1.5 vs Gemma 4 12B: ตัวหนึ่งตอบเป็นประโยค อีกตัวตอบเป็นพิกัด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 610 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 189 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
นี่คือตัวเลขที่ควรทำให้คุณสะดุดตั้งแต่แรก: Perceptron Mk1.5 เป็นโมเดลที่สร้างขึ้นสำหรับวิดีโอและเอเจนต์แบบ embodied และหน้าต่างบริบทของมันคือ 36,864 โทเคน Gemma 4 12B เป็นโมเดลอเนกประสงค์แบบ open-weights ขนาด 12B ที่มีหน้าต่าง 256K บนแกนที่คนส่วนใหญ่ใช้เปรียบเทียบโมเดลวิชัน — คือเราป้อนฟุตเทจให้มันได้มากแค่ไหน — โมเดลขนาดเล็กกว่า แบบปิด และสร้างมาเพื่อจุดประสงค์เฉพาะ แพ้ให้กับตัวที่ดาวน์โหลดได้ด้วยปัจจัยเจ็ดเท่า การกลับกันเช่นนี้ไม่ใช่ข้อบกพร่องของผลิตภัณฑ์ใด มันบอกคุณว่าแต่ละตัวถูกสร้างขึ้นมาเพื่อทำอะไรจริง ๆ และสองงานนี้ห่างกันมากกว่าที่บรรทัด "multimodal input" ที่เหมือนกันบนสเปกชีตของพวกมันจะบอกเป็นนัย
Perceptron Mk1.5 คือโมเดลการให้เหตุผลแบบ embodied ที่ Perceptron เปิดตัวเมื่อวันที่ 25 กันยายน 2026 เป็นรุ่นสืบทอดจาก Perceptron Mk1 เมื่อเดือนพฤษภาคม รับข้อความ รูปภาพ วิดีโอ และเสียงเข้า และส่งออกข้อความพร้อมเรขาคณิตที่เครื่องแยกวิเคราะห์ได้ Gemma 4 12B คือโมเดลมัลติโมดัลแบบเปิดน้ำหนักที่ไม่มีเอนโคเดอร์ ขนาด 11.96B ของ Google DeepMind เปิดตัวเมื่อวันที่ 3 มิถุนายน 2026 ภายใต้ Apache 2.0 รับข้อความ รูปภาพ เสียง และวิดีโอเข้า และส่งออกข้อความ ทั้งสองมีราคาถูก ทั้งสองอ่านฟีดกล้อง และมีเพียงตัวเดียวเท่านั้นที่จะส่ง bounding box ให้คอนโทรลเลอร์ของคุณโดยไม่ต้องมีขั้นตอนการแยกวิเคราะห์ที่สอง การเลือกระหว่างทั้งสองคือการเลือกว่าอะไรต้องส่งกลับมา
สิ่งที่แต่ละอันถูกสร้างขึ้นมาเพื่อคืนค่า
ลองวางสองตัวนี้เคียงข้างกัน แล้วความแตกต่างจะไม่ใช่เรื่องความแม่นยำ แต่เป็นประเภทของเอาต์พุต ถาม Gemma 4 12B ว่าโฟล์กลิฟต์อยู่ที่ไหน คุณจะได้หนึ่งประโยค และในแอปพลิเคชันส่วนใหญ่ ประโยคนั้นก็คือตัวผลิตภัณฑ์ — คำอธิบาย บทสรุป คำตอบของคำถามเกี่ยวกับภาพถ่าย ถาม Perceptron Mk1.5 บ้าง และนอกจากข้อความร้อยเรียงแล้ว คุณยังขอจุด กรอบล้อม (bounding box) รูปหลายเหลี่ยม คลิป หรือ <track> องค์ประกอบที่หอบหิ้วข้อสังเกตเชิงพื้นที่ และ แสตมป์เวลาที่มันสังกัดอยู่ คลิปความยาว 60 วินาทีจะถูกส่งกลับมาเป็นลำดับของตำแหน่งเมื่อเวลาผ่านไป แทนที่จะเป็นการเดาแบบเฉลี่ยครั้งเดียวเกี่ยวกับฉากนั้น
นั่นคือเหตุผลทั้งหมดของการมีอยู่ของ Mk1.5 และคุ้มค่าที่จะพูดให้ชัดเจนว่าทำไมมันจึงสำคัญ คำอธิบายของฉากหนึ่ง ๆ คือชิ้นงานที่เสร็จสมบูรณ์ พิกัดหนึ่งค่าคืออินพุตสำหรับสิ่งอื่น — ตัววางแผนการหยิบจับ การตรวจสอบข้อบกพร่อง ร่องรอยการตรวจสอบที่ประทับเวลา ถ้าโค้ดปลายน้ำของคุณต้องอ่านข้อความร้อยเรียงและอนุมานตำแหน่งจากข้อความนั้น คุณได้สร้างตัวแยกวิเคราะห์ระหว่างโมเดลสองตัวขึ้นมา และตัวแยกวิเคราะห์นั้นก็กลายเป็นพื้นผิวความล้มเหลวของคุณในตอนนี้ จุดขายของ Mk1.5 คือเรขาคณิตมาถึงในรูปแบบที่มีชนิดกำกับแล้ว
ข้อโต้แย้งตอบโต้ของ Gemma 4 12B ไม่ใช่ว่ามันก็ทำแบบนี้เช่นกัน แต่คือคุณสามารถเป็นเจ้าของเวตได้ Apache 2.0, พารามิเตอร์ 11.96B, เผยแพร่ทั้งในรูปแบบ pre-trained และ instruction-tuned, รันบนฮาร์ดแวร์ที่คุณควบคุมเอง, พร้อมการ์ดประเมินผลที่เผยแพร่และดัชนีจากบุคคลที่สามรองรับอยู่เบื้องหลัง สิ่งเหล่านี้เป็นสินทรัพย์คนละประเภท และไม่มีสิ่งใดทดแทนอีกสิ่งหนึ่งได้
จุดที่ทั้งสองตรงกันจริง ๆ
จำนวนแห่งน้อยกว่าที่ป้าย "multimodal 2026" บ่งนัยไว้ แต่จุดร่วมนั้นเป็นของจริง และควรค่าแก่การระบุให้ชัดเจน เพราะนั่นคือจุดที่เช็กลิสต์ของผู้ซื้อมักเริ่มต้น
• รูปแบบอินพุต — ทั้งคู่เป็นสี่รูปแบบอย่างแท้จริง Perceptron Mk1.5 รองรับข้อความ รูปภาพ วิดีโอ และเสียง (WAV, MP3, FLAC) Gemma 4 12B รองรับข้อความ รูปภาพ เสียง และวิดีโอผ่านเส้นทางรวมที่ไม่ใช้ตัวเข้ารหัสเพียงหนึ่งเส้นทาง
รูปแบบเอาต์พุต — ทั้งสองไม่ได้สร้างเสียงหรือรูปภาพ ทั้งคู่เป็นเอาต์พุตแบบข้อความ ความแตกต่างคือข้อความของ Mk1.5 สามารถมีคำอธิบายเชิงพื้นที่แบบมีโครงสร้างได้ ส่วนของ Gemma 4 12B ไม่มี
• การเรียกใช้ฟังก์ชัน — ทั้งสองรองรับ Mk1.5 เปิดให้ใช้การเรียกใช้ฟังก์ชันบนแชทคอมพลีชัน และรับการตอบสนองแบบจำกัดผ่าน JSON Schema และ regex ส่วน Gemma 4 12B มาพร้อมการเรียกใช้ฟังก์ชันในรูปแบบที่ปรับแต่งด้วยคำสั่ง และโหมดคิดที่กำหนดค่าได้
• การควบคุมการให้เหตุผล — Mk1.5 แทนที่vision_config.enable_thinkingแบบบูลีนเดิมด้วยฟิลด์reasoning_effortที่รับค่า high, medium, low, minimal หรือ none และมีค่าเริ่มต้นเป็นhigh Gemma 4 12B มีรูปแบบที่คิดและไม่คิดให้ใช้งาน ซึ่งให้คะแนนต่างกันบนชุดทดสอบเดียวกัน เนื่องจากทำงานในปริมาณที่ต่างกัน
• บริบท — 36,864 โทเคนสำหรับ Mk1.5 เทียบกับ 256K สำหรับ Gemma 4 12B นี่คือช่องว่างที่กว้างที่สุดในรายการ และส่วนถัดไปจะกล่าวถึงเรื่องนี้
น้ำหนักโมเดลและสัญญาอนุญาต — Mk1.5 เป็นโมเดลโฮสต์แบบปิดที่มี SDK ไม่ใช่ไฟล์ดาวน์โหลด Gemma 4 12B อยู่ภายใต้ Apache 2.0 ดังนั้นราคาแบบโฮสต์จึงเป็นเพียงหนึ่งในหลายทางเลือก ไม่ใช่วิธีเดียวในการรันมัน

หน้าต่าง 36K เป็นการตัดสินใจด้านการออกแบบ ไม่ใช่ข้อบกพร่อง
โมเดลแบบ embodied ที่มีหน้าต่าง 36,864 โทเคนดูเหมือนเป็นความผิดพลาด จนกว่าคุณจะดูสิ่งที่ Perceptron สร้างขึ้นมาควบคู่กัน Mk1.5 ยอมรับฟิลด์ asset_idx ดังนั้นคำขอเดียวสามารถอ้างอิงภาพหรือวิดีโอหลายรายการและระบุแต่ละรายการแยกกันได้ มันจำกัดเสียงไว้ที่ 16,384 โทเคนต่อรายการ — เอกสารของ Perceptron ระบุว่าประมาณ 21.8 นาทีของคำพูดที่ราว 750 โทเคนต่อนาที และเหตุผลที่หน้าต่างสามารถเล็กอยู่ได้ก็คือ งานนั้นแคบ: ค้นหาและติดตามสิ่งเฉพาะในเฟรม ตอบเกี่ยวกับสิ่งเหล่านั้น แล้วหยุด
นั่นเป็นงานที่มีรูปแบบแตกต่างจากของ Gemma 4 12B หน้าต่าง 256K ใช้สำหรับเก็บเอกสาร รีโพซิทอรี หรือบทสนทนายาว ๆ และใช้ให้เหตุผลครอบคลุมทั้งหมดนั้น ส่วนหน้าต่างของ Mk1.5 เป็นงบประมาณสำหรับงานด้านการรับรู้หนึ่งงานที่มีคำตอบแบบมีโครงสร้าง และ Perceptron ได้กำหนดขนาดให้เหมาะกับงานนั้น มากกว่าจะให้เหมาะกับลีดเดอร์บอร์ด จุดที่ความแตกต่างนี้แสดงผลชัดคือตอนที่งานของคุณคือ "ดูวิดีโอตรวจสอบความยาว 40 นาทีนี้ทั้งหมดแล้วบอกฉันทุกอย่าง" — หน้าต่าง 36K จะเก็บทั้งข้อความถอดเสียง ทั้งเฟรม และคำตอบไว้พร้อมกันไม่ได้ และหน้าต่างของ Gemma 4 12B บวกกับคะแนนการระลึกถึงบริบทแบบยาวของมันคือเครื่องมือที่ตรงไปตรงมาสำหรับงานนั้น
ครึ่งหลังของข้อแลกเปลี่ยนนั้นคือความเร็ว Perceptron รายงานว่าเร็วขึ้นแบบ end-to-end สูงสุดถึง 4.7× จากค่ามัธยฐานของการรัน 3 ครั้งบน H100 ตัวเดียว โดยมีข้อแม้ว่า 4.7× เป็นค่าที่ดีที่สุดจากการวัด 3 ครั้ง ไม่ใช่กรณีทั่วไป: คำตอบแชตลดจาก 5.2 วินาทีเหลือ 1.1, image QA ลดจาก 1.7 วินาทีเหลือ 0.51 (ประมาณ 3.3×) และวิดีโอ 60 วินาทีที่ทำงานพร้อมกันแปดทางลดจาก 19 วินาทีเหลือ 9.1 (ประมาณ 2.1×) สำหรับงานวิดีโอที่ embodied agent ใช้งานจริง ตัวคูณที่ตรงไปตรงมาคือประมาณสองเท่า
หนึ่งในสิ่งเหล่านี้ถูกวัดโดยคนอื่นแล้ว

นี่คือความไม่สมมาตรที่ชัดเจนที่สุดในการจับคู่นี้ และมันไม่ได้ใกล้เคียงเลย
Gemma 4 12B มีการ์ดประเมินจากผู้ขายและดัชนีจากบุคคลที่สาม การ์ดนี้มีตัวเลขที่ผู้ขายรายงาน — MMLU Pro 77.2, GPQA Diamond 78.8, MMMU Pro 69.1, LiveCodeBench v6 72.0, AIME 2026 โดยไม่ใช้เครื่องมือ 77.5, Tau2 เฉลี่ยจากการรันสามครั้ง 69.0 — และจุดอ่อนที่ตรงไปตรงมาหนึ่งจุดใน MRCR v2 8-needle ที่ 128k ซึ่งได้ 43.4 และเป็นแถวที่ต้องอ่านก่อนที่จะสันนิษฐานว่าหน้าต่าง 256K ทำงานเหมือนกับที่ปลายสุด เหนือสิ่งนั้นขึ้นไปมีการวัดผลอิสระ: Artificial Analysis จัดให้ Gemma 4 12B อยู่ที่ดัชนีความฉลาด 14 อยู่ในอันดับที่ 22 จาก 142 โมเดลในคลาสเดียวกัน ที่ 113.7 โทเค็นเอาต์พุตต่อวินาที — อันดับที่ 20 จาก 142 ในด้านความเร็ว — โดยมีราคาตั้งไว้ที่ $0.10 สำหรับอินพุตและ $0.30 สำหรับเอาต์พุตต่อล้านโทเค็น
Perceptron Mk1.5 ไม่มีอะไรในลักษณะนั้นเลย ไม่มีรายการดัชนีของ Artificial Analysis และไม่มีคะแนน arena สำหรับ Mk1.5 หรือ Mk1 ดังนั้นตัวเลขความสามารถทุกตัวที่มีอยู่สำหรับโมเดลนี้ล้วนผลิตขึ้นโดยบริษัทที่ขายมัน ชุดตัวเลขนั้นเจาะจงเฉพาะเจาะจงมากกว่าจะคลุมเครือ และน่าอ่านอยู่: 0.9433 บน egocentric hand_boxเทียบกับ 0.4467 สำหรับ Gemini 3.1 Pro และ 0.6179 สำหรับ Gemini ที่ดีที่สุดในการรันของ Perceptron เอง; EgoSchema 80.40 เทียบกับ 81.20 สำหรับคู่แข่งรายเดียวกัน เป็นการแพ้ 0.80 คะแนนบนเกณฑ์วัดความเข้าใจภาพรวม พร้อมข้ออ้างว่าดีกว่า 12% บนชุดย่อย EgoSchema-hard ที่ 63.75; 0.647 centre-F1 และ 0.628 point-HOTA บน Molmo2-Track; DailyOmni 74.67 และ AVHBench 80.56 ในส่วนของเสียง รูปแบบที่เห็นในตัวเลขเหล่านั้น — เด็ดขาดบนเรขาคณิตละเอียดยิบ ใกล้เคียงหรือตามหลังเล็กน้อยในการเข้าใจวิดีโอโดยทั่วไป — มีความสอดคล้องกัน และสอดรับกับเรื่องราวของผลิตภัณฑ์ แต่การวัดผลโมเดลของตัวเองโดยผู้ขายเป็นเพียงข้ออ้าง และโมเดลสองตัวในบทความนี้ไม่ได้ถูกอธิบายด้วยหลักฐานชนิดเดียวกัน
แถวหนึ่งในตารางนั้นสมควรได้รับคำเตือนเฉพาะเจาะจง การเปรียบเทียบการติดตามของ Perceptron ระบุค่า Qwen3-VL-8B ไว้ที่ centre-F1 0.180 ซึ่งอ้างอิงจากบทความของโมเดลนั้น วางเรียงข้างตัวเลขที่วัดได้ของโมเดลของตัวเอง และจับคู่กับ Qwen3.5-27B ที่ 0.530 และ 0.476 ซึ่งมาจาก checkpoint และรูปแบบการประเมินที่ต่างกัน ตัวเลขจากบทความที่อยู่ในคอลัมน์ของตัวเลขที่วัดได้นั้นไม่ใช่แถวที่เทียบกันได้แบบเดียวกัน และมันเป็นบรรทัดประเภทที่มักถูกอ้างต่อโดยไม่ระบุที่มา ข้อควรระวังเดียวกันนี้ใช้ในทางกลับกันกับโพสต์ 56.0 Mk1.5 บน LiveVQA-W เมื่อเปิดใช้เครื่องมือเช่นกัน เนื่องจากตัวเลขนั้นมาจากการลงคะแนนเสียงข้างมากจากสี่ตัวอย่าง ขณะที่ค่า 53.2 ที่นำมาเปรียบเทียบกับ Gemini 3.8 Flash เมื่อใช้ search grounding ไม่ได้มาจากวิธีดังกล่าว และการลงคะแนนเสียงข้างมากจากสี่ตัวอย่างเป็นเทคนิคที่ชอบด้วยเหตุผล ซึ่งทำให้คะแนนดูดีขึ้นเมื่อเทียบกับการรันแบบ greedy เพียงครั้งเดียว
การคิดต้นทุนภาระงานจริง
ตารางราคาใกล้เคียงกันมากกว่าที่ตัวผลิตภัณฑ์จะเป็น Perceptron Mk1.5 อยู่ที่ $0.15 ต่ออินพุตหนึ่งล้านโทเคน และ $1.50 ต่อเอาต์พุตหนึ่งล้านโทเคน โดยอินพุตที่แคชไว้ราคา $0.0375 — คิดเป็นหนึ่งในสี่ของอัตราอินพุตมาตรฐานพอดี และถูกกว่าต่อโทเคนที่แคชไว้เมื่อเทียบกับอินพุตมาตรฐาน $0.10 ของ Gemma 4 12B Gemma 4 12B ถูกระบุราคาที่ $0.10 และ $0.30 บนฮาร์เนสของบุคคลที่สามที่ใช้วัด และมันเป็น Apache 2.0 ดังนั้นการโฮสต์เองจะกำจัดต้นทุนส่วนเพิ่มได้ทั้งหมดหากคุณมีฮาร์ดแวร์
สองสิ่งทำให้การเปรียบเทียบตรง ๆ ซับซ้อนขึ้น และทั้งสองชี้ไปในทิศทางตรงกันข้าม อย่างแรก Mk1.5 มี reasoning_effortที่มีค่าเริ่มต้นเป็น high ซึ่งหมายความว่าทุกการเรียกใช้ที่คุณไม่ได้กำหนดค่าจะเป็นการซื้อเส้นทางการให้เหตุผลที่แพงที่สุดที่โมเดลมีให้; การลดลงเป็น medium หรือ low เป็นการแก้ไขเพียงบรรทัดเดียวที่ส่งผลโดยตรงต่อบิล และเป็นการทดลองที่ถูกที่สุดในรีลีสนี้ อย่างที่สอง Gemma 4 12B ให้คุณปิดขั้นตอนการคิดได้ทั้งหมด ซึ่งเปลี่ยนทั้งบิลและความหน่วง และบนงานแบบตายตัวอย่างการจำแนกระดับเฟรม การรันแบบไม่ใช้การให้เหตุผลมักเป็นตัวเลือกที่ถูกต้อง
ลองคำนวณกับอะไรที่จับต้องได้จริง: ไปป์ไลน์วิชันที่ประมวลผล 40,000 เฟรมต่อวัน โดยแต่ละเฟรมมีอินพุตภาพราวหนึ่งพันโทเคน นั่นคือ 40 ล้านโทเคนอินพุตต่อวัน ที่อัตราอินพุต $0.15 ของ Mk1.5 เมื่อมีแคชเฟรมในกรณีที่ฉากเดิมเกิดขึ้นซ้ำ คุณจะจ่ายเพียงหลักไม่กี่ดอลลาร์ต่อวันสำหรับอินพุต — ถูกตามมาตรฐานใด ๆ Gemma 4 12B ที่อินพุต $0.10 ยังถูกกว่า และฟรี ณ ส่วนเพิ่มหากคุณโฮสต์เอง ไม่มีโมเดลไหนแพง การตัดสินใจตรงนี้ไม่ใช่การตัดสินใจด้านงบประมาณ แต่เป็นคำถามว่าคุณต้องการพิกัด หน้าต่าง 256K หรือทั้งสองอย่าง
การเรียกทั้งสองตัวโดยไม่ต้องมีการผสานรวมครั้งที่สอง

อุปสรรคในทางปฏิบัติต่อการเปรียบเทียบนี้ไม่ใช่ราคา — แต่เป็นเพราะ Perceptron Mk1.5 และ Gemma 4 12B ไม่ได้อยู่ในแค็ตตาล็อกเดียวกัน ทั้งคู่ยังไม่ถูกจัดเส้นทางบน OrcaRouter ในตอนนี้: รายการ Gemma 4 ที่เราให้บริการคือรุ่น 31B Instruct และ 26B-A4B และ Mk1.5 ไม่มีเส้นทางเลย ดังนั้นคำแนะนำที่ตรงไปตรงมาคือให้เข้าถึง Mk1.5 ผ่าน API ของผู้จำหน่ายเองที่ api.perceptron.inc — pip install "perceptron>=0.4.0" โดยใส่คีย์ใน PERCEPTRON_API_KEY — และ Gemma 4 12B ไม่ว่าจะผ่านโฮสต์ของบุคคลที่สาม หรือโดยการให้บริการเวท Apache-2.0 ด้วยตัวเอง
สิ่งที่ routing layer มีไว้เพื่อจริง ๆ ในสถานการณ์นี้ คือการตัดสินใจที่คุณยังไม่ได้ตัดสินใจ ถ้า structured output ของ Mk1.5 เป็นสิ่งที่แอปพลิเคชันของคุณต้องการ และ window ของ Gemma 4 12B เป็นสิ่งที่ workload อีกงานของคุณต้องการ นั่นคือการอินทิเกรตสองครั้งและโดเมนความล้มเหลวสองโดเมน การวางสองตัวนี้ไว้เบื้องหลังendpoint เดียวที่เข้ากันได้กับ OpenAIพร้อม automatic failover หมายความว่าการสะดุดของ provider ฝั่งใดฝั่งหนึ่งจะกลายเป็น fallback แทนที่จะเป็นงานที่ล้มเหลว และกฎการ routing สามารถส่งงาน geometry และงาน long-context ไปยังโมเดลที่ต่างกันได้ โดยที่แอปพลิเคชันของคุณไม่รู้ว่าอันไหนเป็นอันไหน เมื่อผู้ขายปรับ rate card ของตน router แบบ pass-through จะคิดราคาตาม list price ของ provider โดยมีไม่มีการบวกเพิ่มต่อ tokenดังนั้นการเปลี่ยนแปลงจึงมีผลในวันเดียวกัน แทนที่จะรอรอบบิลถัดไปของคุณ routing DSL ยังเป็นวิธีที่คุณจะจัดฉากการเปรียบเทียบ — แบ่งทราฟฟิกจริงส่วนหนึ่งให้แต่ละโมเดล วัดผลบนเฟรมของคุณเอง แทนที่จะเป็นข้อโต้แย้งจาก benchmark
คุณอยากได้อันไหนจริงๆ
เลือก Perceptron Mk1.5 หากคำตอบต้องอยู่ในรูปแบบที่เครื่องอ่านได้ หากคุณกำลังขับเคลื่อนบางสิ่ง หรือบันทึกบางอย่างที่ตำแหน่งและเวลาเป็นประเด็นสำคัญ ไม่ว่าหน้าต่างบริบทเพิ่มเติมจะมีมากเพียงใดก็ไม่อาจทดแทนพิกัดที่พิมพ์ระบุได้ และ Mk1.5 เป็นโมเดลเดียวในคู่นี้ที่สร้างพิกัดดังกล่าวได้ เข้าไปโดยตระหนักถึงสามสิ่งนี้: งบประมาณ 36,864 โทเคน ค่าเริ่มต้นการให้เหตุผลแบบสูง และข้อเท็จจริงที่ว่าตัวเลขความสามารถทุกตัวที่แนบมากับมันเป็นของผู้จำหน่ายเอง
วิธีที่ประหยัดที่สุดในการหาข้อสรุปก็คือการกระจายทราฟฟิกจริงส่วนหนึ่งไปยังแต่ละตัว แล้ววัดผลจากเฟรมของคุณเอง ทั้งสองต่างทำงานอยู่เบื้องหลังเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI บน OrcaRouter ซึ่งเป็นสิ่งที่ทำให้การทดสอบแบบเทียบเคียงกันเป็นเพียงการตั้งค่าหนึ่งบรรทัด ไม่ใช่การผสานรวมครั้งที่สอง
เลือก Gemma 4 12B ถ้าคุณต้องเก็บเนื้อหาปริมาณมาก ถ้าคุณต้องใช้เวตของโมเดล หรือถ้าคุณต้องอธิบายเหตุผลในการเลือกให้กับคนที่ไม่เชื่อผลทดสอบจากผู้ขายแบบไม่ตรวจสอบ มันมีดัชนีอิสระ มีการ์ดผลการประเมินที่เผยแพร่ มีสัญญาอนุญาต Apache 2.0 และมีหน้าต่างบริบทที่ใหญ่กว่าเจ็ดเท่า — และมันจะบรรยายฉากแทนที่จะวัดมัน ประโยคสุดท้ายนั้นคือการตัดสินใจทั้งหมด โมเดลหนึ่งในนี้เป็นผู้เชี่ยวชาญทั่วไปที่คุณเป็นเจ้าของและตรวจสอบได้ ส่วนอีกโมเดลเป็นผู้เชี่ยวชาญเฉพาะทางที่คุณเช่าเพราะมันให้เรขาคณิตกลับมา และการที่ผู้เชี่ยวชาญเฉพาะทางมีหน้าต่างที่เล็กกว่าและไม่มีคะแนนจากบุคคลที่สามนั้นไม่ใช่ความขัดแย้ง นั่นคือสิ่งที่เครื่องมือที่สร้างมาแคบ ๆ ดูจากภายนอก
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
