การ์ดชื่อเรื่องหลักที่มีข้อความว่า 'Intern-Decision-0.8B vs Gemma 4 12B' พร้อมคำบรรยายใต้ชื่อว่า 'ตัวหนึ่งเขียนคำตอบ อีกตัวให้คะแนนคำตอบนั้น' ติดป้ายว่า 'หัวให้คะแนน 0.8B ไม่มีโทเคนเอาต์พุต' และ '11.95B มัลติโมดัลเจเนอรัลลิสต์' โดยมีโลโก้ OrcaRouter ประกอบอยู่ที่มุม
Guides & Insights

Intern-Decision-0.8B vs Gemma 4 12B: หัวให้คะแนนปะทะโมเดลอเนกประสงค์แบบมัลติโมดัล

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วิธีที่ถูกที่สุดในการดูว่า Intern-Decision-0.8B คืออะไร — และไม่ใช่อะไร — คือการวางมันไว้ข้าง ๆ Gemma 4 12B แล้วสังเกตว่าการเปรียบเทียบนี้แทบจะทั้งหมดเกี่ยวข้องกับสิ่งที่แต่ละโมเดลทำกับเลเยอร์เอาต์พุตของมัน Gemma 4 12B โมเดลมัลติโมดัลแบบไม่มีเอนโคเดอร์ที่มีพารามิเตอร์ 1.195 หมื่นล้านของ DeepMind ซึ่งเปิดตัวเมื่อวันที่ 3 มิถุนายน 2026 ภายใต้ Apache 2.0 เป็นนักอเนกประสงค์เชิงสร้างสรรค์: คุณป้อนข้อความ รูปภาพ เสียง หรือวิดีโอให้มัน แล้วมันจะเขียนคำตอบออกมา ส่วน Intern-Decision-0.8B ซึ่ง InternLM อัปโหลดขึ้น Hugging Face อย่างเงียบ ๆ เมื่อวันที่ 26 กันยายน 2026 โดยไม่มีการประกาศใด ๆ เป็นโมเดลที่ผ่านการไฟน์ทูนจาก Qwen3.5-0.8B ที่เล็กกว่ามาก และไม่สร้างข้อความใด ๆ เลย — มันรับสถานะหนึ่ง สคีมาของคำถามที่มีชื่อกำกับ และรูปภาพไม่เกินแปดรูป แล้วคืนค่าการแจกแจงความน่าจะเป็นที่ปรับเทียบแล้วสำหรับแต่ละคำถามหลังจากการส่งผ่านไปข้างหน้าหนึ่งครั้ง ตัวหนึ่งเขียน อีกตัวให้คะแนน ทุกสิ่งด้านล่างนี้สืบเนื่องมาจากข้อเท็จจริงข้อนั้น

การจับคู่นี้จึงเป็นเรื่องแปลกหากจะวางกรอบให้เป็นการแข่งขัน และควรพูดให้ชัดก่อนจะถึงแถวสเปก: สองตัวนี้ไม่ใช่สิ่งที่ใช้แทนกันได้ และใครก็ตามที่กำลังเลือกระหว่างสองตัวนี้ ก็ตั้งโจทย์ผิดไปแล้วตั้งแต่แรก Gemma 4 12B ตอบคำถามว่า "คำตอบควรเป็นอะไร" ส่วน Intern-Decision-0.8B ตอบคำถามว่า "ในสิบหกตัวเลือกนี้คือตัวไหน และคุณมั่นใจแค่ไหน" — และตอบโดยไม่ต้องมีลูปตัวถอดรหัส ซึ่งเป็นจุดที่ความแตกต่างด้านความหน่วงและต้นทุนเกิดขึ้น ดังนั้นการเปรียบเทียบที่มีประโยชน์จึงเป็นเรื่องของวิธีที่คุณจะต่อแต่ละตัวเข้ากับเวิร์กโฟลว์เดียว ไม่ใช่เรื่องว่าตัวไหนชนะ

ความแตกต่างที่ใหญ่ที่สุดเพียงอย่างเดียวคือด้านเอาต์พุตของบิล

Gemma 4 12B ถูกคิดค่าบริการเหมือนโมเดลแบบสร้างทั่วไป: ทั้งโทเคนอินพุตและโทเคนเอาต์พุต เมื่อคุณขอให้มันสร้าง JSON ที่มีโครงสร้าง ทุกโทเคนเหล่านั้นจะถูกสร้าง ถูกสุ่ม และถูกคิดค่าบริการ และยิ่งสคีมาของคุณยาวและซ้อนกันมากเท่าไร ก็ยิ่งมีโทเคนเหล่านั้นมากขึ้นเท่านั้น นั่นไม่ใช่การวิจารณ์โมเดล — มันคือสิ่งที่ตัวถอดรหัสทำ — แต่มันคือรายการในบิลที่หัวตัดสินใจมีอยู่เพื่อกำจัดออกไป Intern-Decision-0.8B ไม่มีโทเคนเอาต์พุต การ์ดของมันระบุชัดเจนว่าทำไม: เส้นทางการอนุมานไม่เคยเรียก generate()/, โดยอ่านค่าลอจิตที่ตำแหน่งซึ่งอยู่ก่อนหน้าตรง ๆ ของแต่ละ <decision>/ เพลสโฮลเดอร์ในโครงร่างที่เรนเดอร์ไว้ล่วงหน้า และทำ softmax เฉพาะสัญลักษณ์ผู้สมัครที่ได้รับอนุญาตสำหรับฟิลด์นั้น ตัวนับการใช้งานที่ชื่อ output_tokens/ นับฟิลด์ที่ถูกให้คะแนน ไม่ใช่ข้อความ

ผลที่ตามมาจะทบต้นเมื่อ規模ขยายขึ้น ไปป์ไลน์ที่ติดป้ายระเบียนหนึ่งหมื่นรายการด้วย Gemma 4 12B ต้องจ่ายสำหรับเอกสาร JSON หนึ่งหมื่นฉบับ; ไปป์ไลน์เดียวกันที่ใช้ Intern-Decision-0.8B จ่ายเฉพาะพรอมป์ต์และไม่มีอย่างอื่น ว่าจำนวนสัมบูรณ์จะมากหรือไม่นั้นขึ้นอยู่กับปริมาณและสคีมาของคุณทั้งหมด และใครก็ตามที่มีงบประมาณต่อโทเคนสามารถคำนวณในสเปรดชีตได้ภายในสิบนาที แต่ทิศทางไม่เป็นที่โต้แย้ง และนี่คือเหตุผลที่หมวดหมู่ของโมเดลตัดสินใจขนาดเล็กถือกำเนิดขึ้นมาเลย

ความหน่วง และเหตุใดช่องว่างของพารามิเตอร์จึงทำให้เข้าใจผิด

• โมเดลปริมาณงาน — Intern-Decision-0.8B: การส่งผ่านไปข้างหน้าหนึ่งครั้ง ไม่มีลูปถอดรหัส Gemma 4 12B: การสร้างแบบออโต้รีเกรสซีฟ ครั้งละหนึ่งโทเคน

• เวลาแฝงที่วัดได้ — Intern-Decision-0.8B: ค่าเฉลี่ย 33.98 ms / p95 37.50 ms บน RTX 4090 เครื่องเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง ตามการวัดของ InternLM เอง Gemma 4 12B: ไม่มีตัวเลข single-pass ที่เทียบเคียงได้ เพราะไม่มี single-pass ให้วัด

• พื้นที่ใช้งาน — Intern-Decision-0.8B: พื้นที่จัดเก็บในรีโพซิทอรีประมาณ 1.73 GB, พารามิเตอร์ 852,985,920 ตัว กระจายอยู่บน language shard ขนาด 1.50 GB, vision shard ขนาด 176 MB และ projector ขนาด 25 MB. Gem 4 12B: เอกสารเปิดตัวของ Google ระบุว่าอยู่ที่ 16 GB ของ VRAM หรือหน่วยความจำแบบรวม

• ความแน่นอนของเอาต์พุต — Intern-Decision-0.8B: ใช้ argmax จากโลจิตของตัวเลือก ดังนั้นอินพุตเดียวกันจะให้ป้ายกำกับเดิมทุกครั้ง Gemma 4 12B: ใช้การสุ่มตัวอย่าง เว้นแต่คุณจะตั้งอุณหภูมิให้เป็นศูนย์ และแม้ในกรณีนั้น ป้ายกำกับก็ยังมาในรูปข้อความที่คุณต้องแยกวิเคราะห์

ช่องว่างพารามิเตอร์ 14 เท่าระหว่างสองโมเดลนี้ไม่ได้แปลเป็นช่องว่างเวลาใช้งาน 14 เท่าในงานตัดสินใจ เพราะลักษณะงานแตกต่างกันโดยพื้นฐาน Intern-Decision-0.8B ใช้รอบเดียวในการอ่านพรอมป์ต์ — สถานะ สคีมา คำอธิบายตัวเลือก — แล้วก็หยุด Gemma 4 12B ใช้การอ่านพรอมป์ต์เดียวกันนั้นแล้วเพิ่มโทเค็นทุกตัวของคำตอบเข้าไปด้านบน สำหรับสคีมา 16 ฟิลด์ที่มีป้ายตัวเลือกแบบบรรยาย ขั้นตอนการสร้างไม่ใช่ความคลาดเคลื่อนเล็กน้อย แต่เป็นเวลาส่วนใหญ่ที่ใช้จริง ตารางของ InternLM เองก็แสดงประเด็นนี้โดยบังเอิญ: โมเดลพี่น้องขนาด 2B ของมันทำค่าเฉลี่ยได้ 33.28 มิลลิวินาที เร็วกว่า 0.8B ที่ 33.98 มิลลิวินาทีเล็กน้อย เมื่อการประมวลผลพรอมป์ต์มีบทบาทหลัก จำนวนพารามิเตอร์ก็ไม่ใช่ตัวแปรสำคัญอีกต่อไปimg src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

ในจุดที่ Gemma 4 12B นั้นจัดอยู่ในอีกหมวดหมู่หนึ่งโดยสิ้นเชิง

การปล่อยให้สเปกชีตจบอยู่แค่กรอบโจทย์แบบงานตัดสินใจจะเป็นการไม่ซื่อสัตย์ เพราะนอกกรอบนั้น Gemma 4 12B ไม่ได้แค่ล้ำหน้า — มันกำลังเล่นกีฬาคนละชนิด

Intern-Decision-0.8B รับข้อความพร้อมกับรูปภาพได้สูงสุดแปดรูป และนั่นคือพื้นผิวอินพุตทั้งหมดของมัน เพดานอินพุตเริ่มต้นของมันคือ 8,192 โทเคน โดยจะปฏิเสธแทนที่จะตัดทอน ซึ่งต่ำกว่าค่าสูงสุด 262,144 ของ position embedding ที่ config ของมันโฆษณาไว้มาก — เพดานต่างหาก ไม่ใช่สถาปัตยกรรม ที่เป็นหน้าต่างใช้งานจริง Gemma 4 12B รับข้อความ รูปภาพ เสียง และวิดีโอได้โดยตรงผ่านการออกแบบที่ไม่มี encoder ซึ่งฉาย raw patches และ waveforms เข้าสู่ปริภูมิ embedding โดยตรง มีหน้าต่างบริบท 256K และส่งคืนข้อความ การ์ดที่เผยแพร่ของ Google ให้คะแนนมันที่ 77.2% บน MMLU Pro, 77.5% บน AIME 2026 โดยไม่ใช้เครื่องมือ, 72.0% บน LiveCodeBench v6, 78.8% บน GPQA Diamond, 69.1% บน MMMU Pro และ 79.7% บน MATH-Vision นั่นเป็นตัวเลขจากผู้ขายจากการ์ดประเมินของ Google เอง และต่างจากตารางของ Intern-Decision-0.8B ตรงที่ตัวเลขเหล่านั้นมีการใช้งานโดยบุคคลที่สามมาหนึ่งปีรองรับอยู่ เพราะ Gemma 4 เปิดตัวเข้าสู่ระบบนิเวศ — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — ตั้งแต่วันแรก

การเปิดตัวทั้งสองครั้งก็ดูไม่เหมือนกันเลยแม้แต่น้อย และความต่างนี้ก็ให้แง่คิด Gemma 4 12B มีบล็อกประกาศเปิดตัว รายงานทางเทคนิคบน arXiv หน้าตระกูลโมเดลห้าตัว การ์ดประเมิน และลิงก์ดาวน์โหลดในวันที่มันเปิดตัว Intern-Decision-0.8B มีการ์ดโมเดลที่มี URL GitHub ซึ่งคืนค่า 404 และเดโม Space ที่คืนค่า 401 และมันเปิดตัวภายในสี่สิบวินาทีจากพี่ใหญ่สองตัวที่ไม่มีเอกสารประกอบพอ ๆ กัน หนึ่งในนั้นคือผลิตภัณฑ์ อีกอันคือเช็กพอยต์ที่ใครบางคนตัดสินใจเอาไปปล่อยบนอินเทอร์เน็ต

ทั้งคู่เป็น Apache 2.0 และนั่นไม่ใช่แถวที่ใช้ร่วมกันแบบไม่สำคัญ

มิติเดียวที่ทั้งสองมาบรรจบกันอย่างแท้จริงคือเรื่องสัญญาอนุญาต และเรื่องนี้คุ้มค่าที่จะเขียนถึงสักหนึ่งย่อหน้า เพราะนี่คือจุดที่การตัดสินใจเปลี่ยนไปสำหรับผู้ใช้เชิงพาณิชย์ ทั้งคู่เป็น Apache 2.0 โดย Gemma 4 12B เผยแพร่ภายใต้ข้อกำหนดสัญญาอนุญาต Gemma 4 ที่โฮสต์อยู่บน Google ซึ่งโมเดลการ์ดระบุว่าเป็น Apache 2.0 ส่วน Intern-Decision-0.8B มี Apache-2.0 ควบคู่ไปกับไฟล์ที่สอง LICENSE-QWEN/ ซึ่งเป็นการจัดการที่ถูกต้องสำหรับโมเดลที่ต่อยอดมาจากน้ำหนักของ Qwen และเป็นสัญญาณว่า InternLM ทำเอกสารครบถ้วนแม้กระทั่งกับรุ่นที่มันไม่ได้ประกาศเปิดตัว

นั่นทำให้ทั้งสองแตกต่างจากตระกูล LFM2.5 ของ Liquid AI ซึ่ง LFM Open License v1.0 กำหนดเงื่อนไขสิทธิ์เชิงพาณิชย์โดยขึ้นอยู่กับว่านิติบุคคลของคุณยังคงมีรายได้ต่อปีต่ำกว่าเกณฑ์ 10 ล้านดอลลาร์ — เป็นข้อจำกัดจริงที่ผู้ซื้อแบบจำลองเพื่อการตัดสินใจซึ่งกำลังเปรียบเทียบตัวเลือกควรอ่านก่อนที่จะสันนิษฐานว่า "open weights" หมายถึงสิ่งเดียวกันในทุกที่ หากกรณีการใช้งานของคุณเป็นเชิงพาณิชย์และรายได้ของคุณผ่านเกณฑ์นั้น Apache 2.0 กับสัญญาอนุญาต LFM ไม่สามารถใช้แทนกันได้ และทั้ง Gemma 4 12B และ Intern-Decision-0.8B ต่างก็ไม่มีข้อจำกัดดังกล่าว

บัญชีแยกประเภทที่ซื่อสัตย์เกี่ยวกับตัวเลขของ Intern-Decision-0.8B

ตัวเลขประสิทธิภาพทุกตัวของ Intern-Decision-0.8B ล้วนเป็นข้อมูลที่ผู้ผลิตอ้างเองและยังไม่มีการทำซ้ำ นั่นไม่ใช่แค่เรื่องพิธีการ — นั่นคือสถานะของหลักฐานในปัจจุบัน และมันควรเป็นตัวกำหนดว่าน้ำหนักของตารางนี้ควรมีมากน้อยเพียงใด InternLM เป็นผู้เลือกเกณฑ์มาตรฐาน เลือกคู่แข่ง ดำเนินการประเมิน และเผยแพร่ผลลัพธ์ และไม่มีการรันโดยอิสระใด ๆ บนกระดานผู้นำสาธารณะใดเลย การค้นหา Artificial Analysis สำหรับโมเดลนี้ไม่ให้ผลลัพธ์ใด ๆ ทั้งสิ้น img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

เมื่อมีป้ายกำกับนั้นติดอยู่ รูปร่างของผลลัพธ์ก็ยังคงให้ข้อมูลที่เป็นประโยชน์อยู่ดี รุ่น 0.8B ทำได้ 77.35 บนแบบทดสอบ Typed Decision ของ TypeSafe เทียบกับ 73.35 ของ Jev 1.13 — โมเดลที่แบบทดสอบนี้ตั้งชื่อตาม — และ 94.52 บน ToolACE เทียบกับ 91.29 โดยเฉลี่ยอยู่ที่ 79.38 ทั้งชุด โดยรุ่นพี่น้อง 2B และ 4B ของมันเองอยู่ที่ 84.68 และ 90.02 คอลัมน์ที่ควรทำให้ผู้ซื้อชะงักคือ WildJailBreak ซึ่งมันได้ 64.48 เทียบกับ 96.29 ของ Jev: ช่องว่างด้านความทนทานต่อการปฏิเสธขนาดนั้นเป็นคุณสมบัติของการ fine-tune และไม่มีการบันทึกไว้ที่ใดเลยว่ามันมาจากฐาน Qwen3.5-0.8B มาจากวัตถุประสงค์ของการปรับแต่งด้านการตัดสินใจ หรือมาจากจำนวนพารามิเตอร์ โปรไฟล์การคาลิเบรตของมันเป็นสิ่งที่อ่านได้น่าสนใจกว่า — ค่า Brier 0.530 และค่าความคลาดเคลื่อนการคาลิเบรตที่คาดหวัง 0.066 เทียบกับ 0.358 และ 0.095 ของ Jev — หมายความว่าโดยรวมมันแม่นยำน้อยกว่า แต่ค่าความมั่นใจที่มันระบุนั้นสอดคล้องกับความแม่นยำของมันมากกว่า สำหรับเวิร์กโฟลว์ที่อิงตามเกณฑ์ตัดสิน ความแตกต่างนั้นสำคัญกว่าความแม่นยำดิบ และมันเป็นเรื่องประเภทที่ InternLM ไม่มีแรงจูงใจจะเผยแพร่

ในทางกลับกัน การ์ดประเมินของ Gemma 4 12B ก็เป็นข้อมูลที่ผู้ขายรายงานเช่นกัน — Google ก็เป็นผู้รันเบนช์มาร์กเหล่านั้น — แต่โมเดลนี้อยู่ในโลกมาตั้งแต่เดือนมิถุนายน ถูกนำไปใช้งานผ่านรันไทม์ท้องถิ่นรายใหญ่ทุกตัว และความคลาดเคลื่อนใด ๆ คงจะปรากฏขึ้นแล้ว ช่องว่างเชิงหลักฐานระหว่าง “ยังทำซ้ำไม่ได้เป็นเวลาหนึ่งสัปดาห์” กับ “ยังทำซ้ำไม่ได้เป็นเวลาสี่เดือนและไม่มีใครโต้แย้งมัน” คือความแตกต่างที่แท้จริงระหว่างสองคอลัมน์นี้

คุณจะรวมพวกมันเข้าด้วยกันจริง ๆ ได้อย่างไร

รูปแบบที่สมเหตุสมผลไม่ใช่เรื่องของทางเลือก หัวตัดสินใจ (decision head) รับผิดชอบการเรียกแบบมีโครงสร้าง — การจัดเส้นทาง การคัดแยก การจำแนกประเภท การให้คะแนนตามเกณฑ์ — ซึ่งชุดคำตอบเป็นแบบปิด ความหน่วงมีความสำคัญ และโทเค็นเอาต์พุตเป็นภาระส่วนเกินล้วน ๆ ส่วนโมเดลอเนกประสงค์ (generalist) รับผิดชอบทุกอย่างที่ต้องใช้ร้อยเรียง โค้ด การสังเคราะห์ หรือบริบทขนาดยาว: สรุปการส่งต่อ คำอธิบายว่าทำไมตั๋วจึงไปที่ฝ่ายเรียกเก็บเงิน ฉบับร่างที่มนุษย์แก้ไข

ถ้าคุณกำลังพยายามหาว่าเส้นแบ่งอยู่ตรงไหน การทดลองที่ประหยัดที่สุดคือการวางทั้งสองครึ่งไว้หลัง endpoint เดียว OrcaRouter เส้นทางให้โมเดลกว่า 200+ ตัวผ่าน API เดียวที่เข้ากันได้กับ OpenAI พร้อมการสลับไปใช้ตัวสำรองอัตโนมัติ และราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกกำไรซึ่งหมายความว่าการทดสอบโมเดลตัดสินใจแบบโฮสต์กับโมเดลอเนกประสงค์แบบโฮสต์ในสคริปต์เดียวกันใช้แค่คีย์เดียวและเวลาบ่ายเดียว คุ้มที่จะพูดให้ชัดเจนเกี่ยวกับเส้นแบ่งหนึ่งตรงนี้: Intern-Decision-0.8B ไม่ใช่ของเรา — มันเป็น checkpoint แบบ Apache-2.0 ที่คุณดาวน์โหลดและรันเอง และเหตุผลทั้งหมดที่ต้องเลือกโมเดลขนาด 1.73 GB ก็คือมันอยู่ตรงที่ข้อมูลของคุณอยู่แล้ว ครึ่งที่เป็นเชิงสร้างสรรค์ของแพตเทิร์นคือส่วนที่ห่างออกไปเพียงหนึ่งบรรทัด ส่วน Gemma 4 12B โดยเฉพาะนั้นก็ไม่อยู่ในแคตตาล็อกของเราเช่นกัน; ขนาดของ Gemma 4 ที่เราให้บริการคือ 31B และ 26B A4B และตัว 12B เป็นการดาวน์โหลดแบบโลคัล img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

คำตัดสินจึงไม่ใช่ผู้ชนะ Intern-Decision-0.8B เป็นหัวให้คะแนนแบบดีเทอร์มินิสติกที่ถูกและเร็วจากแล็บที่ยังไม่ได้อธิบายมัน พร้อมตาราง benchmark ที่ยังไม่มีใครทำซ้ำ และคอลัมน์ความทนทานต่อการปฏิเสธที่ควรถูกทดสอบก่อนมันจะเข้าใกล้ข้อมูลนำเข้าที่ไม่น่าเชื่อถือ Gemma 4 12B เป็นโมเดลอเนกประสงค์แบบมัลติโมดัล open-weights ที่เติบโตเต็มที่แล้ว มี model card ที่เผยแพร่ มีรายงานทางเทคนิค และมีพารามิเตอร์มากกว่า 14 เท่า และมันเป็นเครื่องมือที่ผิดสำหรับการเรียกจำแนกประเภท 16 ฟิลด์ — ไม่ใช่เพราะมันแย่กว่า แต่เพราะการสร้างคำตอบให้คำถามที่คุณเขียนชุดคำตอบไว้เองแล้วนั้น เป็นวิธีที่แพงในการได้ป้ายกำกับ

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube