
Intern-Decision-0.8B vs Gemma 4 12B: หัวให้คะแนนปะทะโมเดลอเนกประสงค์แบบมัลติโมดัล
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 592 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
วิธีที่ถูกที่สุดในการดูว่า Intern-Decision-0.8B คืออะไร — และไม่ใช่อะไร — คือการวางมันไว้ข้าง ๆ Gemma 4 12B แล้วสังเกตว่าการเปรียบเทียบนี้แทบจะทั้งหมดเกี่ยวข้องกับสิ่งที่แต่ละโมเดลทำกับเลเยอร์เอาต์พุตของมัน Gemma 4 12B โมเดลมัลติโมดัลแบบไม่มีเอนโคเดอร์ที่มีพารามิเตอร์ 1.195 หมื่นล้านของ DeepMind ซึ่งเปิดตัวเมื่อวันที่ 3 มิถุนายน 2026 ภายใต้ Apache 2.0 เป็นนักอเนกประสงค์เชิงสร้างสรรค์: คุณป้อนข้อความ รูปภาพ เสียง หรือวิดีโอให้มัน แล้วมันจะเขียนคำตอบออกมา ส่วน Intern-Decision-0.8B ซึ่ง InternLM อัปโหลดขึ้น Hugging Face อย่างเงียบ ๆ เมื่อวันที่ 26 กันยายน 2026 โดยไม่มีการประกาศใด ๆ เป็นโมเดลที่ผ่านการไฟน์ทูนจาก Qwen3.5-0.8B ที่เล็กกว่ามาก และไม่สร้างข้อความใด ๆ เลย — มันรับสถานะหนึ่ง สคีมาของคำถามที่มีชื่อกำกับ และรูปภาพไม่เกินแปดรูป แล้วคืนค่าการแจกแจงความน่าจะเป็นที่ปรับเทียบแล้วสำหรับแต่ละคำถามหลังจากการส่งผ่านไปข้างหน้าหนึ่งครั้ง ตัวหนึ่งเขียน อีกตัวให้คะแนน ทุกสิ่งด้านล่างนี้สืบเนื่องมาจากข้อเท็จจริงข้อนั้น
การจับคู่นี้จึงเป็นเรื่องแปลกหากจะวางกรอบให้เป็นการแข่งขัน และควรพูดให้ชัดก่อนจะถึงแถวสเปก: สองตัวนี้ไม่ใช่สิ่งที่ใช้แทนกันได้ และใครก็ตามที่กำลังเลือกระหว่างสองตัวนี้ ก็ตั้งโจทย์ผิดไปแล้วตั้งแต่แรก Gemma 4 12B ตอบคำถามว่า "คำตอบควรเป็นอะไร" ส่วน Intern-Decision-0.8B ตอบคำถามว่า "ในสิบหกตัวเลือกนี้คือตัวไหน และคุณมั่นใจแค่ไหน" — และตอบโดยไม่ต้องมีลูปตัวถอดรหัส ซึ่งเป็นจุดที่ความแตกต่างด้านความหน่วงและต้นทุนเกิดขึ้น ดังนั้นการเปรียบเทียบที่มีประโยชน์จึงเป็นเรื่องของวิธีที่คุณจะต่อแต่ละตัวเข้ากับเวิร์กโฟลว์เดียว ไม่ใช่เรื่องว่าตัวไหนชนะ
ความแตกต่างที่ใหญ่ที่สุดเพียงอย่างเดียวคือด้านเอาต์พุตของบิล
Gemma 4 12B ถูกคิดค่าบริการเหมือนโมเดลแบบสร้างทั่วไป: ทั้งโทเคนอินพุตและโทเคนเอาต์พุต เมื่อคุณขอให้มันสร้าง JSON ที่มีโครงสร้าง ทุกโทเคนเหล่านั้นจะถูกสร้าง ถูกสุ่ม และถูกคิดค่าบริการ และยิ่งสคีมาของคุณยาวและซ้อนกันมากเท่าไร ก็ยิ่งมีโทเคนเหล่านั้นมากขึ้นเท่านั้น นั่นไม่ใช่การวิจารณ์โมเดล — มันคือสิ่งที่ตัวถอดรหัสทำ — แต่มันคือรายการในบิลที่หัวตัดสินใจมีอยู่เพื่อกำจัดออกไป Intern-Decision-0.8B ไม่มีโทเคนเอาต์พุต การ์ดของมันระบุชัดเจนว่าทำไม: เส้นทางการอนุมานไม่เคยเรียก generate()/, โดยอ่านค่าลอจิตที่ตำแหน่งซึ่งอยู่ก่อนหน้าตรง ๆ ของแต่ละ <decision>/ เพลสโฮลเดอร์ในโครงร่างที่เรนเดอร์ไว้ล่วงหน้า และทำ softmax เฉพาะสัญลักษณ์ผู้สมัครที่ได้รับอนุญาตสำหรับฟิลด์นั้น ตัวนับการใช้งานที่ชื่อ output_tokens/ นับฟิลด์ที่ถูกให้คะแนน ไม่ใช่ข้อความ
ผลที่ตามมาจะทบต้นเมื่อ規模ขยายขึ้น ไปป์ไลน์ที่ติดป้ายระเบียนหนึ่งหมื่นรายการด้วย Gemma 4 12B ต้องจ่ายสำหรับเอกสาร JSON หนึ่งหมื่นฉบับ; ไปป์ไลน์เดียวกันที่ใช้ Intern-Decision-0.8B จ่ายเฉพาะพรอมป์ต์และไม่มีอย่างอื่น ว่าจำนวนสัมบูรณ์จะมากหรือไม่นั้นขึ้นอยู่กับปริมาณและสคีมาของคุณทั้งหมด และใครก็ตามที่มีงบประมาณต่อโทเคนสามารถคำนวณในสเปรดชีตได้ภายในสิบนาที แต่ทิศทางไม่เป็นที่โต้แย้ง และนี่คือเหตุผลที่หมวดหมู่ของโมเดลตัดสินใจขนาดเล็กถือกำเนิดขึ้นมาเลย
ความหน่วง และเหตุใดช่องว่างของพารามิเตอร์จึงทำให้เข้าใจผิด
• โมเดลปริมาณงาน — Intern-Decision-0.8B: การส่งผ่านไปข้างหน้าหนึ่งครั้ง ไม่มีลูปถอดรหัส Gemma 4 12B: การสร้างแบบออโต้รีเกรสซีฟ ครั้งละหนึ่งโทเคน
• เวลาแฝงที่วัดได้ — Intern-Decision-0.8B: ค่าเฉลี่ย 33.98 ms / p95 37.50 ms บน RTX 4090 เครื่องเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง ตามการวัดของ InternLM เอง Gemma 4 12B: ไม่มีตัวเลข single-pass ที่เทียบเคียงได้ เพราะไม่มี single-pass ให้วัด
• พื้นที่ใช้งาน — Intern-Decision-0.8B: พื้นที่จัดเก็บในรีโพซิทอรีประมาณ 1.73 GB, พารามิเตอร์ 852,985,920 ตัว กระจายอยู่บน language shard ขนาด 1.50 GB, vision shard ขนาด 176 MB และ projector ขนาด 25 MB. Gem 4 12B: เอกสารเปิดตัวของ Google ระบุว่าอยู่ที่ 16 GB ของ VRAM หรือหน่วยความจำแบบรวม
• ความแน่นอนของเอาต์พุต — Intern-Decision-0.8B: ใช้ argmax จากโลจิตของตัวเลือก ดังนั้นอินพุตเดียวกันจะให้ป้ายกำกับเดิมทุกครั้ง Gemma 4 12B: ใช้การสุ่มตัวอย่าง เว้นแต่คุณจะตั้งอุณหภูมิให้เป็นศูนย์ และแม้ในกรณีนั้น ป้ายกำกับก็ยังมาในรูปข้อความที่คุณต้องแยกวิเคราะห์
ช่องว่างพารามิเตอร์ 14 เท่าระหว่างสองโมเดลนี้ไม่ได้แปลเป็นช่องว่างเวลาใช้งาน 14 เท่าในงานตัดสินใจ เพราะลักษณะงานแตกต่างกันโดยพื้นฐาน Intern-Decision-0.8B ใช้รอบเดียวในการอ่านพรอมป์ต์ — สถานะ สคีมา คำอธิบายตัวเลือก — แล้วก็หยุด Gemma 4 12B ใช้การอ่านพรอมป์ต์เดียวกันนั้นแล้วเพิ่มโทเค็นทุกตัวของคำตอบเข้าไปด้านบน สำหรับสคีมา 16 ฟิลด์ที่มีป้ายตัวเลือกแบบบรรยาย ขั้นตอนการสร้างไม่ใช่ความคลาดเคลื่อนเล็กน้อย แต่เป็นเวลาส่วนใหญ่ที่ใช้จริง ตารางของ InternLM เองก็แสดงประเด็นนี้โดยบังเอิญ: โมเดลพี่น้องขนาด 2B ของมันทำค่าเฉลี่ยได้ 33.28 มิลลิวินาที เร็วกว่า 0.8B ที่ 33.98 มิลลิวินาทีเล็กน้อย เมื่อการประมวลผลพรอมป์ต์มีบทบาทหลัก จำนวนพารามิเตอร์ก็ไม่ใช่ตัวแปรสำคัญอีกต่อไปimg src="2.png">

ในจุดที่ Gemma 4 12B นั้นจัดอยู่ในอีกหมวดหมู่หนึ่งโดยสิ้นเชิง
การปล่อยให้สเปกชีตจบอยู่แค่กรอบโจทย์แบบงานตัดสินใจจะเป็นการไม่ซื่อสัตย์ เพราะนอกกรอบนั้น Gemma 4 12B ไม่ได้แค่ล้ำหน้า — มันกำลังเล่นกีฬาคนละชนิด
Intern-Decision-0.8B รับข้อความพร้อมกับรูปภาพได้สูงสุดแปดรูป และนั่นคือพื้นผิวอินพุตทั้งหมดของมัน เพดานอินพุตเริ่มต้นของมันคือ 8,192 โทเคน โดยจะปฏิเสธแทนที่จะตัดทอน ซึ่งต่ำกว่าค่าสูงสุด 262,144 ของ position embedding ที่ config ของมันโฆษณาไว้มาก — เพดานต่างหาก ไม่ใช่สถาปัตยกรรม ที่เป็นหน้าต่างใช้งานจริง Gemma 4 12B รับข้อความ รูปภาพ เสียง และวิดีโอได้โดยตรงผ่านการออกแบบที่ไม่มี encoder ซึ่งฉาย raw patches และ waveforms เข้าสู่ปริภูมิ embedding โดยตรง มีหน้าต่างบริบท 256K และส่งคืนข้อความ การ์ดที่เผยแพร่ของ Google ให้คะแนนมันที่ 77.2% บน MMLU Pro, 77.5% บน AIME 2026 โดยไม่ใช้เครื่องมือ, 72.0% บน LiveCodeBench v6, 78.8% บน GPQA Diamond, 69.1% บน MMMU Pro และ 79.7% บน MATH-Vision นั่นเป็นตัวเลขจากผู้ขายจากการ์ดประเมินของ Google เอง และต่างจากตารางของ Intern-Decision-0.8B ตรงที่ตัวเลขเหล่านั้นมีการใช้งานโดยบุคคลที่สามมาหนึ่งปีรองรับอยู่ เพราะ Gemma 4 เปิดตัวเข้าสู่ระบบนิเวศ — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — ตั้งแต่วันแรก
การเปิดตัวทั้งสองครั้งก็ดูไม่เหมือนกันเลยแม้แต่น้อย และความต่างนี้ก็ให้แง่คิด Gemma 4 12B มีบล็อกประกาศเปิดตัว รายงานทางเทคนิคบน arXiv หน้าตระกูลโมเดลห้าตัว การ์ดประเมิน และลิงก์ดาวน์โหลดในวันที่มันเปิดตัว Intern-Decision-0.8B มีการ์ดโมเดลที่มี URL GitHub ซึ่งคืนค่า 404 และเดโม Space ที่คืนค่า 401 และมันเปิดตัวภายในสี่สิบวินาทีจากพี่ใหญ่สองตัวที่ไม่มีเอกสารประกอบพอ ๆ กัน หนึ่งในนั้นคือผลิตภัณฑ์ อีกอันคือเช็กพอยต์ที่ใครบางคนตัดสินใจเอาไปปล่อยบนอินเทอร์เน็ต
ทั้งคู่เป็น Apache 2.0 และนั่นไม่ใช่แถวที่ใช้ร่วมกันแบบไม่สำคัญ
มิติเดียวที่ทั้งสองมาบรรจบกันอย่างแท้จริงคือเรื่องสัญญาอนุญาต และเรื่องนี้คุ้มค่าที่จะเขียนถึงสักหนึ่งย่อหน้า เพราะนี่คือจุดที่การตัดสินใจเปลี่ยนไปสำหรับผู้ใช้เชิงพาณิชย์ ทั้งคู่เป็น Apache 2.0 โดย Gemma 4 12B เผยแพร่ภายใต้ข้อกำหนดสัญญาอนุญาต Gemma 4 ที่โฮสต์อยู่บน Google ซึ่งโมเดลการ์ดระบุว่าเป็น Apache 2.0 ส่วน Intern-Decision-0.8B มี Apache-2.0 ควบคู่ไปกับไฟล์ที่สอง LICENSE-QWEN/ ซึ่งเป็นการจัดการที่ถูกต้องสำหรับโมเดลที่ต่อยอดมาจากน้ำหนักของ Qwen และเป็นสัญญาณว่า InternLM ทำเอกสารครบถ้วนแม้กระทั่งกับรุ่นที่มันไม่ได้ประกาศเปิดตัว
นั่นทำให้ทั้งสองแตกต่างจากตระกูล LFM2.5 ของ Liquid AI ซึ่ง LFM Open License v1.0 กำหนดเงื่อนไขสิทธิ์เชิงพาณิชย์โดยขึ้นอยู่กับว่านิติบุคคลของคุณยังคงมีรายได้ต่อปีต่ำกว่าเกณฑ์ 10 ล้านดอลลาร์ — เป็นข้อจำกัดจริงที่ผู้ซื้อแบบจำลองเพื่อการตัดสินใจซึ่งกำลังเปรียบเทียบตัวเลือกควรอ่านก่อนที่จะสันนิษฐานว่า "open weights" หมายถึงสิ่งเดียวกันในทุกที่ หากกรณีการใช้งานของคุณเป็นเชิงพาณิชย์และรายได้ของคุณผ่านเกณฑ์นั้น Apache 2.0 กับสัญญาอนุญาต LFM ไม่สามารถใช้แทนกันได้ และทั้ง Gemma 4 12B และ Intern-Decision-0.8B ต่างก็ไม่มีข้อจำกัดดังกล่าว
บัญชีแยกประเภทที่ซื่อสัตย์เกี่ยวกับตัวเลขของ Intern-Decision-0.8B
ตัวเลขประสิทธิภาพทุกตัวของ Intern-Decision-0.8B ล้วนเป็นข้อมูลที่ผู้ผลิตอ้างเองและยังไม่มีการทำซ้ำ นั่นไม่ใช่แค่เรื่องพิธีการ — นั่นคือสถานะของหลักฐานในปัจจุบัน และมันควรเป็นตัวกำหนดว่าน้ำหนักของตารางนี้ควรมีมากน้อยเพียงใด InternLM เป็นผู้เลือกเกณฑ์มาตรฐาน เลือกคู่แข่ง ดำเนินการประเมิน และเผยแพร่ผลลัพธ์ และไม่มีการรันโดยอิสระใด ๆ บนกระดานผู้นำสาธารณะใดเลย การค้นหา Artificial Analysis สำหรับโมเดลนี้ไม่ให้ผลลัพธ์ใด ๆ ทั้งสิ้น img src="3.png">

เมื่อมีป้ายกำกับนั้นติดอยู่ รูปร่างของผลลัพธ์ก็ยังคงให้ข้อมูลที่เป็นประโยชน์อยู่ดี รุ่น 0.8B ทำได้ 77.35 บนแบบทดสอบ Typed Decision ของ TypeSafe เทียบกับ 73.35 ของ Jev 1.13 — โมเดลที่แบบทดสอบนี้ตั้งชื่อตาม — และ 94.52 บน ToolACE เทียบกับ 91.29 โดยเฉลี่ยอยู่ที่ 79.38 ทั้งชุด โดยรุ่นพี่น้อง 2B และ 4B ของมันเองอยู่ที่ 84.68 และ 90.02 คอลัมน์ที่ควรทำให้ผู้ซื้อชะงักคือ WildJailBreak ซึ่งมันได้ 64.48 เทียบกับ 96.29 ของ Jev: ช่องว่างด้านความทนทานต่อการปฏิเสธขนาดนั้นเป็นคุณสมบัติของการ fine-tune และไม่มีการบันทึกไว้ที่ใดเลยว่ามันมาจากฐาน Qwen3.5-0.8B มาจากวัตถุประสงค์ของการปรับแต่งด้านการตัดสินใจ หรือมาจากจำนวนพารามิเตอร์ โปรไฟล์การคาลิเบรตของมันเป็นสิ่งที่อ่านได้น่าสนใจกว่า — ค่า Brier 0.530 และค่าความคลาดเคลื่อนการคาลิเบรตที่คาดหวัง 0.066 เทียบกับ 0.358 และ 0.095 ของ Jev — หมายความว่าโดยรวมมันแม่นยำน้อยกว่า แต่ค่าความมั่นใจที่มันระบุนั้นสอดคล้องกับความแม่นยำของมันมากกว่า สำหรับเวิร์กโฟลว์ที่อิงตามเกณฑ์ตัดสิน ความแตกต่างนั้นสำคัญกว่าความแม่นยำดิบ และมันเป็นเรื่องประเภทที่ InternLM ไม่มีแรงจูงใจจะเผยแพร่
ในทางกลับกัน การ์ดประเมินของ Gemma 4 12B ก็เป็นข้อมูลที่ผู้ขายรายงานเช่นกัน — Google ก็เป็นผู้รันเบนช์มาร์กเหล่านั้น — แต่โมเดลนี้อยู่ในโลกมาตั้งแต่เดือนมิถุนายน ถูกนำไปใช้งานผ่านรันไทม์ท้องถิ่นรายใหญ่ทุกตัว และความคลาดเคลื่อนใด ๆ คงจะปรากฏขึ้นแล้ว ช่องว่างเชิงหลักฐานระหว่าง “ยังทำซ้ำไม่ได้เป็นเวลาหนึ่งสัปดาห์” กับ “ยังทำซ้ำไม่ได้เป็นเวลาสี่เดือนและไม่มีใครโต้แย้งมัน” คือความแตกต่างที่แท้จริงระหว่างสองคอลัมน์นี้
คุณจะรวมพวกมันเข้าด้วยกันจริง ๆ ได้อย่างไร
รูปแบบที่สมเหตุสมผลไม่ใช่เรื่องของทางเลือก หัวตัดสินใจ (decision head) รับผิดชอบการเรียกแบบมีโครงสร้าง — การจัดเส้นทาง การคัดแยก การจำแนกประเภท การให้คะแนนตามเกณฑ์ — ซึ่งชุดคำตอบเป็นแบบปิด ความหน่วงมีความสำคัญ และโทเค็นเอาต์พุตเป็นภาระส่วนเกินล้วน ๆ ส่วนโมเดลอเนกประสงค์ (generalist) รับผิดชอบทุกอย่างที่ต้องใช้ร้อยเรียง โค้ด การสังเคราะห์ หรือบริบทขนาดยาว: สรุปการส่งต่อ คำอธิบายว่าทำไมตั๋วจึงไปที่ฝ่ายเรียกเก็บเงิน ฉบับร่างที่มนุษย์แก้ไข
ถ้าคุณกำลังพยายามหาว่าเส้นแบ่งอยู่ตรงไหน การทดลองที่ประหยัดที่สุดคือการวางทั้งสองครึ่งไว้หลัง endpoint เดียว OrcaRouter เส้นทางให้โมเดลกว่า 200+ ตัวผ่าน API เดียวที่เข้ากันได้กับ OpenAI พร้อมการสลับไปใช้ตัวสำรองอัตโนมัติ และราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกกำไรซึ่งหมายความว่าการทดสอบโมเดลตัดสินใจแบบโฮสต์กับโมเดลอเนกประสงค์แบบโฮสต์ในสคริปต์เดียวกันใช้แค่คีย์เดียวและเวลาบ่ายเดียว คุ้มที่จะพูดให้ชัดเจนเกี่ยวกับเส้นแบ่งหนึ่งตรงนี้: Intern-Decision-0.8B ไม่ใช่ของเรา — มันเป็น checkpoint แบบ Apache-2.0 ที่คุณดาวน์โหลดและรันเอง และเหตุผลทั้งหมดที่ต้องเลือกโมเดลขนาด 1.73 GB ก็คือมันอยู่ตรงที่ข้อมูลของคุณอยู่แล้ว ครึ่งที่เป็นเชิงสร้างสรรค์ของแพตเทิร์นคือส่วนที่ห่างออกไปเพียงหนึ่งบรรทัด ส่วน Gemma 4 12B โดยเฉพาะนั้นก็ไม่อยู่ในแคตตาล็อกของเราเช่นกัน; ขนาดของ Gemma 4 ที่เราให้บริการคือ 31B และ 26B A4B และตัว 12B เป็นการดาวน์โหลดแบบโลคัล img src="4.png">

คำตัดสินจึงไม่ใช่ผู้ชนะ Intern-Decision-0.8B เป็นหัวให้คะแนนแบบดีเทอร์มินิสติกที่ถูกและเร็วจากแล็บที่ยังไม่ได้อธิบายมัน พร้อมตาราง benchmark ที่ยังไม่มีใครทำซ้ำ และคอลัมน์ความทนทานต่อการปฏิเสธที่ควรถูกทดสอบก่อนมันจะเข้าใกล้ข้อมูลนำเข้าที่ไม่น่าเชื่อถือ Gemma 4 12B เป็นโมเดลอเนกประสงค์แบบมัลติโมดัล open-weights ที่เติบโตเต็มที่แล้ว มี model card ที่เผยแพร่ มีรายงานทางเทคนิค และมีพารามิเตอร์มากกว่า 14 เท่า และมันเป็นเครื่องมือที่ผิดสำหรับการเรียกจำแนกประเภท 16 ฟิลด์ — ไม่ใช่เพราะมันแย่กว่า แต่เพราะการสร้างคำตอบให้คำถามที่คุณเขียนชุดคำตอบไว้เองแล้วนั้น เป็นวิธีที่แพงในการได้ป้ายกำกับ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
