
AREX-2 กับ Gemma 4 12B: หนึ่งในนี้คือโมเดล
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 507 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 194 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
A comparison between Gemma 4 12B and AREX-2 has a property no other matchup on this blog has: one of the two columns is empty because the model on that side does not exist yet. Gemma 4 12B is a shipped artifact — Google DeepMind published it on June 3, 2026 as an 11.95-billion-parameter dense open-weights model under Apache 2.0, with a full model card, a 256K-token context window, native audio and image input, and three and a half months of independent testing behind it. AREX-2 is a Hugging Face repository that BAAI created on September 29, 2026 at 17:56 UTC and has not yet put anything into: no weights, no card, no licence tag, no evaluation, no announcement.
ความไม่สมมาตรนั้นไม่ใช่เหตุผลที่จะข้ามการเปรียบเทียบไป มันคือการเปรียบเทียบนั่นเอง คำถามที่คุ้มค่าจะตอบไม่ใช่ว่าอันไหนในสองสิ่งนี้ดีกว่า — ไม่มีอะไรตอบได้จนกว่า AREX-2 จะมีไฟล์อยู่ในนั้น — แต่คือว่าเอเจนต์วิจัย BAAI รุ่นที่สองจะลงมาแข่งขันกับโมเดล edge ขนาด 12B ตั้งแต่แรกเลยหรือไม่ หรือว่าสองสิ่งนี้อยู่ในตำแหน่งคนละจุดของสแต็กที่ไม่เคยแตะกันเลย การเข้าใจผิดในข้อนั้นคือความผิดพลาดที่แพง เพราะมันคือความผิดพลาดที่ทำให้ทีมจัดงบสำหรับสิ่งที่ผิด
ฝั่งที่จัดส่งแล้วในแบบของตัวเอง
Gemma 4 12B is the small member of Google's fourth-generation open family, and its defining design choice is architectural: it drops the separate vision encoder entirely and feeds raw image patches and audio waveforms straight into the transformer. That is not a benchmark trick. It is what makes the model genuinely portable — roughly 27 GB of BF16 weights that quantise below 7 GB, and a card that names 16 GB of VRAM as the deployment target. On a laptop or a single mid-range card, this is a model you can actually hold.
The capability profile follows from that. Google's own card — vendor-reported, and worth labelling as such — lists DocVQA 94.9 and InfoVQA 88.4 for document understanding, MMLU-Pro 77.2, GPQA Diamond 78.8, AIME 2026 77.5 and LiveCodeBench v6 72.0 in thinking mode. Artificial Analysis, which is independent, scores the reasoning configuration at an Intelligence Index of 14, measures it at 114 tokens per second, and prices a typical served call at $0.10 per million input tokens and $0.30 per million output. Our own catalogue entry for the larger Gemma 4 31B carries 85.7 on GPQA Diamond. The shape of that is a small generalist that is unusually strong on documents and images, reasonable on reasoning, and nowhere near a frontier model on hard multi-step work.
Its job description is therefore concrete: local or single-tenant inference, document and screenshot understanding, modest agentic loops, and anything where the data cannot leave the building. It is not a deep-research engine and Google does not sell it as one.

อีกด้านหนึ่ง ซึ่งเป็นชื่อและเวลาที่บันทึกไว้
ทุกสิ่งที่ยืนยันได้เกี่ยวกับ AREX-2 ในสัปดาห์นี้สรุปได้ในประโยคเดียว มันคือรีโพซิทอรีภายใต้องค์กร BAAI บน Hugging Face สร้างขึ้นเมื่อวันที่ 29 กันยายน 2026 บรรจุไฟล์ .gitattributes และไม่มีอะไรอื่นเลย — ข้อมูลโมเดลที่จัดเก็บเป็นศูนย์ไบต์ ไม่มีดาวน์โหลด ไม่มีการ์ดโมเดล ไม่มีการประกาศสัญญาอนุญาต ไม่มีการนำไปใช้งานโดยผู้ให้บริการ BAAI เองไม่ได้ประกาศอะไรเลย
สิ่งที่ทำให้มันน่าจดบันทึกคือตระกูลที่มันได้รับการตั้งชื่อตาม สาย AREX ของ BAAI เปิดตัวเมื่อวันที่ 23 กรกฎาคม 2026 พร้อมสองโมเดล: AREX-Base ซึ่งเป็น Mixture-of-Experts ขนาด 122 พันล้านพารามิเตอร์ที่มีพารามิเตอร์ที่ใช้งาน 10 พันล้านพารามิเตอร์ สร้างบน Qwen3.5-122B-A10B และ AREX-Turbo ซึ่งเป็น dense 4B ที่สร้างบน Qwen3.5-4B ทั้งสองเป็น Apache 2.0 ทั้งสองไม่ใช่โมเดลแชท แต่เป็นเอเจนต์วิจัยเชิงลึก — ลูปภายในที่รวบรวมหลักฐานและสร้างคำตอบที่เป็นตัวเลือกพร้อมค่าความเชื่อมั่น และลูปภายนอกที่ตรวจสอบคำตอบนั้นกับข้อจำกัดเดิม และสามารถปรับปรุงหรือเริ่มเส้นทางทั้งหมดใหม่ได้ จากตัวเลขที่ BAAI เผยแพร่ AREX-Base ทำได้ 82.5 บน BrowseComp, 85.4 บน GAIA และ 89.9 บน DeepSearch QA; AREX-Turbo ทำได้ 70.7, 81.6 และ 78.5 บนสามรายการเดียวกัน
ตัวเลขทั้งหมดนั้นเป็นของผู้ขายเอง และไม่มีตัวเลขใดที่ถูกทำซ้ำโดยอิสระเลย อีกทั้งยังเป็นตัวเลขของโมเดลอื่นด้วย AREX-2 ไม่มีตัวเลขดังกล่าว และคำว่า “2” ก็ไม่ได้บอกอะไรเกี่ยวกับขนาด แบ็กโบน หรือสถาปัตยกรรมเลย — รุ่นที่สองในสายนี้อาจเป็นเอเจนต์ที่ใหญ่กว่า ดิสทิลเลชันที่เล็กกว่า หรือเฟรมเวิร์กที่เทรนใหม่โดยสลับแบ็กโบนออกก็ได้
สองอันนี้มันเจอกันด้วยเหรอ
ตรงนี้แหละที่การเปรียบเทียบมีประโยชน์กว่าที่เห็น ลองพิจารณาการตีความที่เป็นไปได้สองแบบของสิ่งที่ AREX-2 กลายเป็น
ถ้ามันเป็นเอเจนต์วิจัยรุ่นที่สองที่มีขนาดใกล้เคียงกับ Base มันกับ Gemma 4 12B ก็ไม่มีวันแข่งกัน 122B แบบ mixture-of-experts ที่ขับเคลื่อนการค้นหาจากหลายแหล่งคือบริการที่โฮสต์ให้ คิดค่าบริการรายโทเคน และผูกกับเครือข่าย ส่วน Gemma 4 12B คือเช็กพอยต์ที่คุณดาวน์โหลดไปรันเอง การตัดสินใจเลือกระหว่างสองสิ่งนี้ไม่ใช่การเปรียบเทียบคุณภาพ แต่เป็นการตัดสินใจว่าภาระงานของคุณเป็นวงจรวิจัยหรือปลายทางการทำ inference
ถ้า AREX-2 ออกมาเป็นรุ่นระดับเล็ก — ผู้สืบทอดของ 4B Turbo ไม่ใช่ 122B Base — ทั้งสองก็อยู่ในชั้นเดียวกันจริง ๆ และการเปรียบเทียบก็จะเป็นการเปรียบเทียบที่มีความหมายจริง AREX-2 เวอร์ชันนั้นจะมีจำนวนพารามิเตอร์ประมาณหนึ่งในสามของ Gemma 4 12B เชี่ยวชาญด้านการค้นหาที่ขับเคลื่อนด้วยเครื่องมือมากกว่าความกว้างแบบมัลติโมดัล และจะถูกวัดผลบน BrowseComp กับ GAIA แทนที่จะเป็น DocVQA โมเดลเล็กสองตัว ตัวหนึ่งปรับให้เหมาะกับการรักษาเส้นทางการวิจัยที่ยาวนาน อีกตัวปรับให้เหมาะกับการมองเห็นและการอ่านบนฮาร์ดแวร์ระดับกลาง ทีมที่สร้างไปป์ไลน์เอกสารไม่ควรสนใจตัวแรก ส่วนทีมที่สร้างเอเจนต์วิจัยไม่ควรสนใจตัวหลัง
• สิ่งที่มีอยู่ — Gemma 4 12B ดาวน์โหลดได้แล้ววันนี้พร้อมการ์ดแบบเต็ม ส่วน AREX-2 เป็นรีโพซิทอรีที่ไม่มีไฟล์ใด ๆ อยู่ในนั้น
• พารามิเตอร์ — 11.95B แบบ dense สำหรับ Gemma 4 12B ไม่ได้ระบุไว้ และสามารถอนุมานได้จากชื่อผลิตภัณฑ์เท่านั้น สำหรับ AREX-2
• บริบท — 256K โทเค็น (262,144 ตำแหน่ง) สำหรับ Gemma 4 12B ไม่ทราบสำหรับ AREX-2
• Modality — ข้อความ รูปภาพ และเสียงขาเข้า สำหรับ Gemma 4 12B ไม่ทราบสำหรับ AREX-2; AREX รุ่นแรกเป็นข้อความบวกการใช้เครื่องมือ
• สัญญาอนุญาต — Apache 2.0 สำหรับ Gemma 4 12B ซึ่งระบุไว้บนการ์ด ไม่ได้ระบุสำหรับ AREX-2; AREX-Base และ AREX-Turbo เป็น Apache 2.0
• มีไว้เพื่ออะไร — การอนุมานแบบหลายรูปแบบที่นำไปใช้งานได้บนฮาร์ดแวร์ของคุณเอง เทียบกับ เมื่อพิจารณาจากหลักฐานของตระกูลนี้ การค้นหาและการรวบรวมหลักฐานในระยะยาวกับปลายทางที่โฮสต์ไว้

ส่วนที่เปรียบเทียบได้จริง: ที่ที่แต่ละอันรัน
เนื่องจากไม่มีการเปรียบเทียบขีดความสามารถให้ใช้ การเปรียบเทียบการติดตั้งใช้งานจึงเป็นสิ่งที่ตรงไปตรงมาที่สุดที่ควรทำ และมันไม่ได้ใกล้เคียงกันเลย
Gemma 4 12B ทำงานในที่ที่คุณวางมันไว้ ไม่มีตารางราคา ไม่มีมาตรวัดต่อโทเคน และไม่มีผู้ให้บริการคั่นกลางระหว่างคุณกับโมเดล — ต้นทุนคือฮาร์ดแวร์กับไฟฟ้า และโหมดความล้มเหลวคือการวางแผนกำลังความสามารถของคุณเอง ในทางตรงกันข้าม เมื่อ AREX-Base เปิดตัวในเดือนกรกฎาคม มันเป็นโมเดลผสมผู้เชี่ยวชาญ (mixture-of-experts) ขนาด 122B ซึ่งเป็นโมเดลที่คุณให้บริการบนคลัสเตอร์หรือเช่าตามจำนวนโทเคน และ 4B Turbo ของตระกูลนี้เองก็มีอยู่ก็เพราะทางเลือกนั้นมีราคาที่ต้องจ่าย หากรุ่นที่สองมีรูปร่างแบบเดียวกัน เศรษฐศาสตร์ของ AREX-2 จะเป็นฟังก์ชันของจำนวนโทเคนที่ใช้ต่อหนึ่งคำค้น คูณด้วยจำนวนขั้นตอนการค้นหาที่วิถีหนึ่ง ๆ ดำเนินไป ซึ่งเป็นตัวเลขที่มากกว่ามากสำหรับเอเจนต์วิจัยเชิงลึกเมื่อเทียบกับโมเดลอ่านเอกสาร เพราะเอเจนต์จะอ่านบริบทที่ขยายขึ้นซ้ำใหม่ในทุก ๆ รอบการทำงาน
นั่นคือจุดที่เลเยอร์จัดเส้นทางเลิกเป็นเพียงนามธรรม และเริ่มกลายเป็นรายการในบิลค่าใช้จ่าย ถ้าคุณลงเอยด้วยการรันเอเจนต์สำหรับงานวิจัยกับโมเดลแบบโฮสต์ ขณะที่ยังเก็บ Gemma 4 12B ไว้ในเครื่องสำหรับงานเอกสาร ในกรณีทั่วไปนั่นก็คือการเชื่อมต่อสองอย่าง API เดียวที่วางอยู่หน้าโมเดลกว่า 200 ตัว — โดยส่งผ่านราคาตามรายการของผู้ให้บริการและไม่มีการบวกเพิ่มใด ๆ ดังนั้นเมื่อผู้ขายปรับราคา ก็มีผลในวันเดียวกัน — พวกมันกลายเป็นคีย์เดียว บิลเดียว และไคลเอนต์เดียว และกฎ failover ก็สามารถย้ายคำขอออกจากผู้ให้บริการที่กำลังมีช่วงเวลาที่แย่ได้ โดยที่ลูปเอเจนต์ของคุณไม่รู้ตัว วันนี้เราให้บริการจัดเส้นทางให้ Gemma 4 26B-A4B และ Gemma 4 31B เราไม่ได้จัดเส้นทางให้รุ่น 12B และไม่มีผลิตภัณฑ์ใดจากสาย AREX อยู่ในแคตตาล็อกของเราเช่นกัน ดังนั้นหากตัวใดตัวหนึ่งในนั้นคือโมเดลที่คุณต้องการ มันก็ต้องมาจากช่องทางการจัดจำหน่ายของผู้ขายเอง
สิ่งที่ต้องทำในสัปดาห์นี้
ถ้าคุณต้องการโมเดลมัลติโมดัลขนาดกะทัดรัดที่คุณรันเองได้ การตัดสินใจไม่เคยต้องรอ AREX-2 Gemma 4 12B ถูกส่งมอบแล้ว มีเอกสารประกอบ ได้รับการให้คะแนนอย่างอิสระ และพร้อมนำไปใช้งาน ส่วนคอลัมน์เปรียบเทียบอีกฝั่งว่างเปล่า อย่าซื้ออะไรโดยอาศัยชื่อที่จองไว้
หากคุณกำลังสร้างเอเจนต์วิจัยเชิงลึก และสาย AREX คือสิ่งที่คุณต้องการจริง ๆ สิ่งที่ต้องจับตาดูไม่ใช่ชื่อ แต่คือทรี: ว่ามี safetensors ปรากฏในรีโพซิทอรีนั้นหรือไม่ การ์ดระบุจำนวนพารามิเตอร์ว่าอย่างไร และแท็กสัญญาอนุญาตใดติดอยู่กับมัน เจเนอเรชันแรกเผยแพร่ภายใต้ Apache 2.0 และหากรุ่นที่สองก็เป็นเช่นนั้นด้วย คำถามจะกลายเป็นเรื่องโฮสติ้งมากกว่าเรื่องสัญญาอนุญาต จนกว่าจะถึงตอนนั้น AREX-Base คือโมเดล AREX ที่คุณรันได้จริง และมีให้ใช้งานมาตั้งแต่เดือนกรกฎาคม
สิ่งเดียวที่ควรพูดให้ตรง ๆ เกี่ยวกับการเปรียบเทียบที่บทความนี้บอกว่ากำลังพูดถึงก็คือ หน้า VS ที่ฝั่งหนึ่งเป็นคอมมิตในรีโพซิทอรี ส่วนอีกฝั่งเป็นโมเดลที่เปิดให้ใช้แล้ว ไม่ใช่การจับคู่แข่งขันกัน แต่เป็นกำหนดการ กำหนดการบอกว่า Gemma 4 12B พร้อมใช้งานตอนนี้ และ AREX-2 ยังไม่เปิดให้ใช้งานเลย
