
AREX-2 vs LFM2.5 2.6B Base: รีโปเปล่าและเช็กพอยต์ที่ไม่มีคำแนะนำ
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 507 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 194 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
วาง AREX-2 ไว้ข้าง ๆ LFM2.5 2.6B Base แล้วสิ่งแรกที่ทั้งคู่มีร่วมกันคือ ทั้งคู่ไม่ใช่ผลิตภัณฑ์ที่คุณใช้ได้ในวันนี้ — ด้วยเหตุผลที่ไม่มีส่วนเกี่ยวข้องกันเลย AREX-2 เป็นที่เก็บบน Hugging Face ที่ BAAI สร้างเมื่อวันที่ 29 กันยายน 2026 เวลา 17:56 UTC โดยมีไฟล์ .gitattributes ซึ่งเก็บข้อมูลโมเดลเป็นศูนย์ไบต์ และไม่มีการ์ดโมเดล ไม่มีแท็กใบอนุญาต และไม่มีประกาศใด ๆ LFM2.5 2.6B Base ซึ่งเผยแพร่โดย Liquid AI ในเดือนสิงหาคม 2026 เป็นความไม่สมบูรณ์อีกประเภทหนึ่งที่ตรงกันข้าม: เช็กพอยต์แบบข้อความล้วนขนาด 2.69 พันล้านพารามิเตอร์ที่สมบูรณ์และดาวน์โหลดได้ ภายใต้ LFM Open License (lfm1.0) ที่ส่งมอบมาโดยเจตนาโดยไม่มีการปรับจูนตามคำสั่ง เพราะมันมีไว้ให้ปรับจูนละเอียดมากกว่าที่จะถูกถามคำถาม
หนึ่งคือการไม่มีอาร์ติแฟกต์ อีกอย่างคืออาร์ติแฟกต์ที่ขาดขั้นตอนที่มันไม่เคยควรจะมี สองสิ่งนั้นจะอยู่ในหมวดหมู่เดียวกันก็ต่อเมื่อคุณอ่านแบบผิวเผินเท่านั้น และการปฏิบัติต่อพวกมันเสมือนอยู่ในหมวดหมู่เดียวกันก็เป็นวิธีที่ทีมลงเอยด้วยการรอสิ่งที่ผิด การเปรียบเทียบที่มีประโยชน์ระหว่างสองสิ่งนี้ไม่ใช่ความสามารถ — เพราะไม่มี AREX-2 ให้วัด — แต่เป็นว่าสิ่งที่แต่ละอย่างเป็นวัตถุดิบ สำหรับอะไร และต้นทุนในการค้นหาว่ามันดีพอหรือไม่
ความแตกต่างเชิงประเภท ซึ่งกล่าวไว้ก่อนเป็นอันดับแรก
LFM2.5 2.6B Base เป็นสสาร มันคือเช็กพอยต์ที่ผ่านการฝึกมาก่อนของตระกูลไฮบริด LFM2.5 ของ Liquid AI: 30 เลเยอร์ โดย 22 เลเยอร์เป็นบล็อก short-convolution แบบ dual-gated และ 8 เลเยอร์เป็น grouped-query attention ฝึกบนโทเคนราว 34 ล้านล้านโทเคนใน 16 ภาษา ด้วยหน้าต่างบริบทขนาด 131,072 โทเคน และบิลด์แบบควอนไทซ์ที่อยู่ราว 1.67 GB ที่ Q4_K_M มันไม่มีการปรับแต่งด้วยคำสั่ง ป้อนคำถามให้มัน แล้วมันจะต่อข้อความ; มันไม่ตอบ การ์ดของ Liquid AI เองชี้ว่าการใช้งานที่ตั้งใจคือการ fine-tuning อย่างหนัก และมีโมเดลพี่น้องที่ผ่าน post-training สำหรับใครก็ตามที่ต้องการโมเดลที่ตอบสนองต่อพรอมป์ต์ มันเป็นซับสเตรต และการที่มันได้คะแนนแย่บนเบนช์มาร์กการทำตามพรอมป์ต์ไม่ใช่ข้อบกพร่อง — นั่นคือคำนิยามของสิ่งนี้เอง
AREX-2 ไม่ใช่สารหรือผลิตภัณฑ์ แต่เป็นเนมสเปซ ข้อเท็จจริงเท่าที่มีอยู่มีเพียงองค์กร (BAAI) เวลาที่สร้าง (29 กันยายน 2026) และชื่อเท่านั้น ยังไม่มีการอัปโหลดสิ่งใด และยังไม่มีการกล่าวสิ่งใดเลย ชื่อนี้เองอยู่ในตระกูลที่มีอยู่จริง: เมื่อวันที่ 23 กรกฎาคม 2026 BAAI ได้เปิดตัว AREX-Base ซึ่งเป็น mixture-of-experts ขนาด 122 พันล้านพารามิเตอร์ ที่มีพารามิเตอร์ใช้งาน 10 พันล้านพารามิเตอร์ สร้างบน Qwen3.5-122B-A10B และ AREX-Turbo ซึ่งเป็น dense 4B ที่สร้างบน Qwen3.5-4B — ทั้งคู่เป็น Apache 2.0 ทั้งคู่เป็นเอเจนต์วิจัยเชิงลึกที่มีการออกแบบแบบสองลูป ซึ่งรวบรวมหลักฐาน สร้างคำตอบCandidateพร้อมค่าความเชื่อมั่น แล้วตรวจสอบคำตอบนั้นเทียบกับข้อจำกัดเดิม และปรับปรุงหรือเริ่มต้นใหม่ ตัวเลขที่เผยแพร่ของมัน ซึ่งรายงานโดยผู้ขายและไม่ได้รับการทำซ้ำอย่างอิสระ อยู่ที่ 82.5 บน BrowseComp และ 85.4 บน GAIA สำหรับ Base และ 70.7 / 81.6 สำหรับ Turbo
• ความพร้อมใช้งาน — LFM2.5 2.6B Base ดาวน์โหลดได้แล้ว ส่วน AREX-2 ไม่มีไฟล์ในรีโพซิทอรีของตัวเอง
• ขนาด — พารามิเตอร์แบบ dense จำนวน 2.69B สำหรับโมเดล Liquid ซึ่งมองเห็นได้ทั้งหมดในเช็กพอยต์ ยังไม่ทราบสำหรับ AREX-2; ตระกูลนี้ครอบคลุมตั้งแต่ MoE ขนาด 122B ไปจนถึงแบบ dense 4B ดังนั้น "2" จึงทำนายอะไรไม่ได้
• บริบท — 131,072 โทเค็นสำหรับ LFM2.5 2.6B Base ยังไม่มีข้อมูลเผยแพร่สำหรับ AREX-2
• สัญญาอนุญาต — LFM Open License v1.0 ฟรีสำหรับรายได้ต่อปีต่ำกว่า $10M และต้องมีสัญญาอนุญาตแยกต่างหากเมื่ออยู่ที่ระดับนั้นขึ้นไป ยังไม่มีแท็กสัญญาอนุญาตบน AREX-2; AREX รุ่นแรกใช้ Apache 2.0
• มันคืออะไร — สับสเตรตสำหรับการไฟน์ทูน เมื่อเทียบกับ—ถ้าจะยึดตระกูลนี้เป็นเกณฑ์—เอเจนต์แบบโฮสต์ซึ่งคุณค่าของมันอยู่ที่วงจรค้นหาและตรวจสอบ มากกว่าที่จะอยู่ที่ค่าน้ำหนักของมัน

สกอร์การ์ดเปล่าที่มีความหมายตรงกันข้าม
ทั้งสองโมเดลไม่มีเบนช์มาร์กที่คุณควรใช้เป็นเกณฑ์ในการวางแผน และเหตุผลก็แตกต่างกันโดยสิ้นเชิง
Liquid AI ไม่ได้ปิดบังอะไรด้วยการปล่อย Base ไว้โดยไม่ให้คะแนน การให้คะแนนเช็กพอยต์ที่ผ่านการฝึกมาก่อนบน benchmark ด้านการทำตามคำสั่งจะวัดการไม่มี fine-tuning ไม่ใช่คุณภาพของ substrate ซึ่งเป็นเหตุผลที่บริษัททำ benchmark กับพี่น้องที่ผ่านการฝึกหลังและปล่อย Base ไว้โดยไม่ประเมิน ช่องว่างนั้นตรวจสอบได้จากฝั่งของคุณ และนั่นคือประเด็นทั้งหมด: คุณสามารถดาวน์โหลด 1.67 GB รันการประเมินของคุณเองบนงานของคุณเอง และรู้คำตอบก่อนที่คุณจะใช้จ่ายอะไรกับการให้บริการ
ช่องว่างของ AREX-2 ไม่ใช่การตัดสินใจเชิงการออกแบบ แต่เป็นสิ่งที่ยังไม่เกิดขึ้น ยังไม่มีอะไรให้ดาวน์โหลด จึงไม่มีอะไรให้ทดสอบ และไม่มีการประเมินใดที่คุณจะรันได้ในสัปดาห์นี้ที่จะบอกอะไรคุณเกี่ยวกับมันได้ ใครก็ตามที่เผยแพร่ตัวเลข benchmark ของ AREX-2 ในสองสามวันข้างหน้ากำลังเผยแพร่สิ่งที่พวกเขาไม่สามารถวัดได้

คำถามเกี่ยวกับการปรับละเอียดสองข้อที่แตกต่างกัน
เนื่องจากทั้งสองสิ่งนี้เป็นจุดเริ่มต้นมากกว่าที่จะเป็นบริการที่เสร็จสมบูรณ์ จึงควรระบุให้ชัดเจนว่าแต่ละอย่างจะเป็นจุดเริ่มต้นสำหรับสิ่งใด เพราะนั่นคือจุดที่ทั้งสองเริ่มแตกต่างกันอย่างแท้จริง
เช็คพอยต์ไฮบริดขนาด 2.69B เป็นเครื่องมือสำหรับสร้างโมเดลเฉพาะทางขนาดเล็กและราคาถูก การใช้งานที่น่าสนใจคือแบบที่ไม่หวือหวา: ตัวจำแนกประเภทที่อ่านชนิดเอกสารในเวิร์กโฟลว์ที่มีการควบคุม โมเดลสกัดข้อมูลที่เปลี่ยนฟอร์มให้เป็น JSON ที่มีโครงสร้าง ตัวเขียนใหม่เฉพาะโดเมนที่รันบนการ์ดเดียวใกล้กับข้อมูล คุณค่ามาจากข้อเท็จจริงที่ว่าคุณเป็นเจ้าของชิ้นงานหลังจากนั้น และต้นทุนส่วนเพิ่มต่อการเรียกใช้คือค่าไฟฟ้า ลูปการฝึกคือตัวงาน และเป็นงานที่คุณเริ่มได้วันนี้
AREX-2 ชี้ไปในทิศทางตรงกันข้าม ครอบครัว AREX ไม่ได้ถูกออกแบบมาเพื่อปรับจูนละเอียดให้เป็นผลิตภัณฑ์ แต่ถูกออกแบบมาเพื่อ ถูกเรียก เป็นเอเจนต์ที่ดำเนินการค้นหา รวบรวมหลักฐาน และตรวจสอบคำตอบของตนเองกับข้อจำกัด หากรุ่นที่สองยังคงทำเช่นนั้น สิ่งที่คุณจะประเมินคือเส้นทาง — ใช้กี่ขั้นตอน ไม่ว่ามันจะสังเกตเห็นความขัดแย้งหรือไม่ ไม่ว่าค่าความมั่นใจในคำตอบที่เป็นไปได้ของมันจะมีความหมายอะไร นั่นไม่ใช่คำถามเรื่องการปรับจูนละเอียดและไม่ใช่คำถามเรื่องน้ำหนัก มันเป็นคำถามเรื่องการให้บริการ และมันเริ่มต้นจากการที่ใครสักคนเผยแพร่น้ำหนักและการ์ด
สิ่งเหล่านี้ไม่ใช่ตัวแทนทดแทนไม่ว่าจะขนาดใดก็ตาม ทีมที่ต้องการโมเดลที่ตนเป็นเจ้าของและฝึกใหม่ได้ไม่ได้รอ AREX-2 อยู่ ทีมที่ต้องการเอเจนต์สำหรับงานวิจัยก็จะไม่ปรับจูนไฮบริดขนาด 2.6B ให้กลายเป็นเอเจนต์แบบนั้น
ตำแหน่งที่ชั้นการกำหนดเส้นทางลงตัว สำหรับแต่ละรายการ
ความแตกต่างในทางปฏิบัติระหว่างสองสิ่งนี้จะปรากฏให้เห็นทันทีที่โมเดลถูกนำเข้าสู่แอปพลิเคชัน เพราะทั้งสองมีความสัมพันธ์กับโฮสติ้งที่ตรงกันข้ามกัน
LFM2.5 2.6B Base ไม่ได้อยู่ในแค็ตตาล็อกของ OrcaRouter และไม่มี LFM2.5 รุ่นใดอยู่ในนั้นเลย ดังนั้นมันจึงมาจากการแจกจ่ายของ Liquid AI เองและโฮสต์บุคคลที่สามตามปกติ — เป็นอาร์ติแฟกต์ในเครื่องมากกว่าจะเป็นเอนด์พอยต์ที่ถูกจัดเส้นทาง AREX-Base และ AREX-Turbo ก็ไม่อยู่ในแค็ตตาล็อกของเราเช่นกัน สิ่งที่ เลเยอร์การจัดเส้นทางมีไว้เพื่ออะไรจริง ๆ ในภาพนี้ คืออีกด้านหนึ่งของสถาปัตยกรรม: วันที่คุณเปรียบเทียบไฟน์จูนของคุณกับโมเดลที่มันต้องเอาชนะ คุณอยากให้การเปรียบเทียบนั้นมีต้นทุนแค่การเปลี่ยนคอนฟิก ไม่ใช่รอบการจัดซื้อจัดจ้าง API เดียวที่อยู่หน้าโมเดลกว่า 200 ตัว ราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกเพิ่มต่อโทเคน คีย์เดียวสำหรับทั้งแผง และระบบ failover เพื่อว่าช่วงบ่ายที่ย่ำแย่ของผู้ให้บริการจะไม่กลายเป็นช่วงบ่ายที่ย่ำแย่ของการประเมินของคุณ นั่นคือเงื่อนไขที่ทำให้การทดสอบ A/B กับโมเดลที่ยังไม่พิสูจน์นั้นมีต้นทุนต่ำพอที่จะลงมือทำได้จริง
นั่นก็เป็นการวางกรอบอย่างตรงไปตรงมาสำหรับ AREX-2 เองเช่นกัน เมื่อมันเปิดตัว — โดยสมมติว่ามันเปิดตัวพร้อมเวตแบบเปิด เหมือนที่รุ่นก่อนหน้าสองรุ่นทำ — วิธีที่สมเหตุสมผลในการลองเอเจนต์ใหม่เอี่ยมกับเวิร์กโหลดจริง คือลองบนเส้นทางสำรอง หลังระบบ failover ไม่ใช่ในฐานะผู้ให้บริการรายเดียวที่ลูปโปรดักชันของคุณพึ่งพาอยู่
สิ่งที่คนมีเหตุผลทำเกี่ยวกับแต่ละเรื่องในสัปดาห์นี้
หากคุณมีงานเล็ก ๆ ที่มีขอบเขตแคบเฉพาะทาง และมีข้อมูลที่ไม่สามารถออกจากโครงสร้างพื้นฐานของคุณได้ Liquid checkpoint นั้นพร้อมใช้งาน มีขนาดเล็ก ได้รับสัญญาอนุญาตแบบผ่อนปรนเมื่อรายได้ต่ำกว่าเกณฑ์ที่กำหนด และสามารถทดสอบได้บ่ายนี้เลย ดาวน์โหลดมันไป รันบนชุดประเมินของคุณเอง แล้วให้ผลลัพธ์เป็นตัวตัดสิน ไม่มีอะไรเกี่ยวกับ AREX-2 ที่เปลี่ยนแปลงแผนนั้น
ถ้าคุณต้องการพฤติกรรมการวิจัยแบบระยะยาวในวันนี้ โมเดลที่คุณควรหยิบมาใช้คือตัวที่มีอยู่แล้ว: AREX-Base ซึ่งเปิดตัวเมื่อเดือนกรกฎาคม พร้อมเกณฑ์มาตรฐานเอเจนต์ที่เผยแพร่ ซึ่งอย่างน้อยคุณก็เทียบกับบทความได้ AREX-2 เป็นเพียงชื่อที่มีการประทับเวลา และสองสิ่งที่จะเปลี่ยนสถานะของมันมองเห็นได้จากภายนอก — ว่าไฟล์จะปรากฏในทรีหรือไม่ และว่าการ์ดที่ระบุจำนวนพารามิเตอร์และสัญญาอนุญาตจะปรากฏมาพร้อมกับไฟล์เหล่านั้นหรือไม่
โหมดความล้มเหลวที่บทความนี้มีขึ้นเพื่อป้องกัน คือกรณีที่ชื่อที่จองไว้ถูกมองว่าเป็นรายการในแผนงาน ซึ่งมันไม่ใช่ มันคือรีโพซิทอรีที่ BAAI สร้างขึ้นเมื่อวานนี้ และปริมาณการวางแผนที่เหมาะสมซึ่งควรทำเกี่ยวกับมันตอนนี้คือไม่มีเลย
