
Apodex 1.1 อธิบาย: คะแนน 44 ในดัชนีความชาญฉลาด (Intelligence Index), ความแข็งแกร่งแบบเอเจนต์อย่างแท้จริง — และข้อแม้เรื่องความน่าเชื่อถือของความรู้
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
Apodex 1.1 มีอายุเพียงหนึ่งสัปดาห์ เป็นโมเดลแบบปิด (proprietary) และจนถึงสัปดาห์นี้มันเป็นเพียงแค่สิ่งที่น่าสนใจในห้องแล็บเท่านั้น จากนั้น Artificial Analysis ได้เผยแพร่การประเมินอิสระครั้งแรกของโมเดลนี้ — ซึ่งเป็นการประเมินครั้งแรกของ Apodex บนแพลตฟอร์มดังกล่าว — และกระดานคะแนนก็แสดงสิ่งที่ไม่ปกติ: Apodex 1.1 ได้คะแนน 44 จากดัชนีปัญญาประดิษฐ์ของ Artificial Analysis อยู่อันดับที่ 11 จาก 177 โมเดล ขณะที่ทำคะแนนงานด้าน agentic ที่สูงกว่าโมเดลทุกรุ่นในระดับปัญญาเดียวกัน รวมถึง DeepSeek V4 Pro, Qwen3.7 Max และ Kimi K2.6 รายงานฉบับเดียวกันยังเผยตัวเลขที่สองซึ่งน่าเกลียดกว่า นั่นคือ คะแนนความน่าเชื่อถือของความรู้ (knowledge reliability) ที่อ่อนแอพอที่จะทำให้การตัดสินใจใช้มันทำงานจริงต้องเปลี่ยนไป โมเดลพี่น้องแบบเปิดน้ำหนัก (open-weights) อย่าง Apodex 1.1 Mini คือโมเดลที่ผู้คนส่วนใหญ่สามารถใช้งานได้จริง นี่คือสิ่งที่การประเมินกล่าวถึง สิ่งที่ไม่ได้กล่าวถึง และใครที่ควรสนใจ
Apodex บริษัท AI ที่ก่อตั้งโดย Chen Tianqiao เปิดตัวตระกูลโมเดลเมื่อวันที่ 24 สิงหาคม 2026 พร้อมกับบทความ arXiv ที่มีผู้เขียน 70 คน ชื่อ "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283) โมเดลหลักเป็นซอฟต์แวร์ปิด — มีพารามิเตอร์ประมาณ 397B ตามรายงานของผู้พัฒนา — สร้างขึ้นบนแนวคิดที่ว่าอุปสรรคที่แท้จริงของเอเจนต์ไม่ใช่ความฉลาดดิบ แต่เป็นสภาพแวดล้อมที่พวกมันทำงาน ดังนั้น Apodex 1.1 จึงถูกฝึกให้ทำงานกับไฟล์ การค้นหา และโค้ดโดยตรงในระยะยาว พร้อมกับกลไกการทำงานร่วมกันที่เรียกว่า "AgentOS" ซึ่งประสานงานซับเอเจนต์แบบขนานได้สูงสุด 150 ตัว และบันทึกประวัติที่มาของทุกขั้นตอน ส่วนแบบเปิดคือโมเดลพี่น้อง: Apodex 1.1 Mini ซึ่งเป็น MoE ระดับ 35B ที่ปรับแต่งจาก Alibaba's Qwen3.5-35B-A3B, เผยแพร่ภายใต้ Apache-2.0 พร้อมกับแฮร์เนสเอเจนต์คู่หูที่เรียกว่า FrontierAgent โมเดลเต็มใช้งานได้ผ่าน API และเวิร์กเบนช์ออนไลน์ของ Apodex เท่านั้น ส่วน Mini ต้องโฮสต์ด้วยตนเองเท่านั้น
คะแนน 44 ในดัชนีความฉลาดหมายถึงอะไร
ดัชนี Artificial Analysis Intelligence เป็นค่าเฉลี่ยถ่วงน้ำหนักของชุดเกณฑ์มาตรฐานของแพลตฟอร์ม ซึ่งรวมถึงการประเมินเชิงเอเจนต์อย่าง GDPval-AA v2 และ Terminal-Bench รวมถึงองค์ประกอบด้านการให้เหตุผล คณิตศาสตร์ และความรู้ คะแนน 44 ทำให้ Apodex 1.1 อยู่อันดับที่ 11 จาก 177 โมเดล ซึ่งสูงกว่าค่ามัธยฐานที่ 18 อย่างมาก อีกทั้งยังทำให้โมเดลนี้อยู่ในกลุ่มที่มีการแข่งขันสูงและน่าสนใจ: Kimi K2.6 (45), MiniMax-M3 (45) และ Inkling (42) ต่างกันไม่เกินสามคะแนน และ Apodex 1.1 เป็นเพียงโมเดลเดียวในกลุ่มนั้นที่ชื่อของมันไม่เป็นที่รู้จักสำหรับผู้ใช้ AI ส่วนใหญ่เมื่อสัปดาห์ที่แล้ว Artificial Analysis ระบุว่าหน้านี้ครอบคลุมโมเดลเวอร์ชัน reasoning และอาจมีเวอร์ชันที่ไม่ใช่ reasoning แยกต่างหากด้วย

คะแนนดัชนีหลักไม่ใช่จุดที่ทำให้โมเดลนี้น่าสนใจ ความน่าสนใจอยู่ที่ตำแหน่งของจุดแข็งและจุดอ่อนเทียบกับคะแนนนั้น — และนั่นคือสิ่งที่การเปรียบเทียบระดับชั้นทำให้เห็นเป็นรูปธรรม
จุดที่เหนือกว่าระดับของตน: การประเมินแบบ agentic และงานด้านความรู้
ในองค์ประกอบดัชนีสองรายการที่วัดงานเชิงตัวแทนในโลกจริง Apodex 1.1 ทำผลงานได้ดีกว่าเพื่อนบ้าน 44 จุด ในการวัด GDPval-AA v2 ซึ่งเป็นเกณฑ์มาตรฐานที่ให้คะแนนความสามารถของตัวแทนในการทำงานสไตล์สำนักงานในโลกจริงแบบครบวงจร Apodex 1.1 ได้คะแนน Elo 1348 นำหน้า DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) และ Kimi K2.6 (1202) สำหรับ TerminalBench v2.1 ซึ่งทดสอบตัวแทนที่ทำงานบนเทอร์มินัล ได้คะแนน 70% นำหน้า Kimi K2.6 (66%) และตามหลัง Qwen3.7 Max (75%) เพียงเล็กน้อย ตัวเลขเหล่านี้เป็นผลการวัดจาก Artificial Analysis อย่างอิสระ และเป็นหลักฐานที่แข็งแกร่งที่สุดในรายงานว่าการฝึกแบบเน้นสภาพแวดล้อมเป็นอันดับแรกได้ผลจริง
ตัวเลขเกณฑ์มาตรฐานที่ผู้จำหน่ายเองอ้างไว้นั้นไปได้ไกลกว่านั้น และควรอ่านเป็นตัวเลขที่รายงานโดยผู้จำหน่าย จนกว่าจะมีผู้ทำซ้ำผลลัพธ์ได้: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% พร้อมเครื่องมือ, DeepSearchQA 92.4%, FrontierFinance 54.3 และ FrontierScience-Research 63.3 สิ่งที่ทำให้โปรไฟล์แบบเอเจนต์น่าเชื่อถือมากกว่าเป็นเพียงกระแส hype คือสถาปัตยกรรมที่อยู่เบื้องหลัง: การขยายขนาดสภาพแวดล้อม (เพิ่มความหลากหลายของสภาพแวดล้อมไฟล์ที่เรียกทำงานได้ การค้นหา และโค้ดที่ใช้ในการฝึก) และการขยายขนาดการประสานงานเชิงเอเจนต์ (การฝึกโมเดลให้แยกย่อยงานระยะยาว มอบหมายงานแบบขนาน ผสานผลลัพธ์แบบอะซิงโครนัส และวางแผนใหม่) โหมด "Agent Team" จะสร้างเอเจนต์ย่อยได้มากถึง 150 ตัวสำหรับงานค้นคืนและงานสังเคราะห์ และขั้นตอนการตรวจสอบในตัว ("Statement Review") จะตรวจสอบข้อสรุปก่อนส่งมอบ กล่าวอีกนัยหนึ่ง: นี่คือโมเดลที่ออกแบบมาให้ผิดพลาดได้ ตรวจสอบตัวเอง และแก้ไขสิ่งต่าง ๆ — ไม่ใช่เพื่อท่องข้อเท็จจริงจากความจำ
ต้นทุนแฝงของเอเจนซีทั้งหมดนั้น: ความเยิ่นเย้อ
การออกแบบนั้นปรากฏในตารางประสิทธิภาพด้านต้นทุนของ Artificial Analysis ว่าจุดอ่อนที่ชัดเจนที่สุดของโมเดลรองจากความรู้คือความฟุ่มเฟือยในการใช้คำ: มันใช้คำฟุ่มเฟือยมาก การรันดัชนี Intelligence Index ทั้งหมดใช้โทเค็นเอาต์พุต 180M — เทียบกับค่ามัธยฐานที่ 67M — และประมาณ 17,000 โทเค็นเอาต์พุตต่องาน benchmark เทียบกับประมาณ 9,400 สำหรับ Qwen3.7 Max และ 8,100 สำหรับ MiniMax-M3 โดยรวมแล้ว การประเมินทั้งหมดมีค่าใช้จ่าย $618.41 ในการใช้จ่าย API ตามข้อมูลของ Artificial Analysis

ราคาที่สร้างบิลนั้น: $0.30 ต่อโทเคนนำเข้าหนึ่งล้านตัว และ $3.00 ต่อโทเคนส่งออกหนึ่งล้านตัว — ราคา cache-hit ที่ $0.03 สำหรับอินพุตที่ถูกแคช ซึ่งเป็นส่วนลด 90% — เมื่อผสมกันแล้วจะอยู่ที่ประมาณ $0.38 ต่อล้านตัวตามสัดส่วน cache/input/output ทั่วไปที่ 7:2:1 ราคาต่อโทเคนทั้งสองตัวสูงกว่าค่ามัธยฐานของแพลตฟอร์ม (อินพุต $0.25 เอาต์พุต $0.90) อย่างไรก็ตาม การประมาณต้นทุนต่องานของ Artificial Analysis ยังจัดให้ Apodex 1.1 อยู่ที่ประมาณ $0.05 ต่องานมาตรฐาน ราคาถูกกว่า Qwen3.7 Max (~$0.07) และ Kimi K2.6 (~$0.06) การกระทบยอดนี้สำคัญสำหรับการจัดงบประมาณ: โทเคนของมันถูกพอที่แม้ความยืดยาวในการพูดจะยังคงแข่งขันได้ต่องาน — ความเสี่ยงด้านต้นทุนอยู่ที่ปริมาณ ไม่ใช่อัตรา หากคุณวางเอเจนต์ที่ทำงานยาวนานไว้บนมัน บิลจะถูกขับเคลื่อนด้วยปริมาณที่มันพูด และมันพูดเยอะมาก
หมายเหตุเรื่องราคาหนึ่งข้อก่อนจัดงบประมาณ: $0.30/$3.00 คือราคารายการของผู้จำหน่ายเอง แพลตฟอร์มการจัดเส้นทางที่ส่งต่อราคารายการของผู้ให้บริการด้วยมาร์กอัป 0% จะคิดเงินตามจำนวนนั้นพอดี และการลดราคา Apodex ในอนาคตจะแสดงผลในวันเดียวกับที่ประกาศ
ข้อเสีย: ประวัติความน่าเชื่อถือด้านความรู้ที่อ่อนแอ
นี่คือตัวเลขที่การรายงานข่าวการเปิดตัวส่วนใหญ่ไม่กล่าวถึง บน AA-Omniscience ซึ่งเป็นเครื่องมือตรวจสอบความน่าเชื่อถือของความรู้ของ Artificial Analysis นั้น Apodex 1.1 ได้คะแนน -21.9 มันพยายามตอบคำถามถึง 87% แทนที่จะปฏิเสธ แต่ตอบถูกเพียง 32% และมีอัตราการหลอน (hallucination) ถึง 78.4% สำหรับโมเดลที่ถูกวางตำแหน่งให้เป็นตัวแก้ปัญหาหนัก ๆ นับเป็นบุคลิกที่แตกเป็นสองอย่างจริงจัง: แข็งแกร่งด้านการทำงานแบบเอเจนต์ แต่อ่อนแอด้านความรู้ที่มีหลักฐาน
ข้อเท็จจริงทั้งสองเชื่อมโยงกัน ไม่ได้ขัดแย้งกัน เกณฑ์วัดแบบ Agentic ให้รางวัลกับการลงมือทำในสภาพแวดล้อม — การเรียกใช้เครื่องมือ การวนซ้ำ การกู้คืน — ดังนั้นโมเดลจึงอาจทำคะแนนได้ดีในส่วนนั้นในขณะที่ความจำด้อย เนื่องจากสภาพแวดล้อมเป็นผู้จดจำ การออกแบบยังตั้งสมมติฐานไว้เช่นนั้น: Statement Review มีไว้ตรวจสอบผลลัพธ์ และเวิร์กเบนช์ถูกสร้างรอบการตรวจสอบ ไม่ใช่รอบการที่โมเดลจะต้องถูกต้องจากความจำ การอ่านเชิงปฏิบัติฟังดูตรงไปตรงมา: อย่านำ Apodex 1.1 ไปใช้กับงานที่ต้องพึ่งพามันในการดึงข้อเท็จจริงจากน้ำหนักของตัวเอง จงใช้มันกับงานระยะยาวที่ผลงานสามารถตรวจสอบเทียบกับไฟล์ โค้ด และแหล่งอ้างอิง — แล้วตรวจสอบผลลัพธ์ที่ส่งมอบ
พี่น้องโอเพนซอร์ส: Apodex 1.1 Mini และ FrontierAgent
หากประตูที่ปิดของเรือธงเป็นปัญหา ครึ่งที่เปิดของตระกูลก็คือตัวถ่วงดุล Apodex 1.1 Mini เป็น MoE ขนาดรวม ~35B / ใช้งานจริง ~3B ที่ถูก fine-tune มาจาก Qwen3.5-35B-A3B (โมเดลพื้นฐานที่ Alibaba เปิดซอร์สในเดือนกุมภาพันธ์ 2026) เผยแพร่ภายใต้ Apache-2.0 พร้อมหน้าต่างบริบท 262K และเวอร์ชัน FP8, FP4 และ GPTQ-Int4 บน Hugging Face ตัวเลขหลักที่ผู้ผลิตประกาศคือ 50.2 บน FrontierFinance (เป็นอันดับหนึ่งในการเปรียบเทียบของ Apodex เอง) และ 27.7 บน APEX-Agents เมื่อเปิดใช้ Agent Team harness และ FrontierAgent — รันไทม์โอเพนซอร์สที่มาพร้อมกับมัน — คือสิ่งที่น่าสนใจอย่างแท้จริง: harness แบบเทอร์มินัลที่มีโหมด ReAct และ Agent Team, การทำงานกับไฟล์ในแซนด์บ็อกซ์, เกตการอนุมัติ, เช็คพอยต์และเทรซ โดยทั้งหมดเชื่อมต่อกับเอนด์พอยต์ที่เข้ากันได้กับ OpenAI
มีสองสิ่งที่ควรรู้ก่อนที่คุณจะโฮสต์เอง (self-host) ประการแรก Mini เป็นโมเดลแบบ fine-tune ไม่ใช่ frontier model — อ่านค่าจาก benchmark ของมันในแบบเดียวกับที่คุณอ่านตาราง vendor ของรุ่นเรือธง: เป็นการเปรียบเทียบที่ไม่ได้ผ่านการตรวจสอบซ้ำ (unreproduced) รวมถึงผลจาก harness การทดสอบ และถูกเลือกโดย vendor เอง ประการที่สอง พฤติกรรมของมันสืบทอดมาจาก base model: หากต้องการทดสอบว่า Qwen3.5-35B-A3B ที่เป็นฐานอยู่แล้วทำงานของคุณได้หรือไม่ คุณไม่จำเป็นต้องมี GPU และชุดระบบ serving stack — แค่เรียก API ครั้งเดียวก็รู้คำตอบ
ใครควรใช้ Apodex 1.1 ในวันนี้
รุ่นเรือธงยังอยู่ในช่วงต้น ปิดอยู่ และตอนนี้มีเฉพาะบน API และเวิร์กเบนช์ออนไลน์ของผู้ขายเองเท่านั้น Apodex กล่าวว่าการเปิดให้ใช้ API ในวงกว้างจะมาผ่านแพลตฟอร์มหลัก ๆ แต่ไม่ได้เปิดเผยน้ำหนักของโมเดล ซึ่งจำกัดผู้ที่สามารถดำเนินการกับกระดานคะแนนในสัปดาห์นี้: ทีมที่อยู่บนเวิร์กเบนช์ของ Apodex อยู่แล้ว หรือยินดีสมัครรับคีย์ API ของบุคคลที่หนึ่ง ส่วน Mini เป็นเส้นทางที่เข้าถึงได้ง่ายกว่า แต่หมายถึงต้องโฮสต์เอง

จุดที่โมเดลนี้สมควรได้รับตำแหน่งอย่างแท้จริง: ไปป์ไลน์แบบเอเจนต์ระยะยาวซึ่งผลลัพธ์ถูกตรวจสอบยืนยันในขั้นปลายน้ำ — เวิร์กเบนช์สำหรับงานวิจัย งานหลายขั้นตอนที่เกี่ยวข้องกับไฟล์และเครื่องมือ งานบนเทอร์มินัล — และเมื่อต้นทุนราว 0.05 ดอลลาร์ต่องานยังคงคุ้มค่าแม้โมเดลจะตอบยาว จุดที่ยังไม่เหมาะสม: สิ่งใดก็ตามที่อาศัยความน่าเชื่อถือของความรู้ภายในโมเดลเอง หรือเส้นทางการผลิตที่ไม่สามารถทนต่อการทำงานผิดพลาดของโมเดลอายุเจ็ดวันซึ่งยังไม่ผ่านการพิสูจน์ สำหรับสถานการณ์เช่นนั้น เลเยอร์การจัดเส้นทางคือตัวห่อหุ้มที่เหมาะสม API เดียวสำหรับโมเดล 200+ รุ่นหมายความว่าโมเดลพื้นฐาน Qwen3.5-35B-A3B เรียกใช้ได้แล้วในราคาตามรายการ Mini ที่โฮสต์เองสามารถอยู่เบื้องหลังเราเตอร์ตัวเดียวกันพร้อมระบบสลับอัตโนมัติเมื่อเกิดข้อผิดพลาด และโมเดลใหม่ที่ไม่เสถียรไม่สามารถทำให้เส้นทางการผลิตล่มได้ — เมื่อมันทำงานได้ไม่ดี คำขอจะถูกส่งต่อไปยังผู้ให้บริการที่แข็งแรงแทน
สิ่งที่ควรดูต่อไป
การประเมินนี้เป็นการอ่านครั้งแรก ไม่ใช่คำตัดสิน สามสิ่งจะเป็นตัวกำหนดว่า Apodex 1.1 จะมีความสำคัญในอีกหนึ่งเดือนหรือไม่: การจำลองข้อกล่าวอ้างด้าน agentic ของผู้พัฒนาอย่างเป็นอิสระ (ตัวเลข GDPval และ TerminalBench ที่ดำเนินการโดย Artificial Analysis เป็นเพียงตัวเลขเดียวที่ไม่ได้สร้างโดย Apodex เอง); ช่องว่างด้านความน่าเชื่อถือของความรู้จะแคบลงในเวอร์ชันที่ไม่ใช้การคิดหาเหตุผลหรือรุ่นถัดไปหรือไม่; และโมเดลจะปรากฏบน API มากขึ้นและกระดานคะแนนอิสระมากขึ้นหรือไม่ ซึ่งเมื่อถึงจุดนั้น คะแนน 44 และ -21.9 ก็จะกลายเป็นเป้าหมายที่คนอื่นต้องเอาชนะ สำหรับโมเดลอายุเจ็ดวันที่มีโปรไฟล์แบบสองด้านเช่นนี้ นั่นคือสิ่งที่คุณขอได้มากที่สุดเท่าที่จะทำได้: ความได้เปรียบด้าน agentic ที่แท้จริง ราคาที่โปร่งใส และจุดอ่อนหนึ่งอย่างที่คุณรู้ก่อนจะสมัครใช้
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
