การ์ดไตเติลแบบฮีโร่สำหรับ 'Nex-N2.5 Mini' พร้อมคำบรรยาย 'Open weights landed at launch - the small computer-use agent' มีชิปข้อความ 'APACHE-2.0', '35B TOTAL / ~3B ACTIVE' และ '262K CONTEXT' และริบบิ้น 'IMAGE + TEXT INPUT - 2x H100 REFERENCE' พร้อมโลโก้ OrcaRouter ประกอบที่มุมขวาล่าง
Guides & Insights

Nex-N2.5 Mini: โอเพนเวตส์พร้อมใช้งานตั้งแต่เปิดตัว — เอเจนต์ใช้คอมพิวเตอร์ที่เล็กที่สุดของ Nex-AGI คือจุดเริ่มต้น

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วิธีที่จะรู้ว่าเอเจนต์ใช้งานคอมพิวเตอร์แบบเปิดพร้อมหรือยัง ตอนนี้คือโมเดลที่คุณสามารถดึงมาใช้ได้ในวันเดียวกับที่ประกาศ Nex-AGI เปิดตัวตระกูล Nex-N2.5 เมื่อวันที่ 8 กันยายน 2026 — สามระดับสำหรับเอเจนต์ ได้แก่ Nex-N2.5 Mini, Nex-N2.5 Pro และ Nex-N2.5 Max — โดยระดับที่โดดเด่นเรื่องดาวน์โหลดแล้วรันได้เลยคือรุ่นที่เล็กที่สุด Nex-N2.5 Mini มีน้ำหนักโมเดลภายใต้ Apache-2.0 เผยแพร่บน Hugging Face ใน 16 ชาร์ดแบบ BF16 มีพารามิเตอร์ประมาณ 35 พันล้าน โดยมีรายงานว่ามีพารามิเตอร์ที่ถูกใช้งานจริงประมาณ 3 พันล้านต่อโทเคน และมีการปรับใช้แบบอ้างอิงที่ใช้ H100 สองตัว ตัวพี่น้องมัลติโมดัลที่ใหญ่กว่าอย่าง Nex-N2.5 Pro ยังคงถูกระบุว่า "เร็วๆ นี้" ณ เวลาที่เขียนบทความนี้ ขณะที่ Nex-N2.5 Max แบบข้อความเท่านั้นซึ่งมีพารามิเตอร์ 1.6 ล้านล้านนั้นพร้อมใช้งานแล้วเช่นกัน แต่ต้องใช้ H200 16 ตัวในสองโหนดก่อนจึงจะรันได้ สำหรับใครก็ตามที่กำลังทดสอบสมมติฐานเบื้องหลังตระกูลนี้ — ว่าโมเดลเอเจนต์แบบเปิดสามารถทำงานได้ดีในการใช้งานคอมพิวเตอร์ระยะยาว ไม่ใช่เพียงแค่ตอบคำถาม — รุ่น Mini คือจุดเริ่มต้น

Nex-AGI คือใคร? ชื่อนี้เพิ่งเกิดขึ้นใหม่ และการเปิดตัวครั้งนี้ก็มีกลิ่นอายของการปล่อยสู่สาธารณะเป็นครั้งแรก รายงานข่าวเกี่ยวกับการประกาศดังกล่าวบรรยายว่าความพยายามนี้เป็นความร่วมมือระหว่างองค์กรหลายแห่งในเซี่ยงไฮ้ ได้แก่ สถาบันนวัตกรรมเซี่ยงไฮ้ (Shanghai Innovation Institute), Shanghai Qiji Zhifeng, Mosi Intelligence และ Kuafu Technology โดยผลตระกูลนี้ถูกวางตำแหน่งเป็นโอเพนซอร์ส และทีมงานดำเนินงานภายใต้แฮนเดิล @NexEcosystem การ์ดโมเดลระบุว่า Nex-N2.5-mini และ Nex-N2.5-Pro เป็นการสานต่อ "รากฐาน multimodal ของ Nex-N2" ซึ่งเป็นเวอร์ชันก่อนหน้าของ Nex ที่เปิดน้ำหนักโมเดลไว้แล้ว สิ่งที่ใหม่จริงๆ ตรงนี้คือกรอบแนวคิด: Nex-AGI กล่าวว่าพวกเขาสร้างโมเดลเหล่านี้ขึ้นมาสำหรับงานระยะยาว (long-horizon tasks) ในสภาพแวดล้อมโลกจริง เช่น การใช้งานคอมพิวเตอร์ การควบคุมเบราว์เซอร์ การดำเนินการและทดสอบโค้ด และการแก้ไขเส้นทางจากสิ่งที่เห็นบนหน้าจอ และพวกเขาเผยแพร่น้ำหนักโมเดลเพื่อให้ข้อกล่าวอ้างนั้นสามารถพิสูจน์ทดสอบได้

สามระดับ หนึ่งประกาศ

ครอบครัวแบ่งแยกตามขนาดและตามรูปแบบวิธี และความแตกต่างมีความสำคัญมากกว่าชื่อร่วม:

Nex-N2.5 Mini — รวมประมาณ 35B / ใช้งานจริง ~3B เป็นโมเดลมัลติโมดัลที่รับทั้งภาพและข้อความ ออกแบบมาสำหรับการใช้คอมพิวเตอร์ผ่านการมองเห็น การท่องเว็บ และงานที่ต้องอาศัยผลตอบกลับจากอินเทอร์เฟซ การติดตั้งอ้างอิงคือโหนดเดียวที่มี H100 สองตัว

• Nex-N2.5 Pro — มีรายงานว่ามีพารามิเตอร์รวม 397B / แอคทีฟประมาณ 17B และยังเป็น multimodal สำหรับงานใช้งานคอมพิวเตอร์ที่หนักกว่า การปรับใช้ตามข้อกำหนดอ้างอิงคือ H100 แปดตัว น้ำหนักของโมเดลไม่สามารถดาวน์โหลดได้เมื่อเปิดตัว

• Nex-N2.5 Max — รวม 1.6T พารามิเตอร์ / ~49B ที่ใช้งานจริง, ใช้กับข้อความเท่านั้น และตามบัญชีของ Nex-AGI นี่คือ "ความพยายาม post-training ที่สมบูรณ์ครั้งแรกในระดับล้านล้านพารามิเตอร์" การ์ดระบุว่าสร้างขึ้นบนพื้นฐาน DeepSeek-V4-Pro-Base การใช้งานอ้างอิงคือ 16×H200 กระจายในสองโหนด

ทั้งสามเป็นโมเดลแบบ mixture-of-experts Mini และ Pro อยู่ในตระกูลโมเดล Qwen3.5 — เอกสารเปิดตัวของ Nex-AGI ระบุว่าทั้งคู่ถูก post-trained มาจาก Qwen3.5 variants และ config ของ Mini เองก็มีแท็กสถาปัตยกรรม qwen3_5_moe — ขณะที่ Max เป็นตัวที่แตกต่างซึ่งใช้พื้นฐานจาก DeepSeek ดังนั้นตระกูลนี้จึงไม่ใช่สูตรเดียวที่ทำสามขนาด แต่เป็นสองสูตร โดยที่ชั้นมัลติโมดัลแบบ "ทำงานบนหน้าจอ" มีสายเลือดร่วมกัน ส่วนโมเดลยักษ์สำหรับการให้เหตุผลเชิงข้อความนั้นอยู่คนละสาย

แท้จริงแล้ว Nex-N2.5 Mini ที่จัดส่งออกไปนั้นคืออะไร

ที่เก็บ Hugging Face สำหรับ nex-agi/Nex-N2.5-mini เป็น checkpoint ที่ดาวน์โหลดได้จริง ไม่ใช่ตัวยึดตำแหน่ง — safetensors 16 ชาร์ด รวมประมาณ 70 GB, BF16, ใบอนุญาต Apache-2.0 สร้างครั้งแรกเมื่อวันที่ 8 กันยายน ไฟล์ config มีความเฉพาะเจาะจงพอที่จะใช้ออกแบบได้:

• สถาปัตยกรรม — Qwen3_5MoeForConditionalGeneration ในตระกูล qwen3_5_moe พร้อมสแตกสำหรับงานวิทัศน์: การ์ดระบุว่าเป็นโมเดลภาพ-ข้อความเป็นข้อความ และในรีโปมี preprocessor_config.json มาพร้อมกับคอนฟิกข้อความ

• รูปทรง — 40 เลเยอร์, hidden size 2048, grouped-query attention พร้อม query heads 16 หัว และ KV heads 2 หัว, ขนาดคำศัพท์ (vocabulary) 248,320

• MoE — ผู้เชี่ยวชาญแบบ routed จำนวน 256 ราย โดยมี 8 รายทำงานต่อ token พร้อมผู้เชี่ยวชาญร่วม (shared expert) อีก 1 ราย และขนาด intermediate เท่ากับ 512 — โปรไฟล์แบบเปิดใช้งานเบาบาง (sparsely-activated) ที่ทำให้โมเดลระดับ "35B-class" ที่เป็นแบบ ~3B-active สามารถรันบน H100 สองตัวได้

• บริบท — max_position_embeddings ที่ 262,144 โทเคนในคอนฟิกที่เผยแพร่ ซึ่งเป็นตัวเลข 262K เดียวกันที่ปรากฏในสูตรการปรับใช้กลุ่มโมเดลตระกูลนี้

• น้ำหนักและใบอนุญาต — BF16, Apache-2.0, ไม่ได้จำกัดการเข้าถึง; ที่เก็บโค้ดยังชี้ไปยังมิเรอร์บน ModelScope และองค์กรบน GitHub (nex-agi) ซึ่งมีแนวทางการปรับใช้ของตระกูลโมเดลดังกล่าว

เอกสารการดีพลอยต์ (deployment) ของ Nex-AGI คือส่วนที่รุ่นโอเพนซอร์สส่วนใหญ่มักทำพลาด แต่รุ่นนี้กลับทำออกมาได้ดีอย่างไม่ธรรมดา โมเดล Mini ถูกเสิร์ฟผ่าน SGLang Docker อิมเมจแบบกำหนดเอง (nexagi/sglang:v0.5.18-nex-patch) บนโหนดเดียวที่มี H100 สองตัว โดยใช้ tensor parallelism 2 ค่าที่แนะนำสำหรับการสุ่มตัวอย่างคือ temperature 0.7, top_p 0.95 และ top_k 40 การเรียกใช้เครื่องมือ (tool calling) ทำงานผ่าน parser qwen3_coder ของ SGLang และโมเดลมีโหมดการคิด (reasoning) สามโหมดผ่านฟิลด์ reasoning_effort ได้แก่ "none" สำหรับโหมดไม่คิด "medium" (ค่าเริ่มต้นแบบปรับตัวได้) และ "high" สำหรับโหมดคิดตลอดเวลา สำหรับโมเดล agentic ขนาดเล็ก การควบคุมโหมดการคิดนี้คือตัวแบ่งระหว่าง agent loop ที่ใช้งานได้จริงกับตัวที่เชื่องช้า และมันถูกฝังไว้ในสูตรการเสิร์ฟ (serving recipe) แล้ว แทนที่จะปล่อยให้ผู้ใช้จัดการเอง

A single-column scoreboard titled 'Nex-N2.5 Mini - the scoreboard' with rows 'Params: 35B total / ~3B active (vendor-reported)', 'Architecture: qwen3_5_moe MoE - 256 experts / 8 active', 'Context: 262,144 tokens', 'Input: image + text', 'License: Apache-2.0 - BF16 weights live' and 'OSWorld-Verified: 71.2 (vendor-reported)', with a footer 'Specs from the HF config; benchmarks are Nex-AGI-reported, no independent run yet.'

น้ำหนัก: สิ่งที่ดาวน์โหลดได้จริง

สถานะในวันเปิดตัวของทั้งสามระดับควรระบุให้แม่นยำ เพราะประกาศกับคลังเก็บข้อมูลไม่ค่อยตรงกันนัก ณ ตอนที่เขียนนี้ Mini ดาวน์โหลดได้ครบสมบูรณ์ภายใต้ Apache-2.0 ซึ่งเป็นสิ่งที่บทความนี้ใช้เป็นพื้นฐาน Nex-N2.5 Max ก็ได้เปิดให้ใช้งานแล้วเช่นกัน โดยคลังเก็บบน Hugging Face ของมันมีชาร์ด safetensors จำนวน 644 ชิ้น แต่การจะจำลองขนาดมหึมาที่มีพารามิเตอร์ล้านล้านค่าต้องใช้โปรเจกต์ระดับ 16×H200 ก็ตาม ส่วน Nex-N2.5 Pro ยังเป็นตัวที่ยังไม่ถูกปล่อยออกมา: คลังเก็บ Hugging Face ของมันมีอยู่จริง แต่มีเพียงไฟล์ README และรูปภาพ ไม่มีชาร์ดโมเดล และการ์ดโมเดลยังคงระบุว่าน้ำหนักกำลังจะมา หากระดับที่คุณสนใจคือมัลติโมดัลตัวใหญ่ นั่นคือช่องว่างที่ต้องจับตา เพราะเอกสารเปิดตัวระบุว่า Pro เป็นโมเดลใช้งานคอมพิวเตอร์ที่แข็งแกร่งที่สุดในตระกูล และเป็นรุ่นที่คุณยังไม่สามารถรันในเครื่องได้ในตอนนี้

A screenshot of the Hugging Face repository page for nex-agi/Nex-N2.5-mini (captured September 9, 2026), showing the model header with Text Generation / Transformers / Safetensors / qwen3_5_moe / image-text-to-text / conversational tags and 'License: apache-2.0', and the Files & versions tree for the main branch listing config.json, README.md, chat_template.jinja and the figures directory.

ตัวเลขที่ Nex-AGI รายงาน — และข้อควรระวังที่มาพร้อมกับตัวเลขเหล่านั้น

การ์ดโมเดลของ Nex-AGI ประกอบด้วยตารางเกณฑ์มาตรฐานฉบับเต็มสำหรับ Mini และตัวเลขทุกตัวในนั้นเป็นข้อมูลที่ผู้จำหน่ายรายงานเอง ยังไม่มีการทดสอบอย่างอิสระเผยแพร่ ณ เวลาที่เขียนนี้ และการ์ดระบุชัดเจนว่าคะแนนมาจากลีดเดอร์บอร์ดเกณฑ์มาตรฐานอย่างเป็นทางการและรายงานการประเมินล่าสุดเท่าที่มี รวมถึงการประเมินของ Nex-AGI เองในส่วนอื่น ๆ ผลลัพธ์ด้านการเขียนโค้ดผลิตขึ้นด้วยชุดเครื่องมือ NexAU ของทีม ส่วนผลลัพธ์ด้านการใช้คอมพิวเตอร์และเบราว์เซอร์ใช้ชุดเครื่องมือ NexCUA ซึ่งการ์ดระบุว่าจะเปิดเผยเป็นโอเพนซอร์ส ให้ถือว่าแถวหัวข้อหลักเป็นกรณีที่ดีที่สุดของผู้จำหน่าย จนกว่าหน่วยงานที่เป็นกลางจะทำซ้ำผลลัพธ์เหล่านั้นได้

ด้วยกรอบดังกล่าว รายการผลลัพธ์ที่รายงานของ Mini มีดังนี้: ด้านงานข้อความและการเขียนโค้ด Terminal-Bench 2.1 ได้ 73.4, SWE-Bench Pro ได้ 43.8, DeepSWE v1.1 ได้ 36.1, AutomationBench v1.0.6 ได้ 32.3, Toolathlon Verified ได้ 54.6, BrowseComp ได้ 83.4 และคะแนน GDPval-AA v2 เท่ากับ 1446 ด้านมัลติโมดัล/การใช้คอมพิวเตอร์ จุดที่สะดุดตาคือ OSWorld-Verified ที่ 71.2, WebArena-Verified ที่ 63.4, WebTest ที่ 48.6 (รันในโหมด oracle เทียบกับเช็กลิสต์ ground-truth), OSWorld-G ที่ 82.9 และ OmniDoc ที่ 89.7 รวมถึงผลลัพธ์ที่ถ่อมตัวกว่าอย่าง OSWorld-2 (30.5) และ Vision2Web (52.9)

หมายเหตุจากการอ่านสองข้อ ประการแรก OSWorld-Verified และ OSWorld-2 เป็นชุดทดสอบคนละชุดกัน — ชุดหนึ่งเป็นชุดย่อยที่ตรวจสอบแล้วซึ่งให้คะแนนจากสถานะสภาพแวดล้อมที่ได้ผลลัพธ์ ส่วนอีกชุดเป็นการรันที่ใหม่กว่าและโดยทั่วไปเข้มงวดกว่า — ดังนั้นคะแนน 71.2 จากชุดหนึ่งและ 30.5 จากอีกชุดจึงไม่ขัดแย้งกัน เพราะเป็นการทดสอบคนละแบบ และตารางของ Nex เองก็แยกไว้คนละคอลัมน์ ประการที่สอง ในทุกแถวของตารางตระกูล Mini ได้คะแนนต่ำกว่า Pro และ Max และจุดสูงสุดของแต่ละคอลัมน์เป็นของโมเดล frontier เจ้าประจำ เช่น Claude Opus 5 หรือ GPT-5.6 Sol เรื่องราวของ Mini ไม่ใช่การที่มันเอาชนะโมเดล frontier แต่คือการที่โมเดลเปิดแบบ ~3B-active รายงานคะแนนที่แข่งขันได้บนเกณฑ์ชี้วัด computer-use ที่ใช้ทรัพยากร H100 สองตัว และไม่ว่าข้อนั้นจะคงอยู่จริงหรือไม่ ก็คือคำถามที่น้ำหนักโมเดลแบบเปิดให้คุณตอบได้ด้วยตัวเอง

วันนี้กำลังรัน Nex-N2.5 Mini

การใช้ H100 สองตัวทำให้ Mini เป็นหนทางที่ถูกที่สุดในการได้ทดลองกับข้อกล่าวอ้างหลักของตระกูลโมเดล เนื่องจากสถาปัตยกรรมเป็น Qwen3.5-MoE มาตรฐานพร้อมตัวแยกวิเคราะห์ tool-call ของ qwen3_coder จึงโหลดใน Nex-AGI SGLang fork ได้โดยไม่ต้องใช้โค้ดอินเฟอเรนซ์เฉพาะ และการตั้งค่าที่แนะนำก็ถูกเผยแพร่ไว้แล้ว แทนที่จะต้องถอดรหัสย้อนกลับเอง ความคาดหวังตามตรงที่ควรตั้งไว้ก่อนเริ่มต้นคือ เช็คพอยต์อายุหนึ่งวันกับแฮร์เนสใหม่เอี่ยมถือเป็นการทดลอง ไม่ใช่สิ่งที่พึ่งพาได้ ยอดดาวน์โหลดใน Mini repo ยังเป็นเลขหลักเดียว และยังไม่มีบุคคลที่สามส่งมอบการประเมินอิสระตอนที่เขียนข้อความนี้ — ซึ่งเป็นสภาพปกติของโมเดลที่ปล่อยเมื่อวาน และเป็นเหตุผลว่าทำไมการที่ต้องใช้ H100 สองตัวจึงสำคัญ: คุณสามารถทดลองเองได้ในสัปดาห์นี้ แทนที่จะรอให้คนอื่นทำ

A screenshot of the nex-agi collections page on Hugging Face (captured September 9, 2026), showing the Nex-N2.5 collection 'updated about 7 hours ago' with the three model entries nex-agi/Nex-N2.5-Max (Text Generation, 1.6T), nex-agi/Nex-N2.5-Pro and nex-agi/Nex-N2.5-mini, alongside the earlier Nex-N2, Nex-N1.1 and Nex-N1 collections listed on the left.

หากคุณอยากเปรียบเทียบ Mini กับเอเจนต์ระดับแนวหน้าในตารางเบนช์มาร์กของตัวมันเอง มากกว่าจะลงมือปรับแต่งการติดตั้งใช้งานเพียงชุดเดียว นั่นคือจุดที่เลเยอร์จัดเส้นทางแสดงความคุ้มค่าของมัน เมื่อผู้ให้บริการโฮสต์รายหนึ่งเพิ่ม Nex-N2.5 Mini เข้าในรายการ — และโมเดลเดิมที่ใช้เทียบวัดกับมันนั้นเข้าถึงได้ผ่านระบบจัดเส้นทางอยู่แล้ว — การมี API เดียวที่ครอบคลุมโมเดล 200+ รายการ โดยส่งผ่านราคาตามที่ผู้ให้บริการประกาศไว้โดยบวกเพิ่ม 0% พร้อมระบบเฟลโอเวอร์อัตโนมัติ คือวิธีที่ประหยัดในการรันงานเดียวกันกับโมเดลหลายตัวโดยไม่ต้องเชื่อมต่อระบบใหม่ บน OrcaRouter นี่คือการตั้งค่ามาตรฐานสำหรับทุกโมเดลที่เราจัดเส้นทาง: คีย์เดียวกัน รูปแบบการเรียกเดียวกัน ราคาของผู้ให้บริการเองโดยไม่มีอะไรบวกเพิ่ม สิ่งนี้สำคัญที่สุดสำหรับโมเดลที่ยังไม่ผ่านการพิสูจน์อย่างเช่นรุ่นนี้ เพราะการเฟลโอเวอร์คือสิ่งที่ทำให้คุณลองใช้มันบนเส้นทางจริงได้ โดยไม่ต้องเดิมพันเส้นทางนั้นไว้กับมัน

ใครควรยกน้ำหนักเหล่านี้

เลือกใช้โมเดลเหล่านี้หากงานของคุณคือเอเจนต์สำหรับใช้งานคอมพิวเตอร์ (computer-use agents), ระบบอัตโนมัติสำหรับเบราว์เซอร์ หรือการใช้เครื่องมือที่อาศัยการมองเห็นเป็นหลัก และคุณต้องการโมเดลที่ใช้ไลเซนส์แบบยืดหยุ่นและโฮสต์เองได้เพื่อใช้เป็นเกณฑ์วัดเทียบกับโมเดลชั้นนำที่ให้บริการบนคลาวด์ ไลเซนส์ Apache-2.0 ช่วยลดอุปสรรคที่มักพบในการเผยแพร่ผลงานของห้องแล็บจีน ขนาดการใช้งานที่ต้องใช้ H100 เพียงสองตัวนั้นอยู่ในระดับที่ทีมเอเจนต์จริงจังสามารถเข้าถึงได้ และการควบคุมระดับความพยายามในการคิดหาเหตุผล (reasoning-effort control) ประกอบกับตัวแยกวิเคราะห์การเรียกใช้เครื่องมือ (tool-call parser) ที่ใช้งานได้จริง ทำให้มันเป็นแพลตฟอร์มทดสอบที่น่าเชื่อถือ ไม่ใช่ของเล่น ชะลอไว้ก่อนหากคุณต้องการโมเดลใช้งานคอมพิวเตอร์ที่แข็งแกร่งที่สุดในตระกูลนี้ นั่นคือบทบาทของ Pro และน้ำหนัก (weights) ของ Pro ยังคงรอการเผยแพร่อยู่ และควรติดป้ายกำกับของผู้พัฒนารายนั้นไว้ในทุกแถวของผลการวัด基准 จนกว่าจะมีการทดสอบโดยอิสระมายืนยันผล คะแนน 71.2 บน OSWorld-Verified จากโมเดลโอเพนที่มีพารามิเตอร์ทำงานจริงประมาณ 3B ถือเป็นข้ออ้างที่โดดเด่น ซึ่งเป็นข้ออ้างประเภทที่ควรนำไปตรวจสอบในระบบทดสอบของคุณเองก่อนที่จะต่อยอดจากมัน

สิ่งที่ต้องติดตามต่อไป การปล่อยน้ำหนักของ Pro คือสัญญาณที่สำคัญที่สุดเพียงหนึ่งเดียว เพราะมันเปลี่ยนตระกูลโมเดลจาก “Mini บวกกับยักษ์ใหญ่ที่มีพารามิเตอร์ล้านล้านตัว” ไปเป็นไลน์ผลิตภัณฑ์ที่สมบูรณ์ตามที่เอกสารการเปิดตัวได้บรรยายไว้ ประการที่สองคือการเปิดซอร์สชุดทดสอบ NexCUA ซึ่งหากปราศจากมัน ตัวเลขความสามารถด้านการใช้คอมพิวเตอร์จะไม่สามารถถูกทำซ้ำได้อย่างอิสระภายใต้โปรโตคอลเดียวกัน ประการที่สามคือการทดสอบแบบเป็นกลางครั้งแรกจาก Artificial Analysis ห้องปฏิบัติการของมหาวิทยาลัย หรือผู้ปฏิบัติงานที่เผยแพร่การทำซ้ำที่ผ่านการตรวจสอบตามมาตรฐาน OSWorld-Verified ของตน เมื่อใดก็ตามที่หนึ่งในสามสิ่งนี้เกิดขึ้น คำถามที่การเปิดตัวครั้งนี้ตั้งขึ้น — ว่าโมเดล agentic แบบเปิดได้ปิดช่องว่างกับสแตกการใช้งานคอมพิวเตอร์แบบโฮสต์ได้จริงหรือไม่ — จะไม่ใช่เรื่องของตารางเปรียบเทียบจากผู้ขายอีกต่อไป

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube