การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ 'ARTEMIS vs Qwen3.8' โดยมีคำบรรยายใต้ภาพว่า 'เบนช์มาร์กเดียวกัน สองงานที่ต่างกัน' เปรียบเทียบผลลัพธ์ AndroidWorld ที่ ARTEMIS รายงานด้วยตนเองที่ 99.1% กับรายงานจากผู้ขายของ Qwen3.8-Flash ว่ามีการเพิ่มขึ้น 22.5 จุดเหนือ Opus 4.6 บนเบนช์มาร์กเดียวกัน โดยมีเชิงอรรถว่า AndroidWorld ไม่ได้ตรวจสอบผลงานที่ส่งเข้ามาอย่างเป็นอิสระ
Guides & Insights

ARTEMIS กับ Qwen3.8: เบนช์มาร์กเดียวกัน แต่เป็นงานที่แตกต่างกันสองอย่าง

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ARTEMIS ของ Google และ Qwen3.8 ต่างก็ถูกวัดบน AndroidWorld และความบังเอิญนั้นคือข้อเท็จจริงที่ชวนเข้าใจผิดมากที่สุดเพียงข้อเดียวในข่าวเปิดตัวของทั้งสองโครงการ ARTEMIS เป็นฮาร์เนสสำหรับทำงานอัตโนมัติบน Android — เปิดซอร์สโดย Google ในเดือนสิงหาคม 2026 ภายใต้ Apache 2.0 โดยรับคำสั่งภาษาธรรมชาติ ควบคุมโทรศัพท์เครื่องจริงผ่าน ADB และอ้างอัตราความสำเร็จ 99%+ บนเกณฑ์มาตรฐาน AndroidWorld จำนวน 116 งานของ Google Research โดยแสดง 99.1% บนกระดานผู้นำสาธารณะ ณ วันที่ 11 กันยายน 2026 Qwen3.8-Flash เป็นโมเดล multimodal แบบ mixture-of-experts ของ Alibaba เปิดตัวและเปิดซอร์สเมื่อวันที่ 26 สิงหาคม 2026 ซึ่งสื่อเปิดตัวอ้างว่าเอาชนะ Claude Opus 4.6 ได้ 22.5 คะแนนบน AndroidWorld หนึ่งในตัวเลขเหล่านั้นคือคะแนนของระบบ ส่วนอีกตัวคือส่วนสนับสนุนของโมเดลต่อระบบที่คนอื่นเขียน ถ้าอ่านพวกมันเป็นคู่แข่งกัน คุณจะสรุปผิดเกี่ยวกับทั้งสอง; ถ้าอ่านเป็นสองครึ่งของสแต็กเดียว คำถามที่น่าสนใจ — การรัน Android เป็นเวลานานมีต้นทุนจริงเท่าไร — ก็จะได้คำตอบในที่สุด

Qwen3.8 คืออะไร ในแต่ละขนาด

"Qwen3.8" เป็นตระกูล ไม่ใช่เช็กพอยต์ และสมาชิกที่สำคัญตรงนี้ไม่ใช่รุ่นเรือธง

Qwen3.8-Max — ระดับเรือธง ซึ่งวางตำแหน่งเทียบกับโมเดลแบบโฮสต์ระดับแนวหน้า

Qwen3.8-27B — รุ่นพี่น้องแบบ dense ขนาดกลางแบบเปิด

Qwen3.8-Flash — โมเดล MoE แบบมัลติโมดัลบนสถาปัตยกรรม "Next" ใหม่: พารามิเตอร์ทรานส์ฟอร์เมอร์ 125B โดยเปิดใช้งานเพียง 6B ต่อโทเคน, Qwen Sparse Attention ที่หลอมรวมกับ GDN ในรูปแบบความสนใจแบบไฮบริดเพื่อเพิ่มความเร็วสำหรับบริบทแบบยาวเมื่อแคชทำงาน, Gated Residual ที่แยกช่องทางข้อมูลออกเป็นสี่ทาง, และพารามิเตอร์ 51B ของ N-gram embeddings Alibaba อธิบายว่าสถาปัตยกรรม Next เป็นต้นแบบสำหรับ Qwen4 รุ่นถัดไป

บริบท — ขนาดใหญ่โดยกำเนิด โดยรายการส่วนใหญ่ระบุไว้ที่ 1M โทเค็น และบางแหล่งระบุว่าเป็น 262K แบบเนทีฟที่ขยายไปถึง 1M เอาต์พุตสูงสุดอยู่ที่ประมาณ 131K

ราคา — อัตรา API ที่ประกาศไว้คือ ¥1 ต่ออินพุตหนึ่งล้านโทเค็น และ ¥3 ต่อเอาต์พุตหนึ่งล้านโทเค็น ซึ่งคิดเป็น $0.15 / $0.47 ในแค็ตตาล็อกของเรา โดยการอ่านแคชอยู่ที่ $0.018 และการเขียนแคชอยู่ที่ $0.230 การวางกรอบของ Alibaba เองก็คือ ราคาแบบแคชฮิตที่ต่ำถึง ¥0.1 ต่อหนึ่งล้านคือสิ่งที่ทำให้เวิร์กโฟลว์ของเอเจนต์ที่ป้อนข้อมูลยาวเป็นไปได้จริง และตัวเลขก็สนับสนุนข้อนั้น: การอ่านแคชมีค่าใช้จ่ายประมาณหนึ่งในสิบสองของโทเค็นอินพุตใหม่

คำถามเรื่องน้ำหนักแบบเปิด — น้ำหนักของ Flash ถูกเผยแพร่บน Hugging Face และ ModelScope ในวันเปิดตัว สังเกตวิธีการนับของตระกูลโมเดลนี้: Alibaba กล่าวว่าซีรีส์ Qwen3.8 ได้เปิดซอร์สสามขนาด ได้แก่ Max, 27B และ Flash รวมเป็นพารามิเตอร์ 2.4T ซึ่งเป็นตัวเลขสะสมของทั้งซีรีส์ ไม่ใช่จำนวนพารามิเตอร์ของโมเดลใดโมเดลหนึ่ง

ข้อกล่าวอ้างเกี่ยวกับเบนช์มาร์กนั้นกว้างขวาง และตามเอกสารเปิดตัวของ Alibaba เอง ล้วนเป็นส่วนต่าง (delta) ไม่ใช่ค่าสัมบูรณ์: SWE-bench Pro +9.1 เหนือ Opus 4.6, JobBench ราว +20, MathVision +25.1, ERQA +31.5, AndroidWorld +22.5 ส่วนต่างที่เทียบกับการตั้งค่าที่ไม่ระบุชื่อของโมเดลคู่แข่งไม่ใช่หลักฐานประเภทเดียวกับรายการบนลีดเดอร์บอร์ด และไม่มีข้อใดเลยที่ถูกทำซ้ำโดยอิสระ กรอบการนำเสนอพาดหัวของบริษัท — การนิยามใหม่ของ "เส้นชี้ขาด" ด้านต้นทุนของอุตสาหกรรม จากราคาต่อโทเคนเป็นต้นทุนรวมต่องานที่ทำสำเร็จ — คือข้อกล่าวอ้างที่สำคัญจริงสำหรับการเปรียบเทียบนี้ และยังเป็นข้อที่คุณทดสอบได้ด้วยตัวเองอีกด้วย

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

สิ่งที่ ARTEMIS มีส่วนสนับสนุน และเหตุใดตัวเลขทั้งสองจึงไม่สามารถเปรียบเทียบกันได้

ARTEMIS ไม่มีโมเดลอยู่ในตัวเอง ป้ายของมันระบุว่า "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL" และการกำหนดค่าของมันอยู่ใน code>config/artemis.jsonc/code> สิ่งที่มันนำมาคือส่วนที่เปลี่ยนการคาดเดาของโมเดลให้กลายเป็นการกระทำที่ผ่านการตรวจสอบแล้ว ได้แก่ ตัวระบุตำแหน่งแบบไดนามิกก่อน (dynamic-first locator) ที่อ่าน accessibility tree เมื่อทำได้ และถอยกลับไปใช้การมองเห็นและพิกัดเมื่อพื้นผิว Compose หรือ Flutter ไม่ให้ข้อมูลใด ๆ แก่มัน, Safety Net ที่เคลียร์ป็อปอัปของระบบที่รบกวนก่อนที่การแตะจะเกิดขึ้น, การตรวจสอบเช็กพอยต์ในสี่ระดับ ตั้งแต่ code>off/code> ถึง code>strict/code> และบัญชีบันทึกเซสชันที่บีบอัดภาพหน้าจอเก่าให้เป็นบทสรุปภาพ เพื่อให้บริบทที่มีร้อยขั้นตอนยังคงมีต้นทุนที่จ่ายไหว

มันยังมาพร้อมกับ MCP server แบบเนทีฟอีกด้วย code>uv run artemis mcp --install all/code> เปิดให้เข้าถึง code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> และ code>mobile_diagnose/code> แก่ Antigravity, Claude Code, Codex และอื่น ๆ ที่พูดภาษา MCP ได้ — ซึ่งเป็นสิ่งที่ทำให้โปรเจกต์นี้แพร่กระจายได้เร็วอย่างที่เป็นมา และเป็นการระบุจุดประสงค์ของมันได้อย่างชัดเจนที่สุด ARTEMIS คือเครื่องมือที่เอเจนต์เรียกใช้ โมเดลก็เช่นกัน ซึ่งนั่นคือเหตุผลว่าทำไมการจัดให้ทั้งสองอยู่ในคอลัมน์เดียวกันจึงเป็นความผิดพลาดเชิงหมวดหมู่

สิ่งเดียวที่ต้องระวังเมื่ออ่านตัวเลข 99.1% ของ ARTEMIS คือ ลีดเดอร์บอร์ดของ AndroidWorld ระบุไว้อย่างชัดเจนว่าไม่ได้ตรวจสอบผลงานที่ส่งเข้ามาอย่างเป็นอิสระ ทุกตัวเลขบนนั้น รวมถึงของ ARTEMIS ด้วย เป็นการรายงานเองโดยทีมที่สร้างมันขึ้นมา ข้อแม้เดียวกันนี้ยิ่งใช้ได้หนักกว่าเดิมกับเดลต้าที่ถูกอ้างถึงในโพสต์เปิดตัว

การอ่าน "vs" สองแบบ

มีการตีความที่ตรงไปตรงมาสองแบบสำหรับการเผชิญหน้านี้ และทั้งสองแบบชี้ไปในทิศทางที่ตรงกันข้าม

ในฐานะคู่แข่งกัน การเปรียบเทียบที่แท้จริงก็คือ "ฉันควรใช้โมเดลแบบโฮสต์พร้อมฮาร์เนส หรือฉันควรใช้โมเดลที่เก่งงานบนมือถือพอจนฉันเขียนฮาร์เนสเองได้?" เมื่อตีความแบบนั้น ARTEMIS ชนะไปโดยปริยาย เพราะโมเดลไม่ใช่ฮาร์เนส และส่วนต่าง +22.5 จุดบน AndroidWorld ก็ไม่ได้บอกคุณว่า Qwen3.8-Flash จะอยู่รอดถึงสเต็ปที่ 74 ของการรันหนึ่งร้อยสเต็ปได้หรือไม่ เมื่อมีป็อปอัปของระบบมากลืนการแตะของมัน ไม่มีอะไรในตารางเบนช์มาร์กที่วัด Safety Net ได้

ในฐานะสแต็ก การเปรียบเทียบนี้คือสิ่งที่มีประโยชน์: ARTEMIS คือลูปควบคุม Qwen3.8-Flash เป็นเอ็นจิ้นที่เป็นไปได้สำหรับมัน และคำถามก็กลายเป็นเรื่องของต้นทุนและความน่าเชื่อถือเมื่อใช้งานในระยะยาว จุดขายทั้งหมดของ Alibaba สำหรับระดับ Flash — ที่ว่าตัวเลขสำคัญคือต้นทุนรวมต่องานที่เสร็จสมบูรณ์ ไม่ใช่ราคาต่อโทเคน — คือตัวชี้วัดที่ชุดระบบอัตโนมัติบน Android ถูกให้คะแนนพอดี และเป็นตัวชี้วัดที่คุณสามารถวัดได้บนชุดทดสอบของคุณเองภายในหนึ่งวัน

รายละเอียดที่ชวนกระอักกระอ่วนซึ่งขวางอยู่ตรงหน้าคือ Qwen3.8-Flash ไม่ได้อยู่ในรายชื่อแบ็กเอนด์ที่ผ่านการทดสอบของ ARTEMIS ซึ่งระบุชื่อ Gemini, Claude, GPT-4o และ Qwen-VL โดย Qwen-VL เป็นโมเดลที่แตกต่างออกไป ฮาร์เนสนั้นรับเอนด์พอยต์ของโมเดล และการจับคู่นี้เป็นไปได้ในทางเทคนิค แต่ยังไม่มีใครเผยแพร่ผลการประเมินออกมา และหากคุณรันมัน คุณก็กำลังทำงานเชิงบุกเบิกด้วยตนเอง มากกว่าที่จะทำตามเอกสารที่มีอยู่

การคำนวณที่ตัดสินเรื่องนี้

นี่คือการคำนวณที่คุ้มค่าที่จะทำก่อนที่โพสต์เปิดตัวอันใดอันหนึ่งจะโน้มน้าวคุณในเรื่องใดๆ มันเป็นแบบจำลองที่มีสมมติฐานระบุไว้ ไม่ใช่การวัด และคุณควรแทนที่ด้วยตัวเลขของคุณเอง — แต่รูปทรงของมันคือประเด็นสำคัญ

สมมติการรัน Pro 100 สเต็ป การรัน Pro ใช้เวลาประมาณ 15–40 วินาทีต่อสเต็ป ดังนั้นเวลาจริงรวมจะอยู่ระหว่าง 25 นาทีถึง 1 ชั่วโมง และแต่ละสเต็ปจะส่งภาพหน้าจอพร้อมพรอมต์ที่เพิ่มขึ้นเรื่อย ๆ สมมติว่ามีโทเค็นพรอมต์ 8,000 โทเค็นและโทเค็นเอาต์พุต 300 โทเค็นต่อสเต็ป — เป็นงบประมาณแบบอนุรักษ์นิยมสำหรับภาพหน้าจอและคำสั่ง ซึ่งต่ำกว่าต้นทุนของเฟรมความละเอียดเต็มแบบดิบมาก นั่นคือโทเค็นอินพุต 800,000 โทเค็นและโทเค็นเอาต์พุต 30,000 โทเค็นสำหรับการทดสอบหนึ่งครั้ง

• ที่ราคา $0.15 / $0.47 ของ Qwen3.8-Flash การรันครั้งนั้นมีค่าใช้จ่ายประมาณ $0.12 สำหรับอินพุต และ $0.014 สำหรับเอาต์พุต — ประมาณสิบสามเซนต์

• ที่อัตราโฮสต์ระดับแนวหน้าในหลักหน่วยต่ำ ๆ ต่ออินพุตหนึ่งล้านโทเคน และหลักสิบกลาง ๆ ต่อเอาต์พุตหนึ่งล้านโทเคน การรันเดียวกันจะตกอยู่ที่หลักดอลลาร์ ไม่ใช่เซนต์ สองอัตรานี้ถูกพูดแบบกว้าง ๆ ตรงนี้โดยเจตนา เพราะตัวเลขที่แน่นอนขึ้นอยู่กับว่าเลือกโมเดลระดับแนวหน้าตัวไหน และอัตราส่วนคือสิ่งที่สำคัญ: มันต่างกันหนึ่งลำดับขนาด ในทุกการทดสอบ ทุกการรัน

• และเนื่องจาก ARTEMIS อ่านบริบทที่เติบโตขึ้นซ้ำในทุกขั้นตอน อัตราส่วนจึงยิ่งดีขึ้นสำหรับโมเดลใดก็ตามที่มีการอ่านแคชที่ถูกกว่า การอ่านแคชของ Qwen3.8-Flash อยู่ที่ $0.018 ต่อล้าน เทียบกับอินพุตใหม่ที่ $0.15 — คิดเป็นหนึ่งในสิบสองของราคา และเป็นเหตุผลที่ Alibaba ยังคงชี้ไปที่อัตราการฮิตแคชเมื่อพูดถึงเวิร์กโหลดของเอเจนต์

ตอนนี้ลองคูณกับชุดทดสอบของคุณดู การรันรีเกรสชัน 500 เทสต์ทุกคืนคือ 400 ล้านโทเคนอินพุตต่อคืน และความต่างระหว่าง 13 เซนต์กับ 3 ดอลลาร์ต่อเทสต์ ก็คือความต่างระหว่างฮาร์เนสที่คุณสามารถรันต่อเนื่องได้ กับฮาร์เนสที่คุณต้องตั้งเวลาให้รันสัปดาห์ละครั้ง

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

การรันมัน และตรงจุดที่ระบบพื้นฐานเบื้องหลังมีความสำคัญ

ถ้าคุณอยากทดสอบการคำนวณนั้นกับแอปของคุณเอง ทางที่ตรงไปตรงมาคือชี้ ARTEMIS ไปที่ endpoint ของโมเดลแล้ววัดผลQwen3.8-Flash อยู่ในแค็ตตาล็อกของเราในราคาที่ประกาศไว้ที่ $0.15 / $0.47โดยมีค่า cache reads อยู่ที่ $0.018 และ cache writes อยู่ที่ $0.230 ใช้คีย์เดียวกันและใบเสร็จเดียวกันกับขนาดอื่น ๆ ของ Qwen3.8 และทุกอย่างที่เราให้บริการผ่าน — ซึ่งนั่นคือส่วนที่สำคัญเมื่อ workflow ที่คุณกำลังคิดราคาอยู่นั้นเป็น harness ที่เรียกใช้เป็นร้อยครั้งต่อการทดสอบ มากกว่าที่จะเป็นคนเรียกใช้แค่ครั้งเดียว หน้าโมเดลยังมีตัวเลขด้านการดำเนินงานที่คุณอยากรู้ก่อนจะผูก suite ไว้กับมันด้วย: context ขนาด 1M โทเคน พร้อมเอาต์พุตสูงสุด 131K, p50 ของเวลาถึงโทเคนแรกที่ 7.12 วินาที และ p95 ที่ 10.00 และปริมาณการรับส่งข้อมูลราว 2.3 พันล้านโทเคนที่ผ่านโมเดลนี้ในเจ็ดวันที่ผ่านมา ตัวเลขสุดท้ายนี้เป็นของเราไม่ใช่ของผู้ขาย และเป็นตัวชี้วัดที่สมเหตุสมผลว่าคนอื่น ๆ กำลังรันงานเอเจนต์แบบยาวบน endpoint นี้อยู่แล้วหรือไม่

รายละเอียดเชิงระบบเบื้องหลังที่เลิกเป็นแค่ทฤษฎีเมื่อถึงสเกลนี้ คือสิ่งที่เกิดขึ้นที่ขั้นตอนที่ 74 การรันแบบ Pro หนึ่งครั้งจะยึดบริบทไว้ที่เอนด์พอยต์เดียวเกือบทั้งชั่วโมง เหตุขัดข้องของผู้ให้บริการที่เกิดขึ้นระหว่างนั้นไม่ได้ทำให้การรันเสื่อมลง แต่ทำให้มันจบไปเลย และคุณยังต้องจ่ายสำหรับ 73 ขั้นตอนที่ไม่ได้ให้ผลลัพธ์ การกำหนดเส้นทางเซสชันเอเจนต์ที่ยาวนานผ่านเลเยอร์ที่สลับไปใช้ผู้ให้บริการรายอื่นของโมเดลเดียวกันเมื่อเกิดความล้มเหลว คือความต่างระหว่างชุดทดสอบที่ล้มเหลวไม่แน่นอนกับชุดที่ถูกขัดจังหวะ นั่นเป็นคุณสมบัติทางวิศวกรรมธรรมดา ๆ และเป็นคุณสมบัติที่ตัดสินว่าต้นทุนต่องานที่เสร็จสมบูรณ์ซึ่งคุณวัดได้ จะอยู่รอดเมื่อเผชิญกับการรันจริงหนึ่งสัปดาห์หรือไม่

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

แต่ละอย่างจริงๆ แล้วใช้ทำอะไร

ถ้าคุณมีแอป Android และชุดทดสอบ คุณย่อมต้องการ ARTEMIS และ Qwen3.8-Flash ก็เป็นเอนจินตัวเลือกสำหรับมัน มากกว่าจะเป็นทางเลือกแทนมัน — เป็นตัวเลือกที่ไม่มีเอกสารกำกับ คุ้มค่ากับการทดลองสักบ่ายหนึ่ง และมีราคาที่ทำให้การทดลองนั้นไม่ทำให้คุณต้องเสียค่าใช้จ่ายอะไรที่วัดได้ หากคุณกำลังเลือกโมเดลสำหรับโมบายเอเจนต์ที่คุณเขียนเอง เดลตา AndroidWorld +22.5 จุด เป็นเหตุผลที่ควรลองดู Qwen3.8-Flash ไม่ใช่เหตุผลที่จะเชื่อมัน เพราะมันเป็นเดลตาที่ผู้ขายรายงานเอง โดยไม่มีคะแนนสัมบูรณ์แนบมาด้วย และไม่มีการทำซ้ำอย่างอิสระ

สิ่งที่ทั้งสองโปรเจกต์กำลังถกกันอยู่เงียบ ๆ ก็คือเรื่องเดียวกัน และไม่มีฝ่ายไหนพูดมันออกมาตรง ๆ Google กำลังอ้างว่าฮาร์เนสคือสิ่งที่ทำให้เอเจนต์มือถือเชื่อถือได้ และเปิดซอร์สมันขึ้นมาเพื่อให้ตรวจสอบข้ออ้างนั้นได้ Alibaba กำลังอ้างว่าต้นทุนต่อหนึ่งงานที่ทำสำเร็จคือตัวเลขเดียวที่สำคัญ และตั้งราคาตามนั้น ทั้งคู่น่าจะถูก ซึ่งเป็นเหตุผลว่าทำไมการตั้งค่าที่น่าสนใจจึงไม่ใช่ ARTEMIS หรือ Qwen3.8 — แต่คือ ARTEMIS บน Qwen3.8-Flash วัดบนแอปของคุณเอง โดยเปิด trace ไว้

และเนื่องจาก ARTEMIS อ่านบริบทที่เติบโตขึ้นซ้ำในทุกขั้นตอน อัตราส่วนจึงดีขึ้นอีกสำหรับ โมเดลใดก็ตามที่มีการอ่านแคชที่ถูกกว่า.

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube