
GPT-6 Luna กับ Qwen3.8-Max: โมเดลที่ถูกที่สุดในการเปรียบเทียบนี้ยังเป็นเพียงหนึ่งเดียวที่ดูวิดีโอได้
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
วิธีวางกรอบที่เห็นได้ชัดสำหรับการจับคู่นี้เป็นวิธีที่ผิด Qwen3.8-Maxมีราคาอยู่ที่ 2.00 ดอลลาร์ต่อล้านโทเคนอินพุต และ 6.00 ดอลลาร์ต่อล้านโทเคนเอาต์พุต โดยการอ่านแคชอยู่ที่ 0.25 ดอลลาร์ GPT-6 Lunaมีราคาอยู่ที่ 0.10 ดอลลาร์และ 0.50 ดอลลาร์ โดยการอ่านแคชอยู่ที่หนึ่งเซนต์ ห่างกันยี่สิบเท่าในอินพุต สิบสองเท่าในเอาต์พุต ห้าสิบเท่าในอินพุตที่แคชไว้ — ช่องว่างราคาที่กว้างจนการเปรียบเทียบดูเหมือนจะได้ข้อสรุปตั้งแต่ยังไม่เริ่ม
ยังไม่ยุติ เพราะสองโมเดลไม่ได้แข่งขันกันสำหรับคำขอเดียวกัน Qwen3.8-Max รองรับข้อความ รูปภาพ และวิดีโอ และเพดานเอาต์พุต 131,072 โทเค็นนั้นสูงกว่า 128,000 ของ GPT-6 Luna เล็กน้อย GPT-6 Luna รองรับเฉพาะข้อความและรูปภาพ โมเดลของ Alibaba ได้คะแนน 58 ในดัชนี Intelligence Index อิสระ — เป็นอันดับหนึ่งในคลาสของมันบนบอร์ดแบบเอเจนต์ — และ GPT-6 Luna ได้คะแนน 37 ที่ความพยายามสูงสุด, 29 ที่ค่าเริ่มต้น หนึ่งคือเรือธงที่มีตระกูลโอเพนเวทและโมดัลลิตี้อินพุตวิดีโอ อีกหนึ่งคือระดับปริมาณที่มีตัวเลขความเร็วและอัตราแคชหนึ่งเซนต์ ช่องว่างราคาไม่ใช่ส่วนลดสำหรับสิ่งเดียวกัน แต่เป็นคำอธิบายของสองสิ่งที่แตกต่างกัน
แต่ละอันในสองอันนี้คืออะไร
Qwen3.8-Max คือเรือธงของ Alibaba ประจำรุ่นที่ 3.8 เป็นเช็กพอยต์ระดับ Max ที่โมเดลพื้นฐาน — Qwen3.8-2.4T-A95B — เปิดให้สาธารณะภายใต้สัญญาอนุญาตแบบกำหนดเองเมื่อวันที่ 12 สิงหาคม 2026 ทำให้เป็น Qwen ระดับ Max รุ่นแรกที่มีน้ำหนักแบบเปิดเผยเลยทีเดียว ส่วนเรือธงที่ให้บริการโฮสต์เองยังคงถูกจัดอยู่ในประเภทซอฟต์แวร์ปิดโดยคณะกรรมการอิสระ มีหน้าต่างบริบทขนาด 1,000,000 โทเคน เพดานเอาต์พุต 131,072 โทเคน รับข้อความ รูปภาพ และวิดีโอเป็นอินพุต และเลือกความเข้มข้นในการให้เหตุผลได้ที่ระดับต่ำ กลาง และสูงมากเป็นพิเศษ รีวิชัน Qwen3.8-Max-0902 แบบปักหมุดมีให้ใช้ในราคาเดียวกัน ซึ่งเป็นรายละเอียดเล็ก ๆ ที่มีคุณค่าจริงในทางปฏิบัติ
GPT-6 Luna คือระดับประสิทธิภาพของ OpenAI ตั้งแต่วันที่ 22 กันยายน 2026 โดยอยู่ต่ำกว่า GPT-6 Sol ที่ราคา $2.00/$10.00 และ GPT-6 Astra รุ่นเรือธงที่ $10.00/$50.00 รับข้อความและรูปภาพเข้า ส่งออกเป็นข้อความ หน้าต่างขนาด 1,050,000 โทเคน พร้อมอินพุตสูงสุด 922,000 เพดานเอาต์พุต 128,000 โทเคน และระดับ effort ตั้งแต่ none ไปจนถึง low, medium, high, xhigh และ max โดยมี medium เป็นค่าเริ่มต้น เป็นโมเดลแบบปิด ใช้ตัวระบุเดียว ใช้งานได้สำหรับทุกคนที่มีคีย์ API
ตัวหนึ่งรับวิดีโอและสามารถดาวน์โหลดได้ในรูปแบบพื้นฐานของมัน อีกตัวรับรูปภาพและรวดเร็ว ทั้งสองมีราคาที่กำหนดมาให้ใช้งานในปริมาณมาก ความทับซ้อนระหว่างสองข้อความนั้นน้อยกว่าที่อัตราส่วนราคาบ่งชี้ไว้
การ์ด ทีละบรรทัด
หนึ่งบรรทัดต่อมิติ โดยเปิดทั้งสองด้านในแต่ละบรรทัด:
• อินพุตต่อ 1M — GPT-6 Luna $0.10 เทียบกับ Qwen3.8-Max $2.00
• เอาต์พุตต่อ 1M — GPT-6 Luna $0.50 เทียบกับ Qwen3.8-Max $6.00
• อินพุตที่แคชไว้ต่อ 1M — GPT-6 Luna $0.01 เทียบกับ Qwen3.8-Max $0.25 สำหรับการอ่านแคชแบบ implicit โดยมีการอ่านแคชแบบ explicit ที่ $0.17 และการเขียนแคชแบบ explicit ที่ $2.50
• ข้อกำหนดเรื่องบริบทขนาดยาว — GPT-6 Luna เพิ่มอินพุตและแคชเป็นสองเท่า และเพิ่มเอาต์พุต 1.5× เมื่อเกิน 272,000 โทเคนอินพุต โดยมีผลกับทั้งคำขอ เทียบกับ Qwen3.8-Max ที่ใช้อัตราคงที่ระดับเดียวตลอดหน้าต่างทั้งหมด ซึ่งเป็นจุดเดียวที่การ์ด Qwen ดีกว่าในเชิงโครงสร้าง มากกว่าจะเป็นเพียงแค่ถูกกว่าเล็กน้อย
• หน้าต่างบริบท — GPT-6 Luna 1,050,000 โทเคน เทียบกับ Qwen3.8-Max 1,000,000 โทเคน
• เอาต์พุตสูงสุด — GPT-6 Luna 128,000 โทเคน เทียบกับ Qwen3.8-Max 131,072 โทเคน
• รูปแบบอินพุต — GPT-6 Luna รองรับข้อความและรูปภาพ เทียบกับ Qwen3.8-Max รองรับข้อความ รูปภาพ และวิดีโอ
• ระดับความพยายามในการให้เหตุผล — GPT-6 Luna none, low, medium (ค่าเริ่มต้น), high, xhigh, max เทียบกับ Qwen3.8-Max low, medium และ extra-high
• ดัชนีความฉลาด (Intelligence Index) แบบอิสระ — GPT-6 Luna 37 ที่ระดับความพยายามสูงสุด เทียบกับ Qwen3.8-Max 58
• Agentic Index, อิสระ — Qwen3.8-Max 58 เป็นที่หนึ่งในกลุ่มของตัวเอง; ยังไม่มีการเผยแพร่ตัวเลข GPT-6 Luna ที่เทียบเคียงได้
• คะแนนที่ระดับความพยายามเริ่มต้น — GPT-6 Luna 29 ที่ระดับ medium เริ่มต้น เทียบกับ Qwen3.8-Max ที่วัด ณ การตั้งค่าสูงสุด
• ค่าใช้จ่ายต่องาน Index โดยอิสระ — GPT-6 Luna ประมาณ $0.07 เทียบกับ Qwen3.8-Max $5.41
• GDPval ซึ่งเป็นอิสระ — Qwen3.8-Max ทำได้ 1,739 Elo ที่ 64 เทิร์นต่องาน ซึ่งคิดเป็นประมาณ $1.14 ต่องานที่เสร็จสมบูรณ์ในการประเมินนั้น; ยังไม่มีการเผยแพร่การทดสอบ GPT-6 Luna ที่เทียบเคียงได้
• อัตราการหลอนข้อมูลใน AA-Omniscience — Qwen3.8-Max อยู่ที่ 40% ซึ่งเป็นการถดถอยจาก 23% ในรุ่นก่อนหน้า; GPT-6 Luna อยู่ที่ 77% ลดลงจาก 93%
• สแนปช็อตที่ระบุวันที่ — GPT-6 Luna เป็นตัวระบุแบบโรลลิ่งเพียงตัวเดียว เทียบกับ Qwen3.8-Max-0902 ที่มีให้ใช้เป็นรีวิชันแบบปักหมุดวันที่ 2 กันยายน 2026 ในราคาเดียวกัน
• น้ำหนัก — GPT-6 Luna ปิด, API เท่านั้น เทียบกับ Qwen3.8-Max เช็คพอยต์ฐาน Qwen3.8-2.4T-A95B เผยแพร่ต่อสาธารณะภายใต้สัญญาอนุญาตแบบกำหนดเองตั้งแต่ 12 สิงหาคม 2026 ในขณะที่เรือธงที่โฮสต์ไว้ถูกระบุว่าเป็นกรรมสิทธิ์
• บน OrcaRouter — GPT-6 Luna ไม่อยู่ในแค็ตตาล็อกของเรา เทียบกับ Qwen3.8-Max ที่สามารถจัดเส้นทางได้ในราคาตามรายการของ Alibaba

วิดีโอไม่ใช่ฟีเจอร์ไลน์ แต่เป็นเวิร์กโหลดที่แตกต่างออกไป
แถว modality คือแถวที่ตัดสินการเปรียบเทียบจริงได้มากกว่าแถวราคา และมักถูกอ่านเป็นช่องทำเครื่องหมาย
Qwen3.8-Max รองรับวิดีโอ ส่วน GPT-6 Luna ไม่รองรับ หากไปป์ไลน์ของคุณจำเป็นต้องวิเคราะห์วิดีโอหน้าจอ ไม่ว่าจะเป็นเดโมผลิตภัณฑ์ บันทึกการบรรยาย ไฟล์จากกล้องวงจรปิด หรือการเดินสำรวจ UI การเปรียบเทียบก็จบลงตรงจุดนั้น และส่วนต่างราคายี่สิบเท่าก็ไม่มีความหมายอีกต่อไป — คุณไม่ได้กำลังเลือกระหว่างตัวเลือกแพงกับตัวเลือกถูก แต่คุณกำลังเลือกระหว่างตัวเลือกกับความไม่มีตัวเลือก การดึงเฟรมออกมาแล้วส่งเป็นรูปภาพนั้นเป็นเพียงวิธีเลี่ยง ไม่ใช่สิ่งที่เทียบเท่ากัน และใครก็ตามที่เคยสร้างมันขึ้นมาย่อมรู้ถึงความต่างทั้งในแง่ต้นทุนและคุณภาพ
ถ้าไปป์ไลน์ของคุณเป็นข้อความและรูปภาพ บรรทัดโมดาลิตีจะเงียบ และบรรทัดราคาจะพูด นั่นคือการแบ่งที่ตรงไปตรงมา และคุ้มค่าที่จะพูดตรง ๆ ว่าคุณอยู่ฝั่งไหนของมันก่อนที่จะอ่านสิ่งอื่นใดในหน้านี้
ช่องว่างแบบเอเจนต์มีอยู่จริง และมันคือครึ่งที่แพงของส่วนต่างราคา
Qwen3.8-Max ได้คะแนน 58 บน Intelligence Index ฉบับอิสระ GPT-6 Luna ได้คะแนน 37 เมื่อใช้ความพยายามสูงสุด และ 29 ที่ค่าเริ่มต้นระดับ medium ยี่สิบเอ็ดคะแนนเมื่อตั้งค่าให้ตรงกัน ยี่สิบเก้าคะแนนที่ค่าเริ่มต้น — บนคะแนนรวมที่คะแนนเพียงหนึ่งจุดยังอยู่ในช่วงความแปรปรวนจากการรันซ้ำ ช่องว่างขนาดนั้นไม่ใช่ความแปรปรวน
จุดยืนของ Qwen3.8-Max กระจุกตัวอยู่ในงานแบบ agentic โดยได้ 58 คะแนนบน Agentic Index อิสระ เป็นอันดับหนึ่งในกลุ่มเดียวกัน และ 1,739 Elo บน GDPval ที่ 64 รอบต่องาน ตัวเลขหลังสุดนี่แหละที่ให้ข้อมูล เพราะมันคือการวัดว่าโมเดลหนึ่งสามารถประคองงานให้ต่อเนื่องผ่านการตัดสินใจตามลำดับถึงหกสิบสี่ครั้งได้หรือไม่ และมันมาพร้อมป้ายราคาติดอยู่: ประมาณ $1.14 ต่อหนึ่งงานที่ทำสำเร็จในการประเมินนั้น ลองเทียบกับต้นทุนต่อหนึ่งงานในดัชนีของ GPT-6 Luna ที่ประมาณ $0.07 แล้ว ข้อความที่ตรงไปตรงมาคือไม่ใช่ว่า Qwen แพง หากแต่คือ Qwen ถูกขอให้ทำสิ่งที่ยากกว่ามาก และ它也
ข้อสรุปก็คือ ส่วนต่าง 21 คะแนนของ GPT-6 Luna ก็ไม่ได้กระจายอย่างสม่ำเสมอทั่วทั้งปริมาณงานของคุณเช่นกัน ในงานสั้น ๆ ที่มีข้อกำหนดชัดเจนและโปรแกรมนำไปใช้ — ดึงฟิลด์นี้ จำแนกตั๋วนี้ จัดเส้นทางคำขอนี้ — ทั้งสองโมเดลจะให้คำตอบที่ใช้งานได้เหมือนกันเกือบตลอดเวลา และช่องว่างของดัชนีจะมองไม่เห็นในการประเมินของคุณ ในงานที่ต้องดำเนินการตามลำดับ 64 ขั้นตอนโดยมีจุดตรวจสอบที่ตอนท้าย ช่องว่างคือความแตกต่างระหว่างการทำงานให้เสร็จสิ้นกับการหยุดกลางคันอย่างเงียบ ๆ และนั่นคืองานที่ Qwen3.8-Max ถูกสร้างมาเพื่อ ส่วน GPT-6 Luna ไม่ใช่
ตัวเลขหนึ่งชี้ไปในทางตรงกันข้าม และสมควรได้รับการกล่าวถึงมากกว่าจะถูกฝังไว้ อัตราการสร้างข้อมูลเท็จของ Qwen3.8-Max บนบอร์ด omniscience อยู่ที่ 40% เพิ่มขึ้นจาก 23% ในรุ่นก่อนหน้า — เป็นการถดถอยอย่างมาก และเป็นแบบที่โผล่มาเป็นคำตอบผิดอย่างมั่นใจในงานจริง มากกว่าจะเป็นเพียงบรรทัดหนึ่งในเบนช์มาร์ก ของ GPT-6 Luna อยู่ที่ 77% ลดลงจาก 93% ตัวเลขทั้งสองสูงในเชิงสัมบูรณ์ และโมเดลที่ถูกกว่าก็ยังเป็นตัวที่แย่กว่าในสองตัวเมื่อวัดตามเกณฑ์นี้ ไม่มีตัวเลขใดเป็นเหตุผลให้เลือกโมเดลหนึ่งเหนืออีกโมเดล ทั้งคู่เป็นเหตุผลที่ต้องมีมนุษย์หรือผู้ตรวจสอบอยู่ในลูปสำหรับทุกกรณีที่ข้อเท็จจริงที่ถูกกุขึ้นมามีต้นทุนสูง
อนุประโยคว่าด้วยบริบทความยาวคือบรรทัดเดียวที่ Qwen ชนะในด้านโครงสร้าง
GPT-6 Luna มีข้อกำหนดข้อหนึ่งที่ Qwen3.8-Max ไม่มี: คำขอที่มีโทเคนอินพุตเกิน 272,000 จะถูกคิดค่าบริการในอัตราสองเท่าของอัตราอินพุตและแคช และ 1.5 เท่าของอัตราเอาต์พุต โดยคิดกับทั้งคำขอ ไม่ใช่เฉพาะส่วนที่เกินเกณฑ์ การเรียก 300,000 โทเคนบน GPT-6 Luna จะถูกคิดที่ $0.20 ต่อล้านโทเคนอินพุตสำหรับทั้ง 300,000 โทเคน เพราะเกินเกณฑ์ไป 28,000 แบ่งเอกสารเดียวกันออกเป็นสองคำขอ แล้วค่าใช้จ่ายจะลดลงครึ่งหนึ่งโดยไม่มีการเปลี่ยนแปลงพรอมป์ต
Qwen3.8-Max มีอัตราคงที่ตลอดหน้าต่าง 1,000,000 โทเคนเต็มรูปแบบ สำหรับคำขอเดี่ยวที่ใหญ่โตจริง ๆ นั่นทำให้ช่องว่างราคาเอาต์พุตที่ต่างกันถึงสิบสองเท่าดูเล็กลงกว่าที่เห็น และอาจพลิกกลับได้ เมื่อเกิน 272,000 โทเคนอินพุต อัตราอินพุตที่แท้จริงของ GPT-6 Luna จะเพิ่มเป็นสองเท่าเป็น $0.20 และอัตราเอาต์พุตเพิ่มขึ้นเป็น $0.75 เทียบกับอัตราคงที่ของ Qwen ที่ $2.00 และ $6.00 ช่องว่างแคบลงจากยี่สิบเท่าเหลือสิบเท่าในด้านอินพุต และจากสิบสองเท่าเหลือแปดเท่าในด้านเอาต์พุต ยังคงกว้างอยู่ — แต่ปริมาณงานที่มีแนวโน้มมากที่สุดที่จะมีบริบทการทำงาน 300,000 โทเคน ก็คือปริมาณงานแบบเอเจนต์ที่ผู้ขายทั้งสองรายต่างขายให้ และทีมที่รันงานเหล่านั้นคือทีมที่จะสังเกตเห็น
รายการเชิงโครงสร้างอีกรายการคือเวอร์ชันที่ปักหมุดไว้ Qwen3.8-Max-0902 มีให้ใช้ในราคาเดียวกับตัวระบุแบบหมุนเวียน ซึ่งหมายความว่าทีมที่ต้องการพฤติกรรมที่ทำซ้ำได้แม้มีการอัปเดตโมเดลสามารถมีสิ่งนั้นได้โดยไม่ต้องจ่ายเพิ่ม GPT-6 Luna ไม่มีสิ่งที่เทียบเท่า นั่นเป็นรายการเล็ก ๆ บนเรตการ์ด และเป็นรายการใหญ่ในบทวิเคราะห์หลังเหตุการณ์
รันหนึ่งในนั้น หรือทั้งสอง
Qwen3.8-Max อยู่บน OrcaRouter ในราคาตามที่ Alibaba ประกาศ ภายใต้นโยบายราคาส่งผ่าน (pass-through) ซึ่งหมายความว่าหากผู้ให้บริการปรับอัตรา ฝั่งเราจะมีผลทันทีในวันเดียวกัน มีสองสิ่งที่เกี่ยวกับชั้นการจัดเส้นทางของเราที่พิสูจน์คุณค่าได้สำหรับโมเดลนี้โดยเฉพาะ ได้แก่ การสลับไปใช้ระบบสำรองอัตโนมัติ (automatic failover) เนื่องจากโมเดลเรือธงแบบโฮสต์ที่มีฐานเป็น open-weight ซึ่งเผยแพร่สาธารณะย่อมมีต้นทาง (upstream) มากกว่าโมเดลปิดจากผู้ขายรายเดียว และมีโอกาสมากกว่าที่หนึ่งในนั้นจะเสื่อมประสิทธิภาพลง และการจัดการเวอร์ชันแบบปักหมุด (pinned-revision) ซึ่งทำให้เส้นทางสามารถยึด Qwen3.8-Max-0902 ไว้อย่างชัดเจน แทนที่จะรับช่วงต่อจากสิ่งที่ตัวระบุแบบหมุนเวียน (rolling identifier) จะชี้ไปในสัปดาห์หน้า
ณ เวลาที่เขียนนี้ GPT-6 Luna ไม่ได้อยู่ในแค็ตตาล็อกของเรา และเข้าถึงได้ผ่าน API ของ OpenAI เอง ดังนั้นทีมที่ต้องการใช้ทั้งสองตัวก็ต้องใช้คีย์หนึ่งตัวสำหรับ Qwen3.8-Max ควบคู่ไปกับสิ่งที่ใช้กับ OpenAI อยู่แล้ว นี่ก็เป็นคู่ที่ DSL สำหรับการกำหนดเส้นทางมีค่ามากกว่าการแยกแบบตายตัว เพราะเส้นแบ่งระหว่างสองโมเดลนี้เป็นการตรวจสอบรูปแบบข้อมูลและการตรวจสอบความยาว ไม่ใช่ความ偏好: คำขอที่มีวิดีโอจะไปที่ Qwen3.8-Max เพราะไม่มีตัวอื่นรองรับได้ คำขอที่มีโทเค็นอินพุตเกิน 272,000 จะไปที่ Qwen3.8-Max เพราะจุดหักเหของอีกโมเดลหนึ่งทำให้มีค่าใช้จ่ายสูงกว่าที่นั่น และทุกอย่างที่เหลือจะไปที่โมเดลที่มีราคาหนึ่งในยี่สิบ นั่นคือกฎ และมันควรอยู่ในคอนฟิกูเรชันไม่ใช่ในสาขาของแอปพลิเคชัน

อันไหน และเมื่อไหร่
เลือก Qwen3.8-Max หากข้อใดข้อหนึ่งต่อไปนี้เป็นจริง ไปป์ไลน์ของคุณต้องมีวิดีโอเป็นอินพุต คำขอของคุณมักเกิน 272,000 โทเค็นอินพุต ซึ่งระดับราคาคงที่ของมันชนะการปรับราคาของ GPT-6 Luna เอาต์พุตของคุณเกิน 128,000 โทเค็น งานของคุณคือการรันเอเจนต์ระยะยาวที่มีจุดสิ้นสุดซึ่งตรวจสอบยืนยันได้ โดยที่คะแนน 58 ของมันบนบอร์ดเอเจนต์ และ 1,739 Elo บน GDPval ที่ 64 เทิร์นต่องาน คือหลักฐานที่สำคัญ หรือคุณต้องการเวอร์ชันที่ปักหมุดไว้เพื่อความสามารถในการทำซ้ำ และยินดีจ่ายสำหรับมัน — ซึ่งเมื่อราคาเท่ากับตัวระบุแบบหมุนเวียน นั่นหมายความว่าคุณไม่ได้ยินดีจ่าย
เลือก GPT-6 Luna หากไม่มีข้อใดในนั้นเข้าข่ายกับคุณ และปริมาณงานของคุณมีมาก ถูกเรียกใช้โดยโปรแกรม เป็นข้อความและรูปภาพ และเป็นงานสั้น การจำแนกประเภท การสกัดข้อมูล การกำหนดเส้นทาง การสรุปแบบจำนวนมาก ลูปภายในของเอเจนต์ที่ต้องการคำตอบที่รวดเร็วมากกว่าคำตอบที่รอบคอบ ที่ราคา $0.10/$0.50 พร้อมการอ่านแคชราคาหนึ่งเซนต์ และต้นทุนต่องานที่ทำเสร็จประมาณหนึ่งในสิบห้าของ Qwen3.8-Max ตัวเลขไม่ได้ใกล้เคียงกันเลย ตั้งค่าพารามิเตอร์ effort อย่างชัดเจน — ค่าเริ่มต้นคือ medium และตัวเลข 37 ที่เป็นพาดหัวคือค่าความพยายามสูงสุด — และให้การเรียกใช้แบบยาวอยู่ทางด้านที่ถูกต้องของเส้น 272,000 โทเคน
ความผิดพลาดที่การเปรียบเทียบนี้ชักชวนให้เกิด คือการอ่านราคาอินพุตที่แพงกว่ายี่สิบเท่าเป็นคำตัดสิน มันเป็นคำตัดสินต่อภาระงานรูปแบบหนึ่ง และมันเงียบต่อสามประเด็นที่ชี้ขาดอีกรูปแบบหนึ่ง คือคำขอมีวิดีโอมาด้วยหรือไม่ คำขอผ่าน 272,000 โทเค็นหรือไม่ และคำตอบต้องอยู่รอดผ่านหกสิบสี่ขั้นตอนตามลำดับหรือไม่

การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
