
GPT-6.1 Sol vs Qwen3.8-Max: ใบแจ้งหนี้ ไม่ใช่รายการราคา
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ลองเอางานบำรุงรักษารีโพซิทอรีตอนกลางคืนมาหนึ่งงาน รันคืนละครั้งเป็นเวลาหนึ่งเดือน แล้วให้ GPT-6.1 Sol และ Qwen3.8-Maxมาทำงานนี้สลับกัน จากตัวเลขต่องานของ Artificial Analysis v4.3.2, GPT-6.1 Sol มีค่าใช้จ่าย $21.72 สำหรับสามสิบคืนนั้น และ Qwen3.8-Max มีค่าใช้จ่าย $162.27 — ช่องว่าง $140.55 ต่อเดือน ประมาณ $1,690 ต่อปี สำหรับงานที่ราคาต่อโทเคนระบุไว้ที่ $2.00 ขาเข้า และ $10.00 ขาออก เทียบกับ $2.00 ขาเข้า และ $6.00 ขาออก อัตราต่อล้านนั้นต่างกันเพียงความคลาดเคลื่อนจากการปัดเศษในส่วนขาเข้า และโมเดลจีนถูกกว่า 40% ในส่วนขาออก แต่ใบแจ้งหนี้กลับต่างกันถึง 7.5 เท่า ผู้ขายเปิดตัว GPT-6.1 Sol เมื่อวันที่ 29 กันยายน 2026; Qwen3.8-Max เปิดให้บริการมาตั้งแต่ 3 สิงหาคม 2026
ช่องว่างนั้นไม่ใช่กลเม็ดการตั้งราคา และไม่ใช่ผลลัพธ์เทียมจากการวัดมาตรฐาน — มันคือทั้งหมดที่การเปรียบเทียบนี้มีจะบอก และมันมาจากตัวเลขเพียงตัวเดียวที่ไม่มีตารางอัตราค่าบริการใดแสดงให้คุณเห็น
แต่ละโมเดลคืออะไร
GPT-6.1 Sol เป็นเรือธงด้านการให้เหตุผลและการเขียนโค้ดรุ่นปัจจุบันของ OpenAI เปิดตัวหนึ่งสัปดาห์หลังจาก GPT-6 Sol ที่มันเข้าแทนที่ ในราคาตามรายการเดียวกันที่ 2.00 / 10.00 ดอลลาร์ พร้อมอัตราอินพุตแบบแคช 0.10 ดอลลาร์ และหน้าต่างบริบทขนาด 1,050,000 โทเคน ผลิตภัณฑ์นี้จำหน่ายสำหรับงานเอเจนต์ โดยแท็ก best-for บนการ์ดโมเดลของเราเองระบุว่า การให้เหตุผล การเขียนโค้ด และงานเอเจนต์ และยังได้คะแนนคุณภาพระดับสูงสุด
Qwen3.8-Max เป็นเรือธงแบบเอเจนต์ของ Alibaba — โมเดลแบบปิดที่ใช้ได้เฉพาะผ่าน API ซึ่งรับอินพุตข้อความ รูปภาพ และวิดีโอ และมีบริบท 1,000,000 โทเค็น ต่างจากรุ่น Qwen ที่เล็กกว่า รุ่นนี้ไม่มีน้ำหนักที่เปิดเผย บน Artificial Analysis มันอยู่ที่ 45.42 บน Intelligence Index เป็นอันดับที่ 17 จาก 147 โมเดล โดยมีดัชนีการเขียนโค้ด 76.2 ซึ่งอยู่ในอันดับที่ 9 ในด้านนั้น ไม่ใช่โมเดลที่อ่อนแอ มันเป็นเพียงโมเดลที่แพงที่จะปล่อยให้คิด
หมายเลขที่ไม่อยู่ในตารางราคา

Artificial Analysis บันทึกโทเคนเอาต์พุต 107,730 โทเคนต่องานสำหรับ Qwen3.8-Max โดย 70,830 โทเคนเป็นโทเคนการให้เหตุผล GPT-6.1 Sol สร้างโทเคนเอาต์พุต 38,128 โทเคน โดย 25,190 โทเคนเป็นการให้เหตุผล โมเดลจีนเขียนโทเคนมากกว่า 2.8 เท่าเพื่อตอบคำถามเดียวกัน และเขียนในราคาถูกกว่า 40% ต่อโทเคน
• โทเคนเอาต์พุตต่องาน — 38,128 เทียบกับ 107,730; Qwen เขียนมากกว่า 2.8 เท่า
• ซึ่งเป็นการให้เหตุผล — 25,190 เทียบกับ 70,830
• ค่าใช้จ่ายต่องาน — $0.724 เทียบกับ $5.409; Qwen มีค่าใช้จ่ายสูงกว่า 7.5 เท่า
• เวลาต่องาน — 640 วินาที เทียบกับ 2,152 วินาที; ประมาณ 11 นาที เทียบกับประมาณ 36
• เวลาถึงโทเคนแรกของคำตอบ — 332.0 วินาที เทียบกับ 55.1 วินาที
Intelligence Index — 51.83 เทียบกับ 45.42
• หน้าต่างบริบท — 1,050 เทียบกับ 1,000 โทเคน
• อินพุตที่รองรับ — ข้อความ รูปภาพ และไฟล์ เทียบกับ ข้อความ รูปภาพ และวิดีโอ
ลองคูณดูสิ แล้วส่วนลดก็หายไป โมเดลที่ปล่อยโทเค็นเกือบสามเท่าในอัตราที่ต่ำกว่า 40% ไม่ได้มีต้นทุนที่ต่ำกว่า — เฉพาะเอาต์พุตอย่างเดียวก็มีต้นทุนสูงกว่าประมาณ 1.7 เท่า และตัวเลขที่วัดได้ต่องานทำให้ตัวคูณที่แท้จริงอยู่ที่ 7.5 เมื่อนำอินพุต การอ่านจากแคช และความยาวของคำตอบที่ใช้งานได้จริงมาคิดรวมแล้ว
สังเกตบรรทัดที่สี่และห้า เพราะมันชี้ไปในทิศทางตรงกันข้าม และเมื่อรวมกันแล้วก็อธิบายได้ว่า Qwen3.8-Max คืออะไร มันคืนโทเคนแรกภายใน 55 วินาที ในขณะที่ GPT-6.1 Sol ใช้เวลาห้านาทีครึ่ง จากนั้นใช้เวลาสามสิบหกนาทีในการทำภารกิจให้เสร็จ ในขณะที่โมเดลของ OpenAI ทำเสร็จในสิบเอ็ดนาที นั่นคือโมเดลที่เริ่มพูดทันทีและคิดอย่างยาวนานมาก สำหรับอินเทอร์เฟซแชทที่มีคำตอบแบบสตรีมมิ่ง มันให้ความรู้สึกว่าเป็นการตอบสนองที่รวดเร็ว สำหรับงานกลางคืนที่ไม่มีคนเฝ้า มันคือเวลาตามนาฬิกาที่คุณต้องจ่ายไปด้วยเช่นกัน
สามด้านที่ Qwen3.8-Max เหนือกว่าอย่างแท้จริง
ช่องว่างของดัชนีอยู่ที่ 6.4 คะแนนทั่วทั้งชุด ซึ่งเป็นตัวเลขประเภทที่มักถูกยกมาอ้างราวกับว่ามันสม่ำเสมอ แต่ไม่ใช่ และความไม่ลงรอยกันนั้นให้ข้อคิด:
• GPQA Diamond — Qwen3.8-Max 0.9283 เทียบกับ GPT-6.1 Sol ไม่ได้เผยแพร่ในการรันนี้
• GDPval — 1,671.4 เทียบกับ 1,575.09
• Terminal-Bench 2.1 — 0.8876 เทียบกับไม่ได้เผยแพร่ในรอบนี้
• AutomationBench — 0.5619 เทียบกับ 0.6487
• SciCode — ไม่ได้เผยแพร่ในการรันครั้งนี้ เทียบกับ 0.5417 สำหรับ GPT-6.1 Sol
• CritPT — 0.1771 vs 0.3171
Qwen3.8-Max ชนะคำถามวิทยาศาสตร์ระดับบัณฑิตศึกษาและตัวอย่างงานตามอาชีพ ซึ่งเป็นผลลัพธ์จริงสำหรับโมเดลรุ่นเดียวกัน และเป็นเหตุผลที่ดัชนีการเขียนโค้ดของมันอยู่อันดับ 9 จาก 138 มันแพ้การประเมินที่ยากกว่าและใกล้เคียงงานวิจัย — CritPT ห่าง 14 คะแนน — และแพ้ AutomationBench 8.7 คะแนน ซึ่งเป็นตัวที่คล้ายกับงานคอมพิวเตอร์แบบไม่มีคนดูแลมากที่สุด ไม่ว่าคุณจะเชื่อว่าสองตัวนั้นตัวไหนสำคัญกว่าสำหรับภาระงานของคุณ นั่นคือการตัดสินใจจริง ตัวเลขพาดหัว 6.4 คะแนนเป็นค่าเฉลี่ยจากความเห็นที่ไม่ตรงกัน ไม่ใช่คำตัดสิน
โทเค็นพิเศษให้ประโยชน์อะไร และไม่ได้ให้ประโยชน์อะไร
ร่องรอยการใช้เหตุผลแบบยาวไม่ใช่ความสูญเปล่าโดยตัวนิยาม โมเดลที่ใช้ 70,830 โทเคนในการครุ่นคิดกับงานยากกำลังทำบางสิ่งบางอย่างที่โมเดลที่สั้นกว่าอาจข้ามไป และในการประเมินที่ Qwen3.8-Max อยู่ข้างหน้า การครุ่นคิดนั้นก็เป็นเหตุผลที่เป็นไปได้ โหมดความล้มเหลวคือคุณต้องจ่ายสำหรับมันในทุกงาน ไม่ใช่แค่งานยาก จำนวนโทเคนการใช้เหตุผลเป็นคุณสมบัติของการปรับคาลิเบรชันของโมเดล ไม่ใช่ของคุณสมบัติของความยากของคำถาม และโมเดลที่คิดมากเกินไปกับการสกัดข้อมูลเพียงหนึ่งบรรทัดก็เรียกเก็บเงินจากคุณสำหรับสิ่งนั้น
วิธีที่จะรู้ว่างานแต่ละชิ้นของคุณคือชิ้นไหน คือหยุดมองว่าการเลือกโมเดลเป็นแบบ global ซึ่งพาเรามาถึงส่วนที่เป็นการเปลี่ยนแปลง config
โมเดลการ์ดของเราเองสำหรับ GPT-6.1 Sol มีตัวเลขที่ให้บริการของ subject: อัตรา $2.00 / $10.00 หน้าต่างบริบท 1,050,000 โทเคน p50 4.54 วินาทีถึงโทเคนแรก และบล็อกดัชนี Artificial Analysis ที่จัดเก็บไว้ในหน้าเดียวกันกับราคาที่แอปพลิเคชันจะใช้กำหนดเส้นทางจริง

หนึ่งคีย์ หนึ่งมิเตอร์ สองรุ่น
ทั้งสองโมเดลเข้าถึงได้ผ่านปลายทาง OrcaRouter เพียงจุดเดียว — API เดียวสำหรับโมเดลกว่า 200 ตัว โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านตรงที่มาร์กอัป 0% การ์ด OrcaRouter สำหรับ Qwen3.8-Max แสดงอัตราค่าบริการที่ให้บริการ ควบคู่กับหน้าต่างบริบท 1,000,000 โทเคน รูปแบบอินพุตแบบข้อความ/ภาพ/วิดีโอ และปริมาณการใช้งานในเจ็ดวัน 101.4 ล้านโทเคน — ตัวเลขที่แอปพลิเคชันใช้กำหนดเส้นทาง เทียบเคียงกับตัวเลขที่บทความโต้แย้งกัน การส่งผ่านตรงนี้สำคัญเป็นพิเศษสำหรับ Qwen3.8-Max เพราะโมเดลที่เศรษฐศาสตร์ของมันขึ้นอยู่กับปริมาณโทเคนเอาต์พุตเป็นหลัก คือโมเดลที่ผู้ขายสามารถปรับราคาได้ทุกเมื่อ และมิเตอร์แบบส่งผ่านตรงหมายความว่าการเปลี่ยนแปลงนั้นไปถึงใบแจ้งหนี้ของคุณในวันที่ Alibaba ประกาศ ไม่ใช่ตามตารางเวลาของผู้ขายรายย่อย

การใช้เลเยอร์ routing ที่น่าสนใจกว่าในที่นี้คือ routing DSL ซึ่งช่วยให้คุณประกอบโมเดลหลายตัวเข้าไว้ในการเรียกครั้งเดียว แทนที่จะเลือกโมเดลเดียวสำหรับทั้งแอปพลิเคชัน แบ่งงาน nightly job ออกเป็นส่วน ๆ: โมเดลราคาถูกทำหน้าที่จำแนกและสกัดข้อมูล, GPT-6.1 Sol รับผิดชอบขั้นตอนการให้เหตุผลและการตรวจสอบ, และ Qwen3.8-Max ถูกสงวนไว้สำหรับงานที่การครุ่นคิดอย่างยาวนานและความแข็งแกร่งด้านวิทยาศาสตร์ระดับ GPQA ของมันเปลี่ยนคำตอบได้จริง ระบบ failover อัตโนมัติครอบคลุมส่วนที่เหลือ — หากผู้ให้บริการมีประสิทธิภาพลดลงระหว่างการทำงาน คำขอจะถูกย้ายไปแทนที่จะทำให้แบตช์ล้มเหลว
ทั้งสองอย่างนี้ไม่ใช่เหตุผลในการเลือกโมเดล สิ่งเหล่านี้คือเหตุผลที่คุณไม่จำเป็นต้องเลือกเพียงครั้งเดียวแล้วต้องอยู่กับมันไปตลอด
การเรียก และสิ่งที่ต้องจับตา
จ่ายในราคา 7.5 เท่าเฉพาะตรงที่การคิดอย่างรอบคอบนั้นคุ้มค่าเท่านั้น สำหรับงานรันทุกคืนแบบอเนกประสงค์ GPT-6.1 Sol ที่ราคา $0.724 ต่องาน ถือเป็นทางเลือกเริ่มต้นที่สมเหตุสมผล และ $1,690 ต่อปีก็เป็นตัวเลขจริง เมื่องานเป็นวิทยาศาสตร์ยากหรือการให้เหตุผลเชิงอาชีพที่มีคำตอบตรวจสอบได้ คะแนน 0.9283 ของ Qwen3.8-Max บน GPQA Diamond ก็คุ้มค่ากับโทเคน — นั่นคือสิ่งที่มันทำได้ดีกว่าโดยเฉพาะ
สิ่งที่ต้องจับตาคือ Alibaba จะปรับราคาใหม่หรือไม่ โมเดล 2.8×-token ที่ราคา $2.00/$6.00 ถูกตั้งราคาราวกับว่า token เป็นสิ่งหายาก แต่พฤติกรรมของตัวโมเดลเองกลับทำให้ token มีอยู่อย่างล้นเหลือ หากอัตราค่าเอาต์พุตขยับอย่างมีนัยสำคัญ ตัวเลขคณิตในบทความนี้ก็จะขยับตามไปด้วย และมาตรวัดการส่งผ่านจะแสดงให้คุณเห็นในวันเดียวกับที่มันเกิดขึ้น
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
