การ์ดฮีโร่ที่สร้างขึ้นชื่อ 'GPT-6.1 Sol vs Qwen3.8-Max' ที่มีแผงโค้งมนสองแผง: ด้านซ้าย 'GPT-6.1 Sol' แสดง 'OpenAI - เปิดตัว 29 ก.ย. 2026', '$2.00 อินพุต / $10.00 เอาต์พุต ต่อ 1M', '$0.72 ต่องาน' และ 'AA Index 51.8'; ด้านขวา 'Qwen3.8-Max' แสดง 'Alibaba - เปิดตัว 3 ส.ค. 2026', '$2.00 อินพุต / $6.00 เอาต์พุต ต่อ 1M', '$5.41 ต่องาน' และ 'AA Index 45.4'; ด้านล่างเป็นแถบ 'ราคาอินพุตเท่ากัน ใบแจ้งหนี้ 7.5 เท่า'; ส่วนท้าย 'ตัวเลข: Artificial Analysis v4.3.2.' และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

GPT-6.1 Sol vs Qwen3.8-Max: ใบแจ้งหนี้ ไม่ใช่รายการราคา

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ลองเอางานบำรุงรักษารีโพซิทอรีตอนกลางคืนมาหนึ่งงาน รันคืนละครั้งเป็นเวลาหนึ่งเดือน แล้วให้ GPT-6.1 Sol และ Qwen3.8-Maxมาทำงานนี้สลับกัน จากตัวเลขต่องานของ Artificial Analysis v4.3.2, GPT-6.1 Sol มีค่าใช้จ่าย $21.72 สำหรับสามสิบคืนนั้น และ Qwen3.8-Max มีค่าใช้จ่าย $162.27 — ช่องว่าง $140.55 ต่อเดือน ประมาณ $1,690 ต่อปี สำหรับงานที่ราคาต่อโทเคนระบุไว้ที่ $2.00 ขาเข้า และ $10.00 ขาออก เทียบกับ $2.00 ขาเข้า และ $6.00 ขาออก อัตราต่อล้านนั้นต่างกันเพียงความคลาดเคลื่อนจากการปัดเศษในส่วนขาเข้า และโมเดลจีนถูกกว่า 40% ในส่วนขาออก แต่ใบแจ้งหนี้กลับต่างกันถึง 7.5 เท่า ผู้ขายเปิดตัว GPT-6.1 Sol เมื่อวันที่ 29 กันยายน 2026; Qwen3.8-Max เปิดให้บริการมาตั้งแต่ 3 สิงหาคม 2026

ช่องว่างนั้นไม่ใช่กลเม็ดการตั้งราคา และไม่ใช่ผลลัพธ์เทียมจากการวัดมาตรฐาน — มันคือทั้งหมดที่การเปรียบเทียบนี้มีจะบอก และมันมาจากตัวเลขเพียงตัวเดียวที่ไม่มีตารางอัตราค่าบริการใดแสดงให้คุณเห็น

แต่ละโมเดลคืออะไร

GPT-6.1 Sol เป็นเรือธงด้านการให้เหตุผลและการเขียนโค้ดรุ่นปัจจุบันของ OpenAI เปิดตัวหนึ่งสัปดาห์หลังจาก GPT-6 Sol ที่มันเข้าแทนที่ ในราคาตามรายการเดียวกันที่ 2.00 / 10.00 ดอลลาร์ พร้อมอัตราอินพุตแบบแคช 0.10 ดอลลาร์ และหน้าต่างบริบทขนาด 1,050,000 โทเคน ผลิตภัณฑ์นี้จำหน่ายสำหรับงานเอเจนต์ โดยแท็ก best-for บนการ์ดโมเดลของเราเองระบุว่า การให้เหตุผล การเขียนโค้ด และงานเอเจนต์ และยังได้คะแนนคุณภาพระดับสูงสุด

Qwen3.8-Max เป็นเรือธงแบบเอเจนต์ของ Alibaba — โมเดลแบบปิดที่ใช้ได้เฉพาะผ่าน API ซึ่งรับอินพุตข้อความ รูปภาพ และวิดีโอ และมีบริบท 1,000,000 โทเค็น ต่างจากรุ่น Qwen ที่เล็กกว่า รุ่นนี้ไม่มีน้ำหนักที่เปิดเผย บน Artificial Analysis มันอยู่ที่ 45.42 บน Intelligence Index เป็นอันดับที่ 17 จาก 147 โมเดล โดยมีดัชนีการเขียนโค้ด 76.2 ซึ่งอยู่ในอันดับที่ 9 ในด้านนั้น ไม่ใช่โมเดลที่อ่อนแอ มันเป็นเพียงโมเดลที่แพงที่จะปล่อยให้คิด

หมายเลขที่ไม่อยู่ในตารางราคา

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysis บันทึกโทเคนเอาต์พุต 107,730 โทเคนต่องานสำหรับ Qwen3.8-Max โดย 70,830 โทเคนเป็นโทเคนการให้เหตุผล GPT-6.1 Sol สร้างโทเคนเอาต์พุต 38,128 โทเคน โดย 25,190 โทเคนเป็นการให้เหตุผล โมเดลจีนเขียนโทเคนมากกว่า 2.8 เท่าเพื่อตอบคำถามเดียวกัน และเขียนในราคาถูกกว่า 40% ต่อโทเคน

• โทเคนเอาต์พุตต่องาน — 38,128 เทียบกับ 107,730; Qwen เขียนมากกว่า 2.8 เท่า

• ซึ่งเป็นการให้เหตุผล — 25,190 เทียบกับ 70,830

• ค่าใช้จ่ายต่องาน — $0.724 เทียบกับ $5.409; Qwen มีค่าใช้จ่ายสูงกว่า 7.5 เท่า

• เวลาต่องาน — 640 วินาที เทียบกับ 2,152 วินาที; ประมาณ 11 นาที เทียบกับประมาณ 36

• เวลาถึงโทเคนแรกของคำตอบ — 332.0 วินาที เทียบกับ 55.1 วินาที

Intelligence Index — 51.83 เทียบกับ 45.42

• หน้าต่างบริบท — 1,050 เทียบกับ 1,000 โทเคน

• อินพุตที่รองรับ — ข้อความ รูปภาพ และไฟล์ เทียบกับ ข้อความ รูปภาพ และวิดีโอ

ลองคูณดูสิ แล้วส่วนลดก็หายไป โมเดลที่ปล่อยโทเค็นเกือบสามเท่าในอัตราที่ต่ำกว่า 40% ไม่ได้มีต้นทุนที่ต่ำกว่า — เฉพาะเอาต์พุตอย่างเดียวก็มีต้นทุนสูงกว่าประมาณ 1.7 เท่า และตัวเลขที่วัดได้ต่องานทำให้ตัวคูณที่แท้จริงอยู่ที่ 7.5 เมื่อนำอินพุต การอ่านจากแคช และความยาวของคำตอบที่ใช้งานได้จริงมาคิดรวมแล้ว

สังเกตบรรทัดที่สี่และห้า เพราะมันชี้ไปในทิศทางตรงกันข้าม และเมื่อรวมกันแล้วก็อธิบายได้ว่า Qwen3.8-Max คืออะไร มันคืนโทเคนแรกภายใน 55 วินาที ในขณะที่ GPT-6.1 Sol ใช้เวลาห้านาทีครึ่ง จากนั้นใช้เวลาสามสิบหกนาทีในการทำภารกิจให้เสร็จ ในขณะที่โมเดลของ OpenAI ทำเสร็จในสิบเอ็ดนาที นั่นคือโมเดลที่เริ่มพูดทันทีและคิดอย่างยาวนานมาก สำหรับอินเทอร์เฟซแชทที่มีคำตอบแบบสตรีมมิ่ง มันให้ความรู้สึกว่าเป็นการตอบสนองที่รวดเร็ว สำหรับงานกลางคืนที่ไม่มีคนเฝ้า มันคือเวลาตามนาฬิกาที่คุณต้องจ่ายไปด้วยเช่นกัน

สามด้านที่ Qwen3.8-Max เหนือกว่าอย่างแท้จริง

ช่องว่างของดัชนีอยู่ที่ 6.4 คะแนนทั่วทั้งชุด ซึ่งเป็นตัวเลขประเภทที่มักถูกยกมาอ้างราวกับว่ามันสม่ำเสมอ แต่ไม่ใช่ และความไม่ลงรอยกันนั้นให้ข้อคิด:

• GPQA Diamond — Qwen3.8-Max 0.9283 เทียบกับ GPT-6.1 Sol ไม่ได้เผยแพร่ในการรันนี้

• GDPval — 1,671.4 เทียบกับ 1,575.09

• Terminal-Bench 2.1 — 0.8876 เทียบกับไม่ได้เผยแพร่ในรอบนี้

• AutomationBench — 0.5619 เทียบกับ 0.6487

• SciCode — ไม่ได้เผยแพร่ในการรันครั้งนี้ เทียบกับ 0.5417 สำหรับ GPT-6.1 Sol

• CritPT — 0.1771 vs 0.3171

Qwen3.8-Max ชนะคำถามวิทยาศาสตร์ระดับบัณฑิตศึกษาและตัวอย่างงานตามอาชีพ ซึ่งเป็นผลลัพธ์จริงสำหรับโมเดลรุ่นเดียวกัน และเป็นเหตุผลที่ดัชนีการเขียนโค้ดของมันอยู่อันดับ 9 จาก 138 มันแพ้การประเมินที่ยากกว่าและใกล้เคียงงานวิจัย — CritPT ห่าง 14 คะแนน — และแพ้ AutomationBench 8.7 คะแนน ซึ่งเป็นตัวที่คล้ายกับงานคอมพิวเตอร์แบบไม่มีคนดูแลมากที่สุด ไม่ว่าคุณจะเชื่อว่าสองตัวนั้นตัวไหนสำคัญกว่าสำหรับภาระงานของคุณ นั่นคือการตัดสินใจจริง ตัวเลขพาดหัว 6.4 คะแนนเป็นค่าเฉลี่ยจากความเห็นที่ไม่ตรงกัน ไม่ใช่คำตัดสิน

โทเค็นพิเศษให้ประโยชน์อะไร และไม่ได้ให้ประโยชน์อะไร

ร่องรอยการใช้เหตุผลแบบยาวไม่ใช่ความสูญเปล่าโดยตัวนิยาม โมเดลที่ใช้ 70,830 โทเคนในการครุ่นคิดกับงานยากกำลังทำบางสิ่งบางอย่างที่โมเดลที่สั้นกว่าอาจข้ามไป และในการประเมินที่ Qwen3.8-Max อยู่ข้างหน้า การครุ่นคิดนั้นก็เป็นเหตุผลที่เป็นไปได้ โหมดความล้มเหลวคือคุณต้องจ่ายสำหรับมันในทุกงาน ไม่ใช่แค่งานยาก จำนวนโทเคนการใช้เหตุผลเป็นคุณสมบัติของการปรับคาลิเบรชันของโมเดล ไม่ใช่ของคุณสมบัติของความยากของคำถาม และโมเดลที่คิดมากเกินไปกับการสกัดข้อมูลเพียงหนึ่งบรรทัดก็เรียกเก็บเงินจากคุณสำหรับสิ่งนั้น

วิธีที่จะรู้ว่างานแต่ละชิ้นของคุณคือชิ้นไหน คือหยุดมองว่าการเลือกโมเดลเป็นแบบ global ซึ่งพาเรามาถึงส่วนที่เป็นการเปลี่ยนแปลง config

โมเดลการ์ดของเราเองสำหรับ GPT-6.1 Sol มีตัวเลขที่ให้บริการของ subject: อัตรา $2.00 / $10.00 หน้าต่างบริบท 1,050,000 โทเคน p50 4.54 วินาทีถึงโทเคนแรก และบล็อกดัชนี Artificial Analysis ที่จัดเก็บไว้ในหน้าเดียวกันกับราคาที่แอปพลิเคชันจะใช้กำหนดเส้นทางจริง

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

หนึ่งคีย์ หนึ่งมิเตอร์ สองรุ่น

ทั้งสองโมเดลเข้าถึงได้ผ่านปลายทาง OrcaRouter เพียงจุดเดียว — API เดียวสำหรับโมเดลกว่า 200 ตัว โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านตรงที่มาร์กอัป 0% การ์ด OrcaRouter สำหรับ Qwen3.8-Max แสดงอัตราค่าบริการที่ให้บริการ ควบคู่กับหน้าต่างบริบท 1,000,000 โทเคน รูปแบบอินพุตแบบข้อความ/ภาพ/วิดีโอ และปริมาณการใช้งานในเจ็ดวัน 101.4 ล้านโทเคน — ตัวเลขที่แอปพลิเคชันใช้กำหนดเส้นทาง เทียบเคียงกับตัวเลขที่บทความโต้แย้งกัน การส่งผ่านตรงนี้สำคัญเป็นพิเศษสำหรับ Qwen3.8-Max เพราะโมเดลที่เศรษฐศาสตร์ของมันขึ้นอยู่กับปริมาณโทเคนเอาต์พุตเป็นหลัก คือโมเดลที่ผู้ขายสามารถปรับราคาได้ทุกเมื่อ และมิเตอร์แบบส่งผ่านตรงหมายความว่าการเปลี่ยนแปลงนั้นไปถึงใบแจ้งหนี้ของคุณในวันที่ Alibaba ประกาศ ไม่ใช่ตามตารางเวลาของผู้ขายรายย่อย

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

การใช้เลเยอร์ routing ที่น่าสนใจกว่าในที่นี้คือ routing DSL ซึ่งช่วยให้คุณประกอบโมเดลหลายตัวเข้าไว้ในการเรียกครั้งเดียว แทนที่จะเลือกโมเดลเดียวสำหรับทั้งแอปพลิเคชัน แบ่งงาน nightly job ออกเป็นส่วน ๆ: โมเดลราคาถูกทำหน้าที่จำแนกและสกัดข้อมูล, GPT-6.1 Sol รับผิดชอบขั้นตอนการให้เหตุผลและการตรวจสอบ, และ Qwen3.8-Max ถูกสงวนไว้สำหรับงานที่การครุ่นคิดอย่างยาวนานและความแข็งแกร่งด้านวิทยาศาสตร์ระดับ GPQA ของมันเปลี่ยนคำตอบได้จริง ระบบ failover อัตโนมัติครอบคลุมส่วนที่เหลือ — หากผู้ให้บริการมีประสิทธิภาพลดลงระหว่างการทำงาน คำขอจะถูกย้ายไปแทนที่จะทำให้แบตช์ล้มเหลว

ทั้งสองอย่างนี้ไม่ใช่เหตุผลในการเลือกโมเดล สิ่งเหล่านี้คือเหตุผลที่คุณไม่จำเป็นต้องเลือกเพียงครั้งเดียวแล้วต้องอยู่กับมันไปตลอด

การเรียก และสิ่งที่ต้องจับตา

จ่ายในราคา 7.5 เท่าเฉพาะตรงที่การคิดอย่างรอบคอบนั้นคุ้มค่าเท่านั้น สำหรับงานรันทุกคืนแบบอเนกประสงค์ GPT-6.1 Sol ที่ราคา $0.724 ต่องาน ถือเป็นทางเลือกเริ่มต้นที่สมเหตุสมผล และ $1,690 ต่อปีก็เป็นตัวเลขจริง เมื่องานเป็นวิทยาศาสตร์ยากหรือการให้เหตุผลเชิงอาชีพที่มีคำตอบตรวจสอบได้ คะแนน 0.9283 ของ Qwen3.8-Max บน GPQA Diamond ก็คุ้มค่ากับโทเคน — นั่นคือสิ่งที่มันทำได้ดีกว่าโดยเฉพาะ

สิ่งที่ต้องจับตาคือ Alibaba จะปรับราคาใหม่หรือไม่ โมเดล 2.8×-token ที่ราคา $2.00/$6.00 ถูกตั้งราคาราวกับว่า token เป็นสิ่งหายาก แต่พฤติกรรมของตัวโมเดลเองกลับทำให้ token มีอยู่อย่างล้นเหลือ หากอัตราค่าเอาต์พุตขยับอย่างมีนัยสำคัญ ตัวเลขคณิตในบทความนี้ก็จะขยับตามไปด้วย และมาตรวัดการส่งผ่านจะแสดงให้คุณเห็นในวันเดียวกับที่มันเกิดขึ้น

การเปรียบเทียบในบทความนี้3

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube