
GPT-6.1 Sol กับ DeepSeek V4 Pro: สามมาตรวัด สามคำตอบที่แตกต่างกัน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ถามว่าห่างกันแค่ไหนระหว่าง GPT-6.1 Sol กับ DeepSeek V4 Pro และคำตอบที่ตรงไปตรงมาคือ มันขึ้นอยู่กับว่าคุณอ่านมาตรวัดอันไหน และมาตรวัดทั้งสามอันขัดแย้งกันมากกว่าที่การเปรียบเทียบโมเดลส่วนใหญ่ขัดแย้งกันในทุกเรื่อง ในแง่ราคาต่อล้านโทเคน ผสมในอัตราส่วนอินพุตต่อเอาต์พุต 3:1 พวกมันอยู่ที่ $4.00 เทียบกับ $0.99 — ต่างกันสี่เท่า ในแง่ค่าใช้จ่ายจริงในการรันชุดการประเมินเดียวกัน พวกมันอยู่ที่ $0.72 เทียบกับ $0.67 ต่องาน — เจ็ดเปอร์เซ็นต์ บนดัชนีความฉลาด Artificial Analysis พวกมันอยู่ที่ 51.8 เทียบกับ 36 — ห่างกันสิบหกจุด ซึ่งฟังดูชี้ขาดจนกว่าคุณจะดูว่าแต่ละตัวเลขถูกนำไปเทียบกับใคร เพราะระเบียบวิธีของตัวผู้ประเมินเองจัดวางสองโมเดลนี้ไว้คนละลีก GPT-6.1 Sol เปิดตัวเมื่อวันที่ 29 กันยายน 2026 ในราคา $2.00 ต่ออินพุต และ $10.00 ต่อเอาต์พุต พร้อมหน้าต่าง 1,050,000 โทเคน DeepSeek V4 Pro เป็นเรือธงแบบ mixture-of-experts ที่ใช้สัญญาอนุญาต MIT มีพารามิเตอร์ 1.6 ล้านล้าน โดยใช้งานจริง 4.9 หมื่นล้าน เปิดตัวเมื่อวันที่ 13 สิงหาคม 2026 ในราคา $0.66 และ $1.98 พร้อมหน้าต่าง 1,048,576 โทเคน ตัวหนึ่งเป็นโมเดลข้อความที่คุณดาวน์โหลดได้ อีกตัวมองเห็นภาพได้ การแยกให้ออกว่าจริง ๆ แล้วคุณควรยึดมาตรวัดอันไหนในสามอันนี้เป็นเข็มทิศ คือหัวใจของงานทั้งหมด
แถว index ไม่ใช่การเปรียบเทียบอย่างที่ดูเหมือน
เริ่มจากตัวเลขที่ถูกอ้างถึงบ่อยที่สุดก่อน เพราะเป็นตัวเลขที่มักถูกอ้างผิดบ่อยที่สุด
Artificial Analysis เผยแพร่ระเบียบวิธีของตนควบคู่ไปกับลีดเดอร์บอร์ด และมีสองประโยคในนั้นที่มีความสำคัญตรงนี้ โมเดลแบบเปิดน้ำหนัก ระบุว่า จะถูกเปรียบเทียบกับโมเดลแบบเปิดน้ำหนักอื่นๆ ในระดับขนาดเดียวกันเท่านั้น — เล็กมาก เล็ก กลาง ใหญ่ โดยมีเส้นแบ่งที่ 150 พันล้านพารามิเตอร์ โมเดลแบบกรรมสิทธิ์จะถูกเปรียบเทียบข้ามช่วงราคาแทน โดยใช้อัตราส่วนผสม 3:1 ของอินพุตต่อเอาต์พุต นั่นคือสองกลุ่มเปรียบเทียบที่แตกต่างกัน DeepSeek V4 Pro 0813 เป็นแบบเปิดน้ำหนัก — คำถามที่พบบ่อยของผู้ประเมินเองกล่าวเช่นนั้น และชี้ไปที่น้ำหนักที่เผยแพร่ — และด้วยพารามิเตอร์ทั้งหมด 1.6 ล้านล้านตัว จึงจัดอยู่ในคลาสใหญ่ของแบบเปิดน้ำหนัก GPT-6.1 Sol เป็นแบบกรรมสิทธิ์ และถูกให้คะแนนเทียบกับโมเดลในช่วงราคาของตัวเอง
การที่ 51.8 กับ 36 อยู่ในแถวที่ติดกันของตารางเดียวกันจึงไม่ใช่การเทียบกันแบบตัวต่อตัว คะแนนทั้งสองคือคะแนนที่เทียบกับกลุ่มเทียบเคียงหนึ่ง และคะแนนที่เทียบกับอีกกลุ่มหนึ่ง ซึ่งเป็นเหตุผลตรง ๆ ว่าทำไมตัวเลขต้นทุนต่องานจึงเปรียบเทียบกันได้ แต่ตัวเลขดัชนีดิบเปรียบเทียบกันไม่ได้ ถ้าคุณอยากรู้ว่า DeepSeek V4 Pro นั้นดีสำหรับโมเดลที่ดาวน์โหลดได้หรือไม่ 36 คือตัวเลขที่ตอบคำถามนั้น ถ้าคุณอยากรู้ว่ามันทำได้อย่างไรเมื่อเทียบกับโมเดลระดับแนวหน้าที่ให้บริการแบบโฮสต์ คอลัมน์ดัชนีจะไม่บอกคุณ และในกรณีนี้ สิ่งที่ตรงไปตรงมาที่สุดคือการบอกตามนั้น มากกว่าจะเอา 51.8 ตั้งลบ 36 แล้วเรียกมันว่าช่องว่าง
สิ่งที่สามารถเปรียบเทียบได้อย่างชัดเจน: การ์ดราคา ขีดจำกัดบริบทและเอาต์พุต รายการโมดัลลิตี และค่าใช้จ่ายในการรันชุดการประเมินเดียวกัน — เพราะตัวเลขสุดท้ายนั้นเป็นการทำบัญชีของงานที่เหมือนกัน ไม่ใช่คะแนน
สิ่งที่มิเตอร์ดิบบอก

• ราคาอินพุต — GPT-6.1 Sol $2.00 เทียบกับ DeepSeek V4 Pro $0.66 ต่อล้านโทเค็น
• ราคาเอาต์พุต — GPT-6.1 Sol $10.00 เทียบกับ DeepSeek V4 Pro $1.98 โดยปรับเป็น $1.32 และ $3.96 ภายในสองช่วงเวลา 4 ชั่วโมงตามเวลา UTC ในวันธรรมดา
• การอ่านแคช — GPT-6.1 Sol $0.10 เทียบกับ DeepSeek V4 Pro $0.022 ต่อล้านโทเคน; ทั้งคู่มีแคช และฝั่งที่ถูกกว่าก็ถูกกว่าอีก 4.5 เท่า
• ค่าใช้จ่ายต่องานดัชนี — GPT-6.1 Sol $0.72 เทียบกับ DeepSeek V4 Pro $0.67
• โทเคนเอาต์พุตที่ปล่อยบนชุดทดสอบ index — GPT-6.1 Sol 67M เทียบกับ DeepSeek V4 Pro 160M
• เอาต์พุตสูงสุด — DeepSeek V4 Pro 384,000 โทเค็น เทียบกับ GPT-6.1 Sol 128,000 โทเค็น
• โมดัลลิตี — GPT-6.1 Sol รองรับข้อความ รูปภาพ และไฟล์; DeepSeek V4 Pro รองรับเฉพาะข้อความ
บรรทัดที่สี่และห้าเป็นคู่ที่น่าสนใจ DeepSeek V4 Pro ปล่อยโทเคนมากกว่า 2.4 เท่าในชุดทดสอบเดียวกัน และยังทำงานเสร็จด้วยต้นทุนถูกกว่า 7% ต่องาน เพราะอัตราค่าเอาต์พุตของมันอยู่ที่หนึ่งในห้าของ GPT-6 Sol นั่นคือหน้าตาของโมเดลที่ขับเคลื่อนด้วยราคาเมื่อคุณวัดที่เอาต์พุตแทนที่จะวัดที่อัตรา: ความเยิ่นเย้อนั้นมีจริง และมันไม่ได้ลบข้อได้เปรียบนั้นทิ้งไป หน้าต่างเวลาคือเครื่องหมายดอกจัน สองช่วง ช่วงละสี่ชั่วโมงในวันธรรมดา — 40 จาก 168 ชั่วโมงในหนึ่งสัปดาห์ — เพิ่มอัตราที่ประกาศไว้เป็นสองเท่าเป็น $1.32 และ $3.96 และค่าธรรมเนียมเพิ่มเติมนั้นใช้กับโทเคนชุดเดียวกับที่หากไม่เช่นนั้นแล้วจะเป็นโทเคนที่ถูกที่สุดไม่ว่าจะใช้การ์ดใบไหน
สิ่งที่รุ่นที่ถูกกว่าไม่ได้ทำ
สามสิ่ง และแต่ละอย่างเป็นขีดจำกัดที่ตายตัว ไม่ใช่เรื่องของการได้อย่างเสียอย่าง
มันไม่เห็น DeepSeek V4 Pro เป็นข้อความเข้า ข้อความออก ไม่มีสกรีนช็อต ไม่มี PDF ที่สแกน ไม่มีการอ่านแผนภูมิ ไม่มีไดอะแกรมในตั๋ว เวิร์กโฟลว์ที่ใช้คอมพิวเตอร์และงานเอกสารจำนวนมาก — ภาระงานแบบเดียวกับที่ GPT-6.1 Sol ถูกวางตำแหน่งไว้ — ไม่ต้องพิจารณาไม่ว่าราคาเท่าใด หากไปป์ไลน์ของคุณส่งรูปภาพไปยังโมเดลวิชันอยู่แล้ว นี่ไม่ใช่ปัญหา หากไม่ใช่ มันคือข้อจำกัดที่ชี้ขาด
มันไม่มีจังหวะการออกรีลีสที่คุณจะวางแผนโดยอิงได้ ชื่อ "deepseek-v4-pro" ถูกชี้ไปที่บิลด์ 0813 ตั้งแต่เดือนสิงหาคม และกว่าจะมาถึงตรงนั้นก็ไม่เงียบเลย ผู้ขายประกาศกำหนดปลดระวางบิลด์ในวันที่ 14 กันยายน ถอนประกาศนั้นสองวันก่อนถึงกำหนด และยังคงให้บริการ API โดยการเรียกเก็บเงินไม่เปลี่ยนแปลง แค็ตตาล็อกของเราเองยังคงระบุว่ามันเป็นเรือธงที่มีบริบท เพดานเอาต์พุต และขีดจำกัดการทำงานพร้อมกันเท่าเดิม ผู้ขายที่ถอนการเลิกใช้ได้ในสองวันก็สามารถเลือกที่จะไม่ถอนได้เช่นกัน ข้อสรุปเชิงปฏิบัติไม่ใช่ว่าโมเดลไม่เสถียร แต่ชื่อเป็นเพียงตัวชี้ และการตรึงพฤติกรรมไว้กับตัวระบุบิลด์แทนชื่อเส้นทางคือประกันราคาถูก
มันไม่ได้นำพาความรู้โดยรอบมาด้วย GPT-6.1 Sol มีอายุแปดวัน และมีการเผยแพร่คอนฟิกูเรชันอิสระแล้วหนึ่งชุด; DeepSeek V4 Pro มีประวัติการประเมินที่ยาวนานกว่าและมีฐานผู้ใช้งานจริงที่ใหญ่กว่ามาก รวมถึงสแต็กการให้บริการที่เผยแพร่แล้วและงานด้านทรูพุตจากบุคคลที่สาม สำหรับการติดตั้งใช้งานแบบโฮสต์เอง เนื้อหาชุดนั้นมีค่ามากกว่าข้อมูลในแถวดัชนี เพราะมันคือสิ่งที่คุณใช้ปรึกษาเมื่อโมเดลมีพฤติกรรมแปลก ๆ บนฮาร์ดแวร์ของคุณ มากกว่าเมื่ออยู่บนเบนช์มาร์ก
เมื่อมิเตอร์ที่ถูกกว่าสี่เท่าเป็นมิเตอร์ที่ผิด
ถ้าโมเดลราคาถูกแย่กว่าในทุกเรื่องจริง บทความนี้คงสั้น ข้อเท็จจริงที่น่าอึดอัดคือ ทั้งสองห่างกัน 7% ต่องานเมื่องานเดียวกัน และห่างกัน 2.4 เท่าในปริมาณที่เขียนเพื่อไปให้ถึงผลลัพธ์นั้น นั่นหมายความว่า มิเตอร์แบบ blended-token — ตัวที่บอกว่า 4× — กำลังวัดความแตกต่างที่คุณไม่ได้จ่ายจริงเป็นส่วนใหญ่ เพราะมันตีราคาจากส่วนผสมโทเค็นที่คุณอาจไม่เคยส่ง และมิเตอร์แบบ index ตัวที่บอกว่า 16 คะแนน กำลังวัดข้ามกลุ่มเทียบเคียงสองกลุ่ม และไม่สามารถนำมาลบกันได้
ดังนั้นการแบ่งในทางปฏิบัติจึงไม่ใช่ "โมเดลแนวหน้าสำหรับงานยาก โมเดลราคาถูกสำหรับงานง่าย" แต่เป็นการแบ่งตามรูปแบบและการแบ่งตามปริมาณ อะไรก็ตามที่มีภาพอยู่ในนั้นจะไปที่ GPT-6.1 Sol และเช่นเดียวกันกับอะไรก็ตามที่คำตอบสั้นและการให้เหตุผลเป็นส่วนที่แพง — ระดับความพยายามห้าระดับของมัน ตั้งแต่ low ถึง max โดยมี medium เป็นค่าเริ่มต้น ให้คุณซื้อการให้เหตุผลโดยไม่ต้องซื้อข้อความ และอินพุตที่แคชไว้ในราคา $0.10 ทำให้พรอมป์ยาวๆ ที่ใช้ซ้ำมีราคาถูก อะไรก็ตามที่เป็นข้อความล้วน ปริมาณสูง และทนต่อคำตอบที่ยาวกว่า — การจำแนกประเภท การสกัด การสรุปความ การสร้างจำนวนมากภายใต้งบประมาณเอาต์พุต 384,000 โทเคน — จะไปที่ DeepSeek V4 Pro ควรอยู่นอกช่วงเวลาสองช่วงของ UTC
ทั้งคู่อยู่บนคีย์เดียว และการแยกคือบรรทัดคอนฟิก
ทั้งสองโมเดลอยู่บน OrcaRouter ในอัตราที่ผู้ให้บริการแต่ละรายประกาศไว้เอง โดยไม่มีการบวกเพิ่มใด ๆ: GPT-6.1 Sol ที่ $2.00 / $10.00 และปรับขึ้นเป็น $4.00 / $15.00 เมื่อเกิน 272,000 โทเค็นพรอมต์ และ DeepSeek V4 Pro ที่ $0.66 / $1.98 โดยคงช่วงเวลาทั้งสองช่วงไว้ตามที่ระบุไว้ ใช้คีย์เดียว ใบเรียกเก็บเงินเดียว และเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงหนึ่งเดียวสำหรับทั้งสองโมเดล
นั่นคือเหตุผลที่การแยกข้างต้นควรค่าแก่การจดบันทึกไว้ มากกว่าการโต้เถียงกัน การแยกตามมอดาลิตีสามารถแสดงออกเป็นกฎการกำหนดเส้นทางได้ ดังนั้นคำขอที่มีภาพจะถูกส่งไปยังโมเดลวิชัน และข้อความจำนวนมากจะถูกส่งไปยังโมเดลราคาถูก โดยไม่ต้องแก้ไขแอปพลิเคชัน หากเส้นทางหนึ่งเสื่อมประสิทธิภาพ การสลับไปใช้เส้นทางสำรองจะย้ายการเรียกนั้นแทนที่จะทำให้ล้มเหลว และเนื่องจากทั้งสองอยู่บนเอนด์พอยต์เดียวกัน การเปรียบเทียบราคาที่สำคัญจริง ๆ — ของคุณ บนทราฟฟิกของคุณ ที่ส่วนผสมโทเคนของคุณ — สามารถสร้างได้จากใบแจ้งหนี้ของคุณเอง แทนที่จะเป็นค่าเฉลี่ยจากชุดทดสอบมาตรฐาน


คำตัดสินในหนึ่งบรรทัดคือ ตัวเลขที่บอกว่าถูกกว่า 4 เท่าเป็นตัวเลขที่ควรไม่ไว้วางใจ ส่วนตัวเลข 7 เปอร์เซ็นต์เป็นตัวเลขที่ควรตรวจสอบ 4 เท่าคือสิ่งที่มาตรวัดแบบผสมรายงานเกี่ยวกับส่วนผสมโทเคนที่คุณอาจไม่ได้ส่ง 7 เปอร์เซ็นต์คือค่าใช้จ่ายของงานประเมินเดียวกันบนทั้งสองตัว และมันมาพร้อมความต่างด้านความยืดยาว 2.4 เท่าที่ฝังอยู่ในตัว สิบหกคะแนนนั้นเป็นของจริง และยังเป็นการเทียบข้ามสองกลุ่มเทียบเคียง และข้อจำกัดที่ตัดสินการนำไปใช้งานจริงส่วนใหญ่ของคู่นี้ไม่ใช่ตัวเลขเลย: หนึ่งในโมเดลเหล่านี้สามารถอ่านภาพหน้าจอได้ แต่อีกตัวทำไม่ได้
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
