ฮีโร่การ์ดที่สร้างขึ้นสำหรับ GPT-6.1 Sol เทียบกับ DeepSeek V4 Pro พร้อมหัวข้อ "สามมาตรวัด สามคำตอบที่ต่างกัน" การ์ดตัวชี้วัดสามใบที่ระบุว่า "ราคาผสม 4 เท่า", "ต้นทุนต่องานในดัชนี 1.07 เท่า" และ "ดัชนีความฉลาด 16 คะแนน" ข้อความบรรทัดหนึ่งที่ระบุว่า "ตัวหนึ่งเป็นโมเดลปิดและมองเห็นภาพได้ อีกตัวเป็น open weights ที่มีสัญญาอนุญาต MIT และรองรับเฉพาะข้อความ" ส่วนท้ายที่ระบุว่า "ราคาตามข้อมูลของ OpenAI และ DeepSeek; ตัวเลขดัชนีและต้นทุนต่องานตามข้อมูลของ Artificial Analysis ซึ่งเปรียบเทียบโมเดล open weights และโมเดลปิดในกลุ่มเทียบเคียงที่แตกต่างกัน" และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

GPT-6.1 Sol กับ DeepSeek V4 Pro: สามมาตรวัด สามคำตอบที่แตกต่างกัน

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ถามว่าห่างกันแค่ไหนระหว่าง GPT-6.1 Sol กับ DeepSeek V4 Pro และคำตอบที่ตรงไปตรงมาคือ มันขึ้นอยู่กับว่าคุณอ่านมาตรวัดอันไหน และมาตรวัดทั้งสามอันขัดแย้งกันมากกว่าที่การเปรียบเทียบโมเดลส่วนใหญ่ขัดแย้งกันในทุกเรื่อง ในแง่ราคาต่อล้านโทเคน ผสมในอัตราส่วนอินพุตต่อเอาต์พุต 3:1 พวกมันอยู่ที่ $4.00 เทียบกับ $0.99 — ต่างกันสี่เท่า ในแง่ค่าใช้จ่ายจริงในการรันชุดการประเมินเดียวกัน พวกมันอยู่ที่ $0.72 เทียบกับ $0.67 ต่องาน — เจ็ดเปอร์เซ็นต์ บนดัชนีความฉลาด Artificial Analysis พวกมันอยู่ที่ 51.8 เทียบกับ 36 — ห่างกันสิบหกจุด ซึ่งฟังดูชี้ขาดจนกว่าคุณจะดูว่าแต่ละตัวเลขถูกนำไปเทียบกับใคร เพราะระเบียบวิธีของตัวผู้ประเมินเองจัดวางสองโมเดลนี้ไว้คนละลีก GPT-6.1 Sol เปิดตัวเมื่อวันที่ 29 กันยายน 2026 ในราคา $2.00 ต่ออินพุต และ $10.00 ต่อเอาต์พุต พร้อมหน้าต่าง 1,050,000 โทเคน DeepSeek V4 Pro เป็นเรือธงแบบ mixture-of-experts ที่ใช้สัญญาอนุญาต MIT มีพารามิเตอร์ 1.6 ล้านล้าน โดยใช้งานจริง 4.9 หมื่นล้าน เปิดตัวเมื่อวันที่ 13 สิงหาคม 2026 ในราคา $0.66 และ $1.98 พร้อมหน้าต่าง 1,048,576 โทเคน ตัวหนึ่งเป็นโมเดลข้อความที่คุณดาวน์โหลดได้ อีกตัวมองเห็นภาพได้ การแยกให้ออกว่าจริง ๆ แล้วคุณควรยึดมาตรวัดอันไหนในสามอันนี้เป็นเข็มทิศ คือหัวใจของงานทั้งหมด

แถว index ไม่ใช่การเปรียบเทียบอย่างที่ดูเหมือน

เริ่มจากตัวเลขที่ถูกอ้างถึงบ่อยที่สุดก่อน เพราะเป็นตัวเลขที่มักถูกอ้างผิดบ่อยที่สุด

Artificial Analysis เผยแพร่ระเบียบวิธีของตนควบคู่ไปกับลีดเดอร์บอร์ด และมีสองประโยคในนั้นที่มีความสำคัญตรงนี้ โมเดลแบบเปิดน้ำหนัก ระบุว่า จะถูกเปรียบเทียบกับโมเดลแบบเปิดน้ำหนักอื่นๆ ในระดับขนาดเดียวกันเท่านั้น — เล็กมาก เล็ก กลาง ใหญ่ โดยมีเส้นแบ่งที่ 150 พันล้านพารามิเตอร์ โมเดลแบบกรรมสิทธิ์จะถูกเปรียบเทียบข้ามช่วงราคาแทน โดยใช้อัตราส่วนผสม 3:1 ของอินพุตต่อเอาต์พุต นั่นคือสองกลุ่มเปรียบเทียบที่แตกต่างกัน DeepSeek V4 Pro 0813 เป็นแบบเปิดน้ำหนัก — คำถามที่พบบ่อยของผู้ประเมินเองกล่าวเช่นนั้น และชี้ไปที่น้ำหนักที่เผยแพร่ — และด้วยพารามิเตอร์ทั้งหมด 1.6 ล้านล้านตัว จึงจัดอยู่ในคลาสใหญ่ของแบบเปิดน้ำหนัก GPT-6.1 Sol เป็นแบบกรรมสิทธิ์ และถูกให้คะแนนเทียบกับโมเดลในช่วงราคาของตัวเอง

การที่ 51.8 กับ 36 อยู่ในแถวที่ติดกันของตารางเดียวกันจึงไม่ใช่การเทียบกันแบบตัวต่อตัว คะแนนทั้งสองคือคะแนนที่เทียบกับกลุ่มเทียบเคียงหนึ่ง และคะแนนที่เทียบกับอีกกลุ่มหนึ่ง ซึ่งเป็นเหตุผลตรง ๆ ว่าทำไมตัวเลขต้นทุนต่องานจึงเปรียบเทียบกันได้ แต่ตัวเลขดัชนีดิบเปรียบเทียบกันไม่ได้ ถ้าคุณอยากรู้ว่า DeepSeek V4 Pro นั้นดีสำหรับโมเดลที่ดาวน์โหลดได้หรือไม่ 36 คือตัวเลขที่ตอบคำถามนั้น ถ้าคุณอยากรู้ว่ามันทำได้อย่างไรเมื่อเทียบกับโมเดลระดับแนวหน้าที่ให้บริการแบบโฮสต์ คอลัมน์ดัชนีจะไม่บอกคุณ และในกรณีนี้ สิ่งที่ตรงไปตรงมาที่สุดคือการบอกตามนั้น มากกว่าจะเอา 51.8 ตั้งลบ 36 แล้วเรียกมันว่าช่องว่าง

สิ่งที่สามารถเปรียบเทียบได้อย่างชัดเจน: การ์ดราคา ขีดจำกัดบริบทและเอาต์พุต รายการโมดัลลิตี และค่าใช้จ่ายในการรันชุดการประเมินเดียวกัน — เพราะตัวเลขสุดท้ายนั้นเป็นการทำบัญชีของงานที่เหมือนกัน ไม่ใช่คะแนน

สิ่งที่มิเตอร์ดิบบอก

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• ราคาอินพุต — GPT-6.1 Sol $2.00 เทียบกับ DeepSeek V4 Pro $0.66 ต่อล้านโทเค็น

• ราคาเอาต์พุต — GPT-6.1 Sol $10.00 เทียบกับ DeepSeek V4 Pro $1.98 โดยปรับเป็น $1.32 และ $3.96 ภายในสองช่วงเวลา 4 ชั่วโมงตามเวลา UTC ในวันธรรมดา

• การอ่านแคช — GPT-6.1 Sol $0.10 เทียบกับ DeepSeek V4 Pro $0.022 ต่อล้านโทเคน; ทั้งคู่มีแคช และฝั่งที่ถูกกว่าก็ถูกกว่าอีก 4.5 เท่า

• ค่าใช้จ่ายต่องานดัชนี — GPT-6.1 Sol $0.72 เทียบกับ DeepSeek V4 Pro $0.67

• โทเคนเอาต์พุตที่ปล่อยบนชุดทดสอบ index — GPT-6.1 Sol 67M เทียบกับ DeepSeek V4 Pro 160M

• เอาต์พุตสูงสุด — DeepSeek V4 Pro 384,000 โทเค็น เทียบกับ GPT-6.1 Sol 128,000 โทเค็น

• โมดัลลิตี — GPT-6.1 Sol รองรับข้อความ รูปภาพ และไฟล์; DeepSeek V4 Pro รองรับเฉพาะข้อความ

บรรทัดที่สี่และห้าเป็นคู่ที่น่าสนใจ DeepSeek V4 Pro ปล่อยโทเคนมากกว่า 2.4 เท่าในชุดทดสอบเดียวกัน และยังทำงานเสร็จด้วยต้นทุนถูกกว่า 7% ต่องาน เพราะอัตราค่าเอาต์พุตของมันอยู่ที่หนึ่งในห้าของ GPT-6 Sol นั่นคือหน้าตาของโมเดลที่ขับเคลื่อนด้วยราคาเมื่อคุณวัดที่เอาต์พุตแทนที่จะวัดที่อัตรา: ความเยิ่นเย้อนั้นมีจริง และมันไม่ได้ลบข้อได้เปรียบนั้นทิ้งไป หน้าต่างเวลาคือเครื่องหมายดอกจัน สองช่วง ช่วงละสี่ชั่วโมงในวันธรรมดา — 40 จาก 168 ชั่วโมงในหนึ่งสัปดาห์ — เพิ่มอัตราที่ประกาศไว้เป็นสองเท่าเป็น $1.32 และ $3.96 และค่าธรรมเนียมเพิ่มเติมนั้นใช้กับโทเคนชุดเดียวกับที่หากไม่เช่นนั้นแล้วจะเป็นโทเคนที่ถูกที่สุดไม่ว่าจะใช้การ์ดใบไหน

สิ่งที่รุ่นที่ถูกกว่าไม่ได้ทำ

สามสิ่ง และแต่ละอย่างเป็นขีดจำกัดที่ตายตัว ไม่ใช่เรื่องของการได้อย่างเสียอย่าง

มันไม่เห็น DeepSeek V4 Pro เป็นข้อความเข้า ข้อความออก ไม่มีสกรีนช็อต ไม่มี PDF ที่สแกน ไม่มีการอ่านแผนภูมิ ไม่มีไดอะแกรมในตั๋ว เวิร์กโฟลว์ที่ใช้คอมพิวเตอร์และงานเอกสารจำนวนมาก — ภาระงานแบบเดียวกับที่ GPT-6.1 Sol ถูกวางตำแหน่งไว้ — ไม่ต้องพิจารณาไม่ว่าราคาเท่าใด หากไปป์ไลน์ของคุณส่งรูปภาพไปยังโมเดลวิชันอยู่แล้ว นี่ไม่ใช่ปัญหา หากไม่ใช่ มันคือข้อจำกัดที่ชี้ขาด

มันไม่มีจังหวะการออกรีลีสที่คุณจะวางแผนโดยอิงได้ ชื่อ "deepseek-v4-pro" ถูกชี้ไปที่บิลด์ 0813 ตั้งแต่เดือนสิงหาคม และกว่าจะมาถึงตรงนั้นก็ไม่เงียบเลย ผู้ขายประกาศกำหนดปลดระวางบิลด์ในวันที่ 14 กันยายน ถอนประกาศนั้นสองวันก่อนถึงกำหนด และยังคงให้บริการ API โดยการเรียกเก็บเงินไม่เปลี่ยนแปลง แค็ตตาล็อกของเราเองยังคงระบุว่ามันเป็นเรือธงที่มีบริบท เพดานเอาต์พุต และขีดจำกัดการทำงานพร้อมกันเท่าเดิม ผู้ขายที่ถอนการเลิกใช้ได้ในสองวันก็สามารถเลือกที่จะไม่ถอนได้เช่นกัน ข้อสรุปเชิงปฏิบัติไม่ใช่ว่าโมเดลไม่เสถียร แต่ชื่อเป็นเพียงตัวชี้ และการตรึงพฤติกรรมไว้กับตัวระบุบิลด์แทนชื่อเส้นทางคือประกันราคาถูก

มันไม่ได้นำพาความรู้โดยรอบมาด้วย GPT-6.1 Sol มีอายุแปดวัน และมีการเผยแพร่คอนฟิกูเรชันอิสระแล้วหนึ่งชุด; DeepSeek V4 Pro มีประวัติการประเมินที่ยาวนานกว่าและมีฐานผู้ใช้งานจริงที่ใหญ่กว่ามาก รวมถึงสแต็กการให้บริการที่เผยแพร่แล้วและงานด้านทรูพุตจากบุคคลที่สาม สำหรับการติดตั้งใช้งานแบบโฮสต์เอง เนื้อหาชุดนั้นมีค่ามากกว่าข้อมูลในแถวดัชนี เพราะมันคือสิ่งที่คุณใช้ปรึกษาเมื่อโมเดลมีพฤติกรรมแปลก ๆ บนฮาร์ดแวร์ของคุณ มากกว่าเมื่ออยู่บนเบนช์มาร์ก

เมื่อมิเตอร์ที่ถูกกว่าสี่เท่าเป็นมิเตอร์ที่ผิด

ถ้าโมเดลราคาถูกแย่กว่าในทุกเรื่องจริง บทความนี้คงสั้น ข้อเท็จจริงที่น่าอึดอัดคือ ทั้งสองห่างกัน 7% ต่องานเมื่องานเดียวกัน และห่างกัน 2.4 เท่าในปริมาณที่เขียนเพื่อไปให้ถึงผลลัพธ์นั้น นั่นหมายความว่า มิเตอร์แบบ blended-token — ตัวที่บอกว่า 4× — กำลังวัดความแตกต่างที่คุณไม่ได้จ่ายจริงเป็นส่วนใหญ่ เพราะมันตีราคาจากส่วนผสมโทเค็นที่คุณอาจไม่เคยส่ง และมิเตอร์แบบ index ตัวที่บอกว่า 16 คะแนน กำลังวัดข้ามกลุ่มเทียบเคียงสองกลุ่ม และไม่สามารถนำมาลบกันได้

ดังนั้นการแบ่งในทางปฏิบัติจึงไม่ใช่ "โมเดลแนวหน้าสำหรับงานยาก โมเดลราคาถูกสำหรับงานง่าย" แต่เป็นการแบ่งตามรูปแบบและการแบ่งตามปริมาณ อะไรก็ตามที่มีภาพอยู่ในนั้นจะไปที่ GPT-6.1 Sol และเช่นเดียวกันกับอะไรก็ตามที่คำตอบสั้นและการให้เหตุผลเป็นส่วนที่แพง — ระดับความพยายามห้าระดับของมัน ตั้งแต่ low ถึง max โดยมี medium เป็นค่าเริ่มต้น ให้คุณซื้อการให้เหตุผลโดยไม่ต้องซื้อข้อความ และอินพุตที่แคชไว้ในราคา $0.10 ทำให้พรอมป์ยาวๆ ที่ใช้ซ้ำมีราคาถูก อะไรก็ตามที่เป็นข้อความล้วน ปริมาณสูง และทนต่อคำตอบที่ยาวกว่า — การจำแนกประเภท การสกัด การสรุปความ การสร้างจำนวนมากภายใต้งบประมาณเอาต์พุต 384,000 โทเคน — จะไปที่ DeepSeek V4 Pro ควรอยู่นอกช่วงเวลาสองช่วงของ UTC

ทั้งคู่อยู่บนคีย์เดียว และการแยกคือบรรทัดคอนฟิก

ทั้งสองโมเดลอยู่บน OrcaRouter ในอัตราที่ผู้ให้บริการแต่ละรายประกาศไว้เอง โดยไม่มีการบวกเพิ่มใด ๆ: GPT-6.1 Sol ที่ $2.00 / $10.00 และปรับขึ้นเป็น $4.00 / $15.00 เมื่อเกิน 272,000 โทเค็นพรอมต์ และ DeepSeek V4 Pro ที่ $0.66 / $1.98 โดยคงช่วงเวลาทั้งสองช่วงไว้ตามที่ระบุไว้ ใช้คีย์เดียว ใบเรียกเก็บเงินเดียว และเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงหนึ่งเดียวสำหรับทั้งสองโมเดล

นั่นคือเหตุผลที่การแยกข้างต้นควรค่าแก่การจดบันทึกไว้ มากกว่าการโต้เถียงกัน การแยกตามมอดาลิตีสามารถแสดงออกเป็นกฎการกำหนดเส้นทางได้ ดังนั้นคำขอที่มีภาพจะถูกส่งไปยังโมเดลวิชัน และข้อความจำนวนมากจะถูกส่งไปยังโมเดลราคาถูก โดยไม่ต้องแก้ไขแอปพลิเคชัน หากเส้นทางหนึ่งเสื่อมประสิทธิภาพ การสลับไปใช้เส้นทางสำรองจะย้ายการเรียกนั้นแทนที่จะทำให้ล้มเหลว และเนื่องจากทั้งสองอยู่บนเอนด์พอยต์เดียวกัน การเปรียบเทียบราคาที่สำคัญจริง ๆ — ของคุณ บนทราฟฟิกของคุณ ที่ส่วนผสมโทเคนของคุณ — สามารถสร้างได้จากใบแจ้งหนี้ของคุณเอง แทนที่จะเป็นค่าเฉลี่ยจากชุดทดสอบมาตรฐาน

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

คำตัดสินในหนึ่งบรรทัดคือ ตัวเลขที่บอกว่าถูกกว่า 4 เท่าเป็นตัวเลขที่ควรไม่ไว้วางใจ ส่วนตัวเลข 7 เปอร์เซ็นต์เป็นตัวเลขที่ควรตรวจสอบ 4 เท่าคือสิ่งที่มาตรวัดแบบผสมรายงานเกี่ยวกับส่วนผสมโทเคนที่คุณอาจไม่ได้ส่ง 7 เปอร์เซ็นต์คือค่าใช้จ่ายของงานประเมินเดียวกันบนทั้งสองตัว และมันมาพร้อมความต่างด้านความยืดยาว 2.4 เท่าที่ฝังอยู่ในตัว สิบหกคะแนนนั้นเป็นของจริง และยังเป็นการเทียบข้ามสองกลุ่มเทียบเคียง และข้อจำกัดที่ตัดสินการนำไปใช้งานจริงส่วนใหญ่ของคู่นี้ไม่ใช่ตัวเลขเลย: หนึ่งในโมเดลเหล่านี้สามารถอ่านภาพหน้าจอได้ แต่อีกตัวทำไม่ได้

การเปรียบเทียบในบทความนี้3

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube