
GPT-6.1 Sol vs GPT-6 Sol: หนึ่งสัปดาห์ของงานที่เพิ่มขึ้นแลกมาได้อะไร และไม่ได้อะไร
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 397 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
ถ้าคุณมี GPT-6 Sol อยู่ในโปรดักชันวันนี้ และกำลังพยายามตัดสินใจว่า GPT-6.1 Sol คุ้มค่าที่จะย้ายระบบหรือไม่ คำตอบทั้งหมดขึ้นอยู่กับว่าต้นทุนใดของคุณที่มากกว่า — และทั้งสองโมเดลถูกออกแบบมาเพื่อให้คำตอบแทบไม่เคยเป็น "ทั้งสองอย่าง" GPT-6 Sol เปิดตัวเมื่อวันที่ 22 กันยายน 2026 ในราคา 2.00 ดอลลาร์ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น, 0.20 ดอลลาร์สำหรับแคช และ 10.00 ดอลลาร์สำหรับเอาต์พุต GPT-6.1 Sol เปิดตัวเมื่อวันที่ 29 กันยายน 2026 ในราคา 2.00 ดอลลาร์สำหรับอินพุต, 0.10 ดอลลาร์สำหรับแคช และ 10.00 ดอลลาร์สำหรับเอาต์พุต พร้อมการปรับปรุงที่ผู้ขายรายงานไว้ 6.4 จุดเปอร์เซ็นต์ในงานวิศวกรรมซอฟต์แวร์ที่ซับซ้อน ด้วยความพยายามในการให้เหตุผลที่ต่ำลง ราคาอินพุตและเอาต์พุตไม่เปลี่ยนแปลง อัตราแคชลดลงครึ่งหนึ่ง บรรทัดที่เปลี่ยนแปลงเพียงบรรทัดเดียวคือเหตุผลทางการเงินทั้งหมด และทุกอย่างที่เหลือเป็นข้อโต้แย้งด้านความสามารถ ซึ่ง ณ จุดนี้ในอายุของการเปิดตัว มาจากแหล่งเดียวเท่านั้น
มีสามสิ่งเปลี่ยนไป หนึ่งในนั้นคือบิล
ตัดส่วนการตลาดออกไป แล้วส่วนต่างระหว่างการติดตั้งใช้งานสองครั้งนี้ก็สั้นพอที่จะจำได้หมดในหัว
• อินพุตที่แคชไว้ — $0.10 ต่อล้านโทเคนบน GPT-6.1 Sol เทียบกับ $0.20 บน GPT-6 Sol วัดจากผลจริง而非การอ้าง และเป็นความเปลี่ยนแปลงเดียวที่แสดงออกมาเป็นการคำนวณทางเลขคณิต
• ขีดความสามารถ ตามที่ผู้จำหน่ายระบุ — OpenAI รายงานว่านำอยู่ 6.4 จุดบน DeepSWE v1.1 ด้วยความพยายามในการใช้เหตุผลและต้นทุนที่ต่ำกว่า คะแนนมากกว่าสองเท่าบน Terminal-Bench Science 0.1 ที่ความพยายามสูงสุด เจ็ดจุดบนชุดออฟไลน์ OSWorld 2.0 ที่ความพยายามสูงสุด 4.8 จุดบน AutomationBench ที่ความพยายามปานกลาง และอัตราข้อผิดพลาดเชิงข้อเท็จจริงลดลงจาก 11.4% เหลือ 7.7% บนชุดพรอมป์ที่จงใจชักนำให้เกิดข้อผิดพลาด ทั้งหมดนี้ยังไม่มีการทำซ้ำเพื่อยืนยัน
• ลำดับขั้นการใช้เหตุผล — GPT-6.1 Sol รองรับ low, medium, high, xhigh และ max แต่ไม่รองรับ none ส่วน GPT-6 Sol รองรับทั้งหกระดับ นี่คือความแตกต่างที่ทำให้โค้ดพัง และเป็นสิ่งเดียวที่ไม่มีใครใส่ไว้ในโพสต์เปิดตัว
ทุกอย่างอื่นเหมือนกันหรือใกล้เคียงกันมากพอ ทั้งหน้าต่างบริบทขนาด 1,050,000 โทเค็นเท่าเดิม เพดานเอาต์พุต 128,000 โทเค็นเท่าเดิม อัตราการเขียนแคช $2.50 เท่าเดิม เกณฑ์การปรับราคาที่ 272K โทเค็นเท่าเดิม ซึ่งหากเกินกว่านั้น คำขอทั้งหมดจะถูกคิดค่าบริการที่อัตรา 2× สำหรับอินพุตและแคช และ 1.5× สำหรับเอาต์พุต ข้อกำหนดให้ใช้ Responses API สำหรับการเรียกใช้เครื่องมือเท่าเดิม และการไม่มีการรองรับ fine-tuning เท่าเดิม จุดตัดความรู้ขยับจากวันที่ 20 เมษายนเป็นวันที่ 30 เมษายน 2026 — สิบวัน ซึ่งเป็นตัวเลขแบบที่บอกคุณได้ว่านี่เป็นการดัดแปลงระบบครั้งใหญ่แค่ไหน มากกว่าจะเป็นการสร้างใหม่ทั้งหมด
ทำไมแคชไลน์จึงมีค่ามากกว่าที่เห็น

การอ่านแคชที่ลดลงครึ่งหนึ่งเป็นเรื่องแปลกที่จะใช้เป็นจุดเด่นของการรีเฟรชผลิตภัณฑ์ จนกว่าคุณจะดูว่าทราฟฟิกของเอเจนต์จริงๆ แล้วหน้าตาเป็นอย่างไร ลูปของเอเจนต์ส่งพรีฟิกซ์ที่คงที่ซ้ำ — พรอมต์ระบบ สคีมาของเครื่องมือ บริบทที่ดึงมา ประวัติการสนทนา — ในทุกเทิร์น และในเซสชันที่ยาวนาน พรีฟิกซ์เดียวกันนั้นถูกคิดค่าบริการหลายสิบหรือหลายร้อยครั้ง นั่นคือทราฟฟิกที่อัตราแคชไม่ใช่แค่ความคลาดเคลื่อนจากการปัดเศษอีกต่อไป แต่กลายเป็นรายการหลักในใบแจ้งหนี้
ลองคำนวณตัวเลขสำหรับเซสชันเอเจนต์ยาวครั้งเดียว สมมติว่ามีคำนำหน้า 120,000 โทเคนที่ใช้ซ้ำตลอด 40 เทิร์น ดังนั้นจะมีอินพุตที่แคชไว้ 4.8 ล้านโทเคนต่อเซสชัน บวกกับเอาต์พุตใหม่ 150,000 โทเคนบน GPT-6 Sol การอ่านที่แคชไว้คิดเงิน $0.96 และเอาต์พุต $1.50 — ประมาณ $2.46 ต่อเซสชัน บน GPT-6.1 Sol เซสชันเดียวกันคิดเงิน $0.48 สำหรับการอ่านที่แคชไว้ และ $1.50 เท่าเดิมสำหรับเอาต์พุต: ประมาณ $1.98 ต่อเซสชันความต่างคือ 48 เซนต์ ซึ่งไม่ใช่ปัจจัยตัดสินใจ คูณกับหนึ่งแสนเซสชันต่อเดือนแล้วจะได้ $48,000 — ซึ่งเป็นปัจจัยตัดสินใจ
มีข้อควรระวังสองข้อที่ทำให้เรื่องนี้ยังซื่อตรงอยู่ การอ่านจากแคชจะคิดราคาในอัตราแคชก็ต่อเมื่อ prefix ตรงจริง ๆ เท่านั้น ดังนั้นการประหยัดที่คุณได้รับจริงคืออัตราการฮิตคูณกับส่วนต่าง ไม่ใช่ตัวส่วนต่างเอง และ prefix ต้องมีไม่เกิน 272,000 โทเคน อัตรามาตรฐานจึงจะใช้ได้เลย หากเกินเส้นนั้น คำขอทั้งหมดจะถูกคิดราคาใหม่ที่อินพุตและแคช 2× และเอาต์พุต 1.5× ซึ่งอาจกลบการประหยัด 10 เซนต์บน prefix ได้หมด เซสชันบริบทแบบยาวคือกรณีที่คณิตศาสตร์ของแคชมีแนวโน้มจะไม่ตรงกับที่โฆษณาไว้มากที่สุด
ช่องว่างของเบนช์มาร์กนั้นมีอยู่จริง และมันมาจากจุดเดียว
โพสต์เปิดตัวของ OpenAI ลงรายละเอียดเกี่ยวกับการประเมินของตนอย่างเจาะจงผิดปกติ ซึ่งเป็นข้อดี และตัวเลขทุกตัวเหล่านั้นล้วนมาจากผู้ขายที่ให้คะแนนโมเดลของตัวเอง ซึ่งเป็นข้อเสีย รูปแบบที่ปรากฏทั่วทั้งหมดนั้นสอดคล้องกัน: การเปรียบเทียบที่ถูกหยิบยกไปพูดถึงจะเทียบกับ GPT-6 Astra เสมอ และการเปรียบเทียบกับ Astra ก็เป็นการเปรียบเทียบด้านต้นทุนเสมอ บน DeepSWE v1.1 ข้อกล่าวอ้างคือทำได้เทียบเท่า Astra ด้วยต้นทุนประมาณหนึ่งในห้า บน GDP.pdf คือเข้าใกล้ระดับล้ำสมัยของ Astra ด้วยต้นทุนต่องานประมาณหนึ่งในห้า บน OSWorld 2.0 ห่างจาก Astra ภายใน 2.1 คะแนน ด้วยต้นทุนต่องานประมาณหนึ่งในเจ็ด ด้านความถูกต้องตามข้อเท็จจริง ห่างจาก Astra ภายใน 1.9 คะแนน ด้วยต้นทุนต่องานน้อยกว่าหนึ่งในห้า นั่นไม่ใช่เรื่องบังเอิญในการร่างข้อความ แต่เป็นแก่นข้อเสนอของผลิตภัณฑ์ และเป็นข้อเสนอเกี่ยวกับราคา ไม่ใช่เกี่ยวกับความเป็นผู้นำด้านขีดความสามารถ
จุดเดียวที่ OpenAI ปฏิเสธกรอบการนำเสนอของตัวเองนั้นน่าชื่นชม: ใน Terminal-Bench Science 0.1 ระบุไว้อย่างตรงไปตรงมาว่า GPT-6 Astra ยังคงครองคะแนนสูงสุดในบรรดาโมเดลที่ทดสอบ ด้วยคะแนน 68.1% และควรนำไปใช้กับงานวิจัยทางวิทยาศาสตร์ที่ยากที่สุด โพสต์เปิดตัวที่บอกคุณว่าควรซื้อรุ่นพี่ที่แพงกว่าเมื่อไหร่ ถือเป็นโพสต์เปิดตัวที่มีวินัยอยู่ในตัว
เมื่อเทียบกับ GPT-6 Sol โดยเฉพาะ สภาพที่ตรงไปตรงมาของการเปรียบเทียบคือแบบนี้ — ไม่มีคะแนนอิสระสำหรับทั้งสองโมเดลในการตั้งค่านี้เลย Artificial Analysis มีการประเมิน GPT-6 Sol อย่างเต็มรูปแบบที่ระดับความพยายามในการใช้เหตุผลสูงสุด: Intelligence Index อยู่ที่ 48, 1.06 ดอลลาร์ต่องาน index, โทเคนเอาต์พุตที่สร้างขึ้น 77 ล้านโทเคน เทียบกับค่ามัธยฐานของบอร์ดที่ 88 ล้าน และ Coding Agent Index อยู่ที่ 57 ที่ 2.99 ดอลลาร์ต่องาน ณ วันที่ 30 กันยายน ไม่มีรายการ GPT-6.1 Sol อยู่เลย; slug ของโมเดลขึ้น 404 และสตริงดังกล่าวไม่ปรากฏในลีดเดอร์บอร์ดสด ดังนั้นการเปรียบเทียบโดยบุคคลที่สามที่วัดได้ซึ่งมีอยู่ในวันนี้มีเพียงระหว่าง GPT-6 Sol กับโมเดลของแล็บอื่น ๆ — ไม่ใช่ระหว่าง GPT-6 Sol กับรุ่นสืบทอดของตัวเอง ใครก็ตามที่แสดงแผนภูมิ 6.1 เทียบกับ 6.0 ให้คุณดูตอนนี้ กำลังแสดงสไลด์ของ OpenAI ให้คุณดู
การย้ายข้อมูลเป็นการเปลี่ยนสตริง ยกเว้นในจุดที่มันไม่ใช่
คำแนะนำการย้ายระบบของ OpenAI เองสำหรับตระกูล GPT-6 นั้นคุ้มค่าที่จะอ่านก่อนที่คุณจะสลับตัวระบุ เพราะมีสองประเด็นในนั้นที่ทำให้โค้ดที่ทำงานอยู่พัง ประการแรกคือบันไดการให้เหตุผล: หากคำขอใดส่ง reasoning_effort: "none" GPT-6.1 Sol จะปฏิเสธคำขอนั้น และวิธีแก้ที่ระบุไว้ในเอกสารคือเริ่มต้นที่ low และเปรียบเทียบบนงานที่เป็นตัวแทน แทนที่จะสันนิษฐานว่าการตั้งค่าต่ำสุดนั้นเทียบเท่ากัน เวิร์กโฟลว์ที่ใช้ none เป็นค่าฐานด้านความหน่วงจะสูญเสียค่าฐานนั้นไป ประการที่สองคือการเรียกใช้เครื่องมือ: GPT-6.1 Sol รองรับ Chat Completions แต่ไม่รองรับการเรียกใช้เครื่องมือผ่านช่องทางนั้น — เครื่องมือต้องใช้ Responses API หากสแต็กของคุณเรียกใช้ฟังก์ชันบน /v1/chat/completions นั่นไม่ใช่การสลับสตริง แต่เป็นการพอร์ตเอนด์พอยต์ คำแนะนำของผู้ขายเองที่ให้กับนักพัฒนาที่ใช้ GPT-6 Sol อยู่แล้วคือให้ทบทวนคำแนะนำนั้นก่อนสลับ ซึ่งเป็นสัญญาณที่สมเหตุสมผลว่านี่ไม่ใช่การรีเฟรชแบบเสียบแทนได้ทันทีอย่างที่ช่องว่างหนึ่งสัปดาห์บ่งชี้
พารามิเตอร์ที่เหลือทำงานเหมือนเดิม ไม่ว่าจะเป็น reasoning effort, structured outputs, streaming, prompt caching และชุดเครื่องมือ ล้วนส่งต่อกันได้ทั้งหมด และกฎการปรับราคาที่ 272K แบบเดียวกันก็ใช้กับทั้งสองโมเดลเหมือนกันทุกประการ ตั้งค่า model เป็น gpt-6.1-sol โดยคงค่าการตั้งค่า effort ไว้ในจุดที่รองรับ และนำ temperature, top_p และ top_logprobs ออกทุกครั้งที่ค่า effort ไม่ใช่ none — ข้อหลังนี้ใช้กับทั้งสองโมเดล และเป็นสาเหตุที่พบบ่อยของข้อผิดพลาด 400 หลังการย้ายไปใช้โมเดลแบบ reasoning ใด ๆ
การย้ายโดยไม่เดิมพันเส้นทางโปรดักชันกับมัน

การย้ายระบบที่เป็นจริงไม่ใช่การตัดสลับ (cutover) แต่คือการรันแบบเงา (shadow run): ส่งทราฟฟิกโปรดักชันส่วนหนึ่งไปยังตัวระบุใหม่ เก็บตัวเก่าไว้เป็นเส้นทางที่ตอบกลับ แล้วเปรียบเทียบกันบนงานของคุณเอง นั่นคือปัญหาด้านการกำหนดเส้นทาง และเป็นจุดเดียวที่แพลตฟอร์มที่คุณเรียกผ่านเข้าไปเปลี่ยนรูปร่างของงาน OrcaRouter ให้บริการ GPT-6 Sol ในวันนี้ที่ราคาตามที่ OpenAI ตั้งไว้เองโดยไม่บวกเพิ่ม — การ์ดราคา $2.00 / $0.20 / $10.00 รวมกฎการคิดราคาใหม่ที่ 272K ไว้ด้วย — ดังนั้นแขนฝั่งเบสไลน์ของการเปรียบเทียบจึงพร้อมใช้งานบนคีย์เดียวกับทุกอย่าง และแขน 6.1 จะเพิ่มเข้าไปในชุดเส้นทางได้ทันทีที่เรียกใช้ได้ โดยไม่ต้องมีสัญญาที่สองหรือ SDK ที่สอง จนถึงตอนนั้น จุดยืนที่ตรงไปตรงมาคือ GPT-6 Sol เป็นโมเดลที่เรียกใช้ได้ และควรพูดให้ชัดเจนแทนที่จะสื่อเป็นอย่างอื่น: openai/gpt-6.1-solคืนค่า "model not found" บนแค็ตตาล็อกเอนด์พอยต์สาธารณะของเราในวันนี้ การเฟลโอเวอร์อัตโนมัติคือสิ่งที่ทำให้ shadow run ปลอดภัยเมื่อมันมาถึงจริง — หากเส้นทางใหม่เกิดข้อผิดพลาด คำขอจะเสร็จสิ้นบนเส้นทางเก่า และคุณจะรู้เรื่องนี้จากบันทึก log ไม่ใช่จากผู้ใช้ของคุณ
ใครควรย้ายตอนนี้: ทีมที่ต้นทุนส่วนใหญ่มาจากอินพุตที่แคชไว้ในเซสชันเอเจนต์แบบยาว และทีมที่เวิร์กโฟลว์ใช้ Responses API อยู่แล้วและไม่เคยส่งค่า ไม่มี. สำหรับพวกเขาแล้ว นี่เกือบจะเป็นการอัปเกรดฟรี — ผู้ขายรายงานว่าความสามารถเพิ่มขึ้น อัตราแคชลดลงครึ่งหนึ่ง และการย้ายระบบใช้เพียงสตริงเดียว ใครควรรอ: ทีมที่มี ไม่มี ในเส้นทางที่ความหน่วงเป็นสิ่งสำคัญ ทีมที่การเรียกใช้เครื่องมือทำงานผ่าน Chat Completions และใครก็ตามที่ต้องการตัวเลขจากภายนอก OpenAI ก่อนตัดสินใจ สำหรับกลุ่มสุดท้ายนี้ การรอไม่มีกำหนดสิ้นสุดที่ประกาศไว้ และสิ่งที่สมเหตุสมผลที่ควรทำกับเวลาที่มีคือสร้างชุดประเมินที่การเปรียบเทียบจะต้องใช้ — เพราะเมื่อคะแนนอิสระมาถึง มันจะมาจากทราฟฟิกของคนอื่น

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
