
GPT-6 Luna กับ GPT-5.6 Luna: ชื่อเดียวกัน ราคาครึ่งเดียว และผลงานส่งมอบที่แย่กว่า
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
สองโมเดล มีคำหนึ่งคำที่ใช้ร่วมกัน และคะแนนอิสระที่แทบจะเหมือนกันโดยสิ้นเชิง GPT-6 Luna ทำได้ 37.26 บน Artificial Analysis Intelligence Index; GPT-5.6 Luna ทำได้ 37.32 ความต่าง 0.07 คะแนนไม่ใช่ผลการวัด มันคือสัญญาณรบกวน และเป็นข้อเท็จจริงที่สำคัญที่สุดเพียงข้อเดียวเกี่ยวกับการจับคู่นี้ สิ่งที่ทำให้สองโมเดลนี้ต่างกันไม่ใช่ความสามารถ — แต่เป็น $0.0681 ต่องานดัชนีที่ทำเสร็จ เทียบกับ $0.1783 และชุดการถดถอยในงานองค์ความรู้ที่การลดราคาไม่ได้กล่าวถึง
วันที่มีความสำคัญต่อการตีความตัวเลขเหล่านี้ GPT-5.6 Luna เปิดตัวเมื่อวันที่ 9 กรกฎาคม 2026 ในราคา $0.20 ต่ออินพุตหนึ่งล้านโทเค็น และ $1.20 ต่อเอาต์พุตหนึ่งล้านโทเค็น GPT-6 Luna เปิดตัวเมื่อวันที่ 22 กันยายน 2026 ในราคา $0.10 และ $0.50 — ซึ่งคิดเป็นครึ่งหนึ่งของอัตราอินพุตพอดี และลดลง 58% จากอัตราเอาต์พุต ซึ่ง OpenAI ระบุว่าเป็นราคาถาวร ไม่ใช่ราคาโปรโมชัน นั่นเป็นการลดราคาจริง และยังเป็นเพียงครึ่งเล็ก ๆ ของเรื่องราว ครึ่งที่ใหญ่กว่าคือโมเดลใหม่กว่าเป็นโมเดลที่แตกต่างออกไป ไม่ใช่โมเดลเดิมที่ตั้งราคาใหม่

การโยกย้ายให้อะไรจริง ๆ บ้าง ในเชิงตัวเลข
เมื่อนำสองสิ่งนี้มาเทียบกันในมิติที่ชี้ขาดการย้ายระบบ ภาพรวมที่ได้กลับไม่สม่ำเสมอ บางแถวดีขึ้น บางแถวแย่ลง และมีหนึ่งแถวที่ดีขึ้นอย่างมาก
• ราคา — GPT-6 Luna $0.10 ขาเข้า / $0.50 ขาออก ต่อล้านโทเคน เทียบกับ GPT-5.6 Luna $0.20 / $1.20 ถูกกว่าครึ่งหนึ่งสำหรับขาเข้า และลด 58% สำหรับขาออก
• อินพุตที่แคชไว้ — $0.01 ต่อล้าน เทียบกับ $0.02 ส่วนลด 90% เดียวกันบนฐานที่ลดครึ่ง ดังนั้นคำนำหน้าที่ซ้ำจะเสียค่าใช้จ่ายครึ่งหนึ่งของราคาเมื่อเดือนกรกฎาคม
• ต้นทุนต่องานที่ทำเสร็จ — 0.0681 ดอลลาร์ เทียบกับ 0.1783 ดอลลาร์บนชุดเดียวกัน ลดลง 62% ซึ่งมากกว่าการลดราคาต่อโทเคน เนื่องจากสัดส่วนของประเภทงานไม่เหมือนกัน
• โทเค็นเอาต์พุตต่องาน — 50,537 เทียบกับ 41,235 โมเดลใหม่ช่างพูดมากขึ้น 23% ต่อหนึ่งงานที่เสร็จสิ้น และ 78% ของเอาต์พุตเป็นการใช้เหตุผลที่ไม่ปรากฏในคำตอบ
• หน้าต่างบริบท — 1,050,000 โทเค็น เทียบกับ 1,000,000 เพดานการใช้งานจริงเดียวกัน ทั้งคู่จำกัดเอาต์พุตที่ 128,000 โทเค็น
• การงดตอบ — อัตราการสร้างข้อมูลเท็จ 76.7% บน AA-Omniscience เทียบกับ 92.6% นี่เป็นการปรับปรุงรายการเดียวที่ใหญ่ที่สุดในชุด และไม่ใช่การเพิ่มพูนความรู้: ความแม่นยำขยับจาก 42.7% เป็น 43.8% ซึ่งแทบจะคงที่ โมเดลที่ใหม่กว่าจะปฏิเสธที่จะตอบแทนการกุเรื่องขึ้นมา ซึ่งเป็นการเปลี่ยนแปลงเชิงพฤติกรรมมากกว่าการเปลี่ยนแปลงเชิงขีดความสามารถ
• ผลงานที่ส่งมอบในงานด้านความรู้ — AA-Briefcase v1.1 ลดลงจาก 1,345.38 Elo เป็น 1,299.23 และ GDPval-AA v2.1 ลดลงจาก 1,443.14 เป็น 1,367.09 ทั้งคู่ลดลงราว 46 และ 76 คะแนน
• การเขียนโค้ดและงานระยะยาว — Terminal-Bench 4.0 เพิ่มขึ้นจาก 11.6% เป็น 12.6% และ SciCode จาก 53.6% เป็น 54.6% ซึ่งเป็นสองแถวที่เพิ่มขึ้นในที่นี้ เมื่อเทียบกับสิ่งนั้น Coding Agent Index ลดลงจาก 43 เหลือ 41 และการประเมินเชิงเอเจนต์สไตล์ SWE ก็เป็นไปในทิศทางเดียวกัน
• AutomationBench-AA — 53.2% เทียบกับ 50.2% ปรับขึ้น และปรับขึ้นมากกว่าตัวชี้วัดแบบเอเจนติกอื่น ๆ ในชุดนี้

การถดถอยอยู่ที่อาร์ติแฟกต์ ไม่ใช่ที่การให้เหตุผล
รูปแบบในสองแถวสุดท้ายนั้นควรค่าแก่การตั้งชื่อ เพราะมันคือการตัดสินใจทั้งหมด โมเดลใหม่ทำได้ดีกว่าในการดำเนินการแบบเอเจนต์ในขั้นตอนเดียว และแย่ลงในการส่งคืนเอกสารที่เสร็จสมบูรณ์ Artificial Analysis ระบุว่าการลดลงของงานที่ใช้ความรู้เป็นผลมาจากคุณภาพการนำเสนอและผลงานส่งมอบที่ข้ามองค์ประกอบตามเกณฑ์ที่กำหนด มากกว่าที่จะเป็นความล้มเหลวด้านข้อเท็จจริงหรือการให้เหตุผล ซึ่งเป็นความถดถอยแบบที่ผ่านการทดสอบ smoke test ได้แต่ไม่ผ่านการรีวิว
เมื่อนำข้อเท็จจริงสองข้อนี้มาไว้ด้วยกัน การย้ายโมเดลจะแยกออกได้อย่างชัดเจนตามว่าอะไรเป็นผู้นำผลลัพธ์ไปใช้ หากไปป์ไลน์ของคุณอ่านผลลัพธ์แบบมีโครงสร้าง — JSON, การจำแนกประเภท, ฟิลด์ที่สกัดได้, การตัดสินใจด้านการกำหนดเส้นทาง — การถดถอยด้านการนำเสนอไม่ทำให้คุณเสียอะไรเลย การปรับปรุงด้านการงดตอบถือเป็นกำไรจริง และการลดต้นทุนต่องานลง 62% ก็ได้มาครบถ้วน หากมีคนอ่านสิ่งที่ส่งมอบ — รายงาน, บันทึกช่วยจำ, เอกสารที่ยื่นต่อลูกค้า — โมเดลใหม่จะแย่ลงอย่างที่วัดได้ในสิ่งที่คุณกำลังจ่ายเงินเพื่อมันพอดี และเงินที่ประหยัดได้ก็กำลังซื้อคนตรวจทานมาให้คุณ
ตัวเลขการงดตอบก็ควรได้รับการปฏิบัติแบบเดียวกัน โมเดลที่เปลี่ยนจากเดิมที่กุเรื่องใน 93% ของสิ่งที่มันไม่รู้ มาสู่การกุเรื่องใน 77% ถือเป็นสิ่งที่แตกต่างอย่างมีนัยสำคัญสำหรับ guardrail, การคัดกรองด้าน compliance หรือไปป์ไลน์ใดก็ตามที่คำตอบผิดอย่างมั่นใจแพร่กระจายต่อไป การปรับปรุงนั้นเป็นของจริง ถูกวัดอย่างเป็นอิสระ และเป็นข้อโต้แย้งที่แข็งแกร่งที่สุดสำหรับการย้ายงานไปยังโมเดลใหม่ ซึ่งไม่ได้ขึ้นอยู่กับราคาเลยแม้แต่น้อย
I don't see any source text to translate — your message only contains the instructions, with no content after "must be reproduced..." Please send the text you'd like localized into Thai (with its {{1}}...{{/1}} span markers intact), and I'll return the Thai version with every marker preserved exactly.
น้อยกว่าที่การลดราคาในขนาดนี้บ่งชี้ ซึ่งเป็นข่าวดี หน้าต่างบริบทอยู่ในระดับเดียวกัน เอาต์พุตสูงสุดเท่ากันที่ 128,000 โทเค็น และเงื่อนไขการปรับราคาสำหรับบริบทยาวของตระกูลนี้ยังคงเดิม: คำขอที่มีอินพุตเกิน 272,000 โทเค็นจะถูกคิดค่าบริการในอัตราอินพุตและแคช 2 เท่า และเอาต์พุต 1.5 เท่า สำหรับคำขอทั้งหมด ไม่ใช่เฉพาะส่วนที่เกินเกณฑ์ คำขอที่เคยมีค่าใช้จ่ายสูงที่ 300,000 โทเค็นบน GPT-5.6 Luna ก็ยังมีค่าใช้จ่ายสูงบน GPT-6 Luna เช่นกัน — อัตราถูกลงครึ่ง แต่หน้าผาเดิม ดังนั้นเวิร์กโหลดที่ควรถูกแบ่งในเดือนกรกฎาคมก็ยังควรถูกแบ่งในตอนนี้
ขั้นบันไดความพยายามคือจุดที่พฤติกรรมเปลี่ยนไป ไม่ใช่ค่าใช้จ่าย GPT-6 Luna มีให้เลือก none, low, medium (ค่าเริ่มต้น), high, xhigh และ max และค่าเริ่มต้นนั้นสำคัญ: ไปป์ไลน์ที่ถูกปรับจูนกับระดับความพยายามเริ่มต้นของโมเดลหนึ่ง จะไม่ได้ถูกปรับจูนกับอีกโมเดลโดยอัตโนมัติ ทีมที่ล็อกการตั้งค่าไว้อย่างชัดเจนจะไม่ได้รับผลกระทบ ทีมที่ใช้ค่าเริ่มต้นกำลังทำงานด้วยการตั้งค่าที่ต่างไปจากเมื่อเดือนกรกฎาคม และอาการที่มองเห็นได้จะเป็นปริมาณโทเคน ไม่ใช่คุณภาพ
กับดักหนึ่งข้อควรพูดซ้ำ เพราะมันไม่ได้หายไปกับโมเดลใหม่ บนเอนด์พอยต์ Chat Completions การเรียกใช้ฟังก์ชันจะทำงานเฉพาะเมื่อตั้งค่า reasoning effort เป็น none เท่านั้น ระดับ effort อื่น ๆ ทุกระดับ และเครื่องมือในตัวทุกตัว ต้องใช้ Responses API ทีมที่พอร์ตลูปการเรียกใช้เครื่องมือโดยเปลี่ยนสตริงโมเดลจะพบว่าเครื่องมือของตนใช้งานไม่ได้อย่างเงียบ ๆ ที่ค่า effort เริ่มต้นระดับ medium และวิธีแก้คือการเขียน call surface ใหม่ ไม่ใช่การปรับพารามิเตอร์
สิ่งที่คุณกำหนดเส้นทางได้ในวันนี้ และสิ่งที่คุณกำหนดเส้นทางไม่ได้
นี่คือส่วนของการย้ายระบบที่ไม่เกี่ยวข้องกับเบนช์มาร์กเลย GPT-5.6 Luna อยู่บน OrcaRouter ในราคาตามที่ประกาศไว้ — 0.20 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน, 1.20 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน, หน้าต่างบริบท 1,000,000 โทเคน, เอาต์พุตสูงสุด 128,000 โทเคน และเวลา p50 ถึงโทเคนแรกที่ 1.60 วินาที ซึ่งวัดจากทราฟฟิกจริงบนหน้าของโมเดลของเราเอง เราส่งต่อราคาตามที่ผู้ให้บริการประกาศไว้โดยไม่บวกเพิ่ม ดังนั้นในวันที่ OpenAI ปรับราคาตระกูลนี้ การเปลี่ยนแปลงก็มีผลในฝั่งของเราทันที ไม่ใช่รอรอบบิลถัดไป

GPT-6 Luna ไม่สามารถจัดเส้นทางผ่าน OrcaRouter ได้ ณ วันที่ 23 กันยายน 2026 ความพร้อมให้บริการมีเฉพาะใน API ของ OpenAI เองและแคตตาล็อกคลาวด์ที่ให้บริการตระกูลนี้ และเราไม่แสดงรายการโมเดลที่เราไม่สามารถให้บริการได้ ผลในทางปฏิบัติคือ ทีมที่วางแผนการโยกย้ายนี้สามารถย้ายการคิดราคาได้วันนี้ แต่ยังไม่สามารถย้ายการจัดเส้นทางได้วันนี้ — สองส่วนของการเปลี่ยนแปลงจะเกิดขึ้นคนละวันที่
สิ่งที่ทำให้เป็นไปได้ในระหว่างนี้คือการจัดวางที่ทีมส่วนใหญ่จะลงเอยด้วยการต้องการอยู่ดี ให้ GPT-5.6 Luna อยู่ในเส้นทางที่สิ่งที่ส่งมอบคืองานผลิตภัณฑ์ ใช้ GPT-6 Luna ทุกที่ที่เอาต์พุตถูกนำไปใช้โดยโค้ด และมองขอบเขตนั้นเป็นระดับชั้น (tier) มากกว่าการเขียนใหม่ เพราะโมเดลที่คุณเข้าถึงได้นั้นอยู่หลังปลายทางเดียว (endpoint) ที่มีโมเดลกว่า 200 รายการภายใต้คีย์เดียวกัน พร้อมการสลับไปใช้ผู้ให้บริการรายอื่นอัตโนมัติเมื่อเกิดข้อขัดข้อง การเพิ่มหรือถอดระดับชั้นจึงเป็นเพียงรายการในคอนฟิก ไม่ใช่การผสานรวมชุดที่สอง — และเส้นทางการยกระดับก็ไม่ต้องพึ่งพาโมเดลใดโมเดลหนึ่งให้พร้อมใช้งานอีกต่อไป
การตัดสินใจเรื่องการโยกย้าย กล่าวอย่างตรงไปตรงมา
ย้ายงานไปยังจุดที่ผลลัพธ์ถูกอ่านโดยเครื่องและเงื่อนไขความสำเร็จสามารถตรวจสอบได้ การจำแนกประเภท การสกัดข้อมูล การตัดสินใจด้านการกำหนดเส้นทาง การเรียกใช้ guardrail การประมวลผลการแปลงแบบกลุ่ม และการดำเนินการของเอเจนต์แบบขั้นตอนเดียว ล้วนเข้าเกณฑ์ทั้งหมด: คอมโพสิตยังคงเดิม พฤติกรรมการละเว้นดีขึ้นอย่างมีนัยสำคัญ และต้นทุนของงานลดลงประมาณ 62% ด้วย Batch ที่ครึ่งหนึ่งของอัตรามาตรฐาน และอินพุตที่แคชไว้ในราคาหนึ่งในสิบของฐานที่ลดครึ่งแล้ว ไปป์ไลน์ที่เคยแทบไม่คุ้มในเดือนกรกฎาคมก็สามารถทำได้อย่างตรงไปตรงมาในตอนนี้
อย่าย้ายงานที่มนุษย์เป็นผู้ลงนามรับรองอาร์ติแฟกต์ และอย่าย้ายพาธของเอเจนต์เขียนโค้ดแบบไม่ตรวจสอบ การลดลง 46 จุดของ AA-Briefcase และการลดลง 76 จุดของ GDPval เป็นตัวเลขเล็ก ๆ ที่ชี้ไปในทิศทางเดียวกับการลดลง 2 จุดของ Coding Agent Index และโหมดความล้มเหลวที่ Artificial Analysis อธิบาย — องค์ประกอบรูบริกที่ถูกข้าม การนำเสนอที่อ่อนแอลง — มองไม่เห็นจากการตรวจสอบอัตโนมัติ ให้ใช้โมเดลก่อนหน้าในกรณีที่สิ่งที่ต้องส่งมอบคือความประณีต
และจงมองการเสมอกันของคะแนนดัชนีที่ 0.07 จุดให้เป็นข้อค้นพบอย่างที่มันเป็น นี่ไม่ใช่โมเดลที่ฉลาดกว่าในราคาที่ต่ำกว่า แต่มันคือโมเดลที่มีรูปทรงแตกต่างออกไปในราคาที่ต่ำกว่า และคำถามที่แผนการย้ายระบบต้องตอบคือรูปทรงแบบใดที่เวิร์กโหลดของคุณใช้ ไม่ใช่ว่าคะแนนใดสูงกว่า เพราะในบันทึกผลอิสระ คะแนนสองค่านั้นเป็นตัวเลขเดียวกัน
