
Grok 4.7 vs Grok 4.6: ราคา $2/$6 เท่ากัน แต่ข้างในเป็นโมเดลที่แตกต่างกัน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 1009 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
SpaceXAI เปิดตัว Grok 4.7 เมื่อวันที่ 21 กันยายน 2026 และสิ่งแรกที่น่าสังเกตเกี่ยวกับมันก็คือสิ่งที่ไม่ได้เปลี่ยนแปลง นั่นคือราคา Grok 4.7 มีราคา 2 ดอลลาร์ต่อโทเค็นอินพุต 1 ล้านโทเค็น และ 6 ดอลลาร์ต่อโทเค็นเอาต์พุต 1 ล้านโทเค็น ซึ่งเป็นราคาเดียวกับที่ Grok 4.6 มีมาตั้งแต่เปิดตัวเมื่อวันที่ 12 สิงหาคม 2026 อัตราค่าใช้จ่ายเดียวกัน หน้าต่างบริบท 500,000 โทเค็นเดียวกัน อินพุตข้อความและรูปภาพแบบเดียวกัน — แต่กระนั้นทั้งสองโมเดลกลับไม่ใกล้เคียงกันเลยในการประเมินที่สำคัญต่องานแบบเอเจนติก จากตัวเลขที่ SpaceXAI เผยแพร่เอง Grok 4.7 ทำคะแนนบน Terminal-Bench 4.0 ได้เกือบเป็นสองเท่าของ Grok 4.6 คือ 38.0% เทียบกับ 20.3% นั่นคือภาพรวมทั้งหมดของการเปรียบเทียบนี้: การเปลี่ยนรุ่นในราคาเดิมซึ่งผลกำไรเกือบทั้งหมดตกอยู่ที่จุดเดียว และส่วนต่าง ๆ ของ Grok 4.6 ที่เคยสร้างความรำคาญให้กับทีมโปรดักชันก็ยังอยู่เช่นเดิม
จริง ๆ แล้วมีอะไรเปลี่ยนไประหว่างสองโมเดลนี้
คำอธิบายของ SpaceXAI เองเกี่ยวกับการเปิดตัวครั้งนี้มีขอบเขตแคบ และเป็นการดีกว่าที่จะยกโครงร่างของมันมาอ้างอิง มากกว่าจะยกคำคุณศัพท์ Grok 4.7 สร้างขึ้นบนโมเดลฐานที่ใหญ่กว่า Grok 4.6 และได้รับรอบการเรียนรู้แบบเสริมกำลังที่ยาวนานขึ้น ซึ่งมุ่งเป้าไปที่งานที่ "อาจใช้เวลาหลายชั่วโมงจึงจะเสร็จ" บริษัทกล่าวว่ารอบนั้นได้ขัดเกลาสามสิ่งให้คมชัดขึ้น ได้แก่ การตรวจสอบด้วยตนเอง การจัดการบริบทแบบยาว และพฤติกรรมภายในสภาพแวดล้อมของ Grok Bot ไม่มีการกล่าวอ้างถึงสถาปัตยกรรมใหม่ มอดาลิตีใหม่ หรือสแตกการให้บริการที่แตกต่างออกไป
กรอบความคิดนั้นสำคัญ เพราะมันคาดการณ์ได้ว่าคะแนนเบนช์มาร์กที่เพิ่มขึ้นจะโผล่ตรงไหน และมันก็โผล่ตรงนั้นพอดี การฝึก RL ที่ยาวนานขึ้นบนงานยากที่ใช้เวลาหลายชั่วโมงส่งผลต่องานในเทอร์มินัลและรีโพซิทอรีมากกว่าส่งผลต่อแบบทดสอบความรู้มาก ถ้าคุณหวังว่า Grok 4.7 จะเป็นโมเดลที่กว้างกว่า Grok 4.6 บันทึกประจำรุ่นบอกเป็นอย่างอื่น — มันมีรูปแบบโมเดลเดียวกัน แต่ถูกฝึกต่อไปในปลายด้านยากของงานเชิงเอเจนต์
เรื่องราวเกี่ยวกับพารามิเตอร์เป็นส่วนเดียวในนี้ที่ไม่ใช่การเปิดเผยจากผู้ขาย มัสก์กล่าวเมื่อต้นเดือนกันยายนว่า Grok 4.7 มีพารามิเตอร์ราว 2.1 ล้านล้าน เมื่อเทียบกับ 1.5 ล้านล้านของ Grok 4.6 ซึ่งเพิ่มขึ้น 40% และตัวเลขนั้นก็ถูกพูดซ้ำไปทั่วตั้งแต่นั้นมา มันไม่เคยปรากฏบนเอกสารข้อมูลจำเพาะของ SpaceXAI เลย ให้ถือว่ามันเป็นข้อกล่าวอ้างที่ถูกส่งต่อกันอย่างกว้างขวางเกี่ยวกับโมเดลฐาน ไม่ใช่ข้อมูลจำเพาะที่ยืนยันแล้ว — และโปรดทราบว่าจำนวนพารามิเตอร์บอกอะไรได้น้อยมากเกี่ยวกับต้นทุนการให้บริการหรือความสามารถ เมื่อสถาปัตยกรรมเป็นแบบเบาบาง ซึ่งเป็นเช่นนั้นในตระกูล Grok
ช่องว่างของเกณฑ์มาตรฐาน พร้อมป้ายกำกับแหล่งที่มาที่แนบมาด้วย
ทุกตัวเลขในส่วนนี้มาจากเอกสารการปล่อยของ SpaceXAI ยังไม่มีข้อมูลใดถูกทำซ้ำโดยอิสระ ณ เวลาที่เขียน และวิธีอ่านอย่างซื่อตรงคือมองมันเป็นชุดข้อกล่าวอ้างที่บังเอิญเจาะจงอย่างผิดปกติ ซึ่งทำให้ตรวจสอบได้ในภายหลัง แต่ไม่ได้ทำให้มันได้รับการยืนยันในตอนนี้
• Terminal-Bench 4.0 — Grok 4.7 38.0% (รายงานโดยผู้ขาย) เทียบกับ Grok 4.6 20.3% ส่วนต่างที่ใหญ่ที่สุดเพียงรายการเดียวในการเปิดตัวนี้ และเป็นรายการที่สอดคล้องกับคำกล่าวอ้าง "RL ที่นานขึ้นบนงานที่ยากขึ้น"
• CursorBench 4.0 — Grok 4.7 46.3% (ตามที่ผู้ให้บริการรายงาน) เทียบกับ Grok 4.6 40.4% นับเป็นการเพิ่มขึ้นจริง แต่เพิ่มขึ้นเพียงเล็กน้อย — ไม่ถึงหกจุด บนเบนช์มาร์กที่ใกล้เคียงกับงานแก้ไขในเอดิเตอร์ประจำวันมากกว่ากับเซสชันเทอร์มินัลแบบอัตโนมัติ
• DeepSWE v1.1 — Grok 4.7 71.0% ที่ความพยายามในการให้เหตุผลระดับสูง (ผู้ขายรายงาน) เทียบกับ Grok 4.6 65.2% อีกครั้งเป็นการปรับปรุงที่มั่นคงแต่ไม่หวือหวา
• EEBench — Grok 4.7 64.0% (รายงานโดยผู้จำหน่าย) ไม่มีการเผยแพร่ตัวเลขของ Grok 4.6 ควบคู่กัน ดังนั้นตัวเลขนี้จึงไม่ได้บอกอะไรเกี่ยวกับการอัปเกรดเลย
• AA-Briefcase v1.1 — Grok 4.7 ที่ 1,657 Elo (ตามที่ผู้ขายรายงาน) ในการประเมินงานด้านความรู้เชิงวิชาชีพ
อ่านรายการทั้งหมดเป็นชุดเดียวแล้วรูปแบบจะสอดคล้องกัน: Grok 4.7 ดีขึ้นอย่างมีนัยสำคัญเมื่องานยาวและเป็นเชิงเอเจนต์ และดีขึ้นเพียงเล็กน้อยเมื่องานสั้น การพุ่งขึ้นของ Terminal-Bench นั้นประมาณสองเท่า ส่วนผลที่ได้จากงานแก้ไขในเอดิเตอร์อยู่ในระดับเปอร์เซ็นต์หลักเดียว ถ้าลักษณะภาระงานของคุณเป็นแบบออโตคอมพลีต คุณกำลังจ่าย $2/$6 เท่าเดิมเพื่อการปรับปรุงเพียงเล็กน้อย ถ้าภาระงานของคุณคือ "รันเป็นเวลาสองชั่วโมงแล้วกลับมา" การเปิดตัวนี้เล็งมาที่คุณโดยตรง
สิ่งที่การวัดที่เป็นอิสระบอกมาจนถึงตอนนี้
มีตัวเลขอิสระอยู่หนึ่งตัว และควรกล่าวถึงอย่างระมัดระวัง เพราะอ่านผิดได้ง่าย Artificial Analysis ให้คะแนน Grok 4.7 ที่ 46 บน Intelligence Index เวอร์ชัน v4.3.2 ซึ่งจัดอันดับให้เป็นที่ 16 จาก 655 โมเดลบนกระดานจัดอันดับ Grok 4.6 อยู่ที่ 44 บนมาตราเดียวกัน ช่องว่างสองจุดบนดัชนีรวมไม่ใช่การเพิ่มเป็นสองเท่าที่ Terminal-Bench แสดง และความคลาดเคลื่อนนั้นให้ข้อมูลมากกว่าที่จะขัดแย้งกัน: ดัชนีนี้ผสมผสานการให้เหตุผล ความรู้ คณิตศาสตร์ และการเขียนโค้ด ดังนั้นการเพิ่มขึ้นอย่างมากในด้านเอเจนต์เพียงด้านเดียวจึงเจือจางลงด้วยทุกสิ่งที่โมเดลไม่ได้เปลี่ยนแปลง
รายละเอียดเพิ่มเติมอีกสองข้อจากหน้าเดียวกันมีประโยชน์มากกว่าคะแนนที่พาดหัว ข้อแรก Grok 4.7 สร้างโทเคนเอาต์พุต 240 ล้านโทเคนขณะรันดัชนี เทียบกับค่ามัธยฐานที่ 92 ล้าน — มันเป็นตัวให้เหตุผลที่เยิ่นเย้อ และด้วยอัตราเอาต์พุต 6 ดอลลาร์ต่อล้านโทเคน ความเยิ่นเย้อนั้นก็คือรายการค่าใช้จ่าย ข้อที่สอง คะแนนรวมของดัชนีจัดให้มันอยู่ในกลุ่มโมเดลที่แข็งแกร่งที่สุดในระดับราคาของมัน ซึ่งเป็นการเปรียบเทียบที่สำคัญจริงสำหรับผู้ซื้อ Artificial Analysis ยังไม่ได้เผยแพร่ราคาที่กรอกไว้สำหรับ Grok 4.7 บนหน้าของโมเดล ดังนั้นอย่านำตัวเลขต้นทุนต่องานของมันจากตรงนั้นมาใช้ ให้ใช้อัตรา $2/$6 ของผู้ขาย

หน้าผาราคาที่ไม่มีโมเดลใดแก้ไขได้
นี่คือส่วนหนึ่งของตารางราคา Grok 4.6 ที่ทีมโปรดักชันเรียนรู้ที่จะเกลียด และ Grok 4.7 ไม่ได้เปลี่ยนแปลงมัน ต่ำกว่า 200,000 โทเคนอินพุต อัตราคือ $2 ขาเข้า และ $6 ขาออก เมื่อเกินกว่านั้น คำขอทั้งหมดจะถูกปรับราคาใหม่เป็น $4 ขาเข้า และ $12 ขาออก ไม่ใช่เฉพาะโทเคนส่วนที่เกิน — แต่เป็นคำขอทั้งหมด การเรียกที่มี 210,000 โทเคนมีค่าใช้จ่ายเป็นสองเท่าของการเรียกที่มี 199,000 โทเคน สำหรับโทเคนที่เพิ่มขึ้น 11,000 โทเคน
ด้วยหน้าต่างบริบทขนาด 500,000 โทเค็นบนทั้งสองโมเดล หน้าผานั้นก็เดินตกได้ง่าย การรันเอเจนต์แบบบริบทยาวและพรอมป์ต์ทั้งรีโพซิทอรีเป็นเวิร์กโหลดที่ Grok 4.7 ถูกปรับแต่งมาเพื่อโดยเฉพาะ ซึ่งหมายความว่ากรณีการใช้งานที่ดีที่สุดของโมเดลก็เป็นกรณีที่มีแนวโน้มมากที่สุดที่จะทำให้เกิดการเพิ่มขึ้นเป็นสองเท่าเช่นกัน หากคุณกำลังย้ายงานไปยัง Grok 4.7 เพราะมันจัดการเซสชันเอเจนต์แบบยาวได้ดีกว่า ให้จัดสรรงบประมาณสำหรับการปรับราคาก่อนที่คุณจะย้ายงาน ไม่ใช่หลังจากนั้น
ยังมีระดับความเร็วที่ต้องคำนึงถึงด้วย SpaceXAI มี Grok 4.7 เวอร์ชันเร็วที่เพิ่มความเร็วเอาต์พุตเป็นสองเท่า และเพิ่มราคาที่ประกาศไว้เป็นสองเท่า นั่นเป็นการแลกที่สมเหตุสมผลสำหรับการเขียนโค้ดแบบอินเทอร์แอกทีฟ แต่เป็นการแลกที่ไม่ดีสำหรับงานแบบแบตช์ — งานเดียวกันที่คุณภาพเดียวกันมีค่าใช้จ่ายเป็นสองเท่า เพื่อแลกกับการประหยัดเวลาตามนาฬิกาที่ไม่มีใครเฝ้าดูอยู่
การย้ายจาก Grok 4.6 โดยไม่ต้องเขียนใหม่
ข่าวดีในทางปฏิบัติก็คือ นี่เป็นการสลับโมเดล ไม่ใช่การย้ายแพลตฟอร์ม ทั้งสองโมเดลรับข้อความและรูปภาพเข้าและส่งข้อความออก ทั้งคู่ใช้ระดับ reasoning-effort เดียวกันตั้งแต่ low ไปจนถึง xhigh และรูปแบบคำขอก็เป็นแบบเดียวกับที่ SpaceXAI ให้บริการมาตั้งแต่ Grok 4.5 โค้ดที่เรียก Grok 4.6 พร้อมพารามิเตอร์ effort ไม่จำเป็นต้องปรับโครงสร้างใหม่เพื่อเรียก Grok 4.7
จุดที่การสลับเปลี่ยนนี้ไม่ฟรีคือในด้านการประเมิน ผลตอบแทนที่เพิ่มขึ้นของ Grok 4.7 กระจุกตัวอยู่ในงานแบบเอเจนต์ที่รันยาว ดังนั้นชุดทดสอบที่สร้างจากพรอมป์แบบเทิร์นเดียวสั้น ๆ จะแทบไม่บอกอะไรคุณเลย คุณจะเห็นการปรับปรุงขนาดเท่า CursorBench แล้วสรุปว่าการอัปเกรดครั้งนี้ไม่คุ้มกับความพยายาม ทั้งที่เหตุผลสนับสนุนมันอยู่ในงานที่ชุดทดสอบของคุณไม่เคยทดสอบเลย การวัดที่จะชี้ขาดได้จริงคือความสำเร็จของงานในงานหลายขั้นตอน ได้แก่ แพตช์ที่ถูกยอมรับ การถดถอยที่เกิดขึ้น จำนวนการเรียกเครื่องมือต่อหนึ่งงานที่ทำสำเร็จ และบ่อยครั้งแค่ไหนที่การรันหนึ่งครั้งต้องมีคนเข้ามาช่วยเหลือ นั่นคือแกนหลักที่ตัวเลขของเจ้าของผลิตภัณฑ์เองชี้ไป และเป็นแกนที่ไม่มีเบนช์มาร์กที่เผยแพร่ใดครอบคลุมสำหรับโค้ดเบสของคุณ
ความยาวของคำตอบเป็นสิ่งที่สองที่ต้องวัด โมเดลที่ปล่อย 240 ล้านโทเคนบนดัชนีมาตรฐานจะปล่อยโทเคนบนปริมาณงานของคุณมากกว่ารุ่นก่อน และที่ราคา 6 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน สิ่งนี้อาจลบมูลค่าของการอัปเกรดในราคาเดิมได้อย่างเงียบ ๆ ติดตามจำนวนโทเคนเอาต์พุตต่องานที่ทำเสร็จเป็นเวลาหนึ่งสัปดาห์ก่อนที่คุณจะตัดสินใจ

ควรโทรหาใคร
การตัดสินใจนี้เรียบง่ายอย่างแท้จริง ซึ่งเป็นเรื่องผิดปกติสำหรับการเปรียบเทียบโมเดล Grok 4.6 ยังคงเป็นตัวเลือกที่ถูกต้องสำหรับทราฟฟิกแบบเทิร์นสั้นที่คำนึงถึงต้นทุน: แชท การจำแนกประเภท การสรุป และความช่วยเหลือด้านโค้ดในระดับโปรแกรมแก้ไข ซึ่งการปรับปรุงของ Grok 4.7 นั้นมีน้อยและการพูดมากเกินไปของมันเป็นภาษี Grok 4.7 เป็นตัวเลือกที่ถูกต้องสำหรับปริมาณงานที่มันถูกสร้างขึ้นมา — การเขียนโค้ดแบบเอเจนต์ในระยะยาวและการทำงานบนเทอร์มินัลที่งานหนึ่งใช้เวลาหลายชั่วโมงและการตรวจสอบตนเองคือความแตกต่างระหว่างงานที่เสร็จสิ้นกับงานที่ติดขัด
การรันทั้งสองแบบไม่ใช่การประนีประนอมในกรณีนี้ แต่เป็นคำตอบที่ถูกต้อง และทำได้ในราคาถูก Grok 4.6 อยู่ในแค็ตตาล็อกของ OrcaRouter ในราคาตั้งของ SpaceXAI โดยบวกกำไร 0% ส่งผ่านตรง ๆ ดังนั้นเรตการ์ด $2/$6 ข้างต้นคือสิ่งที่คุณจ่าย — และเนื่องจากเราส่งผ่านราคาตั้งของผู้ให้บริการโดยตรงแทนที่จะบวกกำไร การเปลี่ยนแปลงราคาจากผู้จำหน่ายใด ๆ จึงมีผลจริงฝั่งเราในวันเดียวกับที่ประกาศออกมา คีย์ API เดียวครอบคลุม Grok 4.6 และ โมเดลอื่นอีกกว่า 200 รายการ ดังนั้นการย้ายทราฟฟิกระหว่างโมเดลเหล่านี้ตามงานจึงเป็นการเปลี่ยนคอนฟิก ไม่ใช่การทำสัญญาฉบับที่สอง หากคุณต้องการทดลองใช้ Grok 4.7 บนเส้นทางโปรดักชันก่อนที่จะไว้วางใจมัน รูปแบบที่ปลอดภัยกว่าคือให้คง fallback ไว้ที่ Grok 4.6 — โมเดลที่คุณสามารถเราต์ได้ตั้งแต่วันนี้ — และปล่อยให้การสลับอัตโนมัติข้ามผู้ให้บริการย้ายคำขอกลับมาเมื่อโมเดลใหม่ทำงานผิดพลาด

สิ่งที่ควรดูต่อไป
สองสิ่งที่จะตัดสินการเปรียบเทียบนี้ และยังไม่มีสิ่งใดเกิดขึ้นเลย สิ่งแรกคือการทำซ้ำอย่างอิสระของตัวเลข Terminal-Bench 4.0 — 38% เป็นการเพิ่มขึ้นที่มากพอที่จะมีคนนำไปรันซ้ำ และหากยังคงเป็นเช่นนั้น กรณีสำหรับ Grok 4.7 ในไปป์ไลน์แบบเอเจนต์ก็แข็งแกร่งด้วยคุณสมบัติที่แท้จริงมากกว่าการตลาด สิ่งที่สองคือส่วนที่เหลือของแผนงาน Grok: SpaceXAI ได้จัดลำดับ Grok 4.8, Grok 4.9 และ Grok 5 ต่อจากรุ่นนี้ต่อสาธารณะ และอายุการใช้งานของ Grok 4.6 เองก็ประมาณห้าสัปดาห์ การซื้อ Grok 4.7 เป็นสมมติฐานแพลตฟอร์มระยะยาวจะเป็นการทำซ้ำความผิดพลาดที่ทีมต่างๆ เคยทำกับ Grok 4.5
สำหรับตอนนี้ การอัปเกรดในราคาเดิมเป็นเรื่องจริง และทิศทางก็ชัดเจน ตัวเลขที่ควรจดจำคือ $2/$6 ทำให้คุณได้โมเดลที่ทำงานเทอร์มินัลระยะยาวได้ประมาณสองเท่า และแทบไม่ขยับในงานอื่น ๆ — และนั่นเป็นข้อกล่าวอ้างที่เฉพาะเจาะจง มีประโยชน์ และตรวจสอบได้ มากกว่าจะเป็นการก้าวกระโดดแบบคนละรุ่น
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
