
Grok 4.7 กับ Kimi K3: ราคาครึ่งเดียว บริบทครึ่งเดียว ไม่มีน้ำหนักโมเดล
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ลองเอางานเขียนโค้ดแบบเอเจนติกหนึ่งเดือนที่ใช้ 300 ล้านโทเคนมาเทียบกับทั้งสองโมเดลในราคาตามประกาศ แล้วทางเลือกก็จะไม่ใช่แค่การเถียงกันด้วยผลทดสอบอีกต่อไป Grok 4.7 ซึ่ง SpaceXAI เปิดตัวเมื่อวันที่ 21 กันยายน 2026 คิดราคา 2 ดอลลาร์ต่ออินพุต 1 ล้านโทเคน และ 6 ดอลลาร์ต่อเอาต์พุต 1 ล้านโทเคน Kimi K3 ซึ่ง Moonshot AI เปิดตัวเมื่อวันที่ 16 กรกฎาคม 2026 คิดราคา 3 และ 15 ดอลลาร์ ในเดือนสมมติฐานนั้น — สมมติว่า 200 ล้านอินพุตและ 100 ล้านเอาต์พุต — Grok 4.7 จะอยู่ที่ประมาณ 1,000 ดอลลาร์ และ Kimi K3 อยู่ที่ประมาณ 2,100 ดอลลาร์ ช่องว่างนี้ไม่ใช่ความต่างจากการปัดเศษ มันเทียบเท่างบประมาณของโมเดลอีกตัวหนึ่งเลย เมื่อเทียบกับสิ่งนั้น Kimi K3 ให้หน้าต่างบริบท 1,000,000 โทเคน แทนที่จะเป็น 500,000 พร้อมอินพุตวิดีโอแบบเนทีฟรวมถึงรูปภาพ และน้ำหนักที่ดาวน์โหลดได้ Grok 4.7 ให้โมเดลแบบปิดที่เร็วกว่าและถูกกว่า ซึ่งถูกฝึกมาโดยเฉพาะสำหรับงานเทอร์มินัลระยะยาวที่ Kimi K3 ก็มุ่งเป้าเช่นกัน ทั้งคู่อยู่ในระดับแนวหน้า ทั้งสองไม่ใช่การซื้อแบบเดียวกัน
สองโมเดล โดยสังเขป
Grok 4.7 เป็นโมเดลการเขียนโค้ดและงานความรู้ระดับแนวหน้าของ SpaceXAI สร้างขึ้นบนโมเดลพื้นฐานที่ใหญ่กว่า Grok 4.6 และได้รับการฝึกด้วยการเรียนรู้แบบเสริมกำลังที่นานขึ้นโดยมุ่งเป้าไปที่งานที่ใช้เวลาหลายชั่วโมงได้ เป็น proprietary — ไม่มี weights ไม่มีดาวน์โหลด — ให้บริการหน้าต่างบริบท 500,000 โทเค็น รับข้อความและรูปภาพเข้า และส่งข้อความออก และรองรับระดับความพยายามในการใช้เหตุผลตั้งแต่ low ถึง xhigh จุดขายหลักคือความเร็วและราคา: SpaceXAI วางตำแหน่งให้มันเร็วเป็นประมาณสองเท่าของโมเดลที่เทียบเคียงได้ในราคาประมาณครึ่งหนึ่ง
Kimi K3 เป็นโมเดลโอเพนแบบผสมผู้เชี่ยวชาญ (mixture-of-experts) เรือธงของ Moonshot AI และเป็นโมเดลเปิดตัวแรกในคลาสขนาดสามล้านล้านพารามิเตอร์: มีพารามิเตอร์รวม 2.8 ล้านล้านตัว โดยมี 104 พันล้านตัวที่ทำงานต่อโทเคน สร้างบน Kimi Delta Attention และเวต MXFP4 ที่คำนึงถึงการควอนไทซ์ รองรับอินพุตทั้งข้อความ รูปภาพ และวิดีโอ ให้บริบทขนาด 1,000,000 โทเคน ทำงานใช้เหตุผลแบบเปิดตลอดเวลาด้วยระดับความพยายามที่กำหนดค่าได้ และเวตของมันสามารถดาวน์โหลดได้ภายใต้สัญญาอนุญาต Kimi K3 — อนุญาตให้ใช้เชิงพาณิชย์ โดยมีข้อจำกัด ด้วยการออกแบบ มันคือโมเดลที่คุณพากลับบ้านไปด้วยได้
นั่นคือความแตกต่างเชิงโครงสร้างทั้งหมดระหว่างทั้งสองอย่าง สิ่งหนึ่งคือเอนด์พอยต์แบบปิดที่ราคาถูกและรวดเร็ว อีกสิ่งหนึ่งคืออาร์ติแฟกต์แบบเปิดที่แพงกว่า ช้ากว่า และมีบริบทเป็นสองเท่า ทุกสิ่งด้านล่างนี้เป็นผลสืบเนื่องมาจากเรื่องนั้น
สิ่งที่ benchmarks เปรียบเทียบจริง ๆ
นี่คือจุดที่บทความเปรียบเทียบ Grok 4.7 กับ Kimi K3 ส่วนใหญ่พลาด จึงควรพูดตรง ๆ ว่า ตัวเลขที่เผยแพร่ของทั้งสองโมเดลส่วนใหญ่ไม่ได้วัดสิ่งเดียวกัน และอย่างน้อยก็มีคู่หนึ่งที่ดูเหมือนเทียบกันได้ แต่จริง ๆ ไม่ใช่
เริ่มจากคู่ที่ทำให้เข้าใจผิดอย่างแท้จริง เอกสารเปิดตัวของ Kimi K3 อ้างคะแนน Terminal-Bench 2.1 ที่ 88.3 เอกสารเปิดตัวของ Grok 4.7 อ้าง Terminal-Bench 4.0 ที่ 38.0% สิ่งเหล่านี้เป็นเบนช์มาร์กคนละเวอร์ชัน มีชุดงานต่างกัน และมีการให้คะแนนต่างกัน การนำมาวางเทียบเคียงกันจะทำให้ดูเหมือนว่า Kimi K3 เป็นโมเดลเอเจนต์ที่เก่งกว่าเกินสองเท่า ซึ่งไม่ใช่การตีความที่ป้องกันได้ และไม่มีใครควรพูดซ้ำ ทั้งสองตัวเลขยังเป็นตัวเลขที่ผู้ขายรายงานเอง — ไม่มีตัวเลขใดได้รับการทำซ้ำอย่างอิสระ
สิ่งที่สามารถนำมาเปรียบเทียบกันได้คือคะแนนรวมแบบอิสระ และในจุดนั้นทั้งสองモデルอยู่ใกล้กันมาก บนดัชนี Artificial Analysis Intelligence Index ฉบับปัจจุบัน เวอร์ชัน v4.3.2 Kimi K3 ได้คะแนน 44 — เป็นอันดับสองจาก 113 โมเดล ซึ่งเป็นอันดับสูงสุดของโมเดลน้ำหนักเปิดใด ๆ บนกระดานนี้ ส่วน Grok 4.7 ได้คะแนน 46 เป็นอันดับสิบหกจาก 655 ห่างกันสองคะแนน โดยอันดับของ Kimi K3 ได้มาเมื่อใช้ความพยายามในการคิดวิเคราะห์สูงสุด บนคะแนนรวมแบบผสม โมเดลเหล่านี้อยู่ในระดับเดียวกัน
• คะแนนคอมโพสิตอิสระ — Grok 4.7 ได้ 46 คะแนนบน AA Intelligence Index v4.3.2 เทียบกับ Kimi K3 ที่ได้ 44 คะแนนบนเวอร์ชันเดียวกัน ถือว่าเสมอกันในทางปฏิบัติ
• หน้าต่างบริบท — Grok 4.7 500,000 โทเค็น เทียบกับ Kimi K3 1,000,000 โทเค็น นี่คือข้อได้เปรียบที่แท้จริงและไม่มีเงื่อนไขใด ๆ สำหรับ Kimi K3 และเป็นความแตกต่างด้านสเปกเพียงหนึ่งเดียวที่ไม่มีข้อแม้ใด ๆ แนบมาด้วย
รูปแบบอินพุต — Grok 4.7 รองรับข้อความและภาพ เทียบกับ Kimi K3 ที่รองรับข้อความ ภาพ และวิดีโอ Kimi K3 ครอบคลุมกว่า หากเวิร์กโหลดของคุณมีวิดีโออยู่ด้วย
• น้ำหนักโมเดล — Grok 4.7 เป็นกรรมสิทธิ์เฉพาะ ไม่มีให้ดาวน์โหลด เทียบกับ Kimi K3 ที่มีน้ำหนักโมเดลแบบเปิดภายใต้สัญญาอนุญาต Kimi K3 สำหรับความต้องการใช้งานภายในองค์กรหรือแบบแยกจากเครือข่ายภายนอก นี่คือประเด็นเดียวที่สำคัญ
• ราคาต่อหนึ่งล้านโทเคน — Grok 4.7 $2 ขาเข้า / $6 ขาออก เทียบกับ Kimi K3 $3 ขาเข้า / $15 ขาออก โดยอัตราอินพุตแบบแคชของ Kimi อยู่ที่ $0.30 ต่อหนึ่งล้าน Grok 4.7 ถูกกว่าในทุกด้าน และถูกกว่าอย่างมากในด้านเอาต์พุต
• การควบคุมระดับความพยายามในการให้เหตุผล — Grok 4.7 ตั้งแต่ low ถึง xhigh เทียบกับ Kimi K3 ที่เปิดทำงานตลอดเวลาพร้อมระดับความพยายามที่กำหนดค่าได้ ทำงานคล้ายกันในเชิงฟังก์ชัน; ความแตกต่างคือ Grok 4.7 ให้คุณลดระดับการให้เหตุผลลงได้
• หลักฐานเชิงเอเจนต์ที่ผู้ขายรายงานเอง — Grok 4.7 Terminal-Bench 4.0 38.0%, CursorBench 4.0 46.3%, DeepSWE v1.1 71.0% (ผู้ขายรายงานเองทั้งหมด) เทียบกับ Kimi K3 Terminal-Bench 2.1 88.3%, Frontend Code Arena คว้าอันดับหนึ่งที่ 1,679 Elo (ผู้ขายรายงานเองตอนเปิดตัว) เทียบกันไม่ได้ — ดูด้านบน


เงินไปไหนจริง ๆ
ตารางราคาทำให้ช่องว่างดูเล็กกว่าที่เป็นจริง เพราะโมเดลทั้งสองใช้โทเค็นต่างกัน Grok 4.7 เป็นโมเดลให้เหตุผลแบบเยิ่นเย้อ — Artificial Analysis วัดได้ 240 ล้านโทเค็นเอาต์พุตที่สร้างขึ้นขณะรัน Intelligence Index เทียบกับค่ามัธยฐาน 92 ล้านในโมเดลต่างๆ Kimi K3 เป็นความแพงแบบตรงกันข้าม: มันเป็นโมเดลการให้เหตุผลขนาดใหญ่ที่ทำงานตลอดเวลา และที่ราคา $15 ต่อล้านโทเค็นเอาต์พุต ความเยิ่นเย้อคือสิ่งที่คุณกำลังซื้อ
ดังนั้นโมเดลต้นทุนที่ตรงไปตรงมาจึงไม่ใช่ "$2/$6 เทียบกับ $3/$15." แต่เป็นโทเค็นเอาต์พุตต่องานที่เสร็จสมบูรณ์ คูณด้วยอัตราเอาต์พุต บวกโทเค็นอินพุตรวมทุกครั้งที่ลองใหม่ คูณด้วยอัตราอินพุต โมเดลที่แก้ปัญหางานในรอบยาวครั้งเดียวที่ราคา $6 ต่อล้านสามารถเอาชนะโมเดลที่ต้องลองสามครั้งที่ราคา $15 ต่อล้านได้ และมันก็สามารถแพ้ได้เช่นกันถ้ารอบของโมเดลราคาถูกนั้นยาวพอ นั่นคือการวัดที่คุณต้องรันบนรีโพซิทอรีของคุณเอง ไม่ใช่สิ่งที่ใครจะเผยแพร่ให้คุณ
ความไม่สมมาตรจุดหนึ่งที่ควรรู้ก่อนใช้งาน: Grok 4.6 ซึ่งเป็นรุ่นก่อนหน้าของ Grok 4.7 มีการกำหนดราคาแบบหน้าผาที่ 200,000 โทเคนอินพุต โดยคำขอใดที่ข้ามเส้นนี้จะถูกคิดราคาใหม่ทั้งคำขอในอัตราสองเท่า งานที่ใช้บริบทขนาดยาวฝั่ง Grok จำเป็นต้องตรวจสอบเรื่องนี้เทียบกับตารางราคาปัจจุบันของโมเดลที่คุณใช้งาน เพราะหน้าต่างขนาด 500,000 โทเคนกับหน้าผาที่ 200,000 โทเคนส่งผลกระทบต่อกันอย่างรุนแรง ราคาของ Kimi K3 คงที่ ซึ่งเป็นข้อได้เปรียบที่เงียบกว่าของทั้งสอง
จุดที่แต่ละอันพัง
โมเดลทั้งสองมีโหมดความล้มเหลวที่สื่อเปิดตัวไม่ได้ยกขึ้นมาเป็นประเด็นแรก และความล้มเหลวเหล่านั้นก็แตกต่างกัน
จุดอ่อนของ Kimi K3 คือความน่าเชื่อถือภายใต้ภาระต่อเนื่อง การทดสอบโดยชุมชนและผู้ทดสอบอิสระตอนเปิดตัวรายงานว่าประสิทธิภาพการทำงานแบบเอเจนต์ของมันลดลงเมื่อการรันยาวขึ้น — ผลลัพธ์แบบครั้งเดียวแข็งแกร่ง แต่อัตราการผ่านแบบต่อเนื่องอ่อนลง — และความเร็วเอาต์พุตอยู่ที่ประมาณ 37 ถึง 38 โทเคนต่อวินาที ซึ่งถือว่าช้าสำหรับการเขียนโค้ดแบบโต้ตอบ นอกจากนี้ Moonshot ยังต้องหยุดรับสมัครสมาชิกใหม่สำหรับผู้บริโภคชั่วคราวไม่นานหลังเปิดตัว เพราะความต้องการเกินขีดความสามารถ ซึ่งสะท้อนบางอย่างเกี่ยวกับความสามารถสำรองในการให้บริการทางฝั่งโฮสต์
Grok 4.7 มีลักษณะตรงกันข้าม: มันเร็ว ราคาถูก และปิด ซึ่งหมายความว่าคุณไม่สามารถตรวจสอบภายในได้ ไม่สามารถรันมันเองได้ และไม่สามารถป้องกันความเสี่ยงจากการถูกเลิกใช้ในอนาคตได้ SpaceXAI ได้เปิดเผยลำดับการเปิดตัว Grok 4.8, Grok 4.9 และ Grok 5 ต่อจากรุ่นนี้ต่อสาธารณะแล้ว และ Grok 4.6 อยู่ได้ประมาณห้าสัปดาห์ก่อนจะถูกแทนที่ด้วยรุ่นใหม่ อะไรก็ตามที่คุณสร้างบน Grok 4.7 ควรสร้างโดยให้ ID ของโมเดลเป็นค่าคอนฟิกูเรชัน ไม่ใช่สมมติฐาน
ยังมีข้อพิจารณาประการที่สามซึ่งไม่ใช่ความล้มเหลวของโมเดลใดโมเดลหนึ่ง ทั้งสองแบบไม่ใช่คำตอบที่ใช่สำหรับการรันอัตโนมัติเป็นเวลาสองสัปดาห์ และผู้ขายทั้งสองรายก็ได้สาธิตให้เห็นเช่นนั้นจริง ๆ เดโมการเขียนโค้ดแบบอัตโนมัติ 16 วันและ 48 ชั่วโมงที่เผยแพร่นั้นเป็นเดโมที่ผู้ขายจัดทำขึ้น บนงานที่ผู้ขายเลือกเอง โดยไม่มีการทำซ้ำอย่างอิสระ สิ่งเหล่านั้นมีคุณค่าที่ควรรับรู้ แต่ไม่ควรนำมาใช้วางแผนรับมือ

รันทั้งสอง และเหตุใดนั่นจึงเป็นคำตอบที่แท้จริง
ช่องว่างด้านต้นทุนและช่องว่างด้านคอนเท็กซ์ชี้ไปคนละทาง ซึ่งนั่นคือเหตุผลที่ไม่ควรเลือกอันใดอันหนึ่ง Kimi K3 คุ้มราคากับงานระดับรีโพซิทอรีที่วินโดว์ 1M หมายความว่าคุณไม่ต้องแบ่งอินพุตเป็นชิ้นๆ และกับอะไรก็ตามที่ต้อง self-host Grok 4.7 คุ้มราคากับปริมาณงาน — ลูปเอเจนต์ที่มีจำนวนรอบสูง ไปป์ไลน์ที่เน้นการเรียกเครื่องมือจำนวนมาก และเซสชันเทอร์มินัลยาวๆ ที่ความเร็วและต้นทุนเอาต์พุตเป็นปัจจัยหลัก
Kimi K3 อยู่บน OrcaRouter ซึ่งทำให้การแยกงานนั้นเป็นการตัดสินใจเรื่องการจัดเส้นทาง มากกว่าการตัดสินใจเรื่องการจัดซื้อ จัดอยู่ในแค็ตตาล็อกที่ราคาตามที่ Moonshot ประกาศไว้ และเนื่องจาก OrcaRouter ส่งต่อราคาตามที่ผู้ให้บริการประกาศโดยบวกเพิ่ม 0% การลดราคาของผู้ให้บริการจึงมีผลที่นี่ทันทีในวันที่ประกาศ ไม่ใช่รอถึงการต่อสัญญาครั้งถัดไป สำหรับเวิร์กโหลดที่รอบการประมวลผลบริบทยาวและรอบการประมวลผลงานควรทำงานร่วมกันมากกว่าแข่งขันกัน — โมเดลหนึ่งถือทั้งรีโพซิทอรีไว้ในมุมมอง ส่วนอีกโมเดลลงมือกับมัน — DSL สำหรับการจัดเส้นทางประกอบโมเดลหลายตัวให้เป็นการเรียกครั้งเดียว และ model fusion ทำให้คณะโมเดลตอบร่วมกันได้เมื่องานนั้นคุ้มค่ากับค่าใช้จ่ายที่เพิ่มขึ้น คีย์ API เพียงคีย์เดียวครอบคลุม Kimi K3 พร้อมโมเดลอื่นอีกกว่า 200 ตัว ดังนั้นครึ่งที่เป็นการลงมือทำของงานแยกนั้นจึงมาจากโมเดลที่ถูกและเร็วที่สุดสำหรับงานนั้นก็ได้ แทนที่จะมาจากโมเดลที่บังเอิญถือบริบทอยู่
มีสิ่งหนึ่งที่ต้องทำให้ชัดเจน: open weights ของ Kimi K3 นั้นดาวน์โหลดได้ แต่ปลายทางแบบโฮสต์ต่างหากคือสิ่งที่ OrcaRouter กำหนดเส้นทางไปหา หากความต้องการของคุณคือการประมวลผลอนุมานแบบ on-premise จริง ๆ นั่นคือโปรเจกต์ self-hosting บนฮาร์ดแวร์ของคุณเอง ไม่ใช่การตัดสินใจเรื่องการกำหนดเส้นทาง — และมันเป็นสถานการณ์เดียวที่การเปรียบเทียบนี้มีคำตอบที่ถูกต้องเพียงหนึ่งเดียว
คำตัดสิน และตัวเลขเดียวที่ต้องจดจำ
ถ้าคุณเลือกโดยพิจารณาจากต้นทุนและความเร็ว Grok 4.7 ชนะแบบไม่ต้องเทียบกันเลย: ราคาอินพุตครึ่งหนึ่ง ราคาเอาต์พุตต่ำกว่าครึ่งหนึ่ง การให้บริการเร็วกว่า และมีปุ่มปรับระดับการใช้เหตุผลที่คุณลดลงได้ ถ้าคุณเลือกโดยพิจารณาจากบริบท ความหลากหลายของมอดาลิตี หรือความสามารถในการเป็นเจ้าของโมเดล Kimi K3 ชนะด้วยเงื่อนไขเดียวกัน ถ้าคุณเลือกโดยพิจารณาจากขีดความสามารถเพียงอย่างเดียว คะแนนรวมจากแหล่งอิสระบอกว่าทั้งสองห่างกันสองคะแนน และคุณควรตัดสินใจจากการประเมินของคุณเอง มากกว่าจะดูจากแผนภูมิเปิดตัวของฝ่ายใดฝ่ายหนึ่ง
ตัวเลขที่ต้องยึดไว้คือตัวเลขจากด้านบน: $2/$6 เทียบกับ $3/$15 ทุกอย่างอื่นในการเปรียบเทียบนี้ต่อรองได้ แต่อัตราส่วนนั้นต่อรองไม่ได้
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
