
GPT-6 Luna เทียบกับ Kimi K3: ทรูพุต 4 เท่า ราคาเพียง 1/30 มีข้อยกเว้นจริงอยู่หนึ่งข้อ
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
สองโมเดล ทั้งคู่เปิดตัวภายในสามเดือนที่ผ่านมา ทั้งคู่ถูกวางตำแหน่งให้เป็นระดับราคาประหยัดของตระกูล frontier และทั้งคู่ก็เข้าใจสิ่งที่ "ระดับราคาประหยัด" หมายถึงผิดไป โดยไม่ได้ผิดในแบบเดียวกันเลยแม้แต่น้อย Kimi K3 เป็นเรือธงแบบ open-weight ของ Moonshot AI เปิดให้สาธารณะเข้าถึงภายใต้สัญญาอนุญาต Modified MIT ตั้งแต่วันที่ 27 กรกฎาคม 2026 ราคา $3.00 ต่อหนึ่งล้านโทเคนอินพุต และ $15.00 ต่อหนึ่งล้านโทเคนเอาต์พุต โดยการอ่านแคชอยู่ที่ $0.30 GPT-6 Luna เป็นระดับปริมาณของผู้ให้บริการ เปิดให้ใช้ทั่วไปตั้งแต่วันที่ 22 กันยายน 2026 ในราคา $0.10 และ $0.50 โดยการอ่านแคชอยู่ที่หนึ่งเซนต์ คิดเป็นสามสิบเท่าในด้านอินพุต สามสิบเท่าในด้านเอาต์พุต และมีสัญญาอนุญาตที่ฝ่ายหนึ่งมี ซึ่งอีกฝ่ายไม่สามารถเสนอได้ในราคาใด ๆ
อย่างไรก็ตาม ตารางราคาไม่ใช่สิ่งที่ตัดสินการจับคู่นี้ เพราะราคาไม่ได้ใกล้เคียงกันพอที่จะต้องมาตัดสินใจ สิ่งที่ตัดสินคือตัวเลขที่ผู้ให้บริการทั้งสองรายไม่นำมาใส่พาดหัว: ความเร็วเอาต์พุตที่วัดได้ Kimi K3 สร้างได้ 38.7 โทเคนต่อวินาที GPT-6 Luna สร้างได้ 153.9 นั่นคือช่องว่างถึงสี่เท่า และสำหรับภาระงานใดก็ตามที่โมเดลเป็นองค์ประกอบภายในลูป มากกว่าที่จะเป็นปลายทางที่คนพูดคุยด้วย ความแตกต่างของอัตราการประมวลผลถึงสี่เท่าจะเปลี่ยนสถาปัตยกรรม มากกว่าจะเปลี่ยนบิล
จริง ๆ แล้วสองสิ่งนี้คืออะไร
Kimi K3 เป็นโมเดลแบบ mixture-of-experts ขนาด 2.8 ล้านล้านพารามิเตอร์ โดยเปิดใช้งาน 104 พันล้านพารามิเตอร์ต่อโทเคน มีหน้าต่างบริบท 1,048,576 โทเคน เพดานเอาต์พุต 1,048,576 โทเคน และเผยแพร่น้ำหนักบน Hugging Face ภายใต้สัญญาอนุญาต Modified MIT เป็นโมเดล open-weight ที่ได้คะแนนสูงสุดบนบอร์ดจัดอันดับอิสระ เป็นอันดับหนึ่งใน 112 โมเดล open-weight และครองตำแหน่งสูงสุดบนลีดเดอร์บอร์ด WebDev ของ Code Arena ด้วย 1,679 Elo Moonshot รายงานว่าได้ 88.3% บน Terminal-Bench 2.0 ซึ่งเป็นตัวเลขจากผู้พัฒนาและไม่ได้ถูกทำซ้ำอย่างอิสระ
GPT-6 Luna เป็นรุ่นระดับเล็กของ GPT-6 เจเนอเรชันจาก OpenAI อยู่ต่ำกว่า GPT-6 Sol ที่ราคา $2.00/$10.00 และต่ำกว่าอย่างมากเมื่อเทียบกับเรือธงอย่าง GPT-6 Astra ที่ $10.00/$50.00 รับข้อความและรูปภาพเข้า ส่งออกข้อความ หน้าต่าง 1,050,000 โทเคน โดยมีอินพุตสูงสุด 922,000 และเพดานเอาต์พุต 128,000 โทเคน และระดับความพยายามในการให้เหตุผลเลือกได้จาก none ถึง low, medium, high, xhigh และ max โดยมี medium เป็นค่าเริ่มต้น เป็นโมเดลปิด ใช้ตัวระบุเดียว และพร้อมใช้งานสำหรับทุกคนที่มี API key
อันหนึ่งคือการดาวน์โหลด อีกอันคือเอนด์พอยต์ ทั้งคู่ตั้งราคาตามปริมาณ นั่นคือลักษณะของการเปรียบเทียบนี้
การ์ด ทีละบรรทัด
หนึ่งบรรทัดต่อมิติ โดยเปิดทั้งสองด้านในแต่ละบรรทัด:
• อินพุตต่อ 1M — GPT-6 Luna $0.10 เทียบกับ Kimi K3 $3.00
• เอาต์พุตต่อ 1M — GPT-6 Luna $0.50 เทียบกับ Kimi K3 $15.00
• อินพุตแบบแคชต่อ 1M — GPT-6 Luna $0.01 เทียบกับ Kimi K3 $0.30 คิดเป็นหนึ่งในสิบของอัตราอินพุตของตัวเองบนการ์ดทั้งสอง
• ข้อกำหนดบริบทแบบยาว — GPT-6 Luna เพิ่มอินพุตและแคชเป็นสองเท่า และเพิ่มเอาต์พุตเป็น 1.5× เมื่อเกิน 272,000 โทเค็นอินพุต โดยมีผลกับทั้งคำขอ เทียบกับ Kimi K3 ที่ไม่มีการเผยแพร่ข้อกำหนดเทียบเท่าบนการ์ดของโมเดล
• หน้าต่างบริบท — GPT-6 Luna 1,050,000 โทเค็น พร้อมอินพุตสูงสุด 922,000 เทียบกับ Kimi K3 1,048,576 โทเค็น
• เอาต์พุตสูงสุด — GPT-6 Luna 128,000 โทเค็น เทียบกับ Kimi K3 1,048,576 โทเค็น หรือแปดเท่าของเพดาน
• ดัชนี Intelligence Index แบบอิสระ — GPT-6 Luna 37 ที่ความพยายามสูงสุด เทียบกับ Kimi K3 44 ที่ความพยายามสูงสุด โดยใช้ดัชนีเวอร์ชันเดียวกัน
• คะแนนที่ใช้ความพยายามระดับค่าเริ่มต้น — GPT-6 Luna 29 ที่ระดับกลางซึ่งเป็นค่าเริ่มต้น เทียบกับ Kimi K3 ที่วัดที่การตั้งค่าสูงสุด
• ค่าใช้จ่ายต่องาน Index แบบอิสระ — GPT-6 Luna ประมาณ $0.07 เทียบกับ Kimi K3 $2.00
• จำนวนโทเค็นเอาต์พุตในการรันดัชนี — GPT-6 Luna 150M เทียบกับ Kimi K3 160M เมื่อเทียบกับค่ามัธยฐานของบอร์ดที่ 88M; ทั้งคู่ใช้คำฟุ่มเฟือยมากกว่าโมเดลค่ามัธยฐานของบอร์ดอย่างมาก
• ความเร็วเอาต์พุต, เป็นอิสระ — GPT-6 Luna 153.9 โทเค็น/วินาที เทียบกับ Kimi K3 38.7 โทเค็น/วินาที
• น้ำหนักโมเดล — GPT-6 Luna แบบปิด ใช้ผ่าน API เท่านั้น กับ Kimi K3 แบบเปิดสาธารณะบน Hugging Face ตั้งแต่ 27 กรกฎาคม 2026
• สัญญาอนุญาต — GPT-6 Luna ไม่เกี่ยวข้อง เทียบกับ Kimi K3 Modified MIT ซึ่งไม่ใช่ตราสารเดียวกันกับ MIT
• จำนวนพารามิเตอร์ทั้งหมด — GPT-6 Luna ไม่เปิดเผย เทียบกับ Kimi K3 2,800 พันล้าน โดยในจำนวนนี้ 104 พันล้านเป็นพารามิเตอร์ที่ทำงานต่อโทเคน
• หลักฐานเด่น — GPT-6 Luna เรียกใช้เครื่องมือและลูปแบบเอเจนต์ในราคาหนึ่งในสิบเซนต์ต่อโทเคนอินพุตที่แคชไว้หนึ่งพันโทเคน เทียบกับ Kimi K3 Code Arena WebDev อันดับ #1 ที่ 1,679 Elo, Terminal-Bench 2.0 88.3% ตามรายงานของผู้ขาย, คะแนนสูงสุดในกลุ่มโมเดลน้ำหนักเปิดบนบอร์ดจัดอันดับอิสระ
• บน OrcaRouter — GPT-6 Luna ไม่อยู่ในแคตตาล็อกของเรา เทียบกับ Kimi K3 ที่สามารถจัดเส้นทางได้ในราคาตามรายการของ Moonshot

ทรูพุตคือสเปกที่ไม่มีใครนำมาขึ้นพาดหัว
โมเดล 38.7 โทเคนต่อวินาที กับโมเดล 153.9 โทเคนต่อวินาที ไม่ใช่สินค้าเดียวกันที่มีป้ายราคาต่างกัน พวกมันเป็นสินค้าที่แตกต่างกัน
ลองนึกถึงงานที่โมเดลต้องสร้างคำตอบยาว 1,500 โทเคน — สรุป, การสกัดแบบมีโครงสร้าง, แพตช์โค้ดพร้อมคำอธิบายของมัน ที่ 153.9 โทเคนต่อวินาที คำตอบนั้นใช้เวลาประมาณสิบวินาที ที่ 38.7 ใช้เวลาประมาณสามสิบเก้า ไม่มีตัวเลขใดรวมเวลาการให้เหตุผลหรือความหน่วงของเครือข่าย ดังนั้นช่องว่างในโลกจริงจึงกว้างกว่าสี่เท่าตามสัดส่วน ไม่ใช่แคบกว่า
ตอนนี้ลองเอามันไปใส่ในลูปดูสิ เอเจนต์ที่เรียกโมเดลสามสิบครั้งเพื่อทำงานหนึ่งอย่างให้เสร็จ — วางแผน เลือกเครื่องมือ อ่านผลลัพธ์ ตัดสินใจขั้นถัดไป ทำซ้ำ — สร้างเอาต์พุตโทเคนราว 15,000 โทเคนตลอดการเรียกเหล่านั้น GPT-6 Luna ใช้เวลาประมาณ 97 วินาทีในการสร้าง ส่วน Kimi K3 ใช้เวลาประมาณ 388 วินาที นั่นคือความแตกต่างระหว่างงานที่ผู้ใช้รอได้กับงานที่ผู้ใช้ต้องจัดเวลาไว้ และไม่ว่าสัญญาอนุญาตจะผ่อนปรนเพียงใดก็ไม่เปลี่ยนสิ่งนี้
การพูดเยอะยิ่งซ้ำเติมปัญหาความเร็ว แทนที่จะชดเชยให้ Kimi K3 สร้างโทเคนเอาต์พุต 160 ล้านโทเคนในการทำดัชนีอิสระให้เสร็จ เทียบกับ 150 ล้านของ GPT-6 Luna — ดังนั้นในการประเมินนั้น โมเดลที่ช้ากว่ายังสร้างโทเคนมากกว่าเล็กน้อย ไม่ใช่น้อยกว่า ทั้งสองโมเดลพูดเยอะพอกัน เพียงแต่ไม่ได้เร็วพอกัน และบนการ์ดที่คิดราคาตามเอาต์พุต การพูดเยอะก็แพงสองต่อ
พูดตรง ๆ ก็ควรบอกว่า นี่ไม่ใช่ข้อบกพร่องของ Kimi K3 โมเดลขนาด 2.8 ล้านล้านพารามิเตอร์ที่มีพารามิเตอร์ทำงานจริง 1.04 แสนล้าน กำลังทำงานต่อโทเคนมากกว่าโมเดลระดับเล็ก และตัวเลข throughput นั้นคือการวัดงานดังกล่าว คำถามที่เกี่ยวข้องคือ ภาระงานของคุณจำเป็นต้องใช้ความสามารถนี้หรือไม่ ถ้าจำเป็น 38.7 โทเคนต่อวินาทีคือราคาของความสามารถนั้น ถ้าไม่จำเป็น คุณกำลังจ่ายสำหรับการครุ่นคิดที่คุณไม่ได้ขอมา ถึงสามสิบเท่า
เจ็ดแต้มของ K3 อยู่ที่ไหน
Kimi K3 ได้ 44 คะแนนบนดัชนี Intelligence Index ฉบับอิสระที่ความพยายามสูงสุด GPT-6 Luna ได้ 37 ในการตั้งค่าเดียวกัน เจ็ดคะแนน บนคะแนนรวมที่หนึ่งคะแนนยังอยู่ในช่วงสัญญาณรบกวนของการรันซ้ำ — และทั้งสองแตกต่างกันประมาณ 28 เท่าในต้นทุนต่องานที่ทำเสร็จ โดยอยู่ที่ $2.00 เทียบกับประมาณ $0.07
เจ็ดจุดนั้นไม่ได้กระจายอย่างเท่าเทียมกัน ชื่อเสียงของ Kimi K3 กระจุกตัวอยู่ในงานเขียนโค้ดและงานซอฟต์แวร์แบบเอเจนต์ และนั่นคือเหตุผลที่โมเดลนี้มีอยู่: ลีดเดอร์บอร์ด WebDev ของ Code Arena จัดให้มันอยู่อันดับหนึ่งที่ 1,679 Elo และตัวเลข 88.3% จาก Terminal-Bench 2.0 ของผู้ขายเป็นการวัดผลของเอเจนต์เขียนโค้ด ตำแหน่งด้านการเขียนโค้ดของ GPT-6 Luna เองนั้นเป็นก้าวถอยหลังมากกว่าก้าวไปข้างหน้า — Coding Agent Index ของมันอยู่ที่ 41 ต่ำกว่า GPT-5.6 Luna ที่มันมาแทนอยู่ 2 จุด โดยการลดลงกระจุกตัวอยู่ใน SWE-Atlas-QnA และ DeepSWE v1.1 ถ้างานของคุณคือเอเจนต์ที่เขียนซอฟต์แวร์กับรีโพซิทอรีจริง นั่นคือช่องว่างของดัชนี 7 จุดและการถดถอยข้ามรุ่น 2 จุดที่ชี้ไปในทิศทางเดียวกัน และเหตุผลสนับสนุนระดับราคาถูกก็อ่อนลงอย่างมาก
จุดที่เจ็ดแต้มไม่ได้อยู่ คือ ประเภทงานที่ GPT-6 Luna ถูกตั้งราคาไว้สำหรับ การจำแนกประเภท การสกัดข้อมูล การจัดเส้นทาง การสรุปแบบจำนวนมาก ลูปภายในของเอเจนต์ที่ต้องการคำตอบใช่หรือไม่แบบเร็ว ๆ — ในงานเหล่านั้น สองโมเดลจะให้ผลลัพธ์ที่ใช้งานได้เหมือนกันเกือบตลอดเวลา และความแตกต่างนั้นจะไม่รอดเมื่อเจอชุดประเมินของคุณเอง ดัชนีวัดองค์ประกอบรวมที่ให้น้ำหนักกับการให้เหตุผลระยะยาวและการเขียนโค้ดอย่างมาก และไม่มีสิ่งใดในสองอย่างนั้นที่การตัดสินใจจัดเส้นทางต้องใช้
ข้อควรระวังหนึ่งอย่างที่ควรแนบไปกับตัวเลขดัชนีของทั้งสองฝ่าย: กระดานนี้เป็นการประเมินแบบหมุนเวียน และการปรับปรุงแก้ไขของมันมีความสำคัญ สแนปช็อตก่อนหน้าของลีดเดอร์บอร์ดเดียวกันจัดให้ Kimi K3 อยู่ในระดับที่สูงกว่าอย่างมีนัยสำคัญ เมื่อเทียบกับ 44 ที่การเก็บข้อมูลของเราแสดงในวันนี้ เพราะองค์ประกอบรวม ชุดทดสอบ และชุดโมเดลต่างก็เปลี่ยนแปลงไป การเปรียบเทียบใดก็ตามที่อิงกับช่องว่างที่แม่นยำระหว่างสองโมเดลบนดัชนีแบบหมุนเวียน กำลังอิงกับสิ่งที่ไม่มีทางคงที่ การตีความอย่างซื่อตรงคือ สองตัวนี้อยู่ในแถบความสามารถที่ติดกัน ณ เพดานของแต่ละตัว และดัชนีไม่สามารถบอกคุณได้ว่าตัวไหนดีกว่าสำหรับงานของคุณ
ข้อยกเว้น: สิ่งที่ Modified MIT ให้คุณได้จริง ๆ
ใบอนุญาตของ Kimi K3 เป็นมิติเดียวที่ GPT-6 Luna ไม่มีคำตอบไม่ว่าจะราคาใด และมันสมควรได้รับความแม่นยำมากกว่าที่วลี "open weights" มักจะได้รับ
เวตเหล่านี้เปิดเผยต่อสาธารณะบน Hugging Face และสัญญาอนุญาตคือ Modified MIT ไม่ใช่ MIT ความแตกต่างนี้สำคัญ: สัญญาอนุญาต Modified MIT โดยทั่วไปมีเงื่อนไขแนบมาด้วย — ซึ่งมักเป็นข้อกำหนดให้แสดงการระบุที่มาเมื่อมีการใช้โมเดลในผลิตภัณฑ์ที่เกินระดับหนึ่ง — และใครก็ตามที่วางแผนจะสร้างผลิตภัณฑ์เชิงพาณิชย์บนเวตเหล่านี้ควรอ่านตัวบทสัญญาฉบับจริง ไม่ใช่แค่ชื่อตระกูลที่มันดูคล้าย นี่ไม่ใช่เหตุผลที่จะหลีกเลี่ยงมัน แต่เป็นเหตุผลที่จะไม่เรียกมันว่า MIT ในเอกสารจัดซื้อจัดจ้าง
สิ่งที่การดาวน์โหลดมอบให้เป็นของจริงและมีขอบเขตจำกัด มันมอบต้นทุนขั้นต่ำ ในแง่ที่ว่าโครงสร้าง GPU แบบคงที่สามารถเอาชนะบิลแบบคิดตามการใช้งานได้เมื่อมีปริมาณมากพอ มันมอบความเป็นอิสระจากโรดแมปของผู้ขาย — โมเดลที่คุณโฮสต์เองจะไม่ถูกยกเลิกการสนับสนุนโดยที่คุณไม่ทันตั้งตัว มันมอบความสามารถในการ fine-tune บนข้อมูลของคุณเอง และมันมอบทางเลือกในการเก็บพรอมต์ไว้ภายในขอบเขตของคุณเอง ซึ่งสำหรับบางทีมแล้วเรื่องนี้ทำให้การเปรียบเทียบจบลงก่อนที่จะมีการพูดถึงราคาด้วยซ้ำ
สิ่งที่ต้องจ่ายคือฮาร์ดแวร์ โมเดล mixture-of-experts ขนาด 2.8 ล้านล้านพารามิเตอร์ที่มีพารามิเตอร์ที่ใช้งานจริง 1.04 แสนล้านตัว ไม่ใช่โมเดลที่รันบนเวิร์กสเตชันได้ การให้บริการ它以อัตราการประมวลผลระดับโปรดักชันเป็นการลงทุนระดับคลัสเตอร์ที่มีต้นทุนเงินลงทุน ต้นทุนดำเนินงาน และลักษณะความหน่วงที่คุณเป็นเจ้าของเองแทนที่จะเช่า นั่นไม่ใช่ข้อโต้แย้งต่อการโฮสต์ Kimi K3 ด้วยตนเอง — แต่เป็นข้อโต้แย้งว่าการเปรียบเทียบที่ถูกต้องไม่ใช่ $15.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน เทียบกับ $0.00 แต่เป็น $15.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน เทียบกับต้นทุนต่อโทเคนแบบครบวงจรที่รวมทั้งซิลิคอนและบุคลากร สำหรับองค์กรจำนวนน้อย ตัวเลขนั้นต่ำกว่า สำหรับคนส่วนใหญ่ไม่ใช่ และจุดที่ต้นทุนแบบโฮสต์เองจะคุ้มกว่าก็อยู่ไกลกว่าที่สัญญาอนุญาตทำให้รู้สึก
รันหนึ่งในนั้น หรือทั้งสอง
Kimi K3 อยู่บน OrcaRouter ในราคาตามรายการของ Moonshot ภายใต้โมเดลราคาแบบส่งผ่าน (pass-through) ซึ่งหมายความว่าหากผู้ให้บริการเปลี่ยนแปลงอัตราค่าบริการ ฝั่งเราจะอัปเดตให้มีผลในวันเดียวกัน ระบบสลับการทำงานอัตโนมัติ (automatic failover) คือส่วนที่คุ้มค่ากับโมเดลนี้โดยเฉพาะ เพราะการที่ endpoint ของ Kimi K3 ที่โฮสต์เองหรือของบุคคลที่สามเริ่มมีประสิทธิภาพลดลง คือสถานการณ์ที่คุณต้องการให้เส้นทางเปลี่ยนไปโดยไม่ต้องดีพลอย และโมเดลที่ทำได้ 38.7 โทเคนต่อวินาทีก็มีส่วนเผื่อสำหรับรองรับอัปสตรีมที่ช้ากว่าน้อยกว่าโมเดลที่เร็วกว่า
ณ เวลาที่เขียนนี้ GPT-6 Luna ยังไม่มีอยู่ในแคตตาล็อกของเรา และต้องเข้าถึงผ่าน API ของ OpenAI เอง ดังนั้นทีมที่ต้องการใช้ทั้งสองตัวก็ใช้คีย์เดียวสำหรับ Kimi K3 ควบคู่กับอะไรก็ตามที่ทีมใช้อยู่แล้วกับ OpenAI นี่ก็เป็นคู่ผสมที่ routing DSL ทำในสิ่งที่การแยกแบบฮาร์ดโค้ดทำไม่ได้ นั่นคือ กฎที่ส่งงานเขียนโค้ดและงานที่ใช้เวลายาวไปที่ Kimi K3 และส่งทุกอย่างที่โปรแกรมนำไปใช้กับงานสั้นไปที่ GPT-6 Luna เป็นการแสดงเส้นแบ่งที่ขยับทุกครั้งที่ผู้ให้บริการรายใดรายหนึ่งออกรุ่นใหม่ และมันขยับในฐานะการตั้งค่า ไม่ใช่ในฐานะเส้นทางของโค้ด การหลอมรวมโมเดลคือการตั้งค่าแบบอื่นที่ควรค่าแก่การกล่าวถึงตรงนี้ — คณะที่ประกอบด้วยโมเดลช้าแต่รอบคอบหนึ่งตัวกับโมเดลเร็วและถูกหนึ่งตัวตอบร่วมกัน โดยสมาชิกที่ถูกกว่าทำปริมาณงานส่วนใหญ่ และตัวที่แพงกว่าตัดสินกรณีที่สำคัญ คือรูปแบบที่โมเดลคู่นี้เข้ากันได้ดีเป็นพิเศษ เพราะความไม่สมมาตรของต้นทุนระหว่างทั้งสองมากพอที่การเสียการเรียก Kimi K3 ไปกับทราฟฟิกเพียงเสี้ยวเล็ก ๆ นั้นถือว่าจ่ายไหว

อันไหน และเมื่อไหร่
เลือกใช้ GPT-6 Luna หากปริมาณงานของคุณมีปริมาณสูง ถูกใช้โดยโปรแกรม และไวต่อความหน่วง การจำแนกประเภท การสกัดข้อมูล การกำหนดเส้นทาง การสรุปข้อมูลจำนวนมาก ลูปภายในของเอเจนต์ ที่ราคา $0.10/$0.50 ด้วยการอ่านแคชในราคาหนึ่งเซนต์และอัตราการประมวลผลเป็นสี่เท่าของ Kimi K3 การคำนวณไม่ได้ใกล้เคียงกัน และความแตกต่างของความหน่วงก็ไม่ใช่เล็กน้อย ตั้งค่าพารามิเตอร์ effort อย่างชัดเจน เนื่องจากค่าเริ่มต้นคือ medium และตัวเลข 37 ที่เป็นจุดขายคือค่าความพยายามสูงสุด และเก็บการเรียกใช้แบบยาวไว้ทางด้านที่ถูกต้องของขีดจำกัด 272,000 โทเค็น
เลือกใช้ Kimi K3 หากคุณต้องการเวตของโมเดล หากงานของคุณคือการเขียนโค้ดแบบเอเจนต์กับรีโพซิทอรีจริง ซึ่งตำแหน่ง WebDev ของมันและ 88.3% ที่ผู้ขายรายงานบน Terminal-Bench 2.0 คือหลักฐานที่สำคัญ หากคุณต้องการเพดานเอาต์พุตที่สูงกว่า 128,000 โทเคน หรือหากองค์กรของคุณไม่สามารถส่งพรอมป์ต์ไปยังปลายทางแบบปิดได้ ยอมรับ 38.7 โทเคนต่อวินาทีเป็นส่วนหนึ่งของข้อตกลง และอ่านเงื่อนไข Modified MIT แทนที่จะสันนิษฐานเอาเอง
ข้อผิดพลาดที่การเปรียบเทียบนี้ชักนำให้เกิด คือการมองอัตราสามสิบเท่าเป็นคำตอบของคำถามเกี่ยวกับความสามารถ มันเป็นคำตอบของคำถามเกี่ยวกับโทเคน คำถามเรื่องความสามารถนั้นตัดสินได้ด้วยว่าคุณต้องการน้ำหนักหรือความเร็ว และคำตอบสองข้อนั้นชี้ไปในทิศทางตรงกันข้าม

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
