
Cognition SWE-2: การเขียนโค้ดระดับใกล้เคียงแนวหน้าในราคาลด 64% และกับดักเบนช์มาร์กที่ซ่อนอยู่เบื้องหลัง
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 ต่อ 1 ล้านโทเค็น
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
Cognition SWE-2 เปิดตัวสัปดาห์นี้พร้อมตัวเลขที่ตั้งใจให้เป็นที่พูดถึง: 50.0% บน FrontierCode 1.1 Main ห่างจาก Claude Fable 5.1 ที่ 50.9% เพียงหนึ่งจุด โดยใช้เงินน้อยลง 64% โมเดลนี้เป็น post-train ของ Kimi K3 จาก Moonshot AI — ฐานน้ำหนักเปิดขนาด 2.8 ล้านล้านพารามิเตอร์ — และ Cognition กล่าวว่าการเรียนรู้แบบเสริมกำลังของมันเพิ่ม 5–6 คะแนนในหลายเบนช์มาร์ก ตัวเลขทั้งสองเป็นของผู้ขายเอง และยังไม่มีใครทำซ้ำได้อย่างอิสระ อย่างไรก็ตาม ตัวเลขที่สองคือข้อกล่าวอ้างที่ควรเปลี่ยนวิธีที่คุณอ่านตัวเลขแรก เพราะ "บวกห้าหรือหก" กลายเป็นคำที่อธิบายเกือบทุกอย่างที่ SWE-2 ทำได้ รวมถึงจุดที่มันแพ้อย่างยับเยิน
นั่นไม่ใช่คำติเตียนเลย มันคือสิ่งที่มีประโยชน์ที่สุดเกี่ยวกับการเปิดตัวครั้งนี้ และเป็นส่วนที่เกือบไม่มีสื่อใดที่รายงานการเปิดตัวครั้งนี้พูดออกมาตรง ๆ
สิ่งที่ Cognition ส่งมอบจริง ๆ
SWE-2 เป็นโมเดลเขียนโค้ดของ Devin ไม่ใช่โมเดล API เอนกประสงค์ที่มีรายการราคา พร้อมให้ใช้งานเริ่มตั้งแต่วันนี้ใน Devin Desktop และ CLI ตามคำกล่าวของ Cognition เอง โดยกำลังทยอยเปิดให้ใช้งานบน Devin Web และ Fusion สื่อภายนอกระบุว่าประกาศเมื่อวันที่ 10 กันยายน 2026 ส่วนชื่อผู้เขียนในบทความบล็อกของ Cognition เองระบุว่า 09.11.26 ไม่ว่าจะทางใดก็ตาม มันเพิ่งเปิดตัวได้เพียงไม่กี่วัน น้ำหนักของโมเดลเป็นกรรมสิทธิ์เฉพาะและไม่มีตารางอัตราค่าบริการต่อโทเค็นที่เผยแพร่ หากคุณต้องการใช้ SWE-2 คุณก็ต้องใช้มันภายใน Devin
ฐานคือ Kimi K3 ซึ่งเป็นโมเดล Mixture-of-Experts ขนาด 2.8 ล้านล้านพารามิเตอร์ โดยมีพารามิเตอร์ที่เปิดใช้งานต่อโทเคนราว 104B — ใหญ่กว่าฐานของ SWE-1.7 ประมาณสามเท่า Cognition ระบุว่า K3 ผ่านการฝึกด้วย RL อย่างหนักสำหรับการเขียนโค้ดแบบเอเจนต์อยู่แล้วก่อนที่จะมาถึงจุดนี้ และ RL ของตัวมันเอง "ยังคงพบช่องว่างที่พัฒนาได้อีกมาก" ซึ่งสะท้อนรูปแบบเดียวกับ SWE-1.7 ที่ถูกนำมาฝึกต่อบนฐาน Kimi เช่นกัน
นี่คือรายละเอียดที่สำคัญยิ่งกว่าคะแนน benchmark ใด ๆ เพียงตัวเดียว: FrontierCode เป็น benchmark ของ Cognition บริษัทเป็นผู้เขียนโจทย์เอง — โดยมีผู้ดูแล open-source มากกว่า 20 ราย ใช้เวลามากกว่า 40 ชั่วโมงต่อโจทย์ โดยผู้ดูแลแต่ละรายเป็นผู้กำหนดว่า "mergeable" หมายถึงอะไรใน repo ของตัวเอง — เป็นผู้ดูแล leaderboard และเป็นผู้ให้คะแนนผลงานที่ส่งเข้ามา นี่คือการออกแบบการประเมินที่จริงจังชิ้นหนึ่ง และในขณะเดียวกันก็เป็นเครื่องมือภายในของบริษัทเองด้วย Cognition รายงานคะแนนดีที่สุดของแต่ละโมเดลจากทุกการตั้งค่า reasoning-effort และตามภาคผนวกวิธีวิทยาของบริษัทเอง โมเดลเปรียบเทียบแบบ open-weight รวมถึง Kimi K3 ถูกเรียกใช้ภายใน Devin CLI ของ Cognition ทั้งหมดนี้ไม่ได้ทำให้ตัวเลขผิดพลาด และทั้งหมดนี้ควรอยู่ในประโยคที่คุณอ้างอิงตัวเลขเหล่านั้น

อ่านตาราง benchmark อย่างตรงไปตรงมา
สี่เบนช์มาร์ก ทั้งหมดเป็นข้อมูลที่ผู้ขายรายงานเอง นี่คือสิ่งที่แต่ละรายการระบุไว้จริง ๆ หนึ่งบรรทัดต่อแถว
• FrontierCode 1.1 Main — SWE-2 50.0% เทียบกับ Kimi K3 44.2%, Grok 4.6 48.0%, GPT-5.6 Sol 47.5%, Claude Fable 5.1 50.9%, GPT-6 Astra 53.3%, SWE-1.7 42.0% ห่างจากแนวหน้าไม่เกินหนึ่งจุด นำหน้าทุกสิ่งในตาราง
• DeepSWE 1.1 — SWE-2 73.0% นำหน้า Claude Fable 5.1 ที่ 67.4% และ Grok 4.6 ที่ 67.5% ตามหลัง GPT-6 Astra ที่ 74.1% นี่คือแถวที่ SWE-2 เอาชนะโมเดลระดับแนวหน้าได้อย่างน่าเชื่อถือที่สุด
• Terminal-Bench 2.1 — SWE-2 92.8% ซึ่งเป็นคะแนนสูงสุดในตารางของ Cognition อยู่เหนือกว่า Claude Fable 5.1 ที่ 91.4% และ GPT-6 Astra ที่ 89.9% นี่คือตัวเลขที่ปรากฏอยู่ในพาดหัวข่าวการเปิดตัวส่วนใหญ่
• Terminal-Bench 4 — SWE-2 27.3% เทียบกับ Claude Fable 5.1 ที่ 55.8% และ GPT-6 Astra ที่ 57.9% ห่างกันราว 28 คะแนน และเป็นแถวที่ถูกอ้างถึงน้อยที่สุด
ข้อโต้แย้งที่เห็นได้ชัดคือ ทุกคนต่างมีคะแนนลดลงบน Terminal-Bench 4 — มันเป็นรุ่นสืบทอดที่ยากขึ้นและมีขอบเขตระยะเวลาที่ยาวขึ้น ดังนั้นแน่นอนว่าคะแนนย่อมลดลง ส่วนที่น่าสนใจคือ ลดลงมากแค่ไหน และการลดลงนั้นไม่เป็นสัดส่วน เมื่อเปลี่ยนจาก Terminal-Bench 2.1 เป็น 4 Claude Fable 5.1 สูญเสียประมาณ 35.6 คะแนน และ GPT-6 Astra ประมาณ 32.0 SWE-2 สูญเสียประมาณ 65.5 คะแนน และ Kimi K3 ซึ่งเป็นฐานของมันประมาณ 66.8 คะแนน ดังนั้นในงานเอเจนต์ระยะยาว SWE-2 ไม่ได้เพียงแค่อยู่ต่ำกว่าโมเดลชั้นแนวหน้าเท่านั้น — มันเสื่อมประสิทธิภาพลงเร็วเป็นประมาณสองเท่าของโมเดลเหล่านั้นเมื่องานดำเนินไปยาวนาน
การที่ Terminal-Bench 4 เป็นเวอร์ชัน "live" หรือไม่นั้นควรพูดให้ชัดเจน ก็คือมันเป็นฉบับปัจจุบัน และ 2.1 เป็นฉบับที่ถูกแทนที่แล้ว แถวที่ SWE-2 นำอยู่คือเบนช์มาร์กที่ปลดระวางแล้ว แถวที่มันตามหลังอยู่คือฉบับปัจจุบัน ข้อเท็จจริงทั้งสองข้อเป็นจริง และการรายงานข่าวตอนเปิดตัวมักเลือกหยิบมาข้อหนึ่ง
"Kimi K3 plus five" — ฮิวริสติกที่ทำนายคะแนนที่ไม่มีใครเคยเผยแพร่
เมื่อเทียบสี่เบนช์มาร์กกับโมเดลฐานของ SWE-2 เอง สิ่งที่ดูเกือบจะเป็นกลไกก็ปรากฏออกมา เมื่อเทียบกับ Kimi K3, SWE-2 ได้คะแนนเพิ่มขึ้น 5.8 คะแนนบน FrontierCode 1.1 Main, 4.5 บน DeepSWE 1.1, 4.5 บน Terminal-Bench 2.1 และ 5.8 บน Terminal-Bench 4
สี่เบนช์มาร์ก สี่ช่องว่าง ทั้งหมดอยู่ระหว่าง 4.5 ถึง 5.8 การทำ post-training ขยับระดับขึ้น ไม่ได้เปลี่ยนรูปทรง ตรงไหนที่ K3 แข็งแกร่ง SWE-2 ก็แข็งแกร่งบวกอีกประมาณห้า ตรงไหนที่ K3 อ่อนแอ — Terminal-Bench 4 เป็นกรณีที่ชัดเจน — SWE-2 ก็อ่อนแอบวกอีกประมาณห้า
นั่นทำให้คุณได้การพยากรณ์ที่ใช้งานได้สำหรับงานใด ๆ ที่ Cognition ไม่ได้วัดผล ซึ่งก็คืองานส่วนใหญ่ ลองค้นดูว่า Kimi K3 ทำงานได้ดีแค่ไหนกับภาระงานของคุณ บวกเพิ่มห้าคะแนน แล้วคุณจะได้ค่าประมาณของ SWE-2 ที่ดีกว่าตัวเลขพาดหัวข่าวใด ๆ จะให้ได้ มันยังอธิบายแก่นเรื่องจริงของการเปิดตัวครั้งนี้ด้วย: Cognition ไม่ได้อ้างว่าได้เอาชนะพรมแดน แต่กำลังอ้างว่าได้เลื่อนเส้นโค้งต้นทุน-ประสิทธิภาพทั้งหมดออกไป ขณะที่ยังคงตามหลังโมเดลที่ดีที่สุดอยู่เป็นระยะคงที่บนแกนใดก็ตามที่คุณวัด
64% นั้นเป็นของจริง แต่คุณไม่สามารถช้อปปิ้งมันได้
“ถูกกว่า Claude Fable 5.1 อยู่ 64%” เป็นข้อความจริงเกี่ยวกับการวัดค่าเฉพาะอย่างหนึ่ง — และการวัดนั้นคือค่าเฉลี่ยดอลลาร์สหรัฐที่ใช้จ่ายต่อการ rollout หนึ่งครั้งบน FrontierCode ไม่ใช่ราคาต่อโทเคน ไม่มีอัตราคิดค่าต่อโทเคนสำหรับ SWE-2 เพราะไม่มี API ของ SWE-2 ข้อกล่าวอ้างด้านต้นทุนนี้อธิบายว่าภายใน Devin งานหนึ่งมีต้นทุนเท่าใด ซึ่งรวมโมเดล ฮาร์เนส โครง scaffolding และสแต็กการให้บริการของ Cognition ไว้ในใบแจ้งหนี้เดียว
ความแตกต่างนี้มีนัยสำคัญจริง คุณไม่สามารถเปรียบเทียบต้นทุนของ SWE-2 กับราคาต่อโทเคนจากผู้ขายรายอื่นได้ เพราะมันไม่ใช่หน่วยเดียวกัน และคุณไม่สามารถนำ SWE-2 ไปใช้ที่อื่นได้: น้ำหนักเป็นกรรมสิทธิ์ ผู้ขายรายเดียว ผลิตภัณฑ์เอเจนต์ตัวเดียว ตัวเลข “ลดต้นทุนได้สูงสุดถึง 70%” ในบางรายงานข่าวคือค่าสูงสุดของช่วงที่ Cognition อ้างอิงในหลากเบนช์มาร์ก ส่วนตัวเลขของ FrontierCode 1.1 Main คือ 64%
ตัวเลขด้านประสิทธิภาพนั้น ถ้าจะพูดจริง ๆ ก็เป็นเรื่องที่ใช้งานได้จริงมากกว่า และข้อมูลเหล่านั้นก็เป็นข้อมูลที่ผู้ขายรายงานเองเช่นกัน SWE-2 ที่ระดับความพยายามปานกลางเอาชนะคะแนน FrontierCode ของ SWE-1.7 ได้ ขณะที่ใช้จำนวนรอบน้อยลง 58% และมีค่าใช้จ่ายเฉลี่ยต่ำลง 81% จำนวนขั้นเฉลี่ยต่อการรันลดจาก 127 ใน SWE-1.7 เหลือ 53 ที่ความพยายามปานกลาง (80 ที่ระดับสูง, 98 ที่ระดับสูงสุด) และค่ามัธยฐานของการแก้โค้ดจริงครั้งแรกเลื่อนจากขั้นที่ 48 ไปเป็นขั้นที่ 18 นั่นคือคำตอบโดยตรงต่อข้อร้องเรียนที่ว่า SWE-1.7 สำรวจงานง่าย ๆ มากเกินไป และมันเป็นการปรับปรุงแบบที่ปรากฏบนบิลของคุณนานก่อนที่ช่องว่างของเบนช์มาร์กเพียงหนึ่งคะแนนจะปรากฏเสียอีก

เคล็ดลับการฝึกนั่นแหละคือข่าวจริง
ถ้าตัดเรื่องการวางตำแหน่งบนลีดเดอร์บอร์ดออกไป ก็ยังมีงานวิศวกรรมใหม่จริง ๆ อยู่หนึ่งชิ้นตรงนี้ ซึ่งนั่นคือเหตุผลว่าทำไมการเปิดตัวครั้งนี้จึงน่าอ่าน แม้ว่าคุณจะไม่เปิด Devin เลยก็ตาม
Cognition ฝึกทุกระดับของความพยายามในการใช้เหตุผลทั้งสามระดับ — medium, high และ max — ภายในการรัน RL เพียงครั้งเดียว กลไกคือการลงโทษด้วยต้นทุนแบบเชิงเส้นต่อระดับความพยายาม โดยแต่ละระดับถูกปรับจูนให้สอดคล้องกับความชันของเส้นโค้ง Pareto ด้านต้นทุน-ประสิทธิภาพของโมเดลฐาน ณ จุดนั้น เหตุผลของ Cognition ว่าทำไมการลงโทษจึงต้องเป็นแบบเชิงเส้นคือส่วนที่น่าสนใจ: มีเพียงการลงโทษแบบเชิงเส้นเท่านั้นที่ทำให้วัตถุประสงค์ของการฝึกเป็นฟังก์ชันของต้นทุนเฉลี่ยและอัตราการแก้ปัญหาเพียงอย่างเดียว แทนที่จะเป็นสิ่งที่ขึ้นอยู่กับรูปร่างของการกระจาย
วิธีการปกติจะฝึกระดับความพยายามแยกกัน หรือไม่ก็นำ checkpoint ที่มีต้นทุนต่ำกว่ามาติดตั้งเพิ่มในภายหลัง การฝึกสิ่งเหล่านี้เข้าด้วยกันใน run เดียวคือสิ่งที่ทำให้บริษัทอ้างได้ว่ามันพัฒนาแนวหน้าทั้งหมด ไม่ใช่แค่จุดใดจุดหนึ่งบนแนวหน้านั้น การปรับเปลี่ยนเสริม: reward baseline ที่ถ่วงน้ำหนักตามความยาว, การเพิ่มจำนวนสภาพแวดล้อม RL เป็นสามเท่า, overlay สำหรับการทำตามคำสั่ง, และ flywheel ที่ใช้ checkpoint SWE-2 รุ่นก่อนหน้าเพื่อเสริมความแข็งแกร่งให้ตัวตรวจสอบต่อการแฮ็ก reward ในฝั่งการให้บริการ: เคอร์เนล NVFP4 และ FP8 พร้อมการฝึกแบบรู้ปริมาณ (quantization-aware training), โมเดลร่างสำหรับ speculative decoding ชื่อ DSpark ที่ฝึกใหม่เพื่อให้ความยาวที่ยอมรับได้นานขึ้น 15%, และตัวหน่วง prefill ที่ให้ throughput ต่อ GPU เพิ่มขึ้น 10–20% โดยแลกกับการเพิ่มเวลา time-to-first-token ที่แย่ลง
หากคุณทำ post-training สูตรนั้นคือส่วนที่นำไปใช้ต่อได้ของการเปิดตัวครั้งนี้ หากคุณไม่ทำ ข้อสรุปนั้นง่ายกว่า: เหตุผลที่ SWE-2 มีต้นทุนต่ำไม่ใช่เพราะมันเป็นโมเดลที่เล็กกว่า แต่เป็นเพราะต้นทุนในการรันมันถูกเขียนไว้ในฟังก์ชันรางวัล
ถ้าคุณต้องการความสามารถของ Kimi K3 นอก Devin
SWE-2 ไม่ได้อยู่บน OrcaRouter และจะไม่มีวันอยู่ด้วย — เป็นเวตส์แบบปิด ไม่มี API และเผยแพร่เฉพาะบน Devin เท่านั้น ส่วนโมเดลฐานของมันเป็นอีกกรณีหนึ่ง Kimi K3 ถูกจัดเส้นทางบน OrcaRouterในชื่อkimi/kimi-k3 ในราคา $3.00 ต่อ 1 ล้านโทเคนอินพุต และ $15.00 ต่อ 1 ล้านโทเคนเอาต์พุต โดยไม่บวกเพิ่มจากราคาของผู้ให้บริการ มีหน้าต่างบริบท 1 ล้านโทเคน รองรับการเรียกใช้เครื่องมือแบบเนทีฟ รับอินพุตรูปภาพ และควบคุมความลึกของการให้เหตุผลผ่านพารามิเตอร์ระดับบนสุด reasoning_effort แทนการตั้งค่าการสุ่ม
นั่นคือเวอร์ชันที่ตรงไปตรงมาของข้อสรุปเชิงปฏิบัติจากการเปิดตัวครั้งนี้ SWE-2 แสดงให้คุณเห็นว่าการรัน RL ที่ทำได้ดีบน K3 จะเป็นอย่างไรเมื่ออยู่ในจุดสูงสุดของช่วง — การเพิ่มขึ้นจริง 4.5 ถึง 5.8 จุด บวกกับประสิทธิภาพที่เพิ่มขึ้นอย่างมาก ด้วยต้นทุนที่แท้จริง สิ่งที่มันไม่ได้ให้คุณคือโมเดลที่คุณเรียกใช้ได้ ถ้าคุณต้องการให้ความสามารถที่อยู่เบื้องหลังมุ่งไปที่โค้ดของคุณเอง ฮาร์เนสของคุณเอง หรือไปป์ไลน์ของคุณเอง K3 คือส่วนของสแต็กนี้ที่คุณเข้าถึงได้จริง และมันเข้าถึงได้ผ่านปลายทางที่เข้ากันได้กับ OpenAI เพียงหนึ่งเดียว
มันยังเป็นครึ่งที่ปลอดภัยกว่าของการเดิมพันในขณะที่ตัวเลขยังไม่ผ่านการตรวจสอบ เกณฑ์วัดของ SWE-2 เป็นของ Cognition เองและไม่มีใครนอกบริษัททำซ้ำได้ ส่วนของ Kimi K3 ต่างหากที่การเปรียบเทียบนี้พึ่งพาอยู่จริง ๆ — และถ้าคุณกำหนดเส้นทางผ่าน OrcaRouter คุณก็สามารถ วางเชนสำรองไว้ด้านหลังมัน เพื่อให้โมเดลที่คุณกำลังทดลองใช้จะไม่กลายเป็น dependency สำหรับโปรดักชันในวันที่มันทำให้คุณผิดหวัง

ใครควรลงมือ และสิ่งใดจะทำให้เรื่องนี้ยุติ
หากคุณจ่ายเงินสำหรับ Devin อยู่แล้ว SWE-2 ถือเป็นข่าวดีอย่างชัดเจน: มันกำลังทยอยเปิดให้ใช้กับผลิตภัณฑ์ของคุณ, ถูกกว่าต่องานเมื่อเทียบกับสิ่งที่มันเข้ามาแทนที่, และตัวเลขประสิทธิภาพบ่งชี้ว่าจะสิ้นเปลืองรอบน้อยลงกับงานง่ายๆ ลองใช้กับงานง่ายๆ ต้นคิวของคุณก่อน — การออกแบบระดับความพยายาม (effort-level) หมายความว่าระดับ medium คือจุดที่ความคุ้มค่าด้านต้นทุนอยู่
หากคุณกำลังเลือกโมเดลเขียนโค้ดจากภายนอก ให้รอการประเมินที่เป็นอิสระ ตอนนี้ยังไม่มีเลย: Artificial Analysis ยังไม่มีรายการ SWE-2 และลีดเดอร์บอร์ด FrontierCode ก็เป็นเครื่องมือของ Cognition เอง สามสิ่งที่จะทำให้ได้ข้อสรุป ได้แก่ การรัน SWE-2 บน Terminal-Bench 4 โดยบุคคลที่สาม ซึ่งเป็นแถวที่ตัดสินว่านี่เป็นโมเดลที่ใกล้เคียงระดับแนวหน้าหรือเป็นเพียงโมเดลที่เร็ว การทำซ้ำอย่างอิสระใด ๆ ของช่องว่าง FrontierCode และราคาต่อโทเคน ซึ่งจะต้องให้ Cognition ขายโมเดลนี้นอก Devin — การเปลี่ยนแปลงเพียงอย่างเดียวที่จะทำให้ 64% เทียบเคียงได้กับสิ่งอื่นใดที่คุณได้รับข้อเสนอราคา
จนถึงตอนนั้น สรุปที่ยุติธรรมก็คือสรุปที่ช่องว่างของโมเดลฐานให้คุณอยู่แล้ว SWE-2 คือ Kimi K3 บวกห้าคะแนน ด้วยต้นทุนที่ Cognition ออกแบบไว้ในฟังก์ชันรางวัล นั่นเป็นความสำเร็จที่แท้จริงในการฝึกโมเดล และเป็นข้อตกลงที่ดีจริง ๆ ภายใน Devin มันยังไม่ใช่โมเดลระดับแนวหน้า และเบนช์มาร์กเดียวที่มันดูเหมือนจะเอาชนะทุกอย่างได้ คือเบนช์มาร์กที่เลิกนับไปแล้ว
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
