การ์ดชื่อเรื่องสำหรับ Cognition SWE-2 แสดงคำบรรยายที่ระบุว่า 'Kimi K3 โพสต์เทรน ทำได้ 50.0% บน FrontierCode 1.1 Main ด้วยต้นทุนต่ำลง 64%' พร้อมการ์ดสามใบ: FrontierCode 1.1 Main 50.0%, เทียบกับ Claude Fable 5.1 50.9%, และต้นทุนต่อการโรลเอาต์ต่ำลง 64%
Guides & Insights

Cognition SWE-2: การเขียนโค้ดระดับใกล้เคียงแนวหน้าในราคาลด 64% และกับดักเบนช์มาร์กที่ซ่อนอยู่เบื้องหลัง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Cognition SWE-2 เปิดตัวสัปดาห์นี้พร้อมตัวเลขที่ตั้งใจให้เป็นที่พูดถึง: 50.0% บน FrontierCode 1.1 Main ห่างจาก Claude Fable 5.1 ที่ 50.9% เพียงหนึ่งจุด โดยใช้เงินน้อยลง 64% โมเดลนี้เป็น post-train ของ Kimi K3 จาก Moonshot AI — ฐานน้ำหนักเปิดขนาด 2.8 ล้านล้านพารามิเตอร์ — และ Cognition กล่าวว่าการเรียนรู้แบบเสริมกำลังของมันเพิ่ม 5–6 คะแนนในหลายเบนช์มาร์ก ตัวเลขทั้งสองเป็นของผู้ขายเอง และยังไม่มีใครทำซ้ำได้อย่างอิสระ อย่างไรก็ตาม ตัวเลขที่สองคือข้อกล่าวอ้างที่ควรเปลี่ยนวิธีที่คุณอ่านตัวเลขแรก เพราะ "บวกห้าหรือหก" กลายเป็นคำที่อธิบายเกือบทุกอย่างที่ SWE-2 ทำได้ รวมถึงจุดที่มันแพ้อย่างยับเยิน

นั่นไม่ใช่คำติเตียนเลย มันคือสิ่งที่มีประโยชน์ที่สุดเกี่ยวกับการเปิดตัวครั้งนี้ และเป็นส่วนที่เกือบไม่มีสื่อใดที่รายงานการเปิดตัวครั้งนี้พูดออกมาตรง ๆ

สิ่งที่ Cognition ส่งมอบจริง ๆ

SWE-2 เป็นโมเดลเขียนโค้ดของ Devin ไม่ใช่โมเดล API เอนกประสงค์ที่มีรายการราคา พร้อมให้ใช้งานเริ่มตั้งแต่วันนี้ใน Devin Desktop และ CLI ตามคำกล่าวของ Cognition เอง โดยกำลังทยอยเปิดให้ใช้งานบน Devin Web และ Fusion สื่อภายนอกระบุว่าประกาศเมื่อวันที่ 10 กันยายน 2026 ส่วนชื่อผู้เขียนในบทความบล็อกของ Cognition เองระบุว่า 09.11.26 ไม่ว่าจะทางใดก็ตาม มันเพิ่งเปิดตัวได้เพียงไม่กี่วัน น้ำหนักของโมเดลเป็นกรรมสิทธิ์เฉพาะและไม่มีตารางอัตราค่าบริการต่อโทเค็นที่เผยแพร่ หากคุณต้องการใช้ SWE-2 คุณก็ต้องใช้มันภายใน Devin

ฐานคือ Kimi K3 ซึ่งเป็นโมเดล Mixture-of-Experts ขนาด 2.8 ล้านล้านพารามิเตอร์ โดยมีพารามิเตอร์ที่เปิดใช้งานต่อโทเคนราว 104B — ใหญ่กว่าฐานของ SWE-1.7 ประมาณสามเท่า Cognition ระบุว่า K3 ผ่านการฝึกด้วย RL อย่างหนักสำหรับการเขียนโค้ดแบบเอเจนต์อยู่แล้วก่อนที่จะมาถึงจุดนี้ และ RL ของตัวมันเอง "ยังคงพบช่องว่างที่พัฒนาได้อีกมาก" ซึ่งสะท้อนรูปแบบเดียวกับ SWE-1.7 ที่ถูกนำมาฝึกต่อบนฐาน Kimi เช่นกัน

นี่คือรายละเอียดที่สำคัญยิ่งกว่าคะแนน benchmark ใด ๆ เพียงตัวเดียว: FrontierCode เป็น benchmark ของ Cognition บริษัทเป็นผู้เขียนโจทย์เอง — โดยมีผู้ดูแล open-source มากกว่า 20 ราย ใช้เวลามากกว่า 40 ชั่วโมงต่อโจทย์ โดยผู้ดูแลแต่ละรายเป็นผู้กำหนดว่า "mergeable" หมายถึงอะไรใน repo ของตัวเอง — เป็นผู้ดูแล leaderboard และเป็นผู้ให้คะแนนผลงานที่ส่งเข้ามา นี่คือการออกแบบการประเมินที่จริงจังชิ้นหนึ่ง และในขณะเดียวกันก็เป็นเครื่องมือภายในของบริษัทเองด้วย Cognition รายงานคะแนนดีที่สุดของแต่ละโมเดลจากทุกการตั้งค่า reasoning-effort และตามภาคผนวกวิธีวิทยาของบริษัทเอง โมเดลเปรียบเทียบแบบ open-weight รวมถึง Kimi K3 ถูกเรียกใช้ภายใน Devin CLI ของ Cognition ทั้งหมดนี้ไม่ได้ทำให้ตัวเลขผิดพลาด และทั้งหมดนี้ควรอยู่ในประโยคที่คุณอ้างอิงตัวเลขเหล่านั้น

Two-column scoreboard headed 'Cognition SWE-2 vs Claude Fable 5.1'. Left column Cognition SWE-2: FrontierCode 1.1 Main 50.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%, Cost per rollout 64% lower, Base model Kimi K3 2.8T, Independent eval none yet. Right column Claude Fable 5.1: FrontierCode 1.1 Main 50.9%, Terminal-Bench 2.1 91.4%, Terminal-Bench 4 55.8%, Cost per rollout baseline, Base model proprietary, Independent eval third-party scored.

อ่านตาราง benchmark อย่างตรงไปตรงมา

สี่เบนช์มาร์ก ทั้งหมดเป็นข้อมูลที่ผู้ขายรายงานเอง นี่คือสิ่งที่แต่ละรายการระบุไว้จริง ๆ หนึ่งบรรทัดต่อแถว

• FrontierCode 1.1 Main — SWE-2 50.0% เทียบกับ Kimi K3 44.2%, Grok 4.6 48.0%, GPT-5.6 Sol 47.5%, Claude Fable 5.1 50.9%, GPT-6 Astra 53.3%, SWE-1.7 42.0% ห่างจากแนวหน้าไม่เกินหนึ่งจุด นำหน้าทุกสิ่งในตาราง

• DeepSWE 1.1 — SWE-2 73.0% นำหน้า Claude Fable 5.1 ที่ 67.4% และ Grok 4.6 ที่ 67.5% ตามหลัง GPT-6 Astra ที่ 74.1% นี่คือแถวที่ SWE-2 เอาชนะโมเดลระดับแนวหน้าได้อย่างน่าเชื่อถือที่สุด

• Terminal-Bench 2.1 — SWE-2 92.8% ซึ่งเป็นคะแนนสูงสุดในตารางของ Cognition อยู่เหนือกว่า Claude Fable 5.1 ที่ 91.4% และ GPT-6 Astra ที่ 89.9% นี่คือตัวเลขที่ปรากฏอยู่ในพาดหัวข่าวการเปิดตัวส่วนใหญ่

• Terminal-Bench 4 — SWE-2 27.3% เทียบกับ Claude Fable 5.1 ที่ 55.8% และ GPT-6 Astra ที่ 57.9% ห่างกันราว 28 คะแนน และเป็นแถวที่ถูกอ้างถึงน้อยที่สุด

ข้อโต้แย้งที่เห็นได้ชัดคือ ทุกคนต่างมีคะแนนลดลงบน Terminal-Bench 4 — มันเป็นรุ่นสืบทอดที่ยากขึ้นและมีขอบเขตระยะเวลาที่ยาวขึ้น ดังนั้นแน่นอนว่าคะแนนย่อมลดลง ส่วนที่น่าสนใจคือ ลดลงมากแค่ไหน และการลดลงนั้นไม่เป็นสัดส่วน เมื่อเปลี่ยนจาก Terminal-Bench 2.1 เป็น 4 Claude Fable 5.1 สูญเสียประมาณ 35.6 คะแนน และ GPT-6 Astra ประมาณ 32.0 SWE-2 สูญเสียประมาณ 65.5 คะแนน และ Kimi K3 ซึ่งเป็นฐานของมันประมาณ 66.8 คะแนน ดังนั้นในงานเอเจนต์ระยะยาว SWE-2 ไม่ได้เพียงแค่อยู่ต่ำกว่าโมเดลชั้นแนวหน้าเท่านั้น — มันเสื่อมประสิทธิภาพลงเร็วเป็นประมาณสองเท่าของโมเดลเหล่านั้นเมื่องานดำเนินไปยาวนาน

การที่ Terminal-Bench 4 เป็นเวอร์ชัน "live" หรือไม่นั้นควรพูดให้ชัดเจน ก็คือมันเป็นฉบับปัจจุบัน และ 2.1 เป็นฉบับที่ถูกแทนที่แล้ว แถวที่ SWE-2 นำอยู่คือเบนช์มาร์กที่ปลดระวางแล้ว แถวที่มันตามหลังอยู่คือฉบับปัจจุบัน ข้อเท็จจริงทั้งสองข้อเป็นจริง และการรายงานข่าวตอนเปิดตัวมักเลือกหยิบมาข้อหนึ่ง

"Kimi K3 plus five" — ฮิวริสติกที่ทำนายคะแนนที่ไม่มีใครเคยเผยแพร่

เมื่อเทียบสี่เบนช์มาร์กกับโมเดลฐานของ SWE-2 เอง สิ่งที่ดูเกือบจะเป็นกลไกก็ปรากฏออกมา เมื่อเทียบกับ Kimi K3, SWE-2 ได้คะแนนเพิ่มขึ้น 5.8 คะแนนบน FrontierCode 1.1 Main, 4.5 บน DeepSWE 1.1, 4.5 บน Terminal-Bench 2.1 และ 5.8 บน Terminal-Bench 4

สี่เบนช์มาร์ก สี่ช่องว่าง ทั้งหมดอยู่ระหว่าง 4.5 ถึง 5.8 การทำ post-training ขยับระดับขึ้น ไม่ได้เปลี่ยนรูปทรง ตรงไหนที่ K3 แข็งแกร่ง SWE-2 ก็แข็งแกร่งบวกอีกประมาณห้า ตรงไหนที่ K3 อ่อนแอ — Terminal-Bench 4 เป็นกรณีที่ชัดเจน — SWE-2 ก็อ่อนแอบวกอีกประมาณห้า

นั่นทำให้คุณได้การพยากรณ์ที่ใช้งานได้สำหรับงานใด ๆ ที่ Cognition ไม่ได้วัดผล ซึ่งก็คืองานส่วนใหญ่ ลองค้นดูว่า Kimi K3 ทำงานได้ดีแค่ไหนกับภาระงานของคุณ บวกเพิ่มห้าคะแนน แล้วคุณจะได้ค่าประมาณของ SWE-2 ที่ดีกว่าตัวเลขพาดหัวข่าวใด ๆ จะให้ได้ มันยังอธิบายแก่นเรื่องจริงของการเปิดตัวครั้งนี้ด้วย: Cognition ไม่ได้อ้างว่าได้เอาชนะพรมแดน แต่กำลังอ้างว่าได้เลื่อนเส้นโค้งต้นทุน-ประสิทธิภาพทั้งหมดออกไป ขณะที่ยังคงตามหลังโมเดลที่ดีที่สุดอยู่เป็นระยะคงที่บนแกนใดก็ตามที่คุณวัด

64% นั้นเป็นของจริง แต่คุณไม่สามารถช้อปปิ้งมันได้

“ถูกกว่า Claude Fable 5.1 อยู่ 64%” เป็นข้อความจริงเกี่ยวกับการวัดค่าเฉพาะอย่างหนึ่ง — และการวัดนั้นคือค่าเฉลี่ยดอลลาร์สหรัฐที่ใช้จ่ายต่อการ rollout หนึ่งครั้งบน FrontierCode ไม่ใช่ราคาต่อโทเคน ไม่มีอัตราคิดค่าต่อโทเคนสำหรับ SWE-2 เพราะไม่มี API ของ SWE-2 ข้อกล่าวอ้างด้านต้นทุนนี้อธิบายว่าภายใน Devin งานหนึ่งมีต้นทุนเท่าใด ซึ่งรวมโมเดล ฮาร์เนส โครง scaffolding และสแต็กการให้บริการของ Cognition ไว้ในใบแจ้งหนี้เดียว

ความแตกต่างนี้มีนัยสำคัญจริง คุณไม่สามารถเปรียบเทียบต้นทุนของ SWE-2 กับราคาต่อโทเคนจากผู้ขายรายอื่นได้ เพราะมันไม่ใช่หน่วยเดียวกัน และคุณไม่สามารถนำ SWE-2 ไปใช้ที่อื่นได้: น้ำหนักเป็นกรรมสิทธิ์ ผู้ขายรายเดียว ผลิตภัณฑ์เอเจนต์ตัวเดียว ตัวเลข “ลดต้นทุนได้สูงสุดถึง 70%” ในบางรายงานข่าวคือค่าสูงสุดของช่วงที่ Cognition อ้างอิงในหลากเบนช์มาร์ก ส่วนตัวเลขของ FrontierCode 1.1 Main คือ 64%

ตัวเลขด้านประสิทธิภาพนั้น ถ้าจะพูดจริง ๆ ก็เป็นเรื่องที่ใช้งานได้จริงมากกว่า และข้อมูลเหล่านั้นก็เป็นข้อมูลที่ผู้ขายรายงานเองเช่นกัน SWE-2 ที่ระดับความพยายามปานกลางเอาชนะคะแนน FrontierCode ของ SWE-1.7 ได้ ขณะที่ใช้จำนวนรอบน้อยลง 58% และมีค่าใช้จ่ายเฉลี่ยต่ำลง 81% จำนวนขั้นเฉลี่ยต่อการรันลดจาก 127 ใน SWE-1.7 เหลือ 53 ที่ความพยายามปานกลาง (80 ที่ระดับสูง, 98 ที่ระดับสูงสุด) และค่ามัธยฐานของการแก้โค้ดจริงครั้งแรกเลื่อนจากขั้นที่ 48 ไปเป็นขั้นที่ 18 นั่นคือคำตอบโดยตรงต่อข้อร้องเรียนที่ว่า SWE-1.7 สำรวจงานง่าย ๆ มากเกินไป และมันเป็นการปรับปรุงแบบที่ปรากฏบนบิลของคุณนานก่อนที่ช่องว่างของเบนช์มาร์กเพียงหนึ่งคะแนนจะปรากฏเสียอีก

Screenshot of Cognition's official SWE-2 announcement blog post, headed 'Introducing SWE-2: Pushing the Pareto Frontier', bylined 09.11.26, showing the opening claim of 50.0% on FrontierCode 1.1 Main within one point of Fable 5.1 while being 64% cheaper, and a cost-versus-solve-rate Pareto chart labelling the medium, high and max effort levels.

เคล็ดลับการฝึกนั่นแหละคือข่าวจริง

ถ้าตัดเรื่องการวางตำแหน่งบนลีดเดอร์บอร์ดออกไป ก็ยังมีงานวิศวกรรมใหม่จริง ๆ อยู่หนึ่งชิ้นตรงนี้ ซึ่งนั่นคือเหตุผลว่าทำไมการเปิดตัวครั้งนี้จึงน่าอ่าน แม้ว่าคุณจะไม่เปิด Devin เลยก็ตาม

Cognition ฝึกทุกระดับของความพยายามในการใช้เหตุผลทั้งสามระดับ — medium, high และ max — ภายในการรัน RL เพียงครั้งเดียว กลไกคือการลงโทษด้วยต้นทุนแบบเชิงเส้นต่อระดับความพยายาม โดยแต่ละระดับถูกปรับจูนให้สอดคล้องกับความชันของเส้นโค้ง Pareto ด้านต้นทุน-ประสิทธิภาพของโมเดลฐาน ณ จุดนั้น เหตุผลของ Cognition ว่าทำไมการลงโทษจึงต้องเป็นแบบเชิงเส้นคือส่วนที่น่าสนใจ: มีเพียงการลงโทษแบบเชิงเส้นเท่านั้นที่ทำให้วัตถุประสงค์ของการฝึกเป็นฟังก์ชันของต้นทุนเฉลี่ยและอัตราการแก้ปัญหาเพียงอย่างเดียว แทนที่จะเป็นสิ่งที่ขึ้นอยู่กับรูปร่างของการกระจาย

วิธีการปกติจะฝึกระดับความพยายามแยกกัน หรือไม่ก็นำ checkpoint ที่มีต้นทุนต่ำกว่ามาติดตั้งเพิ่มในภายหลัง การฝึกสิ่งเหล่านี้เข้าด้วยกันใน run เดียวคือสิ่งที่ทำให้บริษัทอ้างได้ว่ามันพัฒนาแนวหน้าทั้งหมด ไม่ใช่แค่จุดใดจุดหนึ่งบนแนวหน้านั้น การปรับเปลี่ยนเสริม: reward baseline ที่ถ่วงน้ำหนักตามความยาว, การเพิ่มจำนวนสภาพแวดล้อม RL เป็นสามเท่า, overlay สำหรับการทำตามคำสั่ง, และ flywheel ที่ใช้ checkpoint SWE-2 รุ่นก่อนหน้าเพื่อเสริมความแข็งแกร่งให้ตัวตรวจสอบต่อการแฮ็ก reward ในฝั่งการให้บริการ: เคอร์เนล NVFP4 และ FP8 พร้อมการฝึกแบบรู้ปริมาณ (quantization-aware training), โมเดลร่างสำหรับ speculative decoding ชื่อ DSpark ที่ฝึกใหม่เพื่อให้ความยาวที่ยอมรับได้นานขึ้น 15%, และตัวหน่วง prefill ที่ให้ throughput ต่อ GPU เพิ่มขึ้น 10–20% โดยแลกกับการเพิ่มเวลา time-to-first-token ที่แย่ลง

หากคุณทำ post-training สูตรนั้นคือส่วนที่นำไปใช้ต่อได้ของการเปิดตัวครั้งนี้ หากคุณไม่ทำ ข้อสรุปนั้นง่ายกว่า: เหตุผลที่ SWE-2 มีต้นทุนต่ำไม่ใช่เพราะมันเป็นโมเดลที่เล็กกว่า แต่เป็นเพราะต้นทุนในการรันมันถูกเขียนไว้ในฟังก์ชันรางวัล

ถ้าคุณต้องการความสามารถของ Kimi K3 นอก Devin

SWE-2 ไม่ได้อยู่บน OrcaRouter และจะไม่มีวันอยู่ด้วย — เป็นเวตส์แบบปิด ไม่มี API และเผยแพร่เฉพาะบน Devin เท่านั้น ส่วนโมเดลฐานของมันเป็นอีกกรณีหนึ่ง Kimi K3 ถูกจัดเส้นทางบน OrcaRouterในชื่อkimi/kimi-k3 ในราคา $3.00 ต่อ 1 ล้านโทเคนอินพุต และ $15.00 ต่อ 1 ล้านโทเคนเอาต์พุต โดยไม่บวกเพิ่มจากราคาของผู้ให้บริการ มีหน้าต่างบริบท 1 ล้านโทเคน รองรับการเรียกใช้เครื่องมือแบบเนทีฟ รับอินพุตรูปภาพ และควบคุมความลึกของการให้เหตุผลผ่านพารามิเตอร์ระดับบนสุด reasoning_effort แทนการตั้งค่าการสุ่ม

นั่นคือเวอร์ชันที่ตรงไปตรงมาของข้อสรุปเชิงปฏิบัติจากการเปิดตัวครั้งนี้ SWE-2 แสดงให้คุณเห็นว่าการรัน RL ที่ทำได้ดีบน K3 จะเป็นอย่างไรเมื่ออยู่ในจุดสูงสุดของช่วง — การเพิ่มขึ้นจริง 4.5 ถึง 5.8 จุด บวกกับประสิทธิภาพที่เพิ่มขึ้นอย่างมาก ด้วยต้นทุนที่แท้จริง สิ่งที่มันไม่ได้ให้คุณคือโมเดลที่คุณเรียกใช้ได้ ถ้าคุณต้องการให้ความสามารถที่อยู่เบื้องหลังมุ่งไปที่โค้ดของคุณเอง ฮาร์เนสของคุณเอง หรือไปป์ไลน์ของคุณเอง K3 คือส่วนของสแต็กนี้ที่คุณเข้าถึงได้จริง และมันเข้าถึงได้ผ่านปลายทางที่เข้ากันได้กับ OpenAI เพียงหนึ่งเดียว

มันยังเป็นครึ่งที่ปลอดภัยกว่าของการเดิมพันในขณะที่ตัวเลขยังไม่ผ่านการตรวจสอบ เกณฑ์วัดของ SWE-2 เป็นของ Cognition เองและไม่มีใครนอกบริษัททำซ้ำได้ ส่วนของ Kimi K3 ต่างหากที่การเปรียบเทียบนี้พึ่งพาอยู่จริง ๆ — และถ้าคุณกำหนดเส้นทางผ่าน OrcaRouter คุณก็สามารถ วางเชนสำรองไว้ด้านหลังมัน เพื่อให้โมเดลที่คุณกำลังทดลองใช้จะไม่กลายเป็น dependency สำหรับโปรดักชันในวันที่มันทำให้คุณผิดหวัง

Screenshot of the OrcaRouter model page for Kimi K3, showing model ID kimi/kimi-k3, input $3.00 per 1M tokens, output $15.00 per 1M tokens, cache read $0.300, 1M-token context, text and image input, p50 time-to-first-token of 9.85 seconds, and 2,739.4M tokens of traffic over 7 days.

ใครควรลงมือ และสิ่งใดจะทำให้เรื่องนี้ยุติ

หากคุณจ่ายเงินสำหรับ Devin อยู่แล้ว SWE-2 ถือเป็นข่าวดีอย่างชัดเจน: มันกำลังทยอยเปิดให้ใช้กับผลิตภัณฑ์ของคุณ, ถูกกว่าต่องานเมื่อเทียบกับสิ่งที่มันเข้ามาแทนที่, และตัวเลขประสิทธิภาพบ่งชี้ว่าจะสิ้นเปลืองรอบน้อยลงกับงานง่ายๆ ลองใช้กับงานง่ายๆ ต้นคิวของคุณก่อน — การออกแบบระดับความพยายาม (effort-level) หมายความว่าระดับ medium คือจุดที่ความคุ้มค่าด้านต้นทุนอยู่

หากคุณกำลังเลือกโมเดลเขียนโค้ดจากภายนอก ให้รอการประเมินที่เป็นอิสระ ตอนนี้ยังไม่มีเลย: Artificial Analysis ยังไม่มีรายการ SWE-2 และลีดเดอร์บอร์ด FrontierCode ก็เป็นเครื่องมือของ Cognition เอง สามสิ่งที่จะทำให้ได้ข้อสรุป ได้แก่ การรัน SWE-2 บน Terminal-Bench 4 โดยบุคคลที่สาม ซึ่งเป็นแถวที่ตัดสินว่านี่เป็นโมเดลที่ใกล้เคียงระดับแนวหน้าหรือเป็นเพียงโมเดลที่เร็ว การทำซ้ำอย่างอิสระใด ๆ ของช่องว่าง FrontierCode และราคาต่อโทเคน ซึ่งจะต้องให้ Cognition ขายโมเดลนี้นอก Devin — การเปลี่ยนแปลงเพียงอย่างเดียวที่จะทำให้ 64% เทียบเคียงได้กับสิ่งอื่นใดที่คุณได้รับข้อเสนอราคา

จนถึงตอนนั้น สรุปที่ยุติธรรมก็คือสรุปที่ช่องว่างของโมเดลฐานให้คุณอยู่แล้ว SWE-2 คือ Kimi K3 บวกห้าคะแนน ด้วยต้นทุนที่ Cognition ออกแบบไว้ในฟังก์ชันรางวัล นั่นเป็นความสำเร็จที่แท้จริงในการฝึกโมเดล และเป็นข้อตกลงที่ดีจริง ๆ ภายใน Devin มันยังไม่ใช่โมเดลระดับแนวหน้า และเบนช์มาร์กเดียวที่มันดูเหมือนจะเอาชนะทุกอย่างได้ คือเบนช์มาร์กที่เลิกนับไปแล้ว

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube