การ์ดชื่อเรื่องสำหรับ Cognition SWE-2 มีหัวข้อว่า 'Cognition SWE-2' คำบรรยายรองว่า 'โมเดลเขียนโค้ดโดย Cognition ซึ่ง post-trained จาก Kimi K3 ให้บริการภายใน Devin' โดยมีสามการ์ดด้านล่างที่ระบุว่า สร้างโดย Cognition, โมเดลฐาน Kimi K3 2.8T และให้บริการใน Devin Desktop และ CLI
Guides & Insights

Cognition SWE-2: ใครเป็นคนสร้าง มันรันอยู่ในฮาร์เนสใด และตัวเลขจริง ๆ บอกอะไร

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Cognition SWE-2 เป็นโมเดลเขียนโค้ดที่สร้างโดย Cognition บริษัทผู้อยู่เบื้องหลัง Devin และให้บริการอยู่ภายใน Devin แทนที่จะให้บริการผ่าน API ของโมเดล โดยโพสต์เปิดตัวของ Cognition เองระบุว่า SWE-2 เปิดให้ใช้ใน Devin Desktop และ Devin CLI ก่อน จากนั้นจึงทยอยเปิดให้ใช้ใน Devin Web และ Fusion มันผ่านการ post-train ต่อยอดมาจากKimi K3 ซึ่งเป็นโมเดลขนาด 2.8 ล้านล้านพารามิเตอร์ของ Moonshot AI นั่นคือคำตอบทั้งหมดสำหรับคำถามที่คนส่วนใหญ่จริง ๆ กำลังถามเมื่อมาถึงที่นี่ และควรกล่าวไว้ก่อนสิ่งอื่นใด เพราะสัดส่วนที่วัดได้ของการค้นหาที่นำผู้คนมาสู่หน้านี้มีการเพิ่มคำที่สี่เข้ามา — Devin — และโยงโมเดลนี้ให้เป็นของ Devin แทนที่จะเป็น Cognition Devin คือเอเจนต์ที่ Cognition จำหน่าย ส่วน SWE-2 คือโมเดลที่ Cognition ฝึกมาเพื่อรันภายในเอเจนต์นั้น

หน้านี้เป็นหน้าอ้างอิงมากกว่าเป็นเรื่องราวการเปิดตัว SWE-2 วางจำหน่ายเมื่อวันที่ 10 กันยายน 2026 ซึ่งผ่านไปกว่าหนึ่งสัปดาห์แล้ว วันที่นี้มีไว้เพื่อปักหมุดโมเดลให้ถูกเวลา ไม่ใช่เพื่อรายงานเหตุการณ์ เนื้อหาต่อจากนี้คือสิ่งที่ได้รับการบันทึกไว้ ใครเป็นผู้บันทึก และสิ่งที่ยังไม่มีใครตรวจสอบ

ใครเป็นผู้สร้าง SWE-2 และทำไมการระบุแหล่งที่มาจึงคลาดเคลื่อน

ความสับสนนี้ไม่ใช่เรื่องไร้เหตุผล Cognition ไม่ได้ขาย SWE-2 แบบที่ห้องแล็บขายโมเดล API ไม่มีโมเดลการ์ดที่ระบุ context window ไม่มีราคาต่อโทเคนที่เผยแพร่ ไม่มีตัวระบุที่คุณส่งไปใน request body ได้ มีผลิตภัณฑ์อยู่หนึ่งอย่าง — Devin — และโมเดลก็มาพร้อมกับมัน ถ้อยคำของ Cognition เองยิ่งตอกย้ำการหลอมรวมนี้: โพสต์เปิดตัวเขียนจากมุมมองของ Devin ตาราง benchmark ไม่มีคำอธิบายสำหรับใครก็ตามที่ยังไม่ได้อ่านงาน FrontierCode ก่อนหน้าของบริษัท และบรรทัดเรื่องความพร้อมใช้งานเอ่ยชื่อ Devin ถึงสี่ครั้ง แต่เอ่ยชื่อ Cognition เพียงครั้งเดียว — ในบรรทัดชื่อผู้เขียน

พูดตรง ๆ ก็คือ: Cognition สร้าง SWE-2 Cognition สร้าง Devin. สองสิ่งนี้ไม่ใช่สิ่งเดียวกัน แต่ในตอนนี้คุณไม่สามารถมีอันหนึ่งได้โดยไม่มีอีกอัน ทั้งนี้ก็ไม่ใช่ความบังเอิญในการตั้งชื่อเพียงครั้งเดียว Cognition ได้ปล่อยโมเดลวิศวกรรมซอฟต์แวร์หลายรุ่นภายใต้คำนำหน้า SWE — SWE-1.5, SWE-1.6, SWE-1.7 และตอนนี้ SWE-2 โดยมี checkpoint SWE-1.6 Preview ระหว่างทาง — ควบคู่ไปกับเครื่องมือที่เฉพาะเจาะจงกว่า เช่น SWE-grep และ SWE-check คำนำหน้านี้เป็นคำย่อของบริษัทสำหรับวิศวกรรมซอฟต์แวร์ และมีมาก่อนโมเดลทุกตัวในย่อหน้านี้ประมาณหนึ่งปี

ชื่อ: โมเดล ไม่ใช่เกณฑ์มาตรฐาน

นี่คือเหตุผลที่สองที่ผู้ค้นหาผูก SWE-2 ไว้กับเจ้าของผิดคน และมันสมควรได้รับย่อหน้าของตัวเองมากกว่าเป็นเพียงเชิงอรรถ

SWE-bench เป็นเบนช์มาร์ก เป็นการประเมินที่เป็นอิสระซึ่งดูแลโดยทีม SWE-bench โฮสต์อยู่ที่ swebench.com และมีให้ใช้งานในหลายเวอร์ชัน ได้แก่ ชุดข้อมูลต้นฉบับ 2,294 อินสแตนซ์ที่ดึงมาจาก issue จริงบน GitHub รวมทั้งชุดย่อย Verified, Lite, Multilingual และ Multimodal โดยใช้ให้คะแนนเอเจนต์เขียนโค้ดโดยทั่วไป ซึ่งรวมถึง Devin ด้วย — Cognition เผยแพร่รายงานทางเทคนิค Devin-on-SWE-bench ย้อนกลับไปเมื่อเดือนมีนาคม 2024 ซึ่งยังอยู่บนบล็อกของบริษัท

SWE-2 เป็นโมเดลหนึ่ง มันไม่ใช่รุ่นย่อย (edition) ของ SWE-bench และก็ไม่ใช่คำย่อของสิ่งนั้นด้วย ไม่มี SWE-bench 2 อยู่จริง: ตระกูลที่เผยแพร่ครอบคลุม SWE-bench, Verified, Lite, Multilingual และ Multimodal และการกำหนดหมายเลขเวอร์ชันที่มีอยู่นั้นเป็นของชุดย่อยของ benchmark ไม่ใช่ของรุ่นสืบทอดที่มีหมายเลขกำกับ ส่วน benchmark มาตรฐานอ้างอิงของ Cognition สำหรับโมเดลเหล่านี้มีชื่อว่า FrontierCode ซึ่งเป็นเครื่องมือที่แตกต่างออกไปโดยสิ้นเชิง และดังที่หัวข้อถัดไปจะอธิบายว่า เป็นเครื่องมือที่ Cognition เป็นเจ้าของเอง

ถ้าคุณมาที่นี่โดยคาดหวังว่าจะได้เห็นการประเมิน SWE-bench รุ่นที่สอง นั่นคือความเข้าใจผิดทั้งหมด

วันวางจำหน่ายและวิธีการเผยแพร่ SWE-2

โพสต์ประกาศของ Cognition มีบรรทัดระบุผู้เขียนและวันที่ 10 กันยายน 2026 และข้อมูลโครงสร้าง (structured data) ของหน้าเพจเองก็ระบุเวลาที่เผยแพร่เป็น 2026-09-10 ทั้งสองอย่างสอดคล้องกัน SWE-2 เปิดให้ใช้งานใน Devin Desktop และ Devin CLI ในวันนั้น โดยมี Devin Web และ Fusion ตามมาในภายหลัง

นั่นคือช่องทางการเผยแพร่ และมันคือช่องทางการเผยแพร่ทั้งหมด ไม่มีเวตแบบเปิด — ไม่มีอะไรบน Hugging Face จาก Cognition สำหรับโมเดลนี้ — และไม่มีเอนด์พอยต์ที่โฮสต์โดยผู้ขายซึ่งรับตัวระบุ SWE-2 ถ้าฮาร์เนสของคุณเป็นของคุณเอง SWE-2 ไม่ใช่คอมโพเนนต์ที่คุณติดตั้งลงไปในนั้นได้ในวันนี้ ถ้าฮาร์เนสของคุณคือ Devin, SWE-2 ก็อยู่ตรงหน้าคุณแล้ว

สำหรับใครก็ตามที่ต้องการขอบเขตของโมเดลฐานแทนที่จะเป็นของ SWE-2, Kimi K3 เป็นสิ่งที่แยกต่างหากและมีเอกสารประกอบที่ดีกว่า และมันถูกกำหนดเส้นทางบน OrcaRouter ในชื่อ kimi/kimi-k3 — API เดียวสำหรับโมเดลกว่า 200 รายการในราคาตามที่ผู้ให้บริการกำหนดโดยไม่บวกเพิ่ม เรื่องนี้สำคัญตรงนี้ด้วยเหตุผลเฉพาะเจาะจง: ความสามารถพื้นฐานที่ Cognition เริ่มต้นนั้นสามารถเข้าถึงได้อย่างอิสระ แม้ว่าโมเดลที่ผ่านการฝึกภายหลัง (post-trained) จะไม่สามารถเข้าถึงได้

ขอบเขต: สิ่งที่ Cognition บันทึกเป็นเอกสาร และสิ่งที่ไม่ได้บันทึก

หน้าอ้างอิงควรซื่อตรงต่อลักษณะของหลักฐานของตัวเอง และนี่คือจุดที่หลักฐานของ SWE-2 บางเบาที่สุด

• ความพยายามในการให้เหตุผล — สามระดับที่มีการบันทึกไว้: medium, high และ max Cognition ระบุว่าระดับเหล่านี้ทำงานแตกต่างกันโดยการออกแบบ: medium ลงมือทำเร็วขึ้นและรองรับงานง่ายและงานระดับกลาง ขณะที่ high และ max วางแผนมากขึ้น สำรวจโค้ดเบสมากขึ้น และทุ่มให้กับการตรวจสอบมากขึ้น
• การเผยแพร่ — Devin Desktop และ Devin CLI ในตอนเปิดตัว, Devin Web และ Fusion กำลังทยอยเปิดให้ใช้ ไม่มี API, ไม่มีน้ำหนักโมเดล, ไม่มีเส้นทางโฮสต์เอง
• โมเดลฐาน — Kimi K3 ซึ่ง Cognition อธิบายว่าเป็นโมเดลขนาด 2.8T พารามิเตอร์ที่ผ่าน RL อย่างกว้างขวางเพื่อการเขียนโค้ดแบบเอเจนต์มาแล้ว เอกสาร Kimi K3 ระบุว่าโมเดลฐานนี้มีหน้าต่างบริบท 1M โทเคนและความสามารถด้านภาพแบบเนทีฟ
• หน้าต่างบริบท, เอาต์พุตสูงสุด, โมดัลลิตี, จำนวนพารามิเตอร์หลังการฝึก — ไม่ได้เผยแพร่สำหรับ SWE-2 ประกาศของ Cognition ไม่ได้กล่าวถึงสิ่งเหล่านี้เลย และไม่มีหน้าอื่นใดของ Cognition ที่เติมช่องว่างนี้

ความแตกต่างในแถวสุดท้ายนั้นไม่ใช่การจู้จี้เรื่องเล็กน้อย หน้าต่างขนาดหนึ่งล้านโทเคนของ Kimi K3 เป็นข้อเท็จจริงเกี่ยวกับ Kimi K3 เอง Cognition ไม่ได้ระบุว่า SWE-2 สืบทอดคุณสมบัตินี้มา และการฝึกภายหลังด้วยสูตรที่แตกต่างออกไปก็เป็นความเปลี่ยนแปลงประเภทที่สามารถส่งผลต่อสิ่งที่โมเดลยอมรับได้พอดี หากคุณต้องการตัวเลขหน้าต่างบริบทเพื่อใช้ในการวางแผน ตัวเลขที่คุณตรวจสอบได้เป็นของโมเดลฐาน และคุณควรถือว่าของ SWE-2 เป็นค่าที่ไม่ทราบ ไม่ใช่สันนิษฐานว่าทั้งสองตรงกัน

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

ตารางอัตราค่าบริการ ในสกุลเงินเดียวที่ Cognition ใช้เสนอราคา

ไม่มีราคาต่อโทเคนสำหรับ SWE-2 เพราะไม่มีเอนด์พอยต์ของ SWE-2 ข้อกล่าวอ้างเรื่องค่าใช้จ่ายของ Cognition ถูกกำหนดเป็นหน่วยที่แตกต่างออกไป: กล่าวว่า SWE-2 ทำได้ภายในหนึ่งจุดจาก Claude Fable 5.1 บน FrontierCode 1.1 Main — 50.0% เทียบกับ 50.9% — ในขณะที่ถูกกว่า 64% อ่านหน่วยให้ดี ตัวเลข 64% คือค่าเฉลี่ยดอลลาร์สหรัฐที่ใช้จ่ายต่อการโรลเอาต์หนึ่งครั้งบน FrontierCode ซึ่งเป็นตัวเลขระดับงานที่รวมโมเดล ฮาร์เนส สแคฟโฟลดิง และสแต็กการให้บริการของ Cognition ไว้ในใบแจ้งหนี้เดียว มันไม่ใช่อัตราต่อโทเคน และไม่สามารถนำไปเปรียบเทียบกับอัตราต่อโทเคนได้

ตารางราคาที่มีอยู่จริงคือของ Devin บนหน้าอัตราราคาของ Devin ซึ่งอ่านเมื่อวันที่ 28 กันยายน 2026: ฟรีในราคา $0, Pro ราคา $20 ต่อเดือน, Max ราคา $200 ต่อเดือน, Teams ราคา $80 ต่อเดือน บวกอีก $40 ต่อที่นั่งนักพัฒนาเต็มหนึ่งที่นั่ง บรรทัด SWE-2 อยู่ใน Pro และมีวันที่กำกับ — “ใช้ SWE-2 ฟรี — ฟรีใน Devin Desktop และ CLI ถึงวันที่ 10 ตุลาคม 2026” นั่นคือช่วงโปรโมชันที่เหลือเวลาประมาณสองสัปดาห์ และเป็นตัวเลข SWE-2 เพียงรายการเดียวบนหน้านั้นที่มีความอ่อนไหวต่อเวลาอย่างแท้จริง: ต้นทุนของโมเดลภายใน Devin หลังวันที่ 10 ตุลาคมไม่ได้ระบุไว้ที่นั่น

ตัวเลขประสิทธิภาพของ Cognition คุ้มค่าที่จะยกมาอ้างอิงควบคู่กับข้อกล่าวอ้างเรื่องต้นทุน และเป็นข้อมูลที่ผู้ขายรายงานเช่นเดียวกับทุกสิ่งบนหน้านี้ บน FrontierCode 1.1 Main, SWE-2 ที่ความพยายามระดับปานกลางได้คะแนนสูงกว่า SWE-1.7 ขณะที่ใช้จำนวนรอบน้อยลง 58% และมีค่าใช้จ่ายน้อยลง 81% โดยเฉลี่ย จำนวนขั้นตอนเฉลี่ยต่อการรันลดลงจาก 127 บน SWE-1.7 เหลือ 53 ที่ระดับปานกลาง, 80 ที่ระดับสูง และ 98 ที่ระดับสูงสุด และค่ามัธยฐานของการแก้ไขโค้ดจริงครั้งแรกเลื่อนจากขั้นตอนที่ 48 ไปเป็นขั้นตอนที่ 18

เบนช์มาร์ก พร้อมฮาร์เนสที่แนบมาด้วย

คะแนนวิศวกรรมซอฟต์แวร์มีความอ่อนไหวต่อ scaffold ที่ใช้สร้างผลลัพธ์เป็นพิเศษ ดังนั้นตัวเลขที่ไม่มี harness ของมันก็ไม่ใช่ตัวเลขที่สมบูรณ์ Cognition ระบุนโยบาย harness ของตนไว้ในภาคผนวกวิธีการของประกาศว่า ผลลัพธ์จะรายงานจากแหล่งสาธารณะหากมี มิฉะนั้นจะรันบนกรอบการประเมินภายในของ Cognition โดยใช้ harness ที่แต่ละโมเดลถูกพัฒนาขึ้นเป็นหลัก — Claude Code สำหรับโมเดล Anthropic, Codex สำหรับโมเดล OpenAI, Grok Build สำหรับโมเดล xAI และ Devin CLI สำหรับโมเดล open-weight สำหรับทุกโมเดล Cognition รายงานคะแนนที่ดีที่สุดจากการตั้งค่า reasoning effort ต่างๆ

ผลที่ตามมามีสองประการ และทั้งสองประการควรกล่าวถึงพร้อมกับตัวเลขเหล่านั้น ประการแรก หลายแถวไม่ใช่การเปรียบเทียบแบบเทียบเคียงกันโดยตรง ตัวเลขของ Fable 5.1 ที่สร้างใน Claude Code กับตัวเลขของ Kimi K3 ที่สร้างใน Devin CLI เป็นการวัดระบบเอเจนต์สองระบบที่แตกต่างกัน ไม่ใช่สองโมเดลในสภาพแวดล้อมทดสอบที่เป็นกลาง ประการที่สอง "คะแนนดีที่สุดจากการตั้งค่า effort ทุกระดับ" หมายความว่าแต่ละช่องคือกรณีที่ดีที่สุดของโมเดลแต่ละตัว ไม่ใช่การตั้งค่าที่จับคู่กัน การเปรียบเทียบที่ตรึงค่า effort ให้คงที่จะให้ผลที่แตกต่างออกไป และ Cognition ก็ไม่ได้เผยแพร่การเปรียบเทียบเช่นนั้น

ทั้งสี่แถวด้านล่างเป็นข้อมูลที่รายงานโดยผู้ขายและยังไม่ผ่านการตรวจสอบ

• FrontierCode 1.1 Main — SWE-2 50.0%, Kimi K3 44.2%, Grok 4.6 48.0%, Claude Fable 5.1 50.9%, GPT-5.6 Sol 47.5%, GPT-6 Astra 53.3%, SWE-1.7 42.0% นี่คือแถวไฮไลต์ และ FrontierCode เป็นเบนช์มาร์กของ Cognition เอง — Cognition ร่างโจทย์ร่วมกับผู้ดูแลโอเพนซอร์สมากกว่า 20 คน ดูแลลีดเดอร์บอร์ด และให้คะแนนผลงานที่ส่งเข้ามา ไม่มีสิ่งใดในนั้นทำให้ตัวเลขผิด ทั้งหมดนี้ควรอยู่ในประโยคที่คุณนำตัวเลขเหล่านั้นไปกล่าวซ้ำ
• DeepSWE 1.1 — SWE-2 73.0%, Kimi K3 68.5%, Grok 4.6 67.5%, Claude Fable 5.1 67.4%, GPT-5.6 Sol 72.7%, GPT-6 Astra 74.1%, SWE-1.7 37.7% แถวที่ SWE-2 เอาชนะโมเดลระดับแนวหน้าได้อย่างเต็มตัวและน่าเชื่อถือที่สุด
• Terminal-Bench 2.1 — SWE-2 92.8%, Kimi K3 88.3%, Grok 4.6 88.4%, Claude Fable 5.1 91.4%, GPT-5.6 Sol 88.8%, GPT-6 Astra 89.9%, SWE-1.7 81.5% ตัวเลขที่ดูดีที่สุดของ SWE-2 และฉบับปัจจุบันของ Terminal-Bench ไม่ใช่ 2.1
• Terminal-Bench 4 — SWE-2 27.3%, Kimi K3 21.5%, Grok 4.6 20.3%, Claude Fable 5.1 55.8%, GPT-5.6 Sol 37.3%, GPT-6 Astra 57.9%, SWE-1.7 7.6% แถวที่ถูกอ้างอิงน้อยที่สุด และเป็นแถวที่โมเดลตามหลังระดับแนวหน้าอยู่ราว 28 จุด

การเปรียบเทียบนี้ยังต้องการบริบทเพิ่มอีกหนึ่งส่วน เพราะมันอธิบายว่าทำไมแถวของโมเดลแนวหน้าจึงมีรูปร่างที่ไม่ปกติ เชิงอรรถของ Cognition เองในแผนภูมิระบุว่าการตั้งค่า max-effort ของ Fable 5.1 บน FrontierCode 1.1 Main ทำคะแนนได้ 50.3% ที่ราคา $12.83 ต่องาน — ต่ำกว่าการตั้งค่า medium ของตัวเองที่ 50.9% และ $3.28 ความพยายามที่มากขึ้นกลับได้คะแนนที่ต่ำลงในต้นทุนที่สูงขึ้นราวสี่เท่า นั่นคือเส้นโค้งของโมเดลแนวหน้าที่บิดย้อนกลับมาหาตัวเอง และเป็นส่วนหนึ่งที่ทำให้ 50.0% กับ 50.9% ใกล้กันมากกว่าที่ตัวเลขสองตัวนี้บอกไว้เพียงลำพัง

ตัวเลขความน่าเชื่อถือ

ส่วนความน่าเชื่อถือแยกต่างหากของ Cognition เป็นส่วนของการเปิดตัวที่ไม่เกี่ยวข้องกับลีดเดอร์บอร์ดเลย และรายงานว่า SWE-2 ผ่านพรอมต์ด้านโฆษณาชวนเชื่อและการเซ็นเซอร์ 98.0% โดยรวม — 99.8% ในภาษาอังกฤษ 95.2% ในภาษาจีนตัวย่อ และ 99.1% ในภาษาจีนตัวเต็ม — และการประเมินความเปราะบางที่ขึ้นกับบริบทของมันไม่พบเงื่อนไขการวางกรอบใดที่ก่อให้เกิดการเปลี่ยนแปลงที่มีนัยสำคัญทางสถิติสำหรับโมเดลใด ๆ ที่ทดสอบ สิ่งเหล่านั้นเป็นการตัดสินของ Cognition ซึ่งสร้างขึ้นด้วยผู้ตัดสิน GPT-5.6 Luna บนชุดคำถาม 145 ข้อ และเป็นการรายงานโดยผู้ขายในความหมายเดียวกับที่เกณฑ์มาตรฐานเป็น

บทวิเคราะห์อิสระ: ยังไม่มีในตอนนี้

ณ วันที่ 28 กันยายน 2026 SWE-2 ไม่มีรายการบน Artificial Analysis การค้นหาชื่อในดัชนีโมเดลไม่ให้ผลลัพธ์ใด ๆ และการเรียกหน้าโมเดลโดยตรงได้ 404 กระดานคะแนนเดียวที่มี SWE-2 คือ FrontierCode ซึ่งเป็นของ Cognition นั่นทำให้การเปิดตัวครั้งนี้เหลือเพียงตัวเลขที่ผู้ขายรายงานเองและไม่มีอย่างอื่น ซึ่งไม่ใช่การวิจารณ์ตัวเลขเหล่านั้น — แต่เป็นข้อความเกี่ยวกับว่าผู้อ่านสามารถตรวจสอบตัวเลขเหล่านั้นได้มากเพียงใด

สองสิ่งเฉพาะเจาะจงจะทำให้เรื่องนี้กระจ่าง และทั้งสองอย่างยังไม่มีในตอนนี้ การรัน SWE-2 บน Terminal-Bench 4 โดยบุคคลที่สามจะตัดสินได้ว่านี่คือโมเดลที่ใกล้ระดับแนวหน้าซึ่งบังเอิญราคาถูก หรือเป็นโมเดลเร็วที่บังเอิญเป็นผู้นำในรุ่นที่ปลดระวางแล้ว และการทำซ้ำอย่างอิสระใด ๆ ของช่องว่าง FrontierCode จะบอกคุณว่าความได้เปรียบหนึ่งจุดเหนือ Fable 5.1 เป็นคุณสมบัติของโมเดลหรือเป็นคุณสมบัติของเครื่องมือวัด

ต่างจากโมเดลของ Cognition เอง Artificial Analysis มี Kimi K3 — และตัวเลขของ Kimi K3 เป็นของบุคคลที่สาม ซึ่งทำให้โมเดลฐานเป็นครึ่งที่มีหลักฐานดีกว่าในสแต็กนี้ ความไม่สมดุลนี้คือรูปร่างในทางปฏิบัติของ SWE-2 ในทุกวันนี้: โพสต์เทรนคือส่วนที่น่าสนใจและเป็นส่วนที่ตรวจสอบได้น้อยที่สุด; โมเดลฐานคือส่วนที่มีเอกสารและเป็นส่วนที่คุณเรียกได้จริง

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

การใช้ SWE-2 และสิ่งที่ควรทำในระหว่างที่ยังไม่ผ่านการตรวจสอบ

หากคุณจ่ายเงินสำหรับ Devin อยู่แล้ว การตัดสินใจก็เป็นเรื่องง่าย และไม่ขึ้นอยู่กับข้อควรระวังใด ๆ ข้างต้นเลย SWE-2 อยู่ในผลิตภัณฑ์ของคุณแล้ว Cognition กล่าวว่ามีต้นทุนต่องานต่ำกว่าโมเดลที่มันเข้าแทนที่ และตัวเลขด้านประสิทธิภาพ — จำนวนรอบน้อยลง 58% ต้นทุนเฉลี่ยต่ำลง 81% การแก้ไขครั้งแรกโดยมัธยฐานอยู่ที่ขั้นตอนที่ 18 แทนที่จะเป็นขั้นตอนที่ 48 — บ่งบอกถึงโมเดลที่ทำให้คุณเสียเวลากับงานทั่วไปน้อยลง เริ่มใช้งานที่ระดับความพยายามปานกลางกับงานง่าย ๆ ปลายแถวคิวของคุณ ซึ่งเป็นจุดที่การออกแบบระดับความพยายามของ Cognition เองวางผลตอบแทนด้านต้นทุนไว้

หากคุณกำลังเลือกโมเดลเขียนโค้ดจากภายนอก Devin จุดยืนที่ตรงไปตรงมาคือ SWE-2 ไม่ใช่ตัวเลือกที่คุณจะประเมินได้ เพราะไม่มีอะไรให้เรียกใช้งานเลย ไม่มีตัวระบุ ไม่มีราคาต่อโทเคน และไม่มีเอนด์พอยต์ สิ่งที่คุณประเมินได้คือโมเดลฐาน

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

Kimi K3 ถูกให้บริการผ่านเส้นทางบน OrcaRouter ในราคา $3.00 ต่อ 1M โทเคนอินพุต และ $15.00 ต่อ 1M โทเคนเอาต์พุต โดยไม่มีการบวกเพิ่มจากอัตราของผู้ให้บริการ พร้อมหน้าต่างบริบท 1M โทเคน การเรียกใช้เครื่องมือแบบเนทีฟ การรับอินพุตรูปภาพ และการควบคุมระดับความพยายามในการคิดวิเคราะห์ระดับสูงสุด นั่นคือครึ่งที่เข้าถึงได้ของการเปิดตัวครั้งนี้: ความสามารถที่ Cognition นำมาฝึกต่อยอด ซึ่งเข้าถึงได้ผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงจุดเดียว แทนที่จะเป็นผลิตภัณฑ์เอเจนต์ของเจ้าของรายใดรายหนึ่ง และเนื่องจากไม่ว่าจะทางไหนก็เป็นดินแดนที่ยังไม่ผ่านการตรวจสอบ คุณจึงวางเชนสำรองไว้ข้างหลังมันได้ เพื่อให้โมเดลที่คุณกำลังทดลองใช้ไม่กลายเป็นสิ่งที่โปรดักชันต้องพึ่งพาในวันที่มันทำให้คุณผิดหวัง

สิ่งที่ SWE-2 บอกคุณ หากคุณอ่านมันเป็นหลักฐานแทนที่จะเป็นหน้าโปรโมตผลิตภัณฑ์ คือสิ่งที่แคบกว่าและมีประโยชน์กว่าพาดหัวข่าว: การรัน RL ที่ทำได้ดีบน Kimi K3 ทำให้ระดับขยับขึ้นราวห้าจุดในสี่เบนช์มาร์กโดยไม่เปลี่ยนรูปร่าง และใช้เทิร์นน้อยลง 58% ในการทำเช่นนั้น นั่นเป็นผลลัพธ์จริงภายใน Devin แต่มันยังไม่ใช่ผลลัพธ์ที่ใครนอก Cognition ทำซ้ำได้ และเบนช์มาร์กเดียวที่ SWE-2 ดูเหมือนจะเอาชนะทุกอย่างได้ คือเบนช์มาร์กที่วงการนี้เลิกให้คะแนนไปแล้ว

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube