การ์ดชื่อเรื่องที่ถูกสร้างขึ้น มีหัวข้อว่า 'การปรับปรุงตนเองแบบเรียกซ้ำ อธิบายให้เข้าใจ' พร้อมคำบรรยายรองว่า 'วงปิดคือวงที่มีการให้คะแนน และการให้คะแนนคือคำถามทั้งหมด' อยู่เหนือแถวการ์ดมุมโค้งสามใบที่อ่านว่า 'การคาดการณ์ที่ลงทะเบียนไว้ก่อนการรัน', 'ค่าพื้นล่างแบบ Null ที่วัดจริง ไม่ใช่สันนิษฐาน' และ 'ความล้มเหลวก็ถูกปล่อยออกไป รวมถึงของแชมป์ด้วย'; ส่วนท้ายอ่านว่า 'ตัวอย่างที่ทำจริง: RSI-Jev v6.0-VL, เผยแพร่ 2026-10-06; บันทึกของโครงการเอง, อ่านเมื่อ 2026-10-08.' พร้อมไอคอนเส้นแบนแบบมินิมัลและโลโก้ OrcaRouter ที่คอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

การพัฒนาตนเองแบบเรียกซ้ำ อธิบายผ่านโปรเจกต์ที่ทำสิ่งนี้ได้จริง

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

“การปรับปรุงตนเองแบบเรียกซ้ำ” (Recursive self-improvement) เป็นหนึ่งในวลีที่ส่วนใหญ่ถูกใช้เพื่อหมายถึงความรู้สึกอย่างหนึ่ง เมื่อนิยามโดยไม่ใส่ความขลัง มันแคบกว่านั้นและน่าสนใจกว่า: ระบบที่เสนอการทดลองถัดไปของตัวเอง รันมัน และเก็บหรือเลิกใช้ผลลัพธ์ตามกฎที่กำหนดไว้ล่วงหน้า โดยผลลัพธ์นั้นป้อนกลับไปสู่รอบถัดไป การเรียกซ้ำไม่ใช่เวทมนตร์และไม่ได้ไร้ขอบเขต — มันคือลูปที่มีฟังก์ชันให้คะแนน และคุณภาพของมันถูกกำหนดทั้งหมดโดยความซื่อสัตย์ในการนำฟังก์ชันให้คะแนนนั้นไปใช้ RSI-Jev โครงการเปิดของบุคคลที่สามที่สร้างโมเดลการตัดสินใจแบบ System One สไตล์ Jev เป็นกรณีที่หาได้ยากซึ่งคุณอ่านลูปได้แทนที่จะเถียงกันเรื่องมัน: ทุกสมมติฐาน ทุกแขนที่ล้มเหลว และทุกการปล่อยเวอร์ชัน ถูกเผยแพร่พร้อมตัวเลขของมัน และรีโพซิทอรีก็ลงวันที่วันต่อวัน โมเดลที่หน้านี้ใช้เป็นตัวอย่างประกอบคือ RSI-Jev v6.0-VL โมเดลตัดสินใจแบบมีชนิดข้อมูลขนาด 4B ที่เผยแพร่เมื่อ 2026-10-06 ซึ่งอยู่ในสัปดาห์ล่าสุด มันไม่ใช่ Jev ของ TypeSafe และไม่มีความเกี่ยวข้องกับ TypeSafe AI — บรรทัดสัญญาอนุญาตของโครงการเองระบุไว้ตรงนั้นเลย และสิ่งที่เราให้บริการที่ OrcaRouter คืออีกตัวหนึ่ง typesafe/jev-1.13 บนเอนด์พอยต์ systemone ของเรา

ขออธิบายให้ชัดหนึ่งเรื่องก่อนที่คำว่า “self-improving” จะทำหน้าที่ใด ๆ ตามด้วยวันที่หนึ่ง นี่ไม่ใช่โมเดลที่เขียนตัวเองใหม่โดยไม่มีขีดจำกัด และไม่มีอะไรในหน้านี้ที่ควรถูกอ่านเช่นนั้น ลูปที่พูดถึงนี้เขียนสูตรใหม่: มันเสนอการเปลี่ยนแปลงการฝึก บันทึกว่าคาดหวังให้การเปลี่ยนแปลงนั้นทำอะไร ใช้เวลา GPU แล้วจากนั้นก็เก็บการเปลี่ยนแปลงไว้หรือบันทึกว่าเหตุใดจึงแพ้ โมเดลนี้เป็นทาวเวอร์ Qwen3.5-4B-Base ที่มีหัวตัดสินใจซึ่งผ่านการฝึก — สถาปัตยกรรมคงที่ที่ฝึกด้วยสคริปต์การฝึกคงที่ โดยการค้นหาเกิดขึ้นบนข้อมูล วัตถุประสงค์ และขั้นตอน ลูปนี้ทำการทดลองของตัวเองและปลดระวางแชมป์ของตัวเอง มนุษย์เป็นผู้ตัดสินว่าอะไรคุ้มค่าที่จะวัด และวันที่: v6.0-VL เผยแพร่เมื่อ 2026-10-06 และโครงการได้เผยแพร่รุ่นถัดไปอีกตั้งแต่ตอนนั้น — สายการออกรุ่นขยับประมาณทุกวัน และตัวเลขในหน้านี้เป็นตัวเลขที่ผูกกับรุ่นที่ระบุชื่อไว้ตรงนี้ โดยลงวันที่ตามที่อ่านมา นั่นเป็นสิ่งที่ควรพูดไว้ตั้งแต่ต้นในหน้าที่มีหัวข้อเกี่ยวกับลูปที่ยังคงทำงานอยู่

ความหมายของคำนั้นกล่าวอย่างตรงไปตรงมา

ถ้าถอดวลีนั้นให้เหลือแต่แก่น จะมีสามส่วนด้วยกัน ซึ่งทั้งหมดล้วนเป็นเรื่องธรรมดา ๆ ส่วนแรกคือพื้นที่การค้นหา (search space): เซตของสิ่งต่าง ๆ ที่อาจถูกเปลี่ยนแปลงได้ ส่วนที่สองคือตัวให้คะแนน (scorer): สิ่งที่บอกว่าการเปลี่ยนแปลงหนึ่ง ๆ ช่วยได้หรือไม่ ส่วนที่สามคือบันทึก (record): สิ่งที่ถูกลอง สิ่งที่เกิดขึ้น และสิ่งที่ถูกโยนทิ้งไป ระบบหนึ่งกำลังทำการพัฒนาตนเองแบบเรียกซ้ำ (recursive self-improvement) เมื่อผลลัพธ์ของรอบที่ N กลายเป็นอินพุตของรอบที่ N+1 ในทั้งสามส่วนนั้น โดยไม่ต้องมีมนุษย์มาคิดค้นพื้นที่การค้นหาใหม่หรือตัดสินเกณฑ์ (threshold) ใหม่ในแต่ละครั้ง

สิ่งที่งานเขียนส่วนใหญ่ในหัวข้อนี้มองข้ามคือส่วนที่สอง และนั่นคือที่ซึ่งคำถามทั้งหมดดำรงอยู่ ลูปที่มีตัวให้คะแนนอ่อนแอจะปรับให้ตัวให้คะแนนนั้นเหมาะสม มันจะสร้างเส้นที่เพิ่มขึ้นแบบโมโนโทนและระบบที่เรียนรู้รูปร่างของการสอบของตัวเอง ความล้มเหลวนั้นไม่จำเป็นต้องมีเจตนาร้ายหรือบั๊ก — มันคือสิ่งที่เกิดขึ้นโดยปริยายเมื่อตัวเลขเดียวกันทำหน้าที่ทั้งคัดเลือกและรายงาน ดังนั้น เมื่อคุณอ่านข้อกล่าวอ้างว่าระบบใดระบบหนึ่งพัฒนาตนเองได้ คำถามที่มีประโยชน์จึงไม่เคยใช่ "มันดีขึ้นแค่ไหน" แต่คือ "ใครตั้งมาตรฐาน เมื่อไหร่ และมาตรฐานนั้นขยับได้หรือไม่หลังจากที่เห็นผลลัพธ์แล้ว"

เวอร์ชันยอดนิยมของแนวคิดนี้ — ฉบับที่ติดอันดับคำค้นนี้ในปัจจุบัน — มักมองไปข้างหน้าเป็นหลัก: บทความของ Wikipedia อธิบายถึงระบบที่เขียนโค้ดของตัวเองใหม่ไปสู่ "การระเบิดของสติปัญญา" และการกล่าวถึงในวงกว้างมักเป็นเรื่องว่าไทม์ไลน์นั้นใกล้เข้ามาหรือไกลออกไปกว่าที่คาดการณ์ไว้ นั่นเป็นข้อโต้แย้งที่สมเหตุสมผล และไม่อาจตอบได้ด้วยหลักฐานที่ใครก็ตามมีอยู่ในปัจจุบัน สิ่งที่ตอบได้คือคำถามที่เล็กกว่า นั่นคือว่า วงปิดแบบที่อธิบายไว้ข้างต้นสามารถสร้างขึ้นและยึดตามกฎของตัวเองได้ในตอนนี้หรือไม่ สำหรับเรื่องนั้น โครงการหนึ่งที่มีอาร์ติแฟกต์สาธารณะย่อมเหนือกว่าการคาดเดาเป็นเวลาหนึ่งทศวรรษ และนี่คือสิ่งที่เนื้อหาส่วนที่เหลือของหน้านี้พูดถึง

ปิด ไม่ใช่เพียงการวนซ้ำ: ห้ากลไก

การที่ลูปหนึ่งวนซ้ำไม่ได้หมายความว่ามันเป็นวงจรปิด ไปป์ไลน์อัตโนมัติจำนวนมากวนซ้ำโดยไม่เคยเป็นวงจรปิด เพราะไปป์ไลน์ที่ปรับเกณฑ์ของตนได้หลังจากเห็นผลลัพธ์กำลังทำสิ่งที่ต่างกันโดยสิ้นเชิงจากไปป์ไลน์ที่ทำเช่นนั้นไม่ได้ กฎของ RSI-Jev เองก็ระบุความแตกต่างนี้อย่างชัดเจนเป็นพิเศษ และสามารถอ่านได้ในฐานะคำนิยามมากกว่าจะเป็นแถลงการณ์ ห้าข้อในนั้นทำงานส่วนใหญ่

การคาดการณ์จะถูกลงทะเบียนไว้ก่อนการรัน สมมติฐานจะถูกเขียนบันทึกไว้พร้อมกับตัวเลขที่คาดว่าจะขยับ และขยับไปเท่าใด ก่อนที่จะใช้เวลาบน GPU เวอร์ชันที่ทำไม่ถึงเกณฑ์ที่ตัวเองตั้งไว้จะถูกปล่อยออกไปในฐานะความล้มเหลว แทนที่จะถูกตัดใหม่เงียบ ๆ นี่คือกลไกที่หยุดยั้งไม่ให้วงจรนี้กลายเป็นเครื่องจักรสำหรับเขียนคำอธิบายย้อนหลัง และมันมีราคาที่ต้องจ่ายจริง ๆ: บันทึกนี้มีรายการที่เนื้อหาทั้งหมดมีเพียงว่าใครบางคนคิดผิดและถูกบันทึกไว้

พื้นเสียงรบกวนของสมมติฐานว่างนั้นวัดเอา ไม่ใช่สันนิษฐาน ทีมรันกลุ่มทดลองที่พิสูจน์ได้ว่าเหมือนกับกลุ่มควบคุมทุกประการ — ตรวจสอบด้วยเอกลักษณ์ของออบเจ็กต์ก่อนใช้เวลา GPU ใด ๆ — และการกระจายระหว่างกลุ่มเหล่านั้น คือ ระดับพื้นเสียงรบกวน ความแตกต่างที่เล็กกว่าพื้นนั้นไม่ใช่ผลลัพธ์ ไม่ว่ามันจะดูเหมือนอะไรก็ตาม เกณฑ์ของโครงการเองสะท้อนเรื่องนี้: บนชุดทดสอบภายใน ค่าขีดเริ่มคือ +0.006 โดยมีค่าเบี่ยงเบนมาตรฐานต่อ seed บนเบนช์มาร์กเดียวที่ 0.011–0.016 ดังนั้นความแตกต่างบนเบนช์มาร์กเดียวที่ต่ำกว่านั้นจึงไม่ถือเป็นข้อค้นพบ เสียงรบกวนส่วนใหญ่ในวงการนี้ถูกวัด ไม่ใช่ทางสถิติ

ชุดข้อมูลที่กันไว้จะถูกใช้จนหมดเมื่อถูกอ่าน การเปิดตัวแต่ละครั้งอ่านชุดที่กันไว้เพียงครั้งเดียว ดังนั้นสองการเปิดตัวจึงยังเปรียบเทียบกันได้อย่างเป็นธรรม — และเนื่องจากการอ่านมันคือการใช้มันจนหมด การเปิดตัวแต่ละครั้งจึงตรึงการเปรียบเทียบของครั้งถัดไปไว้ ล้อยคำของโครงการเองก็ควรค่าแก่การคงไว้ตามเดิม: ชุดที่กันไว้ "ถูกกันออกจากการฝึก ไม่ได้ถูกปิดผนึกจากการค้นหา" มันเป็นการตรวจสอบการท่องจำ ไม่ใช่การรับประกันความใหม่ และตัวเลขของชุดทดสอบเองก็มีช่องโหว่อยู่ ซึ่งโครงการได้เผยแพร่ออกมา: งานภายในชิ้นหนึ่งทับซ้อนกับแถวข้อมูลฝึกหลายร้อยแถว ดังนั้นตั้งแต่ v6.0-VL เป็นต้นมา ชุดทดสอบจึงถูกรายงานโดยไม่มีงานนั้น — 0.770 — และค่า 0.764 ก่อนหน้าของ v5.0-VL ก็ถูกระบุใหม่เป็น 0.763 โดยไม่มีงานนั้น การระบุใหม่นี้คือประเด็นสำคัญ ตัวเลขหนึ่งกำลังพองเกินจริง พบสาเหตุแล้ว และการ์ดของการเปิดตัวที่เก่ากว่าก็ได้รับการแก้ไข แทนที่จะปล่อยไว้เฉย ๆ

ความล้มเหลวก็ถูกส่งออกไปด้วย รวมถึงความล้มเหลวที่สังหารแชมป์ของโครงการเอง ตัวเลขพาดหัวของที่เก็บโค้ด ซึ่งอ่านเมื่อ 2026-10-08 ล้วนสอดคล้องเป็นชุดเดียวกัน: แปดรีลีสในสิบสามวัน และการทดลองหลายร้อยรายการที่เขียนสรุปไว้โดยรวมความล้มเหลวเข้าไปด้วย ผลลัพธ์เชิงลบถูกมองว่าเป็นตัวผลิตภัณฑ์เอง คู่มือการมีส่วนร่วมพูดตรง ๆ ถึงเหตุผลข้อนี้ — ส่วนที่แพงของการค้นหาไม่ใช่การรันผู้ชนะ แต่คือการรันผู้แพ้ ดังนั้นผลลัพธ์เชิงลบที่วัดมาเป็นอย่างดีจากภายนอกจึงตัดกิ่งหนึ่งทิ้งไป และมีค่ามากกว่าผลบวกเล็ก ๆ

ห่วงโซ่รีลีสคือโปรเจกต์หนึ่งการ์ดต่อหนึ่งรีลีส ทั้งหมดอยู่บนสาขาหลักอย่างถาวร การ์ดแต่ละใบเก็บตัวเลขของรีลีสตัวเอง ดังนั้นความเร็วและการปรับเทียบของเวอร์ชันหนึ่งจะไม่เขียนทับของอีกเวอร์ชัน โปรเจกต์ระบุเหตุผลไว้ตรง ๆ ว่า ห่วงโซ่นั้นเป็นวิธีเดียวที่จะเห็นได้ว่าลูปที่พัฒนาตัวเองกำลังดีขึ้นหรือไม่ ทุกอย่างอื่น — สูตร สคริปต์ สแตกที่ปักหมุด — เก็บเฉพาะรีลีสปัจจุบัน เพราะกฎตรงกันข้ามจะทำให้บอกไม่ได้ว่าอะไรคือปัจจุบัน เช็กพอยต์ที่เผยแพร่แล้วมีโค้ดของตัวเองติดมาด้วย เพื่อให้รีลีสเก่ายังรันได้โดยไม่ต้องใช้สาขาเก่า

A screenshot of the subject project's own GitHub repository page, Shanghua-Gao / RSI-Jev, showing the repository description 'Typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents - checkpoints, the code that produced them, and every version that failed', the sidebar counters 80 stars, 5 forks and 1 watching, 198 commits and 8 releases, the newest release headed 'RSI-Jev v6.1-VL 4B', an MIT license line, the topic tags ai-agents, autonomous-research, decision-model, jev, recursive-self-improvement, system-one and typed-decisions, and the merge commit 'Merge pull request #33 from Shanghua-Gao/release-v6.1-vl' at the top of the commit list.

สิ่งใดที่วินัยต้องแลกมา และสิ่งใดที่วินัยแลกมาได้

สองเรื่องราวจากบันทึกคือน้ำหนักถ่วงที่ซื่อตรงต่อคำว่า "self-improving" เพราะทั้งสองเป็นกรณีที่กฎของลูปเองทำให้งานช้าลงและดีขึ้นในเวลาเดียวกัน

อันแรกคือบั๊กที่อยู่เบื้องหลัง v1.0 การค้นพบมันต้องใช้ผลลัพธ์เชิงลบที่ลงทะเบียนไว้ถึงเจ็ดรายการ ทั้งเจ็ดรายการเป็นการแก้ไขฝั่งออปติไมเซอร์ที่ลดความไม่เสถียรในการเทรนลงโดยไม่ได้กำจัดมันออกไป เพราะสาเหตุคือข้อผิดพลาดด้านความแม่นยำที่ไม่ได้อยู่ใกล้กับออปติไมเซอร์เลย — และการแก้ไขในที่สุดก็ใช้เพียงบรรทัดเดียว ไม่มีสักรายการเดียวในทั้งเจ็ดที่คุ้มค่าจะตีพิมพ์ด้วยตัวเอง เมื่อรวมกันแล้ว พวกมันคือสิ่งที่ทำให้ค้นพบสาเหตุได้เลย และนั่นคือข้อโต้แย้งทั้งหมดสำหรับการลงทะเบียนและเก็บผลลัพธ์เชิงลบไว้: คุณค่าของพวกมันอยู่ที่การรวมกัน ไม่ใช่รายตัว

เรื่องที่สองไม่ค่อยน่าชื่นชมนัก และโครงการก็ยังเผยแพร่มันอยู่ดี ในเชิงอรรถ อาร์มหนึ่งในช่วงแรกไม่ผ่านเกณฑ์ป้องกันเพียงข้อเดียว — MMLU-Pro ต่ำกว่าเกณฑ์อยู่ 0.026 เมื่อเทียบกับขีดจำกัด 0.020 — และถูกบันทึกว่าไม่ผ่านการคัดเลือก เจ้าของรอบการทดลองจึงขยายขีดจำกัดเป็น 0.030 โดยให้เหตุผลว่า MMLU-Pro เป็นตัวป้องกันการลืมมากกว่าเป็นเป้าหมาย และอาร์มนั้นได้รับการยืนยันบน seed ใหม่สี่ค่า และกลายเป็นรุ่นเผยแพร่ถัดไป การปฏิเสธเดิมยังคงถูกทิ้งไว้ในบันทึก พร้อมความคิดเห็นของโครงการเองว่า เกณฑ์ที่ถูกเลื่อนหลังจากเห็นผลลัพธ์ เป็นสิ่งที่ผู้อ่านควรจะจับได้ว่าโครงการกำลังทำเช่นนั้น

เชิงอรรถนั้นเป็นย่อหน้าที่มีประโยชน์ที่สุดในรีโพซิทอรีสำหรับใครก็ตามที่พยายามประเมินข้อกล่าวอ้างลักษณะนี้ในสภาพการใช้งานจริง เกณฑ์ที่ถูกขยับไม่ใช่ข้อพิสูจน์ของเจตนาไม่ดี — เหตุผลที่ให้ไว้ก็มีเหตุผลรองรับ และเกณฑ์ที่ขยายออกไปนั้นก็ต้องผ่าน seed ใหม่สี่ชุด แต่เกณฑ์ที่ถูกขยับอย่างเงียบ ๆ คือลูปที่ไม่ได้ถูกปิดอีกต่อไป และความแตกต่างระหว่างสองกรณีนี้อยู่ที่ว่ามันถูกจดบันทึกไว้หรือไม่เท่านั้น กฎทั่วไปที่โครงการตกลงใช้ในภายหลังคือกฎที่ควรนำไปใช้กับระบบอื่น: กรณีเกือบพลาดที่ล้มเหลวที่เงื่อนไขป้องกันเพียงข้อเดียวจะได้รับการวินิจฉัยและการซ่อมเฉพาะจุด แทนที่จะถูกทิ้ง — และหากการซ่อมนั้นล้มเหลว มันจะกลายเป็นทางตันพร้อมบันทึก

ลูปผิดบ่อยแค่ไหน: สิบสี่เซ็ตอัป เก็บไว้สอง

นี่คือตัวเลขที่ต้องจดจำไว้ จากรีลีสที่อ่านภาพได้ โครงการนับชุดการเรียนรู้แบบเสริมกำลังได้สิบสี่ชุด และแขนที่ฝึกด้วยรางวัล 63 แขน มีสองอย่างที่ถูกเก็บไว้

การตั้งค่าแต่ละแบบถูกตัดสินเทียบกับกลุ่มควบคุมแบบมีผู้สอน (supervised control) ที่ฝึกบนรายการเดียวกันเป็นจำนวนก้าวเท่ากัน ซึ่งเป็นการเปรียบเทียบที่ทำให้จำนวนนั้นมีความหมาย — การที่สาย RL เอาชนะ baseline ที่มันไม่เคยต้องทำให้เทียบได้นั้นไม่ได้พิสูจน์อะไรเลย ความสูญเสียที่ให้บทเรียน ในคำพูดของโครงการเอง:

• RL ความถูกต้องแบบไบนารี — เอาต์พุตความน่าจะเป็นยุบตัวเหลือ 0 กับ 1 การให้รางวัลกับการเลือกให้ถูก แทนที่จะให้รางวัลกับความซื่อสัตย์ของค่าความน่าจะเป็นที่รายงาน ผลักดันการแจกแจงไปที่มุมสุดขั้ว และโมเดลตัดสินใจที่มีความมั่นใจเต็มร้อยเสมอ ย่อมไร้ประโยชน์ต่อสิ่งที่โมเดลตัดสินใจมีไว้ทำ

• Proper-score RL การสร้างวัตถุประสงค์แบบ Laya ขึ้นใหม่ — ปกติดีที่ 300 สเต็ป แต่ลู่ออกที่ 1,500 เสถียรในตอนที่แทบไม่ได้ทำอะไรเป็นชิ้นเป็นอัน และไม่เสถียรพอดีตอนที่มันเริ่มมีความสำคัญ

• RLCR — ความแม่นยำเท่ากัน แต่การสอบเทียบดิบนั้นแย่กว่า มันไม่ได้ซื้อความสามารถใด ๆ มาเลย และต้องจ่าย代价นั้นด้วยคุณสมบัติเดียวที่โมเดลนี้ดำรงอยู่เพื่อมอบให้

• Bandit RLCD ซึ่งมีเพียงผลลัพธ์ของตัวเลือกที่ถูกเลือกเท่านั้นที่ถูกเปิดเผย — ไม่ดีไปกว่าการฝึกแบบมีผู้สอนด้วยฟีดแบ็กเดียวกัน โครงการนี้ยกเลิกการทดสอบที่ลงทะเบียนไว้ล่วงหน้าของตัวเองตรงจุดนี้: กลุ่มทดลองนี้ต้องเอาชนะการฝึกแบบมีผู้สอนในตัวชี้วัดการปรับเทียบอย่างน้อยสองจากสี่ตัว และชนะได้หนึ่งตัว

ผู้ชนะ และเหตุผลที่มันชนะ คือสิ่งที่ถ่ายทอดไปใช้ได้มากที่สุดในหน้านี้ มันคือรางวัลแบบ listwise — คุณภาพการจัดอันดับที่วัดจากลำดับของผู้สมัครที่ถูกให้คะแนนแยกกันหลายราย แทนที่จะมองแต่ละรายอย่างโดดเดี่ยว ความแม่นยำเรียกคืนของการจัดอันดับใหม่ที่ตำแหน่งแรกเพิ่มจาก 0.192 สำหรับ supervised ต้นทาง เป็น 0.308 โดยมีทั้งชนะและแพ้ในการทดสอบแบบจับคู่ คำอธิบายของโปรเจกต์ไม่ใช่เรื่องของการปรับจูน: เป้าหมายการฝึกแบบต่อรายการให้คะแนนผู้สมัครแต่ละรายด้วยตัวเอง และไม่มีป้ายกำกับใดเพียงป้ายเดียวที่เข้ารหัสคุณภาพของลำดับข้ามผู้สมัครได้ ที่ใดที่รางวัลบอกบางสิ่งซึ่งป้ายกำกับไม่อาจแสดงออกได้ RL เอาชนะการฝึกแบบ supervised บนแถวข้อมูลเดียวกัน ที่ใดที่มันทำไม่ได้ การฝึกแบบ supervised ก็ทำได้เทียบเท่า

สิ่งนี้สรุปเป็นหลักการทั่วไปได้ว่าเมื่อใดที่ลูปแบบนี้จะสามารถค้นพบอะไรได้เลย เมื่อมีป้ายกำกับทองคำอยู่ในมือ การอัปเดตนโยบายเกรเดียนต์ที่คาดหวังจะเท่ากับเกรเดียนต์ของฟังก์ชันขาดทุนแบบมีผู้สอน — ซึ่งเป็นถ้อยคำของโครงการเอง — ดังนั้น "แขน RL" ที่ถูกให้คะแนนเทียบกับการตัดสินใจที่มีป้ายกำกับจึงเป็นแขนออกแบบฟังก์ชันขาดทุนจริง ๆ และการเปลี่ยนแปลงระดับฟังก์ชันขาดทุนขยับชุดทดสอบภายในได้อย่างมากที่สุด 0.002 ขณะที่ข้อมูลใหม่ขยับได้ 0.13 เมื่ออ่านรวมกัน: แรงงัดของลูปไม่เคยอยู่ที่วัตถุประสงค์ แต่อยู่ที่สิ่งที่ถูกวัดและสิ่งที่ถูกป้อนเข้าไป

ซึ่งเป็นคำตอบที่ตรงไปตรงมาต่อคำถามที่ผู้อ่านสมควรถาม การตั้งค่า RL ถูกอ้างถึงที่อื่นในฐานะหลักฐานเกี่ยวกับการพัฒนาตนเองโดยทั่วไป ส่วน ณ ที่นี้ สิ่งเหล่านี้เป็นหลักฐานเกี่ยวกับลูปหนึ่งในงานตัดสินใจ ผลลัพธ์แบบ listwise เป็นเพียงหนึ่ง seed และโครงการก็ระบุไว้เช่นนั้น: การเปรียบเทียบแบบจับคู่ระหว่าง RL กับ supervised นั้นรันบน parent คนละตัวกับตัวที่ release นำไปใช้ และ release นั้น "ไม่มี supervised control ที่จับคู่กัน" ข้อค้นพบที่มีข้อแม้นั้นกำกับอยู่มีค่ามากกว่าข้อค้นพบที่ไม่มี และนี่คือเหตุผลว่าทำไมหน้าที่คุณกำลังอ่านจึงไม่สรุปมันเป็นนัยทั่วไป

ตำแหน่งที่มนุษย์นั่ง

โครงการนี้ชัดเจน และความชัดเจนนั่นแหละคือส่วนที่น่าสนใจ: ลูปนั้นทำการทดลองของตัวเองและปลดระวางแชมป์ของตัวเอง แต่มันไม่ได้ตัดสินว่าอะไรควรค่าแก่การวัด และมันไม่สังเกตด้วยตัวเองว่าเมื่อใดที่ตัวเลขหนึ่งเป็นจริงในเชิงเทคนิคแต่ทำให้เข้าใจผิดในทางปฏิบัติ คนต่างหากที่ทำเช่นนั้น

กฎสองข้อของโปรเจกต์เองมีอยู่เพราะมีคนท้วงติง guard ของ MMLU-Pro ถูกขยายให้กว้างขึ้น แทนที่จะปล่อยให้กรณีเกือบไม่ผ่านถูกตัดทิ้ง ข้อกำหนดด้าน seed ตอนนี้ปรับตามขนาด effect size แทนที่จะใช้ seed สี่ตัวกับทุกความแตกต่าง — เพราะ confirmation seed ซึ่งเป็นตัวเลขที่ไม่ได้ใช้เลือก arm คือตัวที่รับภาระหลัก และการใช้พลังประมวลผลไปกับความแตกต่างที่คุณมองเห็นอยู่แล้วไม่ให้อะไรเลย หนึ่งในรีลีสในสายโซ่เริ่มต้นจากการปฏิเสธที่จะตัด arm ที่ไม่ผ่าน guard หนึ่งข้อออก โปรเจกต์ให้เครดิตผู้ที่ส่งข้อเสนอแนะนั้นโดยระบุชื่อในกิตติกรรมประกาศ

ดังนั้น “การพัฒนาตนเอง” ในที่นี้พรรณนาถึงตรงกลางของลูป ไม่ใช่ทั้งหมดของมัน ลูปนี้คือการค้นหาที่ดำเนินไปโดยไม่มีมนุษย์คอยหมุนข้อเหวี่ยง มนุษย์ยังคงอยู่ที่ด้านบนของลูปเพื่อเลือกเป้าหมาย และอยู่ที่ด้านล่างเพื่ออ่านผลลัพธ์อย่างมีวิจารณญาณ — ซึ่งเป็นรูปแบบที่ทำให้ลูปไม่กลายเป็นเครื่องจักรสำหรับยืนยันความชอบของตัวเองอย่างแม่นยำ คำอธิบายใด ๆ เกี่ยวกับการพัฒนาตนเองแบบเรียกซ้ำที่ละเลยตำแหน่งนั้น ย่อมกำลังพรรณนาถึงระบบที่แตกต่างจากระบบนี้ และน่าจะเป็นเพียงระบบสมมติ

สิ่งที่ตัวเลขของโครงการเองไม่ได้แสดงให้เห็น

ระเบียบวินัยข้างต้นจะคุ้มค่าที่จะอธิบายก็ต่อเมื่อกล่าวถึงข้อจำกัดของมันในคราวเดียวกัน และบันทึกของ RSI-J ก็บอกข้อจำกัดเหล่านั้นไว้ด้วยตัวมันเอง

• เป็นโครงการเดียว ครั้งละหนึ่งขนาดโมเดล และหนึ่ง seed เช็กพอยต์ที่เผยแพร่มาจาก seed เพียงตัวเดียว โดยกำหนดไว้ล่วงหน้าให้เป็นตัวหลัก แทนที่จะเลือกเพราะให้คะแนนดีที่สุด หลักฐานจาก RL ก็มาจาก seed เพียงตัวเดียว

• มันเป็นงานตัดสินใจ ไม่ใช่การสร้าง: คำถามแบบใช่/ไม่ใช่ เลือกหนึ่งจาก k ตัวเลือก หรือให้คะแนนตามเกณฑ์ rubric บนเอกสาร แชต หรือรูปภาพ โดยตอบใน forward pass เดียวด้วยความน่าจะเป็นที่คาลิเบรตแล้วสำหรับแต่ละตัวเลือก ไม่มีอะไรถูกสร้างขึ้น จึงไม่มี reasoning token ให้ใช้ วนลูปนี้แสดงให้เห็นว่ามันสามารถปรับปรุง scorer ที่มีรูปแบบเช่นนั้นได้

• บางส่วนไม่สามารถทำซ้ำได้จากที่เก็บโค้ดเพียงอย่างเดียว คลังข้อมูลสำหรับฝึกและชุดสำหรับพัฒนานโยบายไม่เปิดเผยต่อสาธารณะ และโครงการระบุไว้อย่างตรงไปตรงมาใน release card ว่า "ขั้นตอนเหล่านี้ไม่สามารถรันซ้ำได้จากที่เก็บโค้ดนี้เพียงอย่างเดียว" ตัวสร้างคลังข้อมูลตัวหนึ่งต้องใช้หน่วยความจำประมาณ 96 GB และไม่ได้ถูกรันซ้ำตั้งแต่ต้นจนจบ

• ไม่ใช่ทุกอย่างที่ตรวจสอบได้เลย ชุดทดสอบภายในไม่เคยถูกกันออกไปอย่างสมบูรณ์ ในบรรดาเบนช์มาร์กทั้ง 15 รายการ มี 10 รายการที่ให้ข้อมูลฝึกในรูปแบบใดรูปแบบหนึ่ง ดังนั้นไม่มีตัวเลขใดในนั้นที่เป็น zero-shot — ชุดที่กันไว้คือการเปรียบเทียบที่ถูกกันไว้ และมันเป็นเพียงชุดเดียวเท่านั้น

และชิ้นส่วนภายนอกก็มีแผลเป็นของตัวเอง การตรวจสอบหลังการเปิดตัวครั้งหนึ่งพบแถวทดสอบของชุดเกณฑ์มาตรฐานสาธารณะราวหนึ่งพันรายการอยู่ในคลังข้อมูลฝึก คิดเป็นประมาณ 0.3% ของแถวในชุด โดยส่วนที่มาจากแหล่งเดียวมีขนาดใหญ่ที่สุดเพียงไม่กี่ร้อยแถว เมื่อให้คะแนนใหม่โดยไม่มีแถวเหล่านั้น ดัชนีขยับไม่เกิน 0.04 การแก้ไขนั้นถูกเผยแพร่ในการ์ดของรุ่นถัดไป แทนที่จะนำไปปรับใช้อย่างเงียบ ๆ ภายใต้กฎที่โครงการระบุว่า "ไม่มีการปนเปื้อน ตรวจสอบแทนที่จะอ้าง" มันเป็นกฎที่ทำให้พวกเขาต้องเสียตัวเลข ซึ่งเป็นกฎแบบเดียวที่คุ้มค่าจะมี

ที่ที่คุณรันมันได้จริง — และที่ที่คุณรันไม่ได้

ไม่มีอะไรที่นี่ให้บริการโดย OrcaRouter แคตตาล็อกของเราไม่มี id ของ RSI-Jev และไม่มี model card สำหรับมัน และจะยังไม่มีจนกว่าจะมีใครให้บริการมัน RSI-Jev ติดตั้งจาก repository ของตัวเองและรันเซิร์ฟเวอร์ของตัวเอง ซึ่งสื่อสารผ่าน Jev API: คุณตั้งค่าไคลเอนต์ Jev ที่มีอยู่ให้ชี้ไปที่มัน แล้วเปลี่ยน base URL มันทำงานบน Linux, Windows และ macOS บน CUDA GPU, Apple Silicon หรือ CPU ธรรมดา

The one model we do host is the other side of that contract. TypeSafe's Jev 1.13, which we serve as typesafe/jev-1.13, is the commercial decision model whose request and answer shapes RSI-Jev reproduces, and it is reached on our dedicated systemone endpoint rather than through the chat-completions shape. That is the whole relationship, and it is a structural one rather than a quality claim: one is a hosted commercial model on a vendor's endpoint, the other is a checkpoint you download and serve yourself. Nobody has run an independent head-to-head between them, and this page is not going to declare a winner from two different harnesses.

A generated single-column scoreboard headed 'RSI-Jev - the loop's own ledger', with six rows reading 'Predictions: registered before the run', 'Null floors: measured from identical arms', 'Held-out set: read once, then spent', 'Failures: published, including the champion's', 'Release chain: one card per release, on main forever' and 'RL setups kept: 2 of 14, each judged against a matched control'; a footer reads 'All figures from the project's own record, read 2026-10-08.'

หากสิ่งที่คุณต้องการคือการนำโมเดลการตัดสินใจแบบนี้ไปวางไว้เบื้องหลังแอปพลิเคชัน คำถามเรื่องการจัดเส้นทางจะแยกออกจากคำถามเรื่องโมเดล และมันคือส่วนที่ตัดสินว่าการทดลองนี้คุ้มค่าที่จะทำตั้งแต่แรกหรือไม่ OrcaRouter คือAPI เดียวสำหรับโมเดลกว่า 200 รายการ โดยไม่บวกราคาเพิ่ม (0%) — ราคาตามที่ผู้ให้บริการประกาศไว้ถูกส่งผ่านตรงถึงคุณ ดังนั้นเมื่อผู้ขายเปลี่ยนราคา ราคาของคุณก็เปลี่ยนในวันเดียวกัน — พร้อมทั้งการสลับไปใช้ระบบสำรองอัตโนมัติ และ DSL สำหรับการจัดเส้นทางเพื่อประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว สำหรับโมเดลแบบลูป (loop model) ที่คุณยังไม่สามารถเรียกผ่าน API ทั่วไปได้ สิ่งนี้สำคัญในแบบเฉพาะเจาะจง: มันหมายความว่าตัวเลือกอื่น ๆ ที่คุณจะนำมาเปรียบเทียบนั้นอยู่หลังคีย์เดียวอยู่แล้ว และการเปรียบเทียบก็เป็นเพียงการเปลี่ยนการตั้งค่า ไม่ใช่การผสานรวมครั้งที่สอง

A screenshot of OrcaRouter's own model page for typesafe/jev-1.13 showing the left navigation, a PERFORMANCE panel with prefill and decode lines, the heading 'Jev 1.13' with the provider line 'typesafe', the price fields $0.11 prefill and $0.36 decode per million tokens, a benchmark box with MED 0.3, Response Trust 0.784, Structured Output 0.964, Refusal Correctness 1.0 and Consistency 0.59, an accuracy-versus-cost scatter with a 'Jev 1.13' marker, an 'Individual Runs' table, API and Agent curl snippets pointing at the systemone endpoint, the OrcaRouter logo and a sign-up button.

ส่วนที่คุ้มค่าที่จะเก็บไว้

เหตุผลที่ควรเขียนเกี่ยวกับการปรับปรุงตนเองแบบเรียกซ้ำผ่านโครงการแบบนี้ แทนที่จะผ่านการโต้แย้งว่ามันนำไปสู่จุดหมายที่น่าตื่นเต้นหรือไม่ ก็คือกฎของลูปเป็นส่วนที่ถ่ายโอนได้ ส่วนการคาดเดาไม่ใช่ คำทำนายที่ลงทะเบียนไว้ ค่าพื้น null ที่วัดได้ ชุดทดสอบที่กันไว้ซึ่งใช้ไปแล้ว ความล้มเหลวที่ตีพิมพ์ ห่วงโซ่การเผยแพร่ที่แก้ไขไม่ได้ สิ่งเหล่านี้ไม่มีสิ่งใดเป็นคุณสมบัติของอภิปัญญาเลย มันเป็นคุณสมบัติของห้องแล็บที่ตัดสินใจว่าจะตรวจสอบได้ และสิ่งเหล่านี้พร้อมใช้สำหรับทีมใดก็ตามที่ทำการค้นหาแบบอัตโนมัติในวันนี้ ไม่ว่าจะขนาดใด บนโมเดลใด

อ่านแบบนั้น ข้อที่น่าสนใจในบันทึกของ RSI-Jev ไม่ใช่คะแนน แต่เป็นข้อที่ว่าทะเบียนของลูปเองบอกว่ามันผิดบ่อยกว่าถูกมาก — สูตรที่เก็บไว้สองสูตรจากทั้งหมดสิบสี่เซ็ตอัป, ผลลบเจ็ดรายการเพื่อตามหาบั๊กหนึ่งบรรทัด, แท่งที่ขยับและถูกจดบันทึกไว้ — และโครงการได้เผยแพร่ทะเบียนนั้น การเพิ่มขึ้นจาก 38.38 เป็น 46.24 บนดัชนีสาธารณะในหนึ่งรีลีสเป็นเพียงเรื่องน่าฉงนถ้าไม่มีรายการล้มเหลวอยู่ข้าง ๆ ความล้มเหลวนั่นเองที่ทำให้ตัวเลขนี้มีความหมาย

ซึ่งเป็นจุดยืนที่ซื่อตรงต่อคำนั้นเอง คำถามไม่ใช่ว่าระบบสามารถพัฒนาตัวเองได้หรือไม่ แต่คือว่าการพัฒนานั้นถูกวัดโดยสิ่งที่สามารถพูดว่า “ไม่” ได้หรือไม่ ในกรณีที่การแยกส่วนนั้นมีอยู่จริงและถูกบันทึกไว้เป็นลายลักษณ์อักษร ลูปนั้นก็คุ้มค่าที่จะอ่าน ในกรณีที่ไม่เป็นเช่นนั้น เส้นที่สูงขึ้นเป็นเพียงคำอธิบายของตัวให้คะแนน ไม่ใช่ของระบบที่กำลังดีขึ้น — และไม่ว่าการเรียกซ้ำจะมีมากเพียงใดก็แก้ไขสิ่งนั้นไม่ได้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube