การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งอ่านว่า 'FrogNano-4B-2609 vs Intern-Decision-4B' พร้อมคำโปรย 'บรรพบุรุษ Qwen3.5-4B เดียวกัน แต่ผลลัพธ์สองแบบที่ตรงข้ามกัน' ชิปสามอันที่อ่านว่า 'การเรียกเครื่องมือและการแพตช์' 'หนึ่งสัญลักษณ์ต่อหนึ่งฟิลด์' และ 'ไม่มีอันใดถูกให้คะแนนอย่างเป็นอิสระ' ส่วนท้ายที่อ่านว่า 'กระดานคะแนนทั้งสองเป็นข้อมูลที่ผู้ขายรายงานเอง ยังไม่มีบุคคลที่สามรายใดทำซ้ำผลของทั้งคู่ได้' และโลโก้ OrcaRouter ที่ถูกคอมโพสิตไว้ในมุมขวาล่าง
Guides & Insights

FrogNano-4B-2609 vs Intern Decision 4B: โมเดลฐานหนึ่งเดียว สองเดิมพันที่แตกต่างกันโดยสิ้นเชิง

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สองห้องแล็บนำเช็กพอยต์เดียวกันไป Qwen3.5-4B และผลักดันมันไปในทิศทางที่แทบไม่เหมือนกันเลย microsoft/FrogNano-4B-2609 ถูกฝึกต่อด้วยการเรียนรู้แบบเสริมกำลังบนสภาพแวดล้อมวิศวกรรมซอฟต์แวร์สังเคราะห์ประมาณ 1,500 แบบ จนกระทั่งมันสามารถส่งการเรียกใช้เครื่องมือแบบมีโครงสร้างและแพตช์หลายไฟล์ผ่านฮาร์เนสห้าเครื่องมือได้ internlm/Intern-Decision-4B ถูกปรับแต่งละเอียดให้ไม่ส่งข้อความใด ๆ ออกมาเลย — มันรับสถานะพร้อมสคีมาของคำถามที่มีชื่อ แล้วคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วสำหรับแต่ละตัวเลือกใน forward pass เพียงครั้งเดียว ตัวหนึ่งเขียนโค้ด อีกตัวปฏิเสธที่จะเขียนอะไรทั้งสิ้นและคืนค่าการแจกแจง การเปรียบเทียบคุณภาพของทั้งสองนั้นไม่มีความหมาย; การเปรียบเทียบว่ามันมีค่าใช้จ่ายในการรันเท่าใด และสิ่งที่คุณไว้วางใจให้มันทำได้ ต่างหากคือการเปรียบเทียบที่ตรงไปตรงมา

ทั้งสองถูกปล่อยออกมาโดยไม่มีการประกาศ ซึ่งเป็นอีกสิ่งหนึ่งที่ทั้งคู่มีร่วมกัน ทั้งสองไม่มีรายการใน Artificial Analysis ไม่มีคะแนนจากอารีนา และไม่มีการประเมินโดยอิสระแม้แต่ครั้งเดียว ตัวเลขทุกตัวด้านล่าง — บันได SWE-bench ในด้านหนึ่ง แถวการคาลิเบรต Brier และ ECE ในอีกด้านหนึ่ง — ถูกสร้างขึ้นโดยห้องแล็บที่ฝึกโมเดล บนฮาร์เนสของห้องแล็บนั้นเอง และไม่เคยพบชุดทดสอบที่ไม่ได้มาจากแหล่งเดียวกันกับมัน

การฟอร์กเกิดขึ้นก่อนที่โมเดลใดโมเดลหนึ่งจะถือกำเนิด

เช็กพอยต์ฐานเป็นโมเดลไฮบริดแบบหนาแน่น 32 ชั้น ที่ผสม Gated DeltaNet และ gated-attention เข้าด้วยกัน และโมเดลที่ต่อยอดทั้งสองก็สืบทอดโครงสร้างหลักของมัน หลังจากนั้น ไปป์ไลน์หลังการฝึกทั้งสองก็ไม่มีอะไรเหมือนกันเลย

ไปป์ไลน์ของ Microsoft เป็นวงปิด TaskPilot สร้างภารกิจในรีโพซิทอรีที่เป็นตัวเลือกจากสแนปช็อตจริง รันการโรลเอาต์จากเช็คพอยต์ปัจจุบันเพื่อหาภารกิจที่นโยบายแก้ได้ในบางครั้ง เก็บภารกิจเหล่านั้นไว้ แล้วนำไปฝึก ห้ารอบ แต่ละรอบปรับเทียบกับนโยบายของรอบก่อนหน้า จบลงที่ 61.5% บน SWE-bench Verified และ 37.6% บน SWE-bench Pro ไม่มีการกลั่น — การ์ดระบุว่าไม่มีการใช้เส้นทางการทำงาน การกระทำ หรือร่องรอยการให้เหตุผลของโมเดลที่แข็งแกร่งกว่าเป็นเป้าหมาย

ไปป์ไลน์ของ InternLM เป็นวัตถุประสงค์แบบมีผู้สอนเพียงหนึ่งเดียวบนรูปแบบงานที่ตายตัว โมเดลได้รับ system prompt สถานะ สคีมาการตัดสินใจ และโครงร่าง JSON ของผู้ช่วยที่สมบูรณ์โดยมีตัวยึดตำแหน่งหนึ่งตัวต่อหนึ่งฟิลด์ มันรัน causal forward pass หนึ่งครั้ง อ่านค่า logits ณ ตำแหน่งตัวยึดตำแหน่งแต่ละแห่ง และทำ softmax เฉพาะเหนือสัญลักษณ์ตัวเลือกที่ฟิลด์นั้นอนุญาต การ์ดของ InternLM กล่าวไว้ตรง ๆ ว่า เส้นทางนี้ "ไม่ได้เรียก generate() หรือสุ่มข้อความอิสระ"

ความแตกต่างนั้นไม่ใช่ความแตกต่างเชิงขนาด แต่มันเป็นความแตกต่างในว่าสิ่งประดิษฐ์นี้เป็นอะไรกันแน่ FrogNano-4B-2609 เป็นเอเจนต์ที่สามารถผิดพลาดได้ในหนึ่งร้อยวิธีที่น่าสนใจ และถูกแก้ไขได้ด้วยการทดสอบ Intern-Decision-4B เป็นตัวให้คะแนนที่โหมดความล้มเหลวคือตัวเลขที่มั่นใจ

สัญญาสองฉบับ และไม่มีฉบับใดเลยที่เป็น "ส่งพรอมป์ต์"

สัญญาของ FrogNano คือลูป โมเดลส่งคำสั่งเรียกไปยัง Read, Write, Edit, Glob และ Bash; ฮาร์เนส Leaf จะรันการเรียกเหล่านี้ภายในแซนด์บ็อกซ์ของที่เก็บโค้ดที่แยกออกมา แล้วส่งคืนผลลัพธ์; ลูปจะดำเนินต่อไปจนกว่าโมเดลจะหยุดเรียก การประเมินดำเนินการที่ 150 สเต็ปภายในโทเค็นรวมประมาณ 131K โดยมีโทเค็นที่สร้างขึ้นสูงสุด 8,192 ต่อเทิร์นของแอสซิสแทนต์ การให้บริการต้องใช้ SGLang ที่มีตัวแยกวิเคราะห์การให้เหตุผลของ Qwen3 และตัวแยกวิเคราะห์การเรียกใช้เครื่องมือของ Qwen3 coder — หากทำผิดพลาด โมเดลจะสร้างข้อความร้อยแก้วในจุดที่ฮาร์เนสคาดหวัง JSON ซึ่งจากภายนอกดูเหมือนโมเดลที่เสียหายอย่างแท้จริง

สัญญาของ Intern-Decision-4B เป็นแบบครั้งเดียวที่เข้มงวดเด็ดขาด ลำดับของคำถามและตัวเลือกยังคงเดิม ตัวเลือกถูกแมปเข้ากับสัญลักษณ์แบบหนึ่งโทเคน — A ถึง Z จากนั้น a ถึง z จากนั้น 0 ถึง 9 ซึ่งเป็นเหตุผลเชิงคณิตศาสตร์ที่ทำให้คำถามหนึ่งข้อมีตัวเลือกได้สูงสุด 62 ตัวเลือก เพดานของตัวห่อคือ 8,192 โทเคน และการ์ดของ InternLM ระบุชัดเจนว่าอินพุตที่ยาวกว่านั้นจะถูกปฏิเสธโดยไม่มีการตัดทอน รองรับคำถามสามประเภท: choice พร้อมแมปเกณฑ์แบบมีลำดับ, score พร้อมรายการหรือแมปที่ใช้ตัวเลขเป็นคีย์ และ noul ซึ่งเป็นแบบไบนารี อนุญาตให้ใช้รูปภาพได้สูงสุดแปดรูป และโทเคนของรูปเหล่านั้นนับรวมอยู่ใน 8,192 เดียวกัน

• รูปแบบเอาต์พุต — FrogNano-4B-2609 ส่งออกการเรียกใช้เครื่องมือ ข้อความการให้เหตุผล และแพตช์ Intern-Decision-4B ส่งออกหนึ่งสัญลักษณ์ต่อฟิลด์และไม่มีสิ่งอื่นใด

• ความเป็นดีเทอร์มินิสต์ — FrogNano สุ่มตัวอย่างที่อุณหภูมิ 0.6 จากสามซีด ดังนั้นโดยการออกแบบแล้วจึงเป็นแบบความน่าจะเป็น ส่วน argmax ของ Intern-Decision-4B ถูกตรึงไว้โดย forward pass; อุณหภูมิที่ปรับให้พอดีจะเลื่อนเพียงค่าความเชื่อมั่นของมันเท่านั้น

• พื้นผิวความล้มเหลว — FrogNano อาจหลอน API, ขยายขอบเขตการแก้ไขกว้างเกินไป, หรือผ่านการทดสอบในขณะที่เพิ่มช่องโหว่ ซึ่งทั้งหมดนี้การ์ดของมันระบุไว้ Intern-Decision-4B ไม่สามารถหลอนคำตอบได้ เพราะมันเลือกได้เพียงจากตัวเลือกที่คุณให้มา — มันอาจปรับเทียบผิดพลาดได้

• ขีดจำกัดอินพุต — ประมาณ 131K โทเค็นรวมสำหรับ FrogNano ในการกำหนดค่าที่ประเมินไว้ เทียบกับขีดจำกัดแบบตายตัวที่ 8,192 สำหรับ Intern-Decision-4B ซึ่งต่างกันเป็นสิบหกเท่า และไม่มีวิธีเลี่ยง

• โครงสร้างต้นทุน — FrogNano คิดค่าบริการตาม trajectory และ trajectory นั้นยาวมาก ส่วน Intern-Decision-4B ไม่มีโทเคนเอาต์พุตให้คิดค่าบริการเลยแม้แต่นิดเดียว

• พารามิเตอร์ — การ์ด FrogNano ระบุช่วง "500M-5B" และอธิบายไว้ประมาณ 4.66B โดยมีไฟล์ดาวน์โหลด BF16 ขนาด 9.32 GB; Intern-Decision-4B ระบุไว้ที่ 4.54B พร้อมด้วย vision tower ขนาด 612 MB และ projector ขนาด 54 MB ควบคู่ไปกับ language shards ของมัน

ตัวเลขที่ตัดสินการจับคู่นี้

การ์ดของ InternLM ระบุว่า Intern-Decision-4B มีค่า latency เฉลี่ย 44.16 ms และค่ามัธยฐาน 44 ms บน RTX 4090 ผ่านเส้นทาง Hugging Face โดยมี P95 อยู่ที่ 44.60 ms อ่านช่วงการกระจายนั้นอีกครั้ง: จากค่ามัธยฐานถึงปลายหางต่ำกว่าหนึ่งมิลลิวินาทีอยู่มาก เพราะ forward pass ที่มีรูปทรงคงที่แทบไม่มีอะไรให้แปรผัน นั่นคือข้อโต้แย้งทั้งหมดสำหรับสถาปัตยกรรมนี้

ตัวเลขที่สอดคล้องของ FrogNano ไม่ได้อยู่ในหน่วยมิลลิวินาที การประเมินของมันอนุญาตให้ใช้งบประมาณ 150 ขั้นตอน โดยมีเพดานเอเจนต์ที่ 10,800 วินาทีต่องาน หน่วยเหล่านี้เทียบกันไม่ได้ และไม่ควรถูกนำมาใส่ไว้ในประโยคเดียวกันกับข้ออ้างเรื่องความหน่วง — แต่สิ่งเหล่านี้ก็บอกคุณถึงลักษณะของการแลกเปลี่ยน โมเดลหนึ่งตอบการตัดสินใจภายในสี่สิบสี่มิลลิวินาที ส่วนอีกโมเดลใช้เวลาหลายนาทีไปกับการเรียกใช้เครื่องมือเพื่อตามหาแพตช์ หากปัญหาของคุณคือ "จัดเส้นทางทิกเก็ตนี้เข้าสู่คิวใดคิวหนึ่งจากทั้งหมดหกคิว และบอกฉันว่าคุณมั่นใจแค่ไหน" ตัวแรกไม่ใช่เวอร์ชันที่ถูกกว่าของตัวที่สอง แต่เป็นเครื่องคนละแบบ

ทั้งสองแล็บวัดตัวเองอย่างระมัดระวัง และชุดการวัดทั้งสองชุดควรถูกอ่านเป็นเจตนามากกว่าผลลัพธ์ InternLM รายงานค่าเฉลี่ยจากเจ็ดชุดที่ 90.02 โดยมีคะแนน Brier เท่ากับ 0.347 และค่าความคลาดเคลื่อนการสอบเทียบที่คาดหมายเท่ากับ 0.065 ซึ่งฟิตที่อุณหภูมิ 1.99241824 บน 1,728 กรณีการสอบเทียบที่กำหนดไว้ Microsoft รายงานการไต่ขึ้นห้ารอบจาก 39.4% เป็น 61.5% บน SWE-bench Verified และภาคผนวกของบทความเดียวกันรายงานความก้าวหน้าเดียวกันนั้นเป็น 48.2%, 53.4%, 58.3%, 58.6% และ 61.6% — เป็นเครื่องเตือนใจว่าแม้ภายในแล็บเดียว ข้อเท็จจริงเดียวกันที่วัดด้วยสองวิธีก็ให้บันไดสองแบบ

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

สัญญาณบอกอยู่ที่ว่าการ์ดแต่ละใบเลือกจะเตือนคุณเรื่องอะไร

การ์ดทั้งสองใบตรงไปตรงมาอย่างผิดปกติ และความตรงไปตรงมานั้นชี้ไปในทิศทางที่ตรงกันข้าม — ซึ่งเป็นสิ่งที่มีประโยชน์ที่สุดในการเปรียบเทียบนี้

ส่วนข้อจำกัดที่ทราบของ Microsoft อ่านแล้วเหมือนคำเตือนการปรับใช้ ภาษาอังกฤษและ Python เท่านั้น ประสิทธิภาพไวต่อฮาร์เนสและคุณภาพการทดสอบ แพตช์ที่อาจไม่ถูกต้องหรือไม่ปลอดภัยแม้จะผ่านการทดสอบแล้ว ประโยคในการ์ดเองคือ FrogNano "ไม่ควรถือว่ามีความสอดคล้องด้านความปลอดภัยโดยอิสระสำหรับการปรับใช้แบบอัตโนมัติโดยไม่มีข้อจำกัด" และระบุช่องว่างเฉพาะ: การฝึกหลังการฝึกเฉพาะเอเจนต์ไม่ได้ใช้ข้อมูลด้านความชอบด้านความปลอดภัย การปฏิเสธ หรือข้อมูลฝ่ายตรงข้าม เพราะมันปรับให้เหมาะสมกับความถูกต้องเชิงฟังก์ชันและการหลีกเลี่ยงการถดถอยแทน มันยังเปิดเผยอัตราการเรียกเครื่องมือแบบขนาน 1.71% หมายความว่าโมเดลแทบไม่เคยเรียกเครื่องมือสองอย่างในเทิร์นเดียว แม้ว่าฮาร์เนสจะอนุญาตก็ตาม ซึ่งเป็นการถดถอยความสามารถจริงจากโมเดลฐานที่ทีมเพิ่มขั้นตอนการรวมเพื่อพยายามกู้คืน

การ์ดของ InternLM เตือนถึงสิ่งประเภทที่ตรงกันข้าม ไม่มีพื้นผิวของอาการหลอนให้ต้องเตือน ข้อควรระวังจึงเกี่ยวกับอินพุต ได้แก่ การปฏิเสธที่ 8,192 เพดาน 62 ตัวเลือก และข้อเท็จจริงที่ว่า text tower ที่เป็นแกนกลางประกาศขีดจำกัดตำแหน่งไว้ที่ 262,144 โทเคน ซึ่ง wrapper ที่เผยแพร่ออกมานั้นปฏิเสธที่จะใช้งาน ความเสี่ยงของมันคือตัวเลขที่ดูมั่นใจถูกเชื่อถือไกลเกินกว่าที่มันควรได้รับ และการ์ดก็พูดตรง ๆ ว่า การปรับคาลิเบรตนั้นลดช่องว่างที่มีต่อ baseline ของ Jev ลง แต่ไม่ได้ปิดช่องว่างนั้นในทุก slice

เมื่ออ่านรวมกันแล้ว สิ่งเหล่านี้บรรยายถึงท่าทีแห่งความไว้วางใจที่แตกต่างกันสองแบบ FrogNano จำเป็นต้องมีการกำกับดูแลเพราะมันลงมือทำ Intern-Decision-4B จำเป็นต้องมีการตรวจสอบเพราะมันให้คะแนน — และตัวเลขที่มีผลต่อการตัดสินใจในการผลิตก็เป็นผลลัพธ์แบบที่ไม่มีใครคิดจะทดสอบ

ตำแหน่งที่เราเตอร์ลงตัว และหมายเหตุที่ตรงไปตรงมาเกี่ยวกับทั้งสอง

ไม่มีโมเดลใดเป็นเอนด์พอยต์แบบโฮสต์ FrogNano ถูกส่งมอบเป็นเวตพร้อมฮาร์เนสสำหรับประเมินผลบน Kubernetes ส่วน Intern-Decision-4B ถูกส่งมอบเป็นคลาส Python ที่คุณอิมพอร์ตหลังจากดาวน์โหลดชาร์ดสี่ชิ้น สำหรับทีมที่ต้องการลองใช้โมเดลใดโมเดลหนึ่งกับงานจริง รูปแบบที่ปลอดภัยก็เหมือนกันสำหรับทั้งสอง และมันไม่ได้ดูหรูหรา: วางคอมโพเนนต์ทดลองไว้หลังฟอลแบ็ก เพื่อให้เส้นทางที่ผิดพลาดหรือวันที่ปรับเทียบคลาดเคลื่อนมีต้นทุนเป็นแค่การลองใหม่ ไม่ใช่เหตุการณ์ผิดพลาดร้ายแรง

รูปแบบแบบนั้นคือสิ่งที่ชั้นจัดเส้นทางมีไว้เพื่อจัดการ OrcaRouter รันโมเดลกว่า 200 ตัวไว้เบื้องหลังคีย์เดียวที่เข้ากันได้กับ OpenAI โดยบวกกำไร 0% — ส่งผ่านราคาตามรายการของผู้ให้บริการไปเลย ดังนั้นเมื่อผู้ขายเปลี่ยนราคา ฝั่งเราก็ได้รับผลภายในวันเดียวกัน — และระบบสลับสำรองอัตโนมัติของมันวางอยู่หน้าโมเดลทั่วไปที่คุณใช้เป็นตัวสำรอง ไม่ได้วางอยู่หน้าสองตัวนี้ พูดให้ชัดก็คือ เราไม่ได้ให้บริการ FrogNano-4B-2609 หรือ Intern-Decision-4B และยังไม่มีกำหนดการสำหรับทั้งสองตัว สิ่งที่ endpoint เดียวให้คุณได้ในกรณีนี้คือการเปรียบเทียบนั้นถูกลง — ใช้ข้อมูลรับรองชุดเดียว บรรทัดเรียกเก็บเงินบรรทัดเดียว และไม่ต้องต่อ интеграцияเพิ่มเป็นครั้งที่สองทุกครั้งที่คุณสลับโมเดลทั่วไปที่ใช้เป็นเกณฑ์เทียบกับตัวเฉพาะทาง

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

อันไหน และเมื่อไหร่

ใช้ Intern-Decision-4B เมื่อคำตอบมีอยู่แล้วในพรอมป์ของคุณ และคุณต้องการให้มันถูกเลือก พร้อมค่าความเชื่อมั่นกำกับ ด้วยอัตราหลายพันครั้งต่อวินาที การกำหนดเส้นทางด้วยอนุกรมวิธานคงที่ การให้คะแนนตามรูบริก การสกัดข้อมูลภายใต้ข้อจำกัดสคีมา และการกลั่นกรองเทียบกับชุดป้ายกำกับแบบปิด ฟอร์เวิร์ดพาส 44 มิลลิวินาทีและบิลโทเคนเอาต์พุตที่เป็นศูนย์คือผลิตภัณฑ์ และการคาลิเบรตคือสิ่งที่ต้องตรวจสอบก่อนที่คุณจะเชื่อถือมัน

พิจารณา FrogNano-4B-2609 เมื่อยังไม่มีคำตอบและต้องค้นพบโดยการอ่านรีโพซิทอรีและรันการทดสอบของมัน นั่นคือกระบวนการที่ใช้เวลาหลายนาที ทำงานในแซนด์บ็อกซ์ และสามารถตรวจสอบได้ และ 61.5% บน SWE-bench Verified — ที่ผู้ขายรายงาน ยังไม่มีการทำซ้ำ — เป็นหลักฐานที่ดีที่สุดในปัจจุบันว่าเช็คพอยต์ขนาด 4B สามารถทำได้จริง

สิ่งที่ไม่ควรถูกปล่อยผ่านไม่ว่าจะทางไหนก็คือนิสัยของการนำคะแนนของทั้งสองมาเปรียบเทียบกัน ค่าเฉลี่ยเจ็ดเซตที่ 90.02 กับอัตรา SWE-bench Verified ที่ 61.5 เป็นการวัดคำถามสองข้อที่แตกต่างกัน ผลิตโดยสองแล็บ บนฮาร์เนสสองตัว และไม่มีตัวเลขใดเลยที่ผ่านมือของบุคคลที่สาม พวกมันมีเพียงบรรพบุรุษร่วมกัน และไม่มีอะไรอื่นอีก

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

ข้อคาดการณ์ที่มีประโยชน์จริงเพียงหนึ่งเดียวจากบรรพบุรุษร่วม: เนื่องจากทั้งสองโมเดลเริ่มต้นจากเช็กพอยต์ 4B ตัวเดียวกัน ความแตกต่างระหว่างพวกมันจึงอยู่ที่การฝึกภายหลังแทบทั้งหมด ซึ่งหมายความว่าคำถามที่น่าสนใจสำหรับใครก็ตามที่สร้างต่อยอดบน Qwen3.5-4B คือ โครงสร้างรางวัลสองแบบนี้ แบบใดจะถ่ายโอนไปยังโดเมนของตนเองได้ ลูปงานสังเคราะห์ที่ปรับเทียบกับนโยบายของตัวเอง หรือหัวให้คะแนนรูปร่างคงที่พร้อมอุณหภูมิที่ปรับให้พอดี นั่นคือสองสูตร ทั้งคู่ได้รับการเผยแพร่ ทั้งคู่มาจากแล็บที่ยังไม่ปล่อยให้ใครอื่นรันมัน นี่เป็นสถานการณ์ที่พบได้ยาก และน่าจับตามองมากกว่าจะเชื่อหรือซื้อตาม

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube