การ์ดชื่อเรื่องหลักสำหรับ 'AesCode-32B' พร้อมคำบรรยาย 'Microsoft อัปโหลดน้ำหนัก 33B ที่เขียนสไลด์เป็น HTML ที่แก้ไขได้ - และไม่ประกาศอะไรเลย' ชิปสามชิ้นที่ระบุว่า '33B พารามิเตอร์, BF16', 'ฐาน: Qwen3-VL-32B-Instruct' และ 'ไม่มี API ที่โฮสต์' ไอคอนเส้นแบนของหน้าต่างเบราว์เซอร์ที่มีเลย์เอาต์สไลด์พร้อมแผงแผนภูมิและแถวตารางสองแถว และบรรทัดส่วนท้ายที่ระบุว่า 'ตาม microsoft/AesCode-32B บน Hugging Face และ github.com/microsoft/AesCode, อ่าน 11 ตุลาคม 2026' โลโก้ OrcaRouter อยู่ที่มุมขวาล่างของแคนวาสที่ขยาย
Guides & Insights

AesCode-32B: โมเดล 33B ที่เงียบๆ ของ Microsoft ซึ่งเขียนสไลด์เป็น HTML ที่แก้ไขได้

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การประทับเวลาใน AesCode-32B ไม่ตรงกันระหว่างกันเอง และความไม่ตรงกันนี้ก็คือเนื้อหาหลักเกือบทั้งหมดที่พอจะรายงานได้microsoft/AesCode-32B บนที่เก็บ Hugging Face ถูกสร้างขึ้นเมื่อวันที่ 29 กันยายน 2026 แต่ทุกสิ่งในนั้นเข้ามาในคอมมิตเดียวที่ลงวันที่ 7 ตุลาคม 2026 ซึ่งข้อความกำกับเขียนไว้เพียงว่า "Release AesCode-32B" — และชุดเครื่องมือฝึกที่ทำให้ผลลัพธ์สามารถทำซ้ำได้ถูกพุชขึ้นไปที่github.com/microsoft/AesCode เมื่อวันที่ 8 ตุลาคม ไมโครซอฟต์ไม่ได้ประกาศอะไรเลย ไม่มีโพสต์บล็อก ไม่มี preprint บน arXiv ไม่มีการส่งเข้าสู่กระดานจัดอันดับ ไม่มีหน้าโมเดลบนเว็บไซต์ของตัวเอง สิ่งที่มีอยู่คือโมเดลภาษา-ภาพขนาด 33,000 ล้านพารามิเตอร์ที่รับพรอมต์แล้วส่งออกเอกสาร HTML ที่สมบูรณ์และครบในตัวเอง — สไลด์ โปสเตอร์ แดชบอร์ด — พร้อมกับโมเดลคู่หูที่เล็กกว่า microsoft/AesCode-8B ทั้งสองถูกปรับละเอียดมาจากโมเดลภาพ-ภาษา Qwen3-VL — Qwen3-VL-32B-Instruct และ Qwen3-VL-8B-Instruct ตามลำดับ — ทั้งคู่ใช้สัญญาอนุญาต Apache 2.0 และทั้งคู่ดาวน์โหลดได้ในวันนี้

ไอดีของรีโปอ่านว่า microsoft/AesCode-32B และการ์ดก็เปิดด้วยทริกว่า AesCode จับคู่พรอมป์ของคุณกับภาพที่สร้างจากพรอมป์เดียวกันนั้น ใช้ภาพเป็นข้อมูลอ้างอิงด้านความสวยงาม แล้วยึดตามข้อความสำหรับเนื้อหาจริง ๆ ตัวสร้างภาพประกอบหน้าเว็บออกมาได้สวยงามแต่เรนเดอร์ตัวเลขบนหน้านั้นผิด ส่วนโมเดลโค้ดทำตัวเลขได้ถูกต้องแต่มองไม่เห็นว่าหน้านั้นหน้าตาเป็นอย่างไร AesCode คือความพยายามที่จะได้ทั้งสองอย่าง และบทสรุปที่ตรงไปตรงมาของมัน ณ วันที่ 11 ตุลาคม 2026 ก็คือ ค่าน้ำหนักเป็นของจริงและตรวจสอบได้ ตัวเลข benchmark เป็นของแล็บเองบนฮาร์เนสที่แล็บเขียนขึ้น และยังไม่มีใครนอกไมโครซอฟต์เผยแพร่ตัวเลขของมันเลย บทความนี้แยกสามหมวดนั้นออกจากกันตลอดทั้งเรื่อง

จริง ๆ แล้วมีอะไรอยู่ในรีโพซิทอรีกันแน่ ไบต์ต่อไบต์

A headless-browser capture of the Hugging Face model page for microsoft/AesCode-32B, showing the repo heading, a Like count of 1, 'License: apache-2.0', the card intro text, the sentence describing training with GDPO, and the bulleted Paper, Code and Companion links; the surrounding Hugging Face navigation and search chrome is included.

เริ่มจากสิ่งที่คุณตรวจสอบได้เองโดยไม่ต้องเชื่อสักคำจากโมเดลการ์ด รีโพซิทอรีขนาด 32B บรรจุไฟล์ safetensors จำนวนสิบสี่แชร์ด รวมขนาดทั้งสิ้น 66,714,912,704 ไบต์ ซึ่งที่ BF16 คิดเป็นพารามิเตอร์ประมาณ 33.4 พันล้านตัว — สอดคล้องกับ "33B params" ในโมเดลการ์ด และคำเตือนที่ว่าเฉพาะน้ำหนักอย่างเดียวก็ต้องใช้หน่วยความจำของตัวเร่งความเร็วราว 65 GB แล้ว คอนฟิกประกาศว่า Qwen3VLForConditionalGeneration เป็นสถาปัตยกรรม และ qwen3_vl เป็นประเภทโมเดล ดังนั้นนี่จึงไม่ใช่สถาปัตยกรรมใหม่และไม่จำเป็นต้องมีสถาปัตยกรรมใหม่ใด ๆ: มันโหลดได้ด้วย transformers>=4.57 และโมเดลการ์ดยังมาพร้อมคำสั่ง vLLM ที่ให้บริการโมเดลนี้กระจายไปยังแรงก์แบบ tensor-parallel สี่แรงก์ โดยอนุญาตให้ใส่ภาพได้สองภาพต่อพรอมป์ต์หนึ่งครั้ง และมีเพดานที่ 24,576 โทเคน

ตัวนับการมีส่วนร่วมเป็นส่วนที่เงียบที่สุดของการเปิดตัวครั้งนี้ ณ เวลาที่เขียน มีการดาวน์โหลดสองครั้งและถูกกดถูกใจหนึ่งครั้งบนรีโพซิทอรี 32B ไม่มีรายการในแมปผู้ให้บริการ inference ของ Hugging Face ซึ่งหมายความว่าไม่มีปลายทางแบบโฮสต์ใดเชื่อมต่ออยู่เบื้องหลังหน้ารีโพ และไม่มีการโฆษณาบิลด์ GGUF, MLX หรือ llama.cpp ที่ใดเลย สำหรับโมเดลที่แบกชื่อ Microsoft และมีผลลัพธ์ที่เอาชนะ GPT-5.5 บนตารางของเจ้าของเอง นั่นถือเป็นการปรากฏตัวที่เล็กอย่างน่าตกใจ — และเป็นหลักฐานที่หนักแน่นที่สุดเท่าที่มีว่าสิ่งนี้ถูกนำขึ้นโดยไม่มีงานเปิดตัวรองรับอยู่เบื้องหลัง

ที่เก็บโค้ดที่มาคู่กันเติมเต็มอีกครึ่งหนึ่งของไทม์ไลน์ และนี่คือจุดที่คำถามเรื่องวันเผยแพร่กลายเป็นเรื่องกำกวมอย่างแท้จริง microsoft/AesCodeถูกสร้างขึ้นเมื่อวันที่ 23 กรกฎาคม 2026 — สิบสัปดาห์ก่อนน้ำหนักโมเดล — และมีคอมมิตทั้งหมดสิบสี่รายการ ทุกรายการเขียนโดยผู้มีส่วนร่วมคนเดียวกัน และทุกรายการมีเวลากำกับอยู่ภายในยี่สิบวินาทีของกันและกันในวันที่ 8 ตุลาคม 2026 ระหว่าง 23:14:04 ถึง 23:14:24 UTC ซึ่งประกอบด้วยสเปกสำหรับการสร้างพรอมป์ต์และข้อกำหนดที่ตรวจสอบได้ ไปป์ไลน์ข้อมูลที่สร้างกราฟการออกแบบและคำถามแบบรูบริก ขั้นตอน SFT แบบ cold-start ลูปการเรียนรู้แบบเสริมกำลัง GDPO ตัวตรวจสอบการเรนเดอร์ที่ใช้ Playwright เทสต์ และ README ที่อธิบายรายละเอียดทั้งหมดนี้ ไม่มีรีลีสและไม่มีแท็ก คำอธิบายที่เก็บว่างเปล่า และมีดาวหนึ่งดวง

A headless-browser capture of the github.com/microsoft/AesCode repository page, showing the org and repo name 'microsoft / AesCode', the line 'No description, website, or topics provided', the README summary listing overview, results and the reproduction guide, a commit count of 14, an MIT licence label, and the top-level directory tree including assets, data_prep, eval and examples/hospital_dashboard.

แล้ววันไหนกันแน่ที่เป็นวันเปิดตัว? บันทึกของรีโพซิทอรีบอกว่า 29 กันยายน คอมมิตที่บรรจุโมเดลบอกว่า 7 ตุลาคม โค้ดที่อธิบายว่าโมเดลถูกสร้างขึ้นมาอย่างไรบอกว่า 8 ตุลาคม เวลาประทับสามรายการภายในหน้าต่างสองสัปดาห์เดียว โดยไม่มีรายการใดเลยที่มีประโยคจาก Microsoft ว่า "เรากำลังปล่อยสิ่งนี้" ให้ถือว่า 7–8 ตุลาคม เป็นวันที่ใช้ได้จริงสำหรับอาร์ติแฟกต์ที่คนส่วนใหญ่จะดาวน์โหลดจริง และ 29 กันยายน เป็นวันที่รีโพซิทอรีถูกจองไว้ ใครก็ตามที่บอกคุณว่า AesCode-32B "เปิดตัว" ในวันใดวันหนึ่งโดยเฉพาะ กำลังเลือกหนึ่งในเวลาประทับเหล่านั้นแทนคุณ

กลไก: รูปภาพเป็นแนวทางด้านสุนทรียศาสตร์ กราฟเป็นรางวัล

ข้อกล่าวอ้างทางเทคนิคของการ์ดนี้แคบและเจาะจง ซึ่งเป็นข้อดีอย่างหนึ่ง โมเดลนี้ถูกฝึกด้วย cold-start supervised fine-tuning บนตัวอย่างสาธิต 3,000 รายการที่อัตราการเรียนรู้ 1e-5 จากนั้นฝึกด้วย GDPO ซึ่งเป็นรูปแบบหนึ่งของ group-relative policy optimisation บนพรอมป์ 7,408 รายการเป็นเวลา 520 สเต็ป โมเดล 8B ใช้สูตรเดียวกันและหยุดที่ 400 สเต็ป การรัน RL ใช้เอนจินไฮบริด FSDP-vLLM ของ verl โดยไม่มี critic และไม่มีโมเดลรางวัลที่ฝึกแยกต่างหาก ใช้ AdamW ที่ค่า 5e-6 คงที่โดยไม่มี warmup ใช้ 128 พรอมป์ต่อสเต็ปโดยแต่ละพรอมป์มี 8 rollouts และพรอมป์กับการตอบกลับถูกจำกัดไว้ที่ 8,192 โทเคนแต่ละส่วน

สิ่งที่ทำให้รางวัลนี้ไม่ธรรมดาคือมันไม่ใช่ค่าสเกลาร์ตัวเดียว แต่ละเป้าหมายการฝึกอบรมถูกอธิบายเป็นกราฟการออกแบบที่ครอบคลุมทั้งแคนวาส ดังนั้นคุณสมบัติแต่ละอย่างจึงสามารถระบุแยกได้ จากกราฟนั้นได้เจ็ดช่องสัญญาณ — การดำเนินการ, ข้อความ, ขอบเขต, ตารางแผนภูมิ, เลย์เอาต์, ช่องว่าง และการออกแบบ — แต่ละช่องถูกทำให้เป็นบรรทัดฐานภายในกลุ่มโรลเอาต์ของมันก่อนการรวม เพื่อไม่ให้สัญญาณที่โดดเด่นตัวหนึ่งกลบเสียงอื่นๆ ตัวตรวจสอบแบบดีเทอร์มินิสติกให้คะแนนสิ่งที่สามารถแยกวิเคราะห์ได้จากโค้ดและการเรนเดอร์ของมัน; ผู้ตัดสินด้านภาพและภาษาให้คะแนนสิ่งที่ทำไม่ได้ โดยใช้เกณฑ์การให้คะแนนที่ผูกกับองค์ประกอบและความสัมพันธ์ของกราฟเอง HTML ที่เป็นตัวเลือกจะถูกให้คะแนนโดยการเรนเดอร์ในเบราว์เซอร์ Playwright แบบแซนด์บ็อกซ์โดยบล็อกคำขอภายนอก ซึ่งส่งออก DOM, สไตล์ที่คำนวณแล้ว, กล่องขอบเขต, สถานะคอนโซล และภาพหน้าจอ

ผลลัพธ์เชิงวิศวกรรมนี้ควรค่าแก่การระบุ เพราะมันปรากฏอยู่ในผลลัพธ์ที่คุณได้รับ: โมเดลได้รับการฝึกให้ส่งออกตารางเป็นโครงสร้างตาราง HTML จริง และแผนภูมิเป็นสเปก ECharts ดังนั้นทั้งสองอย่างจึงตรวจสอบได้โดยตรง แทนที่จะถูกฝังลงในพิกเซล นั่นคือความแตกต่างระหว่างเด็คที่คุณมอบให้นักออกแบบได้ กับเด็คที่คุณมอบให้ linter ได้ ข้อกำหนดในการทำซ้ำจึงหนักหน่วงตามไปด้วย — README ระบุให้ใช้ Python 3.10, CUDA 12.6 และโหนดที่มี B200 GPU แปดตัว ปักหมุด commit เฉพาะของ verl และระบุอย่างชัดเจนว่าจำเป็นต้องมีแพตช์เทียบกับ commit นั้น เพราะ verl มาตรฐานไม่รองรับ Qwen3-VL และเตือนว่าหากไม่มีไลบรารีระบบของ Playwright เบราว์เซอร์จะล้มเหลวตอนเปิดและหน้าเพจจะได้คะแนนศูนย์ และหากไม่มีสแต็ก OCR ที่ปักหมุดไว้ ช่องสัญญาณรางวัลที่เกี่ยวข้องจะคืนค่าเป็นศูนย์แทนที่จะงดเว้น และทำให้สัญญาณเสียหายอย่างเงียบ ๆ

ตารางเกณฑ์มาตรฐาน และสี่เหตุผลที่ควรยึดมันอย่างหลวม ๆ

ตัวเลขเด่นของ AesCode-32B มาจากตัวอย่างอินโฟกราฟิก 300 ตัวอย่าง โดยสร้างสามครั้งต่อพรอมป์ที่อุณหภูมิ 0.8 และ top-p 0.95 แต่ละครั้งมีเอาต์พุตไม่เกิน 12,000 โทเคน และไม่มีการคัดเลือกจากผลลัพธ์ที่สร้างขึ้น คะแนนเป็นเปอร์เซ็นต์ เมื่อใช้ข้อมูลอ้างอิงประกอบ โมเดล 32B รายงาน Text 95.34, Boundary 97.27, Table/Chart 90.37 และค่าเฉลี่ย Rule 94.33; ด้านภาพ Content 85.76, Layout 90.58, Style 55.99 โดยมีค่าเฉลี่ย Visual 77.44 และ Overall 85.89 ในตารางเดียวกัน GPT-5.5 ที่มีข้อมูลอ้างอิงได้คะแนน Overall 81.28 และ Claude Opus 4.8 ที่มีข้อมูลอ้างอิงได้คะแนน 80.39 ขณะที่แกนหลัก Qwen3-VL-32B-Instruct ซึ่งเป็นโมเดลต้นทางที่ใช้เทรนได้คะแนน 61.10

A single-column scoreboard headed 'AesCode-32B - the scoreboard' with six rows reading 'Parameters: 33B BF16 (66.7 GB of weights)', 'Base model: Qwen3-VL-32B-Instruct', 'Overall (vendor): 85.89 vs GPT-5.5 at 81.28', 'Boundary: 97.27 - severe overflow on 4.3% of samples', 'Style: 55.99 - no model in the table clears 60' and 'Hosted API: none - self-host only', with a footer line reading 'All figures vendor-reported by Microsoft on its own rubric; no independent run has been published.'; the OrcaRouter logo sits in the bottom-right corner of the extended canvas.

ข้อควรระวังสี่ประการควรกล่าวควบคู่ไปกับตัวเลขเหล่านั้น และไม่มีข้อใดเป็นการจงใจให้ร้ายผลงานนี้ ประการแรก ทุกแถว รวมถึงแถวของ GPT-5.5 และ Claude Opus 4.8 ถูกทดสอบโดย Microsoft บน harness ของ Microsoft ด้วย rubric ของ Microsoft — นั่นไม่ใช่ตัวเลขของห้องแล็บอื่น แต่เป็นการวัดของ Microsoft ที่มีต่อโมเดลของคู่แข่ง และการ์ดเองก็เรียก rubric นั้นว่า "เฉพาะตัวอย่าง" สำหรับแต่ละ design graph ประการที่สอง rubric ถูกสร้างโดยไปป์ไลน์เดียวกับที่สร้างข้อมูลฝึก ซึ่งเป็นรูปแบบเดียวกับที่ทำให้ benchmark สามารถเอนเอียงไปทางจุดแข็งของโมเดลได้อย่างพอดี; การ์ดพูดตรงไปตรงมาเกี่ยวกับข้อจำกัดของ rubric นั้น — Style ซึ่งกำหนดให้งานออกแบบไม่ต้องแก้ไขภาพใด ๆ อีกก่อนส่งมอบ ถูกเรียกว่า "เพดานร่วมของทุกระบบ" และไม่มีโมเดลใดในตารางที่ทำได้เกิน 60 ประการที่สาม ไม่มีการวัดที่เป็นอิสระของโมเดลนี้ที่ไหนเลย: ไม่มีรายการบน leaderboard ของบุคคลที่สาม ไม่มีการทำซ้ำ และเมื่อพิจารณาว่ามีการดาวน์โหลดเพียงสองครั้ง แทบแน่นอนว่า ยังไม่มีใครนอกห้องแล็บรันมันอยู่ ประการที่สี่ การเปรียบเทียบนี้ไม่สมมาตรอย่างแนบเนียนในแบบที่น่าสังเกต — แถวทั้งหมดของ AesCode-32B เป็นแบบ reference-conditioned ดังนั้นโมเดลจึงถูกวัดในคอนฟิกูเรชันที่มันถูกฝึกมา ซึ่งการ์ดยอมรับโดยแสดงให้เห็นว่าคุณภาพยังสูงสุดเมื่อมี reference ให้

ผลลัพธ์หนึ่งเดียวในตารางที่ยืนหยัดได้ดีกว่าพาดหัวข่าวคือข้ออ้างเรื่องความทนทานมากกว่าข้ออ้างเรื่องคุณภาพ การไม่ให้ภาพอ้างอิงในขั้นตอน inference ทำให้ AesCode-8B สูญเสียเพียง 1.00 Visual point เมื่อเทียบกับ 19.55 สำหรับ backbone Qwen3-VL-8B-Instruct ของมัน และ 10.04 สำหรับ GPT-5.5 ข้อโต้แย้งของการ์ดคือ การฝึกแบบปรับตามภาพอ้างอิงหลอมรวมการวางแผนภาพเข้าไว้ในนโยบาย แทนที่จะสอนให้โมเดลคัดลอกสิ่งที่มันเห็น นั่นเป็นข้อมูลที่ผู้ขายรายงานและยังไม่มีการทำซ้ำ และยังเป็นข้ออ้างประเภทที่การรันอิสระเพียงครั้งเดียวก็สามารถตัดสินได้ — และเป็นประเภทที่สำคัญที่สุดในการใช้งานจริง ซึ่งคุณจะไม่ได้มีภาพอ้างอิงอยู่ในมือเสมอไป

ค่าใช้จ่ายในการรันคือเท่าไร และสิ่งนั้นมีความหมายอย่างไรต่อการเปรียบเทียบ

ไม่มีอะไรเกี่ยวกับโมเดลนี้ที่ถูกเลยเมื่อต้องโฮสต์เอง โทเค็นเอาต์พุตหนึ่งหมื่นถึงหนึ่งหมื่นสองพันโทเค็นคือขนาดการทำงานของอาร์ติแฟกต์เดียว และเอกสาร HTML แบบเต็มที่มีสเปก ECharts นั้นอยู่ใกล้ขอบบนของช่วงนั้นมากกว่าขอบล่าง ดังนั้นทุกการสร้างจึงเป็นการถอดรหัสที่ยาวนาน สูตรการให้บริการของการ์ดเองกำหนดให้ใช้ GPU สี่ตัวด้วย tensor parallelism เพื่อรองรับพารามิเตอร์ BF16 ประมาณ 65 GB และสูตรการฝึกกำหนดให้ใช้ B200 แปดตัว นั่นคือเครื่องจริง ไม่ใช่การติดตั้งแบบงานอดิเรก และมันกำหนดเงื่อนไขของการเปรียบเทียบ: โมเดลที่ใช้เปรียบเทียบกับ AesCode-32B นั้นเช่าเป็นรายโทเค็น และตัวโมเดลเองก็เช่าเป็นรายชั่วโมง GPU ไม่ว่าคุณจะเป็นเจ้าของฮาร์ดแวร์หรือไม่

รูปแบบที่ใช้ได้จริงของการเปรียบเทียบนั้นคือเหตุผลที่ชั้นการจัดเส้นทางมีอยู่ และคุ้มค่าที่จะพูดให้ชัดว่าเรโฮสต์อะไรและไม่โฮสต์อะไร AesCode-32B ไม่ได้อยู่ในแคตตาล็อกของ OrcaRouter และเราไม่ได้ให้บริการมัน — ไม่มีเอนด์พอยต์แบบโฮสต์สำหรับมันที่ใดก็ตามที่ผมยืนยันได้ รวมถึงของ Microsoft ด้วย สิ่งที่อยู่ในแคตตาล็อกคืออีกด้านของโต๊ะ: โมเดลแบบโฮสต์ที่คุณจะใช้เป็น基準เปรียบเทียบกับตัวสร้างอาร์ติแฟกต์ที่โฮสต์เอง ซึ่งรวมถึง GPT-5.5 และ โมเดลวิชัน Qwen3-VL ที่เล็กกว่า, เข้าถึงได้ผ่านคีย์ API เดียวในราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0%, ซึ่งหมายความว่า การเปลี่ยนแปลงราคาของผู้ขายจะมีผลฝั่งเราภายในวันเดียวกัน. การเปรียบเทียบเอนด์พอยต์แบบเช่ากับโมเดลที่คุณรันเองไม่จำเป็นต้องมีสัญญาที่สองหรือ SDK ที่สอง และ DSL สำหรับจัดเส้นทางช่วยให้การเรียกแบบโฮสต์เองอยู่ข้าง ๆ การเรียกแบบโฮสต์อื่น ๆ ภายใต้เอนด์พอยต์เดียว หาก AesCode-32B กลายเป็นว่าเก่งในสิ่งเดียวที่การ์ดของมันอ้างไว้ ค่าใช้จ่ายในการพิสูจน์ก็คือบิล GPU และค่าใช้จ่ายของทางเลือกที่คุณนำมาเปรียบเทียบก็คือคีย์หนึ่งตัวที่คุณน่าจะมีอยู่แล้ว

สิ่งที่คุณสามารถทำได้กับมันในวันนี้ และสิ่งที่ยังไม่มีอยู่

• ดาวน์โหลดและรันได้เลย — ค่าน้ำหนักเป็น Apache 2.0 ตามโครงสร้างหลัก Qwen3-VL โดยมีแชร์ด BF16 จำนวนสิบสี่ชิ้น และtransformers เส้นทางที่ใช้งานได้บนเวอร์ชัน 4.57 ขึ้นไป พร้อมสูตร vLLM ใน model card

• ทำซ้ำการฝึก — โค้ดนี้ใช้สัญญาอนุญาต MIT และสมบูรณ์พอที่จะมีความหมาย: ตัวตรวจสอบรางวัล ตัวสร้างเกณฑ์การให้คะแนน ขั้นตอน SFT และ GDPO คอมมิตของ verl ที่ปักหมุดไว้ พร้อมแพตช์ที่เพิ่มการรองรับ Qwen3-VL และ README ที่ระบุโหมดความล้มเหลวแทนที่จะซ่อนไว้

• ประเมินแบบไม่มีภาพอ้างอิง — โมเดลรองรับพรอมป์ทั้งที่มีและไม่มีภาพอ้างอิง และข้ออ้างที่ทดสอบได้มากที่สุดของการ์ดนี้อยู่ในคอนฟิกูเรชันดังกล่าว

• หา API สำหรับมัน — คุณทำไม่ได้ ไม่มีเอนด์พอยต์ที่โฮสต์ไว้ ไม่มีการแมปผู้ให้บริการ inference บนรีโพซิทอรี และไม่มีบิลด์ GGUF หรือ MLX; การรันสิ่งนี้หมายถึงการรันฮาร์ดแวร์

• อ่านเปเปอร์ — คุณยังทำไม่ได้ในตอนนี้ การ์ดนี้ลิงก์ไปยังเปเปอร์ชื่อ AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards และรายการ BibTeX ของตัวมันเองระบุสถานที่ตีพิมพ์ว่า "Under review" และระบุปีเป็น 2027 การค้นหาใน arXiv ไม่พบบทความที่มีชื่อนั้น มีเปเปอร์ของ Microsoft อีกฉบับที่เก่ากว่าและมีชื่อใกล้เคียงกันแทบจะเหมือนกัน — Code Aesthetics with Agentic Reward Feedback จากเดือนตุลาคม 2025 ซึ่งเปิดตัวโมเดล AesCoder-4B และชุดข้อมูล AesCode-358K — และไม่มีอะไรในการ์ด AesCode-32B ที่อ้างอิงถึงมันหรือระบุความเกี่ยวข้องกับมัน หากคุณไปค้นหาอ่านเป็นข้อมูลพื้นฐานแล้วไปเจอฉบับนั้นแทน คุณกำลังอ่านเกี่ยวกับโมเดลอีกตัวหนึ่งที่สร้างโดยกลุ่มผู้เขียนที่ทับซ้อนกัน

• เปรียบเทียบมันบนกระดานผู้นำสาธารณะ — ยังไม่มี ยังไม่ปรากฏว่ามีดัชนีจากบุคคลที่สามรายใดได้ประเมินมัน ซึ่งไม่น่าแปลกใจสำหรับรีโพซิทอรีที่มีดาวน์โหลดเพียงสองครั้ง

ใครควรใส่ใจ และใครควรรอ

กลุ่มเป้าหมายสำหรับสิ่งนี้แคบกว่าที่ตารางหัวข้อแนะนำ และเจาะจงมากกว่า "ใครก็ตามที่สร้างด้วยโมเดล" ถ้าผลิตภัณฑ์ของคุณเปลี่ยนพรอมป์ต์เป็นสไลด์ โปสเตอร์ รายงาน หรือแดชบอร์ดที่ใครบางคนต้องแก้ไขในภายหลัง คุณได้ค้นพบทางเลือกที่โมเดลนี้มุ่งเป้าไปแล้ว: การสร้างภาพทำให้คุณได้สี่เหลี่ยมสวยงามที่คุณเปลี่ยนแปลงไม่ได้ และการสร้างโค้ดทำให้คุณได้สิ่งที่แก้ไขได้ซึ่งดูเหมือนถูกประกอบโดยคอมไพเลอร์ โมเดล 33B แบบเปิดน้ำหนักที่สร้างเอกสาร HTML ทั้งหมดพร้อมตารางจริงและสเปก ECharts ที่คงคุณภาพไว้ภายในประมาณหนึ่งจุดจากคุณภาพเมื่อมีเรฟเฟอเรนซ์เมื่อคุณไม่มีเรฟเฟอเรนซ์ให้มัน และที่คุณสามารถปรับแต่งให้เข้ากับสไตล์เฉพาะของคุณภายใต้ Apache 2.0 เป็นสิ่งที่มีประโยชน์อย่างแท้จริงที่จะมีอยู่ ไม่มีโมเดลของใครอื่นที่ทำงานนั้นได้ตรง ๆ ในขนาดนี้ด้วยเงื่อนไขเหล่านี้

ในทางตรงกันข้าม: ทุกสิ่งที่คุณรู้เกี่ยวกับคุณภาพล้วนมาจากตารางที่ผู้ขายสร้างขึ้น เกณฑ์การให้คะแนนที่อยู่เบื้องหลังถูกผลิตโดยกระบวนการเดียวกับที่สร้างข้อมูลฝึก และเพดานหนึ่งเดียวที่การ์ดยอมรับ — คะแนน Style ต่ำกว่า 60 สำหรับทุกระบบที่ทดสอบ — ก็เป็นมิติที่ผลิตภัณฑ์ที่ไวต่อการออกแบบให้ความสำคัญมากที่สุดพอดี ทีมที่มีเหตุผลด้านการปฏิบัติตามข้อกำหนดในการเก็บการสร้างไว้ภายในองค์กร และมีโหนดแปด GPU สำรอง ก็มีมากพอจะเริ่มได้ตั้งแต่วันนี้ ส่วนทีมที่กำลังเลือกโมเดลสำหรับโปรดักชันสัปดาห์หน้า ไม่มีตัวเลขอิสระให้ใช้ตัดสินใจเลือก และไม่ควรอ่าน 85.89 เทียบกับ 81.28 ว่าเป็นผลลัพธ์ที่ยุติแล้ว

อะไรจะทำให้สิ่งนี้กลายเป็นเรื่องราว

สี่สิ่ง ซึ่งยังไม่มีสักอย่างในตอนนี้ การประกาศ — Microsoft ยังไม่ได้กล่าวอะไรเลย และเปเปอร์ที่การ์ดอ้างถึงก็ระบุชัดว่าอยู่ระหว่างการพิจารณา ดังนั้นรายงานทางเทคนิคที่มีรายละเอียดการฝึกเกินกว่าสรุปในการ์ดอาจปรากฏขึ้นได้ทุกเมื่อ การรันอิสระ — ข้ออ้างเรื่องความทนทานแบบไม่ต้องอ้างอิง และคะแนน Boundary ซึ่งการ์ดบอกว่าตกไปสู่ความล้มเหลวรุนแรงใน 4.3% ของตัวอย่าง เทียบกับ 34.7% สำหรับ GPT-5.5 ทั้งสองอย่างล้วนทดสอบได้ไม่แพงและคุ้มค่าที่จะทดสอบ การรองรับการให้บริการนอกสูตรของผู้ขาย — บิลด์ GGUF หรือรายการในรันไทม์กระแสหลักจะเปลี่ยนเรื่องราวด้านฮาร์ดแวร์มากกว่าเบนช์มาร์กใด ๆ และจุดข้อมูลที่สองในคำถามเรื่องขนาด: โมเดล 8B ที่ได้ 82.94 Overall เทียบกับ 85.89 ของ 32B บนตารางเดียวกัน คือช่องว่างสองจุดด้วยพารามิเตอร์เพียงหนึ่งในสี่ ซึ่งเป็นเรื่องประเภทที่อาจถูกทำซ้ำ หรือไม่ก็เงียบ ๆ เลิกถูกกล่าวถึงไปเอง

จนกว่าหนึ่งในนั้นจะเกิดขึ้นจริง คำอธิบายที่ถูกต้องของ AesCode-32B ก็คือ: น้ำหนักโมเดลจริงภายใต้สัญญาอนุญาตแบบเปิดกว้าง ชุดการฝึกที่ให้รายละเอียดมากพอจะถูกทำซ้ำโดยห้องปฏิบัติการที่มีทรัพยากรพร้อม ตารางการวัดประสิทธิภาพที่เป็นการวัดของบริษัทหนึ่งต่อโมเดลของตนเองและของคู่แข่งสองราย ตลอดจนประวัติของคลังโค้ดที่ทำให้คุณไม่สามารถเรียกวันใดวันหนึ่งว่าวันเปิดตัวได้ มันเป็นสิ่งประดิษฐ์ที่น่าสนใจกว่าที่ตัวนับซึ่งแสดงว่ามีผู้ดาวน์โหลดสองครั้งของมันบอกเป็นนัย และเป็นสิ่งที่ยังพิสูจน์ได้น้อยกว่าที่ค่า 85.89 ของมันบอกเป็นนัย ทั้งสองครึ่งของประโยคนั้นคือการตีความอย่างซื่อตรง ณ วันที่ 11 ตุลาคม 2026

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube