
AesCode-32B: โมเดล 33B ที่เงียบๆ ของ Microsoft ซึ่งเขียนสไลด์เป็น HTML ที่แก้ไขได้
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 87 tok/s
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
การประทับเวลาใน AesCode-32B ไม่ตรงกันระหว่างกันเอง และความไม่ตรงกันนี้ก็คือเนื้อหาหลักเกือบทั้งหมดที่พอจะรายงานได้microsoft/AesCode-32B บนที่เก็บ Hugging Face ถูกสร้างขึ้นเมื่อวันที่ 29 กันยายน 2026 แต่ทุกสิ่งในนั้นเข้ามาในคอมมิตเดียวที่ลงวันที่ 7 ตุลาคม 2026 ซึ่งข้อความกำกับเขียนไว้เพียงว่า "Release AesCode-32B" — และชุดเครื่องมือฝึกที่ทำให้ผลลัพธ์สามารถทำซ้ำได้ถูกพุชขึ้นไปที่github.com/microsoft/AesCode เมื่อวันที่ 8 ตุลาคม ไมโครซอฟต์ไม่ได้ประกาศอะไรเลย ไม่มีโพสต์บล็อก ไม่มี preprint บน arXiv ไม่มีการส่งเข้าสู่กระดานจัดอันดับ ไม่มีหน้าโมเดลบนเว็บไซต์ของตัวเอง สิ่งที่มีอยู่คือโมเดลภาษา-ภาพขนาด 33,000 ล้านพารามิเตอร์ที่รับพรอมต์แล้วส่งออกเอกสาร HTML ที่สมบูรณ์และครบในตัวเอง — สไลด์ โปสเตอร์ แดชบอร์ด — พร้อมกับโมเดลคู่หูที่เล็กกว่า microsoft/AesCode-8B ทั้งสองถูกปรับละเอียดมาจากโมเดลภาพ-ภาษา Qwen3-VL — Qwen3-VL-32B-Instruct และ Qwen3-VL-8B-Instruct ตามลำดับ — ทั้งคู่ใช้สัญญาอนุญาต Apache 2.0 และทั้งคู่ดาวน์โหลดได้ในวันนี้
ไอดีของรีโปอ่านว่า microsoft/AesCode-32B และการ์ดก็เปิดด้วยทริกว่า AesCode จับคู่พรอมป์ของคุณกับภาพที่สร้างจากพรอมป์เดียวกันนั้น ใช้ภาพเป็นข้อมูลอ้างอิงด้านความสวยงาม แล้วยึดตามข้อความสำหรับเนื้อหาจริง ๆ ตัวสร้างภาพประกอบหน้าเว็บออกมาได้สวยงามแต่เรนเดอร์ตัวเลขบนหน้านั้นผิด ส่วนโมเดลโค้ดทำตัวเลขได้ถูกต้องแต่มองไม่เห็นว่าหน้านั้นหน้าตาเป็นอย่างไร AesCode คือความพยายามที่จะได้ทั้งสองอย่าง และบทสรุปที่ตรงไปตรงมาของมัน ณ วันที่ 11 ตุลาคม 2026 ก็คือ ค่าน้ำหนักเป็นของจริงและตรวจสอบได้ ตัวเลข benchmark เป็นของแล็บเองบนฮาร์เนสที่แล็บเขียนขึ้น และยังไม่มีใครนอกไมโครซอฟต์เผยแพร่ตัวเลขของมันเลย บทความนี้แยกสามหมวดนั้นออกจากกันตลอดทั้งเรื่อง
จริง ๆ แล้วมีอะไรอยู่ในรีโพซิทอรีกันแน่ ไบต์ต่อไบต์

เริ่มจากสิ่งที่คุณตรวจสอบได้เองโดยไม่ต้องเชื่อสักคำจากโมเดลการ์ด รีโพซิทอรีขนาด 32B บรรจุไฟล์ safetensors จำนวนสิบสี่แชร์ด รวมขนาดทั้งสิ้น 66,714,912,704 ไบต์ ซึ่งที่ BF16 คิดเป็นพารามิเตอร์ประมาณ 33.4 พันล้านตัว — สอดคล้องกับ "33B params" ในโมเดลการ์ด และคำเตือนที่ว่าเฉพาะน้ำหนักอย่างเดียวก็ต้องใช้หน่วยความจำของตัวเร่งความเร็วราว 65 GB แล้ว คอนฟิกประกาศว่า Qwen3VLForConditionalGeneration เป็นสถาปัตยกรรม และ qwen3_vl เป็นประเภทโมเดล ดังนั้นนี่จึงไม่ใช่สถาปัตยกรรมใหม่และไม่จำเป็นต้องมีสถาปัตยกรรมใหม่ใด ๆ: มันโหลดได้ด้วย transformers>=4.57 และโมเดลการ์ดยังมาพร้อมคำสั่ง vLLM ที่ให้บริการโมเดลนี้กระจายไปยังแรงก์แบบ tensor-parallel สี่แรงก์ โดยอนุญาตให้ใส่ภาพได้สองภาพต่อพรอมป์ต์หนึ่งครั้ง และมีเพดานที่ 24,576 โทเคน
ตัวนับการมีส่วนร่วมเป็นส่วนที่เงียบที่สุดของการเปิดตัวครั้งนี้ ณ เวลาที่เขียน มีการดาวน์โหลดสองครั้งและถูกกดถูกใจหนึ่งครั้งบนรีโพซิทอรี 32B ไม่มีรายการในแมปผู้ให้บริการ inference ของ Hugging Face ซึ่งหมายความว่าไม่มีปลายทางแบบโฮสต์ใดเชื่อมต่ออยู่เบื้องหลังหน้ารีโพ และไม่มีการโฆษณาบิลด์ GGUF, MLX หรือ llama.cpp ที่ใดเลย สำหรับโมเดลที่แบกชื่อ Microsoft และมีผลลัพธ์ที่เอาชนะ GPT-5.5 บนตารางของเจ้าของเอง นั่นถือเป็นการปรากฏตัวที่เล็กอย่างน่าตกใจ — และเป็นหลักฐานที่หนักแน่นที่สุดเท่าที่มีว่าสิ่งนี้ถูกนำขึ้นโดยไม่มีงานเปิดตัวรองรับอยู่เบื้องหลัง
ที่เก็บโค้ดที่มาคู่กันเติมเต็มอีกครึ่งหนึ่งของไทม์ไลน์ และนี่คือจุดที่คำถามเรื่องวันเผยแพร่กลายเป็นเรื่องกำกวมอย่างแท้จริง microsoft/AesCodeถูกสร้างขึ้นเมื่อวันที่ 23 กรกฎาคม 2026 — สิบสัปดาห์ก่อนน้ำหนักโมเดล — และมีคอมมิตทั้งหมดสิบสี่รายการ ทุกรายการเขียนโดยผู้มีส่วนร่วมคนเดียวกัน และทุกรายการมีเวลากำกับอยู่ภายในยี่สิบวินาทีของกันและกันในวันที่ 8 ตุลาคม 2026 ระหว่าง 23:14:04 ถึง 23:14:24 UTC ซึ่งประกอบด้วยสเปกสำหรับการสร้างพรอมป์ต์และข้อกำหนดที่ตรวจสอบได้ ไปป์ไลน์ข้อมูลที่สร้างกราฟการออกแบบและคำถามแบบรูบริก ขั้นตอน SFT แบบ cold-start ลูปการเรียนรู้แบบเสริมกำลัง GDPO ตัวตรวจสอบการเรนเดอร์ที่ใช้ Playwright เทสต์ และ README ที่อธิบายรายละเอียดทั้งหมดนี้ ไม่มีรีลีสและไม่มีแท็ก คำอธิบายที่เก็บว่างเปล่า และมีดาวหนึ่งดวง

แล้ววันไหนกันแน่ที่เป็นวันเปิดตัว? บันทึกของรีโพซิทอรีบอกว่า 29 กันยายน คอมมิตที่บรรจุโมเดลบอกว่า 7 ตุลาคม โค้ดที่อธิบายว่าโมเดลถูกสร้างขึ้นมาอย่างไรบอกว่า 8 ตุลาคม เวลาประทับสามรายการภายในหน้าต่างสองสัปดาห์เดียว โดยไม่มีรายการใดเลยที่มีประโยคจาก Microsoft ว่า "เรากำลังปล่อยสิ่งนี้" ให้ถือว่า 7–8 ตุลาคม เป็นวันที่ใช้ได้จริงสำหรับอาร์ติแฟกต์ที่คนส่วนใหญ่จะดาวน์โหลดจริง และ 29 กันยายน เป็นวันที่รีโพซิทอรีถูกจองไว้ ใครก็ตามที่บอกคุณว่า AesCode-32B "เปิดตัว" ในวันใดวันหนึ่งโดยเฉพาะ กำลังเลือกหนึ่งในเวลาประทับเหล่านั้นแทนคุณ
กลไก: รูปภาพเป็นแนวทางด้านสุนทรียศาสตร์ กราฟเป็นรางวัล
ข้อกล่าวอ้างทางเทคนิคของการ์ดนี้แคบและเจาะจง ซึ่งเป็นข้อดีอย่างหนึ่ง โมเดลนี้ถูกฝึกด้วย cold-start supervised fine-tuning บนตัวอย่างสาธิต 3,000 รายการที่อัตราการเรียนรู้ 1e-5 จากนั้นฝึกด้วย GDPO ซึ่งเป็นรูปแบบหนึ่งของ group-relative policy optimisation บนพรอมป์ 7,408 รายการเป็นเวลา 520 สเต็ป โมเดล 8B ใช้สูตรเดียวกันและหยุดที่ 400 สเต็ป การรัน RL ใช้เอนจินไฮบริด FSDP-vLLM ของ verl โดยไม่มี critic และไม่มีโมเดลรางวัลที่ฝึกแยกต่างหาก ใช้ AdamW ที่ค่า 5e-6 คงที่โดยไม่มี warmup ใช้ 128 พรอมป์ต่อสเต็ปโดยแต่ละพรอมป์มี 8 rollouts และพรอมป์กับการตอบกลับถูกจำกัดไว้ที่ 8,192 โทเคนแต่ละส่วน
สิ่งที่ทำให้รางวัลนี้ไม่ธรรมดาคือมันไม่ใช่ค่าสเกลาร์ตัวเดียว แต่ละเป้าหมายการฝึกอบรมถูกอธิบายเป็นกราฟการออกแบบที่ครอบคลุมทั้งแคนวาส ดังนั้นคุณสมบัติแต่ละอย่างจึงสามารถระบุแยกได้ จากกราฟนั้นได้เจ็ดช่องสัญญาณ — การดำเนินการ, ข้อความ, ขอบเขต, ตารางแผนภูมิ, เลย์เอาต์, ช่องว่าง และการออกแบบ — แต่ละช่องถูกทำให้เป็นบรรทัดฐานภายในกลุ่มโรลเอาต์ของมันก่อนการรวม เพื่อไม่ให้สัญญาณที่โดดเด่นตัวหนึ่งกลบเสียงอื่นๆ ตัวตรวจสอบแบบดีเทอร์มินิสติกให้คะแนนสิ่งที่สามารถแยกวิเคราะห์ได้จากโค้ดและการเรนเดอร์ของมัน; ผู้ตัดสินด้านภาพและภาษาให้คะแนนสิ่งที่ทำไม่ได้ โดยใช้เกณฑ์การให้คะแนนที่ผูกกับองค์ประกอบและความสัมพันธ์ของกราฟเอง HTML ที่เป็นตัวเลือกจะถูกให้คะแนนโดยการเรนเดอร์ในเบราว์เซอร์ Playwright แบบแซนด์บ็อกซ์โดยบล็อกคำขอภายนอก ซึ่งส่งออก DOM, สไตล์ที่คำนวณแล้ว, กล่องขอบเขต, สถานะคอนโซล และภาพหน้าจอ
ผลลัพธ์เชิงวิศวกรรมนี้ควรค่าแก่การระบุ เพราะมันปรากฏอยู่ในผลลัพธ์ที่คุณได้รับ: โมเดลได้รับการฝึกให้ส่งออกตารางเป็นโครงสร้างตาราง HTML จริง และแผนภูมิเป็นสเปก ECharts ดังนั้นทั้งสองอย่างจึงตรวจสอบได้โดยตรง แทนที่จะถูกฝังลงในพิกเซล นั่นคือความแตกต่างระหว่างเด็คที่คุณมอบให้นักออกแบบได้ กับเด็คที่คุณมอบให้ linter ได้ ข้อกำหนดในการทำซ้ำจึงหนักหน่วงตามไปด้วย — README ระบุให้ใช้ Python 3.10, CUDA 12.6 และโหนดที่มี B200 GPU แปดตัว ปักหมุด commit เฉพาะของ verl และระบุอย่างชัดเจนว่าจำเป็นต้องมีแพตช์เทียบกับ commit นั้น เพราะ verl มาตรฐานไม่รองรับ Qwen3-VL และเตือนว่าหากไม่มีไลบรารีระบบของ Playwright เบราว์เซอร์จะล้มเหลวตอนเปิดและหน้าเพจจะได้คะแนนศูนย์ และหากไม่มีสแต็ก OCR ที่ปักหมุดไว้ ช่องสัญญาณรางวัลที่เกี่ยวข้องจะคืนค่าเป็นศูนย์แทนที่จะงดเว้น และทำให้สัญญาณเสียหายอย่างเงียบ ๆ
ตารางเกณฑ์มาตรฐาน และสี่เหตุผลที่ควรยึดมันอย่างหลวม ๆ
ตัวเลขเด่นของ AesCode-32B มาจากตัวอย่างอินโฟกราฟิก 300 ตัวอย่าง โดยสร้างสามครั้งต่อพรอมป์ที่อุณหภูมิ 0.8 และ top-p 0.95 แต่ละครั้งมีเอาต์พุตไม่เกิน 12,000 โทเคน และไม่มีการคัดเลือกจากผลลัพธ์ที่สร้างขึ้น คะแนนเป็นเปอร์เซ็นต์ เมื่อใช้ข้อมูลอ้างอิงประกอบ โมเดล 32B รายงาน Text 95.34, Boundary 97.27, Table/Chart 90.37 และค่าเฉลี่ย Rule 94.33; ด้านภาพ Content 85.76, Layout 90.58, Style 55.99 โดยมีค่าเฉลี่ย Visual 77.44 และ Overall 85.89 ในตารางเดียวกัน GPT-5.5 ที่มีข้อมูลอ้างอิงได้คะแนน Overall 81.28 และ Claude Opus 4.8 ที่มีข้อมูลอ้างอิงได้คะแนน 80.39 ขณะที่แกนหลัก Qwen3-VL-32B-Instruct ซึ่งเป็นโมเดลต้นทางที่ใช้เทรนได้คะแนน 61.10

ข้อควรระวังสี่ประการควรกล่าวควบคู่ไปกับตัวเลขเหล่านั้น และไม่มีข้อใดเป็นการจงใจให้ร้ายผลงานนี้ ประการแรก ทุกแถว รวมถึงแถวของ GPT-5.5 และ Claude Opus 4.8 ถูกทดสอบโดย Microsoft บน harness ของ Microsoft ด้วย rubric ของ Microsoft — นั่นไม่ใช่ตัวเลขของห้องแล็บอื่น แต่เป็นการวัดของ Microsoft ที่มีต่อโมเดลของคู่แข่ง และการ์ดเองก็เรียก rubric นั้นว่า "เฉพาะตัวอย่าง" สำหรับแต่ละ design graph ประการที่สอง rubric ถูกสร้างโดยไปป์ไลน์เดียวกับที่สร้างข้อมูลฝึก ซึ่งเป็นรูปแบบเดียวกับที่ทำให้ benchmark สามารถเอนเอียงไปทางจุดแข็งของโมเดลได้อย่างพอดี; การ์ดพูดตรงไปตรงมาเกี่ยวกับข้อจำกัดของ rubric นั้น — Style ซึ่งกำหนดให้งานออกแบบไม่ต้องแก้ไขภาพใด ๆ อีกก่อนส่งมอบ ถูกเรียกว่า "เพดานร่วมของทุกระบบ" และไม่มีโมเดลใดในตารางที่ทำได้เกิน 60 ประการที่สาม ไม่มีการวัดที่เป็นอิสระของโมเดลนี้ที่ไหนเลย: ไม่มีรายการบน leaderboard ของบุคคลที่สาม ไม่มีการทำซ้ำ และเมื่อพิจารณาว่ามีการดาวน์โหลดเพียงสองครั้ง แทบแน่นอนว่า ยังไม่มีใครนอกห้องแล็บรันมันอยู่ ประการที่สี่ การเปรียบเทียบนี้ไม่สมมาตรอย่างแนบเนียนในแบบที่น่าสังเกต — แถวทั้งหมดของ AesCode-32B เป็นแบบ reference-conditioned ดังนั้นโมเดลจึงถูกวัดในคอนฟิกูเรชันที่มันถูกฝึกมา ซึ่งการ์ดยอมรับโดยแสดงให้เห็นว่าคุณภาพยังสูงสุดเมื่อมี reference ให้
ผลลัพธ์หนึ่งเดียวในตารางที่ยืนหยัดได้ดีกว่าพาดหัวข่าวคือข้ออ้างเรื่องความทนทานมากกว่าข้ออ้างเรื่องคุณภาพ การไม่ให้ภาพอ้างอิงในขั้นตอน inference ทำให้ AesCode-8B สูญเสียเพียง 1.00 Visual point เมื่อเทียบกับ 19.55 สำหรับ backbone Qwen3-VL-8B-Instruct ของมัน และ 10.04 สำหรับ GPT-5.5 ข้อโต้แย้งของการ์ดคือ การฝึกแบบปรับตามภาพอ้างอิงหลอมรวมการวางแผนภาพเข้าไว้ในนโยบาย แทนที่จะสอนให้โมเดลคัดลอกสิ่งที่มันเห็น นั่นเป็นข้อมูลที่ผู้ขายรายงานและยังไม่มีการทำซ้ำ และยังเป็นข้ออ้างประเภทที่การรันอิสระเพียงครั้งเดียวก็สามารถตัดสินได้ — และเป็นประเภทที่สำคัญที่สุดในการใช้งานจริง ซึ่งคุณจะไม่ได้มีภาพอ้างอิงอยู่ในมือเสมอไป
ค่าใช้จ่ายในการรันคือเท่าไร และสิ่งนั้นมีความหมายอย่างไรต่อการเปรียบเทียบ
ไม่มีอะไรเกี่ยวกับโมเดลนี้ที่ถูกเลยเมื่อต้องโฮสต์เอง โทเค็นเอาต์พุตหนึ่งหมื่นถึงหนึ่งหมื่นสองพันโทเค็นคือขนาดการทำงานของอาร์ติแฟกต์เดียว และเอกสาร HTML แบบเต็มที่มีสเปก ECharts นั้นอยู่ใกล้ขอบบนของช่วงนั้นมากกว่าขอบล่าง ดังนั้นทุกการสร้างจึงเป็นการถอดรหัสที่ยาวนาน สูตรการให้บริการของการ์ดเองกำหนดให้ใช้ GPU สี่ตัวด้วย tensor parallelism เพื่อรองรับพารามิเตอร์ BF16 ประมาณ 65 GB และสูตรการฝึกกำหนดให้ใช้ B200 แปดตัว นั่นคือเครื่องจริง ไม่ใช่การติดตั้งแบบงานอดิเรก และมันกำหนดเงื่อนไขของการเปรียบเทียบ: โมเดลที่ใช้เปรียบเทียบกับ AesCode-32B นั้นเช่าเป็นรายโทเค็น และตัวโมเดลเองก็เช่าเป็นรายชั่วโมง GPU ไม่ว่าคุณจะเป็นเจ้าของฮาร์ดแวร์หรือไม่
รูปแบบที่ใช้ได้จริงของการเปรียบเทียบนั้นคือเหตุผลที่ชั้นการจัดเส้นทางมีอยู่ และคุ้มค่าที่จะพูดให้ชัดว่าเรโฮสต์อะไรและไม่โฮสต์อะไร AesCode-32B ไม่ได้อยู่ในแคตตาล็อกของ OrcaRouter และเราไม่ได้ให้บริการมัน — ไม่มีเอนด์พอยต์แบบโฮสต์สำหรับมันที่ใดก็ตามที่ผมยืนยันได้ รวมถึงของ Microsoft ด้วย สิ่งที่อยู่ในแคตตาล็อกคืออีกด้านของโต๊ะ: โมเดลแบบโฮสต์ที่คุณจะใช้เป็น基準เปรียบเทียบกับตัวสร้างอาร์ติแฟกต์ที่โฮสต์เอง ซึ่งรวมถึง GPT-5.5 และ โมเดลวิชัน Qwen3-VL ที่เล็กกว่า, เข้าถึงได้ผ่านคีย์ API เดียวในราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0%, ซึ่งหมายความว่า การเปลี่ยนแปลงราคาของผู้ขายจะมีผลฝั่งเราภายในวันเดียวกัน. การเปรียบเทียบเอนด์พอยต์แบบเช่ากับโมเดลที่คุณรันเองไม่จำเป็นต้องมีสัญญาที่สองหรือ SDK ที่สอง และ DSL สำหรับจัดเส้นทางช่วยให้การเรียกแบบโฮสต์เองอยู่ข้าง ๆ การเรียกแบบโฮสต์อื่น ๆ ภายใต้เอนด์พอยต์เดียว หาก AesCode-32B กลายเป็นว่าเก่งในสิ่งเดียวที่การ์ดของมันอ้างไว้ ค่าใช้จ่ายในการพิสูจน์ก็คือบิล GPU และค่าใช้จ่ายของทางเลือกที่คุณนำมาเปรียบเทียบก็คือคีย์หนึ่งตัวที่คุณน่าจะมีอยู่แล้ว
สิ่งที่คุณสามารถทำได้กับมันในวันนี้ และสิ่งที่ยังไม่มีอยู่
• ดาวน์โหลดและรันได้เลย — ค่าน้ำหนักเป็น Apache 2.0 ตามโครงสร้างหลัก Qwen3-VL โดยมีแชร์ด BF16 จำนวนสิบสี่ชิ้น และtransformers เส้นทางที่ใช้งานได้บนเวอร์ชัน 4.57 ขึ้นไป พร้อมสูตร vLLM ใน model card
• ทำซ้ำการฝึก — โค้ดนี้ใช้สัญญาอนุญาต MIT และสมบูรณ์พอที่จะมีความหมาย: ตัวตรวจสอบรางวัล ตัวสร้างเกณฑ์การให้คะแนน ขั้นตอน SFT และ GDPO คอมมิตของ verl ที่ปักหมุดไว้ พร้อมแพตช์ที่เพิ่มการรองรับ Qwen3-VL และ README ที่ระบุโหมดความล้มเหลวแทนที่จะซ่อนไว้
• ประเมินแบบไม่มีภาพอ้างอิง — โมเดลรองรับพรอมป์ทั้งที่มีและไม่มีภาพอ้างอิง และข้ออ้างที่ทดสอบได้มากที่สุดของการ์ดนี้อยู่ในคอนฟิกูเรชันดังกล่าว
• หา API สำหรับมัน — คุณทำไม่ได้ ไม่มีเอนด์พอยต์ที่โฮสต์ไว้ ไม่มีการแมปผู้ให้บริการ inference บนรีโพซิทอรี และไม่มีบิลด์ GGUF หรือ MLX; การรันสิ่งนี้หมายถึงการรันฮาร์ดแวร์
• อ่านเปเปอร์ — คุณยังทำไม่ได้ในตอนนี้ การ์ดนี้ลิงก์ไปยังเปเปอร์ชื่อ AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards และรายการ BibTeX ของตัวมันเองระบุสถานที่ตีพิมพ์ว่า "Under review" และระบุปีเป็น 2027 การค้นหาใน arXiv ไม่พบบทความที่มีชื่อนั้น มีเปเปอร์ของ Microsoft อีกฉบับที่เก่ากว่าและมีชื่อใกล้เคียงกันแทบจะเหมือนกัน — Code Aesthetics with Agentic Reward Feedback จากเดือนตุลาคม 2025 ซึ่งเปิดตัวโมเดล AesCoder-4B และชุดข้อมูล AesCode-358K — และไม่มีอะไรในการ์ด AesCode-32B ที่อ้างอิงถึงมันหรือระบุความเกี่ยวข้องกับมัน หากคุณไปค้นหาอ่านเป็นข้อมูลพื้นฐานแล้วไปเจอฉบับนั้นแทน คุณกำลังอ่านเกี่ยวกับโมเดลอีกตัวหนึ่งที่สร้างโดยกลุ่มผู้เขียนที่ทับซ้อนกัน
• เปรียบเทียบมันบนกระดานผู้นำสาธารณะ — ยังไม่มี ยังไม่ปรากฏว่ามีดัชนีจากบุคคลที่สามรายใดได้ประเมินมัน ซึ่งไม่น่าแปลกใจสำหรับรีโพซิทอรีที่มีดาวน์โหลดเพียงสองครั้ง
ใครควรใส่ใจ และใครควรรอ
กลุ่มเป้าหมายสำหรับสิ่งนี้แคบกว่าที่ตารางหัวข้อแนะนำ และเจาะจงมากกว่า "ใครก็ตามที่สร้างด้วยโมเดล" ถ้าผลิตภัณฑ์ของคุณเปลี่ยนพรอมป์ต์เป็นสไลด์ โปสเตอร์ รายงาน หรือแดชบอร์ดที่ใครบางคนต้องแก้ไขในภายหลัง คุณได้ค้นพบทางเลือกที่โมเดลนี้มุ่งเป้าไปแล้ว: การสร้างภาพทำให้คุณได้สี่เหลี่ยมสวยงามที่คุณเปลี่ยนแปลงไม่ได้ และการสร้างโค้ดทำให้คุณได้สิ่งที่แก้ไขได้ซึ่งดูเหมือนถูกประกอบโดยคอมไพเลอร์ โมเดล 33B แบบเปิดน้ำหนักที่สร้างเอกสาร HTML ทั้งหมดพร้อมตารางจริงและสเปก ECharts ที่คงคุณภาพไว้ภายในประมาณหนึ่งจุดจากคุณภาพเมื่อมีเรฟเฟอเรนซ์เมื่อคุณไม่มีเรฟเฟอเรนซ์ให้มัน และที่คุณสามารถปรับแต่งให้เข้ากับสไตล์เฉพาะของคุณภายใต้ Apache 2.0 เป็นสิ่งที่มีประโยชน์อย่างแท้จริงที่จะมีอยู่ ไม่มีโมเดลของใครอื่นที่ทำงานนั้นได้ตรง ๆ ในขนาดนี้ด้วยเงื่อนไขเหล่านี้
ในทางตรงกันข้าม: ทุกสิ่งที่คุณรู้เกี่ยวกับคุณภาพล้วนมาจากตารางที่ผู้ขายสร้างขึ้น เกณฑ์การให้คะแนนที่อยู่เบื้องหลังถูกผลิตโดยกระบวนการเดียวกับที่สร้างข้อมูลฝึก และเพดานหนึ่งเดียวที่การ์ดยอมรับ — คะแนน Style ต่ำกว่า 60 สำหรับทุกระบบที่ทดสอบ — ก็เป็นมิติที่ผลิตภัณฑ์ที่ไวต่อการออกแบบให้ความสำคัญมากที่สุดพอดี ทีมที่มีเหตุผลด้านการปฏิบัติตามข้อกำหนดในการเก็บการสร้างไว้ภายในองค์กร และมีโหนดแปด GPU สำรอง ก็มีมากพอจะเริ่มได้ตั้งแต่วันนี้ ส่วนทีมที่กำลังเลือกโมเดลสำหรับโปรดักชันสัปดาห์หน้า ไม่มีตัวเลขอิสระให้ใช้ตัดสินใจเลือก และไม่ควรอ่าน 85.89 เทียบกับ 81.28 ว่าเป็นผลลัพธ์ที่ยุติแล้ว
อะไรจะทำให้สิ่งนี้กลายเป็นเรื่องราว
สี่สิ่ง ซึ่งยังไม่มีสักอย่างในตอนนี้ การประกาศ — Microsoft ยังไม่ได้กล่าวอะไรเลย และเปเปอร์ที่การ์ดอ้างถึงก็ระบุชัดว่าอยู่ระหว่างการพิจารณา ดังนั้นรายงานทางเทคนิคที่มีรายละเอียดการฝึกเกินกว่าสรุปในการ์ดอาจปรากฏขึ้นได้ทุกเมื่อ การรันอิสระ — ข้ออ้างเรื่องความทนทานแบบไม่ต้องอ้างอิง และคะแนน Boundary ซึ่งการ์ดบอกว่าตกไปสู่ความล้มเหลวรุนแรงใน 4.3% ของตัวอย่าง เทียบกับ 34.7% สำหรับ GPT-5.5 ทั้งสองอย่างล้วนทดสอบได้ไม่แพงและคุ้มค่าที่จะทดสอบ การรองรับการให้บริการนอกสูตรของผู้ขาย — บิลด์ GGUF หรือรายการในรันไทม์กระแสหลักจะเปลี่ยนเรื่องราวด้านฮาร์ดแวร์มากกว่าเบนช์มาร์กใด ๆ และจุดข้อมูลที่สองในคำถามเรื่องขนาด: โมเดล 8B ที่ได้ 82.94 Overall เทียบกับ 85.89 ของ 32B บนตารางเดียวกัน คือช่องว่างสองจุดด้วยพารามิเตอร์เพียงหนึ่งในสี่ ซึ่งเป็นเรื่องประเภทที่อาจถูกทำซ้ำ หรือไม่ก็เงียบ ๆ เลิกถูกกล่าวถึงไปเอง
จนกว่าหนึ่งในนั้นจะเกิดขึ้นจริง คำอธิบายที่ถูกต้องของ AesCode-32B ก็คือ: น้ำหนักโมเดลจริงภายใต้สัญญาอนุญาตแบบเปิดกว้าง ชุดการฝึกที่ให้รายละเอียดมากพอจะถูกทำซ้ำโดยห้องปฏิบัติการที่มีทรัพยากรพร้อม ตารางการวัดประสิทธิภาพที่เป็นการวัดของบริษัทหนึ่งต่อโมเดลของตนเองและของคู่แข่งสองราย ตลอดจนประวัติของคลังโค้ดที่ทำให้คุณไม่สามารถเรียกวันใดวันหนึ่งว่าวันเปิดตัวได้ มันเป็นสิ่งประดิษฐ์ที่น่าสนใจกว่าที่ตัวนับซึ่งแสดงว่ามีผู้ดาวน์โหลดสองครั้งของมันบอกเป็นนัย และเป็นสิ่งที่ยังพิสูจน์ได้น้อยกว่าที่ค่า 85.89 ของมันบอกเป็นนัย ทั้งสองครึ่งของประโยคนั้นคือการตีความอย่างซื่อตรง ณ วันที่ 11 ตุลาคม 2026
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
