
AesCode-8B vs Qwen3-8B: ดูเหมือนพ่อกับลูก แต่ไม่ใช่
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 85 tok/s
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
ชื่อเหล่านี้อาจชวนให้เข้าใจผิด AesCode-8B เป็นโมเดลขนาด 8B ที่มีแกนหลักเป็น Qwen3-VL-8B-Instruct, Qwen3-8B เป็นโมเดล 8B ของผู้พัฒนาเอง และการตีความที่ชัดเจนคือตัวแรกเป็นไฟน์จูนของตัวหลัง ซึ่งไม่ใช่ คอนฟิกที่เผยแพร่ของ AesCode-8B ระบุว่า Qwen3-VL-8B-Instruct เป็นเบส — พี่น้องสายวิชัน-ภาษา ซึ่งเป็นเช็กพอยต์ที่ต่างกันและมีหน้าที่ต่างกัน — และเมทาดาทาบน Hugging Face ระบุว่ามันเป็นไฟน์จูนของโมเดลนั้น ไม่ใช่ของ Qwen3-8B ที่เป็นข้อความล้วน โมเดล AesCode สองตัวในระดับขนาดนี้เป็นลูกพี่ลูกน้องกันมากกว่าเป็นพ่อแม่ลูก และความแตกต่างนี้เองคือเหตุผลทั้งหมดที่หน้านี้มีประโยชน์: มันบอกคุณว่า Microsoft ได้อะไรไปเมื่อเริ่มจากเช็กพอยต์วิชัน-ภาษา สิ่งนั้นแลกมาด้วยต้นทุนอะไรในฝั่งข้อความ และทำไมการเปรียบเทียบกับโมเดลเอนกประสงค์ 8B ธรรมดาในตระกูลเดียวกันจึงกลายเป็นการวัดการแยกสายมากกว่าการอัปเกรด
ทั้งสองเป็น Apache 2.0 และทั้งคู่สามารถดาวน์โหลดได้ แต่บันทึกการเผยแพร่ของทั้งสองนั้นต่างกันอย่างสิ้นเชิง Qwen3-8B เปิดตัวในเดือนเมษายน 2025 โดยเป็นส่วนหนึ่งของสาย Qwen3-generation ของผู้จำหน่าย พร้อมด้วยเอกสารประกอบ การผสานรวมกับระบบนิเวศ และการนำไปใช้งานโดยผู้อื่นเป็นเวลา 18 เดือนเป็นเบื้องหลัง AesCode-8B ไม่มีวันที่เปิดตัวอยู่ที่ใดเลยในไฟล์ของมัน Microsoft สร้างที่เก็บ Hugging Face เมื่อวันที่ 29 กันยายน 2026 คอมมิตค่าถ่วงน้ำหนักภายใต้ข้อความ "Release AesCode-8B" เมื่อเวลา 03:35 UTC ของวันที่ 7 ตุลาคม 2026 และนำโค้ดฝึกสอนขึ้น GitHub ในวันถัดมา ไม่มีโพสต์ของ Microsoft Research ไม่มีบันทึกการเปิดตัว ไม่มีหน้าผลิตภัณฑ์ และไม่มีบทความ — การอ้างอิงในการ์ดโมเดลระบุว่า "Under review" พร้อมปีตัวแทน 2027 และ ณ เวลาที่เขียนนี้ ที่เก็บดังกล่าวมียอดดาวน์โหลด 2 ครั้ง ข้อมูลเชิงปริมาณทั้งหมดเกี่ยวกับ AesCode-8B ด้านล่างนี้เป็นของ Microsoft เอง และยังไม่มีการทำซ้ำโดยผู้ใด
แผนภูมิตระกูลที่ชื่อเหล่านี้ซ่อนไว้
สายรุ่น Qwen3 ประกอบด้วยเช็คพอยต์ระดับ 8B หลายตัวที่สืบเชื้อสายร่วมกันและแทบไม่มีอะไรอื่นเหมือนกัน Qwen3-8B เป็นเจเนอรัลลิสต์แบบข้อความล้วน: มีพารามิเตอร์ทั้งหมดประมาณ 8.2 พันล้านตัว โดยประมาณ 7 พันล้านตัวเป็น non-embedding, grouped-query attention, บริบทเริ่มต้น 32K โทเคนที่ขยายได้ถึง 131K ผ่าน YaRN และฝึกฝนใน 119 ภาษาและถิ่นย่อย มันให้เหตุผล สนทนา เขียนโค้ด และเรียกใช้เครื่องมือ และเป็นหนึ่งในโมเดล 8B ที่ถูกโฮสต์เองอย่างแพร่หลายที่สุดในระบบนิเวศโอเพนซอร์สด้วยเหตุผลเหล่านั้นเอง Qwen3-VL-8B-Instruct เป็นสมาชิกแบบมัลติโมดัล: รุ่นเดียวกันในตระกูล มี vision tower เฉพาะด้านอยู่ด้านบน รับภาพและข้อความเข้า ส่งข้อความออก
Microsoft เริ่มจากตัวที่สอง คอนฟิก AesCode-8B ระบุว่าเป็น Qwen3VLForConditionalGeneration โดยมี 36 เลเยอร์ที่ซ่อนอยู่, ขนาด hidden 4,096, 32 attention heads และ 8 key-value heads, คำศัพท์ 151,936 โทเค็น และตำแหน่ง mrope แบบสลับกัน และต้องใช้ transformers 4.57 หรือใหม่กว่า ชาร์ดทั้งหมดรวม 17,543,339,408 ไบต์ ประมาณ 8.8 พันล้านพารามิเตอร์ bf16 ซึ่งเป็นเหตุผลที่ฟิลด์ขนาดแบบปัดเศษของ Hugging Face ระบุ 9B ขณะที่ผู้ขายระบุ 8B นั่นเป็นการปัดเศษ ไม่ใช่ความคลาดเคลื่อน และจำนวนพารามิเตอร์ไม่ใช่จุดแยกที่สำคัญ — สิ่งที่สำคัญคือ modality ของอินพุตและบริบทการให้บริการ 24,576 โทเค็นต่างหาก
ดังนั้น การวางกรอบอย่างตรงไปตรงมาจึงไม่ใช่ "โมเดลอเนกประสงค์ เทียบกับเวอร์ชันไฟน์จูนของมัน" แต่คือ โมเดลอเนกประสงค์ด้านข้อความที่มีบริบทยาวและมีประวัติการใช้งานจริงในโปรดักชัน 18 เดือน เทียบกับเช็กพอยต์งานวิจัยแบบมัลติโมดัลที่ให้เอาต์พุตเป็นเอกสาร และยังไม่เคยถูกประเมินอย่างเป็นอิสระ

สิ่งที่ Microsoft ใช้ budget การฝึกอบรมไปกับอะไร
บรีฟการออกแบบถูกอ้างไว้บนการ์ดโมเดล และอธิบายทางแยกนี้ว่า โมเดลโค้ด "ไม่สามารถมองเห็นว่าเลย์เอาต์ ลำดับชั้น และสีสันประกอบเข้าด้วยกันบนแคนวาสอย่างไร" ขณะที่ตัวสร้างภาพ "จัดองค์ประกอบหน้าได้น่าดึงดูดทางสายตา แต่บ่อยครั้งเรนเดอร์ข้อความ ตัวเลข และความสัมพันธ์เชิงตรรกะผิดพลาด" AesCode คือความพยายามที่จะดึงความเข้าใจด้านการจัดองค์ประกอบจากตัวหนึ่ง และความสามารถในการตรวจสอบยืนยันจากอีกตัวหนึ่ง และสูตรนี้แปลกในแบบเฉพาะเจาะจง
พรอมต์ฝึกทุกอันถูกจับคู่กับภาพอ้างอิงที่สร้างจากพรอมต์เดียวกันนั้น การรันของ Microsoft เองใช้ GPT-Image-2 สำหรับภาพ และใช้ GPT-5.5 เพื่อขยายบรีฟสั้น ๆ ให้เป็นพรอมต์เนื้อหาที่มีรายละเอียด ภาพอ้างอิงมีเพียงเลย์เอาต์และสไตล์เท่านั้น พรอมต์ข้อความยังคงเป็นตัวกำหนดเนื้อหาหลัก จากนั้น ณ ขั้นการอนุมาน โมเดลแทบไม่จำเป็นต้องใช้มัน: หากไม่ป้อนภาพอ้างอิงให้ AesCode-8B คะแนน Visual ของมันจะลดลง 1.00 คะแนนจากหนึ่งร้อย เมื่อเทียบกับ 19.55 สำหรับ backbone และ 10.04 สำหรับ GPT-5.5 ผลลัพธ์ที่เกี่ยวข้องคือ รางวัลที่อิงกับภาพอ้างอิงช่วยยกคะแนน Visual แบบใช้เฉพาะพรอมต์จาก 25.17 เป็น 69.71 ดังนั้นไพรเออร์เชิงภาพจึงย้ายเข้าไปอยู่ในเวตแทนที่จะคงอยู่ในอินพุต
ส่วนที่เหลือเป็นเรื่องราวของการออกแบบรางวัล การกำกับดูแลคือ "กราฟการออกแบบ" ของโหนดและเส้นเชื่อม — ข้อความ แผนภูมิ ตาราง การ์ด พื้นที่ ช่องรูปภาพ โดยมี containment, alignment, order และ connection เป็นเส้นเชื่อม — ซึ่งเลือกมาเพื่อให้ทุกคุณสมบัติบนแคนวาสเป็นขององค์ประกอบที่มีชื่อ และจึงสามารถให้คะแนนแยกได้เอง เจ็ดช่องทางให้คะแนนผลลัพธ์: ตัวตรวจสอบแบบดีเทอร์มินิสติกหกตัวสำหรับ execution, text, boundaries, ข้อมูลตารางและแผนภูมิ, semantic layout และ whitespace บวกกับ Visual Graph Rubric เฉพาะตัวอย่างหนึ่งตัวซึ่งตัดสินโดยโมเดล vision-language ผู้สมัครถูกเรนเดอร์ในเบราว์เซอร์ Playwright แบบแซนด์บ็อกซ์โดยบล็อกคำขอภายนอก และฮาร์เนสอ่านกลับ DOM, computed styles, bounding boxes และภาพหน้าจอ ซึ่งเป็นเหตุผลว่าทำไมตารางต้องเป็นตาราง HTML และแผนภูมิต้องเป็นสเปก ECharts การฝึกเริ่มจากการทำ cold-start supervised fine-tuning บนตัวอย่างสาธิต 3,000 รายการ จากนั้นทำ GDPO กับพรอมป์ 7,408 รายการเป็นเวลา 400 สเต็ปบนโหนดเดียวของ NVIDIA B200 แปดตัว โดยแต่ละช่องทางรางวัลถูกนอร์มัลไลซ์ภายในกลุ่ม rollout ของตัวเอง เพื่อไม่ให้สัญญาณที่อิงกฎซึ่งหนาแน่นกลบสัญญาณภาพที่เบาบาง Microsoft วัดการนอร์มัลไลซ์นั้นได้ที่ 5.12 Visual points เมื่อเทียบกับ GRPO แบบสเกลาร์ล้วน
กลไกเหล่านั้นไม่ได้มีอยู่เพื่อทำให้ AesCode-8B เป็นผู้ช่วยทั่วไปที่เก่งขึ้น มันมีอยู่เพื่อทำให้ผลลัพธ์สามารถตรวจสอบได้ และนั่นคือเหตุผลที่บริบทของโมเดลเป็นอย่างที่มันเป็น
เคียงข้างกัน โดยมีตัวเลขกำกับ
• ฐาน — AesCode-8B: Qwen3-VL-8B-Instruct ซึ่งเป็นเช็กพอยต์แบบภาพและภาษา Qwen3-8B: โมเดลเอนกประสงค์แบบข้อความล้วนในเจเนอเรชันเดียวกัน
• พารามิเตอร์ — AesCode-8B: ประมาณ 8.8B ในรูปแบบ bf16 แบ่งเป็นสี่ชาร์ด Qwen3-8B: รวมทั้งหมดประมาณ 8.2B โดยประมาณ 7B เป็นส่วนที่ไม่ใช่ embedding
• อินพุต — AesCode-8B: ข้อความพร้อมภาพอ้างอิง (ไม่บังคับ) Qwen3-8B: ข้อความ
• เอาต์พุต — AesCode-8B: เอกสาร HTML และ CSS ที่สมบูรณ์ Qwen3-8B: ข้อความ การเรียกใช้เครื่องมือ โค้ด
• บริบท — AesCode-8B: 24,576 โทเค็นในการกำหนดค่าที่รายงาน Qwen3-8B: 32K แบบเนทีฟ, 131K แบบขยายผ่าน YaRN
• ภาษา — AesCode-8B: แท็กของการ์ดคือ "en" เท่านั้น Qwen3-8B: 119 ภาษาและภาษาถิ่น
• หลักฐาน — AesCode-8B: เกณฑ์ให้คะแนนอินโฟกราฟิก 300 ตัวอย่างของ Microsoft เอง สร้างสามครั้งต่อพรอมป์ ไม่มีการผลิตซ้ำจากภายนอก Qwen3-8B: การทดสอบมาตรฐานอิสระ งานด้านการควอนไทเซชัน และการนำไปใช้งานจริงในโปรดักชันเป็นเวลาสิบแปดเดือน
• สัญญาอนุญาต — ทั้งคู่ใช้ Apache 2.0 และไม่มีข้อจำกัดในการเข้าถึง เสมอกัน และไม่ใช่ปัจจัยที่ทำให้แตกต่างอย่างที่หลายคนเข้าใจกัน
ช่องว่างของหลักฐานต่างหากคือการเปรียบเทียบที่แท้จริง
ไมโครซอฟต์รายงานว่า AesCode-8B ได้ 82.94 Overall ในรูบริกของตน นำหน้า GPT-5.5 แบบ reference-conditioned ที่ 81.28 และ Claude Opus 4.8 ที่ 80.39 และนำหน้า backbone แบบ reference-conditioned ของตัวเองอยู่ 31.1 คะแนน Visual ตัวเลขสามตัวในตารางนั้นมีค่ามากกว่าพาดหัวข่าว ตัวแรกคือ Style ซึ่ง AesCode-8B อยู่ที่ 53.21 และไม่มีโมเดลใดในการเปรียบเทียบที่เกิน 60 — และนิยาม Style ของไมโครซอฟต์คือดีไซน์ที่ไม่ต้องแก้ไขด้านภาพเพิ่มเติมก่อนส่งมอบ ดังนั้นในมิติเดียวที่ถามว่ามนุษย์จะส่งหน้าเว็บนี้โดยไม่แก้ไขหรือไม่ โมเดลนี้ไม่ใช่ผู้นำ ตัวที่สองคือความล้มเหลวบริเวณขอบเขต: การล้นของ canvas อย่างรุนแรงเกิดซ้ำใน 4.3% ของตัวอย่าง 300 ชิ้น เทียบกับ 34.7% สำหรับ GPT-5.5 ตัวที่สามคือครึ่งที่เป็นคะแนนด้านภาพมาจากผู้ตัดสิน vision-language ที่ไม่เปิดเผยชื่อ ซึ่งหมายความว่าครึ่งที่กำหนดได้แบบ deterministic สามารถทำซ้ำได้โดยบุคคลภายนอก ส่วนอีกครึ่งทำไม่ได้
ตัวเลขของ Qwen3-8B มาจากแหล่งอื่นโดยสิ้นเชิง และเรื่องนั้นสำคัญกว่าว่าชุดไหนจะสูงกว่า สิบแปดเดือนของการประเมินที่เป็นอิสระ การควอนไทซ์โดยชุมชน เบนช์มาร์กการให้บริการ และการดีพลอยในโปรดักชันเป็นหลักฐานอีกแบบหนึ่ง มันไม่ใช่คำกล่าวอ้าง แต่มันคือประวัติผลงานที่พิสูจน์ได้ คุณสามารถหาข้อมูลได้ว่า Qwen3-8B ทำงานอย่างไรภายใต้การควอนไทซ์แบบ 4 บิตบนการ์ดรุ่นใดรุ่นหนึ่ง เพราะมีคนเผยแพร่ไว้แล้ว คุณทำแบบนั้นกับ AesCode-8B ไม่ได้ เพราะ ณ สัปดาห์นี้ ยังไม่มีใครนอกไมโครซอฟต์ได้รันมันบนอะไรเลย
และไม่มีตัวชี้วัดร่วมกันระหว่างสองตารางนี้ Qwen3-8B ไม่มีคะแนนด้านเลย์เอาต์อินโฟกราฟิก ส่วน AesCode-8B ไม่มีผลการวัดมาตรฐานด้านการให้เหตุผลทั่วไปที่เผยแพร่เลย การเปรียบเทียบนี้ไม่ใช่ว่าใกล้หรือไม่ใกล้ — แต่ไม่มีให้เปรียบเทียบต่างหาก
การรันแต่ละตัวต้องใช้อะไรจริง ๆ บ้าง

Qwen3-8B เป็นตัวที่ง่าย โมเดลข้อความขนาด 8.2B สามารถควอนไทซ์ลงบนการ์ดระดับผู้บริโภคเพียงใบเดียว มีเครื่องมือรองรับที่สั่งสมมาสิบแปดเดือนในทุกเฟรมเวิร์กสำหรับให้บริการและรันไทม์ภายในเครื่อง และมีพฤติกรรมที่คาดเดาได้ การขยายคอนเท็กซ์ไปถึง 131K มีเอกสารรองรับ ไม่ใช่แค่เรื่องเล่าลือ และการครอบคลุม 119 ภาษาคือเหตุผลที่มันไปปรากฏในไปป์ไลน์หลายภาษามากมาย
AesCode-8B เป็นโปรเจกต์สำหรับการเสิร์ฟ คำสั่งของตัวการ์ดเองคือ vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576 โดยต้องใช้ transformers เวอร์ชัน 4.57 หรือใหม่กว่าสำหรับเส้นทางที่ไม่ใช้ vLLM น้ำหนัก bf16 ขนาด 17.5 GB ต้องพอดีอยู่ร่วมกับ KV cache สำหรับ 24,576 โทเคนและรูปภาพไม่เกินสองรูป ดังนั้นการ์ด 24 GB ใบเดียวจึงเพียงพอในทางเทคนิค แต่อึดอัดตึงตัว และ 40-48 GB หรือการ์ด 24 GB สองใบคือขั้นต่ำที่สมจริง ต้องเผื่อทรัพยากรสำหรับ renderer ด้วย เพราะทุกคำกล่าวอ้างเกี่ยวกับคุณภาพของโมเดลนี้ล้วนมาจากการเรนเดอร์ผลลัพธ์ HTML ของมันในเบราว์เซอร์แบบ sandbox — ถ้าคุณอยากรู้ว่าผลลัพธ์ของคุณเองดีหรือไม่ นั่นคือ harness ที่คุณต้องตั้งขึ้นมา และโปรดทราบว่าคอนเท็กซ์ 24,576 โทเคนนั้นถูกทดสอบกับหน้าอินโฟกราฟิกเดี่ยว ๆ ไม่ใช่ชุดสไลด์หลายหน้าที่โมเดลนี้ถูกนำเสนอขาย ดังนั้นความกดดันด้านคอนเท็กซ์บนสไลด์จริงจึงยังเป็นดินแดนที่ยังไม่ได้ทดสอบ
ความพร้อมใช้งานเป็นอีกครึ่งหนึ่งของประเด็นเดียวกัน AesCode-8B ไม่ใช่สิ่งที่ OrcaRouter จัดเส้นทางให้ และเราไม่พบว่ามีการให้บริการที่อื่นเช่นกัน การประเมินผลในวันนี้จึงหมายถึงการนำเวตไปรันบนฮาร์ดแวร์ของคุณเอง บรรพบุรุษของมันเป็นอีกเรื่องหนึ่ง — Qwen3-VL-8B-Instruct เรียกใช้ผ่าน OrcaRouter ได้แล้วตอนนี้ในราคา 0.18 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 0.70 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน ภายในบริบท 131,072 โทเคนซึ่งทำให้มันเป็นวิธีที่ถูกที่สุดในการดูว่าเวอร์ชันที่ยังไม่ได้ปรับแต่งของสถาปัตยกรรมนี้ทำงานอย่างไรกับพรอมป์อินโฟกราฟิกของคุณ ถัดขึ้นไปในสายเดียวกัน Qwen3.8-27B สามารถจัดเส้นทางได้ในราคา 0.33 และ 2.40 ดอลลาร์ ราคาตามรายการของผู้ให้บริการจะส่งผ่านไปโดยไม่มีการบวกเพิ่ม และการสลับไปยังผู้ให้บริการสำรองเกิดขึ้นโดยอัตโนมัติดังนั้นการทดลองพรอมป์กับโมเดลหลักที่โฮสต์ไว้จึงมีค่าใช้จ่ายเพียงคีย์เดียว ไม่ใช่หนึ่งสัปดาห์ของ GPU และมีเพียงพรอมป์ที่ให้ผลลัพธ์ออกมาดีจริงเท่านั้นที่คุ้มค่ากับงานจำลองขึ้นมาใหม่

อันไหนที่คุณต้องการนั้นขึ้นอยู่กับอาร์ติแฟกต์
เลือก AesCode-8B เมื่อสิ่งที่ต้องส่งมอบเป็นหน้าเว็บและจำเป็นต้องแก้ไขได้ เอาต์พุต HTML แบบมีโครงสร้างที่ทำ diff ใน Git ได้ ตารางก็เป็นตารางจริง และแผนภูมิก็เป็นสเปก ECharts ถือเป็นอาร์ติแฟกต์ที่ต่างจากย่อหน้าข้อความอย่างแท้จริง และไม่ว่าความสามารถทั่วไปจะมีมากแค่ไหนก็ทดแทนสิ่งนี้ไม่ได้ รับข้อแลกเปลี่ยนนี้อย่างรู้เท่าทัน: เช็กพอยต์งานวิจัยที่ไม่ได้ประกาศซึ่งมียอดดาวน์โหลดหลักสิบ คอนเท็กซ์ 24K ภาษาอังกฤษเท่านั้น ไม่มีการประเมินโดยอิสระ เพดานสไตล์ที่ผู้ให้บริการของมันเองเผยแพร่ และค่าบริการเสิร์ฟที่วัดกันเป็นสิบ ๆ กิกะไบต์
เลือก Qwen3-8B สำหรับทุกอย่างอื่น — ซึ่งสำหรับทีมส่วนใหญ่แล้ว ทุกอย่างอื่นก็คือทุกอย่าง มันเป็นผู้เชี่ยวชาญทั่วไปที่พิสูจน์แล้วในระดับขนาดนี้ มันมีบริบทที่ยาวกว่า มันพูดได้หนึ่งร้อยสิบเก้าภาษา มันทำงานบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว และมันมีประสบการณ์การใช้งานจริงจากคนอื่นถึงสิบแปดเดือนรองรับการตัดสินใจที่คุณกำลังจะทำ หากคุณไม่มีความจำเป็นเฉพาะเจาะจงที่จะส่งออกหน้าเว็บที่เรนเดอร์แล้ว การเปรียบเทียบนี้มีคำตอบเดียว
เหตุผลที่ควรมีทั้งสองอย่างนั้นเป็นเรื่องจริง และมันไม่ใช่แค่การตัดสินเมื่อคะแนนเสมอกัน ไปป์ไลน์ที่อ่านเอกสารและสร้างชุดสไลด์ใช้โมเดลสองตัวที่มีประเภทเอาต์พุตต่างกันอย่างแท้จริง และท่าทีที่เป็นประโยชน์คือเก็บตัวเรนเดอร์หน้าไว้บนฮาร์ดแวร์ที่รองรับมันได้ และส่งงานด้านการอ่านและการให้เหตุผลไปยังสิ่งที่โฮสต์อยู่หลังเอนด์พอยต์เดียวกับอย่างอื่นทั้งหมด
อะไรจะทำให้หน้านี้เป็นหน้าปิดการขายที่ดียิ่งขึ้น
มีสามเรื่อง และมีเพียงเรื่องเดียวเท่านั้นที่เกี่ยวกับเบนช์มาร์ก การทำซ้ำอย่างอิสระของคะแนน 82.94 และการลดลง 1.00 จุดเมื่อเทียบกับค่าอ้างอิง จะเปลี่ยน AesCode-8B จากคำกล่าวอ้างของผู้ขายให้กลายเป็นผลลัพธ์ และจะทำให้คำถามเรื่องขนาด 8B กับ 8B ได้รับคำตอบบนพื้นฐานของคุณสมบัติที่แท้จริง ผู้ให้บริการที่นำเช็กพอยต์นี้ไปใช้จะยุบคอลัมน์การปรับใช้ให้หายไป และเปลี่ยน "หนึ่งสัปดาห์บน GPU" ให้เป็น "การเรียก API ครั้งเดียว" และเปเปอร์ที่การ์ดอ้างถึงว่าอยู่ระหว่างการตรวจทาน — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — จะตอบคำถามที่การ์ดโมเดลตอบไม่ได้: ว่าเกณฑ์ประเมินเชิงภาพจะทำอะไร เมื่อกราฟการออกแบบที่มันใช้ให้คะแนนนั้นผิดเสียเอง
จนกว่าหนึ่งในนั้นจะเกิดขึ้นจริง การตีความที่ป้องกันได้คือการตีความแบบแคบ AesCode-8B เป็นโมเดลที่น่าสนใจกว่าในสองตัวนี้ และเป็นตัวที่ใช้งานได้น้อยกว่า มันเก่งมากในส่วนต่างๆ ของการออกแบบภาพที่เครื่องจักรตรวจสอบได้ อยู่ในระดับกลางๆ ในส่วนที่ทำให้เป็นอัตโนมัติไม่ได้ และมันอยู่ในตระกูลรุ่น Qwen3 เดียวกันกับโมเดลที่นำมาเปรียบเทียบกับมัน โดยไม่ได้สืบทอดมาจากโมเดลนั้น Qwen3-8B คือตัวที่คุณใส่ลงในไปป์ไลน์ได้ในบ่ายนี้
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
