
AstaBrief 8B vs Qwen3-8B: การไฟน์จูนของ Ai2 เพิ่มอะไรให้กับโมเดลฐานของตัวเอง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 220 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ไม่มีเรื่องราวทางสถาปัตยกรรมใด ๆ ที่นี่ และนั่นแหละคือประเด็น AstaBrief 8B เป็น fine-tune ของ Qwen/Qwen3-8B และทั้งสองโมเดลใช้การตั้งค่าที่เหมือนกันจนถึง attention head ตัวสุดท้าย: Qwen3ForCausalLM, 36 เลเยอร์, ขนาด hidden 4096, 32 attention head พร้อม 8 key-value head, คำศัพท์ 151,936 โทเคน และเพดานตำแหน่ง 40,960 โทเคน ทุกสิ่งที่แยกการเปิดตัวของ Ai2 เมื่อ 2026-10-02 ออกจากฐานในเดือนเมษายน 2025 คือ post-training ดังนั้นคำถามที่น่าสนใจจึงไม่ใช่ว่าโดยทั่วไปอันไหนดีกว่า — แต่คือการรัน post-training ที่เฉพาะเจาะจงและได้รับทุนสนับสนุนอย่างดีให้อะไรกับคุณบนโมเดลฐานที่คุณดาวน์โหลดได้ฟรีอยู่แล้ว และคุณต้องแลกด้วยอะไร
คำตอบของ Ai2 คือเครื่องเขียนรายงานที่สร้างงานสังเคราะห์หลายส่วนพร้อมการอ้างอิงในเวลาประมาณ 51 วินาที เทียบกับ 178.5 วินาทีสำหรับไปป์ไลน์ที่ขับเคลื่อนด้วย Claude ซึ่งมันเข้าแทนที่ภายในแพลตฟอร์ม Asta — เร็วกว่าประมาณ 3.5 เท่า โดย Ai2 อ้างว่าคุณภาพรายงานคงเดิมตามเมตริกที่ติดตาม คำตอบของ Qwen3-8B คือโมเดลอเนกประสงค์ที่มีโหมดคิดแบบไฮบริดและโหมดไม่คิด รองรับมากกว่าร้อยภาษา และการใช้งานปลายน้ำหนึ่งปีครึ่ง ทั้งคู่เป็น Apache-2.0 การแลกเปลี่ยนคือความสามารถแบบแคบบวกความเร็ว เมื่อเทียบกับความสามารถแบบกว้างบวกความยืดหยุ่น และข้อมูลด้านล่างทำให้รูปร่างของมันค่อนข้างชัดเจน
แถวสถาปัตยกรรมเป็น no-op ดังนั้นพรอมป์ต์จึงไม่ใช่
เนื่องจากเรขาคณิตของ checkpoint เหมือนกันทุกประการ สัญชาตญาณด้านการให้บริการทุกอย่างที่คุณมีเกี่ยวกับ Qwen3-8B จะถ่ายโอนไปยัง AstaBrief 8B โดยไม่เปลี่ยนแปลง มันเป็นโมเดล dense ขนาด 8B ใน BF16 สามารถรันบนการ์ด 24GB ได้ ให้บริการบน vLLM หรือ Transformers โดยไม่ต้องใช้ custom kernel และสืบทอดเพดานตำแหน่ง 40K ของโมเดลฐานมา — ทั้งสองโมเดลไม่ใช่โมเดล long-context และหน้าต่างที่ฝึกด้วย 32K ขยายด้วย YaRN ได้เหมือนกับโมเดลฐานทุกประการ การวางแผนการปรับใช้สำหรับ fine-tune ก็คือการวางแผนการปรับใช้สำหรับโมเดลฐาน นั่นเป็นสิ่งที่ควรพูดอย่างตรงไปตรงมา เพราะมันไม่จริงเสมอไปสำหรับ fine-tune และหมายความว่าสิ่งเดียวที่คุณกำลังประเมินคือพฤติกรรม
การล็อกติดอยู่ที่พฤติกรรม การ์ดของ AstaBrief มีคำเตือนที่พิมพ์เป็นตัวหนา: โมเดลถูก fine-tune ให้เข้ากับรูปแบบพรอมป์ตเฉพาะแบบหนึ่ง ซึ่งเผยแพร่เป็น sft_prompt.txt ในชุดข้อมูล AstaBrief_prompts และ Ai2 กล่าวว่าการใช้พรอมป์ตหรือรูปแบบการโต้ตอบที่แตกต่างออกไปอาจทำให้พฤติกรรมเสื่อมลงหรือไม่สม่ำเสมอ พรอมป์ตนั้นไม่ใช่เทมเพลตแชตทั่วไป อ่านแล้วคุณจะพบสัญญาที่เข้มงวด — ช่องคำถามในวงเล็บเหลี่ยม, บล็อก section_references ของข้อความอ้างอิงที่ใช้ตัวระบุเป็นคีย์, ไวยากรณ์การอ้างอิงที่ชัดเจนซึ่งกำหนดให้คีย์อ้างอิงต้องตามหลังประโยคที่มันสนับสนุน, เครื่องหมายที่กำหนดไว้สำหรับความรู้ของโมเดลซึ่งต้องไม่นำไปรวมกับแหล่งอื่น และคำสั่งให้เปิดแต่ละส่วนด้วย TLDR สองประโยค Qwen3-8B จะยอมรับอะไรก็ตามที่คุณพิมพ์ ส่วน AstaBrief 8B ถูกปรับให้เข้ากับอินพุตรูปแบบเดียว และจะให้ประสิทธิภาพต่ำลงหากคุณป้อนอีกรูปแบบหนึ่งให้มัน
สิ่งที่ตัวอย่าง 47,000 รายการและความชอบ 6,000 รายการซื้อมา
การไฟน์จูนนี้เป็นการฝึกหลังการฝึกทั้งหมด และสูตรก็เป็นแบบแผนดั้งเดิมโดยเจตนา: การปรับแต่งแบบมีผู้สอนตามด้วยการเพิ่มประสิทธิภาพตามความชอบโดยตรงแบบออฟไลน์ ไม่มีการเรียนรู้แบบเสริมกำลัง Ai2 เริ่มจากคำค้นหาจริงที่ส่งผ่านระบบ Asta ของตน กรองพรอมต์ที่เน้นการวิจัย 90,000 รายการเพื่อคุณภาพ ความเกี่ยวข้อง และความเป็นส่วนตัว สร้างเป้าหมายรายงานด้วยไปป์ไลน์ ScholarQA แบบหลายขั้นตอนโดยใช้ Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini และ GPT-4.1 และเก็บตัวอย่างไว้ 47,000 ตัวอย่าง จากนั้นขั้นตอนความชอบก็สร้างคู่ประมาณ 6,000 คู่ โดยมี GPT-4.1 และ DeepSeek-R1 เป็นผู้ตัดสิน และเฉพาะคู่ที่เห็นตรงกันเท่านั้นที่รอดชีวิต
วัดบน SQABench-CS2 — คำถามวิจัยด้านวิทยาการคอมพิวเตอร์ที่ผู้ใช้เขียนขึ้น 100 ข้อ — เทียบกับโมเดลฐาน นี่คือสิ่งที่ได้มา โดยตัวเลขทุกตัวเป็นข้อมูลที่ผู้ขายรายงาน และไม่มีตัวเลขใดได้รับการทำซ้ำอย่างอิสระ:
• ค่าเฉลี่ยโดยรวม — AstaBrief 8B 87.0 เทียบกับ Qwen3-8B 77.3 เพิ่มขึ้น 9.7 จุด
• การระลึกส่วนผสม — 90.2 เทียบกับ 77.8
• ความแม่นยำของการอ้างอิง — 90.5 เทียบกับ 76.2
• การเรียกคืนการอ้างอิง — 78.2 เทียบกับ 64.6
• ความแม่นยำของคำตอบ — 89.0 เทียบกับ 90.6 ลดลง 1.6 จุดเมื่อเทียบกับฐาน
แถวสุดท้ายคือแถวที่ควรใช้กำหนดความคาดหวัง การปรับละเอียดเพื่อคุณภาพรายงานไม่ได้ปรับปรุงทุกอย่างให้ดีขึ้นอย่างสม่ำเสมอ มันแลกความเกี่ยวข้องรายย่อหน้าจำนวนเล็กน้อยเพื่อแลกกับการเพิ่มขึ้นอย่างมากในความครอบคลุมและการอ้างอิงที่มีหลักฐานรองรับ หากงานของคุณให้ความสำคัญกับย่อหน้าที่เกี่ยวข้องเหนือสิ่งอื่นใด โมเดลฐานก็ไม่ใช่ตัวเลือกที่แย่กว่าอย่างชัดเจน และการปรับละเอียดก็ไม่ใช่คำตอบของคุณโดยอัตโนมัติ
อีกสองสิ่งที่เงินไม่ได้ซื้อมา AstaBrief 8B ไม่มีคะแนนที่รายงานบน DeepScholarBench ที่สูงกว่าทางเลือกอื่น ๆ ของ Ai2 เอง — คะแนน 53.50 ของมันตามหลัง Asta ScholarQA ที่ 60.25 และ DR-Tulu-8B ที่ 56.26 — และการตรวจสอบโดยมนุษย์ของมันประกอบด้วยคำถามสิบสี่ข้อจากนักวิจัยสามคน ซึ่ง DR-Tulu ชนะความชอบโดยรวม โมเดลเฉพาะทางสามารถแพ้โมเดลวิจัยอเนกประสงค์บนเบนช์มาร์กของโมเดลเฉพาะทางเองได้ และ Ai2 ก็เผยแพร่เรื่องนั้น

สิ่งที่ฐานยังทำได้ดีกว่า
การเปรียบเทียบนี้ไม่ได้เป็นไปในทิศทางเดียว และฝั่งของเจเนอรัลลิสต์ในเรื่องนี้ก็เป็นสิ่งที่ถูกประเมินค่าต่ำได้ง่าย
Qwen3-8B มาพร้อมกับโหมดคิดแบบไฮบริดและโหมดไม่คิด ดังนั้นจึงสามารถใช้โทเค็นไปกับการให้เหตุผลเมื่อปัญหาสมควรได้รับ และตอบโดยตรงเมื่อไม่จำเป็น AstaBrief 8B ถูกฝึกมาเพื่อการเขียนรายงานแบบครั้งเดียว และไม่ได้สืบทอดพฤติกรรมการให้เหตุผลโดยเจตนานั้นมาเป็นคุณสมบัติของผลิตภัณฑ์ Qwen3-8B ยังมีความครอบคลุมหลายภาษาของโมเดลฐาน — มากกว่าหนึ่งร้อยภาษา — ในขณะที่ AstaBrief ถูกฝึกบนคลังข้อมูลที่ถูกกรองอย่างชัดเจนให้เหลือเฉพาะคำถามทางวิทยาศาสตร์ภาษาอังกฤษ ดังนั้นความสามารถของมันนอกเส้นทางนั้นจึงไม่เป็นที่ทราบแน่ชัด มากกว่าที่จะเป็นเพียงแค่ยังไม่ได้รับการทดสอบ
จากนั้นก็มีเรื่องของพื้นผิวคำสั่ง (instruction surface) คุณต้องการโมเดลเอนกประสงค์ (generalist) เมื่องานจะเปลี่ยนไปในสัปดาห์หน้า เมื่อคุณต้องใช้การเรียกเครื่องมือ (tool calling) เมื่อสคีมาของเอาต์พุตเป็นของคุณเองไม่ใช่ของ Ai2 หรือเมื่อคุณกำลังสร้างต้นแบบและยังไม่รู้ว่าพรอมต์สุดท้ายจะมีหน้าตาอย่างไร และสำหรับคำถามเรื่องแหล่งที่มาดิบ — คำถามที่สำคัญเมื่อมีคนถามว่าทำไมคุณจึงเชื่อมั่นในโมเดล — Qwen3-8B มีการดาวน์โหลดมากกว่าสิบเอ็ดล้านครั้งและผ่านการใช้งานอย่างอิสระมาหนึ่งปีครึ่ง ส่วน AstaBrief 8B เพิ่งเปิดตัวได้หนึ่งสัปดาห์
สิ่งที่ AstaBrief 8B มีที่โมเดลฐานไม่อาจเทียบได้คือวินัยในการอ้างอิง ความแม่นยำและความครบถ้วนของการอ้างอิงเป็นสองเมตริกที่ความได้เปรียบของโมเดลที่ไฟน์ทูนนั้นมากที่สุดและสอดคล้องกับเรื่องราวการฝึกที่สุด — ฟิลเตอร์เดี่ยวที่แข็งแกร่งที่สุดในไปป์ไลน์ข้อมูลของ Ai2 คือความหนาแน่นของการอ้างอิง ซึ่งเป็นสัดส่วนของข้อความที่มีการอ้างอิงอย่างน้อยหนึ่งรายการ และโมเดลที่ได้ก็สะท้อนลำดับความสำคัญนั้น การทำให้โมเดลทั่วไปอ้างอิงในบรรทัดด้วยรูปแบบคีย์คงที่อย่างน่าเชื่อถือ โดยไม่ละทิ้งการสนับสนุนข้อกล่าวอ้าง เป็นวิศวกรรมพรอมต์ที่คุณเขียนและดูแลรักษา การไฟน์ทูนของ Ai2 ทำให้สิ่งนั้นกลายเป็นพฤติกรรมเริ่มต้นของโมเดล

สายผลิตภัณฑ์ Qwen ได้พัฒนาก้าวหน้าต่อไปแล้วนับตั้งแต่เดือนเมษายน 2025
ความยุ่งยากเพิ่มอีกหนึ่งอย่าง และเป็นความยุ่งยากในทางปฏิบัติ: Qwen3-8B มีอายุหนึ่งปีครึ่งแล้ว และการเปรียบเทียบโมเดล fine-tune ใหม่กับมัน ก็ไม่เหมือนกับการเปรียบเทียบกับคู่แข่งปัจจุบันที่ใช้งานได้จริง
สายของ Qwen ตอนนี้ไล่เรียงผ่าน Qwen3.5, Qwen3.6, Qwen3.7 และ Qwen3.8 และเจเนอเรชันปัจจุบันก็เข้าถึงได้โดยไม่ต้องดาวน์โหลดอะไรเลย Qwen3.8 27B คือเส้นทางที่ให้บริการจริงในแคตตาล็อกของเรา พร้อมหน้าต่างบริบท 262,144 โทเคน ในราคา $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านโทเคนเอาต์พุต; Qwen3.8 Flash มีหน้าต่างหนึ่งล้านโทเคนในราคา $0.15 และ $0.47; Qwen3 VL 8B Instruct ครอบคลุมกรณีมัลติโมดัลในราคา $0.18 และ $0.70 ต่อล้าน พร้อมหน้าต่าง 131,072 โทเคน และถูกจัดเส้นทางมาตั้งแต่ตุลาคม 2025 ตัว Qwen3-8B เองไม่ใช่เส้นทางที่เราให้บริการ และ AstaBrief 8B ก็ไม่ใช่เช่นกัน — ทั้งคู่เป็นเวตแบบดาวน์โหลดไปรันเอง และการวางกรอบอย่างตรงไปตรงมาก็คือ โมเดลฐานควรอยู่บนฮาร์ดแวร์ของคุณ ส่วนเจเนอเรชัน Qwen สมัยใหม่นั้นไม่จำเป็นต้องเป็นเช่นนั้น
นั่นทำให้คุณได้แขนที่สามสำหรับการประเมินที่ Ai2 ไม่สามารถรันได้ ติดตั้ง AstaBrief 8B บน GPU ของคุณเอง ตั้งฐาน Qwen3-8B ขึ้นเคียงข้างเพื่อยืนยันส่วนต่างที่รายงานไว้ และชี้ฮาร์เนสตัวเดียวกันไปยังโมเดล Qwen3.8 แบบโฮสต์เพื่อรองรับการขยายขนาด ทั้งสามแขนห่างกันเพียงปลายทางเดียว ซึ่งเป็นสิ่งที่ทำให้เรื่องนี้เป็นแบบฝึกหัดการตั้งค่า ไม่ใช่โครงการจัดซื้อจัดหาAPI เดียวครอบคลุมกว่า 200 โมเดล, ราคาตามรายการของผู้ให้บริการส่งผ่านด้วยมาร์กอัป 0% ดังนั้นเมื่อผู้ขายลดราคา ฝั่งคุณก็ได้ราคานั้นทันทีในวันเดียวกัน, การเฟลโอเวอร์อัตโนมัติ และDSL สำหรับจัดเส้นทาง หากคุณต้องการให้หลายโมเดลช่วยกันตอบคำถามข้อเดียวแขนที่โฮสต์เองยังคงโฮสต์เองไว้ด้วยเหตุผลด้านความอ่อนไหวของข้อมูล ทุกอย่างที่โฮสต์ไว้ยังสลับเปลี่ยนได้เสมอ ซึ่งสำคัญเมื่อ Qwen เจเนอเรชันถัดไปเปิดตัวภายในไตรมาสเดียว
วิธีตัดสินใจ
เลือก AstaBrief 8B หากผลิตภัณฑ์ของคุณคือการสังเคราะห์วรรณกรรมที่มีการอ้างอิง และคุณต้องการให้พฤติกรรมการอ้างอิงเป็นค่าเริ่มต้นของโมเดล แทนที่จะเป็นความรับผิดชอบของพรอมต์คุณ เรขาคณิตของโมเดลฐานหมายถึงไม่มีความประหลาดใจในการให้บริการ สัญญาอนุญาต Apache-2.0 และส่วนผสม SFT และ DPO ที่เผยแพร่ทำให้ตรวจสอบได้ และความได้เปรียบของมันด้านความแม่นยำและความครบถ้วนของการอ้างอิงเป็นผลลัพธ์ที่ใหญ่ที่สุดและอธิบายได้มากที่สุดในตารางของ Ai2
คงใช้ Qwen3-8B ไว้ หรือย้ายไปใช้ Qwen3.x รุ่นปัจจุบัน หากงานของคุณมีความหลากหลาย หากคุณต้องใช้โหมดคิดหรือเครื่องมือหรือการรองรับหลายภาษา หากคุณยังอยู่ในช่วงสำรวจพรอมป์ต์ หรือหากคุณไม่อยากถูกผูกติดกับบล็อกคำสั่งขนาดหนึ่งหมื่นหกพันตัวอักษรที่คุณไม่ได้เขียนขึ้นมา โมเดลฐานแพ้ในด้านความครอบคลุมและการอ้างอิงที่มีหลักฐานรองรับ ไม่ใช่ด้านความเกี่ยวข้อง และมันยังคงรักษาสิ่งหนึ่งที่โมเดลปรับละเอียดได้สละไป
สิ่งที่ต้องหลีกเลี่ยงคือการมองว่าค่าเฉลี่ย 87.0 เทียบกับ 77.3 เป็นเรื่องทั้งหมด ตารางของ Ai2 เองแสดงให้เห็นว่า fine-tune ยอมสละความแม่นยำของคำตอบเพื่อแลกกับวินัยในการอ้างอิง บันทึกในแล็บของตัวเองระบุว่าการฝึกและการประเมินส่วนใหญ่เสร็จสิ้นในปี 2025 และยังไม่ได้รันซ้ำกับโมเดล frontier ปัจจุบัน และโมเดลฐานที่มันต่อยอดขึ้นไปก็ไม่ใช่รุ่นที่คุณจะเลือกใช้กับสิ่งใดอีกต่อไป ยกเว้นเฉพาะการเปรียบเทียบนี้ สิ่งที่ fine-tune เพิ่มเข้ามาได้อย่างชัดเจนคือรูปแบบของผลลัพธ์ ว่ารูปแบบนั้นคุ้มค่ากับความแคบหรือไม่นั้น ขึ้นอยู่ทั้งหมดกับว่ามันตรงกับรูปแบบของผลิตภัณฑ์คุณหรือเปล่า
