
AstaBrief 8B: ตัวเขียนรายงานแบบเปิดของ Ai2 ทำงานเร็วกว่าพายป์ไลน์ที่มันแทนที่ 3.5 เท่า
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 216 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 42 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ตัวเลขพาดหัวจากการประกาศเปิดตัว AstaBrief 8B ของ Ai2 คือค่าที่อ่านจากนาฬิกาจับเวลา ไม่ใช่คะแนนจากเบนช์มาร์ก: ตลอดทั้งไปป์ไลน์ Asta โมเดลใหม่สร้างรายงานวิจัยที่มีการอ้างอิงโดยใช้เวลาเฉลี่ย 51.1 วินาที เทียบกับ 178.5 วินาทีสำหรับเส้นทางที่ขับเคลื่อนด้วย Claude ซึ่งปัจจุบันอยู่เคียงข้างกัน นั่นเร็วกว่าประมาณ 3.5 เท่า และเป็นผลมาจากการตัดสินใจเชิงสถาปัตยกรรมเพียงอย่างเดียว — เขียนรายงานทั้งหมดในรอบเดียว แทนที่จะสรุป จัดกลุ่ม แล้วจึงเขียนทีละส่วน AstaBrief 8B เป็นโมเดลน้ำหนักเปิดขนาด 8B ใช้สัญญาอนุญาต Apache-2.0 ปรับละเอียดมาจาก Qwen3-8B รับคำถามวิจัยพร้อมข้อความตัดตอนจากเอกสารวิชาการที่ค้นคืนมา และส่งคืนรายงานพร้อมการอ้างอิงในบรรทัด เปิดตัวในแพลตฟอร์ม Asta ของ Ai2 ในชื่อ "Fast mode" เมื่อวันที่ 2026-10-02 และน้ำหนัก โมเดล ข้อมูลการฝึก และตัวอย่างเวิร์กโฟลว์ภายในเครื่องได้รับการเปิดเผยต่อสาธารณะในวันเดียวกัน
คลังโค้ดนี้เก่ากว่าคำประกาศ และนั่นสำคัญ
รายละเอียดหนึ่งในการเปิดตัวนี้ควรค่าแก่การกล่าวอย่างตรงไปตรงมา เพราะมันเปลี่ยนวิธีที่คุณควรอ่านส่วนที่เหลือทั้งหมด: ที่เก็บ Hugging Face ที่ allenai/AstaBrief_8B มีตราประทับเวลาการสร้างภายในเป็น 2026-02-09 และชุดข้อมูล DPO ที่มาคู่กันมีวันที่เป็นเดือนพฤศจิกายน 2025 การประกาศเมื่อวันที่ 2 ตุลาคมเป็นเรื่องจริง — โพสต์บล็อก ทวีตของ AI2 และการ์ดโมเดล ต่างก็เปิดตัวในวันนั้น — แต่ประวัติของที่เก็บนั้นยาวนานกว่าที่วงจรข่าวชี้ให้เห็น
สิ่งที่เกิดขึ้นเมื่อวันที่ 2 ตุลาคม คือ Ai2 ได้ปล่อยและจัดทำเอกสารสำหรับสิ่งนั้น พร้อมแก้ไข repo ให้สอดคล้องกัน โดยมีคอมมิตสามรายการลงบนการ์ดโมเดลระหว่าง 16:18:06 ถึง 16:18:20 UTC ในวันเปิดตัว เพิ่มเทมเพลตการตอบกลับลงในเทมเพลตแชต และตัดโทเค็น no-op ออก นั่นคือการดูแลจัดการบนการ์ด ไม่ใช่การฝึกใหม่ Ai2 ยังระบุอย่างชัดเจนในบล็อกว่า "การฝึกและการประเมินส่วนใหญ่ที่อธิบายไว้เสร็จสิ้นในปี 2025" และโมเดลที่เป็นกรรมสิทธิ์ซึ่งใช้สร้างข้อมูลฝึกและใช้เป็นจุดเปรียบเทียบนั้น "สะท้อนแนวหน้า ณ เวลานั้น" ทางแล็บกล่าวว่ายังไม่ได้รันการประเมินแบบเต็มซ้ำกับโมเดลแนวหน้าในปัจจุบัน

ดังนั้นนี่คือเวอร์ชัน GA ของงานที่เสร็จสมบูรณ์เป็นส่วนใหญ่ในปี 2024 — การเปิดตัวหนึ่ง พร้อมเอกสารประกอบของการเปิดตัว และการผสานรวมแพลตฟอร์มของการเปิดตัว บนพื้นฐานของเช็กพอยต์ที่มีอยู่ในบัญชีของแล็บมาหลายเดือน ไม่มีอะไรในนั้นที่ไม่ซื่อสัตย์ และโมเดลนี้เป็นของใหม่สำหรับทุกคนนอก Ai2 แต่มันหมายความว่าตัวเลขเปรียบเทียบด้านล่างนี้อธิบายถึงพรมแดนของปี 2024 และ Ai2 เองก็พูดเช่นนั้น
สิ่งที่ AstaBrief 8B ทำจริง ๆ
แพลตฟอร์ม Asta ของ Ai2 มีฟีเจอร์สร้างรายงานที่นักวิจัยนำคำถามสำคัญและชุดวรรณกรรมมา แล้วได้ผลการสังเคราะห์พร้อมการอ้างอิงกลับไป ซึ่งพวกเขาถือเป็นชิ้นงานที่ใช้งานได้จริง ฟีเจอร์นี้ก่อนหน้านี้ทำงานทั้งหมดบนสิ่งที่ Ai2 เรียกว่า Thinking mode: ไปป์ไลน์หลายขั้นตอนที่สรุปข้อความสั้นที่ดึงมา จัดกลุ่มตามธีม และเขียนคำตอบทีละส่วน โดยมีโมเดล Claude รองรับ Thinking mode ละเอียดถี่ถ้วนและช้า
AstaBrief 8B คือ Fast mode เมื่อได้รับคำถามเดียวกันและข้อความที่ดึงมาเดียวกัน มันจะเขียนรายงานฉบับสมบูรณ์ใน forward pass เดียว สิ่งที่น่าสนใจคือข้ออ้างของ Ai2: การข้ามการสรุปข้อความตัดตอน การจัดกลุ่ม และการวนซ้ำแบบทีละส่วน ไม่ได้ทำให้คุณภาพรายงานต้องลดลง อย่างน้อยก็ในตัวชี้วัดที่ห้องแล็บติดตาม โมเดลนี้ไม่ใช่เครื่องมือค้นหาและไม่ได้ดึงข้อมูล — มันคือผู้เขียนที่อยู่ปลายทางของไปป์ไลน์การดึงข้อมูล และคาดหวังว่าจะมีหลักฐานถูกส่งมาให้
นั่นทำให้มันเป็นคอมโพเนนต์มากกว่าที่จะเป็นผลิตภัณฑ์ และนั่นก็เป็นเหตุผลที่ Ai2 ปล่อยเวิร์กโฟลว์ตัวอย่างมาพร้อมกับเวตของโมเดลด้วย: ไลบรารีเล็ก ๆ ที่เปลี่ยน PDF ของคุณให้เป็นรายงาน ในรีโพ ai2-scholarqa-lib ช่วยให้คุณมีจุดเริ่มต้นสำหรับการเจนเนอเรตในเครื่อง
สูตรการฝึกนี้จงใจให้น่าเบื่อ และนั่นแหละคือประเด็น
งานก่อนหน้าของ Ai2 เอง คือ DR Tulu แสดงให้เห็นว่าการเรียนรู้แบบเสริมกำลังสามารถปรับปรุงการสร้างรายงานแบบยาวในโมเดลแบบเปิดน้ำหนักได้ สำหรับ AstaBrief ทีมได้พิจารณาแนวทางนั้นและเลือกที่จะไม่ใช้ เนื่องจาก RL ไม่เสถียรและมีค่าใช้จ่ายสูง และพวกเขาต้องการสิ่งที่ง่ายต่อการดีบัก สิ่งที่พวกเขาสร้างแทนคือการปรับแต่งละเอียดแบบมีผู้สอน ตามด้วยการปรับให้เหมาะสมตามความชอบโดยตรงแบบออฟไลน์ สองขั้นตอน ทั้งคู่เป็นวิธีดั้งเดิม
ขั้นตอน SFT เริ่มจากคำค้นจริงที่ส่งผ่านระบบ Asta ของ Ai2 แทนที่จะเป็นพรอมป์ตสังเคราะห์ จากล็อกที่เก็บรวบรวม ทีมได้กรองคุณภาพ ความเกี่ยวข้อง และความเป็นส่วนตัว โดยตัดทราฟฟิกจากบอตและผู้ทดสอบเบต้าออก ตัดคำค้นที่สั้นเกินกว่าจะมีความหมาย และรันการตรวจด้วย LLM หนึ่งรอบเพื่อจับคำค้นที่ไม่ใช่ภาษาอังกฤษ คำขอที่ไม่ใช่วิทยาศาสตร์ และพรอมป์ตที่มีข้อมูลส่วนบุคคล เหลือกลุ่มคำค้นที่เน้นการวิจัยจำนวน 90,000 รายการ เป้าหมายรายงานฉบับเต็มสำหรับคำค้นเหล่านั้นถูกสร้างด้วยไปป์ไลน์ ScholarQA แบบหลายขั้นตอน โดยใช้ Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini และ GPT-4.1 เป็นโมเดลที่ใช้รองรับ หลังการกรองคุณภาพ: ตัวอย่างสำหรับฝึกที่ใช้งานได้ 47,000 ตัวอย่าง
ขั้นตอน DPO ต้องการสิ่งที่แตกต่างออกไป — คู่ของรายงานที่มีความชอบระหว่างกัน รายงานหนึ่งฉบับต่อหนึ่งคำค้นมาจากไปป์ไลน์ ScholarQA; รายงานคู่แข่งมาจากการป้อนข้อความที่ดึงมาจาก ScholarQA ให้โมเดลอื่น ซึ่งเลือกจาก o3, o4-mini, DeepSeek-V3 หรือ DeepSeek-R1 ผู้ตัดสินสองราย ได้แก่ GPT-4.1 และ DeepSeek-R1 เลือกผู้ชนะสำหรับแต่ละคู่ และมีเพียงคู่ที่ผู้ตัดสินทั้งสองเห็นตรงกันเท่านั้นที่ผ่านการคัดเลือก Ai2 รายงานความสอดคล้อง 95% ระหว่างผู้ตัดสิน LLM กับความชอบของมนุษย์ ชุดความชอบสุดท้ายมีประมาณ 6,000 ตัวอย่าง ทั้งชุดผสม SFT และชุดผสม DPO อยู่บน Hugging Face เพื่อให้ตรวจสอบได้

ข้อค้นพบที่ถ่ายทอดไปใช้ได้กว้างขวางที่สุดกลับเป็นสิ่งที่ดูไม่หวือหวาที่สุด การรัน SFT ในช่วงแรกเขียนรายงานได้ดีขึ้น แต่ยังล้าหลังในด้านความแม่นยำของคำตอบและคุณภาพของการอ้างอิง ทีมจึงทดสอบตัวกรองที่อิงสถิติสี่แบบกับข้อมูลฝึกแบบสังเคราะห์ ได้แก่ อัตราส่วนโทเคนของเอาต์พุตต่ออินพุต ความเกี่ยวข้องเฉลี่ยของการดึงข้อมูลของบทความที่ถูกอ้างอิง ความหนาแน่นของการอ้างอิง (สัดส่วนของข้อความที่มีการอ้างอิงอย่างน้อยหนึ่งรายการ) และความหลากหลายของการอ้างอิง ผลตอบแทนที่มากที่สุดมาจากการกรองรายงานสังเคราะห์ที่มีความหนาแน่นของการอ้างอิงต่ำออกไป — และการกรองที่เข้มข้นขึ้น การผสมตัวกรองเข้าด้วยกัน และการปรับค่า learning rate อย่างละเอียดก็ไม่ได้เพิ่มผลตอบแทนที่มีนัยสำคัญ ข้อสรุปของ Ai2 นั้นคุ้มค่าที่จะนำไปใช้ให้เกินขอบเขตของโมเดลนี้: การทำให้เชี่ยวชาญเฉพาะทางไม่ใช่เรื่องของการเทข้อความทางวิทยาศาสตร์เพิ่มลงในขั้นก่อนการฝึก (pretraining) แต่เป็นเรื่องขององค์ประกอบและคุณภาพของข้อมูลหลังการฝึก (post-training)
สกอร์บอร์ดที่ Ai2 เผยแพร่ และวิธีอ่านมัน

ตัวเลขทุกตัวด้านล่างนี้เป็นข้อมูลที่ผู้พัฒนารายงานเอง มาจากการ์ดโมเดลและบล็อกของ Ai2 ซึ่งสร้างขึ้นโดยชุดเครื่องมือประเมินของห้องแล็บเอง และยังไม่มีการจำลองซ้ำโดยอิสระแม้แต่ส่วนเดียว เป้าหมายหลักคือ SQABench-CS2 ซึ่งเป็นชุดคำถามวิจัยด้านวิทยาการคอมพิวเตอร์ 100 ข้อที่ผู้ใช้เขียนขึ้น โดยวัดจากตัวชี้วัดสี่ตัว ได้แก่ การเรียกคืนส่วนประกอบ (ความครอบคลุมของเนื้อหาที่จำเป็น) ความแม่นยำของคำตอบ (ว่าย่อหน้าแต่ละย่อหน้าเกี่ยวข้องหรือไม่) ความแม่นยำของการอ้างอิง (ว่าการอ้างอิงแต่ละรายการสนับสนุนข้อกล่าวอ้างของตนหรือไม่) และการเรียกคืนการอ้างอิง (ว่าข้อกล่าวอ้างได้รับการสนับสนุนอย่างครบถ้วนจากการอ้างอิงที่ให้มาหรือไม่)
• ค่าเฉลี่ยโดยรวม — AstaBrief 8B 87.0, เช็คพอยต์ SFT ของตัวเอง 83.7, Qwen3-8B ฐาน 77.3
• การเรียกคืนส่วนผสม — AstaBrief 8B 90.2, SFT 85.2, Qwen3-8B 77.8
• ความแม่นยำของคำตอบ — AstaBrief 8B 89.0, SFT 90.4, Qwen3-8B 90.6
• ความแม่นยำของการอ้างอิง — AstaBrief 8B 90.5, SFT 87.7, Qwen3-8B 76.2
• การเรียกคืนการอ้างอิง — AstaBrief 8B 78.2, SFT 71.3, Qwen3-8B 64.6
เมื่ออ่านแถวต่างๆ ประกอบกัน ขั้นตอน DPO ดูเหมือนจะให้ผลแบบเจาะจงมากกว่าจะดีขึ้นอย่างสม่ำเสมอทั่วทั้งหมด ค่าเฉลี่ยโดยรวมเพิ่มขึ้น การเรียกคืนส่วนผสมและตัวชี้วัดการอ้างอิงทั้งสองเพิ่มขึ้นอย่างชัดเจน ขณะที่ความแม่นยำของคำตอบลดลงเพียงเล็กน้อยจนต่ำกว่าทั้ง SFT checkpoint และโมเดลฐาน หากกรณีการใช้งานของคุณให้ความสำคัญกับความเกี่ยวข้องต่อย่อหน้าเหนือสิ่งอื่นใด ไฟน์จูนก็ไม่ได้เป็นคำตอบของคุณโดยอัตโนมัติ
ในการประเมินรอง Ai2 ได้ทดสอบโมเดลสุดท้ายเทียบกับไปป์ไลน์ ScholarQA ของตัวเองและเทียบกับ DR-Tulu-8B บน SQABench-CS2 dev, Asta ScholarQA ได้คะแนน 87.6, DR-Tulu-8B 86.5 และ AstaBrief 8B 86.3; บนชุดทดสอบ (test split), ScholarQA 86.2, DR-Tulu-8B 88.8, AstaBrief 87.0 บน DeepScholarBench ซึ่งเป็นเบนช์มาร์กการสังเคราะห์รูปแบบยาว 63 คำถาม, ScholarQA ได้ 60.25, DR-Tulu-8B 56.26 และ AstaBrief 53.50 — แถวเดียวที่ตัวเขียนรายงานแบบเปิดตามหลังทางเลือกทั้งสอง ในการเปรียบเทียบแบบคู่ที่ตัดสินโดย LLM สองครั้งกับไปป์ไลน์ที่ขับเคลื่อนด้วย Claude, AstaBrief ชนะ 55% ของการเปรียบเทียบบน dev และ 72% ของการเปรียบเทียบบน test การศึกษากับมนุษย์แยกต่างหากครอบคลุมเพียง 14 คำถามจากนักวิจัยสามคน และในด้านความชอบโดยรวม DR-Tulu ชนะ แม้ว่านักวิจัยสองในสามคนชอบ AstaBrief ในด้านความแม่นยำของการอ้างอิง สิบสี่คำถามจากสามคนเป็นสัญญาณ ไม่ใช่คำตัดสิน และ Ai2 นำเสนอเช่นนั้น
แล็บยังได้เผยแพร่ข้อมูลการใช้งานเบื้องต้นจากการผสานรวม Asta: ในบรรดาผู้ใช้ 374 คนที่ลองใช้โหมด Fast, 29.1% ใช้งานเป็นเวลาสองวันหรือมากกว่า, ผู้ใช้สร้างเธรดรายงานเฉลี่ย 3.67 เธรด, 23% ไม่เคยสลับกลับไปใช้โหมด Thinking, และ 18% สลับไปมาระหว่างสองโหมดขึ้นอยู่กับงาน ผลตอบรับเชิงบวกอยู่ที่ 84.2% สำหรับโหมด Fast เมื่อเทียบกับ 85.2% สำหรับโหมด Thinking — ใกล้เคียงกันมากพอที่ Ai2 จะระบุว่าผลตอบรับนั้นเบาบางเกินไปที่จะสรุปผลที่หนักแน่นได้ นั่นคือการนำเสนอที่ตรงไปตรงมา ดังนั้นให้คงไว้
การรันด้วยตนเอง
AstaBrief 8B เป็น Apache-2.0 และอิงตาม Qwen/Qwen3-8B จึงจัดอยู่ในคลาส GPU เดี่ยวมากกว่าระดับดาต้าเซ็นเตอร์: โมเดล dense ขนาด 8B บนสถาปัตยกรรม Qwen3, 36 เลเยอร์, ขนาด hidden 4096, 32 attention head พร้อม 8 key-value head, คำศัพท์ 151,936 โทเค็น และเพดานตำแหน่ง 40,960 โทเค็นของ base ใน BF16 มันใส่ได้สบายบนการ์ด 24GB และตัวอย่างใน model card ของโมเดลเองใช้ vLLM ด้วย temperature 0.7, top-p 0.95 และเพดานเอาต์พุต 4096 โทเค็น
คำเตือนด้านการใช้งานข้อหนึ่งถูกพิมพ์เป็นตัวหนาไว้บนการ์ดโมเดล และเป็นเรื่องง่ายที่จะมองข้ามไป: เช็กพอยต์นี้ถูกปรับละเอียดให้เข้ากับรูปแบบพรอมป์ตแบบใดแบบหนึ่งโดยเฉพาะ ซึ่งเผยแพร่เป็น sft_prompt.txt ในชุดข้อมูล AstaBrief_prompts หากใช้พรอมป์ตหรือรูปแบบการโต้ตอบที่แตกต่างออกไป Ai2 คาดว่าจะให้พฤติกรรมที่ด้อยลงหรือไม่สม่ำเสมอ หากคุณประเมินโมเดลนี้ด้วยฮาร์เนสของคุณเองแล้วได้ผลลัพธ์ที่ไม่ดี ให้ตรวจสอบพรอมป์ตก่อนที่จะสรุปสิ่งใดเกี่ยวกับเวต
การ์ดนี้ยังกล่าวถึงขอบเขตอย่างตรงไปตรงมา AstaBrief มีไว้สำหรับการวิจัยและการศึกษา ไม่ใช่ในฐานะผู้ช่วยเอนกประสงค์ และไม่มีเอนด์พอยต์การอนุมานที่โฮสต์จาก Ai2 — คุณดาวน์โหลดมัน หรือคุณใช้มันภายใน Asta ไม่มีผู้ให้บริการรายใดในแคตตาล็อกของเราให้บริการมัน รวมถึงเรา ด้วยเหตุนี้จึงไม่มีเส้นทางให้ชี้ไป วิธีที่ซื่อสัตย์ในการใช้มันคือบนฮาร์ดแวร์ของคุณเองหรือหลังไฟร์วอลล์ของคุณเอง ซึ่งเป็นกรณีที่ Ai2 กล่าวถึงสำหรับน้ำหนักแบบเปิดตั้งแต่แรก
เราเตอร์อยู่ตรงไหนในไปป์ไลน์รายงาน
AstaBrief ครองหนึ่งช่องในห่วงโซ่ที่ยาวกว่า บางอย่างดึงเอกสารงานวิจัยมา บางอย่างตัดสินว่าข้อความตัดตอนใดควรถูกส่งต่อ และบางอย่างอาจประเมินหรือตรวจสอบรายงานที่เสร็จแล้ว การเรียกเหล่านั้นเป็นการเรียกโมเดลแบบโฮสต์ทั่วไป และเป็นส่วนของสแตกที่คุณอยากได้ทางเลือกของผู้ให้บริการจริง ๆ: API เดียวที่ครอบคลุมโมเดลกว่า 200 รายการ, ราคาตามรายการของผู้ให้บริการส่งผ่านมาที่มาร์กอัป 0% ดังนั้น การลดราคาของผู้ให้บริการจะปรากฏบนบิลของคุณในวันเดียวกัน, การสลับไปใช้ผู้ให้บริการสำรองอัตโนมัติหากผู้ให้บริการรายใดมีประสิทธิภาพลดลง, และ DSL สำหรับกำหนดเส้นทางหากคุณต้องการประกอบหลายโมเดลไว้ในการเรียกครั้งเดียว จงโฮสต์ตัวเขียนด้วยตนเอง เพราะนั่นคือส่วนที่มีนัยเกี่ยวกับความอ่อนไหวของข้อมูลและมีต้นทุนคงที่ ส่วนการประสานงานนั้นให้กำหนดเส้นทางไปยังผู้ให้บริการ เพราะนั่นคือส่วนที่ความยืดหยุ่นมีค่ามากกว่าการเป็นเจ้าของ
ยังมีการทดลองราคาถูกที่ทำได้ตรงนี้ด้วย ชุดเปรียบเทียบของ Ai2 เองประกอบด้วย Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini และ GPT-4.1 — ซึ่งจงใจให้เป็นแนวหน้าของปี 2025 และทางห้องแล็บระบุว่ายังไม่ได้รันมันใหม่ การนำผลลัพธ์ของ AstaBrief ไปวางเทียบกับโมเดลแบบโฮสต์ในปัจจุบันบนคำถามของคุณเอง เป็นเรื่องที่ทำได้ด้วยการกดปุ่มครั้งเดียว หากทั้งสองฝั่งสามารถเข้าถึงได้ผ่านเอนด์พอยต์เดียวกัน และมันตอบคำถามที่โพสต์บล็อกทิ้งเอาไว้
อะไรจะทำให้ภาพเปลี่ยนไป
มีสามสิ่งที่จะเปลี่ยนเรื่องนี้จากการเปิดตัวที่มีเอกสารประกอบครบถ้วนให้กลายเป็นผลลัพธ์ที่ยุติแล้ว การทำซ้ำอย่างอิสระของตัวเลข SQABench-CS2 เนื่องจากตัวเลขทุกตัวข้างต้นเป็นข้อมูลที่รายงานด้วยตนเอง การรันซ้ำเทียบกับโมเดลแนวหน้าปัจจุบัน เนื่องจากชุดการเปรียบเทียบนั้นล้าสมัยไปหนึ่งปีตามที่ห้องแล็บเองยอมรับ และการประเมินโดยมนุษย์ที่ใหญ่กว่าสิบสี่คำถามจากนักวิจัยสามคน — บล็อกของ Ai2 เองปิดท้ายด้วยการโต้วงการว่าสาขานี้ต้องการการประเมินที่ไปไกลกว่าการสนับสนุนการอ้างอิง เพื่อถามว่าโมเดลรักษาขอบเขตเชิงหลักฐานของแหล่งที่มาหรือไม่ รวมถึงว่าโมเดลนั้นเปลี่ยนข้อค้นพบเฉพาะตัวอย่างให้กลายเป็นข้อสรุปทั่วไปอย่างเงียบ ๆ หรือไม่ นั่นเป็นคำวิจารณ์ที่เป็นธรรมต่อหมวดหมู่การประเมินทั้งหมด และใช้ได้กับการเปิดตัวครั้งนี้ด้วยเช่นกัน
สำหรับตอนนี้ ข้อสรุปในทางปฏิบัติก็ง่าย ๆ ว่า ถ้าคุณสร้างรายงานที่มีการอ้างอิงจากเอกสารวิชาการ และต้องการให้ตัวเขียนรายงานทำงานบนฮาร์ดแวร์ของคุณเอง ภายใต้สัญญาอนุญาต Apache-2.0 พร้อมข้อมูลฝึกแบบเปิด AstaBrief 8B คือตัวเลือกแบบเปิดที่ถูกสร้างขึ้นเพื่อจุดประสงค์นี้โดยตรงมากที่สุดเท่าที่มีใครเผยแพร่ และการลดเวลาจริง (wall-clock) ลง 3.5 เท่าก็คือเหตุผลที่มันมีอยู่ ถ้างานของคุณต้องพึ่งพาการสังเคราะห์ที่เฉียบคมที่สุดเท่าที่จะเป็นไปได้ โปรดทราบว่าตารางของ Ai2 เองจัดให้ DR-Tulu นำในด้านความชอบโดยรวมของมนุษย์ และ ScholarQA นำใน DeepScholarBench — และโหมด Thinking ก็ยังอยู่ ในผลิตภัณฑ์เดียวกัน ด้วยเหตุผลนั้นแหละ
