การ์ดชื่อเรื่องแบบฮีโร่สำหรับบทความ 'AstaBrief 8B: ตัวเขียนรายงานแบบเปิดของ Ai2 ทำงานเร็วขึ้น 3.5 เท่าเมื่อเทียบกับไปป์ไลน์ที่มันแทนที่' พร้อมป้ายระบุเวลา 51.1 วินาที เทียบกับ 178.5 วินาที, สัญญาอนุญาต Apache-2.0 และฐาน Qwen3-8B โดยมีโลโก้ OrcaRouter อยู่ที่มุม
Guides & Insights

AstaBrief 8B: ตัวเขียนรายงานแบบเปิดของ Ai2 ทำงานเร็วกว่าพายป์ไลน์ที่มันแทนที่ 3.5 เท่า

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ตัวเลขพาดหัวจากการประกาศเปิดตัว AstaBrief 8B ของ Ai2 คือค่าที่อ่านจากนาฬิกาจับเวลา ไม่ใช่คะแนนจากเบนช์มาร์ก: ตลอดทั้งไปป์ไลน์ Asta โมเดลใหม่สร้างรายงานวิจัยที่มีการอ้างอิงโดยใช้เวลาเฉลี่ย 51.1 วินาที เทียบกับ 178.5 วินาทีสำหรับเส้นทางที่ขับเคลื่อนด้วย Claude ซึ่งปัจจุบันอยู่เคียงข้างกัน นั่นเร็วกว่าประมาณ 3.5 เท่า และเป็นผลมาจากการตัดสินใจเชิงสถาปัตยกรรมเพียงอย่างเดียว — เขียนรายงานทั้งหมดในรอบเดียว แทนที่จะสรุป จัดกลุ่ม แล้วจึงเขียนทีละส่วน AstaBrief 8B เป็นโมเดลน้ำหนักเปิดขนาด 8B ใช้สัญญาอนุญาต Apache-2.0 ปรับละเอียดมาจาก Qwen3-8B รับคำถามวิจัยพร้อมข้อความตัดตอนจากเอกสารวิชาการที่ค้นคืนมา และส่งคืนรายงานพร้อมการอ้างอิงในบรรทัด เปิดตัวในแพลตฟอร์ม Asta ของ Ai2 ในชื่อ "Fast mode" เมื่อวันที่ 2026-10-02 และน้ำหนัก โมเดล ข้อมูลการฝึก และตัวอย่างเวิร์กโฟลว์ภายในเครื่องได้รับการเปิดเผยต่อสาธารณะในวันเดียวกัน

คลังโค้ดนี้เก่ากว่าคำประกาศ และนั่นสำคัญ

รายละเอียดหนึ่งในการเปิดตัวนี้ควรค่าแก่การกล่าวอย่างตรงไปตรงมา เพราะมันเปลี่ยนวิธีที่คุณควรอ่านส่วนที่เหลือทั้งหมด: ที่เก็บ Hugging Face ที่ allenai/AstaBrief_8B มีตราประทับเวลาการสร้างภายในเป็น 2026-02-09 และชุดข้อมูล DPO ที่มาคู่กันมีวันที่เป็นเดือนพฤศจิกายน 2025 การประกาศเมื่อวันที่ 2 ตุลาคมเป็นเรื่องจริง — โพสต์บล็อก ทวีตของ AI2 และการ์ดโมเดล ต่างก็เปิดตัวในวันนั้น — แต่ประวัติของที่เก็บนั้นยาวนานกว่าที่วงจรข่าวชี้ให้เห็น

สิ่งที่เกิดขึ้นเมื่อวันที่ 2 ตุลาคม คือ Ai2 ได้ปล่อยและจัดทำเอกสารสำหรับสิ่งนั้น พร้อมแก้ไข repo ให้สอดคล้องกัน โดยมีคอมมิตสามรายการลงบนการ์ดโมเดลระหว่าง 16:18:06 ถึง 16:18:20 UTC ในวันเปิดตัว เพิ่มเทมเพลตการตอบกลับลงในเทมเพลตแชต และตัดโทเค็น no-op ออก นั่นคือการดูแลจัดการบนการ์ด ไม่ใช่การฝึกใหม่ Ai2 ยังระบุอย่างชัดเจนในบล็อกว่า "การฝึกและการประเมินส่วนใหญ่ที่อธิบายไว้เสร็จสิ้นในปี 2025" และโมเดลที่เป็นกรรมสิทธิ์ซึ่งใช้สร้างข้อมูลฝึกและใช้เป็นจุดเปรียบเทียบนั้น "สะท้อนแนวหน้า ณ เวลานั้น" ทางแล็บกล่าวว่ายังไม่ได้รันการประเมินแบบเต็มซ้ำกับโมเดลแนวหน้าในปัจจุบัน

A screenshot of the Ai2 blog post 'Open-sourcing AstaBrief, the fast report-generation model in Asta', dated October 2, 2026, showing the opening paragraphs about grounding scientific answers in evidence.

ดังนั้นนี่คือเวอร์ชัน GA ของงานที่เสร็จสมบูรณ์เป็นส่วนใหญ่ในปี 2024 — การเปิดตัวหนึ่ง พร้อมเอกสารประกอบของการเปิดตัว และการผสานรวมแพลตฟอร์มของการเปิดตัว บนพื้นฐานของเช็กพอยต์ที่มีอยู่ในบัญชีของแล็บมาหลายเดือน ไม่มีอะไรในนั้นที่ไม่ซื่อสัตย์ และโมเดลนี้เป็นของใหม่สำหรับทุกคนนอก Ai2 แต่มันหมายความว่าตัวเลขเปรียบเทียบด้านล่างนี้อธิบายถึงพรมแดนของปี 2024 และ Ai2 เองก็พูดเช่นนั้น

สิ่งที่ AstaBrief 8B ทำจริง ๆ

แพลตฟอร์ม Asta ของ Ai2 มีฟีเจอร์สร้างรายงานที่นักวิจัยนำคำถามสำคัญและชุดวรรณกรรมมา แล้วได้ผลการสังเคราะห์พร้อมการอ้างอิงกลับไป ซึ่งพวกเขาถือเป็นชิ้นงานที่ใช้งานได้จริง ฟีเจอร์นี้ก่อนหน้านี้ทำงานทั้งหมดบนสิ่งที่ Ai2 เรียกว่า Thinking mode: ไปป์ไลน์หลายขั้นตอนที่สรุปข้อความสั้นที่ดึงมา จัดกลุ่มตามธีม และเขียนคำตอบทีละส่วน โดยมีโมเดล Claude รองรับ Thinking mode ละเอียดถี่ถ้วนและช้า

AstaBrief 8B คือ Fast mode เมื่อได้รับคำถามเดียวกันและข้อความที่ดึงมาเดียวกัน มันจะเขียนรายงานฉบับสมบูรณ์ใน forward pass เดียว สิ่งที่น่าสนใจคือข้ออ้างของ Ai2: การข้ามการสรุปข้อความตัดตอน การจัดกลุ่ม และการวนซ้ำแบบทีละส่วน ไม่ได้ทำให้คุณภาพรายงานต้องลดลง อย่างน้อยก็ในตัวชี้วัดที่ห้องแล็บติดตาม โมเดลนี้ไม่ใช่เครื่องมือค้นหาและไม่ได้ดึงข้อมูล — มันคือผู้เขียนที่อยู่ปลายทางของไปป์ไลน์การดึงข้อมูล และคาดหวังว่าจะมีหลักฐานถูกส่งมาให้

นั่นทำให้มันเป็นคอมโพเนนต์มากกว่าที่จะเป็นผลิตภัณฑ์ และนั่นก็เป็นเหตุผลที่ Ai2 ปล่อยเวิร์กโฟลว์ตัวอย่างมาพร้อมกับเวตของโมเดลด้วย: ไลบรารีเล็ก ๆ ที่เปลี่ยน PDF ของคุณให้เป็นรายงาน ในรีโพ ai2-scholarqa-lib ช่วยให้คุณมีจุดเริ่มต้นสำหรับการเจนเนอเรตในเครื่อง

สูตรการฝึกนี้จงใจให้น่าเบื่อ และนั่นแหละคือประเด็น

งานก่อนหน้าของ Ai2 เอง คือ DR Tulu แสดงให้เห็นว่าการเรียนรู้แบบเสริมกำลังสามารถปรับปรุงการสร้างรายงานแบบยาวในโมเดลแบบเปิดน้ำหนักได้ สำหรับ AstaBrief ทีมได้พิจารณาแนวทางนั้นและเลือกที่จะไม่ใช้ เนื่องจาก RL ไม่เสถียรและมีค่าใช้จ่ายสูง และพวกเขาต้องการสิ่งที่ง่ายต่อการดีบัก สิ่งที่พวกเขาสร้างแทนคือการปรับแต่งละเอียดแบบมีผู้สอน ตามด้วยการปรับให้เหมาะสมตามความชอบโดยตรงแบบออฟไลน์ สองขั้นตอน ทั้งคู่เป็นวิธีดั้งเดิม

ขั้นตอน SFT เริ่มจากคำค้นจริงที่ส่งผ่านระบบ Asta ของ Ai2 แทนที่จะเป็นพรอมป์ตสังเคราะห์ จากล็อกที่เก็บรวบรวม ทีมได้กรองคุณภาพ ความเกี่ยวข้อง และความเป็นส่วนตัว โดยตัดทราฟฟิกจากบอตและผู้ทดสอบเบต้าออก ตัดคำค้นที่สั้นเกินกว่าจะมีความหมาย และรันการตรวจด้วย LLM หนึ่งรอบเพื่อจับคำค้นที่ไม่ใช่ภาษาอังกฤษ คำขอที่ไม่ใช่วิทยาศาสตร์ และพรอมป์ตที่มีข้อมูลส่วนบุคคล เหลือกลุ่มคำค้นที่เน้นการวิจัยจำนวน 90,000 รายการ เป้าหมายรายงานฉบับเต็มสำหรับคำค้นเหล่านั้นถูกสร้างด้วยไปป์ไลน์ ScholarQA แบบหลายขั้นตอน โดยใช้ Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini และ GPT-4.1 เป็นโมเดลที่ใช้รองรับ หลังการกรองคุณภาพ: ตัวอย่างสำหรับฝึกที่ใช้งานได้ 47,000 ตัวอย่าง

ขั้นตอน DPO ต้องการสิ่งที่แตกต่างออกไป — คู่ของรายงานที่มีความชอบระหว่างกัน รายงานหนึ่งฉบับต่อหนึ่งคำค้นมาจากไปป์ไลน์ ScholarQA; รายงานคู่แข่งมาจากการป้อนข้อความที่ดึงมาจาก ScholarQA ให้โมเดลอื่น ซึ่งเลือกจาก o3, o4-mini, DeepSeek-V3 หรือ DeepSeek-R1 ผู้ตัดสินสองราย ได้แก่ GPT-4.1 และ DeepSeek-R1 เลือกผู้ชนะสำหรับแต่ละคู่ และมีเพียงคู่ที่ผู้ตัดสินทั้งสองเห็นตรงกันเท่านั้นที่ผ่านการคัดเลือก Ai2 รายงานความสอดคล้อง 95% ระหว่างผู้ตัดสิน LLM กับความชอบของมนุษย์ ชุดความชอบสุดท้ายมีประมาณ 6,000 ตัวอย่าง ทั้งชุดผสม SFT และชุดผสม DPO อยู่บน Hugging Face เพื่อให้ตรวจสอบได้

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration and PyTorch tags, the apache-2.0 licence line, the qwen3 and deep-research tags, the Ai2 organisation badge and the start of the model card text about supervised fine-tuning and offline DPO.

ข้อค้นพบที่ถ่ายทอดไปใช้ได้กว้างขวางที่สุดกลับเป็นสิ่งที่ดูไม่หวือหวาที่สุด การรัน SFT ในช่วงแรกเขียนรายงานได้ดีขึ้น แต่ยังล้าหลังในด้านความแม่นยำของคำตอบและคุณภาพของการอ้างอิง ทีมจึงทดสอบตัวกรองที่อิงสถิติสี่แบบกับข้อมูลฝึกแบบสังเคราะห์ ได้แก่ อัตราส่วนโทเคนของเอาต์พุตต่ออินพุต ความเกี่ยวข้องเฉลี่ยของการดึงข้อมูลของบทความที่ถูกอ้างอิง ความหนาแน่นของการอ้างอิง (สัดส่วนของข้อความที่มีการอ้างอิงอย่างน้อยหนึ่งรายการ) และความหลากหลายของการอ้างอิง ผลตอบแทนที่มากที่สุดมาจากการกรองรายงานสังเคราะห์ที่มีความหนาแน่นของการอ้างอิงต่ำออกไป — และการกรองที่เข้มข้นขึ้น การผสมตัวกรองเข้าด้วยกัน และการปรับค่า learning rate อย่างละเอียดก็ไม่ได้เพิ่มผลตอบแทนที่มีนัยสำคัญ ข้อสรุปของ Ai2 นั้นคุ้มค่าที่จะนำไปใช้ให้เกินขอบเขตของโมเดลนี้: การทำให้เชี่ยวชาญเฉพาะทางไม่ใช่เรื่องของการเทข้อความทางวิทยาศาสตร์เพิ่มลงในขั้นก่อนการฝึก (pretraining) แต่เป็นเรื่องขององค์ประกอบและคุณภาพของข้อมูลหลังการฝึก (post-training)

สกอร์บอร์ดที่ Ai2 เผยแพร่ และวิธีอ่านมัน

A screenshot of the Hugging Face dataset page for allenai/AstaBrief_DPO_Mix showing the cc-by-nc-4.0 licence, the json format tag and the dataset viewer with a 6.62k-row train split and prompt, chosen and rejected columns.

ตัวเลขทุกตัวด้านล่างนี้เป็นข้อมูลที่ผู้พัฒนารายงานเอง มาจากการ์ดโมเดลและบล็อกของ Ai2 ซึ่งสร้างขึ้นโดยชุดเครื่องมือประเมินของห้องแล็บเอง และยังไม่มีการจำลองซ้ำโดยอิสระแม้แต่ส่วนเดียว เป้าหมายหลักคือ SQABench-CS2 ซึ่งเป็นชุดคำถามวิจัยด้านวิทยาการคอมพิวเตอร์ 100 ข้อที่ผู้ใช้เขียนขึ้น โดยวัดจากตัวชี้วัดสี่ตัว ได้แก่ การเรียกคืนส่วนประกอบ (ความครอบคลุมของเนื้อหาที่จำเป็น) ความแม่นยำของคำตอบ (ว่าย่อหน้าแต่ละย่อหน้าเกี่ยวข้องหรือไม่) ความแม่นยำของการอ้างอิง (ว่าการอ้างอิงแต่ละรายการสนับสนุนข้อกล่าวอ้างของตนหรือไม่) และการเรียกคืนการอ้างอิง (ว่าข้อกล่าวอ้างได้รับการสนับสนุนอย่างครบถ้วนจากการอ้างอิงที่ให้มาหรือไม่)

• ค่าเฉลี่ยโดยรวม — AstaBrief 8B 87.0, เช็คพอยต์ SFT ของตัวเอง 83.7, Qwen3-8B ฐาน 77.3

• การเรียกคืนส่วนผสม — AstaBrief 8B 90.2, SFT 85.2, Qwen3-8B 77.8

• ความแม่นยำของคำตอบ — AstaBrief 8B 89.0, SFT 90.4, Qwen3-8B 90.6

• ความแม่นยำของการอ้างอิง — AstaBrief 8B 90.5, SFT 87.7, Qwen3-8B 76.2

• การเรียกคืนการอ้างอิง — AstaBrief 8B 78.2, SFT 71.3, Qwen3-8B 64.6

เมื่ออ่านแถวต่างๆ ประกอบกัน ขั้นตอน DPO ดูเหมือนจะให้ผลแบบเจาะจงมากกว่าจะดีขึ้นอย่างสม่ำเสมอทั่วทั้งหมด ค่าเฉลี่ยโดยรวมเพิ่มขึ้น การเรียกคืนส่วนผสมและตัวชี้วัดการอ้างอิงทั้งสองเพิ่มขึ้นอย่างชัดเจน ขณะที่ความแม่นยำของคำตอบลดลงเพียงเล็กน้อยจนต่ำกว่าทั้ง SFT checkpoint และโมเดลฐาน หากกรณีการใช้งานของคุณให้ความสำคัญกับความเกี่ยวข้องต่อย่อหน้าเหนือสิ่งอื่นใด ไฟน์จูนก็ไม่ได้เป็นคำตอบของคุณโดยอัตโนมัติ

ในการประเมินรอง Ai2 ได้ทดสอบโมเดลสุดท้ายเทียบกับไปป์ไลน์ ScholarQA ของตัวเองและเทียบกับ DR-Tulu-8B บน SQABench-CS2 dev, Asta ScholarQA ได้คะแนน 87.6, DR-Tulu-8B 86.5 และ AstaBrief 8B 86.3; บนชุดทดสอบ (test split), ScholarQA 86.2, DR-Tulu-8B 88.8, AstaBrief 87.0 บน DeepScholarBench ซึ่งเป็นเบนช์มาร์กการสังเคราะห์รูปแบบยาว 63 คำถาม, ScholarQA ได้ 60.25, DR-Tulu-8B 56.26 และ AstaBrief 53.50 — แถวเดียวที่ตัวเขียนรายงานแบบเปิดตามหลังทางเลือกทั้งสอง ในการเปรียบเทียบแบบคู่ที่ตัดสินโดย LLM สองครั้งกับไปป์ไลน์ที่ขับเคลื่อนด้วย Claude, AstaBrief ชนะ 55% ของการเปรียบเทียบบน dev และ 72% ของการเปรียบเทียบบน test การศึกษากับมนุษย์แยกต่างหากครอบคลุมเพียง 14 คำถามจากนักวิจัยสามคน และในด้านความชอบโดยรวม DR-Tulu ชนะ แม้ว่านักวิจัยสองในสามคนชอบ AstaBrief ในด้านความแม่นยำของการอ้างอิง สิบสี่คำถามจากสามคนเป็นสัญญาณ ไม่ใช่คำตัดสิน และ Ai2 นำเสนอเช่นนั้น

แล็บยังได้เผยแพร่ข้อมูลการใช้งานเบื้องต้นจากการผสานรวม Asta: ในบรรดาผู้ใช้ 374 คนที่ลองใช้โหมด Fast, 29.1% ใช้งานเป็นเวลาสองวันหรือมากกว่า, ผู้ใช้สร้างเธรดรายงานเฉลี่ย 3.67 เธรด, 23% ไม่เคยสลับกลับไปใช้โหมด Thinking, และ 18% สลับไปมาระหว่างสองโหมดขึ้นอยู่กับงาน ผลตอบรับเชิงบวกอยู่ที่ 84.2% สำหรับโหมด Fast เมื่อเทียบกับ 85.2% สำหรับโหมด Thinking — ใกล้เคียงกันมากพอที่ Ai2 จะระบุว่าผลตอบรับนั้นเบาบางเกินไปที่จะสรุปผลที่หนักแน่นได้ นั่นคือการนำเสนอที่ตรงไปตรงมา ดังนั้นให้คงไว้

การรันด้วยตนเอง

AstaBrief 8B เป็น Apache-2.0 และอิงตาม Qwen/Qwen3-8B จึงจัดอยู่ในคลาส GPU เดี่ยวมากกว่าระดับดาต้าเซ็นเตอร์: โมเดล dense ขนาด 8B บนสถาปัตยกรรม Qwen3, 36 เลเยอร์, ขนาด hidden 4096, 32 attention head พร้อม 8 key-value head, คำศัพท์ 151,936 โทเค็น และเพดานตำแหน่ง 40,960 โทเค็นของ base ใน BF16 มันใส่ได้สบายบนการ์ด 24GB และตัวอย่างใน model card ของโมเดลเองใช้ vLLM ด้วย temperature 0.7, top-p 0.95 และเพดานเอาต์พุต 4096 โทเค็น

คำเตือนด้านการใช้งานข้อหนึ่งถูกพิมพ์เป็นตัวหนาไว้บนการ์ดโมเดล และเป็นเรื่องง่ายที่จะมองข้ามไป: เช็กพอยต์นี้ถูกปรับละเอียดให้เข้ากับรูปแบบพรอมป์ตแบบใดแบบหนึ่งโดยเฉพาะ ซึ่งเผยแพร่เป็น sft_prompt.txt ในชุดข้อมูล AstaBrief_prompts หากใช้พรอมป์ตหรือรูปแบบการโต้ตอบที่แตกต่างออกไป Ai2 คาดว่าจะให้พฤติกรรมที่ด้อยลงหรือไม่สม่ำเสมอ หากคุณประเมินโมเดลนี้ด้วยฮาร์เนสของคุณเองแล้วได้ผลลัพธ์ที่ไม่ดี ให้ตรวจสอบพรอมป์ตก่อนที่จะสรุปสิ่งใดเกี่ยวกับเวต

การ์ดนี้ยังกล่าวถึงขอบเขตอย่างตรงไปตรงมา AstaBrief มีไว้สำหรับการวิจัยและการศึกษา ไม่ใช่ในฐานะผู้ช่วยเอนกประสงค์ และไม่มีเอนด์พอยต์การอนุมานที่โฮสต์จาก Ai2 — คุณดาวน์โหลดมัน หรือคุณใช้มันภายใน Asta ไม่มีผู้ให้บริการรายใดในแคตตาล็อกของเราให้บริการมัน รวมถึงเรา ด้วยเหตุนี้จึงไม่มีเส้นทางให้ชี้ไป วิธีที่ซื่อสัตย์ในการใช้มันคือบนฮาร์ดแวร์ของคุณเองหรือหลังไฟร์วอลล์ของคุณเอง ซึ่งเป็นกรณีที่ Ai2 กล่าวถึงสำหรับน้ำหนักแบบเปิดตั้งแต่แรก

เราเตอร์อยู่ตรงไหนในไปป์ไลน์รายงาน

AstaBrief ครองหนึ่งช่องในห่วงโซ่ที่ยาวกว่า บางอย่างดึงเอกสารงานวิจัยมา บางอย่างตัดสินว่าข้อความตัดตอนใดควรถูกส่งต่อ และบางอย่างอาจประเมินหรือตรวจสอบรายงานที่เสร็จแล้ว การเรียกเหล่านั้นเป็นการเรียกโมเดลแบบโฮสต์ทั่วไป และเป็นส่วนของสแตกที่คุณอยากได้ทางเลือกของผู้ให้บริการจริง ๆ: API เดียวที่ครอบคลุมโมเดลกว่า 200 รายการ, ราคาตามรายการของผู้ให้บริการส่งผ่านมาที่มาร์กอัป 0% ดังนั้น การลดราคาของผู้ให้บริการจะปรากฏบนบิลของคุณในวันเดียวกัน, การสลับไปใช้ผู้ให้บริการสำรองอัตโนมัติหากผู้ให้บริการรายใดมีประสิทธิภาพลดลง, และ DSL สำหรับกำหนดเส้นทางหากคุณต้องการประกอบหลายโมเดลไว้ในการเรียกครั้งเดียว จงโฮสต์ตัวเขียนด้วยตนเอง เพราะนั่นคือส่วนที่มีนัยเกี่ยวกับความอ่อนไหวของข้อมูลและมีต้นทุนคงที่ ส่วนการประสานงานนั้นให้กำหนดเส้นทางไปยังผู้ให้บริการ เพราะนั่นคือส่วนที่ความยืดหยุ่นมีค่ามากกว่าการเป็นเจ้าของ

ยังมีการทดลองราคาถูกที่ทำได้ตรงนี้ด้วย ชุดเปรียบเทียบของ Ai2 เองประกอบด้วย Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini และ GPT-4.1 — ซึ่งจงใจให้เป็นแนวหน้าของปี 2025 และทางห้องแล็บระบุว่ายังไม่ได้รันมันใหม่ การนำผลลัพธ์ของ AstaBrief ไปวางเทียบกับโมเดลแบบโฮสต์ในปัจจุบันบนคำถามของคุณเอง เป็นเรื่องที่ทำได้ด้วยการกดปุ่มครั้งเดียว หากทั้งสองฝั่งสามารถเข้าถึงได้ผ่านเอนด์พอยต์เดียวกัน และมันตอบคำถามที่โพสต์บล็อกทิ้งเอาไว้

อะไรจะทำให้ภาพเปลี่ยนไป

มีสามสิ่งที่จะเปลี่ยนเรื่องนี้จากการเปิดตัวที่มีเอกสารประกอบครบถ้วนให้กลายเป็นผลลัพธ์ที่ยุติแล้ว การทำซ้ำอย่างอิสระของตัวเลข SQABench-CS2 เนื่องจากตัวเลขทุกตัวข้างต้นเป็นข้อมูลที่รายงานด้วยตนเอง การรันซ้ำเทียบกับโมเดลแนวหน้าปัจจุบัน เนื่องจากชุดการเปรียบเทียบนั้นล้าสมัยไปหนึ่งปีตามที่ห้องแล็บเองยอมรับ และการประเมินโดยมนุษย์ที่ใหญ่กว่าสิบสี่คำถามจากนักวิจัยสามคน — บล็อกของ Ai2 เองปิดท้ายด้วยการโต้วงการว่าสาขานี้ต้องการการประเมินที่ไปไกลกว่าการสนับสนุนการอ้างอิง เพื่อถามว่าโมเดลรักษาขอบเขตเชิงหลักฐานของแหล่งที่มาหรือไม่ รวมถึงว่าโมเดลนั้นเปลี่ยนข้อค้นพบเฉพาะตัวอย่างให้กลายเป็นข้อสรุปทั่วไปอย่างเงียบ ๆ หรือไม่ นั่นเป็นคำวิจารณ์ที่เป็นธรรมต่อหมวดหมู่การประเมินทั้งหมด และใช้ได้กับการเปิดตัวครั้งนี้ด้วยเช่นกัน

สำหรับตอนนี้ ข้อสรุปในทางปฏิบัติก็ง่าย ๆ ว่า ถ้าคุณสร้างรายงานที่มีการอ้างอิงจากเอกสารวิชาการ และต้องการให้ตัวเขียนรายงานทำงานบนฮาร์ดแวร์ของคุณเอง ภายใต้สัญญาอนุญาต Apache-2.0 พร้อมข้อมูลฝึกแบบเปิด AstaBrief 8B คือตัวเลือกแบบเปิดที่ถูกสร้างขึ้นเพื่อจุดประสงค์นี้โดยตรงมากที่สุดเท่าที่มีใครเผยแพร่ และการลดเวลาจริง (wall-clock) ลง 3.5 เท่าก็คือเหตุผลที่มันมีอยู่ ถ้างานของคุณต้องพึ่งพาการสังเคราะห์ที่เฉียบคมที่สุดเท่าที่จะเป็นไปได้ โปรดทราบว่าตารางของ Ai2 เองจัดให้ DR-Tulu นำในด้านความชอบโดยรวมของมนุษย์ และ ScholarQA นำใน DeepScholarBench — และโหมด Thinking ก็ยังอยู่ ในผลิตภัณฑ์เดียวกัน ด้วยเหตุผลนั้นแหละ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube