
Reflection Beam vs Gemini 3.1 Pro Preview: ตัวหนึ่งอ่านวิดีโอ อีกตัวอ่านข้อความ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 150 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
เริ่มจากความไม่สมมาตรที่ไม่มีตาราง benchmark ใดในการเปรียบเทียบคู่นี้เอ่ยถึง Reflection Beam ซึ่งประกาศเมื่อวันที่ 5 ตุลาคม 2026 เป็นโมเดล sparse mixture-of-experts ขนาด 501,000 ล้านพารามิเตอร์ โดยมีพารามิเตอร์ 23,000 ล้านตัวที่ทำงานอยู่ต่อโทเคน และมันรับข้อความเข้าแล้วส่งข้อความออกมา เท่านั้น Gemini 3.1 Pro Preview ซึ่งเป็นโมเดลมัลติโมดัลระดับแนวหน้าของผู้จำหน่ายตั้งแต่ 19 กุมภาพันธ์ 2026 ยอมรับข้อความ รูปภาพ วิดีโอ เสียง และไฟล์ และเป็นโมเดลเดียวในการเปรียบเทียบนี้ที่คำถามว่า "มันมองเห็นสิ่งที่ฉันอยากถามถึงได้หรือไม่" มีคำตอบที่ต่างกันในแต่ละฝ่าย ทุกอย่างอื่น ไม่ว่าจะเป็นอัตราส่วนความเบาบาง หน้าต่างบริบท หรือระดับราคา ล้วนเป็นข้อโต้แย้ง ส่วนข้อนั้นคือข้อกำหนดทางเทคนิค
นอกจากนี้ยังหมายความว่านี่คือคู่ที่มีความสมมาตรน้อยที่สุดในชุด และมีประโยชน์มากที่สุด เพราะมันเผยให้เห็นว่าการเปรียบเทียบโมเดลมีไว้เพื่ออะไรกันแน่ หากภาระงานของคุณเป็นข้อความ Beam และ Gemini 3.1 Pro คือสองตัวเลือกบนสเปกตรัมที่ไล่จากถูกและไม่ได้วัดผล ไปจนถึงแพงและถูกให้คะแนนอย่างละเอียด ถ้าภาระงานของคุณมีเฟรมวิดีโออยู่ด้วย ก็ไม่มีการเปรียบเทียบให้ต้องทำ
แต่ละโมเดลคืออะไร
Gemini 3.1 Pro Preview เป็นเรือธงระดับพรีวิวของ Google: คอนเท็กซ์ 1,048,576 โทเคน เอาต์พุตสูงสุด 65,536 โทเคน อินพุตห้ารูปแบบ และหน้าต่าง 1 ล้านโทเคนที่เข้าถึงผ่านบันไดราคาแทนที่จะเป็นอัตราคงที่ Google วางตำแหน่งโมเดลนี้สำหรับงานวิศวกรรมซอฟต์แวร์ที่ยกระดับขึ้น ความน่าเชื่อถือของเอเจนติกที่ดีขึ้น และการใช้โทเคนอย่างมีประสิทธิภาพมากขึ้นในเวิร์กโฟลว์ที่ซับซ้อน มันไม่ใช่โมเดลแบบเปิดเวต ชื่อของมันยังคงมีคำว่า "Preview" ซึ่งเป็นสถานะที่ Google ใช้กับโมเดลนี้มาตั้งแต่เดือนกุมภาพันธ์
Reflection Beam เป็นโมเดลแรกของ Reflection และเป็นจุดเริ่มต้นของซีรีส์น้ำหนักเปิด พารามิเตอร์รวม 501 พันล้านตัว ใช้งานจริง 23 พันล้านตัว — ประมาณ 4.6 เปอร์เซ็นต์ของโมเดลที่ตื่นตัวต่อโทเค็น โทเค็นก่อนการฝึก 23.8 ล้านล้านโทเค็นบนชิป GB300 จำนวน 6,144 ตัวภายในเวลาไม่ถึงสี่สัปดาห์ จากนั้นเป็นการรณรงค์การเรียนรู้แบบเสริมกำลังบนชิป GB300 จำนวน 10,500 ตัวเป็นเวลาสี่สัปดาห์ โดยมีการทดลองมากกว่า 100 ล้านครั้งในสภาพแวดล้อมประมาณหนึ่งล้านแห่ง API ของมันเข้ากันได้กับ OpenAI ที่ api.reflection.ai/openai/v1 โดยมี Chat Completions และรายการ Models บริบทของมันคือ 256,000 โทเค็นพร้อมเชิงอรรถเบต้า พารามิเตอร์ reasoning_effort ของมันมีห้าระดับและไม่มีสวิตช์ปิด และน้ำหนักของมันถูกสัญญาไว้สำหรับปลายเดือนนี้ภายใต้ Apache 2.0
• โมดาลิตี้ — Gemini 3.1 Pro Preview รองรับข้อความ รูปภาพ วิดีโอ เสียง และไฟล์; Reflection Beam รองรับเฉพาะข้อความ
• บริบทและเอาต์พุต — 1,048,576 โทเค็นอินพุต และ 65,536 โทเค็นเอาต์พุตสำหรับ Gemini เมื่อเทียบกับ 256,000 อินพุต และ 128,000 เอาต์พุตสำหรับ Beam
• ราคา — Gemini 3.1 Pro Preview ที่ $2.00 ขาเข้า และ $12.00 ขาออก ต่อล้านโทเค็น สูงสุด 200,000 โทเค็น เพิ่มขึ้นเป็น $4.00 และ $18.00 เมื่อเกินจำนวนนั้น โดยการอ่านแคชอยู่ที่ $0.20; Reflection Beam ยังไม่มีราคาที่เผยแพร่
• ขอบเขตด้านเครื่องมือ — การเรียกใช้เครื่องมือแบบเนทีฟ เอาต์พุตแบบมีโครงสร้าง และการอ้างอิงจากการค้นหา ทางฝั่ง Google; การเรียกใช้เครื่องมือและเอาต์พุตแบบมีโครงสร้าง ทางฝั่ง Beam โดยมีเอนด์พอยต์ที่จำกัดเฉพาะ Chat Completions
• ค่าถ่วงน้ำหนัก — เป็นกรรมสิทธิ์เฉพาะสำหรับ Gemini; Apache 2.0 ที่ให้สัญญาไว้สำหรับ Beam แต่ยังไม่เปิดตัว
• คะแนนอิสระ — Gemini 3.1 Pro Preview มีดัชนี Artificial Analysis; Beam ไม่มีแถวบนกระดานจัดอันดับ
ช่องว่างทาง modality คือข้อโต้แย้งทั้งหมด
ควรพูดให้เป็นรูปธรรมมากกว่าจะเอ่ยถึงคำว่า "multimodal" แบบลอย ๆ เพราะผลที่เกิดขึ้นในทางปฏิบัติมีความเฉพาะเจาะจง
เวิร์กโหลดที่นำเข้าบันทึกหน้าจอ ภาพถ่ายสินค้า สัญญาที่สแกน หรือไฟล์เสียงคอลเซ็นเตอร์ ไม่สามารถให้บริการได้โดย Beam ไม่ว่าจะจ่ายราคาเท่าใด ใช้พรอมป์ตใด หรืออยู่ในแพ็กเกจใด ไม่มีทางหลบเลี่ยงในระดับ API: เอกสารของ Beam อธิบายรูปแบบอินพุตหนึ่งรูปแบบและรูปแบบเอาต์พุตหนึ่งรูปแบบ และไม่ได้ระบุเส้นทางสำหรับภาพหรือเสียงไว้เลย Gemini 3.1 Pro Preview รองรับทั้งห้า ซึ่งหมายความว่ามันเป็นโมเดลเดียวในที่นี้ที่สามารถนำไปใส่ในเวิร์กโฟลว์ที่อินพุตไม่ได้เป็นข้อความอยู่แล้วได้
กรณีกลับกันก็ควรกล่าวถึงเช่นกัน เพราะนี่คือกรณีที่ผู้คนมักเข้าใจผิด หากอินพุตของคุณเป็นข้อความและจะยังคงเป็นข้อความต่อไป ห้าโมดัลของ Gemini ก็ไม่ได้ให้ประโยชน์อะไรกับคุณ และคุณกำลังจ่ายราคาของโมเดลมัลติโมดัลเพื่อรันงานข้อความ นั่นไม่ใช่ข้อโต้แย้งสำหรับ Beam — มันเป็นข้อโต้แย้งว่าคำถามเรื่องโมดัลควรได้รับคำตอบก่อนคำถามเรื่องเบนช์มาร์ก เพราะมันตัดตัวเลือกออกได้ถูกกว่าและเชื่อถือได้มากกว่าการเปรียบเทียบคะแนนใดๆ
สองพรีวิว สองความหมายที่แตกต่างกัน
ชื่อโมเดลทั้งสองมีข้อแม้ติดมาด้วย และข้อแม้เหล่านั้นไม่เหมือนกัน ซึ่งเป็นสิ่งที่น่าสนใจที่สุดเกี่ยวกับการจับคู่นี้
“Preview” ของ Gemini 3.1 Pro เป็นเพียงธรรมเนียมการตั้งชื่อบนโมเดลที่สามารถเรียกใช้งานได้โดยทั่วไปตั้งแต่เดือนกุมภาพันธ์ โดยมีคะแนนอิสระ มีการ์ดราคาที่เผยแพร่ซึ่งรวมถึงระดับ long-context ที่มีเอกสารระบุไว้ และมีชุดเครื่องมือที่ครบถ้วน ในทางปฏิบัติ “preview” ในที่นี้หมายความว่า Google ขอสงวนสิทธิ์ที่จะออกเวอร์ชันใหม่มาแทนที่ ไม่ได้หมายความว่ามันเข้าถึงได้ยากหรือไม่มีคะแนน
เบต้าของ Beam เป็นด่านกั้นที่แท้จริง การเข้าถึงต้องผ่านรายชื่อรอ ID โมเดลถูกสร้างขึ้นเมื่อวันที่ 5 ตุลาคม 2026 ไม่มีตารางอัตราค่าบริการ ไม่มีคะแนนจากบุคคลที่สาม และอาร์ติแฟกต์ที่จะทำให้ใครก็ตามตรวจสอบข้ออ้างหลักได้ — ค่าน้ำหนัก รายงานทางเทคนิค การ์ดโมเดล — เป็นคำสัญญามากกว่าจะถูกส่งมอบ ตัวเลขบริบทมีเชิงอรรถเตือนว่าอาจเปลี่ยนแปลงระหว่างเบต้า ซึ่งเป็นมาตรการป้องกันความเสี่ยงที่โมเดลที่เปิดให้ใช้ทั่วไปไม่จำเป็นต้องมี
ผลลัพธ์ที่ตามมานั้นไม่สมมาตรในแบบที่มีนัยสำคัญต่อการจัดซื้อจัดจ้าง ทีมที่นำ Gemini 3.1 Pro Preview มาใช้กำลังยอมรับความเสี่ยงจากการเปลี่ยนโมเดลบ่อย ทีมที่นำ Beam มาใช้ในวันนี้กำลังยอมรับราคาที่ไม่รู้ คะแนนอิสระที่ไม่รู้ และความสามารถเป็นศูนย์ในการรันโมเดลด้วยตนเอง สิ่งเหล่านี้เป็นความเสี่ยงคนละประเภท และราคาคือปัจจัยที่มักเป็นตัวตัดสินบ่อยที่สุด

เบนช์มาร์ก และปัญหาการอ้างอิง
ตารางการเปิดตัวของ Reflection ไม่ได้รวม Gemini 3.1 Pro Preview หรือโมเดลใด ๆ ของ Google ไว้เลย ชุดการเปรียบเทียบของมันมีแต่แบบเปิดและกึ่งเปิดเท่านั้น ได้แก่ Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max และ DeepSeek V4.1 Flash ดังนั้นสองโมเดลนี้จึงไม่เคยถูกนำมาเทียบกันในตารางที่เผยแพร่ และตัวเลขด้านล่างมาจากฮาร์เนสที่ต่างกันของทั้งสองฝ่าย
• ดัชนีความฉลาด Artificial Analysis — Gemini 3.1 Pro Preview บันทึกได้ 29.7 อยู่ในอันดับที่ 58 จาก 147 ในการรันของตน ส่วน Beam ไม่มีแถวดัชนีเลย
• GPQA Diamond — Gemini 3.1 Pro Preview ที่ 94.1 ตามข้อมูลของ Artificial Analysis เทียบกับ 90.5 ที่ Beam รายงานเอง
• SciCode — 58.7 สำหรับ Gemini เทียบกับ 49.7 ที่ Beam รายงานเอง
• Humanity's Last Exam — 47.0 สำหรับ Gemini เทียบกับ 36.2 ที่ผู้ขายของ Beam รายงาน โดยรายหลังระบุชัดเจนว่าไม่ใช้เครื่องมือ
• Terminal-Bench v2.1 — 73.8 สำหรับ Gemini ตามข้อมูลของ Artificial Analysis เทียบกับ 80.1 ที่ Beam รายงานเองในฐานะผู้ขาย นี่คือแถวที่แข็งแกร่งที่สุดของ Beam ในการเปรียบเทียบครั้งนี้ และถือเป็นการเก็บชัยชนะเหนืองโมเดลที่อยู่ในตลาดมาตั้งแต่เดือนกุมภาพันธ์
• การเรียกคืนบริบทขนาดยาว — 82.0 สำหรับ Gemini เทียบกับ 79.3 ที่ Beam รายงานเองบน AA-LCR
• tau-squared Bench — 95.6 สำหรับ Gemini เทียบกับ 78.7 ของ Beam บน MCP Atlas และ 38.0 บน tau3 banking เป็นการประเมินที่เกี่ยวข้องกับการใช้เครื่องมือแบบเอเจนต์ แต่ไม่ใช่การประเมินเดียวกัน และความแตกต่างของชื่อเรียกนั้นสำคัญ
มีปัญหาด้านความซื่อสัตย์แยกต่างหากในฝั่ง Gemini ของตารางนี้ที่ควรมีประโยคของตัวเอง คะแนนดัชนีอิสระสำหรับ Gemini 3.1 Pro Preview ถูกอ้างอิงไว้ที่ 30, 46, 47.7 และ 57 จากแหล่งต่าง ๆ และ Artificial Analysis ให้บริการดัชนีคนละฉบับบนหน้าโมเดลคนละหน้าในเวลาเดียวกัน ตัวเลข 29.7 ข้างต้นคือตัวเลขที่อยู่ในหน้าที่เราอ่านเมื่อวันที่ 6 ตุลาคม 2026 และเป็นตัวเลขเดียวที่เราจะอ้างถึง — แต่บทความใดก็ตามที่นำตัวเลขดัชนี Gemini เพียงตัวเดียวไปวางข้างคู่แข่งโดยไม่บอกว่ามาจากสแนปช็อตใด กำลังนำเสนอตัวเลขที่ลอยอยู่ราวกับเป็นตัวเลขคงที่ ข้อควรระวังเดียวกันนี้ใช้ในทางกลับกันกับ Beam ซึ่งไม่มีสแนปช็อตใด ๆ เลย
ราคา และระดับที่ไม่มีใครวางแผนไว้
Gemini 3.1 Pro Preview ราคา $2.00 สำหรับอินพุต และ $12.00 สำหรับเอาต์พุต ต่อล้านโทเคน จนถึง 200,000 โทเคน และ $4.00 กับ $18.00 เมื่อเกินกว่านั้น การอ่านแคชอยู่ที่ $0.20 ต่อล้าน และการเขียนแคช $0.375 เส้นแบ่งระดับชั้นคือส่วนที่ควรวางแผนรับมือ: จุดขายเด่นของโมเดลคือหน้าต่าง 1,048,576 โทเคน และทันทีที่คำขอข้าม 200,000 โทเคน อัตราอินพุตจะเพิ่มเป็นสองเท่า และอัตราเอาต์พุตจะเพิ่มขึ้นครึ่งหนึ่ง เวิร์กโหลดที่ออกแบบโดยอิงหน้าต่างล้านโทเคนจึงเป็นเวิร์กโหลดที่มีราคาอยู่ในระดับชั้นที่สองสำหรับปริมาณการใช้งานส่วนใหญ่ ไม่ใช่ระดับชั้นแรก
Beam ไม่มีเรทการ์ด ดังนั้นจึงไม่มีระดับให้จำลองและไม่มีอะไรให้เปรียบเทียบ การไม่มีข้อมูลนั้นไม่ได้เป็นกลาง: มันหมายความว่าข้อความที่ปกป้องได้ง่ายที่สุดเกี่ยวกับค่าใช้จ่ายของ Beam คือไม่ทราบ และหลักฐานเชิงปริมาณเพียงอย่างเดียวสำหรับการวางตำแหน่งด้านประสิทธิภาพของมันคือแผนภูมิของ Reflection เอง ซึ่งประมาณค่า FLOPs ที่สร้างขึ้นเป็นสองเท่าของจำนวนพารามิเตอร์ที่ใช้งานอยู่ คูณกับค่าเฉลี่ยของโทเค็นที่สร้างต่อความพยายามใน DeepSWE, HLE และ Terminal-Bench 2.1 — โดยมีคำบรรยายภาพที่ยอมรับว่าการ prefill พรอมต์, attention และค่าใช้จ่ายส่วนเกินในการให้บริการถูกตัดออกไป ในเวิร์กโหลดที่บริบทขนาดหนึ่งล้านโทเค็นมีความสำคัญ การ prefill ไม่ใช่ความคลาดเคลื่อนจากการปัดเศษ และมันเป็นพจน์ที่สูตรนี้มองข้ามไปอย่างแม่นยำ

การใช้เครื่องมือ การค้นหา และจุดที่การออกแบบทั้งสองแตกต่างกัน
จุดแข็งที่โฆษณาไว้ของ Gemini 3.1 Pro Preview คือวิศวกรรมซอฟต์แวร์ ความน่าเชื่อถือแบบเอเจนต์ และประสิทธิภาพด้านโทเค็น และชุดเครื่องมือที่เผยแพร่ของมันประกอบด้วย function calling, structured outputs และ search grounding รายการสุดท้ายนี้คือสิ่งที่ควรสังเกตสำหรับใครก็ตามที่เปรียบเทียบสแต็กเอเจนต์: grounded search เป็นความสามารถแบบ first-party ของฝั่ง Google และมันเปลี่ยนสิ่งที่เอเจนต์ที่ใช้เครื่องมือสามารถทำได้โดยไม่ต้องเชื่อมต่อบริการดึงข้อมูลภายนอกเข้ามา
เรื่องราวเครื่องมือของ Beam น่าสนใจกว่าที่บรรทัดสเปกบ่งชี้ และประเมินได้ยากกว่า Reflection รายงาน MCP Atlas ที่ 78.7, AutomationBench สาธารณะที่ 37.0, tau3 banking ที่ 38.0, BrowseComp ที่มีการจัดการบริบทที่ 77.4 และ DeepSearchQA ที่มีการจัดการบริบทที่ 80.1 — และตั้งข้อสังเกตว่าในระหว่างการเรียนรู้แบบเสริมกำลัง โมเดลได้เรียนรู้โดยธรรมชาติที่จะสอบถามโมเดลภาษาอื่น และเรียกใช้ OCR API เมื่อได้รับสิทธิ์เข้าถึงเว็บ แม้ว่างานท่องเว็บจะไม่อยู่ในส่วนผสมการฝึก หากการวางนัยทั่วไปนั้นเป็นจริง มันเป็นสัญญาณจริงเกี่ยวกับการถ่ายโอนแบบเอเจนต์ ณ จุดนี้ มันยังเป็นข้อสังเกตจากผู้ขายจากการรันฝึก โดยไม่มีการตรวจสอบอิสระ
ในแถวการใช้งานเครื่องมือที่ทั้งสองฝ่ายมีตัวเลข ภาพรวมค่อนข้างผสมกันมากกว่าเอนไปทางใดทางหนึ่ง ตารางผู้ขายของ Beam ทำให้มันนำหน้า GLM 5.2 บน MCP Atlas และทัดเทียมกับ GLM 5.2 และ Kimi K3 บน tau3 banking ขณะที่ตัวเลข tau-squared Bench ของ Gemini ที่ 95.6 เป็นตัวเลขเชิงเอเจนต์ที่สูงที่สุดที่ฝ่ายใดฝ่ายหนึ่งเคยเผยแพร่ ชุดทดสอบต่างกัน ฮาร์เนสต่างกัน และไม่มีการประเมินร่วมกัน — ซึ่งเป็นปัญหาที่เกิดซ้ำในการเปรียบเทียบนี้
การเลือก และวิธีการป้องกันความเสี่ยง
กฎการตัดสินใจที่ตกผลึกจากข้างต้นนั้นเรียบง่ายพอจะพูดเป็นบรรทัดเดียวได้ว่า ถ้าอินพุตใดไม่ใช่ข้อความ Beam ก็ไม่ใช่ตัวเลือก และการเปรียบเทียบก็จบลง ถ้าอินพุตทุกตัวเป็นข้อความ คำถามจะกลายเป็นว่า คำอ้างเรื่องประสิทธิภาพของ Beam ที่ไม่ระบุที่มานั้นคุ้มค่ากับราคาที่ไม่รู้แน่ชัดและคะแนนอิสระที่ไม่มีหรือไม่ เมื่อเทียบกับโมเดลที่ราคา $2.00 และ $12.00 พร้อมบันไดราคาที่มีเอกสารชัดเจนและชุดเครื่องมือที่ครบถ้วน
Gemini 3.1 Pro Preview อยู่บนแคตตาล็อกของเรา โดยคิดตามอัตราตามรายการของผู้ให้บริการโดยตรง ไม่มีบวกเพิ่ม ภายใต้คีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียวที่ api.orcarouter.ai/v1 ควบคู่ไปกับโมเดลอื่นอีกกว่า 200 รายการ — และคีย์เดียวกันนี้ยังให้บริการโมเดลที่ Beam แข่งขันด้วยในด้านราคา ตั้งแต่ GLM 5.3 ที่ $1.26 และ $3.96 ไปจนถึง DeepSeek V4.1 Flash ที่ $0.15 และ $0.60 ซึ่งดึงข้อมูลสดเมื่อเช้านี้ เนื่องจากเส้นแบ่งระดับที่ 200,000 โทเคนเป็นปัญหาด้านการกำหนดเส้นทางมากกว่าปัญหาของโมเดล DSL สำหรับการกำหนดเส้นทางจึงให้คุณระบุได้โดยตรง: เก็บคำขอสั้นไว้บนระดับราคาถูก และปักหมุดคำขอที่ยาวจริง ๆ ไว้ที่หน้าต่างบริบทซึ่งเป็นเหตุผลที่คุณเลือกโมเดลนี้ ในหนึ่งการเรียกแทนที่จะเขียนในโค้ดแอปพลิเคชัน
Reflection Beam ไม่ใช่หนึ่งในเส้นทางของเรา และเราจะไม่ชี้คุณไปหาใครก็ตามที่อ้างว่ามีมัน หากน้ำหนัก Apache 2.0 มาถึงเดือนนี้ตามที่สัญญาไว้ การโฮสต์เองจะกลายเป็นตัวเลือกที่สามสำหรับงานข้อความเท่านั้น และข้ออ้างเรื่องประสิทธิภาพจะสามารถทดสอบได้บนฮาร์ดแวร์ของคุณเอง

อะไรจะเปลี่ยนคำตอบ
ข้อได้เปรียบของ Beam เหนือ Gemini ตั้งอยู่บนปัจจัยสองข้อเดียวกับที่การเปรียบเทียบ Beam ทุกครั้งใช้เป็นหลัก และการเปรียบเทียบครั้งนี้เพิ่มปัจจัยข้อที่สามเข้ามา
ราคา. หากไม่มีราคา ข้อโต้แย้งเรื่องประสิทธิภาพก็ไม่สามารถแปลงให้เป็นการตัดสินใจด้านงบประมาณได้ และโมเดลก็กำลังแข่งขันกันด้วยแผนภาพมากกว่าตารางราคา
คะแนนจากแหล่งอิสระ Artificial Analysis กล่าวเมื่อวันที่ 5 ตุลาคมว่า Reflection ได้ให้สิทธิ์เข้าถึงแก่ตน และกำลังทดสอบประสิทธิภาพ Beam โดยระบุว่าตัวชี้วัดเบื้องต้นบ่งชี้ว่า Beam จะเป็นหนึ่งในโมเดลแบบเปิดที่ประหยัดโทเคนที่สุดเท่าที่ตนเคยเห็นสำหรับระดับความฉลาดของมัน นั่นคือแหล่งข้อมูลที่ใช่ซึ่งพูดสิ่งที่ถูกต้อง และก็ยังไม่มีแถวของ Beam บนกระดาน — หน้าโมเดลส่งคืน 404 และลีดเดอร์บอร์ดไม่มีรายการ Beam ณ เช้าวันนี้
และสิ่งที่ไม่มีวันเปลี่ยนแปลงก็คือ Beam รองรับเฉพาะข้อความเท่านั้น ไม่ว่าจะเป็นการเปิดตัวเวตของโมเดล การลดราคา หรือคะแนนดัชนีใด ๆ ก็ไม่สามารถเปลี่ยนสิ่งนั้นได้ ซึ่งหมายความว่าสำหรับกลุ่มงานทั้งประเภทหนึ่ง การเปรียบเทียบนี้จะไม่มีวันกลายเป็นการเปรียบเทียบเลยด้วยซ้ำ ถ้าไปป์ไลน์ของคุณมีวิดีโออยู่ คำตอบก็คือ Gemini 3.1 Pro Preview ตั้งแต่ก่อนที่เบนช์มาร์กแรกจะเริ่มโหลดด้วยซ้ำ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
