
Clef vs Gemma 4 12B: เครื่องมือตัดสินใจขนาด 64K โทเคน ปะทะโมเดลอเนกประสงค์ขนาด 256K โทเคน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ตัวเลขที่มีประโยชน์ที่สุดในการเปรียบเทียบระหว่าง Clef และ Gemma 4 12B ไม่ใช่คะแนน Benchmark แต่เป็น 65,536 กับ 256,000 — ขนาดหน้าต่างบริบท Cloudflare/clef เป็นโมเดลการตัดสินใจแบบมัลติโมดัลที่มี 27 พันล้านพารามิเตอร์ ผ่านการฝึกหลัง (post-trained) จาก Qwen3.8-27B ซึ่งอ่านสถานะและสคีมาของคำถามแบบมีชนิด และคืนค่าความน่าจะเป็นสำหรับทุกคำตอบที่อนุญาตในการส่งผ่านครั้งเดียวแบบไม่ใช่ออโตรีเกรสซีฟ Gemma 4 12B — เช็คพอยต์แบบ Unified, google/gemma-4-12B-it — เป็นโมเดล any-to-any แบบไม่มี encoder ที่มี 11.95 พันล้านพารามิเตอร์ของผู้จำหน่าย เปิดตัวในฤดูร้อนปี 2026 ซึ่งสร้างข้อความบนหน้าต่าง 256,000 โทเค็นในกว่า 140 ภาษา วางโฟลเดอร์สัญญาไว้ตรงหน้าทั้งสองโมเดล และโมเดลการตัดสินใจจะหมดพื้นที่เร็วขึ้นสี่เท่า เนื่องจากเพดานของมันคือ 65,536 โทเค็นตามเอกสาร ขณะที่ของโมเดลทั่วไปคือ 256,000 ความไม่สมมาตรนี้ไม่ใช่หมายเหตุประกอบ สำหรับงานจัดเส้นทางทั้งประเภท — เอกสารยาว, เธรดที่วางไว้, แบบฟอร์มหลายหน้า — มันตัดสินใจเลือกก่อนที่จะพูดถึงความแม่นยำด้วยซ้ำ
ดังนั้นนี่ไม่ใช่หน้าที่ว่าด้วยรุ่นไหนดีกว่า แต่เป็นหน้าที่ว่าด้วยสองแกนที่ทั้งสองต่างกันจริง ๆ ได้แก่ แต่ละรุ่นเก็บสถานะได้มากน้อยแค่ไหน และแต่ละรุ่นสามารถสร้างคำตอบที่มีรูปแบบใดได้จริงในทางกายภาพ ส่วนอย่างอื่นที่เหลือไม่ใช่ตัวเลขจากผู้ขายที่ไม่มีใครทำซ้ำได้ ก็เป็นการเปรียบเทียบที่ไม่ได้หมายความอย่างที่มันดูเหมือน
แต่ละอันคืออะไร อธิบายอันละหนึ่งย่อหน้า
Clef คือโมเดลตัดสินใจขนาด 27B ของ Cloudflare เผยแพร่ภายใต้สัญญาอนุญาต Apache-2.0 โดยมีเวตอยู่บน Hugging Face และมีเอนด์พอยต์แบบโฮสต์บน Workers AI Cloudflare ตรึงแบ็กโบน Qwen3.8-27B รวมถึงตัวเข้ารหัสภาพไว้ ติดตั้ง joint schema head พร้อมอะแดปเตอร์ low-rank อันดับ 256 และฝึกด้วย cross-entropy แบบ label-smoothed สำหรับคำตอบสคีมาที่ถูกต้อง ควบคู่กับ Brier loss เพื่อทำให้การคาลิเบรตแม่นยำคมขึ้น คุณป้อน state — ข้อความ JSON รูปภาพ หรือเฟรมวิดีโอ — และคำถามที่ตั้งชื่อไว้ 1 ถึง 64 ข้อ โดยแต่ละข้อมีชนิดเป็น noul (จริง/เท็จ คืนค่าความน่าจะเป็นของค่า true), choice (ตัวเลือกที่ตั้งชื่อไว้ 2 ถึง 26 ตัวเลือก) หรือ score (ระดับที่มีลำดับ 2 ถึง 26 ระดับ) สิ่งที่ได้กลับมาคือการแจกแจงต่อคำถามหนึ่งข้อเท่านั้น ไม่มีเส้นทางการสร้างข้อความเลย
Gemma 4 12B เป็นโมเดลอเนกประสงค์ที่สร้างข้อความได้ มันไม่มีเอนโคเดอร์: แทนที่จะมีทาวเวอร์สำหรับภาพหรือเสียงแยกต่างหาก แพตช์ภาพดิบและรูปคลื่นจะถูกฉายตรงเข้าสู่พื้นที่ฝังตัวของโมเดลภาษาผ่านเลเยอร์เชิงเส้นแบบน้ำหนักเบา ซึ่งเป็นสิ่งที่ทำให้มันสามารถรับข้อความ ภาพ วิดีโอ และเสียงได้โดยไม่ต้องมีไปป์ไลน์แยกตามโมดัล มันมีโหมดคิดที่กำหนดค่าได้ การเรียกฟังก์ชันแบบเนทีฟ คำศัพท์ 262K และกลไกแอตเทนชันแบบไฮบริดที่สลับแอตเทนชันแบบหน้าต่างเลื่อนขนาด 1,024 โทเคน กับแอตเทนชันแบบทั่วโลกเต็มรูปแบบ มันเป็น Apache-2.0 พร้อมเงื่อนไขการใช้งานของผู้ขายเองกำกับอยู่ด้วย และเป็นเช็กพอยต์ที่คนส่วนใหญ่หมายถึงเมื่อพูดว่า "รันขนาดนี้ในเครื่อง"
มีเรื่องหนึ่งที่ต้องบอกให้ชัดเจนก่อนจะไปต่อ: ไม่มีโมเดลใดในสองตัวนี้เป็นเส้นทางบน OrcaRouter แค็ตตาล็อกของเราคืนค่า 404 สำหรับ cloudflare/clef และสำหรับเช็กพอยต์ 12B ในตระกูลเดียวกัน และไม่มีข้อความใดในบทความนี้ที่ควรถูกตีความว่าเป็นการอ้างความพร้อมใช้งานจากเรา สิ่งที่เรามีจากตระกูล Gemma คือสองขนาดที่ใหญ่กว่า และราคาของทั้งสองอยู่ถัดลงไปด้านล่าง

รายการตัวเลือกคืออินเทอร์เฟซ และมันมีโหมดความล้มเหลว
ความแตกต่างเชิงโครงสร้างระหว่างสองสิ่งนี้อยู่ที่สิ่งที่เกิดขึ้นกับข้อมูลนำเข้าที่ไม่เข้ากัน
• เอาต์พุต — Clef จะคืนค่าความน่าจะเป็นต่อตัวเลือกที่ประกาศไว้แต่ละตัวเลือก และเฉพาะตัวเลือกเหล่านั้นเท่านั้น ส่วน Gemma 4 12B จะคืนข้อความที่สร้างขึ้น
• การปฏิเสธ — Clef ไม่มี "none of the above" เว้นแต่คุณจะเขียนมันลงในเกณฑ์ด้วยตัวเอง Gemma 4 12B สามารถอธิบายกรณีที่ไม่เข้าข่ายกับสิ่งที่คุณถามถึงได้
• โหมดความล้มเหลว — ข้อผิดพลาดของ Clef เป็นแบบเงียบ: การเลือกอย่างมั่นใจภายในสคีมาของคุณ ไม่มีข้อยกเว้นเกิดขึ้น ไม่มีสาขาสำรองถูกเรียกใช้งาน ข้อผิดพลาดของโมเดลทั่วไปมักดัง: ข้อความร้อยเรียงที่แยกวิเคราะห์ไม่ได้
• ความสามารถในการทดสอบ — ชุดตัวเลือกแบบตายตัวทำให้คอมโพเนนต์สามารถทำซ้ำได้และตรวจสอบได้ในราคาถูก ส่วนข้อความอิสระทำให้ยืดหยุ่นแต่มีค่าใช้จ่ายสูงในการตรวจสอบความถูกต้อง
ตัวเลขของ Clef เองสำหรับปัญหาการปฏิเสธคำขอนั้นเป็นตัวเลขที่อ่อนที่สุดที่มันเผยแพร่ บน CLINC150 ที่มีการจัดการกรณีนอกขอบเขต — การตรวจจับเจตนาซึ่งคำตอบที่ถูกต้องข้อหนึ่งคือ "สิ่งนี้ไม่จัดอยู่ในหมวดหมู่ใดเลย" — โมเดล 27B ทำคะแนนได้ 97.4 macro-F1 ซึ่งเป็นค่าที่ดีที่สุดในตารางของ Cloudflare และเป็นเหตุผลที่ควรให้ความสนใจกับ 27B แทนรุ่นพี่น้อง 9B ของมันเอง ซึ่งทำได้ 66.8 บนเบนช์มาร์กเดียวกัน ช่องว่างสามสิบจุดระหว่างสองโมเดลที่สร้างจากสูตรเดียวกันบ่งชี้ว่าพฤติกรรมนอกขอบเขตคือสิ่งที่สเกลหลังการฝึกซื้อมาให้ และเป็นสิ่งที่ไปป์ไลน์การจัดเส้นทางส่วนใหญ่พึ่งพาอย่างเงียบ ๆ มาตรการบรรเทาที่ Cloudflare บันทึกไว้คือคำถามที่สองในสคีมา — เพิ่มฟิลด์ noul ที่ถามว่าสถานะนั้นเข้าข่ายหรือไม่เลย แล้วตั้งเกณฑ์ตัดสิน — ซึ่งได้ผล และซึ่งเป็นงานของคุณมากกว่าของโมเดล
ที่มาของตัวเลขสำคัญกว่าสิ่งที่ตัวเลขเหล่านั้นบอก
ตัวเลข Clef ทุกตัวในบทความนี้มาจาก Cloudflare: การ์ดโมเดลของมัน โพสต์เปิดตัวของมัน หรือการรัน Decision Index ของมัน ชุดทดสอบนี้เองก็เป็นของ Cloudflare และลีดเดอร์บอร์ดที่เก็บคะแนนเหล่านั้นก็เป็นของ Cloudflare นั่นคือผู้ขายที่กำลังวัดผลิตภัณฑ์ของตนบนฮาร์ดแวร์ที่ตนควบคุม เทียบกับคู่แข่งที่ตนจงใจเลียนแบบ API ไม่มีบุคคลที่สามรายใดทำซ้ำผลลัพธ์ใด ๆ เหล่านี้ได้ และบทความนี้จะไม่แสร้งทำเป็นอย่างอื่น
คอลัมน์ Gemma 4 12B เป็นหลักฐานอีกประเภทหนึ่ง การ์ดของผู้ขายเองเผยแพร่ MMLU Pro 77.2%, GPQA Diamond 78.8%, AIME 2026 โดยไม่ใช้เครื่องมือที่ 77.5% และ LiveCodeBench v6 ที่ 72.0% Artificial Analysis ซึ่งเป็นตัวติดตามอิสระ จัดทำดัชนีการกำหนดค่าการให้เหตุผลที่ Intelligence Index 14.18 โดยมีราคาที่ระบุไว้ $0.10 / $0.30 ต่อล้านโทเคน และความเร็วเอาต์พุตมัธยฐานที่วัดได้ประมาณ 113 โทเคนต่อวินาที — และหน้าของมันเองระบุว่าตัวเลขเหล่านั้นขึ้นอยู่กับภาระงานและฮาร์ดแวร์
การตีความอย่างตรงไปตรงมาคือ สองคอลัมน์นี้เทียบกันไม่ได้เลย คอลัมน์หนึ่งเป็นชุดทดสอบคุณภาพการตัดสินใจของผู้ขาย ที่ดำเนินการโดยผู้ขายเอง ส่วนอีกคอลัมน์หนึ่งเป็นการผสมกันระหว่างเกณฑ์มาตรฐานของผู้ขายกับการประเมินอิสระของโมเดลทั่วไป การยก 97.4 มาวางข้าง 77.2 ราวกับว่ามันเป็นคอลัมน์ของตารางเดียวกัน จะเป็นสิ่งที่ทำให้เข้าใจผิดได้มากที่สุดเท่าที่หน้านี้จะทำได้
ความหน่วงคือจุดเดียวที่อย่างน้อยที่สุดทั้งสองก็ยังพูดถึงในหน่วยเดียวกันได้ และแม้แต่ตรงนั้น ข้อแม้ต่างๆ ก็ยังทับถมกัน Cloudflare รายงานว่า Clef อยู่ที่ค่ามัธยฐาน 209.3 ms และ p95 238.6 ms โดยวัดบนโครงสร้างพื้นฐานของตนเอง Artificial Analysis วัดเวลาถึงชิ้นส่วนแรกของรุ่น 12B ได้ประมาณ 2.4 วินาทีในการตั้งค่าแบบ reasoning ซึ่งรวมงบการคิดที่โมเดลสำหรับตัดสินใจไม่มี การประมวลผลแบบ non-autoregressive 209 ms เทียบกับการเริ่มสร้างที่ 2.4 วินาทีเป็นความแตกต่างเชิงสถาปัตยกรรมที่แท้จริง — หนึ่ง forward pass เทียบกับ decoding loop — และเป็นข้อโต้แย้งที่แข็งแกร่งที่สุดที่ Clef มีสำหรับ hot path นอกจากนี้ ที่ขนาด 27B มันเป็นโมเดลที่ต้องใช้ฮาร์ดแวร์ระดับ H200 จึงจะทำตัวเลขนั้นได้ และ Cloudflare คิดค่าบริการ $0.24 ต่ออินพุตหนึ่งล้านโทเคนเพื่อรันให้คุณ

สิ่งที่ 64K ของ context ให้คุณได้จริง ๆ
บริบทคือจุดที่การเปรียบเทียบนี้กลายเป็นเรื่องที่ใช้ได้จริง และเป็นจุดที่ฝ่ายทั่วไปชนะบนกระดาษอย่างท่วมท้น
• Clef — 65,536 โทเค็น ตามหน้าโมเดล Workers AI และโพสต์ประกาศเปิดตัว; ตัวช่วยการเข้ารหัสที่มาพร้อมกันมีค่าเริ่มต้นเป็น max_length=16,384 ซึ่งเป็นค่าเริ่มต้นไม่ใช่เพดานสูงสุด แต่ก็เป็นค่าเริ่มต้นที่คุณจะได้หากใช้ตัวโหลดแบบที่จัดส่งมา
• Gemma 4 12B — 256,000 โทเค็น ตามการ์ดของผู้จำหน่าย พร้อมความสนใจแบบหน้าต่างเลื่อนขนาด 1,024 โทเค็น เพื่อลดต้นทุนของบริบทความยาว
• รูปภาพ — Clef ให้คะแนนรูปภาพและเฟรมวิดีโอร่วมกับสถานะข้อความผ่านตัวเข้ารหัสการมองเห็นที่สืบทอดมา Gemma 4 12B รับข้อความ รูปภาพ วิดีโอ และเสียงผ่านเส้นทางที่ไม่ต้องใช้ตัวเข้ารหัส
• ภาษา — การ์ดของ Clef ไม่ได้อ้างว่ามีความสามารถหลายภาษา; Gemma 4 12B ได้รับการบันทึกว่าครอบคลุมภาษามากกว่า 140 ภาษา
สำหรับทิกเก็ต ใบแจ้งหนี้ หรือภาพหน้าจอที่เรนเดอร์แล้ว 64K ถือว่าเหลือเฟือ และความแตกต่างนั้นก็เป็นเพียงเรื่องทางทฤษฎี สำหรับสัญญา 200 หน้าที่คุณต้องการให้จำแนกทีละฟิลด์ มันคือประเด็นทั้งหมด: โมเดลเอนกประสงค์สามารถถือเอกสารไว้ได้ แต่โมเดลตัดสินใจทำไม่ได้ คำตอบของ Clef ต่อเรื่องนี้คือการแบ่งเป็นชิ้น (chunking) และการแบ่งเอกสารก่อนที่คุณจะตัดสินใจเกี่ยวกับมัน หมายความว่าคุณได้ตัดสินใจไปแล้วในสิ่งที่โมเดลควรจะเป็นผู้ตัดสินใจ นั่นคือข้อจำกัดจริง และมันสมควรถูกระบุว่าเป็นข้อจำกัดเช่นนั้น
สิ่งที่คุณจะจ่ายจริง และจะจ่ายที่ไหน
ไม่มีรุ่นใดในสองรุ่นนี้อยู่ในแคตตาล็อกของเรา คำถามเรื่องราคาจึงแยกออกเป็นสามแนวทาง
• Clef — 0.24 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคนบน Workers AI ของ Cloudflare หรือโฮสต์เองจากเวต Apache-2.0; ความหน่วงที่ Cloudflare เผยแพร่ถูกวัดบน H200 เครื่องเดียวด้วย torch 2.11 และ transformers 5.10.2 และการควอนไทซ์โดยชุมชนที่ปรากฏขึ้นภายในสองวันบ่งชี้ว่าสามารถบีบให้เล็กลงได้อีก ด้วยต้นทุนความแม่นยำบางอย่างที่ยังไม่มีใครวัด
• Gemma 4 12B — ไม่มีเส้นทางแบบโฮสต์ที่นี่เลย คุณต้องดึงเวต BF16 ประมาณ 24 GB มาเสิร์ฟเอง หรือหันไปใช้แพลตฟอร์มของบุคคลที่สาม เราไม่มีราคาต่อโทเคนที่จะอ้างอิงได้
• ตัวเลือกทดแทนที่ผ่านการจัดเส้นทาง — Gemma 4 26B A4B ซึ่งเป็น mixture-of-experts ที่มีพารามิเตอร์รวม 25.2B และพารามิเตอร์ที่ทำงานอยู่ 3.8B มีรายการอยู่บน OrcaRouter ในราคา $0.06 ต่อล้านโทเคนอินพุต และ $0.33 ต่อล้านโทเคนเอาต์พุต ด้วยบริบท 262,144 โทเคน Gemma 4 31B พี่น้องแบบ dense multimodal ที่มีความสามารถคิดที่ปรับแต่งได้และการเรียกฟังก์ชันแบบเนทีฟ มีรายการอยู่ที่ $0.13 และ $0.38 ทั้งคู่อยู่บนคีย์เดียวกับ ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยไม่มีมาร์กอัปต่อโทเคน และ การสลับไปใช้ผู้ให้บริการอื่นโดยอัตโนมัติเมื่อเกิดความล้มเหลว
บรรทัดสุดท้ายนั้นคือเวอร์ชันที่ตรงไปตรงมาของการมีส่วนร่วมของเราในการเปรียบเทียบนี้ หากสิ่งที่คุณต้องการคือโมเดลอเนกประสงค์ที่อ่านเอกสารยาว ๆ แล้วเขียนออกมาเป็นประโยค หนทางราคาถูกที่จะได้มานั้นคือขนาดของ Gemma 4 ที่เราให้บริการจริง และมีค่าใช้จ่ายต่อล้านโทเคนต่ำกว่าการโฮสต์โมเดล 12B ด้วยตัวเองบน GPU เช่า หากสิ่งที่คุณต้องการคือการตัดสินใจแบบมีขอบเขตในเส้นทางวิกฤต ค่ามัธยฐาน 209 มิลลิวินาทีของ Clef ถือเป็นคุณสมบัติทางสถาปัตยกรรมที่เป็นของจริง และสิ่งที่ใกล้เคียงที่สุดในแคตตาล็อกของเราคือ Jev 1.13 ของ TypeSafe — โมเดลที่ Cloudflare ใช้เป็นเกณฑ์เปรียบเทียบและคัดลอกรูปแบบไวร์จากมัน — ที่ราคา $0.042 ต่อล้านโทเคนอินพุต บนบริบทขนาด 65,536 โทเคน ให้บริการผ่านรูปแบบ POST /v1/systemoneเดียวกัน เพราะทั้งสองเข้ากันได้ทาง API ภายใต้อะแดปเตอร์บาง ๆ การลอง Clef เทียบกับตัวที่ใช้งานอยู่จึงเป็นการทดลองมากกว่าการโยกย้าย และการทดลองนั้นก็ยังมีค่าใช้จ่ายต่ำเมื่อทั้งสองฝั่งเข้าถึงได้ผ่านปลายทางเดียว

การตัดสินใจ ที่ระบุไว้ในฐานะการตัดสินใจ
เลือก Clef เมื่อคำตอบสามารถแจกแจงได้ สถานะพอดีใน 64K การตัดสินใจอยู่ในเส้นทางที่ไวต่อเวลาแฝง และคุณยินดีรับผิดชอบคลาสส่วนที่เหลือด้วยตัวเอง 97.4 ของ 27B ในการตรวจจับเจตนานอกขอบเขตคือเหตุผลที่คุณจะยอมจ่ายเพื่อมันแทน 9B รุ่นพี่น้อง และรูปร่างเอาต์พุตคงที่ของมันคือสิ่งที่ทำให้คอมโพเนนต์ตรวจสอบได้โดยไม่ต้องมีตัวแยกวิเคราะห์
เลือก Gemma 4 12B เมื่ออินพุตยาว เมื่อมอดัลลิตีเป็นเสียงหรือวิดีโอ เมื่อคำตอบต้องเป็นความเรียง หรือเมื่อยังไม่รู้หมวดหมู่ — เพราะ "จัดกองนี้เข้าหมวดหมู่ใดก็ตามที่สมเหตุสมผล" เป็นคำขอที่โมเดลสำหรับการตัดสินใจรับไม่ได้ ไม่ใช่คำขอที่มันจัดการได้แย่ มันเป็นเจเนอรัลลิสต์ที่มีการประเมินอิสระรองรับอยู่ และสำหรับงานปลายเปิด สิ่งนั้นมีค่ามากกว่าตารางจากผู้ขาย
และจงตั้งข้อกังขาต่อชุดตัวเลขทั้งสองชุดด้วยเหตุผลที่บทความนี้ย้ำซ้ำอยู่เสมอ: Cloudflare ยังไม่เคยมีใครทำซ้ำอย่างเป็นอิสระในเรื่องใดเลย และการ์ดใบนั้นคือตาราง benchmark ของผู้ขายเอง ตัวเลขเดียวที่น่าสนใจจริง ๆ ในคู่นี้ — ว่า schema head ขนาด 27B จะรักษาคะแนน out-of-scope 97.4 ของมันไว้ได้จริงหรือไม่บนข้อมูลที่มันไม่ได้ถูกฝึกด้วย — คือตัวเลขที่ผู้ขายทั้งสองรายต่างก็ชี้ขาดไม่ได้ และมีเพียงบุคคลที่สามเท่านั้นที่ชี้ขาดได้
