
Laya กับ von: เมื่อเบนช์มาร์กจากผู้ขายไม่สามารถถ่ายโอนได้
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
งานจำแนกประเภทคอมมิตที่มีป้ายกำกับที่เป็นไปได้หกป้าย โดยการเดาจะได้ 8.3% และ von ทำได้ 26.7% งานกำหนดเส้นทางไฟล์ที่โมเดลเดียวกันทำได้ 8.8% ซึ่งแทบไม่เหนือกว่าการเดา งานไบนารีเรื่องขอบเขตการเปลี่ยนแปลงที่มีค่า AUC 0.513 ซึ่งเป็นการทอยเหรียญ ตัวเลขเหล่านั้นมาจากการประเมินของบุคคลที่สามต่อ von — โมเดล System One โอเพนซอร์สจาก wfzyx ซึ่งเป็นเอนโคเดอร์ ModernBERT-Large ขนาด 395M ที่เผยแพร่ภายใต้ Apache 2.0 เมื่อวันที่ 18 กันยายน 2026 วันเดียวกับ Laya ของ Convai Innovations บนเบนช์มาร์ก jabr v2 ของ von เอง ภาพกลับตรงกันข้าม: ความแม่นยำมาโคร 71.5% จาก 49 งานและ 869 กรณี, การกำหนดเส้นทางแบบทางเลือกที่ 83.4%, และผล ViZDoom ที่ 9.38 การสังหารเฉลี่ยในเวลาไม่ถึง 18ms เทียบกับ Jev ของ TypeSafe AI ที่ 5.62 การสังหารและประมาณ 115ms ตัวเลขทั้งสองชุดเป็นของจริง ช่องว่างระหว่างตัวเลขทั้งสองชุดเป็นสิ่งที่มีประโยชน์ที่สุดที่ใครๆ ก็เคยเผยแพร่เกี่ยวกับหมวดหมู่โมเดลนี้ และมันใช้ได้กับ Laya ด้วยเช่นกัน
สองโมเดล สองแบ็กโบน หนึ่งโหมดความล้มเหลวร่วมกัน
von และ Laya ใกล้เคียงกันในเชิงสถาปัตยกรรม ด้วยเหตุนี้ปัญหาการถ่ายโอน (transfer problem) จึงเป็นมุมมองที่เหมาะสมสำหรับการเปรียบเทียบทั้งสอง ทั้งคู่เป็นเอนโคเดอร์แบบ non-autoregressive ที่สร้างขึ้นบน ModernBERT: von มี 395M พารามิเตอร์ ส่วนเช็กพอยต์ภาษาอังกฤษของ Laya มี 421M ทั้งคู่เปิดให้ใช้ primitive สามอย่างชุดเดียวกัน — choice จากรายการที่จัดเตรียมไว้ score บนรูบริกที่มีลำดับ noul ในฐานะความน่าจะเป็นแบบคาลิเบรตของค่า yes — และทั้งคู่ใช้งานรูปแบบ wire /v1/systemone เพื่อให้ไคลเอนต์ที่เขียนมาสำหรับ Jev ของ TypeSafe ชี้ไปยังเซิร์ฟเวอร์ภายในเครื่องแทนได้ ทั้งคู่ใช้สัญญาอนุญาต Apache 2.0 ทั้งคู่คืนค่าความน่าจะเป็นแทนที่จะเป็นข้อความ และไม่มีลูปการถอดรหัสให้เกิดการหลอน (hallucination) ได้

ความแตกต่างอยู่ที่เรื่องราวการฝึก von ถูกพรีเทรนบนโทเค็น 2 ล้านล้านโทเค็นของข้อความเว็บทั่วไป เอกสารทางเทคนิค และโค้ด จากนั้นจึงไฟน์จูนบนคลังข้อมูลหลายโดเมนที่สมดุลประมาณ 290,000 ตัวอย่าง ครอบคลุมเวิร์กโฟลว์ด้านปฏิบัติการและองค์กร ความปลอดภัยและ DevOps ความปลอดภัยและการกลั่นกรองนโยบาย ภาษาศาสตร์ การคัดแยก และการให้เหตุผลเชิงปฏิปักษ์ การฝึกหลังการฝึกใช้ Reinforcement Learning with Calibration Distribution โดยลดองค์ประกอบของเอนโทรปีไขว้และคะแนนไบรเออร์ด้วยแลมบ์ดาที่ 0.5 และการปรับขนาดอุณหภูมิลู่เข้าที่ T=1.1692 เช็คพอยต์ภาษาอังกฤษของ Laya คือ ModernBERT-large ที่ไฟน์จูนสำหรับรูปแบบการตัดสินใจแบบมีชนิด พร้อมหน้าต่าง 512 โทเค็น ควบคู่กับเช็คพอยต์หลายภาษาขนาด 322M mmBERT-base ที่ครอบคลุมกว่า 100 ภาษาที่อยู่เบื้องหลังเราเตอร์ และค่า p50 32.8ms ต่อการตัดสินใจที่เผยแพร่บน Tesla T4
โหมดความล้มเหลวร่วมคือทั้งคู่เป็นเอนโคเดอร์ที่ถูกฝึกมาให้สร้างผลลัพธ์ ไม่ใช่ตัวให้เหตุผล README ของ von เองก็ระบุชัดเจนว่ามันกำหนดเป้าหมายไปที่ไปป์ไลน์ที่ไวต่อความหน่วง ซึ่งโมเดล autoregressive ทำให้เกิดความหน่วง 500–2,000ms และข้อผิดพลาดในการแยกวิเคราะห์สคีมาที่ไม่แน่นอน กรอบแนวคิดนั้นบอกคุณว่ามันมีไว้สำหรับอะไร: การจำแนกประเภทที่รวดเร็ว แน่นอน และปรับเทียบทางสถิติ มันไม่ได้บอกคุณว่ามันจะได้ผลกับการจำแนกประเภทของคุณ และการวัดประสิทธิภาพแบบอิสระคือสิ่งที่เกิดขึ้นเมื่อมีคนตรวจสอบ
อ่าน benchmark ของ von อย่างตรงไปตรงมา
ผลลัพธ์ของ jabr v2 ถูกเผยแพร่โดยเจ้าของเองและยังไม่ได้รับการตรวจสอบอย่างอิสระ และโครงสร้างของเบนช์มาร์กก็สำคัญพอ ๆ กับคะแนน งาน 49 งานและ 869 เคสถือเป็นความกว้างที่สมเหตุสมผลสำหรับการประเมินโมเดลสำหรับการตัดสินใจ และความแม่นยำแบบมาโคร 71.5% เป็นตัวเลขที่แข็งแกร่งสำหรับเอนโคเดอร์ขนาด 395M การแยกตามโดเมนคือจุดที่ให้ข้อมูลเชิงลึก: การคัดแยกอาการอยู่ที่ 100.0% บริการภายในบ้านอยู่ที่ 95.7% การจัดเส้นทางระดับเมืองอยู่ที่ 94.7% การจัดเส้นทางแบบเลือกโดยรวมอยู่ที่ 83.4% นั่นคือกลุ่มงานที่คอร์ปัสฝึกอบรมถูกสร้างขึ้นโดยเน้นเป็นหลัก — README อธิบายข้อมูล fine-tuning ว่าเป็นเวิร์กโฟลว์ด้านปฏิบัติการและองค์กร ความปลอดภัยและ DevOps การกลั่นกรองด้านความปลอดภัยและนโยบาย ภาษาศาสตร์ การคัดแยก และการให้เหตุผลเชิงปฏิปักษ์ คะแนนสูงในด้านการคัดแยกอาการเป็นข้อบ่งชี้ว่าโมเดลเรียนรู้โดเมนการคัดแยก ไม่ได้เรียนรู้ที่จะจำแนกประเภท

ผลลัพธ์ของ ViZDoom เป็นผลลัพธ์ที่ถูกอ้างถึงมากที่สุด และสมควรได้รับการอ่านอย่างรอบคอบ ค่าเฉลี่ยการสังหาร 9.38 ครั้งใน "Defend the Center" ใช้ 8 ซีด แบบ zero-shot จากข้อความฉากที่มีโครงสร้าง ที่ความหน่วงต่ำกว่า 18 มิลลิวินาที เทียบกับ 5.62 ครั้งของ Jev ที่ประมาณ 115 มิลลิวินาที — เป็นการปรับปรุง +66.9% นี่เป็นผลลัพธ์ที่น่าทึ่ง และยังเป็นสภาพแวดล้อมเกมที่ขับเคลื่อนด้วยข้อความที่มีโครงสร้าง ซึ่งนโยบายรีเฟล็กซ์ที่รวดเร็วนั้นเป็นรูปแบบที่เหมาะสมพอดี การวางกรอบกระบวนทัศน์ System One ของโครงการ — รีเฟล็กซ์ ขนาน ดีเทอร์มินิสติก ปรับเทียบเชิงสถิติ — เป็นคำอธิบายที่ตรงไปตรงมาของสิ่งที่งานนั้นให้รางวัล
จากนั้นการประเมินโดยบุคคลที่สามได้รัน von กับงานจำแนกประเภทคอมมิต การจัดเส้นทางไฟล์ การตรวจจับฟีเจอร์ และการให้คะแนนความกว้างของการเปลี่ยนแปลง และมันแพ้ให้กับเส้นฐานแบบคีย์เวิร์ดและ regex ในบางงานเหล่านั้น ค่า AUC ที่ 0.513 บนงานไบนารีเป็นตัวเลขที่ชัดที่สุด: เท่ากับการโยนเหรียญ จากโมเดลที่การคาลิเบรตถูกปรับจูนเป็น T=1.1692 และ README อ้างว่ามีค่า expected calibration error ใกล้เคียงอุดมคติ ทั้งสองอย่างสามารถเป็นจริงได้พร้อมกัน โมเดลหนึ่งอาจคาลิเบรตได้ดีบนการแจกแจงที่มันถูกฝึก และไร้ประโยชน์บนการแจกแจงที่มันไม่เคยเห็น — และที่จริงแล้ว การคาลิเบรตที่ดีบนการแจกแจงที่ผิดนั้นแย่กว่าการคาลิเบรตที่แย่อย่างเห็นได้ชัด เพราะตัวเลขความเชื่อมั่นดูน่าเชื่อถือ
การทดสอบเดียวกันนี้ใช้กับ Laya
Laya ได้รับการทดลองในรูปแบบหนึ่ง และผลลัพธ์ก็สอดคล้องกับของ von ในเกณฑ์มาตรฐาน typed-decisions ของ TypeSafe Laya ทำคะแนนได้ 0.362 ในแบบ zero-shot เทียบกับ 0.318 สำหรับการสุ่ม และ 0.461 สำหรับ majority-class baseline — ใกล้เคียงกับโอกาสสุ่มมากกว่าคำตอบแบบง่าย ๆ การ์ดโมเดลของมันเองระบุข้อสรุปว่า: "Laya เป็นฐานที่เร็วสำหรับการปรับแต่งเฉพาะทาง ไม่ใช่เครื่องมือตัดสินใจแบบ zero-shot" เมื่อเกินประมาณยี่สิบตัวเลือก ประสิทธิภาพจะลดลงอย่างรวดเร็ว โดยได้ 0.425 บน Banking77 เทียบกับ 0.870 ของ Jev ในการทดสอบโดยบุคคลที่สามครั้งหนึ่งกับข้อความเร่งด่วน 100 ข้อความของ Mars-base Jev ได้ 100/100 และ Laya ได้ 53/100 ในเกณฑ์มาตรฐาน browser-agent มันทำงานสำเร็จ 0 จาก 50 งาน โดยประกาศว่าเสร็จสิ้นก่อนเวลาอันควรใน 33 ครั้ง ซึ่ง 17 ครั้งเกิดขึ้นก่อนที่จะลงมือทำอะไรเลย — แม้ว่าผู้เขียนเกณฑ์มาตรฐานจะตั้งข้อสังเกตว่ามันถูกฝึกมาสำหรับงานที่ต้องใช้ดุลยพินิจ เช่น ตั๋วสนับสนุนและใบแจ้งหนี้ ไม่ใช่การนำทาง ซึ่งเป็นการระบุขอบเขตมากกว่าคำตัดสิน
จุดที่ Laya ต่างจาก von อยู่ที่สิ่งที่แต่ละโครงการอ้างเกี่ยวกับตัวเอง Convai เผยแพร่ตัวเลข zero-shot ที่ไม่น่าประทับใจ และค่า expected calibration error ที่ 0.466 บนการ์ดโมเดล ข้าง ๆ กับค่า 0.081 ที่ได้จากการรีฟิตอุณหภูมิแยกตามประเภทคำถาม README ของ von เผยแพร่ตัวเลข jabr v2 ที่น่าประทับใจและชัยชนะใน ViZDoom ทั้งสองโครงการซื่อสัตย์เกี่ยวกับสิ่งที่ทำ มีเพียงหนึ่งในนั้นที่นำด้วย benchmark ที่โมเดลทำได้แย่ นั่นเป็นข้อสังเกตเกี่ยวกับแหล่งที่มา ไม่ใช่ข้อกล่าวหา — แต่ถ้าคุณกำลังเลือกระหว่างสองโครงการนี้จากหลักฐานที่เผยแพร่ โปรดทราบว่าคุณกำลังเปรียบเทียบโครงการที่แสดงตัวเลขที่อ่อนแอของตัวเองให้คุณเห็น กับอีกโครงการหนึ่งที่คุณต้องไปหาตัวเลขที่อ่อนแอของมันจากที่อื่นเอง
การเปรียบเทียบสเปก ทีละมิติ
• แกนหลัก — Laya: ModernBERT-large 421M ภาษาอังกฤษ, mmBERT-base 322M หลายภาษา. ของ: ModernBERT-Large 395M.
• ภาษา — Laya: 100+ ผ่าน multilingual checkpoint และ router. von: อังกฤษ โดยไม่มี multilingual checkpoint เผยแพร่.
• หน้าต่างบริบท — Laya: 512 โทเค็นภาษาอังกฤษ, 1,024 โทเค็นหลายภาษา. von: ไม่ได้เผยแพร่ในข้อกำหนดเดียวกัน; เคส jabr v2 เป็นการตัดสินใจแบบมีโครงสร้างที่สั้น.
• ความหน่วง — Laya: 32.8ms p50 บน T4, 7.2ms ต่อคำถามที่ batch 10. von: อ้างว่าต่ำกว่า 15ms ถึงต่ำกว่า 25ms, ต่ำกว่า 18ms ในการรัน ViZDoom.
• ความแม่นยำที่มีการรายงาน — Laya: 0.362 แบบ zero-shot, 0.766 เมื่อ fine-tune บน split ของ benchmark เอง, 0.425 บน Banking77. von: 71.5% macro จาก 49 งานของ jabr v2, 83.4% สำหรับ choice routing และ 26.7% สำหรับ commit type ในการทดสอบอิสระ
• การสอบเทียบ — Laya: ECE 0.466 ตอนเปิดตัว, 0.081 หลังการปรับตั้งอุณหภูมิใหม่แยกตามประเภทคำถาม von: ปรับสเกลอุณหภูมิเป็น T=1.1692 ระหว่างการฝึกภายหลังด้วย RLCD โดยอ้างว่ามี ECE ใกล้เคียงอุดมคติบนการกระจายของตัวเอง
• การให้บริการ — Laya: pip install laya พร้อมพอร์ตชุมชนสำหรับ ONNX, Go และ Apple MLX ส่วน von: SDK สำหรับ Python และ TypeScript, เซิร์ฟเวอร์ HTTP ผ่าน von serve รวมถึงพรีเซ็ตที่จัดแพ็กเกจมาให้พร้อมใช้สำหรับการคัดแยกตั๋ว ความปลอดภัยอีเมล การกลั่นกรอง และการคัดแยกเหตุการณ์ด้านความปลอดภัย
• ฮาร์ดแวร์ — Laya: CPU, CUDA และ Apple MPS จาก: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS และ CPU แบบหลายเธรด
• สัญญาอนุญาต — Apache 2.0 สำหรับทั้งสอง
ส่วนที่โดดเด่นอย่างแท้จริงของฟอน
รูปแบบที่ประกอบกันได้ของ von เป็นสิ่งที่มีการพูดถึงน้อยที่สุดในรีโพซิทอรีของมัน การควบคุมด้วยความเชื่อมั่น (confidence gating) การส่งต่อเส้นทาง (route dispatch) การให้คะแนนแบบผสม (composite scoring) และการจัดเส้นทางแบบสองขั้นตอน (two-stage routing) ถูกจัดส่งมาเป็นรูปแบบที่มีชื่อเรียก ควบคู่ไปกับพรีเซ็ตต่าง ๆ — การคัดแยกตั๋ว ความปลอดภัยของอีเมล การกลั่นกรอง การคัดแยกเหตุการณ์ด้านความปลอดภัย — และสิ่งเหล่านี้ถอดรหัสสถาปัตยกรรมที่โมเดลสำหรับตัดสินใจต้องการจริงในการใช้งานจริง การเรียก choiceเพียงครั้งเดียวไม่ค่อยเป็นระบบทั้งหมด รูปแบบที่มีประโยชน์คือเราเตอร์ขั้นแรกที่ราคาถูก ซึ่งส่งต่อไปยังขั้นที่สองที่เชี่ยวชาญ พร้อมกับเกตความเชื่อมั่นที่ยกระดับกรณีที่ไม่แน่นอนให้สูงขึ้น von จัดส่งสิ่งนี้เป็นรูปแบบที่มีเอกสารกำกับไว้ แทนที่จะปล่อยให้คุณจัดการเอง
เรื่องนี้สอดคล้องพอดีกับสิ่งที่ OrcaRouter ทำในฝั่งเจเนอเรทีฟ ซึ่งควรพูดให้ชัดเจนเพราะสองครึ่งของแพตเทิร์นนี้มักถูกสร้างโดยทีมที่ต่างกัน ทั้ง von และ Laya ไม่ได้โฮสต์อยู่บน OrcaRouter — ทั้งคู่เป็นเวตที่คุณดาวน์โหลดไปรันเอง และไม่มีอะไรตรงนี้ที่ควรตีความเป็นข้ออ้างว่าเราให้บริการโมเดลเหล่านี้ สิ่งที่อยู่ในรายการของเราคืออีกครึ่งหนึ่ง นั่นคือโมเดลเจเนอเรทีฟ 200+ ตัวที่อยู่หลังคีย์เดียวซึ่งเข้ากันได้กับ OpenAI ในราคาตามรายการของผู้ให้บริการ ส่งผ่านโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ให้บริการลดราคา บิลของคุณก็สะท้อนราคานั้นในวันเดียวกันแทนที่จะรอถึงรอบต่ออายุ หาก confidence gate ของ von ตัดสินว่า 4% ของคำขอจำเป็นต้องใช้โมเดลระดับแนวหน้า routing DSL คือสิ่งที่ประกอบการตัดสินใจนั้นให้กลายเป็นการเรียกครั้งเดียวแทนที่จะเป็นสองสัญญาและสอง SDK และ automatic failover คือสิ่งที่ทำให้เส้นทางที่มีค่าใช้จ่ายสูงไม่กลายเป็นจุดล้มเหลวจุดเดียว
จะทำอย่างไรกับสองโมเดลที่ต่างก็ล้มเหลวเมื่ออยู่นอกการแจกแจงข้อมูลที่ใช้ฝึก
ข้อสรุปในทางปฏิบัติจากการประเมิน von ไม่ใช่ว่า von เป็นโมเดลที่ไม่ดี แต่เป็นว่า ความแม่นยำที่เผยแพร่ของโมเดลสำหรับการตัดสินใจเป็นเพียงคำกล่าวอ้างเกี่ยวกับการกระจายข้อมูลที่ใช้ฝึก และวิธีเดียวที่จะรู้ว่าปัญหาของคุณอยู่ในช่วงการกระจายนั้นหรือไม่ คือการทดสอบมัน ตาราง benchmark ใน README ของ von เองเปรียบเทียบตัวเองกับ GLiNER2, Qwen3.5 4B ที่ปรับละเอียดแล้ว, Laya และ Jev ของ TypeSafe ในด้านขนาด ความแม่นยำ ความหน่วง และการโฮสติ้ง — ซึ่งเป็นตารางที่มีประโยชน์ และยังเป็นตารางที่รายการความแม่นยำทุกตัวยกเว้นรายการเดียวมาจากชุดทดสอบของผู้เขียนเอง
ระหว่างสองตัวเลือก: เลือก von หากคุณต้องการชุดโดเมนที่เผยแพร่กว้างกว่า ฟุตพรินต์ที่เล็กกว่าเล็กน้อย รูปแบบการเสิร์ฟที่สร้างไว้ล่วงหน้าสำหรับการคัดกรองและการกลั่นกรอง และหลักฐานจาก ViZDoom ว่ามันจัดการการตัดสินใจจากข้อความแบบมีโครงสร้างที่รวดเร็วได้ดี เลือก Laya หากคุณต้องการอินพุตหลายภาษา — von ไม่มีเช็กพอยต์หลายภาษา และตัวแปร mmBERT ขนาด 322M ของ Laya ครอบคลุมมากกว่า 100 ภาษา — หรือหากตัวเลข 32.8ms บน T4 และหน้าต่างภาษาอังกฤษขนาด 512 โทเคนเข้ากับเวิร์กโหลดของคุณ ไม่ควรเลือกตัวใดเลยโดยไม่ใช้เวลาหนึ่งบ่ายในการติดป้ายกำกับตัวอย่างไม่กี่ร้อยรายการจากทราฟฟิกของคุณเองและรันทั้งสองตัวเทียบกับตัวอย่างเหล่านั้น เอกสารของทั้งสองโปรเจกต์เองก็ชี้ให้คุณไปที่การทดลองนั้น และผลลัพธ์จากบุคคลที่สามของ von คือสิ่งที่เกิดขึ้นเมื่อไม่มีใครรันมัน
สิ่งเดียวที่จะเปลี่ยนการเปรียบเทียบนี้คือการประเมินแบบจับคู่บนอินพุตที่เหมือนกัน พร้อมแผนภาพความน่าเชื่อถือสำหรับแต่ละโมเดล สิ่งนี้ยังไม่มีอยู่ จนกว่าจะมี การจัดอันดับอย่างซื่อสัตย์ก็คือจัดตามคุณภาพของหลักฐานมากกว่าตามคะแนน: Laya เผยแพร่ตัวเลขที่แย่ที่สุดของตนออกมาแล้ว von เผยแพร่ตัวเลขที่ดีที่สุดของตนออกมา และการทดสอบอิสระของ von ก็เป็นสิ่งที่ใกล้เคียงที่สุดที่ทั้งสองฝ่ายมีต่อการตรวจสอบจากภายนอก

