
CARI4D กับ ABot-Earth 0.7: สองโมเดล 4D ที่ไม่เคยแข่งขันกัน
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ถ้าคุณค้นหา CARI4Dเทียบกับ ABot-Earth 0.7โดยหวังว่าจะได้เห็นการเปรียบเทียบแบบตัวต่อตัว คำตอบที่ตรงไปตรงมาคือไม่มีการเปรียบเทียบเช่นนั้นอยู่จริง และก็จะไม่มีวันมีด้วย ระบบสองระบบนี้ไม่ได้ทำงานอย่างเดียวกัน ไม่ได้ใช้ข้อมูลนำเข้าแบบเดียวกัน ไม่ได้ให้ผลลัพธ์แบบเดียวกัน และจะไม่มีใครที่เข้าใจระบบใดระบบหนึ่งอย่างแท้จริงนำมันมาเปรียบเทียบกันด้วยเกณฑ์วัด CARI4D คือการสร้างใหม่แบบ 4D ของอันตรกิริยาระหว่างมนุษย์กับวัตถุแบบไม่จำกัดหมวดหมู่ของ NVIDIA — มันเฝ้าดูคนคนหนึ่งจัดการวัตถุชิ้นหนึ่งในวิดีโอธรรมดา แล้วกู้คืนท่าทางในสเกลเมตริกของบุคคลนั้นตลอดช่วงเวลา ABot-Earth 0.7 คือแบบจำลองโลกเมืองแบบ 3D-native ของ Amap — มันรับภาพถ่ายดาวเทียมหรือพรอมต์ข้อความ แล้วสร้างเมืองที่สำรวจได้ขนาดระดับกิโลเมตรออกมาเป็นฉากแบบ Gaussian splatting เหตุผลที่หน้านี้ยังมีอยู่ทั้งอย่างนั้นก็คือ แกนที่แยกสองสิ่งนี้ออกจากกันนั้นมีประโยชน์อย่างแท้จริง และทั้งสองแตกต่างกันอย่างมากในสิ่งที่คุณสามารถทำกับมันได้ มากกว่าที่รูปลักษณ์ของมันดูเหมือนจะเป็น
ยังมีเหตุผลข้อที่สองที่คมชัดกว่า สองรีลีสนี้อยู่ปลายตรงข้ามกันของสเปกตรัมที่สำคัญกว่าบรรทัดสเปกใด ๆ ตัวหนึ่งคุณดาวน์โหลดและรันได้ในบ่ายนี้ ส่วนอีกตัวคุณรันไม่ได้เลย
คำตอบที่ไม่มีใครที่ค้นหาคำนี้อยากได้
ทั้งคู่ได้รับการอธิบายว่าเป็น 4D ทั้งคู่มาจากผู้จำหน่ายรายใหญ่ ทั้งคู่เปิดตัวภายในปีที่ผ่านมา นั่นก็ประมาณจุดที่ความเหมือนกันสิ้นสุดลง
CARI4D ทำการสร้างใหม่ เมื่อได้รับวิดีโอ มันจะประมาณการว่ามีอะไรอยู่ตรงนั้น บทความ — การสร้างใหม่แบบ 4 มิติที่ไม่จำกัดหมวดหมู่ของปฏิสัมพันธ์ระหว่างมนุษย์กับวัตถุ โดย Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll และ Stan Birchfield — ปรากฏบน arXiv ในรหัส 2512.11988 เมื่อเดือนธันวาคม 2025 และได้รับการตอบรับให้ตีพิมพ์ใน CVPR 2026 เนื้อหาของมันคือมนุษย์และวัตถุแข็งที่สัมผัสกัน และข้ออ้างหลักของมันคือมาตราส่วน: การกู้คืนขนาดตามจริงจากกล้องตัวเดียวโดยไม่มีเซ็นเซอร์วัดความลึกและไม่มีชุดกล้องหลายมุมมอง ซึ่งเป็นส่วนที่งานก่อนหน้าต้องประสบปัญหา
ABot-Earth 0.7 เจนเนอเรต เมื่อได้รับภาพถ่ายดาวเทียมที่อ้างอิงพิกัดทางภูมิศาสตร์หรือคำอธิบายเป็นข้อความ มันจะสร้างฉากที่ก่อนหน้านี้ไม่มีอยู่ในรูปแบบข้อมูล Amap บริษัทด้านแผนที่และการนำทางของจีน เปิดตัวเมื่อวันที่ 10 กันยายน 2026 ในงานกาลา Street Stars ที่หางโจว สืบต่อจาก ABot-Earth 0.5 เมื่อวันที่ 8 มิถุนายน โดยส่งออกเป็น 3D Gaussian splats ส่งออกไปยัง Unreal Engine และ Unity และครอบคลุมสิ่งที่ Amap กล่าวว่าเป็น 196 ประเทศและภูมิภาคขึ้นไป เพิ่มจาก 190 แห่งขึ้นไปใน 0.5
ตัวหนึ่งเป็นตัวประมาณค่า อีกตัวหนึ่งเป็นตัวสร้าง ข้อแตกต่างนี้ทำงานได้มากกว่าที่ตารางเบนช์มาร์กใด ๆ จะทำได้
คนหนึ่งคนกับเก้าอี้หนึ่งตัว หรือเมืองหนึ่งเมือง
ช่องว่างของมาตราส่วนคือสิ่งที่ผู้คนมักประเมินต่ำไป หน่วยที่สนใจของ CARI4D คือร่างกายมนุษย์และวัตถุที่ถือด้วยมือ วัดเป็นเซนติเมตร ติดตามผ่านเฟรมของคลิปเดียว หน่วยที่สนใจของ ABot-Earth 0.7 คือพื้นที่หนึ่งตารางกิโลเมตรของเมือง ซึ่งสร้างขึ้นในเวลาประมาณสิบนาทีบน GPU ระดับผู้บริโภคตัวเดียว ตามคำกล่าวอ้างของ Amap เอง
• อินพุต — CARI4D รับวิดีโอ RGB จากกล้องตัวเดียว (MP4) เทียบกับ ABot-Earth 0.7 ที่รับภาพถ่ายดาวเทียมหรือข้อความพรอมต์
• เอาต์พุต — ท่าทางและรูปร่างมนุษย์ต่อเฟรมของ CARI4D, การหมุนและการเคลื่อนที่ของวัตถุ, และลอจิตการสัมผัสด้วยมือสองค่า เทียบกับ ABot-Earth 0.7 ซึ่งเป็นฉาก 3D Gaussian splatting ที่สามารถส่งออกไปยัง Unreal Engine และ Unity ได้
• หน่วยวิเคราะห์ — CARI4D: มนุษย์หนึ่งคนและวัตถุแข็งเกร็งหนึ่งชิ้นที่สัมผัสกัน เทียบกับ ABot-Earth 0.7: ภูมิประเทศ อาคาร พืชพรรณ และแลนด์มาร์กในระดับเมือง
• ข้ออ้างเชิงเวลา — CARI4D สร้างการเคลื่อนไหวที่สังเกตได้ขึ้นใหม่ทีละเฟรม เทียบกับ ABot-Earth 0.7 ซึ่งถูกวางตำแหน่งเป็นแบบจำลองโลกที่มีชั้นการพยากรณ์สำหรับสิ่งที่จะเกิดขึ้นต่อไป
• สเกลเมตริก — สเกลเมตริกของ CARI4D ที่กู้คืนจากวิดีโอแบบโมโนคิวลาร์ผ่าน UniDepth และการค้นหาสเกลแบบหยาบไปละเอียด เทียบกับ ABot-Earth 0.7 ที่อ้างอิงพิกัดภูมิศาสตร์จากภาพถ่ายดาวเทียม โดยไม่มีปัญหาการกู้คืนสเกลเมตริก
• ต้นทุนการรัน — CARI4D PyTorch บน NVIDIA Ampere GPU ซึ่งผ่านการตรวจสอบความถูกต้องบน A100 ใช้เวลา 38 ชั่วโมงบน 8×A100 สำหรับการรันฝึกโมเดลเพื่อการวิจัย เทียบกับ ABot-Earth 0.7 ที่ใช้เวลาประมาณสิบนาทีต่อตารางกิโลเมตรบน GPU ระดับผู้บริโภคหนึ่งตัว ตามการเปรียบเทียบของ Amap เอง

สังเกตว่าไม่มีคอลัมน์ไหนดีกว่ากันในแถวเดียว พวกมันกำลังวัดโลกที่แตกต่างกัน โมเดลที่กู้คืนจุดสัมผัสระหว่างมือกับถังแก๊สไม่ได้ดีขึ้นจากการรู้ตำแหน่งของอาคารด้วย และโมเดลที่สร้างเส้นขอบฟ้าที่สมเหตุสมผลไม่ได้ดีขึ้นจากการรู้มุมข้อมือที่แน่นอนของคนเดินเท้า
ความไม่สมมาตรที่เป็นตัวชี้ขาดจริง ๆ
นี่คือความแตกต่างที่ผู้ซื้อจะรู้สึกได้ภายในชั่วโมงแรก และมันไม่เกี่ยวข้องกับความสามารถเลย
CARI4D มีโค้ดและเวทให้คุณดาวน์โหลดได้แล้ววันนี้ รีพозиториของ NVlabs มีการใช้งานอย่างเป็นทางการ เปิดตัวเมื่อวันที่ 28 กุมภาพันธ์ 2026 โดยมีโค้ดสำหรับฝึกและตัวประมวลผลวิดีโอแบบกำหนดเองเพิ่มเข้ามาเมื่อวันที่ 4 เมษายน เช็คพอยต์ CoCoNet ที่ผ่านการฝึกแล้วดาวน์โหลดได้จาก Hugging Face ส่วนอิมเมจ Docker xiexh20/cari4d ได้เผยแพร่แล้ว และตั้งแต่ 30 สิงหาคม 2026 เช็คพอยต์ขนาด 231M ที่มีสิทธิ์ใช้งานเชิงพาณิชย์ก็มีให้ใช้ในชื่อ nvidia/cari4d_commercial ภายใต้ NVIDIA Open Model Agreement — แม้ต้องผ่านการอนุมัติ แต่ก็ขอรับได้ มีการจัดทำเอกสาร dependencies ไว้ครบ รวมถึงส่วนที่ยุ่งยากอย่างน้ำหนัก torchscript ของ NLF, น้ำหนัก FoundationPose, แอสเซ็ต SMPL-H, ไฟล์ kid_template.npy จาก AGORA และ Hunyuan3D สำหรับเมชของวัตถุ คุณสามารถรันการประมวลผลบนเดโม BEHAVE บนคลิปจากสภาพแวดล้อมจริงที่มีให้ หรือบนวิดีโอของคุณเอง และประเมินผลด้วยสคริปต์ที่มาพร้อมกัน

ABot-Earth 0.7 ไม่สามารถเข้าถึงหรือหาได้ในความหมายใด ๆ เหล่านั้น Amap ไม่ได้เผยแพร่ค่าน้ำหนักโมเดล ไม่มีโมเดลการ์ด ไม่มี API สาธารณะ ไม่มีราคา และไม่มีเอกสารสำหรับนักพัฒนา เว็บไซต์ทดลองใช้งานเปิดให้บริการแล้ว แต่ Amap ระบุว่าการสร้างเป็นแบบเชิญเท่านั้นหรือต้องอยู่ในรายชื่อที่อนุญาต อินเทอร์เฟซมีเฉพาะภาษาจีนตัวย่อ และที่เก็บ GitHub ยุค 0.5 มีรายงานว่ามีเพียงรายงานทางเทคนิคและไม่มีอะไรที่รันได้ ตัวเลขเด่นทุกตัว — สิบนาทีต่อตารางกิโลเมตร ประสิทธิภาพราว 1,000 เท่าของการสร้างใหม่แบบดั้งเดิม ต้นทุนประมาณหนึ่งในร้อย 196 ประเทศขึ้นไป — ล้วนมีที่มาจาก Amap และยังไม่มีใครนอก Amap ทำซ้ำได้อย่างอิสระ นี่เป็นตัวเลขที่ผู้ขายรายงานเอง และในปัจจุบันไม่มีช่องทางใดที่ทำให้ตัวเลขเหล่านี้กลายเป็นอย่างอื่นได้
ดังนั้นการเปรียบเทียบในทางปฏิบัติจึงไม่ใช่ "โมเดลไหนดีกว่ากัน" แต่คือหนึ่งในสองสิ่งนี้เป็นผลงานวิจัยที่มีใบอนุญาตเชิงพาณิชย์และอิมเมจ Docker ส่วนอีกสิ่งหนึ่งเป็นการสาธิตผลิตภัณฑ์ที่มาพร้อมรอบข่าวประชาสัมพันธ์ ทั้งคู่เป็นความสำเร็จที่ชอบธรรม มีเพียงสิ่งเดียวเท่านั้นที่คุณสามารถใส่ลงในบิลด์ได้
ตรงจุดที่ทั้งสองจะได้บรรจบกันอย่างแท้จริง
ที่นี่มีการประกอบกันขึ้นจริง และก็คุ้มค่าที่จะพูดให้เป็นรูปธรรมเกี่ยวกับเรื่องนี้ เพราะนั่นเป็นความหมายเดียวที่ทำให้สิ่งเหล่านี้จัดอยู่ในบทสนทนาเดียวกันได้
ผลลัพธ์ของ CARI4D คือปฏิสัมพันธ์ระหว่างมนุษย์กับวัตถุในกรอบโลกเชิงเมตริก ผลลัพธ์ของ ABot-Earth 0.7 คือสภาพแวดล้อมหนึ่ง นำผลลัพธ์แรกไปเติมลงในผลลัพธ์ที่สอง แล้วคุณจะได้สิ่งที่ทั้งสองไม่ได้ผลิตขึ้นมาลำพัง: เมืองที่ถูกสร้างขึ้นซึ่งผู้คนกำลังทำสิ่งต่างๆ ที่ถูกวัดทางกายภาพ แทนที่จะถูกจัดวางอย่างศิลปะ การจำลองหุ่นยนต์ การวางแผนผังร้านค้าปลีก และการสร้างชุดข้อมูลปฏิสัมพันธ์ ต่างก็ต้องการการผสมผสานแบบนั้นพอดี — สภาพแวดล้อมที่ถูกพอจะสร้างใหม่ได้ และการเคลื่อนไหวของมนุษย์ที่แม่นยำพอจะใช้ฝึกได้

รอยต่อระหว่างทั้งสองคือการแปลงพิกัดและข้อกำหนดเรื่องสเกล และมันไม่ใช่เรื่องเล็กน้อย เพราะกรอบอ้างอิงเชิงเมตริกของ CARI4D ถูกกำหนดโดยอ้างอิงกับกล้องตัวเดียว ในขณะที่ของ ABot-Earth 0.7 ถูกกำหนดด้วยตำแหน่งทางภูมิศาสตร์ ไม่มีใครเคยเผยแพร่การผสานรวมนั้น มันเป็นประเภทของสิ่งที่ทีมสร้างขึ้นได้ในหนึ่งสัปดาห์แล้วไม่เขียนเป็นเอกสารเอาไว้
ขั้นตอนที่มักถูกลืมในไปป์ไลน์นั้นคือส่วนที่เปลี่ยนข้อมูลปฏิสัมพันธ์ดิบให้กลายเป็นสิ่งที่สืบค้นได้ — การใส่คำบรรยายให้คลิป การติดแท็กเหตุการณ์การสัมผัส การสร้างดัชนีสำหรับค้นคืน และตัวกรองควบคุมคุณภาพเหนือผลลัพธ์ งานนี้ต้องอาศัยโมเดลภาษาภาพและโมเดลภาษา และนั่นคือเลเยอร์ที่ OrcaRouter ครอบคลุม: โมเดลมากกว่า 200 ตัวภายใต้ API เดียว ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยบวกเพิ่ม 0% การสลับไปใช้ระบบสำรองอัตโนมัติเมื่อผู้ให้บริการมีประสิทธิภาพลดลง และ DSL สำหรับกำหนดเส้นทางที่ประกอบโมเดลหลายตัวเข้าเป็นคำเรียกเดียว เพื่อให้การใส่คำบรรยายและการตรวจสอบ QC ไม่ต้องเป็นอินทิเกรชันแยกจากกัน ทั้ง CARI4D และ ABot-Earth 0.7 ไม่ได้ให้บริการอยู่ที่นั่น และทั้งคู่ก็ไม่ใช่ LLM — แต่เครื่องมือที่คุณใช้ล้อมรอบทั้งสองนั้นเกือบจะแน่นอนว่าใช่
คุณอยากได้อันไหนจริงๆ
เลือก {{1}}CARI4D{{/1}} หากคุณมีวิดีโอของบุคคลที่กำลังมีปฏิสัมพันธ์กับวัตถุ และต้องการท่าทางของบุคคลนั้นในหน่วยเมตริก ทีละเฟรม — สำหรับการวิเคราะห์การเคลื่อนไหว การรับรู้ของหุ่นยนต์ ข้อมูลอ้างอิงสำหรับแอนิเมชัน หรือการสร้างชุดข้อมูลการมีปฏิสัมพันธ์ ตอนนี้พร้อมใช้งานแล้ว มีเอกสารประกอบ และสิทธิ์การใช้งานเชิงพาณิชย์มีผลเมื่อวันที่ {{2}}30 สิงหาคม 2026{{/2}} จัดสรรงบประมาณสำหรับห่วงโซ่การพึ่งพา และอ่านข้อกำหนดสิทธิ์การใช้งานในส่วนที่ {{3}}NVIDIA{{/3}} ไม่ได้เป็นเจ้าของ
เลือก ABot-Earth 0.7 หากคุณต้องการสภาพแวดล้อมมากกว่าตัวละคร — ฉากขนาดเมืองที่สร้างจากสถานที่หรือคำอธิบายอย่างรวดเร็ว และส่งออกไปยังเอนจินเกมได้ โปรดเข้าใจว่าคุณกำลังประเมินความสามารถที่ได้รับการสาธิต มากกว่าการนำเครื่องมือมาใช้งาน และการเข้าถึงเป็นไปตามดุลยพินิจ และตัวเลขประสิทธิภาพเป็นของ Amap เอง
เลือกทั้งสองอย่างก็ต่อเมื่อคุณกำลังสร้างระบบที่ประกอบขึ้นตามที่อธิบายไว้ข้างต้น และเริ่มลงมือโดยรู้ไว้เลยว่าคุณจะต้องเป็นคนเขียนรอยต่อนั้นด้วยตัวเอง
คำถามที่ควรถามไม่ใช่ว่าในสองตัวนี้ตัวไหนจะชนะ แต่คือว่าสิ่งที่คุณกำลังสร้างอยู่จริง ๆ นั้นต้องการโมเดลสำหรับการสร้างใหม่ (reconstruction model) โมเดลสำหรับการสร้าง (generation model) หรือไม่ต้องการทั้งสองอย่าง — และในคำถามข้อนั้น คำตอบของสองตัวนี้ไม่เคยทับซ้อนกันเลย
