การ์ดชื่อเรื่องแบบฮีโร่สำหรับ Tavus Griffin พร้อมคำบรรยายใต้ชื่อว่า "โมเดลปฏิสัมพันธ์ระหว่างมนุษย์รุ่นแรก — ประกาศเมื่อวันที่ 1 ตุลาคม 2026" เหนือชิปสามอันที่อ่านว่า "48% คิดว่าเป็นคนจริง" "การสร้าง VideoFDB: 3.83 เทียบกับค่าอ้างอิงมนุษย์ที่ 3.92" และ "ความหน่วงเสียงเป็นวิดีโอ 0.43 วินาที" ส่วนท้าย: "ตัวเลขทั้งหมดรายงานโดยผู้จำหน่ายและ NVIDIA; Griffin-Lite เป็นตัวอย่างงานวิจัย ยังไม่พร้อมใช้งานทั่วไป" โลโก้ OrcaRouter ถูกประกอบรวมไว้ที่มุมขวาล่าง
Guides & Insights

Tavus Griffin: โมเดลปฏิสัมพันธ์ของมนุษย์ตัวแรก และ 48% ที่ผ่านการทดสอบทัวริงแบบวิดีโอ

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ห้าสิบสี่คนมียี่สิบหกคนที่คุยวิดีโอคอลหนึ่งนาทีจนจบแล้วบอกว่าคู่สนทนาของตนเป็นคนจริง นั่นคือตัวเลขที่ Tavus ใช้ชูโรงสำหรับTavus Griffin ซึ่งประกาศเปิดตัวเมื่อวันที่ 1 ตุลาคม 2026 และมันเป็นผลลัพธ์ที่น่าทึ่งจริง ๆ ภายใต้โปรโตคอลเดียวกัน สแตกเดิมของบริษัท — Phoenix-4.5 เรนเดอร์ใบหน้า, Raven-1 รับรู้, Sparrow-2 ดูแลจังหวะการผลัดกันพูด — ให้ผลแค่หนึ่งคนจากสี่สิบเอ็ดคน หรือ 2.4% การตีความสองแบบที่ชัดเจนที่สุดของความก้าวกระโดดครั้งนี้ล้วนผิดทั้งคู่ และการแยกสองสิ่งนั้นออกจากกันคือเนื้อหาส่วนใหญ่ของสิ่งที่ตามมา Griffin ไม่ใช่เอนจินอวตาร์ที่ดีกว่า และไม่ใช่ผลิตภัณฑ์ที่คุณซื้อได้ มันคือพรีวิวงานวิจัยชื่อ Griffin-Lite เปิดให้เฉพาะผู้ทดสอบที่ได้รับความไว้วางใจบางราย ไม่มีราคา ไม่มี API สาธารณะ และไม่มีชื่ออยู่ในตารางจัดอันดับวิดีโออิสระใด ๆ การที่ทั้งสองอย่างนี้เป็นจริงพร้อมกันคือเรื่องราวที่แท้จริง

สิ่งที่ 48% วัด และสิ่งที่มันไม่ได้วัด

การศึกษานี้เป็นการทดสอบทัวริงแบบเผชิญหน้า ไม่ใช่แบบสำรวจความชอบ และระเบียบวิธีวิจัยก็ควรค่าแก่การระบุอย่างแม่นยำ เพราะมันเป็นข้ออ้างหลักที่รับน้ำหนัก ผู้เข้าร่วมห้าสิบสี่คนถูกรับสมัครผ่านแพลตฟอร์มวิจัยอิสระ และได้รับแจ้งว่าพวกเขาจะถูกจับคู่กับผู้เข้าร่วมอีกคนสำหรับการวิดีโอคอลหนึ่งนาทีเกี่ยวกับสิ่งที่พวกเขารอคอยในปีนี้ คู่สนทนาของพวกเขาคือ PAL ที่รัน Griffin-Lite ซึ่งสร้างใบหน้า เสียง และการตอบสนองแบบเรียลไทม์ เฉพาะตอนท้ายของการสำรวจเท่านั้นที่พวกเขาถูกถามว่าเคยคิดหรือไม่ว่าคู่สนทนาอาจไม่ใช่คนจริง และจากนั้นผู้เข้าร่วมทุกคนก็ได้รับแจ้งว่ามันเป็น AI การรันเปรียบเทียบใช้ระเบียบวิธีเดียวกันกับสแต็กเก่า โดยมีผู้เข้าร่วมสี่สิบเอ็ดคน

ตัวเลขสนับสนุนมีความสำคัญพอๆ กับพาดหัวข่าว ผู้ที่เชื่อนั้นมั่นใจ — โดยเฉลี่ย 79% — และผู้ที่สงสัยก็เช่นกัน ที่ 81% ซึ่งเป็นสิ่งที่การศึกษาต้องการ: ไม่มีใครเดา ผู้เข้าร่วมมากกว่าครึ่งกล่าวว่าความเป็นไปได้นั้นไม่เคยเข้ามาในความคิดของพวกเขาเลยระหว่างการสนทนา และเกือบทั้งหมดของกลุ่มนั้นกล่าวต่อไปว่าคู่สนทนาเป็นของจริง ผู้เข้าร่วมที่สงสัยจริงๆ มีแนวโน้มที่จะสงสัยภายในยี่สิบวินาทีแรก นั่นคือบรรทัดที่สบายใจน้อยที่สุดในรายงาน และเป็นบรรทัดที่ควรกำหนดวิธีที่คุณอ่านส่วนความปลอดภัยในภายหลัง

ในมาตรวัดแบบเจ็ดจุด โมเดลได้คะแนนเฉลี่ย 5.4 สำหรับความดูเป็นธรรมชาติ 5.6 สำหรับความดูน่าเชื่อถือ 5.8 สำหรับคำถามว่าผู้เข้าร่วมจะสนุกกับการพูดคุยกับมันอีกครั้งหรือไม่ — คะแนนที่ยังคงอยู่ที่ 5.4 แม้ในกลุ่มผู้เข้าร่วมที่ระบุได้อย่างถูกต้องว่ามันเป็น AI — และ 5.5 สำหรับความรู้สึกว่าคู่สนทนากำลังตั้งใจฟังพวกเขาจริง ๆ คะแนนต่ำสุดคือ 4.9 สำหรับคำถามว่าบทสนทนาลื่นไหลตามธรรมชาติหรือไม่ เมื่ออ่านเป็นชุด นี่คือโปรไฟล์ที่เฉพาะเจาะจง: Griffin-Lite ชวนเชื่อทีละช่วงเวลา และชวนเชื่อได้น้อยลงเล็กน้อยเมื่อมองเป็นเส้นเรื่องโดยรวม

เบนช์มาร์กอิสระ และวิธีอ่านแทร็กทั้งสองของมัน

ตัวเลขคุณภาพมาจาก VideoFDB ของ NVIDIA ซึ่งเป็นเกณฑ์มาตรฐานสำหรับการสนทนาแบบเสียงและภาพแบบฟูลดูเพล็กซ์ที่ให้คะแนนโมเดลในสองแทร็กแยกกัน — การสร้าง หมายถึงว่าโมเดลแสดงพฤติกรรมที่ถูกต้องหรือไม่ และการรับรู้ หมายถึงว่าโมเดลเข้าใจช่วงเวลานั้นหรือไม่ — โดยแต่ละแทร็กมีเกณฑ์การให้คะแนนของตัวเองและมีลีดเดอร์บอร์ดของตัวเอง NVIDIA สร้างเกณฑ์มาตรฐานนี้ ดำเนินการประเมินด้วยผู้ตัดสินของตัวเองเทียบกับเมตริกที่เผยแพร่ และให้คะแนนคำตอบในระดับศูนย์ถึงห้า Tavus ไม่ได้รันมัน ซึ่งนั่นคือเหตุผลที่ต้องอ้างอิงถึงมัน

• การสร้าง — Griffin-Lite ได้คะแนน 3.83 ระบบที่เผยแพร่แล้วซึ่งได้คะแนนสูงเป็นอันดับถัดมาอยู่ที่ 2.80 (Gemini 2.5 ร่วมกับ Anam) และค่าอ้างอิงเฉลยจากมนุษย์อยู่ที่ 3.92 ซึ่งนำหน้าระบบที่เทียบเคียงได้ดีที่สุดอยู่ 1.03 และต่ำกว่ามนุษย์อยู่ 0.09

• การรับรู้ — 3.73 เทียบกับค่าอ้างอิงของมนุษย์ที่ 4.20 โดยมี 3.44 สำหรับค่าพื้นฐานที่รายงานสูงสุด คือ MiniCPM-o 4.5 ในรูปแบบการทำงานแบบเสียงเท่านั้น Gemini 2.5 Flash Native ได้ 3.17 และ gpt-realtime ของ OpenAI ได้ 2.97

• ความสอดคล้องของอัตราการแทรกบทพูด — 62.8% ในด้านการสร้าง และ 73.8% ในด้านการรับรู้ ค่านี้วัดว่าการตัดสินใจของโมเดลว่าจะพูดเมื่อใดสอดคล้องกับจังหวะในบทสนทนาอ้างอิงมากเพียงใด และ Tavus ระบุว่าทั้งสองค่าเป็นค่าที่สูงที่สุดในบรรดาระบบใด ๆ บนบอร์ด

มีข้อควรระวังสองข้อที่ควรแนบไปกับตัวเลขเหล่านั้น ก่อนที่ใครจะนำไปพูดซ้ำ ช่องว่างในการสร้างเมื่อเทียบกับมนุษย์อยู่ที่ 0.09 บนมาตรวัดห้าจุดที่ตัดสินโดยแบบจำลองภาษา ซึ่งควรตีความว่า "ใกล้เคียงมนุษย์ในเกณฑ์นี้" มากกว่า "อยู่ในระดับมนุษย์" และการเปรียบเทียบการรับรู้ก็ไม่ได้เป็นการเปรียบเทียบแบบเดียวกัน: MiniCPM-o 4.5 และ gpt-realtime ถูกให้คะแนนในการตั้งค่าแบบใช้เสียงอย่างเดียว ขณะที่ Griffin รับรู้วิดีโอได้ด้วย คะแนนที่นำอยู่ 0.29 จุดเหนือเส้นฐานแบบเสียงอย่างเดียวเป็นของจริง แต่ส่วนหนึ่งของสิ่งที่มันวัดคือคุณค่าของการมีตา

บทสรุปของผู้ขาย — ซึ่งอ้างว่าเป็นที่หนึ่งในการทดสอบอิสระของ NVIDIA เกี่ยวกับ AI แบบสนทนาซึ่งหน้า และนำหน้า AI ที่ดีรองลงมาถึง 37% ในการตอบสนองต่อสถานการณ์เฉพาะหน้า — เป็นการตีความข้อมูลชุดเดียวกัน มากกว่าจะเป็นข้อค้นพบแยกต่างหาก ให้เก็บคะแนนผลการทดสอบพื้นฐานไว้ ไม่ใช่กรอบการนำเสนอ

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

สองเครื่องยนต์ ทำงานพร้อมกัน

ข้อกล่าวอ้างเชิงสถาปัตยกรรมนั้นประเมินได้ง่ายกว่าการตลาดที่โอบล้อมมันอยู่ เพราะมันเป็นข้อกล่าวอ้างเกี่ยวกับสิ่งที่ทำงานพร้อมกัน Griffin ถูกอธิบายว่าเป็นระบบสองระบบที่ทำงานขนานกัน มากกว่าจะเป็นไปป์ไลน์ที่ส่งต่องานระหว่างขั้นตอน

อันแรกคือเอนจิน Continuous Conversational Modeling ซึ่งนำเข้าเสียงและวิดีโอของบุคคลนั้น แล้วประเมินการสนทนาซ้ำใหม่เป็นช่วงสั้น ๆ ทุกเสี้ยววินาที — Tavus เรียกช่วงเหล่านี้ว่ามินิเทิร์น — โดยในแต่ละช่วงจะตัดสินใจว่าจะเงียบไว้ ส่งสัญญาณ ส่งเสียงตอบรับสั้น ๆ หรือรับช่วงพูด ผลลัพธ์ไม่ใช่แค่ถ้อยคำ แต่เป็นชุดการควบคุมการแสดงออกซึ่งพาจังหวะ ท่าที สีหน้า และท่าทางมาด้วย จุดสำคัญของการออกแบบคือ การตัดสินใจที่เกิดขึ้นกลางประโยคจะปรากฏในเสียงและใบหน้าภายในมินิเทิร์นเดียวกัน แทนที่จะปรากฏหลังการส่งช่วงพูด ซึ่งเป็นสิ่งที่ทำให้โมเดลหยุดได้เมื่อถูกตัดบท พยักหน้าได้ขณะที่กำลังฟัง และมองว่าการหยุดเพื่อคิดเป็นสิ่งอื่น而非การจบช่วงพูด

ตัวที่สองคือเอนจินสร้างภาพและเสียงที่เปลี่ยนการควบคุมเหล่านั้นให้เป็นเสียงและพิกเซลไปพร้อมกัน: เครื่องสร้างเสียงพูดแบบสตรีมมิงและเครื่องสร้างวิดีโอแบบสตรีมมิงที่ขับเคลื่อนด้วยสัญญาณเดียวกัน ดังนั้นการเปลี่ยนโทนเสียงและการเปลี่ยนการแสดงออกจึงลงจังหวะเดียวกัน

หมายเหตุความซื่อตรงประการหนึ่งเกี่ยวกับเนื้อหาที่ Tavus เผยแพร่พร้อมกับสิ่งนี้ เพราะอาจทำให้เข้าใจผิดว่าเป็นผลการวัดได้ง่าย แผนภาพแบบอินเทอร์แอกทีฟของการสนทนาเก้าวินาทีนั้น มีคำอธิบายกำกับไว้ในข้อความของหน้าเพจเองว่าเป็นเพียงภาพประกอบ และระบุชัดเจนว่าไม่ได้วัดจากเซสชันจริง ข้อควรระวังเดียวกันนี้ใช้กับภาพแสดงเวลาของแบบผลัดกันพูดเทียบกับแบบฟูลดูเพล็กซ์ สิ่งที่วัดได้คือตัวเลขความหน่วงที่อยู่ถัดลงไป

เจาะลึกสแตกสตรีมมิ่ง

ฝั่งเสียงสร้างขึ้นรอบ ๆ โคเดกชื่อ Tavec ซึ่งเป็น convolutional autoencoder ที่แมปเสียง 48 kHz ไปเป็นเลเทนต์ต่อเนื่อง 40 ค่าต่อเฟรมที่ 100 เฟรมต่อวินาที โดยไม่มี codebook ตัวถอดรหัสเป็นแบบ causal อย่างสมบูรณ์ จึงพาสถานะข้ามชังก์ได้ และปล่อยแพ็กเก็ตเสียงที่มีขนาดเล็กถึง 10 ms โดยไม่ต้องมองล่วงหน้า เสียงพูดหนึ่งนาทีมี 6,000 เฟรมเลเทนต์ แทนที่จะเป็น 2.88 ล้านตัวอย่างดิบ ซึ่งเป็นสิ่งที่ทำให้ลำดับมีต้นทุนต่ำพอที่ speech transformer จะทำนายได้เร็วกว่าเวลาจริง ตัวสร้างเสียงเองเป็น autoregressive diffusion transformer ที่ปรับเงื่อนไขบนคำนำหน้าผู้พูดที่เข้ารหัสไว้ — สามารถโคลนเสียงได้จากเสียงประมาณสิบวินาที — และสร้างเลเทนต์ทีละชังก์เมื่อคำสั่งควบคุมเข้ามา ดังนั้นการเล่นจึงเริ่มก่อนที่คำพูดจะพูดจบ

ฝั่งวิดีโอเริ่มจากหลักการเดียวกัน: การบีบอัดเชิงเวลาที่แข็งแกร่งคือสิ่งที่ทำให้โมเดลการแพร่กระจายเร็วพอที่จะสนทนาได้ ตัวสร้างแบบออโตเรเกรสซีฟไม่กี่ขั้นตอนจะรับภาพอ้างอิง เสียงสตรีมมิ่ง และตัวควบคุมสตรีมมิ่ง และสร้างเลเทนต์หนึ่งตัวต่อขั้นตอน โดยมีสามขั้นตอนการแพร่กระจายต่อเลเทนต์ VAE บีบอัดเวลาแปดเท่า ดังนั้นที่ 25 fps หนึ่งเลเทนต์คือแปดเฟรม หรือ 320 มิลลิวินาทีของวิดีโอ 720p เลเทนต์ที่เก่ากว่าจะถูกเก็บไว้ที่ความละเอียดต่ำลงเรื่อยๆ เพื่อให้การโรลเอาต์ยาวๆ ยังคงมีค่าใช้จ่ายที่เหมาะสม ผลลัพธ์คือตัวสร้างที่ปล่อยวิดีโอ 720p เป็นชิ้นส่วนละ 320 มิลลิวินาทีแบบเรียลไทม์

กว่าจะไปถึงจุดนั้นต้องใช้การกลั่นแบบสามขั้นตอนจากครูแบบไดฟิวชันหลายสเต็ปแบบสองทิศทางขนาดใหญ่: Distribution Matching Distillation ไปสู่โมเดลนักเรียนแบบไม่กี่สเต็ป, teacher forcing เพื่อแปลงนักเรียนตัวนั้นให้เป็นโมเดล autoregressive ที่สร้างละเทนต์ทีละตัว, และสุดท้ายคือการเทรนด้วย self-forcing บนประวัติที่โมเดลสร้างขึ้นเอง บวกกับกลไกเพิ่มเติมที่ทำงานกับเฟรมประวัติ เพื่อให้การโรลเอาต์ยาว ๆ ไม่ดริฟต์ ขั้นตอนที่สามนี้คือขั้นที่จัดการกับโหมดความล้มเหลวที่โมเดลประเภทนี้มักมี — ใบหน้าที่เสื่อมคุณภาพ หรือฉากหลังที่ค่อย ๆ เคลื่อนเพี้ยน ไปตลอดบทสนทนาที่ดำเนินไปหลายนาที

ค่าความหน่วง ซึ่งเป็นคำกล่าวอ้างที่แท้จริงของผลิตภัณฑ์

เมื่อเทียบกับโมเดล diffusion แบบสตรีมมิงที่เผยแพร่แล้วสี่ตัวในสถานการณ์เสียงเป็นวิดีโอ ซึ่งแต่ละโมเดลได้รับเสียงพูดและภาพอ้างอิง และต้องสร้างใบหน้าคนพูด เจนเนอเรเตอร์ของ Griffin-Lite มีเวลาแฝงจริงจากเสียงเป็นวิดีโอเฉลี่ย 0.43 วินาทีบน H100s — เวลาตั้งแต่ช่วงเสียงหนึ่งมาถึงจนวิดีโอแสดงผลของเสียงนั้น Tavus อธิบายว่านั่นเป็นครึ่งหนึ่งของวิธีที่เร็วที่สุดรองลงมา นอกจากนี้ยังรายงานว่าครองอันดับหนึ่งในด้านคุณภาพเชิงการรับรู้ของ DOVER และ FID และบน THEval ซึ่งเป็นเฟรมเวิร์กประเมินใบหน้าพูด และอันดับสองในความมั่นใจในการซิงก์ปาก LSE-C ที่ 7.27 เป็นรองหนึ่งเบสไลน์ — โดยผู้ขายตั้งข้อสังเกตว่า LSE-C ให้คะแนนกับการขยับปากที่ชัดเจน รวมถึงการขยับที่เลยจุดที่ดูเป็นธรรมชาติ

ทั้งหมดนั้นเป็นการวัดของ Tavus เองเมื่อเทียบกับ baseline ที่ตนเลือก สิ่งเหล่านี้มีประโยชน์เพราะมีความเจาะจง และเพราะตัวเลข 0.43 วินาทีนั้นเป็นตัวเลขประเภทที่อาจผ่านหรือไม่ผ่านในการทดสอบสด สิ่งเหล่านี้ไม่ใช่ผลลัพธ์อิสระ และคะแนนอิสระเพียงอย่างเดียวในบทความนี้คือแทร็ก VideoFDB สองรายการด้านบน

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

ทำไมจึงไม่มีราคาให้เปรียบเทียบ

Griffin-Lite เปิดให้ผู้ทดลองใช้กลุ่มเล็กๆ ที่ได้รับการคัดเลือกใช้ในวันนี้ในฐานะพรีวิวสำหรับงานวิจัย โดยจะมีการเปิดตัวแบบกว้างขึ้นสำหรับโมเดลที่ความสามารถสูงกว่าในภายหลัง แต่ในตอนนี้ยังไม่พร้อมให้ลูกค้านำไปใช้งาน การเข้าถึงทำได้ผ่านแบบฟอร์มขอใช้เท่านั้น ทั้งนี้ Griffin-Lite ไม่ได้อยู่บนแพลตฟอร์มของ Tavus และประโยคปิดท้ายของบริษัทในประกาศก็ระบุไว้อย่างชัดเจนว่า Griffin ยังไม่อยู่บนแพลตฟอร์มของ Tavus และจะมาเมื่อ Tavus หาวิธีเปิดตัวได้อย่างปลอดภัยแล้วเท่านั้น สิ่งที่ผู้ซื้อมักนำมาเปรียบเทียบกันตามปกติ ทั้งราคาต่อวินาทีหรือต่อคำขอ ตัวระบุโมเดล ขีดจำกัดอัตราการใช้งาน SLA และรายการภูมิภาค ยังไม่มีในตอนนี้ Tavus ชี้นำให้ใครก็ตามที่ต้องการเริ่มสร้างวันนี้ไปใช้โมเดลที่นักพัฒนาและธุรกิจ 150,000 รายใช้อยู่แล้ว ซึ่งได้แก่โมเดลรุ่นก่อนหน้าสามรุ่น ไม่ใช่ Griffin

นั่นไม่ใช่รายละเอียดทางเทคนิคที่จะใส่เป็นเชิงอรรถ มันเปลี่ยนว่าโมเดลนี้มีไว้เพื่ออะไรในตอนนี้ มันเป็นเป้าหมายการประเมินสำหรับทีมที่ผลิตภัณฑ์ต้องพึ่งพาว่าคนจะแยกออกได้หรือไม่ และเป็นสัญญาณว่าแผนงานของผู้ขายกำลังมุ่งไปทางไหน มันไม่ใช่สิ่งที่ควรสร้างเส้นทางที่หันหน้าสู่ลูกค้าบนพื้นฐานนี้ในไตรมาสนี้

ประตูความปลอดภัยคือแผนการเผยแพร่

สิ่งที่น่าสนใจที่สุดที่ Tavus เขียนเกี่ยวกับ Griffin ไม่ใช่เรื่องเกี่ยวกับตัวโมเดล แต่เป็นการยอมรับว่าคุณสมบัติเดียวกันที่ทำให้โมเดลปฏิสัมพันธ์แบบมนุษย์เป็นอินเทอร์เฟซที่ดีขึ้น ยังทำให้มันหลอกคนให้เชื่อว่ามันไม่ใช่ AI ได้ดีขึ้นด้วย ว่าจำเป็นต้องมีงานด้าน alignment และความปลอดภัยเพิ่มเติมก่อนจะปล่อยใช้งานอย่างปลอดภัย และบริษัทกำลังพัฒนาฟีเจอร์การเปิดเผยข้อมูลและร่วมมือกับองค์กรต่าง ๆ ด้านการประเมินความปลอดภัยของ AI เมื่อพิจารณาว่าเกือบครึ่งหนึ่งของกลุ่มตัวอย่างที่ทดสอบสด ๆ แยกไม่ออก และคนที่แยกออกได้ส่วนใหญ่ก็รู้ได้ภายในยี่สิบวินาที กลไกการเปิดเผยที่ไม่พังทลายเมื่อเจอการสนทนาสบาย ๆ จึงไม่ใช่แค่สิ่งที่ "มีก็ดี"

สองสิ่งจะเปลี่ยนบทความนี้อย่างมีนัยสำคัญ การ์ดโมเดลที่เผยแพร่พร้อมเอ็นด์พอยต์และราคาจะย้าย Griffin จากผลการวิจัยไปสู่คำถามด้านการจัดซื้อ และรายการบนบอร์ดวิดีโออิสระ — โดยมีข้อแม้ว่าบอร์ดเหล่านั้นให้คะแนนคลิปสั้นจากการเปรียบเทียบแบบเป็นคู่ และไม่ได้ถูกสร้างขึ้นมาเพื่อให้คะแนนบทสนทนาแบบสด ดังนั้นความไม่เข้ากันอาจเป็นแบบถาวรมากกว่าชั่วคราว — จะมอบการตรวจสอบจากภายนอกให้กับคำอ้างเรื่องความหน่วงและคุณภาพ จนกว่าหนึ่งในสิ่งเหล่านั้นจะเกิดขึ้น แทร็กของ VideoFDB คือหลักฐานที่แข็งแกร่งที่สุดที่มีอยู่ และมาพร้อมช่องว่างเมื่อเทียบกับมนุษย์ที่ 0.09 และ 0.47 คะแนนตามลำดับ

ข้อโต้แย้งที่ควรนำมาชั่งน้ำหนักก็คือ การรันเบนช์มาร์กไม่ใช่การนำไปใช้งานจริง โปรโตคอลของ NVIDIA มอบงานผลัดกันพูดแบบเดียวกันและผู้ตัดสินคนเดียวกันให้ทุกระบบ แต่ไม่ได้บอกอะไรเลยว่าชั่วโมงที่เก้าของการสนทนาจะเป็นอย่างไร เกิดอะไรขึ้นเมื่อมีคนสองคนพูดทับกันเป็นเวลาหนึ่งนาทีเต็ม หรือตัวควบคุมการแสดงออกจะเสื่อมลงหรือไม่บนใบหน้าที่ภาพถ่ายอ้างอิงเรนเดอร์ออกมาได้แย่ Tavus รายงานว่าการฝึกที่เจาะจงการดริฟต์ ซึ่งได้แก่ขั้นตอน self-forcing และกลไก history เป็นวิธีแก้สำหรับเรื่องนี้โดยตรง และรายงานก็เป็นทั้งหมดที่ผู้อ่านมี จนกว่าจะมีคนนอก Tavus ทดลองเซสชันยาวและเผยแพร่ผลออกมา ให้ถือว่าเบนช์มาร์กเป็นหลักฐานที่ดีที่สุดเท่าที่มีอยู่ ไม่ใช่ผลลัพธ์จากการนำไปใช้งานจริง

สิ่งที่ควรสร้างล้อมรอบมันในระหว่างนี้

คำถามเชิงปฏิบัติสำหรับทีมที่ต้องการอะไรแบบนี้ในตอนนี้คือ ส่วนใดของสแตกที่ซื้อได้แล้ว อินเทอร์เฟซวิดีโอเชิงสนทนาเป็นห่วงโซ่ — การรู้จำเสียง โมเดลภาษา การสังเคราะห์เสียง และในกรณีของ Tavus คือโมเดลเรนเดอร์ — และสามอย่างแรกเป็นสินค้าทั่วไป สิ่งเหล่านั้นอยู่หลังเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI ที่ OrcaRouter โดยมีโมเดล 200+ ตัวบนคีย์เดียวกัน และ ราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยบวกเพิ่ม 0% ดังนั้นการลดราคาของผู้ขายจึงมีผลที่นี่ในวันเดียวกัน แทนที่จะเป็นหลังรอบสัญญา หากคุณกำลังประกอบไปป์ไลน์การโต้ตอบและต้องการคงชั้นการสร้างให้เปิดอยู่จนกว่า Griffin หรือสิ่งที่คล้ายกันจะกลายเป็นผลิตภัณฑ์จริง นั่นคือจุดที่การสลับเปลี่ยนมีค่าใช้จ่ายเป็นเพียงการแก้ไขคอนฟิกแทนการโยกย้าย Tavus Griffin เองไม่ใช่โมเดลที่ถูกจัดเส้นทางที่นี่ และจะไม่เป็นเช่นนั้นตราบใดที่มันยังเป็นพรีวิวที่อยู่หลังแบบฟอร์มคำขอ

สิ่งที่ควรจับตาดูไม่ใช่ตัวอย่างสาธิตอีกชิ้นหนึ่ง แต่คือว่าเครื่องมือเปิดเผยข้อมูลที่ Tavus กำลังสร้างจะถูกเผยแพร่หรือไม่ และทีมวิจัยกลุ่มที่สองจะทำซ้ำโปรโตคอลแบบเผชิญหน้าหรือเปล่า การผ่านการทดสอบทัวริงในระดับใหญ่ขนาดนี้เป็นผลลัพธ์ประเภทที่ต้องให้ห้องแล็บแห่งที่สองมาทดลองซ้ำ

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube