การ์ดหัวเรื่องหลักสำหรับ Granite Speech 5.0 470M TurboCTC แสดงไอคอนรูปคลื่นเสียงพูด ป้ายข้อความ 12,600 RTFx บน H200 หนึ่งตัว ป้ายกำกับ: 470M พารามิเตอร์, CTC แบบ Encoder เท่านั้น และ Apache 2.0 คำบรรยายย่อย: 'ระบบ ASR ภาษาอังกฤษ Apache-2.0 ของ IBM' ส่วนท้าย: เผยแพร่ 25 ส.ค. 2026 และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Granite Speech 5.0 470M TurboCTC: ระบบ ASR ของ IBM ภายใต้ Apache-2.0 อ้างว่ามีค่า 12,600 RTFx

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Granite Speech 5.0 470M TurboCTC คือโมเดลในการปล่อยโมเดลเสียงพูดครั้งใหม่ของ IBM ที่คุณได้รับอนุญาตให้นำไปใช้งานจริงได้ และนั่นคือสิ่งแรกที่ควรรู้เกี่ยวกับมัน IBM ได้วางเช็คพอยต์การรู้จำเสียงพูดภาษาอังกฤษสองตัวบน Hugging Face เมื่อวันที่ 25 สิงหาคม 2026 ได้แก่ Granite Speech 5.0 470M TurboCTC ภายใต้สัญญาอนุญาต Apache 2.0 และ Granite Speech 5.0 470M TurboCTC-NC ภายใต้สัญญาอนุญาตแบบไม่ใช่เชิงพาณิชย์ CC-BY-NC-SA-4.0 สถาปัตยกรรม 470 ล้านพารามิเตอร์เหมือนกัน แต่ข้อมูลต่างกัน และสัญญาอนุญาตตรงกันข้าม โมเดล Apache เป็นตัวที่ IBM ชี้ไปสำหรับ "กรณีการใช้งานอื่น ๆ" ซึ่งเป็นภาษาของผู้ขายที่หมายถึงการผลิตเชิงพาณิชย์ และยังเป็นตัวที่มาพร้อมกับตัวเลขหลัก: IBM รายงานปริมาณงานรวมเกิน 12,600 RTFx บน NVIDIA H200 ตัวเดียว ซึ่งแปลว่าเสียงภาษาอังกฤษมากกว่าสามชั่วโมงครึ่งถูกถอดความเป็นข้อความต่อวินาทีด้วยการอนุมานแบบแบตช์

ตัวเลขความเร็วนี้เป็นคำกล่าวอ้างของผู้จำหน่ายที่มีอายุแค่วันเดียวและยังไม่มีการทำซ้ำโดยบุคคลที่สามใด ๆ ดังนั้นควรอ่านเป็นตัวเลขที่ดูดีบนกระดาษ ไม่ใช่ข้อเท็จจริงที่ผ่านการตรวจสอบ เหตุผลที่มันยังสมควรได้รับความสนใจอยู่ดีคือการออกแบบที่อยู่เบื้องหลัง: Granite Speech 5.0 TurboCTC ตัดตัวถอดรหัสภาษา (language-model decoder) ที่ทุกรุ่นก่อนหน้าของ Granite Speech ใช้ทิ้งไป เหลือเพียงตัวเข้ารหัส Conformer บริสุทธิ์ที่ฝึกด้วย connectionist temporal classification (CTC) และถอดรหัสแบบ non-autoregressive การไม่มีลูปการสร้างแบบ token-by-token คือสิ่งที่ทำให้โมเดลขนาด 470M พารามิเตอร์สามารถอ้างปริมาณงานที่เหนือกว่าโมเดลที่ใหญ่กว่าหลายเท่า และนี่คือเหตุผลว่าทำไมการเปิดตัวครั้งนี้จึงสำคัญสำหรับใครก็ตามที่สร้างระบบแปลงเสียงเป็นข้อความ ไม่ใช่แค่สำหรับตาราง benchmark เท่านั้น

สิ่งที่ส่งมอบจริง

เช็คพอยต์สองตัว ซึ่งทั้งคู่เผยแพร่เมื่อวันที่ 25 สิงหาคม 2026 บน org ของ ibm-granite ใน Hugging Face ต่างเป็น ASR สำหรับภาษาอังกฤษเท่านั้น และมีสถาปัตยกรรมแบบ encoder-only เหมือนกัน:

• Granite Speech 5.0 470M TurboCTC — Apache 2.0 อนุญาตให้ใช้เชิงพาณิชย์ได้ ฝึกฝนจากเสียงภาษาอังกฤษประมาณ 60,000 ชั่วโมง

• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0 ใช้เพื่อการวิจัยและการใช้งานที่ไม่ใช่เชิงพาณิชย์เท่านั้น ฝึกฝนด้วยเสียงภาษาอังกฤษประมาณ 75,000 ชั่วโมง

บทความนี้เกี่ยวกับโมเดล Apache — โมเดลที่ผลิตภัณฑ์สามารถพึ่งพาได้ตามกฎหมาย — โดยอ้างถึง -NC คู่แฝดในจุดที่เรื่องใบอนุญาตต้องการ ทั้งสอง checkpoint มาพร้อมกับ safetensors ในรูปแบบ F32 และ BF16 และทั้งคู่รองรับแบบเนทีฟใน Hugging Face Transformers ผ่าน AutoModelForCTC และ AutoProcessor ฟีเจอร์นี้จะมาใน Transformers รุ่นถัดไป จนกว่าจะถึงตอนนั้น คุณต้องติดตั้ง Transformers จากซอร์ส โหลด processor และโมเดล แล้วรัน greedy decoding IBM ยังมีลิงก์ไปยังเดโมสตรีมมิ่ง WebGPU บนเบราว์เซอร์ ซึ่งเป็นวิธีที่เร็วที่สุดในการฟังว่าหน่วงต่ำจริง ๆ แค่ไหน

ข้อเดิมพันด้านสถาปัตยกรรม: ตัวเข้ารหัส ไม่มีตัวถอดรหัส 12.5 โทเคนต่อวินาที

การเปลี่ยนแปลงการออกแบบเป็นที่มาของการอ้างความเร็ว Granite Speech รุ่นก่อนหน้านี้จับคู่ตัวเข้ารหัสเสียง (acoustic encoder) กับโปรเจกเตอร์และตัวถอดรหัสแบบภาษา (language-model decoder) และตัวถอดรหัสนั่นเองที่ถูกตัดออกไป Granite Speech 5.0 470M TurboCTC เป็นตัวเข้ารหัส Conformer จำนวน 16 ชั้นที่ฝึกด้วย CTC และการอนุมานเป็นแบบผ่านครั้งเดียวแบบไม่ต้องอาศัย autoregressive (non-autoregressive greedy pass) ไม่มีอะไรต้องสุ่มตัวอย่าง จึงไม่มีความหน่วงในการสร้างผลลัพธ์ให้ต้องรอ

รายละเอียดการกำหนดค่าสามประการทำให้มันทำงานได้เร็ว ไม่ใช่แค่มีขนาดเล็กเท่านั้น:

• การสุ่มตัวอย่างย่อยเชิงเวลาด้วยตัวประกอบ 8 ส่วนหน้าทำงานที่ 100 เฟรมต่อวินาที ส่วนโมเดลส่งออกที่ 12.5 โทเคนต่อวินาที การซ้อนและการข้ามเฟรม log-mel ตามด้วยคอนโวลูชันแบบมีสไตรด์และรีซิดิวอัลแบบพูลในสองบล็อก Conformer แรก ช่วยลดอัตราการส่งออกในสามขั้นตอน โดยแต่ละขั้นตอนลด 2 เท่า

• การใช้คำศัพท์ย่อย (subword vocabulary) แทนที่จะเป็นอักขระ ตัวเข้ารหัส Granite Speech รุ่นก่อนหน้าสร้างอักขระ 50 ตัวต่อวินาที ส่วนรุ่น 5.0 สร้างโทเค็นย่อย 12.5 โทเค็นต่อวินาทีจากคำศัพท์ BPE จำนวน 16,384 หน่วย (SentencePiece ในตัวแปร -NC) จำนวนหน่วยเอาต์พุตต่อวินาทีของเสียงที่น้อยลงหมายความว่าตัวถอดรหัส CTC มีการตัดสินใจที่ต้องทำน้อยลง

• CTC แบบปรับสภาพตนเอง ชั้น Conformer ตรงกลางปรับแต่งการแทนค่าขั้นกลางของโมเดลเอง ซึ่งเป็นเคล็ดลับที่ทำให้เอนโค้ดเดอร์ขนาดเล็กยังคงความแม่นยำไว้ได้เมื่อไม่มีดีโค้ดเดอร์

ทั้งหมดนั้นอยู่ในโมเดลการ์ดและเอกสารทางเทคนิคของ IBM โดยสรุปแล้ว มันคือ checkpoint ที่สร้างขึ้นสำหรับแล็ปท็อป โทรศัพท์ และไปป์ไลน์สตรีมมิ่ง ซึ่งตัวถอดรหัสออโตรีเกรสซีฟขนาดใหญ่ไม่สามารถนำมาใช้ได้ — การวางตำแหน่งเอดจ์นั้นชัดเจนในคำอธิบายของ IBM เอง

ตัวเลขที่ IBM อ้าง

ทุกอย่างในส่วนนี้รายงานโดย IBM ผ่านการรันด้วยชุดทดสอบสาธารณะของ Open ASR leaderboard บนโครงสร้างพื้นฐานของ Hugging Face ณ วันที่ 25 สิงหาคม 2026 และไม่ได้ผ่านการทำซ้ำโดยอิสระ โปรดถือว่าเป็นตัวเลขจากผู้จำหน่ายที่ดูน่าเชื่อถือ ไม่ใช่ความจริงที่แน่ชัด:

• ปริมาณงาน — มากกว่า 12,600 RTFx บน NVIDIA H200 ตัวเดียวพร้อมการอนุมานแบบแบตช์ (batched inference) ซึ่ง IBM ระบุว่าคิดเป็นเสียงมากกว่า 3.5 ชั่วโมงต่อวินาที และ IBM ยังเสริมอีกว่านี่คือปริมาณงานที่มากกว่า Granite Speech รุ่นก่อนหน้าถึง 20 เท่า ตัวเลขนี้เป็นตัวเลขของ GPU ในศูนย์ข้อมูลและการอนุมานแบบแบตช์ ไม่ใช่สิ่งที่แล็ปท็อปจะให้ได้

• ความแม่นยำ — อัตราคำผิดรวม 5.00% สำหรับโมเดล Apache บนชุดทดสอบภาษาอังกฤษแบบสั้นสาธารณะของลีดเดอร์บอร์ด Open ASR (ตัวแปร -NC ได้ 4.85% บนชุดเดียวกัน) การอนุมานดำเนินการผ่านโครงสร้างพื้นฐานงานของ Hugging Face และให้คะแนนด้วยเครื่องมือของลีดเดอร์บอร์ด ดังนั้น IBM จึงคาดว่าผลลัพธ์เหล่านี้จะตรงกับตารางทางการเมื่อโมเดลใหม่ถูกรวมเข้าไปในตารางแล้ว

• ฟาร์ฟิลด์ — ในลีดเดอร์บอร์ด FFASR สำหรับเสียงที่มีสัญญาณรบกวนและเสียงก้อง โมเดล Apache อยู่อันดับที่เก้าในด้านความแม่นยำ และโมเดล -NC อยู่อันดับที่ห้า และทั้งสองเป็นรายการที่เร็วที่สุดในบอร์ดนั้น (วัดปริมาณงานบน NVIDIA L4 เพียงตัวเดียว)

• การฝึก — ใช้คลิปเสียงภาษาอังกฤษสาธารณะประมาณ 60,000 ชั่วโมงสำหรับโมเดล Apache ดำเนินการในสิบวันบน NVIDIA H100 จำนวนแปดเครื่องในคลัสเตอร์ Blue Vela ของ IBM

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

สิ่งที่ Apache 2.0 มอบให้คุณจริงๆ

{{1}}ใบอนุญาตคือสิ่งที่ทำให้รุ่นนี้ต่างจากปกติ{{/1}} {{2}}โมเดลเสียงพูดแบบเปิดน้ำหนักมักออกมาภายใต้ใบอนุญาตสำหรับการวิจัยหรือมีข้อผูกพันที่ทำให้ฝ่ายกฎหมายของทีมโปรดักชันปวดหัว{{/2}} {{3}}ในที่นี้ รุ่นคู่แฝดที่ใช้งานเชิงพาณิชย์ได้คือรุ่นที่ IBM ให้คะแนนความแม่นยำต่ำกว่าเล็กน้อย{{/3}} {{4}}คุณยอมเสีย WER รวม 0.15 จุด (5.00% เทียบกับ 4.85%) เพื่อแลกกับสิทธิ์ในการนำไปใช้งานในผลิตภัณฑ์{{/4}} {{5}}เพื่อสร้างรายได้จากผลลัพธ์ ปรับแต่งโมเดล และเก็บน้ำหนักที่ได้จากการปรับแต่งไว้เป็นของคุณเอง{{/5}} {{6}}และใช้ในโครงสร้างพื้นฐานคลาวด์โดยไม่มีข้อกำหนดแบบเพื่อการวิจัยเท่านั้นมาขวางทาง{{/6}}

การแลกเปลี่ยนแบบนั้นง่ายที่จะทำผิดทางหากคุณไล่ตามลีดเดอร์บอร์ด ค่า 4.85% ของโมเดล -NC มาจากข้อมูลฝึกอบรมเพิ่มเติมประมาณ 15,000 ชั่วโมง (GigaSpeech และ SPGI Speech) และเป็นเวอร์ชันที่ IBM ระบุไว้ตามตัวอักษรว่า "สำหรับการวิจัยและวัตถุประสงค์ที่ไม่ใช่เชิงพาณิชย์เท่านั้น" มันเป็นโมเดล benchmark ที่ดี แต่เป็น dependency ที่ไม่ดีสำหรับผลิตภัณฑ์ โมเดล Apache สูญเสียความแม่นยำเล็กน้อย แต่ได้ความสามารถในการเป็นฐานของ pipeline การถอดความเชิงพาณิชย์ ระบบ QA ของคอลเซ็นเตอร์ หรืออุปกรณ์ edge หากคุณกำลังประเมินตระกูลนี้ การตัดสินใจเรื่องลิขสิทธิ์ต้องมาก่อนการตัดสินใจเรื่อง benchmark

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

สิ่งที่คุณยอมสละ

การละทิ้งโมเดลภาษาไม่ใช่เรื่องฟรีๆ และการ์ดโมเดลก็ตรงไปตรงมาเกี่ยวกับการตัดทอน:

• ไม่มีการแปลเสียงพูด Granite Speech รุ่นก่อนหน้าสามารถส่งผ่านโมเดลภาษาเพื่อแปลขณะที่ถอดความ; 5.0 เป็นเพียงการถอดความเท่านั้น

• ไม่มีการไบแอสคำสำคัญ LM ยังจัดการการไบแอสไปทางคำศัพท์เฉพาะโดเมนและชื่อต่าง ๆ อีกด้วย เมื่อไม่มี LM แล้ว สิ่งที่คุณจะได้คือสิ่งที่คำศัพท์ย่อย (subword vocabulary) ผลิตออกมาอย่างเป็นธรรมชาติ

รองรับเฉพาะภาษาอังกฤษ ไม่มีจุดตรวจสอบหลายภาษาในเวอร์ชันนี้ และไม่มีสัญญาณว่าจะมีในเร็วๆ นี้

ค่า WER 5.00% เป็นตัวเลขสำหรับเสียงพูดรูปแบบสั้นที่ไม่มีเสียงรบกวน ส่วนผลลัพธ์ FFASR (อันดับที่เก้า จากเสียงพูดระยะไกลที่มีเสียงรบกวน) เป็นตัวบ่งชี้ที่สมจริงกว่าสำหรับการใช้งานในห้องประชุมและการใช้งานแบบแฮนด์ฟรี และเป็นเพียงอันดับ ไม่ใช่ตัวเลขหลัก

สำหรับงานถอดเสียงแบบเฉพาะเจาะจง — เช่น เสียงโทรศัพท์ การประชุม โน้ตเสียง คำบรรยาย การเขียนตามคำบอก — สิ่งเหล่านี้ไม่ใช่อุปสรรคเลย สิ่งเหล่านี้สำคัญหากคุณหวังว่าโมเดลขนาดเล็กหนึ่งตัวจะแปลได้ด้วย หรือถอดเสียงคำศัพท์เฉพาะได้อย่างน่าเชื่อถือทันทีที่ใช้งาน

วิธีรันในวันนี้

คุณไม่จำเป็นต้องใช้ cloud API ที่ยังไม่มีอยู่จริง โมเดลทำงานในเครื่อง:

• ติดตั้ง Transformers จากซอร์ส (ชุดคุณสมบัติ CTC ยังไม่รวมอยู่ในเวอร์ชันล่าสุด) จากนั้นใช้ AutoModelForCTC ร่วมกับ AutoProcessor และ greedy decoding — ซึ่งเป็นไปป์ไลน์มาตรฐาน ตัวประมวลผลสามารถคำนวณฟีเจอร์ log-mel บนอุปกรณ์ของโมเดลได้ ช่วยประหยัดการคัดลอกจากโฮสต์ไปยังอุปกรณ์

• ตัวอย่างโมเดลการ์ดเป็นโค้ดสองบรรทัดผ่านไปป์ไลน์: automatic-speech-recognition โดยใช้โมเดล "ibm-granite/granite-speech-5.0-470m-turboctc"

• เดโมสตรีมมิ่ง WebGPU ที่รันในแท็บเบราว์เซอร์เป็นวิธีที่เร็วที่สุดในการประเมินความหน่วง ก่อนที่คุณจะทุ่มเทเวลาช่วงบ่ายให้กับชุดทดสอบประสิทธิภาพ

• สำหรับการใช้งานในระดับโปรดักชัน คำถามเชิงปฏิบัติคือการให้บริการโมเดล โมเดล ASR แบบเปิดในคลาสนี้โดยทั่วไปจะรันบน CPU หรือ GPU ขนาดเล็ก ด้วยการอนุมานแบบสตรีมมิงแบบแบตช์ — ตัวเลข headline 12,600 RTFx เป็นจำนวนแบตช์ของ H200; ตัวเลขการสตรีมเดี่ยวบนแล็ปท็อปตามความเป็นจริงจะต่ำกว่ามาก และ IBM ยังไม่ได้เผยแพร่ตัวเลข time-to-first-token

ชั้นการให้บริการคือจุดที่ต้นทุนและความซับซ้อนที่แท้จริงของ open ASR อยู่ และเป็นจุดที่แพลตฟอร์มจัดเส้นทางได้แสดงคุณค่าของมันจริง ๆ โมเดลของ OrcaRouter คือ API เดียวที่ครอบคลุมโมเดล 200+ รายการ โดยส่งผ่านราคารายการของผู้ให้บริการที่มาร์กอัป 0% — ดังนั้นเมื่อผู้ขายลดราคา ราคาที่ลดลงก็มีผลทันทีในวันเดียวกัน — พร้อมทั้งการเฟลโอเวอร์อัตโนมัติข้ามผู้ให้บริการ และ routing DSL สำหรับประกอบโมเดลหลายตัวเข้าไว้ในการเรียกครั้งเดียว ไม่มีข้อใดที่กล่าวมาประยุกต์ใช้กับ Granite Speech 5.0 470M TurboCTC โดยเฉพาะ เพราะทั้งสองเวอร์ชันยังไม่ได้อยู่บน OrcaRouter: น้ำหนักโมเดลเพิ่งออกมาได้วันเดียว และไม่มีผู้ให้บริการเชิงพาณิชย์รายใดเสิร์ฟโมเดลเหล่านี้ เมื่อโมเดลเสียงพูดแบบเปิดเช่นนี้มีโฮสต์พาธ — หรือเมื่อคุณเปรียบเทียบกับ hosted ASR API ที่มีอยู่แล้ว — ชั้นจัดเส้นทางคือวิธีที่คุณลองใช้และถอยกลับได้โดยไม่ต้องเขียนอินทิเกรชันใหม่ และการตั้งราคาแบบส่งผ่านคือสิ่งที่ทำให้การเปรียบเทียบตรงไปตรงมา

สิ่งที่ยังไม่ได้รับการยืนยัน

โมเดลอายุหนึ่งวันมีร่องรอยเอกสารสั้น ๆ และควรระบุให้ชัดเจนว่ายังไม่รู้อะไรบ้าง:

• ไม่มีการวัดประสิทธิภาพจากบุคคลที่สาม ค่า RTFx 12,600, ค่า WER 5.00% และอันดับ FFASR ล้วนมาจากการรันของ IBM เองผ่านระบบ leaderboard สาธารณะ ไม่มีบุคคลอิสระรายใดเผยแพร่ตัวเลข

• ไม่มี API ที่โฮสต์โดย IBM ไม่มีหน้าโมเดล watsonx ไม่มี managed endpoint ไม่มีราคา และไม่มีกำหนดการว่าจะมาเมื่อใด

• ไม่มีตัวเลขความหน่วงในการสตรีม มีการรองรับการสตรีมและเดโม WebGPU อยู่ แต่ไม่มีตัวเลขของเวลาในการได้รับโทเค็นแรกและความหน่วงของชังก์

• ไม่มีการเปรียบเทียบในกรอบทดสอบเดียวกันกับโมเดล ASR แบบเปิดที่รวดเร็วอื่นๆ การเปรียบเทียบที่สำคัญ — กับ Whisper large-v3, NVIDIA Parakeet TDT 0.6B และ hosted transcription APIs — ยังไม่มีใครรันบนข้อมูลที่เหมือนกันเลย

สิ่งที่ควรดูต่อไป

สัญญาณระยะใกล้คือการทำซ้ำโดยอิสระ Open ASR leaderboard เป็นสาธารณะ ชุดทดสอบเป็นมาตรฐาน และน้ำหนักโมเดลอยู่บน Hugging Face ดังนั้นการรันโดยบุคคลที่สามน่าจะออกมาภายในไม่กี่วัน — จับตาว่าค่า 5.00% จะยังคงอยู่หรือไม่ และ 12,600 RTFx จะอยู่รอดบน H200 ตัวเดียวภายนอกชุดแบตช์ของ IBM เองหรือไม่ อีกสิ่งที่ต้องจับตาคือ IBM จะเปลี่ยนรุ่นแฝด Apache ให้เป็นบริการแบบจัดการหรือไม่ เนื่องจาก watsonx endpoint จะทำให้สิ่งนี้กลายเป็น open ASR ที่มีเส้นทางเชิงพาณิชย์ที่น่าเชื่อถือที่สุดในทันที Granite Speech 5.0 470M TurboCTC ตั้งแต่วันแรกเป็น ASR ภาษาอังกฤษที่รวดเร็วอย่างแท้จริง อนุญาตอย่างเสรีอย่างแท้จริง และมีหลักฐานการตรวจสอบที่บางเฉียบอย่างแท้จริง สองข้อแรกเป็นจริง ข้อที่สามเป็นเพียงเรื่องของเวลา

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube