제목 카드에 'Qwen3.8-LiveTranslate'가 적혀 있고, 부제는 'AI 통역을 인간의 속도에 맞춘 0.5초', 그리고 세 개의 통계 칩이 있습니다. 평균 지연 2.8초 → 2.3초, 소스 언어 60개, 음성 출력 언어 29개입니다.
Engineering & Research

Qwen3.8-LiveTranslate를 만나보세요: AI 통역을 인간의 속도에 맞추는 0.5초

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Qwen3.8-LiveTranslate는 2026년 9월 19일에 출시되었고, 발표 내용 전체는 결국 하나의 뺄셈으로 요약된다. 평균 지연(Average lagging), 즉 LAAL — 화자의 입에서 단어가 떠나간 시점과 그 번역이 청자의 귀에 도달한 시점 사이의 평균 격차 — 은 이전 세대의 2.8초에서 2.3초로 떨어진다. 전문 인간 통역사는 대략 2~3초의 귀-대-입(ear-to-voice) 간격으로 작업한다. 이것이 이야기의 전부다. 기계가 더 빨라졌다는 것이 아니라, 이제 그 지연이 청자가 기계를 전혀 의식하지 않게 되는 구간 안에 들어왔다는 것이다. 출시 자료는 이전 세대의 FLEURS 번역 품질을 83.0 xCOMET-XXL로 제시했고, 이번 세대는 85.7이라고 주장된다. 두 수치 모두 벤더의 것이며 벤더 자체 평가 환경에서 산출된 것이고, 아직 어떤 독립적인 제3자도 이를 재현하지 못했다 — 이것이 이 글에서 가장 중요한 단 하나의 단서다.

이번 릴리스를 헤드라인 너머까지 읽을 가치가 있게 만드는 것은 그 메커니즘이다. Qwen은 더 빠른 인식기나 더 가벼운 합성기를 만들어 지연 시간을 줄인 것이 아니다. 그것은 둘 사이의 이음새를 없앴다.

실제로 달라진 것: 이음새가 사라졌다

고전적인 동시통역은 10년 동안 같은 방식으로 조립되어 온 3단계 파이프라인이다: 자동 음성 인식이 스트림을 전사하고, 기계 번역이 전사문을 변환하며, 텍스트 음성 변환이 결과를 소리 내어 읽는다. 각 단계는 자체 지연 예산을 가진 별도의 모델이며, 각 핸드오프는 무언가를 잃는다 — 첫 번째에서는 운율을, 세 번째에서는 화자 정체성을, 그리고 모듈이 확신을 가질 만큼 충분한 토큰을 기다려야 하는 모든 경계에서 고정된 수백 밀리초를.

Qwen3.8-LiveTranslate는 그 캐스케이드를 벤더가 Interleave 아키텍처라고 부르는 것으로 대체합니다. 이 아키텍처는 하이브리드 MoE 백본 위에 구축되어 두 개의 협력 모듈로 나뉩니다:

Thinker — 비디오, 오디오, 원문 텍스트와 번역을 시간 순서에 따라 교차 배치된 하나의 인과적 시퀀스로 정렬하고, 세 단계가 아닌 한 번의 패스로 이해와 번역을 엔드투엔드로 생성합니다.

Talker — 번역된 텍스트를 원본 오디오와 함께 입력받아 원 화자의 음색을 유지하는 음성을 합성하므로, 더빙된 목소리가 말한 사람임을 알아볼 수 있습니다.

그 아키텍처적 주장은 인식, 번역, 합성이 모듈 경계를 넘어 메시지를 주고받는 대신 하나의 시퀀스 모델링 프레임을 공유하기 때문에, 시스템이 발화마다 모듈 간 비용을 두 번 치르는 일을 멈춘다는 것이다. 이는 0.5초가 어디서 나왔는지에 대한 그럴듯한 설명이며, 동시에 주장하기는 쉽고 검증하기는 비싼 바로 그런 종류의 주장이기도 하다. 이를 확립된 결과가 아니라 벤더의 설명으로 취급하라.

진정으로 새로운 세 가지 역량

언어 지원 범위는 그대로였습니다. 인식 가능한 원어는 60개, 음성 출력 가능 언어는 29개로, Qwen3.5-LiveTranslate와 동일한 수치입니다. 흥미로운 추가 기능은 모두 여러 사람이 말할 때 벌어지는 일에 관한 것입니다.

실시간 화자 분리 — 말하는 즉시 각 문장이 화자에게 귀속되며, 음성 음색 복제는 화자 전환이 이루어져도 더 안정적이라고 설명됩니다. Qwen은 자체 장문 다중 화자 테스트 세트에서 화자 분리 오류율 9.7%를 자체 보고했으며, 이는 Seed LiveInterpret 2.0의 30.6%와 대비됩니다. 두 수치 모두 Qwen에서 나온 것입니다.

원문과 번역이 같은 프레임에 — 모델이 원본 스크립트와 번역문을 하나의 타임라인에 출력하기 때문에, 별도의 정렬 작업 없이 이중 언어 화면 자막 쌍을 만들 수 있습니다.

장문맥 중의성 해소 — 이전 맥락이 계속 이어져 이름, 경칭, 도메인 용어가 일관되게 유지됩니다. 실제로 가장 중요한 부분인데, 동시통역의 전형적인 실패는 잘못된 단어가 아니라 같은 인물이 한 회의에서 세 가지로 다르게 표현되는 것입니다.

여기서 진정으로 차별화되는 요소는 화자 분리다. 구글의 경쟁 실시간 음성-대-음성 모델인 Gemini 3.5 Live Translate는 턴테이킹에 문서화된 어려움을 안고 있다. 화자가 실제로 말을 멈췄는지 파악하는 데 어려움을 겪을 수 있다. Qwen은 반대 속성을 기능으로 내세우고 있다. 어느 회사도 이를 판가름할 맞대결 결과를 공개하지 않았다.

Screenshot of Alibaba Qwen team's own announcement page for Qwen3.8-LiveTranslate, showing the release headline, the Interleave architecture description with Thinker and Talker modules, and the stated average lagging figure of 2.3 seconds.

벤치마크 주장을 정직하게 읽기

Qwen은 두 세트에서 테스트되었으며, 두 세트는 서로 다른 것을 측정하기 때문에 분리할 가치가 있습니다.

FLEURS, 70개 언어 방향 — 공개적으로 널리 사용되는 다국어 오디오 벤치마크다. Qwen은 번역 품질, 평균 지연, 음성 인식 정확도, 음성 합성 품질 측면에서 자사의 전작은 물론 이른바 현재 주류 실시간 통역 시스템보다 우위에 있다고 주장한다. 85.7 대 83.0 xCOMET-XXL 비교가 여기에 나온다.

Omnilingua-MSpeaker, 14개 언어 방향 — Qwen 자체의 다중 화자 장문 오디오 평가 세트입니다. 이 회사는 더 나은 충실도, 유창성, 간결성과 더 낮은 화자 분리 오류율을 주장합니다. 벤더가 구축한 벤치마크가 가치 없는 것은 아니지만, 그것이 증거가 되지는 않습니다: 평가 대상 모델의 개발자들이 설계한 것이기 때문입니다.

솔직히 요약하자면, FLEURS는 실제로 존재하고 공개되어 있으므로 85.7은 적어도 원칙적으로는 검증 가능하다. Omnilingua-MSpeaker는 그렇지 않으므로, 누군가 다시 실행하기 전까지 화자 분리에서의 승리는 주장에 불과하다. 이 글을 쓰는 시점에서 제3자가 Qwen3.8-LiveTranslate 수치를 발표한 적은 없으며, 해당 모델은 나온 지 몇 시간밖에 되지 않았다.

API 비용과 당신을 물어뜯을 한 가지 숫자

Qwen3.8-LiveTranslate는 비공개 가중치 모델이며 API 전용입니다. 이 모델은 일반 HTTP 엔드포인트가 아니라, 모델 ID qwen3.8-livetranslate-flash-realtime로 WebSocket Realtime API를 통해 실행됩니다. 가격은 100만 토큰당이며, 오디오 토큰은 밀도가 높기 때문에 오디오 토큰이 무엇인지 떠올리기 전까지는 텍스트 모델과 나란히 놓았을 때 대표 요금이 깜짝 놀랄 만해 보입니다:

싱가포르 리전 — 백만 토큰당 오디오 입력 $7.50, 이미지 입력 $0.55, 텍스트 출력 $20.00, 오디오 출력 $30.00.

베이징 리전 — 백만 토큰당 오디오 입력 ¥40, 이미지 입력 ¥3.3, 텍스트 출력 ¥100, 오디오 출력 ¥160이며, 현재 환율로 환산하면 대략 $5.65 / $0.47 / $14.13 / $22.61에 해당합니다.

컨텍스트 — 총 53,248개 토큰이며, 최대 입력 49,152개와 최대 출력 4,096개로 나뉩니다.

속도 제한 — 분당 10회 요청 및 분당 100,000 토큰으로, 두 리전에서 동일합니다.

그 속도 제한이 바로 강조해야 할 숫자다. 분당 10회 요청은 회의실 몇 개에는 넉넉하지만, 컨택센터 배포나 수천 개의 동시 스트림이 있는 라이브 방송에는 전혀 충분하지 않다. Qwen은 인터페이스 가격을 이전 세대와 사실상 동일하게 유지했다. 베이징 요금은 변동이 없고 싱가포르는 약간 더 저렴하다. 그러나 아키텍처적으로 확장 준비가 된 모델이 마치 프리뷰처럼 프로비저닝되고 있다. 프로덕션 트래픽을 계획하는 사람이라면 토큰당 가격이 아니라 분당 10회라는 상한을 실질적인 제약으로 읽어야 한다.

Single-column scoreboard for Qwen3.8-LiveTranslate listing average lag (LAAL) 2.3 seconds, languages 60 source and 29 spoken, context 53,248 tokens, input audio plus image, output text plus audio, and weights closed and API-only, with a footer reading 'All figures vendor-reported; no independent replication yet.'

그것을 호출하는 건 채팅 모델을 호출하는 것과는 다르다.

Realtime API는 이벤트 기반이며, 이는 completion 엔드포인트와는 다른 사고 모델입니다. 소켓을 열고 수신합니다: session.created, 그런 다음 전송합니다: session.update 이벤트를 사용하여 오디오가 이동하기 전에 세션을 구성합니다.

target_language필수이며, 첫 번째 오디오 청크 전에 설정해야 합니다 — 암시적인 기본 대상은 없습니다.

source_language는 선택 사항이며 자동 감지로 기본 설정됩니다.

output_modalities를 선택합니다.["text"]는 전사 전용의 경우 ["text","audio"]를, 또는 번역된 음성의 경우

input_audio_buffer.append는 base64로 인코딩된 PCM 청크를 위로 전송하고, response.text.deltaresponse.audio.delta가 아래로 돌아오며, response.done이 한 턴의 종료를 표시합니다.

실무적인 두 가지 참고 사항. 첫째, 브라우저는 Authorization 헤더를 WebSocket 핸드셰이크에서 설정할 수 없으므로, 연결은 서버 측에서 열어야 하고 오디오는 자체 소켓을 통해 클라이언트로 중계해야 합니다. 이는 프런트엔드에 직접 연결하는 것이 아닙니다. 둘째, Qwen은 매개변수와 이벤트 집합이 이전 LiveTranslate 세대와 다르다고 명시적으로 경고하므로, Qwen3.5-LiveTranslate에 맞춰 작성된 코드는 다시 지정하는 것이 아니라 재검토해야 합니다. 엔지니어링 시간을 투자하기 전에 지연을 들어보고 싶다면 omni.qwen.ai/live-translate에서 무료 체험 엔드포인트가 운영 중입니다.

의도적으로 하지 않는 것

Qwen은 여러 기능을 사용할 수 없는 것으로 명시하고 있으며, 그 목록은 이를 분명히 해준다. 함수 호출 없음. 구조화된 출력 없음. 웹 검색 없음. 접두사 이어쓰기, 컨텍스트 캐싱, 배치 추론 없음. 파인튜닝 없음.

이것은 전문가이지, 통역사 모자를 쓴 범용 모델이 아니다. 여러분의 에이전트 루프를 실행하지 않으며, 회의를 요약하는 모델도 아니다. 그에 맞게 설계하십시오: 통역기는 트랜스크립트와 번역된 오디오 스트림을 생성하고, 그 이후의 모든 것 — 실행 항목 추출기, 용어집 적용기, CRM 역기록 — 은 별도의 텍스트 모델이 할 일이다.

바로 그 구분점이 라우터가 존재 가치를 입증하는 곳입니다. Qwen3.8-LiveTranslate 자체는 벤더 자체 API와 여러 서드파티 플랫폼을 통해 이용할 수 있지만, 오늘날 OrcaRouter의 카탈로그에는 없으며, 우리는 그렇지 않은 척하지 않겠습니다. OrcaRouter가 갖추고 있는 것은 그 주변 스택입니다 — 알리바바 자체의 Qwen3.8-Max 플래그십을 포함하는데, 이는 2.4조 파라미터 규모의 희소 전문가 혼합(MoE) 모델로 100만 토큰 컨텍스트를 지원하며 입력 100만 토큰당 $2.00, 출력 100만 토큰당 $6.00입니다, 제공자의 정가로 청구되며 마크업은 전혀 붙지 않습니다. 통역기와 그 출력을 소비하는 모델들을 하나의 엔드포인트와 하나의 키 뒤에 두면, 요약기를 교체할 때 전사 파이프라인에 별도의 계약이 필요하지 않으며, 자동 장애 조치가 단일 제공자가 흔들릴 때 시스템의 하류 절반을 살려 둡니다 — 분당 10회 요청이라는 조건에서는 이는 직접 겪고 나서 알게 되기보다 미리 대비해야 할 시나리오입니다.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

다음에 볼 콘텐츠

두 가지가 갖춰지면 이번 릴리스는 논거가 탄탄한 주장에서 확정된 사실로 바뀔 것입니다. 첫째는 독립적인 지연 시간 측정입니다. LAAL은 잘 정의된 지표이고, 체험판 엔드포인트와 스톱워치 장비만 갖춘 사람이라면 누구나 Qwen이 산출하지 않은 숫자를 만들어낼 수 있습니다. 둘째는 Qwen이 직접 밝힌 로드맵입니다. 지연 시간 하한선에 더 가까이 다가가기, 세션 간 장기 기억, 롱테일 언어와 지역 방언에 대한 포괄 범위 확대입니다. 롱테일 항목은 그들에게 이행을 요구해야 할 부분입니다. 60개 소스 언어는 존중할 만한 숫자지만, 세계 대다수 화자를 조용히 배제하고 있기 때문입니다. 그리고 만다린어와 영어에서 작동하는 데모와 요루바어나 케추아어에서 작동하는 데모 사이의 격차는 실시간 통역 제품이 역사적으로 정체되어 온 지점입니다.

현재로서는 Qwen3.8-LiveTranslate가 대표 수치를 자사의 전임 모델이 아니라 인간 통역사와 견주어 설정한 최초의 동시통역 모델이라는 것이 합리적인 평가다 — 그리고 그런 설정은 그것이 대체하는 기준보다 통과하기 훨씬 어려운 시험이다. 그것은 아직 그 시험을 통과하지 못했다. 그저 그 시험에 자원했을 뿐이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트