← 블로그로
Ai약 12 분 읽기

구글 Gemini 3.5 라이브 번역, 멈춤을 없애다

게시일 2026년 10월 7일
구글 Gemini 3.5 라이브 번역, 멈춤을 없애다

실시간 번역은 늘 턴제 방식의 기술이었다. 한 사람이 말하면 시스템은 말이 끝날 때까지 기다렸다가 생각한 뒤 결과를 다시 읽어준다. 그 멈춤은 짧지만 대화를 바꾼다. 기계가 작동하도록 두 사람 모두 말을 멈추기 때문이다. 구글의 새로운 Gemini 3.5 라이브 번역은 바로 그 멈춤을 없애기 위해 만들어졌다.

이달 발표된 이 모델은 전사 파이프라인에 합성기를 덧붙인 형태가 아니라 음성-대-음성 오디오 모델이다. 끊임없이 듣고 화자가 말하는 대로 번역하며, 더 많은 문맥을 기다릴지 아니면 동기화를 유지하기 위해 지금 옮길지를 매 순간 결정한다. 실제로는 화자보다 몇 초 뒤처지면서도 계속 진행하므로 문장마다 대화가 멈추지 않는다.

구글은 이 모델을 이전 시스템과 구분 짓는 세 가지 기능을 내세운다. 먼저 언어 설정을 미리 구성할 필요 없이 70개 이상의 언어를 스스로 감지한다. 화자의 어조, 속도, 음높이를 보존해 결과물이 중립적인 아나운서가 아니라 말하는 사람처럼 들린다. 또한 대부분의 번역 데모가 피하는 조건인 잡음 많고 예측 불가능한 오디오에서도 견딘다.

모델에 내재된 트레이드오프

연속 번역에는 턴제 시스템이 피하는 설계상의 선택이 따른다. 문장을 너무 일찍 번역하면 절반의 정보만으로 빠른 답을 얻고, 너무 늦게 번역하면 실시간 대화의 감각이 깨진다. 구글의 모델은 잠시 기다리는 것이 출력을 개선할지와 화자에게서 더 뒤처지는 비용을 저울질하며 매 순간 두 방식의 균형을 잡는다. 이 결정은 사용자에게 보이지 않지만, 결과가 사용 가능하게 느껴지는지를 좌우하는 핵심이다.

음높이와 속도 보존은 실시간 대화 위에 두 번째 활용 사례를 더한다. 목소리가 정체성을 바꾸지 않고 언어를 넘어 전달될 수 있다면, 하나의 녹음이 지원되는 모든 언어의 더빙이 된다. 이는 마이크로소프트가 자사의 새 음성 모델에 붙인 약속과 같고, 더빙 업계가 이 분야를 예의주시해 온 이유다. 억양과 타이밍을 제대로 맞추면 결과물은 더 이상 번역처럼 들리지 않는다.

어디에 나타나는가

이번 출시는 세 갈래로 동시에 진행된다. 개발자는 Gemini Live API와 Google AI Studio를 통해 공개 프리뷰로 이용할 수 있다. 기업 사용자는 이달 Google Meet 내부에서 비공개 프리뷰로 만난다. 소비자는 Android와 iOS의 Google 번역 앱에서 전 세계적으로 사용할 수 있는데, 이는 개발자 세그먼트보다 훨씬 큰 사용자층이며 구글이 이를 연구 데모가 아닌 제품으로 취급하고 있다는 신호다.

흥미로운 작업은 개발자 쪽에 있다. 라이브 번역은 오디오를 스트림으로 처리하므로 번역 계층을 처음부터 구축하지 않고도 다국어 통화, 회의, 수업, 라이브스트림에 넣을 수 있다. Agora, Fishjam, LiveKit, Pipecat, Vision Agents를 포함한 통합 파트너들이 이미 실시간 미디어 배관을 완성해 두었기에, 개발자는 전송 계층 대신 주로 인터페이스와 제품 로직을 다루면 된다.

Grab은 구체적이고 측정 가능한 문제를 위해 이 모델을 테스트하고 있다. 운전자와 승객은 종종 같은 언어를 쓰지 않으며, 픽업 지점에서의 인계는 의사소통 오류가 비용이 커지는 바로 그 지점이다. Grab은 한 달에 1,000만 건 이상의 음성 통화를 처리하므로, 그 통화에서의 작은 개선도 추구할 가치가 있다.

연속이 턴제를 이기는 이유

지연 시간은 턴제 번역과 연속 번역의 차이 중 일부에 불과하다. 턴제 시스템은 문장이 끝났다는 신호가 필요한데, 이는 대본이 있는 데모에서는 쉽지만 실제 발화에서는 어렵다. 사람들은 말끝을 흐리고, 다시 말하고, 끼어들고, 생각 도중에 언어를 바꾸기 때문이다. 깔끔한 경계를 기다리는 시스템은 경계를 놓치거나 응답이 늦어진다. 연속으로 생성하는 시스템은 그 모든 과정에서 화자를 따라갈 수 있다.

그 설계는 출력물의 용도도 바꾼다. 번역이 몇 초 뒤처지더라도 화자 자신의 목소리로 도착한다면, 회의 중에 켜 두고 자막을 읽는 대신 주변 오디오처럼 흐르게 할 수 있다. 자막은 보라고 요구하지만, 오디오는 듣라고 요구한다. 눈맞춤이 중요한 대화에서 상대가 계속 말하는 동안 상대의 목소리를 내 언어로 듣는 것은, 상대 얼굴 아래에 텍스트가 도착하는 것을 보는 것과 다른 경험이다.

어조와 음높이 보존은 들리는 것보다 더 많은 일을 한다. 원화자의 억양을 유지하는 번역 음성은 밋밋한 합성 음성이 잃어버리는 정보를 담는다. 망설임, 강조, 농담과 위협의 차이다. 이를 제거한 기계 번역은 기술적으로 정확할 수 있지만 의도에 대해서는 여전히 틀릴 수 있다.

일주일 새 두 번 움직인 기준선

라이브 번역은 음성 분야가 붐비는 달에 등장했다. 마이크로소프트는 10월 1일에 세 가지 모델을 출시했다. 그중 MAI-Transcribe-2-Streaming은 100밀리초가 조금 넘는 시간에 텍스트를 생성하기 시작하고 60개 언어를 자동 전환하며 처리한다. MAI-Voice-2.1은 26개 로케일에서 23개 언어를 말하고 언어를 바꿔도 하나의 음성 정체성을 유지한다. Sota Labs는 68개 이상의 언어를 지원하며 브라우저 확장 프로그램을 통해 Google Meet, Zoom, Teams에 연결되는 회의 어시스턴트 Saydi를 공개했다.

조각들을 나란히 놓으면 경쟁의 윤곽이 분명해진다. 마이크로소프트는 귀와 입을 개발자가 조립하는 별도 부품으로 판매한다. 구글은 대화의 양방향을 모두 처리하는 단일 모델을 출시하고 이를 소비자에게 먼저 선보인다. 둘 다 첫 오디오 지연 시간을 낮추고 있으며, 언어 전반에 걸쳐 일관된 목소리를 대표 기능으로 내세운다. 그것이 번역된 통화를 통화처럼 느끼게 하기 때문이다.

여전히 어려운 것

언어 지원 수치는 발표하기 쉽고 검증하기 어렵다. 70개 이상의 언어를 감지하는 모델이 모든 언어를 똑같이 잘 번역하지는 않으며, 그 차이는 전문 용어, 관용구, 고유명사에서 드러난다. 구글 번역 자체의 역사가 여기서 교훈적이다. 이 제품은 20년간 시장에 있었고 한 달에 1조 단어 이상을 처리하지만, 인간 통역사가 당연하게 여기는 문맥에서는 여전히 어려움을 겪는다.

더 어려운 문제는 동의와 정체성이다. 당신이 말하지 않는 언어로 당신의 목소리를 재현하는 모델은 유용하면서도, 당신이 하지 않은 말을 하게 만드는 도구가 된다. 마이크로소프트는 음성 복제를 승인 및 동의 확인 뒤에 두었다. 구글은 라이브 번역에 대해 이에 상응하는 세부 사항을 공개하지 않았고, Meet 내부의 비공개 프리뷰는 구글이 아직 경계가 어디인지 정하는 중임을 시사한다.

오디오가 어떻게 처리되는지도 문제다. 회의 안에 자리한 라이브 번역 계층은 말해진 모든 것을 보게 되고, 이는 유용한 도구를 기록물로 바꾼다. 그 오디오가 얼마나 오래 보관되는지, 누가 조회할 수 있는지, 다운스트림에서 무언가를 학습시키는지는 기업 구매자가 기능을 켜기 전에 묻는 질문들이다.

그중 어느 것도 변화를 막지는 못한다. 이미 주머니에 있는 휴대폰에서 화자 자신의 목소리로 연속 실행되는 번역은, 이 기능을 따로 열어야 하는 것에서 그냥 켜져 있는 것으로 옮긴다. 그 멈춤은 기계가 방 안에 있다는 마지막 명백한 신호였다. 구글은 방금 그것을 선택 사항으로 만들었다.

관련 글