← 블로그로
Ai약 14 분 읽기

보이스 에이전트만을 위한 벤치마크 등장, 연구소마다 다른 항목에서 1위

게시일 2026년 10월 3일
보이스 에이전트만을 위한 벤치마크 등장, 연구소마다 다른 항목에서 1위

음성 비서는 올해 더 이상 데모가 아니라 인프라가 되었고, 이제 그 인프라가 측정되기 시작했습니다. 실제 환경의 보이스 에이전트를 겨냥한 최근 벤치마크 작업은 이 기술 위에 무언가를 만드는 사람이라면 누구나 흥미를 가질 만한 사실을 발견했습니다. 단일 모델이 모든 것을 지배하지는 않는다는 점입니다. 각 선도 연구소는 서로 다른 축에서 1위를 차지합니다.

결과를 다룬 보도에 따르면 xAI의 Grok Voice Think Fast 2.0은 작업 완료(task completion) 항목에서 앞서는데, 이는 요청받은 일을 실제로 끝낸다는 뜻입니다. OpenAI의 GPT-Live 1은 응답 속도가 가장 빠릅니다. Google의 Gemini 3.8 Live는 오디오에 잡음이 많을 때 가장 강건합니다. 세 벤더, 세 가지 강점, 그리고 뚜렷한 종합 우승자는 없습니다.

이는 단일 리더보드가 보통 보여주는 것보다 정직한 그림이며, 이 범주가 얼마나 아직 어린지를 반영합니다. 보이스 에이전트는 하나의 능력이 아닙니다. 정확하게 듣고, 빠르게 판단하고, 자연스럽게 응답하고, 중단이 끼어들어도 대화의 흐름을 이어가야 합니다. 이 중 하나에 최적화하면 다른 것에서 손해를 보기 마련입니다. 이 벤치마크가 유용한 이유는 바로 그것들을 분리해서 보여주기 때문입니다.

Microsoft의 3종 모델 공세

Microsoft는 이번 주 이 분야에서 자체적인 행보를 보이며 소비자가 아닌 개발자를 겨냥한 음성 모델 세트를 출시했습니다. 핵심은 MAI-Transcribe-2-Streaming으로, 회사 최초의 실시간 스트리밍 음성-텍스트 변환 모델입니다. 말을 아직 하고 있는 동안에도 사용자를 이해해야 하는 에이전트에게 가장 중요한 부분입니다. 회사는 또한 MAI-Voice-2.1 제품군을 업데이트하며 더 자연스러운 음성과 더 짧은 발화 순서 전환(turn-taking) 지연 시간을 목표로 삼았습니다. 이는 사용자가 말을 마친 뒤 에이전트가 시작하기까지의 멈춤으로, 너무 길면 대화가 어색하게 느껴지게 만듭니다.

이 두 가지 문제, 즉 스트리밍 정확도와 발화 순서 전환 지연은 대부분의 보이스 에이전트가 실무에서 무너지는 지점입니다. 말을 멈춘 뒤에 정확하게 변환하는 모델은 자막에는 충분합니다. 예의 있게 끼어들고, 자연스러운 멈춤을 기다리고, 2초의 공백 없이 답하고자 하는 에이전트는 스트리밍 입력과 빠른 음성 생성이 함께 작동해야 합니다. 두 가지를 각각 별도의 개발자용 모델로 출시한 것은 Microsoft가 음성을 단일 앱이 아니라 많은 제품이 그 위에 구축할 하나의 계층으로 보고 있다는 신호입니다.

회사는 또한 자사 오디오 모델을 데이터를 전혀 보존하지 않는(zero data retention) 서드파티 AI 게이트웨이를 통해 사용할 수 있게 했습니다. 이는 콘텐츠를 제공업체의 저장소로 보내지 않고도 음성 기능을 원하는 기업에 중요한데, 규제 산업에서 끊임없이 제기되는 제약입니다.

캡처 쪽도 흥미로워진다

대화의 반대편에서는 사람의 음성과 얼굴을 생성하는 도구가 계속 더 저렴하고 더 좋아지고 있습니다. HeyGen의 최근 업데이트에는 OpenAI의 전이중(full-duplex) 음성 모델을 자사의 라이브 아바타 제품에 연결하는 오픈소스 실시간 아바타 스택, 음성 복제 API, 그리고 AI 생성 영상이 얼마나 잘 '보이는지'가 아니라 실제로 얼마나 잘 '제작되는지'를 측정하기 위해 Kaggle과 함께 만든 벤치마크가 포함됐습니다.

마지막 항목은 이런 도구들이 평가되는 방식의 공백을 지적합니다. 생성형 영상의 대부분 비교는 시각적 품질에서 멈춥니다. 토킹 헤드 아바타는 파이프라인이기도 하며, 그 파이프라인에는 실패 모드가 있습니다. 립싱크가 어긋나는 것, 중단을 무시하는 발화 순서 전환, 대화를 어색하게 만드는 지연 등입니다. 겉모습이 아니라 제작 품질을 중심으로 벤치마크를 만드는 것은 이 분야에 빠져 있던 측정 방식입니다.

전이중 전환이 중요한 이유

이 모든 것 아래에는 제품 발표만 읽으면 놓치기 쉬운 기술적 변화가 있습니다. 이전 세대 음성 비서는 계주처럼 작동했습니다. 사용자가 말하면, 시스템은 사용자가 멈추기를 기다리고, 변환하고, 생각하고, 답변을 생성하고, 재생합니다. 최신 전이중 모델은 듣기와 말하기를 동시에 할 수 있으며, 이것이 사람의 대화를 닮은 발화 순서 전환을 가능하게 합니다. 말이 겹쳐 들어오는 상황을 처리하는 능력도 포함됩니다.

상호작용 설계의 사소한 변화처럼 들립니다. 하지만 어색하게 순서를 주고받는 시스템과, 끼어들 수 있는 시스템의 차이입니다. 최근 한 데모와 함께 돌던 세부 사항이 이를 잘 보여줍니다. 양쪽이 동시에 말을 시작했을 때, 에이전트는 사람에게 먼저 말할 기회를 양보했습니다. 사소한 배려지만, 이를 제대로 해내려면 모델이 자기 차례를 기다리는 대신 계속 듣고 있어야 합니다.

자연스러운 대화를 가능하게 하는 엔지니어링

음성이 보기보다 어려운 이유는 사용자가 결코 보지 못하는 숫자로 귀결됩니다. 대화 중 두 사람 사이의 자연스러운 멈춤은 짧아서 흔히 1초의 몇 분의 1에 불과하며, 답이 너무 늦으면 산만하거나 자신 없어 보입니다. AI 에이전트가 살아 있다고 느껴지려면 전체 체인이 비슷한 시간 창 안에 들어와야 합니다. 오디오를 포착하고, 화자가 멈춘 뒤가 아니라 도착하는 대로 변환하고, 무슨 말을 할지 정하고, 음성을 생성하고, 재생을 시작하는 것입니다. 각 단계마다 지연이 더해지고, 이 모두를 합친 예산은 작습니다.

그래서 Microsoft가 강조한 두 가지 능력이 스트리밍 변환과 발화 순서 전환 지연입니다. 발화가 끝나기를 기다리는 모델은 정확할 수 있지만 대화에는 여전히 쓸모가 없습니다. 처리를 마칠 때쯤이면 응답하기에 자연스러운 순간이 이미 지나갔기 때문입니다. 스트리밍 입력은 문장이 완성되기 전에 에이전트가 추론을 시작하게 합니다. 빠른 음성 생성은 눈에 띄는 공백 없이 답하게 합니다.

전이중이라는 변화는 또 다른 층을 더합니다. 예전의 순차적 시스템에서는 한 번에 한쪽만 활성화됩니다. 어시스턴트가 듣고, 말하고, 다시 듣습니다. 전이중 모델은 둘을 동시에 할 수 있고, 그래서 방해받는 상황을 처리하고, 사람이 단지 생각하느라 잠깐 멈춘 것인지 알아차리고, 우아하게 발언권을 넘길 수 있습니다. 이는 모델링의 문제인 동시에 상호작용 설계의 문제입니다. 기술적 요소를 빠르게 만드는 것은 필수이고, 언제 말을 멈출지 결정하는 것이 결과를 배려심 있게 느껴지게 합니다.

데이터 처리 측면은 간과하기 쉽지만 기업 도입에는 못지않게 중요합니다. 음성은 단어 이상을 담습니다. 말투부터 배경 소음, 화자의 정체성까지 담기 때문에 텍스트보다 가볍게 다루기 어렵습니다. 그래서 이 모델들을 보존 없음(no-retention) 옵션이 있는 게이트웨이를 통해 사용할 수 있다는 점이 이 이야기의 일부입니다. 음성 기능을 원하지만 고객 오디오를 벤더의 저장소로 보낼 수 없는 기업은 처리가 흔적을 남기지 않아야 하며, 최근까지는 그 점이 음성 자체를 피하는 이유였습니다.

데모와 배포 사이의 간극

신중할 이유는 있습니다. 보이스 에이전트는 고객 지원, 보험 청구 처리, IT 헬프데스크에 바로 쓸 수 있다고 팔리고 있지만, 이를 측정하는 벤치마크는 새것이고 배포 사례도 아직 초기입니다. 세 개의 선도 모델이 단일 테스트에서 최상위 자리를 나눠 가졌다는 사실은 '최고의 음성 AI'라는 말이 아직 의미 있는 표현이 아니라는 것을 상기시킵니다. 어떤 모델이 맞는지는 문제가 시끄러운 콜센터인지, 끝까지 완수해야 하는 작업인지, 빠르고 자연스럽게 느껴져야 하는 대화인지에 달려 있습니다.

또 하나의 주의점은 사람처럼 들리는 모든 생성 모델에 따라붙는 것입니다. 사람으로 통할 만큼 뛰어난 시스템은 악용될 만큼도 뛰어납니다. 같은 주에 도쿄의 법원 판결은 무단 음성 복제가 개인의 권리를 침해할 수 있음을 인정했습니다. 기술과 그를 둘러싼 규칙이 동시에 도착하고 있는데, 이는 흔치 않은 일이며 아마 대안보다 나을 것입니다.

빌더에게 실질적인 결론은 음성을 하나의 체크박스로 취급하지 말라는 것입니다. 잡음 속에서 듣기, 작업 완수, 살아 있다고 느껴질 만큼 빠른 응답 중 무엇이 병목인지에 맞춰 모델을 고르고, 하나로 표준화하기보다 벤더를 섞어 쓰는 것을 예상하세요. 이들을 구분해 준 벤치마크는 서로 바꿔 쓸 수 있는 것처럼 가장하는 어떤 순위표보다 유용합니다.

관련 글