← 블로그로
Ai약 13 분 읽기

AssemblyAI, 실시간 음성 지연 시간을 91밀리초로 단축했다. 이 숫자가 중요한 이유

게시일 2026년 10월 7일
AssemblyAI, 실시간 음성 지연 시간을 91밀리초로 단축했다. 이 숫자가 중요한 이유

AssemblyAI가 새로운 스트리밍 음성 인식 모델인 Universal 3.6 Pro Realtime을 출시했다. 단어 오류율은 1.77퍼센트로 떨어졌다. 1,000건이 넘는 통화 녹음 테스트에서 발화 종료부터 최종 텍스트 출력까지의 중앙값 지연 시간은 91밀리초였다. P95 지연 시간은 692밀리초에서 225밀리초로 감소했다.

이런 수치는 성숙한 기술의 점진적 개선처럼 보인다. 하지만 움직인 특정 숫자 때문에 이는 임계점 사건에 가깝다.

91밀리초가 다른 제품인 이유

음성 인식은 수년 전부터 받아쓰기에 충분할 만큼 정확했다. 대화형 애플리케이션의 제약은 결코 단어 오류율이 아니었다. 그것은 턴 테이킹이었다.

인간의 대화는 빠른 겹침 위에서 돌아간다. 한 화자가 말을 마치고 다음 화자가 시작할 때까지의 중앙값 간격은 약 200밀리초이며, 친숙한 대화에서는 이 간격이 줄어들고 논쟁에서는 더욱 줄어든다. 이것이 모든 대화형 시스템이 맞춰 들어가야 하는 예산이다.

P95 지연 시간이 692밀리초라면 음성 에이전트는 체감상 뒤처진다. 사용자는 적응한다(멈추고, 반복하고, 시스템 위로 말한다). 그러면 상호작용은 누구나 기계와 대화한다고 인식하는 다소 딱딱한 성질을 띠게 된다. P95 225밀리초에서 에이전트는 사려 깊은 인간 응답 범위 안에 들어온다. 중앙값 91밀리초라면 대부분의 사람보다 빠르다.

이것이 데모로 작동하는 음성 에이전트와 제품으로 작동하는 음성 에이전트의 차이다. 그리고 개선은 2배를 훨씬 뛰어넘는데, 중앙값만큼 분포도 중요하기 때문이다. P95를 692에서 225로 줄인다는 것은 대화가 깨진 것처럼 느껴지게 만들던 꼬리 응답이 대부분 제거되었음을 의미한다.

이로부터 따라 나오지만 종종 간과되는 설계상의 결과가 있다. 인식이 느리면 제품 팀은 에이전트가 더 긴 턴을 갖도록 보정한다. 즉 분명한 멈춤을 기다리고, 완전한 문단으로 말하며, 사용자와 전혀 겹치지 않도록 한다. 이런 보정은 단어가 자연스러워도 사용자가 로봇 같다고 인식하는 특정한 대화 스타일을 낳는다.

인식이 빠르면 에이전트는 짧은 턴을 사용할 수 있다. 사용자가 아직 말하는 동안에도 맞장구를 칠 수 있다. 문장이 끝난 뒤가 아니라 모호성이 나타나는 순간에 명확화 질문을 끼워 넣을 수 있다. 이 대화 스타일은 지연 예산이 허용한 뒤에야 가능해진다. 즉 지연 개선은 현재 상호작용이 느껴지는 방식을 개선하는 데 그치지 않고 다른 상호작용 설계를 열어젖힌다.

이번 릴리스에 포함된 다른 것들

이 모델은 엔터티 인식 턴 감지를 통합한다. 전화번호나 주소처럼 인식된 엔터티가 완료되었을 때를 알며, 구두점에 인접한 침묵을 턴의 끝으로 취급하지 않는다. 또한 배경 소음 보정을 추가한다.

두 기능 모두 같은 문제를 가리킨다. 실제 음성 환경은 지저분하다는 점이다. 콜센터 오디오에는 대기 음악, 키보드 소음, 동시 발화, 억양이 있다. 단순한 침묵 임계값에 의존하는 턴 감지는 화자가 생각하느라 멈출 때마다 말을 중간에 끊고, 말처럼 들리는 소음 동안에도 회선을 열어 둔다.

엔터티 인식 감지는 구체적이고 비용이 큰 오류 범주를 다룬다. "내 번호는 오 오 오"를 완전한 턴으로 취급하는 시스템은 반쯤 끝난 문장에 응답을 생성하고, 사용자는 처음부터 다시 시작하게 된다. 통화 한 건에서 이런 재시작은 2분 상호작용과 6분 상호작용의 차이를 만든다.

에이전트 스택에서 이 위치

시점은 우연이 아니다. 같은 주에 Decagon은 Voice 3와, 콜러가 그 자체로 에이전트인 상황에 고객 지원을 대비시키기 위한 PACT라는 프레임워크를 발표했다. Anthropic은 사이버 검증 등급을 구축해 왔다. OpenAI는 decisions API를 열었다. 에이전트 인프라 계층은 사방에서 동시에 구축되고 있으며, 음성은 지연 예산이 가장 빠듯한 인터페이스다.

음성이 가장 빠듯한 이유는 텍스트 에이전트는 느려도 된다는 점이다. 채팅 창에 입력하는 사용자는 몇 초의 사고 시간을 견딘다. 상호작용 모델에 이미 기다림이 포함되어 있기 때문이다. 전화 통화 중인 사용자는 그렇지 않다. 1초가 넘는 침묵은 연결 끊김으로 읽히고, 사용자는 시스템이 처리를 마치기도 전에 "여보세요?"라고 말한다.

이 비대칭성은 실시간 음성 인식이 음성 제품의 여러 구성 요소 중 하나가 아님을 의미한다. 그것은 제품이 될 수 있는 것의 상한을 정한다. 뛰어난 추론과 700밀리초의 인식 지연을 가진 음성 에이전트는 느린 음성 에이전트다. 추론이 아무리 좋아도 깨끗한 턴에서 실행될 기회를 얻지 못하기 때문이다.

1.77퍼센트 오류율의 비용

단어 오류율 수치는 맥락이 필요하다. 깨끗하게 읽은 음성에서는 최상위 모델들이 한동안 3퍼센트 아래였다. 이름, 계좌 번호, 주소가 있는 소음 많은 콜센터 오디오에서는 오류율이 역사적으로 훨씬 높았으며, 바로 여기서 엔터티 정확도가 전체 단어 오류율보다 더 중요하다.

공급업체의 테스트 세트에서 1.77퍼센트 오류율은 당신의 오디오에서 무슨 일이 일어나는지 알려주지 않는다. 조달에서 중요한 세부 사항은 더 좁다. 고유명사 정확도, 영숫자 문자열(계좌 번호, 확인 코드) 정확도, 그리고 화자가 인식 대상 언어의 원어민이 아닐 때의 정확도다.

마지막 항목은 대부분의 프로덕션 시스템이 실패하고 대부분의 벤치마크가 측정하지 않는 지점이다. 억양 차이는 무작위 오류가 아니라 체계적 오류를 낳는다. "fifteen"을 일관되게 "fifty"로 듣는 인식기는 평균을 내서 고쳐지지 않는다. AssemblyAI의 엔터티 인식 턴 감지는 하류 결과에 도움이 되지만, 억양 있는 발화의 전사 정확도는 별도의 평가다.

실용적 해석

음성을 만드는 사람에게 이번 릴리스는 시도할 가치가 있는 일을 바꾼다. 대화형 지연의 스트리밍 인식은 제품이 끼어들기, 빠른 주고받기, 실제 대화에 포함된 종류의 겹치는 턴을 처리할 수 있음을 뜻한다. 이전에는 기술적으로 가능했지만 사용하기 어색하게 느껴졌던 애플리케이션이 이제는 만들 가치가 있다.

비용 차원도 지연과 함께 중요하다. 이 정도 속도의 스트리밍 인식은 통화 중 지속적으로 실행되어야 하며, 이는 컴퓨팅 비용이 전사된 오디오가 아니라 대화 시간에 따라 확장됨을 의미한다. 대규모 배포에서는 이것이 단위 경제성을 바꾸므로, 상시 인식을 가정하는 아키텍처에 전념하기 전에 모델링할 가치가 있다.

가정하지 말고 세 가지를 테스트하라. P95가 아니라 P99 지연 시간이다. 사용자는 최악의 1퍼센트 턴을 기억하기 때문이다. 공급업체의 벤치마크 세트가 아니라 당신의 오디오에서의 정확도, 특히 이름과 숫자에 주의하라. 그리고 끼어들기 상황에서의 동작이다. 깨끗한 턴 테이킹은 처리하지만 사용자가 위로 말할 때 멈추는 시스템은 음성이 가장 중요한 바로 그 대화에서 실패할 것이기 때문이다.

대부분의 평가가 건너뛰는 네 번째 테스트가 있다. 인식이 틀렸을 때 무슨 일이 일어나는가다. 모든 인식기는 무언가를 잘못 듣는다. 음성 제품의 품질은 그것이 어떻게 회복하는지에 크게 달려 있다. 명확화를 요청하는지, 잘못된 전사 위에서 조용히 진행하는지, 단어 열이 문맥상 비현실적임을 식별하고 다시 묻는지. 자신의 오류를 전혀 감지하지 못하는 1.77퍼센트 오류율 모델은 더 높은 오류율과 좋은 불확실성 신호를 가진 모델보다 실제로 덜 유용하다.

더 큰 변화는 음성이 더 이상 병목이 아니라는 점이다. 2026년 말 음성 제품 팀의 질문은 나머지 스택(추론, 행동 실행, 오류 복구)이 이제 인간 속도로 작동하는 귀를 따라잡을 만큼 빠른가이다.

관련 글