← 블로그로
Ai약 14 분 읽기

마이크로소프트가 부분 전사 지연 시간을 100밀리초로 줄였다. 이것은 전사의 용도를 바꾼다.

게시일 2026년 10월 5일
마이크로소프트가 부분 전사 지연 시간을 100밀리초로 줄였다. 이것은 전사의 용도를 바꾼다.

2026년 10월 2일, Microsoft AI는 60개 언어에서 100밀리초가 조금 넘는 시간에 부분 전사를 반환하는 음성 인식 모델 MAI-Transcribe-2-Streaming을 발표했습니다. 이 모델은 최종 전사와 부분 전사 정확도 모두에서 Artificial Analysis 1위를 차지했습니다. 도입 가격은 연말까지 오디오 1시간당 0.54달러입니다.

회사는 또한 23개 언어와 26개 로캘을 지원하는 MAI-Voice-2.1 및 MAI-Voice-2.1-Flash도 발표했습니다. 이 모델은 Azure Speech, Microsoft Foundry, MAI Playground, OpenRouter(아이디 microsoft/mai-transcribe-2), Vercel, Azure Voice Live를 통해 사용할 수 있으며, LiveKit 통합은 곧 제공될 예정입니다.

100밀리초는 단순한 벤치마크의 호기심이 아니라 하나의 임계점입니다. 이는 사람들이 즉각적이라고 인식하는 경계에 놓여 있습니다. 이보다 낮으면 인터페이스는 누군가가 아직 말하고 있는 동안에도 반응할 수 있으며, 이는 문서를 생산하는 제품과 대화에 참여하는 제품의 차이입니다.

청록색 조명 아래 고운 금색 메시에 싸인 마이크 다이어프램의 극단적 클로즈업

최종 정확도만으로는 전체 이야기가 될 수 없었던 이유

음성 인식은 수년간 성숙한 범주였고, 리더보드는 주로 한 가지를 측정해 왔습니다. 화자가 멈춘 뒤 완성된 발화를 모델이 얼마나 정확하게 표현하는가입니다. 그 지표는 전사 서비스가 관심을 두는 질문에는 답합니다. 하지만 실시간 제품이 관심을 두는 질문에는 답하지 않습니다.

화자가 말을 끝낸 뒤에야 단어를 보여주는 회의 비서는 포맷팅이 더 나은 녹음기에 불과합니다. 단어가 도착하는 즉시 보여주는 회의 비서는 현재 화자를 강조하고, 이름이 언급되는 순간 이를 표시하며, 주제가 아직 논의 중일 때 검색을 실행하고, 누군가가 문장 중간에 뒤로 스크롤해도 위치를 잃지 않게 할 수 있습니다. 이 모든 것은 최종 정확도가 아니라 부분 지연 시간에 달려 있습니다.

부분 정확도는 더 어려운 문제이며, Artificial Analysis가 이제 별도로 추적하는 항목입니다. 문장이 완성되기 전에 안정적인 추측을 생성한다는 것은 나중에 수정해야 할 수도 있는 해석을 확정하는 일입니다. 끊임없이 수정하는 모델은 깜빡이는 텍스트를 만들어내는데, 이는 기다리는 것보다 더 나쁩니다. 너무 공격적으로 확정하는 모델은 화면에 오류를 남깁니다. 부분 전사 순위는 독자가 보고 있는 내용을 신뢰할 수 있을 만큼 중간 텍스트를 자주 정확하게 만드는 모델에 보상을 줍니다.

마이크로소프트가 두 리더보드 모두에서 1위를 차지했다고 주장하는 것은, 모델이 부분 속도를 얻기 위해 흔히 중간 안정성을 최종 정확성과 맞바꾸는 방식과 달리 그렇게 하지 않았다는 의미입니다. 바로 이 조합이 실제 발표의 내용입니다.

100밀리초라는 숫자

스트리밍 인식의 종단 간 지연 시간은 단일 수치가 아니라 연쇄입니다. 오디오는 프레임 단위로 도착합니다. 엔드포인팅 모델이 발화가 끝났을 수 있는 시점을 결정합니다. 인식 모델이 텍스트를 생성합니다. 다운스트림 시스템이 이를 렌더링합니다. 모든 연결 고리가 지연을 더하며, 총합이 경험이 실시간처럼 느껴지는지를 결정합니다.

마이크로소프트의 100밀리초 수치는 독립적인 지연 시간 감사가 아니라 회사 자체 측정과 Artificial Analysis 순위에 기반한 모델 자체 출력을 의미합니다. 관련 비교는 이 수치가 실시간 제품이 만들어내는 조건에서도 유지되는지에 관한 것이며, 이는 고립된 상태에서 스톱워치로 잰 값과는 다른 질문입니다. 여러 화자, 배경 소음, 열악한 회의용 마이크, 그리고 동일한 파이프라인에 도착하는 60개 언어가 그 조건입니다. 공급업체는 이러한 조건 전반의 지연 시간 분포를 거의 공개하지 않는데, 바로 그 분포가 회의 제품이 실제 회의에서 사용 가능한지를 결정합니다.

가격 구조는 이야기의 나머지 절반입니다. 오디오 1시간당 0.54달러는 연말까지 적용되는 도입 요금으로, 마이크로소프트가 이 가격을 변경할 것으로 예상한다는 뜻입니다. 전략적 의도는 분명합니다. 스트리밍 전사는 모든 회의 비서, 콜센터 분석 제품, 실시간 자막 서비스의 입력 계층입니다. 60개 언어에서 가장 저렴한 빠른 옵션이 된다는 것은 배포 전략이며, 입력 계층에서의 배포는 고착성이 있습니다. 두 번째로 공급자를 전환하는 팀은 서로 다른 중간 동작 집합에 맞춰 처리를 다시 구축해야 하기 때문입니다.

무엇과 경쟁하는가

마이크로소프트가 빈 들판에 들어가는 것은 아닙니다. Deepgram, AssemblyAI, Speechmatics는 모두 스트리밍 정확도와 낮은 지연 시간을 기반으로 사업을 구축해 왔으며, Google과 Amazon은 경쟁력 있는 인식 기능을 자사 클라우드 스택에 묶어 제공합니다. 현실적인 구매자는 이미 Azure에서 운영 중이고, MAI-Transcribe-2-Streaming이 나머지 MAI 제품군과 함께 Foundry 및 OpenRouter에 등장한다는 점을 가치 있게 여기며, 한 구성 요소 때문에 두 번째 공급업체 관계를 유지하고 싶지 않은 개발자입니다.

MAI-Voice-2.1 발표도 여기서 중요하며, 이 짝짓기는 의도적입니다. 음성 인식과 음성 합성은 같은 대화의 양 끝이며, 둘 다 판매하는 플랫폼은 하나의 파이프라인을 제안할 수 있습니다. 오디오 입력, 전사 출력, 응답 합성, 음성 반환입니다. 합성 측면에서 23개 언어와 26개 로캘을 추가하면 해당 파이프라인을 단일 제품으로 판매할 수 있는 시장 수가 넓어집니다.

빠른 부분 전사가 제품 설계를 바꾸는 방식

중간 텍스트가 0.1초 이내에 도착하면, 이전에는 비합리적이었던 일련의 인터페이스 결정이 평범해집니다.

끼어들기를 생각해 봅시다. 전사가 화자가 멈춘 뒤에야 확정된다면, 시스템은 말해진 내용에 따라 행동하기 전에 침묵을 기다려야 하며, 이는 대화가 이미 넘어간 뒤에야 응답할 수 있다는 뜻입니다. 빠른 부분 전사를 사용하면 시스템은 명령이 말해지는 순간 이를 인식하고 끼어들 수 있으며, 이는 사람들이 방 안에 있는 사람에게 기대하는 행동입니다. 바지인(barge-in)을 지원하는 음성 에이전트가 이에 의존합니다. 빠른 화자를 세 문장 뒤처지지 않고 따라가야 하는 실시간 자막 시스템도 마찬가지입니다.

검색이 두 번째 수혜자입니다. 전사가 작성되는 동안 전사 전체를 검색할 수 있는 회의 비서는 프로젝트 이름이 나오는 순간, 논의가 아직 진행 중일 때 문서를 표시할 수 있습니다. 이는 한 시간 뒤에 검색 가능한 노트를 만들어내는 녹음기와 근본적으로 다른 제품입니다.

구조화된 추출이 세 번째입니다. 부분 텍스트가 충분히 신뢰할 수 있다면, 다운스트림 모델은 회의가 끝나기 전에 이를 읽기 시작해 결정 사항과 실행 항목을 말해지는 대로 태깅할 수 있습니다. 여기서 얻는 이점은 단순한 속도가 아니라 참가자들이 자신이 의도한 바를 아직 기억하고 있을 때 출력을 검토할 수 있다는 데 있습니다.

이러한 각 동작은 부분 전사의 안정성에 더 큰 중요성을 부여합니다. 초당 두세 번씩 스스로를 다시 쓰는 전사는 세 기능 모두를 유용하기보다 짜증나게 만듭니다. 그렇기 때문에 마이크로소프트 발표에서 더 깊은 이야기는 지연 시간 수치 자체가 아니라 부분 전사에서의 정확도 순위입니다.

흥미로운 위험이 자리한 곳

전사 정확도 수치는 일반적으로 집계 백분율로 보고되며, 집계 백분율은 그 아래의 분포를 숨깁니다. 악센트가 있는 발화, 문장 중간의 언어 전환(code-switching), 어린이 목소리, 비표준 마이크에서의 성능은 모델마다 크게 다르며, 이러한 조건은 실시간 제품이 가장 많이 사용될 가능성이 높은 바로 그 조건입니다. 평균이 좋은 모델이라도 고객이 문장 중간에 언어를 바꾸는 특정 콜센터에는 잘못된 선택일 수 있습니다.

두 번째 위험은 더 전략적입니다. 전사가 지속적으로 실행될 만큼 빠르고 저렴해지면, 자연스러운 다음 단계는 항상 실행하는 것입니다. 시간당 0.5달러인 모델은 분당 가격 모델이 하지 못했던 방식으로 지속적 청취를 저렴하게 만들며, 지속적 청취는 기기 근처에서 말해진 모든 것의 상시 녹음입니다. 이는 정확도 리더보드가 이 제품을 구매하는 팀을 위해 대신 내려주지 않을 데이터 거버넌스 결정입니다.

MAI-Transcribe-2-Streaming은 진정으로 유용한 인프라이며, 부분 정확도 순위는 주목할 만한 부분입니다. 이는 실시간 제품이 실제로 의존하는 지표를 측정하기 때문입니다. 아직 해결되지 않은 것은 공급업체가 측정한 100밀리초 수치가 음향이 나쁜 방에서 네 사람이 서로 말을 겹쳐 하는 상황에서도 유지되는지 여부입니다. 이는 모든 구매자가 프로덕션 파이프라인에 적용하기 전에 비공개로 실행할 테스트입니다.

관련 글