← 블로그로
Ai약 12 분 읽기

알리바바, 보이스 에이전트를 둘로 나누고 가격을 최대 95% 인하

게시일 2026년 10월 2일
알리바바, 보이스 에이전트를 둘로 나누고 가격을 최대 95% 인하

알리바바의 Qwen 팀은 2026년 9월 마지막 주에 Qwen-Audio-3.1을 공개했습니다. 이는 음성 인식, 텍스트 음성 변환(TTS), 실시간 상호작용을 아우르는 5개 모델 오디오 스택입니다. 가장 빠르게 퍼진 숫자는 가격 인하였습니다. 실시간 모델은 약 85%, 텍스트 음성 변환은 약 70%, 자동 음성 인식은 최대 95% 인하되었습니다.

이 숫자들이 중요한 이유는 업계 전체가 가격을 인하하던 주에 나왔기 때문입니다. 마이크로소프트, 오픈AI, 앤스로픽 모두 같은 시기에 더 저렴하거나 재조정된 모델을 내놓았고, 알리바바의 움직임은 특히 오디오 분야에서 의도적인 경쟁 심화로 읽힙니다. 하지만 Qwen-Audio-3.1에서 더 흥미로운 점은 할인이 아닙니다. 바로 플래그십 모델이 어떻게 만들어졌는가입니다.

하나의 음성 뒤에 있는 두 모델

대표 모델은 Qwen-Audio-3.1-Realtime으로, 대화 도중 도구를 호출해야 하는 보이스 에이전트를 위해 만들어진 전이중(full-duplex) 음성 시스템입니다.

핵심 설계 결정은 분리입니다. 듣고 말하는 하나의 거대한 엔드투엔드 시스템 대신, Qwen은 오디오 인코더와 언어 모델 백본을 공유하는 두 개의 모델을 실행합니다. 결정 모델은 계속 들을지, 말을 시작할지, 멈출지, 다시 이어갈지를 예측합니다. 별도의 생성 모델이 실제 발화를 담당합니다. 쉽게 말해, 한 모델은 언제 말할지를 결정하고 다른 모델은 무엇을 말할지를 결정합니다.

이 분리는 특정 실패에 대한 실용적인 답입니다. 보이스 에이전트가 고장 난 것처럼 느껴지는 가장 흔한 이유는 당신을 오해해서가 아니라 타이밍을 잘못 판단하기 때문입니다. 말을 끊고 겹쳐 말하거나, 침묵하거나, 말이 끝나기 전에 답합니다. 지금까지의 처방은 더 큰 모델에 턴테이킹을 덧붙이고 그 행동이 창발하기를 바라는 것이었습니다. Qwen은 “언제 말할지”를 콘텐츠 생성과 분리된 자체 모델을 가진 독자적인 엔지니어링 문제로 다룹니다. 회사에 따르면 한 벤치마크에서 잘못된 화자를 향한 응답이 0.13에서 0.03으로 줄었고, 또 다른 벤치마크에서는 군더더기 말 비율이 0.759에서 0.296으로 낮아졌습니다. 또한 상호작용 중단 후 원치 않는 재개 비율이 0.035에서 0.130으로 상승하는 트레이드오프도 보고했는데, 이는 공개 노트에서는 좀처럼 포함되지 않는 종류의 공개입니다.

이 모델은 관리형 API로 제공됩니다. Qwen-Audio-3.1-Realtime-Plus는 WebSocket을 통해 QwenCloud에서 실행됩니다. 오픈 웨이트는 없는데, 이는 Qwen의 오픈 이미지 작업을 지켜보는 사람들에게 중요합니다. 오디오 스택은 폐쇄형 관리형 제품으로 운영되기 때문입니다.

사양과 가격

실시간 엔드포인트는 텍스트와 오디오를 모두 입력과 출력으로 지원합니다. 컨텍스트는 262K 토큰까지이며, 최대 입력 245K, 최대 출력 16K입니다. 기본 처리량 한도는 분당 60회 요청 및 100,000 토큰입니다. 가격은 오디오 입력 백만 토큰당 $6.4, 텍스트 입력 백만 토큰당 $0.8이며, 텍스트와 오디오를 합친 출력은 백만 토큰당 $24이고 출력 텍스트에는 전혀 요금이 부과되지 않습니다. 함수 호출, 웹 검색, 구조화된 출력, 컨텍스트 캐싱, 파인튜닝이 모두 내장되어 있습니다.

동반 모델인 Qwen-Audio-3.1-ASR-Flash-Filetrans는 긴 오디오의 오프라인 전사를 목표로 합니다. 핫워드, 화자 분리, 구두점, 그리고 여러 언어와 중국어 방언에 걸친 인식을 지원하며, 백만 토큰당 입력 $0.15, 출력 $0.47입니다. 대규모 장문 전사 비용을 산정해 본 사람이라면, 이는 한때 고정비였던 항목이 크게 낮아진 것입니다.

훈련 방식은 Qwen이 Think, Act, Speak라고 부르는 세 계층으로 구성됩니다. Think 계층은 수백만 시간 규모의 병렬 데이터를 사용해 오디오 모델을 원천 텍스트 모델에 다시 고정한 다음, 미리 작성된 답변을 모방하는 대신 온폴리시 증류를 적용합니다. Act 계층은 도구 풀, 상태 저장 데이터베이스, 서면 비즈니스 정책을 각각 묶은 실행 가능 환경을 구축하며, 작업은 최종 상태를 우선 기준으로 채점됩니다. Speak 계층은 말할지, 언제 말할지, 어떻게 말할지를 결정합니다.

Act 계층에서 눈여겨볼 세부 사항이 있습니다. 채점은 문구를 확인하기 전에 결과 상태를 확인하므로, 유창한 답변이라도 실패한 행동을 구제할 수 없습니다. 이는 대화만 나누는 것이 아니라 실제로 무언가를 해야 하는 에이전트를 평가하는 올바른 방식입니다.

가격 전쟁이 진짜 이야기인 이유

아키텍처를 걷어내면 Qwen-Audio-3.1은 명확한 전략적 움직임입니다. 알리바바는 개방성보다 음성 인프라의 비용과 지연 시간에서 오픈AI, 구글과 경쟁하고 있습니다.

이를 이해하게 해 주는 비교는 지연 시간입니다. Qwen은 인터럽트 중지 지연 시간이 약 1.116초라고 보고했는데, GPT-Realtime-2는 0.383초입니다. 사용자가 방해할 때 더 느리게 멈추는 것은 눈에 띄는 약점이며, Qwen이 승리 요인들과 함께 이 수치를 공개했다는 사실은 오디오 분야의 벤치마크 문화 상태를 말해 줍니다. 여기서는 정직한 숫자도 여전히 차별화 요소입니다.

빌더에게 실질적인 효과는 더 저렴한 백엔드입니다. 실시간 음성이 85% 더 저렴하고 인식이 최대 95% 더 저렴하다면, 이전에는 프리미엄 등급에만 있던 음성 기능이 일반 제품에서도 실행 가능해집니다. 상시 청취, 실시간 번역, 에이전트용 음성 인터페이스는 모두 그 비용 곡선의 영향을 받습니다. 말하는 1분의 비용이 급감하면, 지난 분기에는 감당할 수 없었던 제품 결정이 이번 분기에는 당연해집니다.

주의할 점은 모든 관리형 API에 해당합니다. 내부가 아니라 동작을 얻습니다. 턴테이킹 모델을 살펴보거나, 완전히 통제하는 방식으로 자체 데이터에 결정 로직을 파인튜닝하거나, 자체 하드웨어에서 스택을 실행할 수 없습니다. 대부분의 스타트업에게는 받아들일 만한 거래입니다. 지연 시간 프로필이나 데이터 경로 자체가 제품인 무언가를 만드는 사람에게는 비용을 산정해 둘 만한 의존성입니다.

경쟁 구도는 이 점을 더 선명하게 합니다. 같은 9월 기간에 오픈AI와 앤스로픽은 더 낮은 비용으로 더 많은 작업을 하도록 설계된 모델을 내놓았고, 마이크로소프트는 자체 라인에 스트리밍 전사 모델과 두 개의 텍스트 음성 변환 모델을 추가했습니다. 오디오는 더 이상 작은 연구소가 아무도 모르게 최고가 될 수 있는 조용한 구석이 아닙니다. 가장 큰 플레이어들이 공개적으로 가격과 지연 시간에서 경쟁하는 카테고리이며, 이는 구매자에게는 좋은 소식이고 음성에 프리미엄을 붙이는 이들에게는 압박입니다.

지켜볼 것

당연한 질문은 Qwen이 결국 이 스택의 일부라도 오픈소스로 공개할지, 그리고 두 모델 설계가 벤치마크 조건이 아니라 실제 다중 턴 도구 호출 부하에서 얼마나 견딜지입니다. 턴테이킹을 콘텐츠와 분리하는 것은 종이 위에서는 우아합니다. 사용자가 방해하고, 마음을 바꾸고, 문장 중간에 작업을 전환할 때도 우아함을 유지하는지는 데모가 답하지 않는 종류의 질문입니다.

지금으로서의 시사점은 더 좁고 분명합니다. 알리바바는 보이스 에이전트에서 가장 고장 난 것처럼 느껴지던 부분을 집어내 이름을 붙이고 전용 모델을 부여했습니다. 그런 다음 전체 카테고리가 더 저렴해질 때까지 가격을 내렸습니다. 내년의 음성 제품이 더 저렴하고 인터럽트가 더 잘 되는 음성 위에 구축된다면, 이번 릴리스는 그 이유 중 하나로 보일 것입니다.

관련 글