마이크로소프트, 초저지연 실시간 음성인식 모델 'MAI-Transcribe-2-Streaming' 및 차세대 음성 합성 라인업 공개

Key Points
- 1마이크로소프트 AI가 아티피셜 아날리시스 1위를 차지한 실시간 음성인식 모델 'MAI-Transcribe-2-Streaming'과 음성합성 모델 2종을 출시했습니다.
- 2MAI-Transcribe-2-Streaming은 오디오 수신 100ms 만에 부분 전사를 생성하고 60개 언어 자동 감지를 지원해 발화 중간 추론 및 도구 호출을 구현합니다.
- 3MAI-Voice-2.1은 23개 언어에 걸쳐 화자의 고유 음색을 유지하며 네이티브 억양으로 발화하는 다국어 음성 합성 모델입니다.
- 4MAI-Voice-2.1-Flash는 45초 오디오를 150ms 초저지연으로 생성하며 100만 자당 15달러의 비용으로 대규모 워크로드에 최적화되었습니다.
- 5신규 모델들은 마이크로소프트 파운드리, 오픈라우터, 버셀 및 MAI 플레이그라운드를 통해 즉시 연동 및 테스트가 가능합니다.
마이크로소프트 AI가 차세대 대화형 음성 에이전트 구축을 위한 핵심 음성 모델 라인업을 10월 1일 전격 공개했다. 이번에 발표된 모델은 실시간 음성인식(STT) 모델인 'MAI-Transcribe-2-Streaming'과 다국어 텍스트 음성 변환(TTS) 모델인 'MAI-Voice-2.1', 저지연 고성능에 특화된 경량 모델 'MAI-Voice-2.1-Flash' 등 총 3종이다. 이 모델들은 사람이 대화 흐름을 자연스럽게 느낄 수 있는 초저지연 처리 속도와 높은 음성 품질을 결합해 실시간 보이스 에이전트 개발을 가속화하도록 설계됐다.
100ms 응답 속도와 정확도를 양립한 실시간 스트리밍 STT
'MAI-Transcribe-2-Streaming'은 글로벌 AI 평가 플랫폼인 아티피셜 아날리시스(Artificial Analysis)의 음성인식 평가에서 최종 전사(final)와 중간 전사(partial) 부문 모두 정확도 1위를 기록했다. 특히 정확도 대 지연시간 평가에서 파레토 프론티어(Pareto frontier)에 도달해 정확도 저하 없는 초저지연 스트리밍 성능을 입증했다. 오디오 입력 후 약 100ms 만에 첫 번째 부분 가설 텍스트를 출력하며, 이후 음성 컨텍스트가 유입됨에 따라 실시간으로 문맥을 보정하여 안정적인 전사 텍스트를 확정한다.
이러한 즉각적인 부분 전사는 음성 에이전트 아키텍처에 실질적인 이점을 제공한다. 사용자의 발화가 완전히 끝나기 전 문장 중간 단계에서 실시간으로 의도를 분석하고 추론을 시작하거나 도구 호출(Tool Calling)을 선제적으로 실행할 수 있기 때문이다. 마이크로소프트 자체 벤치마크에 따르면 기존 주요 경쟁 모델 대비 텍스트 노출 속도가 2배 빠르며, 총 60개 언어에 대한 연속 자동 언어 감지(Continuous Language Detection)를 지원한다. 이용 요금은 연말까지 프로모션 가격인 오디오 1시간당 0.54달러로 책정됐다.
단일 화자 정체성 유지와 150ms 저지연 TTS 라인업
함께 공개된 텍스트 음성 변환 모델 'MAI-Voice-2.1'은 23개 언어와 26개 로케일을 지원한다. 특히 동일 화자가 영어, 중국어, 독일어 등 다양한 언어로 전환하더라도 특유의 음색과 캐릭터를 유지하면서 각 언어 고유의 자연스러운 억양을 구사하는 크로스 링구얼 기능을 갖췄다. 이는 다국어 고객 응대 봇이나 글로벌 튜터링 서비스에서 화자 정체성을 일관되게 유지하는 데 효과적이다. 가격은 100만 자당 22달러다.
대규모 트래픽과 극도의 지연 시간 단축이 필요한 워크로드를 위해 설계된 'MAI-Voice-2.1-Flash'는 45초 분량의 오디오를 종단 간(End-to-End) 지연 시간 150ms 만에 생성할 수 있다. 기존 동급 모델 대비 55% 빠른 추론 속도와 약 60% 저렴한 100만 자당 15달러의 가격 경쟁력을 갖췄다. 두 음성 모델 모두 수 초 분량의 참조 음성만으로 다국어 보이스 클로닝을 지원하며, 음성 오남용 방지를 위한 사용자 동의 기반 가드레일이 내장되어 있다.
마이크로소프트는 이번 신규 음성 모델군을 통해 음성을 듣고(STT), 판단하고(LLM), 말하는(TTS) 전체 보이스 루프의 병목을 해결할 수 있다고 설명했다. 해당 모델들은 마이크로소프트 파운드리(Microsoft Foundry), MAI 플레이그라운드의 'Chatter' 데모, 오픈라우터(OpenRouter), 버셀(Vercel)을 통해 즉시 사용할 수 있으며, 향후 라이브킷(LiveKit)과 애저 보이스 라이브(Azure Voice Live) 등으로 지원 범위가 확장될 예정이다.
메타(Meta), 'Muse AI' 에이전트 탑재 커스텀 기기 제작용 오픈소스 코드 공개
메타가 사용자가 자체 하드웨어에 자사의 Muse AI 에이전트를 연동할 수 있도록 가젯 SDK를 오픈소스로 공개했습니다. 개발자는 라즈베리 파이나 ESP32 보드를 활용해 디스플레이와 센서를 제어하는 DIY AI 기기를 구축할 수 있습니다.
스트랜즈, 텍스트 생성 배제한 2B 오픈소스 의사결정 모델 'Strands Decider 2B' 공개… 100ms대 초고속 에이전트 라우팅 지원
스트랜즈(Strands)가 복잡한 텍스트 생성 대신 객관식 선택과 신뢰도 점수 산출에 특화된 20억 파라미터 규모의 오픈소스 모델 '스트랜즈 디사이더 2B(Strands Decider 2B)'를 공개했습니다. Qwen3.5-2B 토르소에 경량 포인터 헤드를 결합하여 로컬 하드웨어 환경에서도 중앙값 115ms 수준의 초저지연으로 결정을 내릴 수 있도록 설계되었습니다. 에이전트의 도구 선택, 모델 라우팅, 가드레일 등 빠른 시스템 1(System 1) 판단이 필요한 워크플로우의 비용과 지연 시간을 대폭 절감할 수 있습니다.
앤트로픽, '클로드 코드' 동작 및 UI 제어하는 타입스크립트 기반 '모드(Mods)' 출시
앤트로픽이 개발자 도구 '클로드 코드(Claude Code)'의 동작과 UI를 타입스크립트 코드로 커스텀할 수 있는 '모드(mods)' 시스템을 발표했습니다. 모드를 통해 개발자는 프롬프트 재작성, 도구 호출 제어, 민감 정보 마스킹, 커스텀 UI 확장 등 에이전트 실행 파이프라인 전반을 정교하게 제어할 수 있습니다. CLI 및 데스크톱 앱 모두를 지원하며, 플러그인 기반 배포와 기업용 보안 거버넌스 기능을 함께 제공합니다.
