Meta, 시간당 $0.18 Muse Voice Transcribe 공개…20명 이상 실시간 화자 분리로 엔터프라이즈 음성 AI 시장 공략

편집자 요약
Meta가 Meta Superintelligence Labs에서 개발한 Muse Voice Transcribe를 공개하며 실시간 speech-to-text 시장에 진입했습니다. 이 모델은 스트리밍 전사, endpoint detection, 20명 이상 화자 분리를 단일 API로 제공하고, 처리 오디오 기준 시간당 $0.18의 공격적인 가격을 제시합니다. 70개 이상 언어로 학습됐으며 초기 출시에서는 25개 언어가 중점 검증됐고, 장시간 오디오와 다국어 code-switching도 지원합니다.
인사이트
Muse의 20명 이상 화자 분리 자체는 Speechmatics나 Amazon Transcribe의 공개 상한을 넘는 수준은 아니지만, 저지연 전사와 다국어 처리, endpointing, 가격을 한 모델에 결합한 점이 차별화 요소입니다. 회의 요약, 콜센터 분석, live assistant, ambient AI를 구축하는 기업에는 별도 후처리 파이프라인을 줄이는 통합 음성 스택이 비용과 개발 복잡도를 낮추는 계기가 될 수 있습니다.
댓글
토론
> geekhaus:~$ 다음 읽을거리?


