짙은 하늘색 배경 위에 분홍색 쉼표 모양 기호 수십 개가 흩날리듯 그려진 Microsoft AI 발표문의 대표 이미지. 왼쪽의 기호는 크고 오른쪽으로 갈수록 작아진다.

Our first streaming transcription model debuts at no. 1 on Artificial Analysis

Microsoft AI가 첫 스트리밍 음성 인식 모델 MAI-Transcribe-2-Streaming과 음성 합성 모델 MAI-Voice-2.1, MAI-Voice-2.1-Flash를 공개했다. 전사 모델은 Artificial Analysis 스트리밍 순위표의 38개 모델 중 오류율 2.51%로 1위이고, 발화가 끝난 뒤 0.13초 만에 최종 전사를 내놓는다.

October 3, 2026 · 7 분 · 서소영
하늘색 그라데이션 배경 가운데에 'Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS'라는 문구가 적혀 있고, 그 아래에 Gemini의 네 꼭짓점 별 로고가 있는 구글 공식 발표 이미지

Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS

구글이 텍스트를 음성으로 바꾸는 모델 두 종을 공개했다. 3.8 Flash TTS로는 목소리를 새로 설계하고 대사마다 연기를 지시할 수 있고, 3.8 Flash-Lite TTS는 대량 생산을 위해 단가를 낮췄다. 발표문과 모델 카드, 평가 방법론 문서, API 문서와 가격표로 확인한 내용을 정리했다.

September 24, 2026 · 8 분 · 서소영