블로그 목록
IT 뉴스 & 트렌드

DeepMind, 음성 인식 모델 Gemini 3.5 Transcribe 공개

DeepMind가 8월 26일 공개한 Gemini 3.5 Transcribe는 스트리밍 WER 4.0%, 비스트리밍 2.6%로 Chirp 3보다 단어 오류율과 응답 속도가 개선된 음성 인식 모델이다. 실시간 Live API와 사후 녹음 Interactions API 두 가지로 제공되며, 85개 이상 언어, 커스텀 단어장, 최대 3명 화자 분리를 지원한다.

2026년 8월 27일 5분 읽기

왜 지금 음성 인식이 다시 주목받나

음성 인터페이스가 스마트폰을 넘어 데스크톱과 웹까지 확장하면서 정확한 텍스트 변환이 다시 중요해졌어요. 기존 음성 인식 모델은 배경 소음, 전문 용어, 말끝맺음 불필요 단어 등에서 오류가 쌓이곤 했어요. DeepMind가 8월 26일 공개한 Gemini 3.5 Transcribe는 이 문제를 API 수준에서 다르게 풀어냈어요.

DeepMind, Gemini 3.5 Transcribe를 공개했어요

DeepMind는 Gemini 3.5 Transcribe를 자사 음성 인식 라인의 최신 모델로 소개했어요. 이전 모델 Chirp 3 대비 단어 오류율과 응답 속도에서 명확한 개선을 보이는 게 특징이에요. 현재 Google AI Studio와 Gemini Enterprise Agent Platform에서 공개 미리보기로 사용할 수 있고, macOS용 Gemini 앱과 Android Gboard Rambler 기능에도 이미 적용됐어요.

핵심 성능과 수치

Artificial Analysis 기준으로 스트리밍 API에서 평균 WER 4.0%, 사전 녹음 오디오 처리 API에서 2.6%를 기록했어요. 이전 모델 Chirp 3보다 최종 텍스트 생성까지 걸린 시간이 70% 빨라졌다고 DeepMind는 밝혔어요.

다중 언어 벤치마크 FLEURS에서는 스트리밍 5.50%, 비스트리밍 5.04% WER를 보였어요. 85개 이상의 언어를 자동 감지해 지역 억양과 방언을 함께 처리할 수 있고, 우편번호나 주문 ID처럼 영문자와 숫자가 섞인 엔티티도 정확히 잡아내요. 화자 분리 기능은 최대 3명까지 정확히 구분하고, 3명 이상은 실험 단계예요.

두 가지 API, 용도에 따라 골라 쓰세요

Gemini 3.5 Transcribe는 용도별로 두 API로 나뉘어요. gemini-3.5-transcribe-live는 실시간 양방향 스트리밍을 지원해 1초 미만 지연 시간의 음성 인터랙티브 앱에 맞춰요. gemini-3.5-transcribe는 녹음 오디오 파일, 회의, 통화 기록 등을 처리하며 단어 단위 타임스탬프와 화자 속성까지 제공해요. 두 API 모두 커스텀 단어장을 지원해 도메인 전문 용어나 고유 표기를 직접 등록하면 변환 정확도가 올라가요.

실제 제품 속 적용 사례

Gboard의 Rambler 기능은 spoken thoughts를 정형 텍스트로 바꾸면서 filler words를 자동으로 제거해요. 사용자가 목소리로 철자를 고치거나 문체를 바꾸는 것도 가능해요. Antigravity는 사용자의 허락 하에 화면 맥락과 채팅 기록을 함께 보고 파일 이름, 문서 내용까지 정확히 받아적어요.

macOS용 Gemini 앱은 음성만으로 로컬 파일 요약, 앱 간 텍스트 재배치, 이미지 생성을 호출하는 function calling을 지원해요. Chrome에서도 곧 웹 입력 필드에 음성 입력이 들어올 예정이라고 밝혔어요.

개발자 접근성과 현재 한계

개발자는 Google AI Studio의 Build 모드에서 gemini-3.5-transcribe-live를 직접 호출해 프로토타입을 만들 수 있고, 엔터프라이즈 환경은 Gemini Enterprise Agent Platform과 곧 출시될 Gemini Enterprise for Customer Experience에서 제공돼요.

다만 function calling 기능은 아직 macOS Gemini 앱에서만 확인됐고, 3명 이상 화자 분리는 실험 단계라는 점은 실제 서비스에 반영할 때 고려해야 해요. Agora, LiveKit, LangChain, Vercel 같은 개발자 플랫폼이 이미 Live API 기반 통합을 공개했으니 직접 써보기는 쉬운 편이에요.

정리

Gemini 3.5 Transcribe는 WER과 응답 속도에서 Chirp 3보다 분명히 앞서는 모델이에요. 실시간 스트리밍과 사후 녹음 처리라는 두 API 구성이 개발 워크플로에 맞게 설계됐고, 85개 이상 언어와 커스텀 단어장 지원으로 실무 적용 폭도 넓어요. 음성 기반 인터페이스를 만들 계획이 있다면 Google AI Studio에서 공개 미리보기를 먼저 확인해볼 만해요.

#DeepMind#Gemini 3.5 Transcribe#음성 인식#AI 뉴스#Google AI Studio
Robeedau

발행 전 운영자가 직접 큐레이션·검수·편집합니다.