DeepMind, 음성 인식 모델 Gemini 3.5 Transcribe 공개
DeepMind가 8월 26일 공개한 Gemini 3.5 Transcribe는 스트리밍 WER 4.0%, 비스트리밍 2.6%로 Chirp 3보다 단어 오류율과 응답 속도가 개선된 음성 인식 모델이다. 실시간 Live API와 사후 녹음 Interactions API 두 가지로 제공되며, 85개 이상 언어, 커스텀 단어장, 최대 3명 화자 분리를 지원한다.
왜 지금 음성 인식이 다시 주목받나
음성 인터페이스가 스마트폰을 넘어 데스크톱과 웹까지 확장하면서 정확한 텍스트 변환이 다시 중요해졌어요. 기존 음성 인식 모델은 배경 소음, 전문 용어, 말끝맺음 불필요 단어 등에서 오류가 쌓이곤 했어요. DeepMind가 8월 26일 공개한 Gemini 3.5 Transcribe는 이 문제를 API 수준에서 다르게 풀어냈어요.
DeepMind, Gemini 3.5 Transcribe를 공개했어요
DeepMind는 Gemini 3.5 Transcribe를 자사 음성 인식 라인의 최신 모델로 소개했어요. 이전 모델 Chirp 3 대비 단어 오류율과 응답 속도에서 명확한 개선을 보이는 게 특징이에요. 현재 Google AI Studio와 Gemini Enterprise Agent Platform에서 공개 미리보기로 사용할 수 있고, macOS용 Gemini 앱과 Android Gboard Rambler 기능에도 이미 적용됐어요.
핵심 성능과 수치
Artificial Analysis 기준으로 스트리밍 API에서 평균 WER 4.0%, 사전 녹음 오디오 처리 API에서 2.6%를 기록했어요. 이전 모델 Chirp 3보다 최종 텍스트 생성까지 걸린 시간이 70% 빨라졌다고 DeepMind는 밝혔어요.
다중 언어 벤치마크 FLEURS에서는 스트리밍 5.50%, 비스트리밍 5.04% WER를 보였어요. 85개 이상의 언어를 자동 감지해 지역 억양과 방언을 함께 처리할 수 있고, 우편번호나 주문 ID처럼 영문자와 숫자가 섞인 엔티티도 정확히 잡아내요. 화자 분리 기능은 최대 3명까지 정확히 구분하고, 3명 이상은 실험 단계예요.
두 가지 API, 용도에 따라 골라 쓰세요
Gemini 3.5 Transcribe는 용도별로 두 API로 나뉘어요. gemini-3.5-transcribe-live는 실시간 양방향 스트리밍을 지원해 1초 미만 지연 시간의 음성 인터랙티브 앱에 맞춰요. gemini-3.5-transcribe는 녹음 오디오 파일, 회의, 통화 기록 등을 처리하며 단어 단위 타임스탬프와 화자 속성까지 제공해요. 두 API 모두 커스텀 단어장을 지원해 도메인 전문 용어나 고유 표기를 직접 등록하면 변환 정확도가 올라가요.
실제 제품 속 적용 사례
Gboard의 Rambler 기능은 spoken thoughts를 정형 텍스트로 바꾸면서 filler words를 자동으로 제거해요. 사용자가 목소리로 철자를 고치거나 문체를 바꾸는 것도 가능해요. Antigravity는 사용자의 허락 하에 화면 맥락과 채팅 기록을 함께 보고 파일 이름, 문서 내용까지 정확히 받아적어요.
macOS용 Gemini 앱은 음성만으로 로컬 파일 요약, 앱 간 텍스트 재배치, 이미지 생성을 호출하는 function calling을 지원해요. Chrome에서도 곧 웹 입력 필드에 음성 입력이 들어올 예정이라고 밝혔어요.
개발자 접근성과 현재 한계
개발자는 Google AI Studio의 Build 모드에서 gemini-3.5-transcribe-live를 직접 호출해 프로토타입을 만들 수 있고, 엔터프라이즈 환경은 Gemini Enterprise Agent Platform과 곧 출시될 Gemini Enterprise for Customer Experience에서 제공돼요.
다만 function calling 기능은 아직 macOS Gemini 앱에서만 확인됐고, 3명 이상 화자 분리는 실험 단계라는 점은 실제 서비스에 반영할 때 고려해야 해요. Agora, LiveKit, LangChain, Vercel 같은 개발자 플랫폼이 이미 Live API 기반 통합을 공개했으니 직접 써보기는 쉬운 편이에요.
정리
Gemini 3.5 Transcribe는 WER과 응답 속도에서 Chirp 3보다 분명히 앞서는 모델이에요. 실시간 스트리밍과 사후 녹음 처리라는 두 API 구성이 개발 워크플로에 맞게 설계됐고, 85개 이상 언어와 커스텀 단어장 지원으로 실무 적용 폭도 넓어요. 음성 기반 인터페이스를 만들 계획이 있다면 Google AI Studio에서 공개 미리보기를 먼저 확인해볼 만해요.
관련 글
ChatGPT 광고, 출시 200일 만에 연 10억 달러 매출 기록
OpenAI가 ChatGPT Ads의 연간 매출 추이를 10억 달러로 밝히고 인도·유럽·중동·북아프리카에서 셀프서비스 광고를 확대했다. 무료 티어를 유지하려면 광고가 필수인데, 실제로 그 모델이 성장 궤도에 올랐다는 점에서 AI 산업의 수익 구조가 바뀌고 있음을 확인할 수 있다.
OpenAI, 태국 AI 스타트업 10곳과 8주 액셀러레이터를 시작한다
OpenAI가 태국 MHESI와 8주 액셀러레이터를 시작해 의료·웰니스·교육 AI 스타트업 10곳을 선발했다. 참가 팀每人에 2,000달러 API 크레딧과 전용 멘토가 배정되고, 11월 방콕 Demo Day로 프로그램이 마무리된다.
구글, 제미니 노트북에 '엑스퍼트 인텔리전스' 론칭
구글이 8월 27일 제미니 노트북에 엑스퍼트 인텔리전스를 도입해, 사용자가 Google Play Books에서 구매한 전자책과 저자·출판사·전문가 콘텐츠를 직접 연결해 질의하고 활용할 수 있게 됐다. 10만 권 이상의 도서로 시작하며, 향후 구독 뉴스레터·보고서 등으로 확장될 예정이다.
발행 전 운영자가 직접 큐레이션·검수·편집합니다.