
구글이 실시간 음성 대화에 특화된 신규 모델 ‘제미니 3.8 라이브’와 ‘제미니 3.8 라이브 익스텐디드 씽킹’을 공개했습니다. 음성 인식과 텍스트 이해, 음성 합성을 하나의 모델에서 처리하는 완전 멀티모달 구조가 특징입니다.
말하면서 생각하는 비동기 처리
기존 음성 비서는 데이터베이스 조회 같은 작업을 실행하는 동안 대화가 멈췄습니다. 제미니 3.8 라이브는 비동기 함수 호출을 지원해 도구를 실행하면서도 자연스럽게 말을 이어갑니다. 사용자가 문장 중간에 끼어들면 즉시 멈추고 새로운 방향에 맞춰 대화를 이어가는 배리지 인 기능도 갖췄습니다.
카메라 보고 바로 대화
실시간 영상 그라운딩 기능을 통해 스마트폰 카메라로 물체, 문서, 손그림을 비추면서 그 내용에 대해 즉시 대화할 수 있습니다. 97개 이상 언어를 지원하고 대화 중간에도 언어를 자동으로 전환합니다. 확인 코드나 시리얼 번호 같은 영문과 숫자 조합을 정확하게 읽어내도록 최적화됐습니다.
성능과 가격
첫 발화까지 약 1.18초의 낮은 지연 시간을 기록했고, 익스텐디드 씽킹 모델은 음성 대화 품질 지수 82.6점으로 업계 1위를 달성했습니다. 개발자 가격은 오디오 입력 분당 0.005달러, 출력 분당 0.018달러입니다. 제미니 라이브 API와 구글 AI 스튜디오, 제미니 앱을 통해 이용할 수 있습니다.
업계에 미치는 영향
음성 기반 AI 에이전트 시장이 본격 열리는 가운데 구글이 가격과 지연 시간에서 공격적인 카드를 꺼냈습니다. 콜센터 자동화, 실시간 통역, 음성 비서 서비스 개발 진입 장벽이 크게 낮아질 전망입니다.
자주 묻는 질문
제미니 3.8 라이브는 어디서 쓸 수 있나요?
제미니 라이브 API, 구글 AI 스튜디오, 구글 워크스페이스, 제미니 앱에서 이용할 수 있습니다.
기존 음성 비서와 무엇이 다른가요?
음성 인식과 이해, 발화를 하나의 모델이 처리하고 도구 실행 중에도 대화가 멈추지 않는 비동기 처리가 핵심 차이입니다.
한국어도 지원하나요?
97개 이상 언어를 지원하며 한국어도 포함됩니다. 대화 중간 언어 전환도 가능합니다.
비용은 얼마인가요?
개발자 기준 오디오 입력 분당 0.005달러, 출력 분당 0.018달러입니다.
개인정보나 저작권 우려는 없나요?
모든 합성 음성에 신스ID 오디오 워터마크가 적용되어 AI 생성 음성 추적이 가능합니다.
