구글 ‘Gemini 3.8 Live’ 공개…말하는 동안 추론·도구 호출을 이어간다
구글이 실시간 음성 에이전트용 Gemini 3.8 Live와 Extended Thinking을 정식 공개했습니다. 기본형은 낮은 지연과 대규모 운영, 확장 추론형은 복잡한 다단계 작업에 초점을 맞춥니다. 97개 언어 전환, 카메라 화면 이해, 대화 중 비동기 함수 호출을 지원하며 입력 100만 오디오 토큰당 5달러, 출력은 18달러로 제시됐습니다. 다만 새 프로토콜에서는 응답 종료가 작업 종료를 뜻하지 않아 서비스 상태 관리와 개인정보 보호를 함께 다시 설계해야 합니다.
속도형과 추론형, 실시간 음성을 두 갈래로
구글은 9월 15일 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 공개했습니다. 둘 다 음성을 글자로 옮긴 뒤 다시 읽는 단계를 줄인 실시간 오디오 모델이지만 목표가 다릅니다. 기본형은 고객센터·교육·게임 캐릭터처럼 빠른 응답과 동시 접속 규모가 중요한 서비스에, 확장 추론형은 계획·비교·다단계 실행이 필요한 업무에 맞췄습니다.
구글이 공개한 평가에서 Extended Thinking은 Speech-to-Speech Quality Index 82.6, 도구를 사용하는 음성 과제인 τ-Voice 68.6을 기록했습니다. 수치는 회사가 선택한 설정과 벤치마크 결과이므로 실제 한국어 전화망, 소음, 전문 용어 환경의 품질을 보장하지 않습니다. 도입 전에는 대상 업무의 성공률과 지연, 중단 처리 능력을 별도로 시험해야 합니다.
말을 멈추지 않고 백그라운드 작업
가장 큰 변화는 비동기 함수 호출입니다. 기존 음성봇은 일정 검색이나 결제 확인을 위해 외부 시스템을 부르면 대화가 멈추기 쉬웠습니다. 새 모델은 도구 요청을 백그라운드로 보내고 사용자가 질문을 더 하거나 정보를 고치는 동안 대화를 이어갈 수 있습니다. 카메라 화면도 거의 실시간으로 받아 제품, 문서, 게임 화면을 보며 설명하는 흐름을 구성할 수 있습니다.
대신 개발자가 관리할 상태가 늘어납니다. 모델 문서에 따르면 `turnComplete`는 더 이상 전체 작업의 유휴 상태를 뜻하지 않습니다. 도구가 `IN_PROGRESS`인지 `IDLE`인지 별도 신호를 확인해야 합니다. 사용자가 전화를 끊거나 예약을 취소했는데 백그라운드 작업이 계속되는 사고를 막으려면 세션 종료, 중복 실행, 보상 거래와 감사 로그를 명시적으로 설계해야 합니다.
97개 언어와 숫자 정확도, 화면까지 함께 본다
두 모델은 대화 도중 97개 언어를 자동으로 바꿀 수 있고, 전화번호·주소·상품 코드처럼 한 글자 차이가 큰 영숫자 표현을 강화했습니다. 음성과 함께 텍스트, 이미지, 영상도 입력할 수 있어 이용자가 카메라로 기기 상태를 보여 주면 화면에 근거해 안내하는 지원 서비스나 언어 학습, 접근성 도구로 확장할 수 있습니다.
확장 추론형의 문맥 창은 입력 13만1072토큰, 출력 6만5536토큰이며 생각 수준을 낮음·중간·높음으로 조절합니다. 긴 문맥이 곧 정확성을 의미하지는 않습니다. 고객이 보여 준 화면과 음성에는 얼굴, 주소, 계정 번호가 함께 들어갈 수 있으므로 필요한 프레임만 전송하고 저장 기간과 상담원 열람 범위를 줄이는 원칙이 먼저 필요합니다.
분당 비용보다 완료 비용을 계산해야
개발자용 가격은 오디오 입력 100만 토큰당 5달러, 출력 18달러로 제시됐으며 구글은 각각 대략 분당 0.005달러와 0.018달러라고 설명합니다. 짧은 안내에는 낮아 보이지만 카메라 영상, 외부 도구 호출, 긴 추론, 재시도가 더해지면 한 건의 완료 비용은 달라집니다. 빠른 기본형과 추론형을 업무 난도에 따라 나누는 라우팅이 중요합니다.
서비스 운영자는 평균 대화 시간만 보지 말고 첫 시도 해결률, 상담원 전환율, 잘못 실행한 작업의 복구 비용을 함께 측정해야 합니다. 단순 배송 조회에 고비용 추론을 쓰거나, 반대로 금융·의료처럼 확인이 필요한 업무를 속도형에 맡기면 토큰 절감보다 오류 비용이 커질 수 있습니다. 모델 선택은 음질 경쟁이 아니라 업무 위험 분류의 문제입니다.
음성 워터마크와 사람에게 넘기는 기준
구글은 생성 음성에 SynthID 워터마크를 넣는다고 밝혔습니다. 생성 사실 추적에는 도움이 되지만 전화 녹음의 압축·편집 뒤에도 탐지되는지, 외부 플랫폼이 이를 읽고 표시하는지는 별도 문제입니다. 이용자에게 AI와 대화 중임을 시작 단계에서 알리고, 본인 확인·결제·위기 상황에서는 사람에게 즉시 넘기는 기준이 필요합니다.
이번 공개의 핵심은 음성 AI가 질문에 한 번 답하는 인터페이스에서, 말하면서 계획하고 외부 시스템을 움직이는 실행 계층으로 이동했다는 점입니다. 개발팀은 자연스러운 말투보다 취소 가능성, 도구 권한, 상태 표시, 데이터 최소 수집을 먼저 검증해야 합니다. 목소리가 매끄러워질수록 사용자는 기계의 한계를 더 쉽게 잊기 때문입니다.
기사가 마음에 드셨다면 하트를 눌러주세요.
기사 읽고, 잠깐 게임 한 판 어떠세요?

입체적인 캐릭터 체스 말로 즐기는 AI 대국
미니게임 고르기 ▶