목소리보다 동의와 수정 기록을 파는 음성 서비스
음성 생성 비용이 낮아진 지금, 좋은 목소리 자체보다 누가 허락했고 어떤 문안을 언제 어디에 보냈는지 관리하는 서비스가 더 작고 오래가는 사업이 될 수 있다.
2026. 9. 25. 발행
녹음보다 관리가 먼저인 도구가 나왔다
구글은 2026년 9월 22일 Gemini 3.8 Flash TTS와 대량 처리용 Flash-Lite TTS를 정식 출시했다. 전자는 감정 표현과 긴 해설에, 후자는 전화 안내처럼 짧은 음성을 많이 만드는 일에 맞춰졌다.
한국어도 지원한다. 구글 문서상 Flash는 130개 이상, Lite는 100개 이상 언어를 다루며, 2026년 말까지의 요금을 환산하면 음성 1분 생성에 약 18원, 한 시간에 약 1,100원 수준이다. 실제 결제액은 환율과 세금에 따라 달라지지만, 녹음실을 빌리는 일과는 비용의 크기부터 다르다.
특정인의 목소리도 만들 수 있다. 같은 성인 화자가 읽은 10~30초 분량의 참조 음성과 정해진 동의 문구가 필요하며, 한국어 동의 문구도 제공된다. 짧은 파일 하나만 올리는 방식이 아니라 목소리 주인이 직접 허락했는지 함께 확인하는 구조다.
저장형 목소리 프로필은 한 프로젝트에 최대 200개까지 두고 1년간 보관할 수 있다. 계속 저장하지 않는 방식을 고르면 7일 동안 쓸 수 있는 암호화된 열쇠를 이용하며, 구글은 생성 음성에 사람이 듣기 어려운 표시와 출처 정보를 넣는다고 설명한다.
한국에서 음성을 특정인 인증이나 식별에 쓰면 생체정보 관련 기준도 살펴야 한다. 실제 인물 음성과 구분하기 어려운 인공지능 음성은 생성 사실 표시 대상이 될 가능성이 있으므로 구체적인 적용 여부를 확인해야 한다. 따라서 음성을 만드는 기능만 붙이는 것보다 동의 범위, 보관 기간, 삭제 요청, 생성 사실 안내를 한 흐름으로 묶는 편이 현실적이다.
안과 원장의 하루를 바꾸는 것은 목소리보다 수정 절차다
직원 열두 명인 동네 안과의원 원장이라고 해보자. 직원들은 예약 확인, 검사 전 준비, 시술 후 주의사항을 전화와 문자로 안내한다. 진료 일정이나 문구가 바뀌면 같은 내용을 여러 곳에서 다시 고친다.
녹음 안내를 쓰려면 원장이나 직원이 조용한 곳에서 다시 읽어야 한다. 한 문장만 틀려도 파일 전체를 확인하고 교체해야 하며, 예전 파일이 남아 있으면 잘못된 안내가 나갈 수 있다. 정작 어려운 일은 목소리를 내는 것이 아니라 최신 문안을 가려내는 일이다.
새 음성 기능을 붙이면 승인된 글을 바로 한국어 음성으로 바꿀 수 있다. 같은 문안을 차분한 기본 음성, 빠른 전화용 음성, 천천히 듣는 고령자용 음성으로 나눠 만들 수도 있다. 수정이 생기면 성우나 원장의 녹음 일정을 다시 잡지 않아도 된다.
여기서 모두가 원장 목소리 복제에 몰린다면 반대 자리가 생긴다. 환자가 원하는 것이 원장과 똑같은 목소리가 아니라 틀리지 않고 다시 들을 수 있는 안내라면, 비싼 복제 기능보다 문안 승인과 수정 기록이 중요해진다. 처음에는 구글이 제공하는 기본 음성으로 시작해도 된다.
첫 화면에는 ‘오늘 발송할 안내’, ‘원장 확인 대기’, ‘지난 문안과 달라진 문장’을 놓는다. 직원은 바뀐 부분만 확인하고, 원장은 승인 버튼을 누르며, 서비스는 어떤 음성이 언제 누구에게 전달됐는지 남긴다. 문제가 생겼을 때 재생 파일보다 승인된 원문을 먼저 찾을 수 있어야 한다.
사람 손에 남는 일도 분명하다. 의료 설명이 정확한지 판단하고, 환자별 예외를 처리하며, 불안해하는 환자와 직접 대화하는 일은 자동 음성이 대신할 수 없다. 발음이 어색한 약 이름과 숫자도 직원이 실제 전화기에서 들어 봐야 한다.
음질 차이가 계속 줄어든다는 전제가 맞다면 승자는 가장 사람 같은 목소리를 가진 회사가 아닐 수 있다. 동의받기, 문안 고치기, 담당자 승인, 발송 중단, 삭제 요청을 한 화면에서 끝내는 회사가 병원 업무 안에 더 깊이 남는다.
해외에서는 목소리의 권한과 사용 흐름을 함께 판다
미국 기반 ElevenLabs의 Voice Library는 성우와 창작자가 자기 목소리의 전문 복제본을 등록하고 다른 제작자가 사용하게 한다. 등록자는 본인 목소리인지 확인하는 음성 검증을 거치고, 용도와 요금, 사용 중단 전 통지 기간을 정할 수 있다.
이 서비스는 음성 생성량에 따라 이용료를 받고 일부를 목소리 주인에게 지급한다. 회사는 2026년까지 제작자에게 지급한 누적 금액이 약 300억원을 넘었다고 발표했지만, 회사 자체 수치이므로 개인별 수입을 뜻하지는 않는다. 중요한 점은 목소리를 파일이 아니라 허락 범위와 보상이 붙은 자산으로 다룬다는 것이다.
미국 광고회사 SuperBloom은 인력관리 회사 Deel의 광고를 만들 때 미국 성우 한 명의 복제 음성을 다섯 개 언어에 사용했다. 계약서에는 사용 장소와 기간을 적고, 복제된 목소리를 해당 광고회사 계정에서만 쓰도록 제한했다.
문구 수정은 재녹음 없이 처리했지만 모든 언어를 자동 음성으로 밀어붙이지는 않았다. 억양이 특히 중요한 언어에서는 원어민 성우로 바꿨고, Deel은 뒤이어 2026년용 캠페인을 다시 맡겼다. 자동 생성과 사람 녹음을 상황별로 나눈 사례다.
과테말라의 Museo Miraflores는 Musa와 함께 태블릿 대여 대신 방문객 휴대전화에서 여는 음성 가이드를 시험했다. 관람객은 약 2,800원을 내고 해설을 들으며 후속 질문도 할 수 있었다.
공급사 사례에 따르면 4주 동안 200명 이상이 사용했고, 이전 안내보다 이용률이 다섯 배였으며 평균 이용 시간은 40분을 넘었다. 시험 시작부터 유료 상설 운영까지 8주가 걸렸고, 문안 수정 30건 이상을 재녹음 없이 반영했다. 자체 사례 수치이지만 작은 문화시설이 어디서 시작할 수 있는지는 보여 준다.
지금 작게 만들어 볼 네 가지
1. 병원 음성 안내 검수함
- 무엇을 하나: 예약, 검사 준비, 시술 후 주의 문안을 음성으로 만들고 승인·발송·수정 기록을 남긴다.
- 누가 쓰나: 전화 안내가 많지만 별도 녹음 담당자가 없는 동네 안과나 건강검진 의원이 쓴다.
- 왜 지금인가: 한국어 음성을 낮은 비용으로 다시 만들 수 있어 녹음보다 검수 절차에 집중할 수 있다.
- 첫 화면: 오늘 보낼 안내와 원장 승인 대기 문안, 어제 이후 바뀐 문장을 나란히 놓는다.
2. 전시 교체가 쉬운 음성 해설 편집기
- 무엇을 하나: 전시 설명을 입력하면 지점별 음성 해설과 휴대전화용 접속 코드를 만든다.
- 누가 쓰나: 학예사 한 명이 전시 기획과 안내 수정을 함께 맡는 사립박물관이나 지역 기념관이 쓴다.
- 왜 지금인가: 문장 하나를 고치려고 성우 녹음과 기기 파일 교체를 반복하지 않아도 된다.
- 첫 화면: 전시장 순서대로 해설 지점을 보여 주고, 오래됐거나 아직 승인되지 않은 문안을 표시한다.
3. 고령 입주민용 전화 공지
- 무엇을 하나: 아파트 공지를 천천히 읽어 주고 숫자 버튼으로 다시 듣기나 직원 연결을 선택하게 한다.
- 누가 쓰나: 문자 공지를 읽기 어렵다는 문의를 자주 받는 아파트 관리사무소가 쓴다.
- 왜 지금인가: 많은 짧은 통화를 동시에 처리하는 가벼운 음성 기능을 쓸 수 있게 됐다.
- 첫 화면: 오늘 공지와 수신 대상, 다시 듣기 횟수, 직원 연결이 필요한 가구를 보여 준다.
4. 강사 목소리 사용 허락 장부
- 무엇을 하나: 강사의 복제 음성을 어디서 언제까지 쓸 수 있는지 기록하고 만료되면 생성을 막는다.
- 누가 쓰나: 대표 강사의 결석 안내와 복습 자료를 여러 지점에서 쓰려는 학원 운영자가 쓴다.
- 왜 지금인가: 복제 자체가 쉬워진 만큼 포괄 동의 한 번으로 여러 용도에 쓰는 위험도 커졌다.
- 첫 화면: 등록된 목소리마다 허용 매체, 종료일, 금지 주제, 삭제 요청 상태를 보여 준다.
오늘 30분 안에 확인할 한 가지
동네 의원 세 곳에 전화해 “지난 일주일 동안 다시 녹음하거나 고쳐 전달한 안내문이 있었는지, 수정 전 문안은 어디에 남는지” 물어본다. 세 곳 중 두 곳이 일주일에 두 번 이상 문안을 고치고 승인 기록을 찾기 어렵다고 답하면, 목소리 복제보다 ‘안내 검수함’ 화면부터 만들어 볼 만하다.
출처
참고한 글 8개
이 글에 쓴 사실은 아래에서 왔습니다. 직접 확인해 보세요.
- Gemini API 변경 이력GoogleGemini 3.8 Flash TTS와 Flash-Lite TTS의 정식 출시일 확인에 사용했다.https://ai.google.dev/gemini-api/docs/changelog
- Gemini 3.8 Text-to-Speech 출시 발표Google두 모델의 용도, 음성 설계, 복제 동의, 워터마크 설명에 사용했다.https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
- Gemini 3.8 Flash TTS 모델 문서Google한국어를 포함한 지원 언어와 모델 특성 확인에 사용했다.https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts?authuser=31&hl=ko
- Gemini 개발자용 가격표Google음성 생성 비용과 2026년 말까지 적용되는 출시 요금 확인에 사용했다.https://ai.google.dev/gemini-api/docs/pricing?hl=ko
- Gemini 음성 복제 문서Google참조 음성 길이, 한국어 동의 문구, 저장 수량과 보관 기간 확인에 사용했다.https://ai.google.dev/gemini-api/docs/voice-replication
- 개인정보의 안전성 확보조치 기준국가법령정보센터음성을 개인 인증·식별에 이용할 때 생체정보 기준을 검토해야 한다는 설명에 사용했다.https://law.go.kr/flDownload.do?flSeq=133609911
- 인공지능 발전과 신뢰 기반 조성 등에 관한 기본법국가법령정보센터인공지능으로 생성된 음향의 고지·표시 관련 설명에 사용했다.https://www.law.go.kr/LSW/lsInfoP.do?lsiSeq=268543&utm_source=openai
- Professional Voice CloningElevenLabs전문 음성 등록자의 본인 확인과 사용 통제 구조 설명에 사용했다.https://elevenlabs.io/docs/eleven-creative/voices/voice-cloning/professional-voice-cloning?utm_source=openai