로컬 음성 AI 이야기는 대부분 "무료"에서 멈춥니다. 저도 처음엔 그렇게 봤어요. 두 주 굴려보니 무료 여부는 옮기고 말고를 가르는 조건이 아니었습니다.
문제는 엉뚱한 데를 놓고 견준다는 겁니다. 클라우드와 로컬을 가격표로 나란히 두면 답이 뻔해 보이는데, 실제로 갈리는 건 요금이 아니라 딱 한 가지였습니다. 이 결과물을 다시 뽑을 일이 있는가.
이 글은 그 하나를 세 각도에서 재본 기록입니다. 제 환경 하나(RTX 5080 · 윈도우 11 · v0.5.1)에서 2026년 9월에 잰 값이고, 속도 쪽 결론은 장비가 다르면 달라집니다.
먼저 답 — 옮겨도 되는 쪽은 이미 정해져 있다
뽑아서 보관하고 끝나는 작업이면 옮기세요. 영상 나레이션, 오디오북, 안내 음성이 여기 들어갑니다.
같은 결과물을 회차를 돌려가며 다듬는 작업이면 남으세요. 이유는 세 번째 항목입니다.
각도 하나 — 크레딧이 없어지면 실제로 뭐가 달라지나
요금이 0이 되는 게 아니라 중간에 멈춰 서는 데가 없어지는 게 체감입니다.
제 경우 예전엔 대본을 쓰고 나서 네 단계를 더 밟았어요. 복사하고, 사이트 열고, 붙여넣고, 내려받고. 지금은 그 네 단계가 없습니다.
여기서 로컬이 유리한 조건 셋을 적습니다.
- 같은 작업을 하루에 여러 번 반복한다
- 글자 수나 호출 수 한도에 실제로 걸려본 적이 있다
- 파일 여러 개를 밀어 넣고 딴 일 하러 가야 한다
대칭으로, 클라우드가 유리한 조건 셋입니다.
- 한 달에 몇 번만 쓴다
- 내 컴퓨터를 켜둘 수 없는 시간대에 돌려야 한다
- 디스크에 20GB를 낼 여유가 없다
저는 첫 묶음이라 옮겼습니다. 세 번째 줄이 걸리는 분은 다음 항목부터 보시면 됩니다.
각도 둘 — 디스크는 안내대로 잡으면 모자란다
설치 화면에 뜨는 숫자만 보고 정리했다가 두 주 만에 다시 비웠습니다.
| 시점 | 안내 | 실제 점유 |
|---|---|---|
| 기본 설치 직후 | 17GB | 17GB |
| 받아쓰기 켠 뒤 | 미표기 | +2.9GB |
| 두 주 굴린 뒤 | — | 20GB 초과 |
표에서 눈에 걸리는 건 가운데 줄의 "미표기"입니다. 기능 목록에는 더빙과 받아쓰기가 처음부터 적혀 있는데, 그걸 켜는 순간 필요한 몫이 설치 안내에 안 잡혀 있어요. 디스크는 20GB 기준으로 잡으시는 게 안전합니다.
참고로 안 켜면 안 받습니다. 필요한 사람만 받게 해둔 구조라, 음성만 만들 거면 17GB 그대로 끝납니다.
각도 셋 — 결과가 고정되지 않는다
여기서 갈립니다.
같은 문장을 같은 설정으로 두 번 넣었더니 나온 파일이 서로 달랐습니다. 초 단위 길이도 함께 움직였어요. 회차마다 조금씩 다른 물건이 나온다고 보시면 됩니다.
그래서 이런 작업에는 부담이 됩니다. 음성만 바꿔 A/B로 견주는 일, 대본을 고쳐가며 같은 대목을 다시 뽑는 일, 검수 후 재생성이 전제인 일. 견줄 바탕이 매번 달라지니까요.
반대로 한 번 뽑고 끝나는 작업에는 걸릴 게 없습니다. 회차마다 미세하게 다른 편이 오히려 사람 목소리처럼 들리기도 하고요.
속도는 어느 쪽이 빠른가
준비가 끝난 뒤로만 보면 로컬이 빠릅니다. 10초짜리 문장 하나가 1.3초에 나오니까요.
다만 맨 처음 한 번은 예외입니다. 그때 모델을 받아옵니다.
| 구간 | 걸린 시간 |
|---|---|
| 기본 목소리, 첫 호출 | 286.59초 |
| 내 목소리, 첫 호출 | 148초 |
| 그 이후 | 0.98 ~ 2.04초 |
이 표에서 볼 곳은 첫 줄과 마지막 줄의 간격입니다. 290배예요. 자동화에 붙이신다면 맨 처음 한 번을 배치 바깥에서 미리 때려두세요. 안 그러면 배치가 첫 건에서 5분을 섭니다.
공식 소개에는 훨씬 큰 배수가 적혀 있는데, 제 장비에서는 그만큼 안 나왔습니다. 재본 구간이 다른 것 같습니다.
목소리 복제용 참조 음성의 길이와 녹음 상태
공식 안내에 참조 음성 하한이 3초로 적혀 있고, 그걸 그대로 옮긴 글도 여럿 봤습니다.
되기는 됩니다. 결과가 아쉬울 뿐이에요. 여러 번 넣어보니 5초에서 15초 구간이 낫고, 저는 12초짜리로 정착했습니다. 길이보다 크게 작용한 건 녹음 상태였어요. 노래가 깔려 있거나, 소음이 섞였거나, 두 사람이 말하면 거기서 무너집니다.
등록 자체는 눈 깜짝할 새에 끝납니다. 학습을 돌리지 않고 샘플을 보고 흉내 내는 방식이라서요. 덕분에 목소리를 하나 더 만들어 나란히 들어보는 데 부담이 없습니다.
만든 음성에는 표시가 남습니다. 귀로는 안 들리고, 기계가 만든 소리라는 흔적만 들어갑니다. 나중에 출처를 따질 일이 생기면 오히려 이쪽이 편합니다.
반대 사례도 하나 적어둡니다
여기까지 읽고 전부 옮기기로 하셨다면 그건 제가 의도한 게 아닙니다.
그래픽 메모리가 8기가에 못 미치면, 받아쓰기를 같이 돌릴 때 음성 쪽이 프로세서로 밀립니다. 멈추지는 않는데 느려져요. 이 조건에서는 위 속도 표가 그대로 적용되지 않습니다.
그리고 저는 두 주 썼습니다. 장기 운영에서 뭐가 터질지는 아직 모릅니다.
컴퓨터가 약하면 0.5.0부터 여러 대를 묶어 쓸 수 있습니다. 좋은 컴퓨터 한 대를 서버로 두고 다른 기기에서 붙는 방식이에요.
무료지만 만든 음성을 파는 건 됩니다. 걸리는 건 프로그램 자체를 손봐서 남에게 서비스로 돌릴 때예요. 그때 소스를 공개해야 합니다. 변호사 의견이 아니라 제가 읽은 조항입니다.
정리
세 각도를 접으면 하나로 모입니다. 옮기는 결정은 가격이 아니라 "이 결과물을 다시 뽑을 일이 있는가"에서 갈립니다.
다시 뽑을 일이 없으면 옮기세요. 멈춰 서는 데가 사라집니다. 다시 뽑아야 하면 남으세요. 고정된 결과는 돈으로 사는 게 맞습니다.
처음에 던진 세 각도를 하나로 접으면 이렇게 됩니다. 디스크 20GB는 한 번만 내면 되고, 5080에서 잰 1.3초도 준비가 끝난 뒤엔 유지됩니다. 그런데 이 둘을 얻는 대가가 "다시 못 뽑는다"였어요. 두 주 굴려보고 남은 건 그 대가를 낼 만한 작업인지부터 보라는 것 하나입니다.
제가 다음에 확인할 건 여러 대를 묶는 구성입니다. 약한 노트북에서 붙었을 때도 1.3초가 유지되는지가 궁금하거든요.