Speech-to-speech와 STT→TTS 방식은 어떻게 다른가요?
Speech-to-speech는 음성 입력과 음성 응답을 실시간 세션에서 다룹니다. STT→TTS 방식은 중간에 텍스트가 남아 답변을 확인·수정하거나 각 모델을 교체하기 쉽습니다.
Speech-to-speech와 STT→TTS의 차이부터 OpenAI·Google·ElevenLabs의 한국어 음성을 비교할 때 확인할 점까지
한국어 AI 음성을 고를 때 먼저 따질 것은 ‘잘 말하는가’보다 ‘무엇을 해야 하는가’다. 대화 상대가 말을 끊으면 즉시 반응해야 하는 서비스와 정해진 대본을 정확히 읽어야 하는 영상은 출발점이 다르다. 클코단에서도 직접 음성을 처리하는 방식과 STT→TTS 방식의 차이, 자연스러운 한국어 목소리를 어디서 찾을지가 함께 논의됐다.
STT→언어 모델→TTS 파이프라인은 사용자의 말을 문자로 바꾸고 답변 문장을 만든 뒤 다시 음성으로 합성한다. 중간 문장을 검사하거나 고치기 쉽고, 각 단계를 다른 업체의 모델로 교체할 수도 있다. 반면 speech-to-speech 방식의 Realtime API는 한 세션에서 입력 음성을 해석하고 음성으로 답하며 끼어들기까지 처리한다. OpenAI는 단계별 제어가 중요한 작업에는 체인 방식을, 음성 대화와 도구 사용을 한 세션에서 다룰 때는 Realtime 방식을 제시한다. (developers.openai.com)
실시간이라는 이름이 반드시 직접 음성 처리만을 뜻하지는 않는다. STT와 TTS를 이어 붙여도 각 단계의 결과를 스트리밍하면 대기 시간을 줄일 수 있다. 대신 발화가 잘못 인식됐는지, 답변 생성이 늦는지, 합성 음성이 부자연스러운지 따로 확인해야 한다. 고객 응대처럼 답변 문구를 기록·수정해야 한다면 이처럼 단계를 나눠 확인할 수 있는 점이 오히려 장점이다. (developers.openai.com)
완성된 한국어 대본을 영상에 붙일 때는 입력 음성이 없으므로 STT도 speech-to-speech도 필요 없다. 비교할 것은 TTS 모델과 목소리다. Google 역시 정해진 문장을 읽는 TTS와 자유로운 실시간 대화를 위한 Live API를 다른 용도로 설명한다. (ai.google.dev)
방에서는 GPT TTS의 한국어 발화가 기대만큼 자연스럽지 않았다는 의견이 나왔다. 다만 특정 모델·목소리·대본을 같은 조건에서 비교한 결과는 아니므로 제품 전체의 품질 판정으로 옮길 수 없다. OpenAI 공식 문서는 TTS 지원 언어에 한국어를 포함하면서도 제공 음성은 현재 영어에 맞춰 최적화됐다고 명시한다. 한국어 지원 여부와 한국어 화자의 귀에 자연스러운지는 다른 질문이다. (developers.openai.com)
OpenAI의 gpt-4o-mini-tts는 텍스트를 음성으로 만드는 모델이다. 같은 업체의 실시간 음성 모델을 써보고 받은 인상으로 이 TTS 모델까지 평가해서는 안 된다. 짧은 안내문이라면 숫자, 영문 상표, 조사와 문장 끝 억양이 섞인 실제 문구를 들어봐야 한다. ‘안녕하세요’ 한 문장이 매끄럽다고 서비스의 모든 한국어 문장이 매끄러운 것은 아니다. (developers.openai.com)

ElevenLabs는 한국어를 지원한다. 하지만 지원 목록에 있다는 사실만으로 모든 목소리의 한국어 억양이 자연스럽다고 보장할 수는 없다. 업체 설명에 따르면 발음과 억양에는 선택한 목소리의 영향이 크다. Eleven Multilingual v2는 긴 음성의 안정성을, Eleven v4는 표현력을, v4 Turbo는 낮은 지연 시간을 앞세운다. 한국어 내레이션이라면 모델뿐 아니라 한국어에 어울리는 목소리도 골라야 한다. (elevenlabs.io)
Google AI Studio에서 TTS를 써봤다는 외부 참고 자료에는 Gemini 3.1 Flash TTS 사용 경험이 담겼다. 그러나 Google의 2026년 9월 출시 안내는 새 작업에 Gemini 3.8 Flash TTS 또는 3.8 Flash-Lite TTS를 사용하도록 안내한다. 두 모델 모두 한국어를 지원한다. Google은 전자를 표현력과 긴 대본에, 후자를 처리량과 비용 효율이 중요한 작업에 배치한다. 예전 체험담의 모델 이름을 현재 선택지로 그대로 옮기면 비교 출발점부터 달라진다. (ai.google.dev)
표현력만 높인다고 해결되는 것도 아니다. 짧은 음성은 생동감이 있어도 여러 조각을 이어 붙이면 목소리의 세기나 말투가 달라져 거슬린다는 사용 경험이 있다. 긴 영상에서 같은 화자가 계속 말해야 한다면 가장 마음에 든 한 문장보다 서로 떨어진 대본 구간을 연달아 생성해 일관성을 들어보는 편이 낫다. (elevenlabs.io)
ElevenLabs의 TTS API 가격표는 모델별 입력 문자 1,000자 기준으로 제시된다. Google Gemini TTS는 입력 텍스트와 출력 오디오 토큰을 구분해 과금한다. 실시간 대화에서는 듣는 음성과 내보내는 음성, 세션이 유지되는 방식까지 비용에 영향을 준다. 서로 다른 단위의 가격표에서 숫자 하나만 떼어 ‘가장 싼 모델’을 고를 수 없는 이유다. (elevenlabs.io)
특히 Google의 Live API는 대화가 이어질 때 기존 맥락을 다시 처리해 턴당 비용이 커질 수 있다고 설명한다. ElevenLabs는 API 가격표에 단기 할인도 표시하고 있다. 오래 운영할 서비스라면 할인 가격만으로 예산을 짜지 말아야 한다. 개인 개발자나 작은 팀에는 ‘대본 1,000자당 재생 가능한 결과물 비용’과 ‘완료된 대화 1건당 비용’이 각각 더 쓸모 있는 기준이다. (ai.google.dev)
내레이션을 비교할 때는 실제 사용할 대본에서 짧은 안내, 긴 설명, 숫자·영문 혼용, 감정이 필요한 문장을 뽑는다. 같은 문장을 OpenAI TTS, ElevenLabs, Gemini TTS에 넣고 목소리와 모델명을 기록한다. 처음 생성한 결과뿐 아니라 고쳐 쓴 문장을 다시 만들었을 때의 발음, 문장 연결, 제작 비용까지 살펴야 한다. 목소리를 바꿔가며 나온 최고 결과 한 개만 비교하면 재현하기 어려운 선택이 된다. (developers.openai.com)
대화형 서비스라면 동일한 질문을 마이크로 넣고 응답 시작 시간, 중간에 말을 끊었을 때의 처리, 잘못 들은 고유명사의 수정 경로를 기록한다. 체인 방식에서는 STT 기록과 최종 대답 문장을 따로 검토할 수 있다. 직접 음성 처리 방식에서는 실제 대화가 얼마나 자연스럽게 이어지는지가 핵심이다. 한국어 AI 음성의 선택은 단일 품질 순위가 아니라 고정 대본의 발음과 일관성을 살 것인지, 끊김 없는 대화 경험을 살 것인지에서 갈린다. (developers.openai.com)
Speech-to-speech는 음성 입력과 음성 응답을 실시간 세션에서 다룹니다. STT→TTS 방식은 중간에 텍스트가 남아 답변을 확인·수정하거나 각 모델을 교체하기 쉽습니다.
공식 지원 언어에 한국어가 포함됩니다. 다만 OpenAI는 제공 음성이 영어에 최적화됐다고 밝혀, 실제 한국어 대본으로 발음과 억양을 확인해야 합니다.
두 업체 모두 한국어를 지원하지만, 어느 쪽이 더 자연스러운지는 목소리와 대본에 따라 달라집니다. 같은 문장으로 발음, 긴 구간의 일관성, 재생성 비용을 비교하는 편이 정확합니다.