대화형 AI 지연 시간이란 무엇이며, 무엇이 영향을 미치나요?
- 게시일
- 최종 업데이트
대화형 AI에서 지연 시간은 좋은 애플리케이션과 뛰어난 애플리케이션을 가르는 요소입니다.
대화형 AI는 본질적으로 지향점이 높은 기술입니다. 사람과 대화할 때의 느낌을 재현하고, 감정의 폭과 음높이, 말의 리듬까지 닮아가고자 합니다. 여기에 말을 멈춘 순간부터 AI 에이전트가 응답을 시작할 때까지의 ‘자연스러운’ 지연 시간을 더하면, 실제 인간의 소통 방식에 기반한 지연 시간 목표가 만들어집니다.
대화형 AI 에이전트를 대규모로 도입하려는 기업이라면 자연스러운 경험을 구현하기 위해 지연 시간을 최대한 줄여야 합니다. 이 글에서는 대화형 AI 지연 시간이 무엇인지, 전체 파이프라인에서 지연이 발생하는 원인과 이를 줄이는 방법을 개괄적으로 살펴봅니다.
요약
- 대화형 AI 지연 시간은 사용자가 말을 멈춘 순간부터 에이전트의 첫마디를 듣기까지 걸리는 전체 엔드투엔드 지연 시간입니다.
- 지연 시간이 700ms를 넘는 에이전트는 부자연스럽게 느껴질 수 있으며, 1,200ms를 넘으면 이탈률이 높아집니다.
- 지연 시간은 대화형 AI 파이프라인의 모든 단계에서 누적됩니다.
- ElevenAgents는 단일 통합 아키텍처에서 전체 파이프라인을 처리해, 기업이 저지연 대화형 AI를 쉽게 활용할 수 있도록 합니다.
대화형 AI 지연 시간이란 무엇인가요?
대화형 AI 지연 시간이란 말을 한 뒤 시스템이 응답하기까지 걸리는 총시간을 말합니다. 최신 AI 모델에서 지연 시간은 ms 단위로 측정합니다. 내부적으로 전체 지연 시간은 여러 개별 프로세스로 구성되며, 각 프로세스가 엔드투엔드 파이프라인의 일부를 담당합니다.
일반적인 대화형 AI 파이프라인은 다음과 같습니다.
- 사용자가 말함
- 음성 텍스트 변환 모델이 오디오를 전사함
- 전사된 텍스트가 LLM 모델로 전달되고, LLM이 응답을 생성함
- LLM의 텍스트가 텍스트 음성 변환 모델을 통해 오디오로 합성됨
- 오디오가 사용자에게 재생됨
이 모든 단계는 대화형 AI 시스템에 지연 시간을 추가합니다. 따라서 지연 시간을 논의할 때는 몇 가지 약어를 구분해 이해할 필요가 있습니다.
모델 추론 지연 시간
모델 추론 지연 시간은 모델이 출력을 생성하는 데 걸리는 시간으로, 내부적으로 측정되며 외부 요인은 제외합니다. 일반적인 입력에서 엔진이 얼마나 빠르게 작동하는지를 보여 주는 모델별 지표입니다. 예를 들어 Flash v2.5의 모델 추론 지연 시간은 약 75ms입니다. 이를 통해 경쟁사 모델 간의 속도를 비교할 수 있습니다.
다만 이것은 사용자가 실제로 경험하는 지연 시간 수치가 아니라는 점을 기억하세요. 모델이 출력을 생성하는 데 소요하는 총시간만을 나타냅니다.
LLM 첫 토큰 생성 시간
대규모 언어 모델(LLM)의 첫 토큰 생성 시간(TTFT)은 프롬프트를 처리하고 사용할 수 있는 첫 번째 출력 토큰을 생성하기까지 걸리는 총시간입니다.
TTS 생성은 LLM에서 첫 토큰이 도착하면 시작되므로, 이 지표는 LLM이 TTS 모델 실행을 시작시키기까지 걸리는 시간을 보여 줍니다. 대부분의 엔드투엔드 대화형 AI 시스템에서 LLM TTFT는 전체 지연 시간에서 큰 비중을 차지합니다.
TTS 첫 오디오 생성 시간(TTFA)
TTS 첫 오디오 생성 시간(TTFA)은 첫 번째 TTS 요청부터 실제로 첫 오디오 청크가 모델에서 나올 때까지의 시간을 측정합니다. TTS 엔진에 특화된 모델 추론 지연 시간 표현 방식입니다.
엔드투엔드 첫 오디오 생성 시간(TTFA)
엔드투엔드 TTFA는 전체 대화형 AI 지연 시간입니다. 음성 인식, LLM TTFT, TTS, TTFA 및 단계 간 모든 네트워크 전송 시간을 합한 값입니다. 대화형 AI 지연 시간을 전체적으로 논의할 때, 사용자가 체감하는 지표는 바로 이것입니다.
사용자가 말을 하면 에이전트의 응답을 듣기 전까지 엔드투엔드 TTFA만큼 기다리게 됩니다. 이는 종합적인 지표이므로 파이프라인의 어느 부분이든 개선하면 함께 향상됩니다.
대화형 AI 지연 시간이 중요한 이유
사용자가 AI 에이전트와 대화할 때 지연 시간은 그 경험을 평가하는 핵심 요소가 됩니다. 지연 시간이 짧으면 응답을 기다리는 시간이 줄어들어 대화가 자연스럽고 에이전트가 유능하게 느껴집니다.
응답 품질이 같더라도 지연 시간이 긴 에이전트는 인위적이고 덜 유능하게 느껴집니다. 기업 입장에서는 수백 ms의 차이도 매우 길게 느껴져 고객 지원 에이전트가 둔하고 비효율적으로 보일 수 있습니다.
실제 상황에서 대화형 AI 지연 시간이 왜 중요한지 보여 주는 몇 가지 예시는 다음과 같습니다.
- 500ms 미만: 대화형 에이전트가 반응이 빠르고 매끄럽게 느껴집니다. 사용자는 말을 멈춘 순간부터 첫 응답을 받기까지의 지연을 알아차리지 못할 수 있어 대화가 자연스럽게 이어집니다.
- 500ms~1000ms: 사용자가 말을 멈춘 시점과 응답을 받는 시점 사이의 지연이 체감되기 시작할 수 있습니다. 아주 조금 길기 때문에 사용자는 에이전트가 자신을 제대로 이해했는지 확인하려고 말을 반복하거나 잠시 기다릴 수 있습니다.
- 1000ms 초과: 지연이 느리게 느껴지기 시작하며, 일부 사용자는 AI 에이전트가 대화를 제대로 따라가지 못한다고 느낄 수 있습니다. 전사 기록에는 간헐적인 끼어들기나 상담원 연결 요청이 나타날 수 있습니다. 경우에 따라 사용자는 통화를 종료할 수도 있습니다.
이 각각의 기준은 실제 비즈니스 성과로 이어집니다.
지연 시간 스펙트럼의 낮은 쪽에서는 고객 서비스 에이전트가 들어오는 질문을 자연스럽게 처리하고 추가 지원 없이 사용자가 문제를 해결하도록 도울 수 있습니다. 이는 상담원의 부담을 줄이고 고객 만족도를 높게 유지합니다. 반면 지연 시간이 긴 쪽에서는 지나치게 오래 망설이는 것처럼 보이는 에이전트 때문에 고객이 불편을 겪게 됩니다.
음성 에이전트 지연 시간 예산 벤치마크에 관한 다른 글에서 P50과 P95 값 모두에서 좋은 지연 시간이 어떤 모습인지 설명했습니다.
대화형 AI 지연 시간은 무엇 때문에 발생하나요?
대화형 AI 지연 시간은 여러 프로세스에서 발생하는 시간을 통합한 용어이며, 각 구간이 전체 지연 시간에 기여합니다. 따라서 저지연의 병목 현상은 단순히 더 좋은 모델을 선택해서 해결되는 문제가 아니라 시스템 수준의 문제에 가깝습니다. 여러 모델이 파이프라인에서 상호작용하기 때문입니다.
개발자를 위해 음성 에이전트 지연 시간 최적화에 대한 심층 기술 가이드를 작성했습니다. 이를 활용해 엔드투엔드 첫 오디오 생성 시간(TTFA)의 모든 단계를 개선할 수 있습니다.
핵심 파이프라인 외에도 전화 통신과 함수 호출 같은 요소는 모델 인프라 내부 요소는 아니지만 지연 시간을 더합니다.
대화형 AI 지연 시간에 영향을 미치는 모든 요소를 살펴보겠습니다.
자동 음성 인식
음성 인식의 지연 시간은 전사본을 생성하는 데 걸리는 시간이 아닙니다. 사용자가 말하는 동안 전사 프로세스는 백그라운드에서 실행되므로, 발화가 끝날 때쯤에는 텍스트가 대부분 준비됩니다.
여기서의 지연 시간은 실제로 발화가 끝난 시점부터 전사본이 확정되어 다음 단계로 전달될 때까지의 간격입니다. Scribe v2 Realtime은 지속적으로 스트리밍하여 턴이 끝나는 즉시 출력이 준비되도록 하고, 이 간격을 약 150ms까지 줄입니다.

턴 전환 및 종점 감지
음성 활동 감지기(VAD)는 음성 인식과 언어 모델 사이에 위치합니다. 역할은 사용자가 실제로 말을 마쳤는지 판단하는 것입니다.
오류를 방지하기 위해 VAD는 일정 시간 동안 침묵이 이어질 때까지 기다린 후 발화 턴이 끝났다고 판단합니다. 이 대기 시간은 언어 모델이 단어를 처리하기 전에 추가되는 지연 시간입니다. 이 작은 추가 지연은 시간을 더하지만, 사용자가 아직 말하고 있는 중에 시스템이 응답을 시작하는 일도 방지합니다.
기술적으로 말하면, 다른 모든 대화형 AI 구성 요소의 지연 시간이 0이라면 턴 전환으로 인한 지연은 바람직한 요소일 수 있습니다. 사람도 말에 응답하기 전 잠시 뜸을 들입니다. 기계가 비슷한 정도로 잠시 멈추면 상호작용이 더 현실적으로 느껴집니다. 하지만 대화형 AI의 다른 구성 요소에서도 이미 지연 시간이 발생하므로, 최소한의 지연 시간이 이상적입니다.

언어 모델 처리
음성 텍스트 변환(STT) 엔진에서 전사본이 준비되면 언어 모델이 응답을 생성합니다. 여기서의 지연 시간은 전체 응답을 생성하는 시간이 아니라 토큰 생성을 시작하기까지의 시간입니다. 토큰은 도착하는 즉시 TTS 단계로 스트리밍되므로 가장 중요한 것은 TTFT입니다.
모델 선택 외에도 프롬프트 길이와 지식 베이스 크기가 이 단계에 영향을 줍니다. LLM이 고려해야 하는 컨텍스트가 많을수록 시간이 더 오래 걸립니다. 이러한 시스템을 대규모로 설계할 때는 유용한 지식 베이스와 간결한 프롬프트 사이에서 적절한 균형을 찾아 속도를 유지해야 합니다.

음성 합성
TTS 지연 시간은 언어 모델에서 첫 토큰을 받은 시점부터 오디오가 시작될 때까지의 시간입니다. 토큰은 사람이 말하는 속도보다 빠르게 도착하므로 음성 합성 모델은 전체 응답을 기다리지 않습니다. TTS 지연 시간은 엄밀히 말해 첫 오디오 청크까지 걸리는 시간입니다.
이 단계는 기존 모델이 음성 생성을 시작하는 데 2~3초가 걸리면서 대화형 AI 지연 시간에 가장 크게 기여하던 구간이었습니다. ElevenLabs의 Flash v2.5는 약 75ms의 지연 시간으로 음성 합성을 제공해 이 병목 현상을 수 초에서 1초의 일부 수준으로 직접 줄입니다.

네트워크 지연 시간
한 위치에서 다른 위치로 데이터를 전송하면 항상 지연 시간이 발생하며, 지리적 거리가 멀수록 네트워크 왕복 지연 시간은 더 커집니다.
엔드투엔드 응답을 위해 여러 구성 요소가 함께 작동하므로, 여러 차례의 네트워크 홉에서 상당한 지연 시간이 누적될 수 있습니다.

함수 호출
함수 호출은 LLM 단계에서 API 왕복 시간을 추가합니다. 빠른 내부 조회는 수십 ms가 추가되지만, 결제 처리 시스템이나 재고 시스템은 수 초가 걸릴 수 있습니다. 지연 시간은 호출하는 서비스에 전적으로 좌우되므로 이 단계는 직접 최적화하기 가장 어렵습니다.
가장 효과적인 방식은 도구 호출이 완료되기 전에 LLM이 응답하도록 프롬프트를 설정하는 것입니다. "확인해 드릴게요"와 같은 문구를 사용하면 외부 호출이 처리되는 동안 사용자의 참여를 유지할 수 있으며, 침묵이 이어지는 것을 방지합니다. 도구가 병렬로 실행되는 동안 음성 응답이 시작됩니다.

대화형 AI 지연 시간을 줄이는 방법
대화형 AI 지연 시간을 줄이려면 영향도가 큰 순서대로 파이프라인의 각 단계를 개선해야 합니다. 개별 개선도 지연 시간에 영향을 주지만, 가장 큰 변화를 얻으려면 전체 파이프라인을 종합적으로 다뤄야 합니다.
대화형 AI 지연 시간을 전반적으로 줄이는 데 도움이 되는 몇 가지 원칙은 다음과 같습니다.
- TTS 모델 선택: Flash v2.5와 같은 속도 최적화 TTS 모델은 품질 최적화 모델인 Eleven v3와 다른 아키텍처를 사용합니다. 실시간 음성 에이전트의 경우, 지연 시간 목표를 충족하는 모델 중 가장 높은 품질의 모델을 선택해야 하며, 대개 속도에 최적화된 모델이 적합합니다.
- LLM 모델 선택: 일반적으로 더 작고 빠른 LLM은 더 큰 모델보다 첫 토큰 생성 시간이 짧습니다. 작업에 필요한 품질 기준을 충족하면서도 가장 빠른 LLM을 선택하는 일은 TTS 모델 선택만큼 중요합니다.
- 스트리밍: 스트리밍 TTS는 합성이 진행되는 동안 오디오를 청크 단위로 반환하므로, 모델이 나머지 내용을 생성하는 중에도 사용자는 첫마디를 들을 수 있습니다. 이 개념은 LLM 출력에도 적용됩니다. 언어 모델이 이후 문장을 생성하는 동안 첫 문장부터 TTS 합성을 시작하면 파이프라인 지연 시간을 줄일 수 있습니다.
- 시스템 프롬프트 설계: 사용자는 시스템 프롬프트를 간소화하여 모든 판단 단계에 지침을 포함하는 대신 절차나 워크플로에 지침을 배치할 수 있습니다. 이렇게 하면 모델이 매 턴마다 추론해야 하는 컨텍스트 양이 줄어듭니다.
- 가드레일: 스트리밍 모델에서 가드레일을 실행하면 검사가 완료될 때까지 재생을 차단하는 대신, 가드레일 검사가 끝나기 전에 출력 재생을 시작할 수 있습니다.
- 모델 공동 배치: ElevenLabs Agents 스택처럼 가능한 경우 모델을 공동 배치하면 구성 요소 간 거리를 가깝게 유지하여 별도 호스팅된 모델 간 홉으로 인한 지연 시간이 추가되지 않습니다.
- 지리적 위치: 서버와 사용자가 가까이 있을수록 지연 시간을 크게 줄일 수 있습니다. 이는 엔드투엔드 TTFA에서 네트워크가 차지하는 시간을 직접 줄이기 때문입니다.
이러한 요소 외에도 더 자세한 내용은 지연 시간 최적화 기술 가이드를 참고하세요.
ElevenAgents로 저지연 대화형 AI 시작하기
에이전트를 구축하고 배포할 때 대화형 AI 지연 시간은 반드시 고려해야 할 중요한 요소입니다. ElevenAgents는 지연 시간 최적화를 프로세스에 기본으로 적용합니다. 복구 시간을 위한 오버랩 기술부터 개별 구성 요소의 낮은 모델 추론 지연 시간까지, ElevenAgents는 비즈니스를 위한 저지연 대화형 AI 스택을 구축합니다.
궁극적인 목표는 현실감을 만드는 것입니다. 사용자는 컴퓨터 프로그램의 이점을 누리면서 사람과 대화하는 듯한 편안함을 느껴야 합니다. 하위 프로세스를 최적화하면 이제 이를 실현할 수 있습니다.
ElevenAgents에 대해 더 알아보거나 영업팀에 문의하여 지금 시작하세요.
.webp&w=3840&q=80)
.webp&w=3840&q=80)
