콘텐츠로 건너뛰기
  1. 인사이트

대화형 AI란?

작성자
Jack Limebear

듣기이 글 오디오로 듣기

1950년 사고 실험으로 시작된 기술은 이제 전 세계 기업의 고객 지원 전화를 받고, 리드를 검증하며, 예약을 잡고, 인터뷰까지 진행합니다.

대화형 AI는 새로운 단계에 들어섰습니다. 한때 사용자를 경직된 메뉴와 정해진 응답에 묶어 두었던 시스템은 이제 음성과 텍스트로 자연스럽고 실시간으로 대화하며, 의도를 이해하고, 맥락을 기억하고, 작업을 처음부터 끝까지 완료합니다.

이 가이드에서는 대화형 AI에 관해 알아야 할 모든 내용을 다룹니다. 대화형 AI의 기원, 내부 작동 방식, 이 범주를 정의하는 구성 요소와 유형, 그리고 오늘날 기업이 실제 환경에서 이를 어떻게 배포하는지 살펴봅니다.

요약:

  • 대화형 AI는 사용자가 텍스트나 음성으로 소통하는 기술로, 최신 시스템은 전체 맥락을 바탕으로 실시간 응답을 제공합니다.
  • 대화형 AI는 인공지능, 머신러닝, 자연어 처리라는 3가지 핵심 분야를 기반으로 하며, 최신 시스템은 여기에 LLM, 음성 모델, 검색, 턴 테이킹을 더합니다.
  • 이 분야는 1966년 ELIZA의 패턴 매칭에서 시작해 규칙 기반 IVR, Siri와 Alexa 같은 소비자용 어시스턴트, 그리고 오늘날의 LLM을 가능하게 한 Transformer 혁신으로 발전해 왔습니다.
  • 최신 파이프라인은 음성 인식, 의도 파악, 대화 관리, 응답 생성, 음성 합성을 1초 미만의 상호작용으로 연결하며, 턴 테이킹 모델이 이를 조율합니다.
  • 기업은 고객 지원, 영업, 채권 회수, 일정 관리, 안내 업무 전반에 대화형 AI를 배포합니다. ElevenAgents 같은 플랫폼에서는 하나의 구성으로 음성과 채팅에서 동일한 에이전트를 운영할 수 있습니다.

대화형 AI란 무엇인가요?

대화형 AI는 사용자가 텍스트 또는 음성으로 인공지능 시스템과 소통하며 정보를 얻을 수 있는 기술 범주입니다. 기존의 인간-컴퓨터 소통 방식은 사용자가 미리 정해진 명령어 중에서 선택하는 고정된 대화 분기로 제한되었습니다. 최신 대화형 AI 시스템은 사람의 음성을 인식하고 분류하며, 전체 맥락을 바탕으로 질문에 실시간으로 응답할 수 있습니다.

대화형 인공지능이 더욱 강력해지면서 기업들은 이를 고객 대면 시스템에 도입하고 있습니다. 고객 지원 핫라인을 간소화하는 것부터 보험 양식에 고객 데이터를 자동으로 입력하는 완전한 에이전트를 구축하는 것까지, AI 어시스턴트로 가능합니다. 

모든 대화형 AI 시스템은 다음 3가지 핵심 분야를 기반으로 합니다.

  • 인공지능: 일반적으로 사람의 지능이나 입력이 필요한 인지 기능을 소프트웨어가 모방하도록 돕는 광범위한 시스템입니다. AI 기반 대화에서는 입력에 따라 작업을 조율하고, 응답에 포함할 데이터를 결정하며, 시스템을 특정 구성 요소로 연결하거나 내부 리소스를 조회하는 역할을 합니다.
  • 머신러닝: 머신러닝을 통해 AI 시스템은 방대한 데이터세트를 처리하고 그 안의 패턴을 식별할 수 있습니다. 이전 상호작용에서 학습함으로써 ML은 대화형 AI 시스템이 사용자 행동에 적응하고 시간이 지날수록 성능을 개선하도록 돕습니다.
  • 자연어 처리(NLP): 자연어 처리 엔진은 컴퓨터가 사람의 언어를 이해하고 사용할 수 있게 합니다. 자연어 처리는 대화형 AI의 핵심 기반으로, 시스템이 입력에서 사용자 의도를 추출하고, 일관된 응답을 생성하며, 대화를 관리하고, 시간이 지나며 응답을 개선해 성능과 정확도를 높일 수 있게 합니다.

최신 프로덕션 시스템은 이러한 기반 위에 훨씬 더 많은 요소를 추가합니다. 대규모 언어 모델은 추론과 응답 생성을 담당하고, 음성 인식(STT) 및 텍스트 음성 변환(TTS) 모델은 음성 계층을 담당하며, 검색 시스템은 승인된 지식에 기반한 답변을 제공하고, 턴 테이킹 모델은 실시간 대화 흐름을 관리합니다. 이 모든 과정은 가드레일 내에서 이루어집니다. 아래의 대화형 AI 작동 방식과 주요 구성 요소 섹션에서 각각을 자세히 설명합니다.

이 3가지 핵심 기술이 결합되면 사용자가 자연어로 대화할 수 있는 간결하고 일관되며 맥락을 완전히 이해하는 대화형 AI 소프트웨어가 만들어집니다. 많은 시스템이 다양한 언어로 대화를 지원하며, ElevenAgents는 70개 이상의 언어에서 자연스러운 음성을 제공합니다. 

대화형 AI의 역사와 발전

대화형 AI는 철학적 아이디어에서 시작되었습니다. 앨런 튜링은 1950년 논문 「Computing Machinery and Intelligence」에서 ‘기계가 생각할 수 있는가?’라는 질문을 던졌습니다. 그는 모방 게임(The Imitation Game)이라는 모의 실험을 통해 이 질문에 답하고자 했습니다.

모방 게임에는 인간 평가자, 컴퓨터, 인간 피실험자 3명이 참여합니다. 두 사람은 서로 다른 방에 있고, 평가자는 인간과 컴퓨터 프로그램 모두에게 메시지를 보내고 답장을 받습니다. 인간 평가자가 인간과 컴퓨터 프로그램의 대화 상대를 구분하지 못한다면, 튜링은 그 소프트웨어가 지능과 기능적으로 동등한 무언가를 보여 준 것이라고 주장했습니다.

70년이 넘은 지금도 튜링 테스트 프레임워크는 이후 등장한 모든 대화형 시스템의 근본적인 철학적 기준점으로 남아 있습니다. 다만 이러한 에이전트를 구동하는 인공지능이 발전하면서 기준은 크게 높아졌습니다.

과학자와 수학자들이 시간에 따라 대화형 AI와 관련해 튜링의 프레임워크를 어떻게 활용하고 발전시켜 왔는지 살펴보겠습니다.

Timeline of conversational AI milestones from Turing’s 1950 test to voice AI in 2022.

초기 챗봇: 1960년대~1990년대

1966년 조지프 와이젠바움은 최초의 자연어 처리 프로그램 중 하나를 만들었습니다. ELIZA로 알려진 이 소프트웨어는 패턴 매칭을 사용해 사용자의 입력을 이해하고 그에 맞게 응답하는 듯한 인상을 주었습니다. ELIZA의 소스 코드는 발견되지 않았지만, 와이젠바움이 1966년 Computational Linguistics에 발표한 논문 덕분에 일부 기록이 남아 있습니다.

가장 잘 알려진 ELIZA 스크립트는 ‘DOCTOR’로, ‘모의 로저스식 심리치료사’ 역할을 하도록 설계되었습니다. ‘무언가 마음에 걸리시나요?’로 대화를 시작하면 사용자는 자신의 고민을 답하게 됩니다. ELIZA는 각 입력을 받아 연결된 질문으로 다시 구성했습니다.

Terminal screenshot showing a conversation with the ELIZA chatbot about depression.

예를 들어 사용자가 ‘일이 너무 스트레스예요’라고 입력하면 ELIZA는 ‘일의 어떤 점이 너무 스트레스인가요?’라고 응답하며 다른 질문으로 대화를 이어갈 수 있습니다. 와이젠바움은 버나드 쇼의 「피그말리온」에서 엘라이자 둘리틀이 시간이 지나면서 말투를 다듬는다는 점을 참고해 ELIZA라는 이름을 지었습니다.

몇 년 뒤인 1973년, 케네스 콜비는 정신 질환 환자의 편집증을 반영하도록 설계한 챗봇 Parry를 공개했습니다. Parry는 응답을 제어하는 500개 이상의 휴리스틱을 갖추고 있어, 유연하고 섬세해 보이는 답변을 제공할 수 있었습니다. 실제 정신과 의사와 환자의 대화가 지닌 정서적 복잡성을 모방하는 것이 목표였습니다. 

Parry와 면허를 보유한 임상 정신과 의사 사이의 대화 기록을 대량으로 수집한 뒤, 콜비는 전문가들이 실제 환자의 기록과 Parry가 생성한 기록을 구분하지 못한다는 사실을 발견했습니다. 

규칙 기반 시스템: 1990년대~2000년대

대화형 음성 응답(IVR) 시스템은 이미 1970년대부터 존재했지만, 널리 사용하기에는 비용이 많이 들고 지나치게 복잡한 것으로 여겨졌습니다. 기업들이 콜센터에서 고객 데이터를 수집하기 위해 IVR 시스템과 컴퓨터 전화 통합에 투자한 것은 1990년대 후반이었습니다.

IVR은 컴퓨터와 인간의 상호작용에 구조화된 접근 방식을 제공합니다. 이 시스템은 사용자에게서 정보를 수집한 뒤 전화를 적절한 부서나 서비스로 연결합니다. 초기 IVR조차 음성 인식을 사용하는 음성 IVR과 키패드로 숫자를 입력하는 DTMF(Dual-Tone Multi-Frequency)라는 두 가지 상호작용 방식을 제공했습니다.

2000년대에는 VoiceXML 표준이 널리 채택되고 CPU 성능을 더 쉽게 활용할 수 있게 되면서 IVR의 비용 효율성이 크게 높아졌습니다. 

ELIZA와 Parry 같은 초기 챗봇에서 발전한 형태이지만, 규칙 기반 IVR은 역설적으로 한 단계 후퇴한 것처럼 보입니다. 상호작용 범위는 더 넓지만, 엄격히 제한된 범주 안에서만 가능합니다. 이러한 경직성은 ELIZA와 Parry가 전달할 수 있었던 실제 사람과 대화하는 듯한 인상을 없앱니다.

미리 지정된 IVR 경로를 벗어나는 입력은 잘해도 무의미한 응답을 낳고, 최악의 경우 시스템을 멈추게 했습니다. 이 때문에 사람들은 기계가 이해할 수 있는 방식으로 자신의 언어를 바꿔 말해야 했습니다. 예를 들면 ‘재무 상담사에게 연결하려면 “청구”라고 말씀하세요’와 같습니다.

IVR 기반 대화 라우팅의 핵심 토대는 이후 등장한 많은 대화형 AI 시스템의 기반이 되었습니다. 

챗봇의 부상: 2000년대

2001년 ActiveBuddy는 AOL Instant Messenger에서 SmarterChild를 출시했습니다. 이 메신저 봇은 널리 배포되어 사용자에게 날씨 업데이트, 최신 뉴스, 스포츠 점수를 제공할 수 있었습니다. 기능은 비교적 제한적이었지만, SmarterChild는 서비스 기간 동안 3,000만 건이 넘는 개별 사용자 상호작용을 기록했습니다.

높은 실용성에도 불구하고 SmarterChild는 실제로 브랜드에 수익을 가져다주지 못했습니다. 당시 COO였고 이후 CEO가 된 스티븐 클라인은 대화형 컴퓨팅의 가능성을 보여 주었기 때문에 이 기능을 계속 유지했습니다.

SmarterChild는 A.L.I.C.E(Artificial Linguistic Internet Computer Entity)가 2000년 가장 현실적인 대화 로봇으로 처음 뢰브너상을 수상한 지 불과 몇 년 후 출시되었습니다. A.L.I.C.E는 서비스 기간 동안 뢰브너상을 세 번 수상했지만, 튜링 테스트를 통과하지는 못했습니다.

10년 후, 소비자 기기에 직접 통합된 최초의 대중적 AI 어시스턴트가 등장했습니다. Siri는 자동 음성 인식(ASR), 자연어 처리(NLP), 머신러닝을 비롯한 여러 기술이 집약된 결과물이었습니다.

2010년에 출시된 Siri는 질문 뒤에 숨은 의도를 이해하고 그에 맞게 응답할 수 있었던 초기 소프트웨어 시스템 중 하나였습니다. Microsoft Cortana, Amazon Alexa, Google Now 등도 2012년부터 2014년 사이에 출시되었습니다. 특히 Alexa는 항상 켜져 있는 가정 내 환경을 통해 화면이나 터치 입력 없이 작동하는 대화형 AI의 초기 형태를 보여 주었습니다.

고객 대면 영역에서는 챗봇이 대부분의 엔터프라이즈 웹사이트에서 일상적인 요소로 자리 잡았습니다. 챗봇은 주문을 조회하고, 리소스를 찾고, 정보를 추적하며, 비밀번호를 재설정하거나 고객에게 계정 관련 업데이트를 제공할 수 있었습니다. Alexa나 Siri 같은 서비스보다 유연성은 낮았지만, 이 초기 챗봇은 구체적으로 정의된 작업에서 뛰어난 성능을 보였습니다.

머신러닝과 NLP: 2010년대

이전 세대의 대화형 AI 어시스턴트는 규칙으로 정의되었으며, 세심하게 설계한 의사결정 매핑 트리와 방대한 큐레이션 응답 라이브러리에 의존했습니다. 2010년대에는 머신러닝과 NLP를 통해 모델이 대규모 인간 응답 코퍼스를 학습할 수 있게 되면서 이러한 개발 방식이 변화하기 시작했습니다.

역량의 큰 변화는 순환 신경망(RNN)과 장단기 기억(LSTM) 모델의 등장에서 비롯되었습니다. 이 시스템은 기계가 순차적 입력을 처리하고 문장 속 단어를 이해하는 방식에 큰 영향을 미쳤습니다. 

Google의 Word2Vec NLP 기법도 의미론적 관계를 기하학적 공간에 매핑하여 LLM 개발을 가속했습니다. 이 방식은 모델이 단어 간 관계를 추정할 수 있게 하여, 다음 단어 생성과 맥락에 맞는 정확한 응답 구성에 도움을 주었습니다. 

이러한 발전은 2017년 Google이 Transformer 아키텍처를 소개한 「Attention is All You Need」 논문으로 이어졌습니다. Transformer는 셀프 어텐션을 사용해 입력의 모든 단어를 다른 모든 단어와 동시에 비교해 가중치를 부여하므로, 학습 속도가 빨라지고 훨씬 풍부한 출력을 생성할 수 있습니다.

2018년 Google은 Transformer 아키텍처를 사용하는 초기 AI 모델인 BERT(Bidirectional Encoder Representations from Transformers)를 출시했습니다. 인터넷 텍스트로 사전 학습된 이 모델은 비교적 적은 추가 학습 데이터로도 다양한 다운스트림 작업을 수행할 수 있었습니다.

번역과 요약부터 질의응답, 입력 감정 분류에 이르기까지, 2010년대 말에는 모델이 오늘날 사용하는 대화형 AI의 일반적인 역량을 갖추기 시작했습니다.

음성의 공백

이 모든 발전 과정에서 인간과 기계의 상호작용에 필요한 근본적인 요소 하나가 빠져 있었습니다. 2020년대에 대화형 AI는 입력을 읽고 추론하며 긴 응답을 생성할 수 있었지만, 사용자와 진정으로 대화할 수는 없었습니다. 불과 몇 년 전까지 음성 계층은 완전한 대화형 AI에서 늘 빠져 있던 요소였습니다.

2022년에 출시된 ElevenLabs는 음성이 작동하는 방식에 관한 더욱 풍부한 이해를 생성 모델에 학습시켜 인간의 음성과 합성 음성 간 격차를 좁히고자 했습니다. 이 모델들은 단순한 음성적 분해와 재구성을 넘어 언어의 정서적 맥락을 이해하는 것을 목표로 했습니다.

직접 확인해 보고 싶으신가요? Eleven v3에 대해 자세히 알아보세요. ElevenLabs의 가장 표현력 높은 모델로, 폭넓은 인간 감정을 전달할 수 있습니다.

대화형 AI의 작동 방식

최신 대화형 AI 시스템은 사용자와 협업하고, 다양한 작업을 수행하며, 저장된 정보를 검색하고, 응답에 도움이 될 데이터를 얻기 위해 외부 플랫폼을 조회합니다. 응답은 1초 이내에 표시될 수 있지만, 그 짧은 순간에는 여러 도구와 시스템이 순차적으로 연결됩니다.

상호작용이 처음부터 끝까지 이루어지는 방식은 다음과 같습니다.

  1. 대화 시작: 사용자는 텍스트나 음성으로 입력을 제공해 에이전트와 세션을 시작합니다. 음성 기반 시스템에서 에이전트는 듣기 상태를 활성화하고, 음성 활동 감지(VAD)는 화자의 오디오를 배경 소음에서 분리합니다.
  2. 입력 분석: 시스템은 원시 텍스트나 오디오를 내부적으로 사용할 수 있는 구조화된 표현으로 변환합니다. 텍스트의 경우 입력을 토큰으로 변환하고 구조를 분석합니다. 음성의 경우 음성 인식(STT) 모델이 말소리를 텍스트로 전사합니다. ElevenLabs는 자체 STT 모델인 Scribe를 사용하며, 150ms 미만으로 오디오를 전사합니다.
  3. 의도 파악: 이 단계에서는 사용자가 상호작용을 통해 정확히 무엇을 원하는지 파악합니다. 예를 들어 서로 다른 사용자가 ‘예약을 변경하고 싶어요’ 또는 ‘항공편을 바꾸고 싶어요’라고 말해도 같은 결과로 이어질 수 있습니다. 의도 인식은 항공편 번호나 날짜처럼 입력에 포함된 구체적인 정보도 추출합니다.
  4. 대화 관리를 통한 맥락 추적: 대화 관리는 이미 확인된 정보, 사용자가 말한 내용, 아직 해결해야 할 사항 등 핵심 정보를 기록합니다. 이 계층은 시스템에 지속적인 메모리를 제공하므로, ‘내일로 옮겨 주세요’라는 말도 맥락 단서를 통해 ‘항공편을 내일로 변경해 주세요’로 해석할 수 있습니다.
  5. 응답 생성: 대규모 언어 모델(LLM)은 대화 기록, 지식 베이스에서 검색한 관련 문서, 사용 가능한 도구 출력, 시스템 프롬프트를 조합한 뒤 맥락에 적절한 응답을 생성합니다. 이 출력은 전달 전에 가드레일 검사를 거쳐 허용된 주제 범위 안에 머물도록 합니다.
  6. 출력 전달: 사용자는 화면의 텍스트, 합성 음성 또는 둘 다의 형태로 응답을 받습니다. 음성의 경우 응답은 텍스트 음성 변환 모델을 거칩니다. ElevenLabs는 Eleven v3를 사용해 로봇 같지 않고 자연스러운 응답을 제공합니다. 이후 에이전트는 발언권을 넘기고 사용자의 다음 차례를 기다립니다.
  7. 지속적인 학습 및 개선:프로덕션 규모의 시스템은 방대한 상호작용 데이터를 생성합니다. 이를 대규모로 분석하면 잘못 식별된 의도, 낮은 품질의 응답, 지식 격차를 찾아내어 에이전트가 시간이 지나며 개선해야 할 지점을 정확히 알려 줍니다.

텍스트 기반 상호작용의 과정도 STT 및 TTS 계층이 없다는 점을 제외하면 거의 같습니다. 메시지는 처리되기 위해 LLM으로 바로 전달되고, 응답은 동일한 기반 지능을 바탕으로 텍스트로 돌아옵니다.

Seven stages of conversational AI, from spoken input to reply, with parallel tool calls.

함께 작동하는 기반 시스템

위 단계는 간단한 상호작용을 보여 주지만, 실제 대화는 좀처럼 직선적으로 진행되지 않습니다. 사용자는 끼어들고, 문장 중간에 주제를 바꾸며, 언어를 전환합니다. 이런 미묘한 상황을 처리하기 위해 대화형 AI는 병렬로 작동하는 여러 기반 시스템을 활용합니다.

  • LLM: 사용자의 발화를 처리하고, 응답 방식을 결정하며, 도구나 작업을 실행해야 하는지 판단합니다.
  • RAG(검색 증강 생성): 자체 지식 베이스에서 관련 문서를 검색하여 기업 콘텐츠에 기반한 답변을 제공합니다.
  • STT(음성 인식): LLM이 처리할 수 있도록 음성 오디오를 텍스트로 변환합니다.
  • TTS(텍스트 음성 변환): LLM의 응답을 미리 선택한 음성의 말소리로 다시 변환합니다.
  • 턴 테이킹 모델: 사용자가 말을 마친 시점을 감지해 에이전트가 언제 응답해야 하는지 알 수 있게 하며, 대화가 자연스럽게 주고받는 느낌이 들도록 합니다.
  • 가드레일: 대화가 어디로 흘러가든 에이전트가 스크립트, 규정 준수 요건, 설정한 경계 안에 머물도록 합니다.
  • VAD(음성 활동 감지): 주 화자의 오디오를 배경 소음에서 분리하여 전사 정확도를 높이고 대화와 관련 없는 소리를 걸러냅니다.
  • 음성사서함 감지: 통화가 실제 사람에게 연결된 것이 아니라 음성사서함으로 연결되었는지 식별하여 에이전트가 적절히 응답하게 합니다.

파이프라인의 모든 부분이 엄격한 순서대로 실행되는 것도 아닙니다. 에이전트는 말하는 동안 병렬 도구 호출로 데이터베이스를 조회하거나 주문 상태를 확인할 수 있으므로, 검색 때문에 대화가 어색하게 멈추지 않습니다.

턴 테이킹: 대화형 AI를 더 인간적으로 만드는 요소

턴 테이킹은 자연스럽게 느껴지는 에이전트와 경직된 에이전트를 가장 크게 구분하는 계층이므로 자세히 살펴볼 필요가 있습니다. 

최신 턴 테이킹 시스템은 여러 메커니즘을 통해 이러한 흐름을 관리합니다.

  • 예측형 턴 테이킹: 시스템은 정해진 침묵 시간을 기다리는 대신 사용자가 말한 내용의 의미를 바탕으로 실제 발화가 끝났는지 판단합니다. 덕분에 문장 중간의 자연스러운 쉼에서 에이전트가 성급하게 끼어드는 일을 막을 수 있습니다.
  • 끼어들기 처리: 사용자가 응답 중간에 말을 시작하면 에이전트는 말을 멈추고 진행 중인 답변을 지운 뒤, 통화자 위로 말을 겹치지 않고 새 입력을 바탕으로 새로운 응답을 생성합니다.
  • 끼어들기 무시 용어: ‘음’, ‘네’ 같은 짧은 맞장구는 완전한 끼어들기를 유발하지 않고 지나가도록 구성할 수 있습니다. 따라서 통화자가 듣고 있다는 신호를 보낼 때마다 에이전트가 흐름을 잃지 않습니다.
  • 소프트 타임아웃: LLM이 예상보다 오래 걸려 응답을 생성할 때 에이전트는 어색한 침묵 대신 ‘잠시 생각해 볼게요…’ 같은 짧은 채움 문구를 말해 자연스러운 대화 흐름을 유지합니다.

이 모든 요소의 목표는 같습니다. 빠르고, 자연스럽게 들리며, 충분히 도움이 되는 응답을 제공해 고객이 기계와 대화하고 있다는 느낌을 받지 않도록 하는 것입니다.

대화형 AI의 주요 구성 요소

대화형 AI는 최종 사용자를 돕기 위해 함께 작동하는 다양한 기술과 시스템의 스택입니다. 각 구성 요소는 최종 제품에 기여하는 서로 다른 역할을 맡습니다.

대화형 AI 시스템의 주요 구성 요소와 각각의 역할을 살펴보겠습니다.

대규모 언어 모델(LLM)

대규모 언어 모델은 최신 대화형 AI 시스템의 추론 핵심입니다. LLM은 사용자의 발화를 해석하고, 대화 기록·검색 문서·도구 출력을 조합하며, 수행할 작업을 결정하고, 응답을 생성합니다. 이를 통해 이전에는 별도의 의도 인식, 대화 관리, 자연어 생성(NLG) 엔진이 필요했던 역할 대부분을 수행합니다.

음성 인식과 텍스트 음성 변환

음성 상호작용에서는 두 가지 음성 모델이 파이프라인의 시작과 끝을 담당합니다. 음성 인식 모델은 사용자의 말소리를 LLM이 처리할 수 있는 텍스트로 전사하고, 텍스트 음성 변환 모델은 응답을 다시 말소리로 변환합니다. 텍스트 음성 변환 모델의 표현력은 에이전트가 사람처럼 들릴지 로봇처럼 들릴지를 크게 좌우합니다. 그래서 ElevenAgents는 전사에 Scribe를, 음성 전달에 Eleven v3를 함께 사용합니다.

턴 테이킹 모델

턴 테이킹 모델은 대화의 실시간 리듬, 즉 언제 들을지, 언제 응답할지, 언제 발언권을 넘길지를 관리합니다. 사용자의 발화 의미를 바탕으로 실제 차례가 끝났는지 판단하고, 끼어들기를 처리하며, 맞장구가 응답 흐름을 방해하지 않도록 합니다. 이 모델이 없다면 아무리 잘 추론한 답변도 잘못된 순간에 도착하게 됩니다.

자연어 처리 

자연어 처리는 컴퓨터가 사람의 언어를 처리하고 이해할 수 있게 하는 인공지능의 한 분야입니다. 토큰화, 구문 분석, 의미 분석, 개체명 인식 등 원시 입력 텍스트를 컴퓨터가 처리할 수 있는 형태로 변환하는 여러 하위 과정이 포함됩니다.

의도 인식

의도 인식은 인간 언어를 해석하여 서로 다른 의미 선택 뒤에 있는 뜻을 이해하려는 NLP 기법입니다. 일반적으로 연구자들은 방대한 양의 레이블링된 예시로 의도 인식 엔진을 학습시킵니다. 이를 통해 모델은 하나의 메시지에 여러 요구 사항이 포함되어 있어도 입력을 의도 범주에 매핑하는 방법을 배웁니다.

대화 관리

대화 관리는 시간에 따른 대화 흐름을 구성하고 계획하는 시스템입니다. 무엇이 말해졌는지, 요청을 완료하기 위해 시스템에 어떤 정보가 더 필요한지 이해하며, 대화가 ‘완료’된 시점을 판단하기 위한 분기형 대화 로직을 관리합니다. 사용자가 예상치 못한 말을 했을 때 시스템의 응답을 관리하는 데에도 관여합니다.

자연어 생성(NLG)

자연어 생성은 대화형 AI 안에서 언어적 표현을 담당하는 구성 요소입니다. 모델 출력을 사람이 읽을 수 있는 언어로 변환하며, 흔히 가변적인 내부 구조를 가진 템플릿 기반 시스템을 사용합니다. 이 구성 요소의 품질은 크게 달라질 수 있으며, 더 발전된 시스템은 응답을 처음부터 완전히 생성합니다. 

머신러닝

머신러닝은 대화형 AI 시스템이 단순히 기본 수준으로 작동하는 데 그치지 않고 시간이 지나며 개선할 수 있게 합니다. ML 모델은 이전 예시에서 학습하고 내부 매개변수를 조정하여 사용자 입력에 더 잘 대응합니다. 

규모는 여기서 매우 중요합니다. ML의 반복적 개선을 통해 기계는 규칙 기반 시스템이 감당할 수 있는 수준을 훨씬 넘어 인간 언어의 복잡성을 지원할 수 있습니다.

능동 학습

능동 학습은 시스템이 가장 확신하지 못하는 특정 예시를 선택해 사람의 검토 대상으로 표시하는 머신러닝 구성 요소입니다. 사람이 예외적 사용 사례의 레이블링을 검토하면, 연구자는 모델 성능에 큰 영향을 미치는 피드백을 제공할 수 있습니다.


능동 학습은 모델이 모든 영역을 동일하게 개선하는 데 시간을 덜 쓰고 문제 영역에 더 집중하게 하므로 모델 성능 향상을 크게 가속합니다.

문서 인지

모든 AI 시스템은 광범위한 맥락 정보 코퍼스를 기반으로 합니다. 내부 지식 베이스부터 정책 문서와 교육 매뉴얼까지 활용할 수 있는 콘텐츠가 풍부합니다. 실시간 정보 아카이브를 모델에 연결하면, 모델은 학습 과정에서 익힌 사실에만 의존하지 않고 이러한 문서를 조회해 사용자에게 실시간 답변을 제공할 수 있습니다.

문서 인지는 사용자나 직원이 구체적인 질문을 하는 모든 대화형 AI 시스템에 중요한 요소입니다.

대화형 AI 기술의 유형

대화형 AI라는 넓은 범주에는 여러 기술 배포 방식이 포함됩니다. 특히 자체 에이전트를 배포하려는 엔터프라이즈라면 유형별 차이를 이해하는 것이 제품 개발을 훨씬 간단하게 만드는 데 도움이 됩니다.

대화형 AI 기술의 주요 유형을 살펴보겠습니다.

AI 챗봇

AI 챗봇은 주로 웹사이트와 모바일 애플리케이션에서 작동하며, 사용자가 상호작용을 통해 정보를 찾을 수 있게 합니다. 일부 AI 챗봇은 내부 FAQ 및 문서와 깊이 통합되어 복잡한 여러 차례의 상호작용을 처리할 수 있습니다. 

AI 챗봇의 품질 차이는 주로 더 복잡한 사용자 문의를 처리하는 능력에서 나옵니다. 특히 사용자가 요청을 완료하는 방법을 잘 모르는 경우, 모델은 입력을 받아 그 안의 기본 요구 사항을 분해하고 문제를 해결하기 위한 관련 문서를 찾아야 합니다.

음성 어시스턴트

음성 어시스턴트는 음성 인식과 음성 합성 시스템을 결합해 사용자가 오디오로 상호작용할 수 있게 합니다. 입력하기 어려운 사용 사례에서는 음성 어시스턴트가 훨씬 편리한 대화 방식입니다.

음성 어시스턴트의 품질은 매우 크게 달라집니다. 사람 같은 음성부터 로봇 같고 부자연스러운 오디오 샘플까지, 음성이 사용자의 경험을 어떻게 느끼게 하는지를 결정합니다. 기반 응답이 효과적이더라도 기계적인 전달 방식은 사용자에게 거부감을 주어 이탈로 이어질 수 있습니다.

대화형 음성 응답

앞서 언급했듯 IVR은 사용자가 미리 정의된 옵션 계층에서 선택할 수 있게 하는 초기 수동 탐색 시스템입니다. AI 기반 IVR에서는 사용자가 자연어로 자신의 필요를 설명할 수 있고, 시스템은 그 입력을 적절한 대화 경로에 연결합니다. 

초기 IVR이 ‘청구 관련 문의는 3번을 누르세요’였다면, AI 기반 IVR은 ‘전화하신 이유를 말씀해 주세요’와 같습니다. 

AI 에이전트

AI 에이전트는 대화형 AI 기술의 가장 발전된 형태입니다. 다단계 프로세스를 실행하고, 연결된 도구를 자동으로 사용하며, 모호한 상황에서도 의사결정을 내리고, 엔드투엔드 workflow를 운영할 수 있습니다.

이 기술의 다른 여러 형태가 사람 주도로 작동했던 것과 달리, AI 에이전트는 간단한 사람의 요청을 받아 그에 대응하는 전체 시스템을 계획할 수 있습니다. 사람의 입력이 필요한 결정이 있을 때는 다시 사용자에게 연락합니다. 

AI 에이전트의 유연성과 강력한 기능은 전 세계 기업이 이를 workflow에 통합하는 주요 이유입니다.

대화형 AI는 실제로 어디에 활용할 수 있나요?

이제 기업은 단순한 FAQ 답변을 넘어서는 대화에 대화형 AI를 활용할 수 있습니다. ElevenAgents 같은 플랫폼에서는 음성 및 채팅 에이전트가 승인된 지식을 사용하고, 정의된 workflow를 따르며, CRM, 티켓 관리, 결제, 전화 시스템 같은 기존 도구에 연결해 대화를 해결로 이끌 수 있습니다.

아래 목록은 전체를 포괄하지는 않지만, 대화형 AI를 활용할 수 있는 몇 가지 방법을 보여 줍니다.

Use case
Business problem
What the agent handles
Success metric
Customer support
High call or ticket volume slows resolution
Product questions, account help, order status, billing questions, and human handoff
Resolution time, CSAT, containment rate
Sales and business development
Leads need fast follow-up and consistent qualification
Inbound screening, outbound follow-up, routing, and meeting booking
Speed-to-lead, qualified leads, booked meetings
Appointment scheduling and intake
Staff spend time on repeated booking and intake steps
Intake questions, booking, reminders, rescheduling, and routing
Booking completion, intake completion, no-show reduction
Front desk reception
Missed calls create lost revenue and poor customer experience
Call answering, routing, FAQs, messages, and after-hours coverage
Missed call rate, call completion, booked appointments
Collections and payment recovery
Teams need consistent payment follow-up
Account verification, reminders, payment links, and recorded commitments
Recovery rate, completed commitments, days to payment

이 목록은 시작점일 뿐입니다. 이러한 일반적인 활용 사례 외에도 기업들은 직원 교육, 내부 헬프데스크, 온보딩 등에 대화형 AI를 사용하고 있습니다. 팀이 운영 전반에서 음성 및 채팅 에이전트를 테스트하면서 새로운 활용 사례도 계속 등장하고 있습니다.

기업은 대화형 AI 도입으로 어떤 이점을 얻고 있나요?

대화형 AI의 이점은 실제로 무엇을 가능하게 하는지 통해 가장 잘 이해할 수 있습니다. 여러 산업에서 기업들은 이전에는 너무 시간이 많이 들거나, 너무 반복적이거나, 규모를 확장하기에 비용이 너무 많이 들었던 업무를 처리하기 위해 대화형 AI를 활용하고 있습니다. 실제 시나리오에서 어떻게 적용되는지 자세히 살펴보겠습니다.

고객 지원 문의를 더 빠르게 해결

많은 고객 문의에는 빠르고 정확한 답변이 필요하므로, 대량의 지원 요청 대기열은 대화형 AI에 적합합니다. 대화형 AI 에이전트는 고객의 문제를 파악하고 승인된 지식 소스를 바탕으로 답변하며, 복잡하거나 민감한 사례가 감지되면 대화를 상담원에게 전달할 수 있습니다. 

Klarna는 고객 지원에서 이것이 어떻게 구현되는지 보여 줍니다. 3,500만 명의 미국 고객을 대상으로 음성 AI를 1차 전화 지원에 활용하며, 기존 방식보다 최대 10배 빠르게 문의를 해결합니다. 

영업 후속 조치와 리드 검증 가속화

영업 및 사업 개발팀은 대화형 AI를 활용해 인바운드 리드에 더 빠르게 응답하고 아웃바운드 후속 조치의 일관성을 유지합니다. 에이전트는 인바운드 리드를 검증하고, 선별 질문을 하며, 계정 세부 정보를 수집하고, 미팅을 예약할 수 있습니다. 아웃바운드 workflow에서는 대화 기록을 잃지 않고 잠재 고객에게 전화를 걸어 결과를 기록할 수 있습니다. 

모기지 대출 분야에서 Better는 AI 음성 어시스턴트를 배포해 반복적인 자격 검증 전화를 처리하고, 실시간 자격 확인을 수행하며, 전화로 금리를 확정합니다. 그 결과 리드에서 금리 확정으로 이어지는 전환율이 2배로 증가했습니다. 

대규모 아웃바운드 대화 자동화

대규모 아웃바운드 대화에는 일관성, 명확한 기록, 결과를 안정적으로 수집하는 방식이 필요합니다. 여기에는 채권 회수 전화, 결제 알림, 휴면 계정 재활성화가 포함됩니다. 에이전트는 발신자를 안전하게 인증하고, 미납 잔액을 설명하며, 직접 결제 링크를 제공하고, 구조화된 결과를 내부 회계 시스템에 기록하는 데 활용할 수 있습니다.

Razorpay는 아웃바운드 음성 에이전트를 사용해 휴면 계정의 재이용을 유도하고 거래를 중단한 이유를 파악합니다. 이러한 재활성화 대화를 자동화함으로써, 사람 콜센터와 맞먹는 연결률을 달성했습니다.

예약 일정 관리 및 접수 간소화

예약 일정 관리와 접수에는 반복적인 연락, 자격 확인, 예약 단계가 수반되는 경우가 많습니다. 에이전트는 회원에게 먼저 연락하고, 자격을 확인하며, 전화나 채팅으로 직접 예약을 잡을 수 있습니다. 

Everlywell은 건강 검진 안내에 다국어 음성 에이전트를 활용하여 기존 자동 전화 시스템과 비교해 스페인어 사용 회원의 전환율을 3.5배 높였습니다. 

부재중 전화 감소 및 프런트 데스크 응대 개선

전화 기반 안내 업무가 필요한 기업은 대화형 AI를 사용해 일상적인 인바운드 전화를 받고 놓치는 문의를 줄입니다. 여기에는 병원, 지역 서비스 제공업체, 공공기관 등 통화자가 빠른 연결이나 기본 정보를 기대하는 조직이 포함됩니다. 에이전트는 수신 전화를 받고, 통화자를 올바른 부서로 연결하며, 정확한 메시지를 남기고, 업무 시간 외 예약 요청을 처리해 고객이 더 빠르게 응답받도록 합니다. 

텍사스주 미들랜드시는 AI ‘시민 컨시어지’를 사용해 넘치는 전화를 처리하고 주민에게 연중무휴 즉각적인 다국어 지원을 제공합니다. 

대화형 AI 플랫폼에서 확인할 사항

데모 품질뿐 아니라 실제 운영 환경에 배포할 준비가 되었는지를 기준으로 대화형 AI 플랫폼을 평가하세요. 짧은 테스트 대화는 인상적으로 들릴 수 있지만, 실제 배포에서는 다양한 고객 상황, 시스템 통합, 규정 준수 요건, 그리고 시간에 따른 업데이트를 처리해야 합니다.

플랫폼을 평가할 때 다음 기능을 확인하세요.

  • 음성 품질 및 지연 시간: 자연스럽게 들리고 실시간 대화가 계속 이어질 만큼 빠르게 응답해야 합니다. 로봇 같은 음성이나 지연된 응답은 상호작용 초반에 고객의 신뢰를 잃게 할 수 있습니다.
  • 언어 지원: 자연스러운 음성 품질과 정확한 응답을 유지하면서 대화 중 언어를 감지하고 전환합니다.
  • 통합 수준: CRM, 티켓 관리 플랫폼, 전화 시스템, 일정 관리 도구, 결제 시스템 같은 시스템에서 데이터를 읽고 다시 기록합니다.
  • 보안 및 규정 준수: SOC 2, HIPAA, GDPR, PCI DSS 또는 지역별 데이터 레지던시 등 업계에 필요한 인증, 개인정보 보호 제어, 배포 요건을 지원합니다.
  • 간편한 배포 및 반복 개선: 비기술 팀도 모든 수정 사항마다 엔지니어링 팀을 기다리지 않고 지식을 업데이트하고, 응답을 조정하며, 변경 사항을 테스트할 수 있어야 합니다.
  • 지원 모델: 설정 과정과 출시 후에도 신속한 지원을 제공합니다. 특히 실제 운영 동작 문제 해결, 새로운 시장으로의 확장, 새로운 활용 사례 추가 시 중요합니다.
  • 가드레일 및 테스트: 팀이 에이전트가 말할 수 있는 내용, 수행할 수 있는 작업, 에스컬레이션해야 하는 시점, 출시 전 대화를 테스트하는 방법을 정의할 수 있게 합니다.
  • 지식 베이스 제어: 승인된 회사 콘텐츠에 기반한 답변을 제공하고, 시간이 지나도 해당 콘텐츠를 쉽게 업데이트할 수 있게 합니다.

기술 팀의 경우 오케스트레이션 엔진도 평가할 가치가 있습니다. 대화 중 모델, 도구, workflow, 비즈니스 규칙이 함께 작동하는 방식을 결정하기 때문입니다. 

ElevenLabs로 첫 대화형 AI 만들기

ElevenAgents로 대화형 AI 에이전트를 구축하려면 웹 플랫폼 또는 API에서 시작하면 됩니다. 대부분의 에이전트는 1시간 이내에 운영할 수 있으며, 심층 통합, 승인 workflow, 맞춤 요구 사항이 포함된 더 복잡한 배포는 며칠이 걸릴 수 있습니다.

지금 구축할 준비가 되었든 아직 적절한 접근 방식을 검토 중이든, 시작할 수 있는 방법은 몇 가지가 있습니다. 더 까다로운 배포를 계획하고 범위 설정에 도움이 필요하다면 영업팀에 문의하세요. 또는 지금 플랫폼에서 시작하여 몇 분 안에 에이전트를 운영할 수 있습니다. 시작하기 전에 과정을 보고 싶다면 이 동영상 안내에서 첫 번째 에이전트를 단계별로 구축하는 방법을 확인하세요.

FAQ

최고 품질의 AI 오디오로 창작하세요