- 洞察
什么是对话式 AI?
- 作者
- Jack Limebear
收听收听本文
始于 1950 年一个思想实验的技术,如今已在为全球企业接听客服来电、筛选潜在客户、预约和进行面试。
对话式 AI 已跨越关键门槛。过去只能让用户在固定菜单和预设回复中选择的系统,如今可通过语音和文本进行自然、实时的交流,理解意图、记住上下文,并端到端完成任务。
本指南将介绍对话式 AI 的方方面面:它的起源、底层工作原理、定义这一类别的组件与类型,以及企业如今如何在生产环境中部署它。
摘要:
- 对话式 AI 是一种可通过文本或语音与用户交流的技术,现代系统能结合完整上下文实时响应。
- 它建立在人工智能、机器学习和自然语言处理这 3 个基础领域之上;现代系统还叠加了 LLM、语音模型、检索和轮次管理功能。
- 该领域从 1966 年 ELIZA 的模式匹配发展而来,历经基于规则的 IVR、Siri 和 Alexa 等消费级助手,以及推动如今 LLM 发展的 Transformer 突破。
- 现代流程将语音识别、意图识别、对话管理、回复生成和语音合成串联成不到 1 秒的交互,并由轮次管理模型协调。
- 企业在客服、销售、催收、预约和前台等场景部署对话式 AI。ElevenAgents 等平台可通过一项配置,让同一智能体同时服务语音和聊天渠道。
什么是对话式 AI?
对话式 AI 是一类技术,用户可通过文本或语音与之交流,从人工智能系统获取信息。传统的人机交互方式仅限于固定的对话分支,用户需从预设命令中选择。现代对话式 AI 系统可以识别和分类人类语音,并结合完整上下文实时回应提问。
随着对话式人工智能能力不断增强,企业已将它应用于面向客户的系统。从优化 客户支持 热线,到构建可自动将客户数据填入保险表单的完整智能体,AI 助手都能胜任。
每个对话式 AI 系统都基于 3 个核心领域:
- 人工智能:帮助软件模拟通常需要人类智力或输入的认知功能的更广泛系统。在 AI 驱动的对话中,这包括根据输入协调任务、决定回复应包含哪些数据、将系统引导至特定组件,或查询内部资源。
- 机器学习:机器学习让 AI 系统能够处理海量数据集并识别其中的模式。通过从过往交互中学习,ML 可让对话式 AI 系统适应用户行为,并持续提升性能。
- 自然语言处理(NLP):自然语言处理引擎让计算机能够理解和使用人类语言。它是 对话式 AI 的基础支柱,使系统能够从输入中提取用户意图、生成连贯回复、管理对话,并不断优化回复以提升性能和准确性。
现代生产系统在这些基础上叠加了更多能力。大语言模型负责推理和回复生成,语音转文本和文本转语音模型构成语音层,检索系统让回答基于已批准的知识,轮次管理模型则负责实时对话节奏,所有功能均受安全护栏约束。下文的“对话式 AI 工作原理”和“核心组件”部分将逐一说明。
这 3 项核心技术最终形成流畅、连贯且具备完整上下文感知能力的对话式 AI 软件,用户可以用自然语言与之交流。许多系统支持多种语言对话,其中 ElevenAgents 可管理超过 70 种语言的自然语音。
对话式 AI 的历史与演进
对话式 AI 源于一个哲学问题。Alan Turing 在 1950 年发表的论文《计算机器与智能》中,以“机器能思考吗?”开篇。他试图通过一项模拟测试——模仿游戏——来回答这个问题。
模仿游戏有 3 名参与者:一名人类评估者、一台计算机和一名人类测试者。两名人类分别坐在不同房间,评估者与人类和计算机程序收发消息。如果人类评估者无法区分人类和计算机程序的聊天内容,Turing 认为该软件便展现出了在功能上等同于智能的能力。
70 多年后,图灵测试框架仍是此后每个对话系统的重要哲学标杆。不过,随着驱动这些智能体的人工智能日益先进,衡量标准已显著提高。
下面来看看科学家和数学家如何随着时间推移,围绕对话式 AI 使用并调整 Turing 的框架。

早期聊天机器人:1960 年代至 1990 年代
1966 年,Joseph Weizenbaum 创建了最早的自然语言处理程序之一。该软件名为 ELIZA,使用模式匹配,让用户以为它能理解输入并作出相应回答。ELIZA 的源代码从未被找到,但 Weizenbaum 于 1966 年在《计算语言学》发表的论文保留了一些痕迹。
最知名的 ELIZA 脚本名为“DOCTOR”,旨在扮演一位“模拟的罗杰斯学派心理治疗师”。对话以“有什么事困扰着你吗?”开始,提示用户说出心事。ELIZA 会将每条输入改写为一个相关问题。

例如,若用户输入“我的工作压力非常大”,ELIZA 可能会回答“你的工作中哪些方面让你压力非常大?”,再通过另一个提示继续对话。Weizenbaum 选择 ELIZA 这个名字,是为了致敬 Bernard Shaw 的《卖花女》;剧中 Eliza Doolittle 学习逐步改善自己的言谈。
几年后的 1973 年,Kenneth Colby 推出了 Parry,这款聊天机器人旨在模拟精神疾病患者的偏执状态。Parry 有超过 500 条控制回复的启发式规则,因此能给出看似灵活且细致的回答。它试图模拟真实精神科医患对话中的情绪复杂性。
Colby 收集了大量 Parry 与持证临床精神科医生之间的对话记录后发现,专家无法区分真实患者的记录和来自 Parry 的记录。
基于规则的系统:1990 年代至 2000 年代
尽管交互式语音应答(IVR)系统早在 1970 年代就已出现,但当时被认为成本高且过于复杂,难以广泛使用。直到 1990 年代末,企业才开始投资将计算机电话集成技术与 IVR 系统结合,用于在呼叫中心收集客户数据。
IVR 为人机交互提供了结构化方法。这类系统从用户收集信息,再将来电转接至合适的部门或服务。即使是早期 IVR,也提供了两种交互方式:使用语音识别的语音 IVR,以及通过按键输入数字的双音多频方式。
2000 年代,随着 VoiceXML 标准广泛采用、CPU 算力更易获取,IVR 的成本效益大幅提升。
尽管基于规则的 IVR 是 ELIZA 和 Parry 等早期聊天机器人的演进,讽刺的是它看起来反而像是倒退。它们确实扩大了交互范围,但只限于明确划定的类别。这种僵化性消除了 ELIZA 和 Parry 曾营造出的“正在与真人对话”的感觉。
任何超出预设 IVR 路径的输入,轻则得不到有效答复,重则导致系统失效。因此,人类来电者会调整自己的说法,以便机器理解。比如:“说‘账单’,即可联系财务顾问。”
基于 IVR 的对话路由核心支柱,为后来许多对话式 AI 系统奠定了基础。
聊天机器人的兴起:2000 年代
2001 年,ActiveBuddy 在 AOL Instant Messenger 上推出 SmarterChild。这是一款广泛使用的即时通讯机器人,可向用户提供天气更新、最新新闻或体育比分。尽管功能相当有限,SmarterChild 在其生命周期内仍产生了超过 30,000,000 次独立用户交互。
尽管实用性很高,SmarterChild 实际上并未为品牌带来收入。当时的 COO、后来的 CEO Stephen Klein 仍保留了这一功能,因为它展现了对话式计算的潜力。
SmarterChild 推出仅数年之前,A.L.I.C.E(Artificial Linguistic Internet Computer Entity)首次获得 Loebner Prize,被评为 2000 年最逼真的对话机器人。A.L.I.C.E 在其生命周期内 3 次获得 Loebner Prize,但始终未能通过图灵测试。
10 年后,第一个直接集成到消费设备中的主流 AI 助手出现了。Siri 集成了多项此前的技术,包括自动语音识别(ASR)、自然语言处理(NLP)和机器学习。
Siri 于 2010 年推出,是最早能够理解问题背后意图并作出相应回答的软件系统之一。Microsoft Cortana、Amazon Alexa 和 Google Now 等产品则在 2012 至 2014 年间陆续发布。Alexa 尤其值得一提:这种始终在线的家庭设备,是不依赖屏幕或触控输入的早期对话式 AI 形态。
面向客户的聊天机器人也逐渐成为大多数企业网站的常规组成部分。它们可以查询订单、查找资源、跟踪信息、重置密码,或向客户提供账户相关更新。尽管不如 Alexa 或 Siri 灵活,这些早期聊天机器人在特定且明确的任务上表现良好。
机器学习与 NLP:2010 年代
早期对话式 AI 助手由规则定义,依赖精心规划的决策树和庞大的人工整理回复库。进入 2010 年代,随着机器学习和 NLP 让模型可基于大量人类回复语料训练,这种开发模式开始转变。
循环神经网络(RNN)和长短期记忆(LSTM)模型的兴起,带来了能力上的重大转变。这些系统显著影响了机器处理序列输入和理解句中词语的方式。
Google 的 Word2Vec NLP 技术也通过将语义关系映射到几何空间,加速了 LLM 的发展。这种方法让模型能够估算词语间关系,从而帮助生成下一个词,并构建上下文准确的回复。
这些进展最终汇聚于 2017 年的论文《Attention is All You Need》,Google 在文中提出了 Transformer 架构。Transformer 使用自注意力机制,同时衡量输入中每个词与其他所有词的关系,使训练更快、生成内容也丰富得多。
2018 年,Google 发布 BERT(Bidirectional Encoder Representations from Transformers),这是一个采用 Transformer 架构的早期 AI 模型。它基于互联网文本进行预训练,因此只需相对较少的额外训练数据,就能完成许多下游任务。
从翻译、摘要到回答问题,乃至对输入情绪进行分类,到 2010 年代末,模型已开始展现出如今对话式 AI 所具备的通用能力。
语音缺口
在所有这些进步中,人机交互始终缺少一个基础要素。到 2020 年代,对话式 AI 已能读取输入、进行推理并生成长篇回复,但还不能真正与用户交谈。直到过去几年,语音层始终是完整对话式 AI 缺失的一环。
ElevenLabs 于 2022 年推出,旨在通过训练对声音运作方式有更丰富理解的生成模型,缩小人类语音与合成语音之间的差距。这些模型不止分析和重建音素,也试图理解语言的情感语境。
想看看实际效果?了解更多关于 Eleven v3,这是 ElevenLabs 迄今表现力最强的模型,能够传达完整的人类情感范围
对话式 AI 的工作原理
现代对话式 AI 系统可与用户协作,完成各种任务,搜索存储的信息,并向外部平台查询可帮助生成回复的数据。虽然回复可能在不到 1 秒内出现,但这短暂时刻中会串联起一系列工具和系统。
以下是一次交互从开始到结束的流程:
- 发起对话:用户通过文本或语音输入,与智能体建立会话。在语音系统中,智能体会进入监听状态,语音活动检测(VAD)会从背景噪声中分离说话者的音频。
- 分析输入:系统会将原始文本或音频转换为可供内部使用的结构化表示。对于文本,这意味着将输入转换为 token 并解析其结构。对于语音,语音转文本(STT)模型会将语音音频转录为文本;ElevenLabs 使用自研的 STT 模型 Scribe,可在 150 ms 内完成音频转录。
- 识别意图:这一阶段用于准确判断用户希望通过交互实现什么。不同的表达往往对应相同结果,比如两个用户分别说“改一下我的预订”和“更改我的航班”。意图识别还会从输入中提取航班号或日期等具体信息。
- 通过对话管理跟踪上下文:对话管理会记录核心信息:已确认的内容、用户已说的内容,以及仍待解决的问题。该层为系统提供持久记忆,因此“改到明天”可根据上下文理解为“将航班改到明天”。
- 生成回复:大语言模型(LLM)会汇集对话历史、从知识库检索的相关文档、所有可用工具输出和系统提示词,再生成符合上下文的回复。回复在发送前会经过安全护栏检查,确保内容处于可接受的话题范围内。
- 交付输出:用户可在屏幕上收到文本回复、听到合成语音,或同时获得两者。对于语音,回复会经过文本转语音模型;ElevenLabs 使用 Eleven v3 提供自然、不机械的回复。随后,智能体会让出发言权,等待用户下一轮发言。
- 持续学习与改进:生产级系统会产生海量交互数据。大规模分析这些数据可发现识别错误的意图、低质量回复和知识缺口,从而准确定位智能体需要持续改进的地方。
对于文本交互,流程基本相同,只是不包括 STT 和 TTS 层。消息直接交由 LLM 处理,回复以文本形式返回,依赖同样的底层智能能力。

底层协同工作的系统
上述步骤展现的是直接的交互,但真实对话很少一帆风顺。用户会打断、在句中转换话题,也会切换语言。为处理这些细微变化,对话式 AI 依赖一系列并行运行的底层系统:
- LLM:处理用户所说内容,决定如何回复,并判断是否需要触发工具或操作。
- RAG(检索增强生成):从内部知识库检索相关文档,让回答基于企业内容。
- STT(语音转文本):将语音音频转换为文本,供 LLM 处理。
- TTS(文本转语音):将 LLM 的回复转换回预选音色的语音。
- 轮次管理模型:检测用户何时说完,让智能体知道何时回复,使对话呈现自然的你来我往。
- 安全护栏:无论对话如何发展,都能让智能体遵循设定的脚本、保持合规,并处于你设定的边界内。
- VAD(语音活动检测):将主要说话者的音频与背景噪声分离,提升转录准确性,并过滤不属于对话的声音。
- 语音信箱检测:识别来电是否转入语音信箱而非由真人接听,以便智能体作出恰当回应。
流程的每一部分也并非严格按顺序运行。智能体在说话时可通过并行工具调用查询数据库或检查订单状态,因此检索不会让对话出现生硬的停顿。
轮次管理:让对话式 AI 更像真人
轮次管理值得深入了解,因为它是自然感智能体与僵化智能体之间最显著的区别。
现代轮次管理系统通过多种机制管理对话节奏:
- 预测式轮次管理:系统不会等待固定时长的静默,而是根据用户所说内容的语义,判断发言何时真正结束。这能防止智能体在句子中自然停顿时过早插话。
- 打断处理:当用户在回复过程中开始说话时,智能体会停止、清除正在生成的回复,并根据新输入生成新的回复,而不是盖过来电者的声音。
- 忽略打断词:可将“嗯哼”或“好的”等简短附和语配置为不触发完整打断,让智能体不会在来电者每次表示正在倾听时丢失对话进度。
- 软超时:如果 LLM 生成回复的时间超出预期,智能体会说出“让我想想……”等简短的填充语,而不是留下尴尬的沉默,从而保持自然的对话流畅度。
所有这些功能都有同一个目标:提供快速、自然且足够有帮助的回复,让客户不会觉得自己在和机器交谈。
对话式 AI 的核心组件
对话式 AI 由多种协同工作的技术和系统构成,共同服务终端用户。每个组件职责略有不同,共同促成最终产品。
以下是对话式 AI 系统的主要组件,以及它们发挥的作用。
大语言模型(LLM)
大语言模型是现代对话式 AI 系统的推理核心。LLM 会理解用户所说内容,汇集对话历史、检索到的文档和工具输出,决定应采取的行动,并生成回复。它因此承载了过去需要由独立的意图识别、对话管理和 NLG 引擎完成的大部分工作。
语音转文本与文本转语音
在语音交互中,流程两端由两个语音模型构成。 语音转文本 模型会将用户的语音音频转录为 LLM 可处理的文本,而 文本转语音 模型会将回复转换回语音。文本转语音模型的表现力很大程度上决定智能体听起来像真人还是机器人,因此 ElevenAgents 将用于转录的 Scribe 与用于语音输出的 Eleven v3 配对使用。
轮次管理模型
轮次管理模型负责对话的实时节奏:何时倾听、何时回复、何时让出发言权。它根据用户语音的语义判断发言是否真正结束,处理打断,并允许附和语通过而不影响回复。没有它,即使推理完美的回答也会在错误时机出现。
自然语言处理
自然语言处理是人工智能的一个分支,让计算机能够处理和理解人类语言。它包括分词、句法分析、语义分析和命名实体识别等子流程,可将原始输入文本转换为计算机能够处理的内容。
意图识别
意图识别是一种 NLP 技术,旨在解读人类语言,理解不同语义表达背后的含义。研究人员通常使用海量已标注示例训练意图识别引擎,使模型能够将输入映射到意图类别,即使一条消息包含多个需求也能处理。
对话管理
对话管理是一种随时间组织和规划对话流程的系统。它理解已说过的内容,以及系统完成请求仍需哪些信息,并通过管理分支对话逻辑判断对话何时“完成”。当用户说出意外内容时,该组件也会参与管理系统回复。
自然语言生成(NLG)
自然语言生成是对话式 AI 中负责语言表达的组件。它将模型输出转换为人类可读的语言,通常使用具有可变内部结构的模板系统。该组件的质量差异很大,更先进的系统可以完全从头生成回复。
机器学习
机器学习让对话式 AI 系统能够持续改进,而不是仅停留在基础水平。ML 模型从过往示例中学习,通过调整内部参数来更好地适应用户输入。
规模至关重要,因为 ML 的迭代改进使机器能够支持远超任何基于规则系统的人类语言复杂性。
主动学习
主动学习是机器学习中的一个组件,会选择系统最不确定的特定示例,并标记出来供人工审核。通过人工审核边缘使用场景的标注,研究人员可以对模型表现提供有影响力的反馈。
主动学习可显著加快模型性能提升,因为模型会减少在各方面平均改进的时间,转而更专注于问题区域。
文档认知
每个 AI 系统都以大量上下文信息为基础,包括内部知识库、政策文件和培训手册等丰富内容。将实时信息档案连接到模型后,模型便可查询这些文档,为用户提供实时答案,而非仅依赖训练过程中学到的事实。
对于用户或员工会提出具体问题的任何对话式 AI 系统,文档认知都是重要要素。
对话式 AI 技术的类型
作为一个广泛主题,对话式 AI 包含多种技术部署方式。特别是对于计划部署自有智能体的企业,理解不同类型的差异可大幅简化产品开发。
下面来看看几种主要的对话式 AI 技术类型。
AI 聊天机器人
AI 聊天机器人主要运行在网站和移动应用中,让用户与之互动以获取信息。一些 AI 聊天机器人深度集成内部常见问题和文档,因此能够处理复杂的多轮交互。
AI 聊天机器人的质量差异,主要体现在处理更复杂用户咨询的能力上。尤其当用户自己也不确定如何完成请求时,模型需要理解输入,将其拆解为底层需求,并查找相关文档来解决问题。
语音助手
语音助手增加了语音识别和语音合成系统,让用户可以通过音频与之互动。在某些不便打字的场景中,语音助手是更方便的对话选择。
语音助手的质量差异极大,从接近真人的声音到机械、呆板的音频样本,都会影响用户体验。即使底层回复有效,机械的表达也可能让用户感到不适并停止互动。
交互式语音应答
如前所述,IVR 是一种早期的手动导航系统,让用户从预定义的选项层级中选择。AI 驱动的 IVR 则让用户可使用自然语言说明需求,系统会将该输入连接到相应的对话路径。
如果早期 IVR 是“按 3 进入账单服务”,AI IVR 则是“请说明你的来电原因”。
AI 智能体
AI 智能体是对话式 AI 技术中最先进的形态。它们能够执行多步骤流程、自动使用已连接的工具、在面对模糊情况时做出决策,并端到端运行工作流程。
其他许多形态的此类技术由人主导,而 AI 智能体可根据简单的人类回复规划完整系统。当需要人类输入来做决定时,它们会再次联系用户。
AI 智能体的灵活性和强大能力,是全球企业将其整合到工作流程中的两个主要原因。
对话式 AI 有哪些实际应用场景?
企业如今可利用对话式 AI 处理不止是简单 FAQ 回复的对话。借助 ElevenAgents 等平台,语音和聊天智能体可使用已批准的知识、遵循既定 workflow,并连接 CRM、工单、支付和电话系统等现有工具,推动对话走向解决。
以下列表并不全面,但可让你了解对话式 AI 的一些应用方式。
这份列表只是起点。除这些常见应用外,企业还将对话式 AI 用于员工培训、内部服务台和入职等场景。随着团队在更多运营环节测试语音和聊天智能体,新的应用场景还将不断涌现。
企业采用对话式 AI 后获得了哪些收益?
对话式 AI 的价值,最好从它在实践中实现的能力来理解。各行业的企业都在使用对话式 AI 来处理过去耗时过长、重复性过高或成本过高而难以规模化的工作。下面详细看看它在真实场景中的表现。
更快解决客户支持咨询
高量级客服队列很适合使用对话式 AI,因为许多客户问题需要快速而准确的答案。对话式 AI 智能体可识别客户问题,根据已批准的知识来源作答,并在发现复杂或敏感情况时将对话转交给人工客服。
Klarna 展现了它在客户支持中的应用。它使用语音 AI 为 3,500 万美国客户提供一线电话支持,解决咨询的速度最高可达传统方式的 10 倍。
加快销售跟进和潜在客户筛选
销售和业务拓展团队利用对话式 AI 更快回应主动咨询的潜在客户,并保持外呼跟进的一致性。智能体可筛选主动咨询的潜在客户、提出筛选问题、收集账户详情并预约会议。对于外呼 workflow,智能体可致电潜在客户并记录结果,同时保留对话历史。
在抵押贷款领域,Better 部署 AI 语音助手处理重复性的资格确认电话、实时进行资格检查,并通过电话执行利率锁定,使其从潜在客户到锁定利率的转化率翻倍。
自动处理大规模外呼对话
大规模外呼对话需要保持一致性、清晰的记录和可靠的结果采集方式,包括催收电话、付款提醒和账户重新激活。智能体可用于安全验证来电者身份、说明未结余额、提供直接付款链接,并将结构化结果记录到内部会计系统。
Razorpay 使用外呼 语音智能体 重新激活休眠账户,并了解它们停止交易的原因。通过自动化这些挽回客户的对话,其接通率已达到人工呼叫中心的水平。
简化预约安排和信息登记
预约安排和信息登记通常涉及重复联系、资格检查和预约步骤。智能体可以主动联系成员、检查资格,并通过电话或聊天直接安排预约。
Everlywell 使用多语言语音智能体开展健康筛查联系,与传统自动电话系统相比,西班牙语成员的转化率高出 3.5 倍。
减少漏接来电,改善前台覆盖
有电话前台需求的企业可使用对话式 AI 接听常规呼入电话,减少遗漏的咨询。这包括诊所、本地服务商、公共机构,以及其他来电者期望快速转接或获取基本信息的组织。智能体可接听来电、将来电者转至正确部门、准确记录留言,并处理非工作时间的预约请求,让客户更快获得回应。
美国得克萨斯州米德兰市 使用 AI“市民礼宾”处理溢出电话,并为居民提供全天候即时多语言协助。
选择对话式 AI 平台时应关注什么
评估对话式 AI 平台时,应关注其生产就绪度,而不只是演示质量。简短的测试对话可能令人印象深刻,但真实部署需要应对客户差异、系统 集成、合规要求,以及持续更新。
评估平台时,请关注以下能力:
- 语音质量与延迟:语音自然,回复速度足以维持实时对话。机械的声音或延迟的回复,可能让客户在交互早期失去信任。
- 语言支持:可在对话中检测并切换语言,同时保持自然的语音质量和准确回复。
- 集成深度:可从 CRM、工单平台、电话技术栈、预约工具和支付系统等系统读取数据并写回数据。
- 安全与合规:支持所在行业所需的认证、隐私控制和部署要求,例如 SOC 2、HIPAA、GDPR、PCI DSS 或区域数据驻留。
- 部署和迭代的便捷性:让非技术团队无需每次修改都等待工程团队,即可更新知识、调整回复和测试变更。
- 支持模式:在设置期间和上线后提供及时支持,尤其是在排查生产环境行为、扩展至新市场或添加新应用场景时。
- 安全护栏与测试:让团队定义智能体可说的内容、可执行的操作、应在何时升级处理,以及上线前如何测试对话。
- 知识库控制:让回答基于已批准的企业内容,并支持随时间轻松更新这些内容。
对于技术团队,编排引擎 也值得评估,因为它决定模型、工具、workflow 和业务规则在对话中如何协同工作。
使用 ElevenLabs 创建第一个对话式 AI
使用 ElevenAgents 构建对话式 AI 智能体,可从网页平台或 API 开始。大多数智能体可在 1 小时内上线运行;涉及深度集成、审批 workflow 或自定义需求的更复杂部署,则可能需要数天。
无论你已准备好开始构建,还是仍在确定合适方案,都有多种入门方式。如果计划进行要求更高的部署,并希望获得范围规划方面的帮助,可联系销售团队;或者立即在平台上开始,几分钟内即可让智能体运行起来。如果想在开始前先了解流程,这段视频演示将逐步讲解如何构建第一个智能体。
