什么是对话式 AI 延迟,哪些因素会影响它?
- 发布时间
- 最近更新
对于对话式 AI而言,延迟决定了应用是好还是出色。
对话式 AI 的本质是追求模拟与人交谈的感觉,复现人类对话中的情绪变化、音高和节奏。再加上从你停止说话到 AI 智能体开始回应之间应有的“自然”停顿,就能得出一个基于真实人类沟通方式的延迟目标。
希望大规模部署对话式 AI智能体的企业,若想实现这种自然体验,就需要尽可能降低延迟。本文将介绍什么是对话式 AI 延迟、整个流程中造成延迟的原因,以及如何降低延迟的概览。
摘要
- 对话式 AI 延迟,是指从用户停止说话到听到智能体说出第一个字之间的端到端总延迟。
- 延迟超过 700 ms 的智能体可能会显得不自然;超过 1,200 ms 时,用户放弃率会很高。
- 延迟会在对话式 AI 流程的每个阶段累积。
- ElevenAgents 通过统一架构处理完整流程,让企业也能轻松使用低延迟对话式 AI。
什么是对话式 AI 延迟?
对话式 AI 延迟是指说完话后,系统作出回应所需的总时间。现代 AI 模型通常以 ms 衡量延迟。实际上,总延迟由多个独立流程构成,每个流程都为端到端处理链路贡献一部分时间。
典型的对话式 AI 流程如下:
- 用户说话
- 语音转文本模型将音频转录为文字
- 将转录文本传给 LLM 模型,由其生成回复
- 随后,LLM 生成的文本会通过文本转语音模型合成为音频
- 向用户播放音频
每个阶段都会为对话式 AI 系统增加延迟。因此,讨论延迟时需要先明确几个不同的缩写。
模型推理延迟
模型推理延迟是模型生成输出所花费的时间,在内部测量且不包含外部因素。它反映引擎处理典型输入的速度。例如,Flash v2.5 的模型推理延迟约为 75 ms。借此可以比较不同厂商模型的速度。
不过,这不是用户实际感受到的延迟。它仅指模型生成输出所需的总时间。
LLM 首个 token 时间
大语言模型(LLM)的首个 token 时间(TTFT)是指大语言模型处理提示词并生成第一个可用输出 token 所需的总时间。
当 LLM 传来第一个 token 时,TTS 就会开始生成。因此,这项指标衡量 LLM 开始触发 TTS 模型运行所需的时间。对于大多数端到端对话式 AI 系统,LLM TTFT 占总延迟的很大一部分。
TTS 首段音频时间(TTFA)
TTS 首段音频时间(TTFA)衡量从首次发出 TTS 请求,到第一段音频实际从模型输出之间的时间。它描述的是模型推理延迟,但专用于 TTS 引擎。
端到端首段音频时间(TTFA)
端到端 TTFA 就是对话式 AI 的总延迟。它涵盖流程中的每个环节,包括语音识别、LLM TTFT、TTS、TTFA,以及各步骤间的所有网络传输。讨论整体对话式 AI 延迟时,这才是用户实际感受到的指标。
用户说完话后,要等到端到端 TTFA 结束,才能听到智能体的回复。它是一个综合指标,因此优化流程中的任何环节都能改善它。
为什么对话式 AI 延迟很重要
当用户与 AI 智能体交流时,延迟会直接影响他们对体验的评价。低延迟能缩短等待回复的时间,让对话更自然,也让智能体显得更可靠。
高延迟的智能体会显得生硬、能力不足,即使回复质量相同也是如此。对企业来说,哪怕只相差几百 ms,也会让人感觉等了很久,使客户支持智能体显得笨拙且低效。
以下场景可以说明对话式 AI 延迟在实际使用中的重要性:
- 低于 500 ms:对话式智能体响应迅速、体验流畅。用户可能察觉不到停止说话与收到首个回复之间的延迟,对话得以自然进行。
- 500 ms 至 1000 ms:用户停止说话到收到回复之间的延迟可能变得明显。这段时间稍微长了一点,用户可能会提前调整行为,例如重复说一遍,或停下来确认智能体是否真的理解了。
- 高于 1000 ms:延迟开始让人觉得缓慢,停顿会让部分用户感觉 AI 智能体没能跟上对话节奏。转录记录中可能偶尔出现打断,或要求转接人工客服。在某些情况下,用户可能会挂断电话。
每个延迟阈值都会转化为实际业务结果。
在较低延迟范围内,客户服务智能体可以自然应对咨询,帮助用户解决问题,无需额外协助。这能减轻人工客服的压力,并维持较高的客户满意度。在较高延迟范围内,反应迟缓的智能体则会让客户感到沮丧。
我们在另一篇文章中定义了语音智能体延迟预算基准,说明 P50 和 P95 值下的理想延迟水平。
什么会导致对话式 AI 延迟?
对话式 AI 延迟涵盖多个流程,每个环节都会影响总延迟。因此,低延迟的瓶颈更多是系统层面的问题,不能只靠选择更好的模型来解决。毕竟,流程中会涉及多个模型。
面向开发者,我们编写了一份深入的技术指南,介绍语音智能体延迟优化,可用于优化端到端首段音频时间(TTFA)的每个阶段。
除了核心流程,电话系统和函数调用等因素也会增加延迟,尽管它们不属于模型基础设施内部环节。
以下概述影响对话式 AI 延迟的所有因素。
自动语音识别
语音识别的延迟并非生成转录文本所需的时间。用户说话时,转录会在后台进行,因此说话结束时,文本通常已基本准备完成。
这里的延迟实际是从说话结束到转录文本最终确定并传递到下一阶段之间的间隔。Scribe v2 Realtime 将这一间隔缩短至约 150 ms,通过持续流式传输,在轮次结束时立即准备好输出。

轮次判断与终点检测
语音活动检测器(VAD)位于语音识别与语言模型之间,负责判断用户是否真的说完了。
为避免误判,VAD 会等待达到持续静音阈值后,才确认当前轮次结束。这段等待会在语言模型开始处理前增加延迟。但这点额外延迟能避免用户仍在说话时系统就开始回应。
从技术上说,如果其他所有对话式 AI 组件都没有延迟,轮次判断带来的延迟反而是好事。人类听完话后也会稍作停顿再回应,机器采用类似停顿会让交互更真实。不过,由于其他组件已经会产生延迟,因此最好将此处延迟降至最低。

语言模型处理
当语音转文本(STT)引擎准备好转录文本后,语言模型会生成回复。这里的延迟是开始生成 token 所需的时间,而非生成完整回复所需的时间。token 一生成就会直接流式传入 TTS 阶段,因此最重要的是 TTFT。
除模型选择外,提示词长度和知识库大小也会影响这一阶段。LLM 需要考虑的上下文越多,所需时间越长。在大规模设计这类系统时,需要在实用的知识库与精简提示词之间取得平衡,才能保持速度。

语音合成
TTS 延迟是指从接收语言模型的首批 token,到音频开始播放之间的时间。由于 token 的到达速度快于人类语音播放速度,合成模型无需等待完整回复。TTS 延迟严格来说就是生成首段音频所需的时间。
过去,这一阶段是对话式 AI 延迟的最大单项来源,旧模型开始生成语音通常需要 2-3 秒。ElevenLabs 的Flash v2.5直接解决了这一问题,以约 75 ms 的延迟实现语音合成,将这一瓶颈从数秒缩短到不足 1 秒。

网络延迟
从一个地点向另一个地点传输数据必然会增加延迟,而地理距离只会进一步加重网络往返延迟。
端到端回复需要多个组件协同工作,经过多次网络跳转后,延迟可能会显著累积。

函数调用
函数调用会在 LLM 阶段增加 API 往返时间。快速的内部查询只会增加几十毫秒,而支付处理系统或库存系统可能增加数秒。延迟完全取决于所调用的服务,因此这是最难直接优化的阶段。
最有效的方法是在工具调用完成前,就提示 LLM 作出回应。例如,“我来帮你查一下”可以在外部调用完成期间持续吸引用户,而不是留下沉默。工具并行运行时,语音回复便可开始。

如何降低对话式 AI 延迟
降低对话式 AI 延迟,需要按影响程度处理流程中的每个阶段。单项改进确实能减少延迟,但要实现最大改善,仍需从整体上优化整个流程。
以下原则可从整体上帮助你降低对话式 AI 延迟:
- TTS 模型选择:针对速度优化的 TTS 模型,如 Flash v2.5,与针对质量优化的模型,如 Elevenv3,采用不同的架构。对于实时语音智能体,正确选择是在满足延迟目标的前提下质量最高的模型,而这几乎总是为速度优化的模型。
- LLM 模型选择:更小、更快的 LLM 通常比大型模型拥有更低的首个 token 时间。选择能满足任务质量要求的最快 LLM,与选择 TTS 模型同样重要。
- 流式传输:流式 TTS 会在合成过程中分段返回音频,因此模型仍在生成其余内容时,用户就能听到第一个字。这个概念同样适用于 LLM 输出:语言模型生成后续内容时,可在第一个句子生成后就启动 TTS 合成,从流程中节省延迟。
- 系统提示词设计:用户可以通过将指令移入程序或 workflow,而不是将其保留在每个决策步骤中,来精简系统提示词。这样可减少模型在每轮中需要推理的上下文。
- 护栏机制:在流式模型中运行护栏机制,可以在检查完成前开始播放输出,而无需等检查结束后再播放。
- 模型共置:尽可能使用共置模型,例如 ElevenLabs Agents 技术栈,让各组件彼此靠近,避免在独立托管模型之间跳转而增加延迟。
- 地理位置:让服务器靠近用户可显著降低延迟,因为这会直接减少网络对端到端 TTFA 的影响。
除上述因素外,还可参考这份延迟优化技术指南,了解更多详情。
使用 ElevenAgents 开始构建低延迟对话式 AI
构建和部署智能体时,对话式 AI 延迟是必须重点考虑的问题。ElevenAgents 将延迟优化融入整个流程。从通过重叠技术节省时间,到降低各组件的模型推理延迟,ElevenAgents 可为企业构建低延迟对话式 AI 技术栈。
归根结底,目标是打造真实的交流体验。用户应感受到如同与人交谈般轻松,同时享受计算机程序带来的优势。通过缩短各个子流程的时间,这一目标如今已能实现。
了解更多有关ElevenAgents的信息,或联系销售,立即开始。
.webp&w=3840&q=80)
.webp&w=3840&q=80)
