在 LiveKit Cloud 上部署和扩展代理

Deploy and run voice and video agents on LiveKit Cloud

在过去两年中,随着越来越多的团队将 LiveKit 语音 智能体 投入 生产,一些相同的问题不断出现:

  • 我应该为我的智能体池分配多少 CPU 和内存?
  • 我如何处理突发的流量高峰?
  • 我如何在整个会话中对性能进行测量和优化?

我们的智能体框架使构建语音或视频智能体变得容易,但在规模化运营智能体方面仍然很困难。今天,我们让它变得简单。

0:00
/1:57

有关如何将简单的语音助手部署到 LiveKit Cloud 的分步教程,请参阅我们的语音AI快速入门

当您在 LiveKit Cloud 上部署和运行您的智能体时,我们将为您处理所有操作挑战:

  • 有状态负载均衡。与 HTTP 请求不同,与语音或视频智能体的实时会话可以持续数分钟或数小时。为了保持状态和流时间,智能体在会话期间应保持在同一服务器上。LiveKit Cloud 的智能体调度程序专为长时间会话而构建。我们根据有效负载(而非连接数)来分配会话,同时考虑用户位置、CPU/GPU、内存和网络条件,以最小化端到端延迟和抖动。
  • 容量管理。智能体资源消耗大;您无法在单台机器上运行数百个活动的语音通话。这个数量级通常是几十个,这使得吸收峰值的缓冲更少。每个智能体对底层资源的压力也可能不同;语音智能体可能会运行较小的模型进行降噪,而视频智能体可能会使用浏览器执行操作。部署在 LiveKit Cloud 上的智能体可以弹性扩展以服务新的请求。当现有服务器接近其限制时,我们会自动启动新实例并将传入流量引导至新实例。
  • 平滑下线和即时回滚。当您更新智能体代码并部署新版本时,您希望避免任何服务中断或停机时间。LiveKit Cloud 将在版本更新期间平滑下线智能体服务器,允许现有通话完成,同时阻止该服务器接受任何新会话。如果您在更新中发现任何意外情况,您可以通过单个命令将智能体即时回滚到以前的版本。
  • 可操作性可观察性。要快速迭代您的智能体,您需要了解用户如何与它们互动。您的 LiveKit Cloud 仪表板中有一个新部分,提供了一套初始的智能体可观察性工具。对于每次智能体部署,您可以查看会话分析、构建日志以及正常运行时间、会话启动延迟和资源消耗等质量指标。

我们的理念一直是为您完成无差别的繁重工作,并收取低于您自己操作成本的费用。当您在 LiveKit Cloud 上部署智能体时,您的智能体主动服务用户每分钟的成本为 $0.01。我们称之为智能体会话分钟数。此价格包括在我们的全球数据中心网络中托管您的智能体、进出智能体的无限数据传输以及所有可观察性和分析功能。对于付费计划,智能体始终处于“热启动”状态,随时可以接受传入连接。


我们的客户已经在生产中运行着惊人的用例:提供心理健康支持的智能体、辅导学生困难科目的智能体、帮助患者安排医生预约的智能体,甚至是分流911紧急呼叫的智能体。

使团队能够在 LiveKit Cloud 上部署和运行智能体是朝着为语音、视频和物理 AI 应用提供端到端平台迈出的重要一步。在接下来的几个月里,我们计划推出新的功能和特性,使构建、测试、部署、扩展和监控您的智能体——软件开发生命周期的每个阶段——感觉像一个无缝的过程。

请继续关注,一如既往,我们很乐意听取您正在构建的内容以及我们如何提供帮助。您可以随时通过Slack联系我们。