推出 LiveKit 推理服务:面向语音 AI 的统一模型接口
我们很高兴推出 LiveKit 推理服务,这是一个专为语音 AI 构建的低延迟模型网关。只需使用您的 LiveKit API 密钥,即可使用性能卓越的语音转文本 (STT)、大型语言模型 (LLM) 和文本转语音 (TTS) 模型。您不再需要创建和管理多个提供商账户和集成。
我们已与领先的模型提供商合作,在整个语音代理堆栈中提供一流的性能。通过单个 LiveKit 密钥,您现在可以访问来自以下提供商的模型:
- STT:AssemblyAI、Cartesia、Deepgram
- LLM:OpenAI、Google DeepMind、Cerebras、Groq、Baseten
- TTS:Cartesia、ElevenLabs、Inworld、Rime
LiveKit 推理服务现已向所有用户开放,所有 LiveKit Cloud 套餐都包含免费的每月使用额度。
用于调用模型的统一 API
构建语音代理时,您做出的第一个决定就是选择您的模型堆栈。模型的延迟、可靠性、说话风格和语言支持各不相同,因此值得尝试几种模型,看看哪些最符合您的用例需求。但测试不同的模型并不容易。每个提供商都需要单独的 API 密钥、计费设置和集成工作。最重要的是,STT 和 TTS 之间没有一致的 API,因为每个提供商的处理方式都不同。
LiveKit 推理服务简化了这一过程。您现在可以通过一致的 API 访问受支持的模型,无需额外的插件、计费账户或设置。
session = AgentSession(
stt="assemblyai/universal-streaming",
llm="openai/gpt-4.1-mini",
tts="cartesia/sonic-2:6f84f4b8-58a2-430c-8c79-688dad597532",
turn_detection=MultilingualModel()
)
将另一个语音插入您的代理管道就像更改 TTS 字符串值一样简单,例如 tts="inworld/inworld-tts-1:ashley"。
对于任何大规模构建语音代理的人来说,LiveKit 都是显而易见的选择。AssemblyAI 很高兴能通过 LiveKit 推理服务提供我们领先的流式 STT 模型。
- Dylan Fox,创始人兼首席执行官
LiveKit 长期以来一直是实时开发者基础设施的标准制定者。我们很高兴能加深与 LiveKit 的合作关系,成为 LiveKit 推理服务的主要文本转语音提供商。Cartesia 和 LiveKit 拥有共同的使命,即定义 AI 的基础范式。
- Karan Goel,联合创始人兼首席执行官
简化的并发管理
当您从开发转向生产时,并发限制成为下一个痛点。大多数模型提供商会限制开发者账户的使用量,但每个提供商的限制方式都不同。
- STT 并发(即 WebSocket 连接数)
- LLM 每分钟的令牌限制
- TTS 并发生成数
这些限制变得难以跟踪,尤其是当您的语音代理开始扩展时。您需要了解特定提供商的使用情况,而容量规划主要靠猜测。
LiveKit 推理服务在您的 LiveKit Cloud 控制面板中提供了所有并发限制的统一视图。限制按模型类型应用,而不是按提供商应用,这意味着您可以例如在 OpenAI 和 Gemini 等 LLM 模型系列之间切换,而无需重新协商配额或担心兼容性。

除了速率限制管理之外,LiveKit 推理服务还整合了跨提供商的计费。通过 LiveKit 推理服务调用的模型将根据每个提供商的 按需付费价格进行计费。
优化延迟和可靠性
端到端延迟对于语音代理至关重要。在基于文本的应用程序中,让用户多等待几秒钟来获取响应通常是可以接受的(或者对于推理模型来说甚至是期望的)。但是当与 AI 交谈时,延迟会使对话感觉尴尬或不自然。
模型性能是语音代理整体延迟的最大贡献者。一旦您将代理发布给真实用户,通常会看到意想不到的延迟峰值。许多提供商在需求量大时会对其公共推理端点进行请求排队。这些延迟或失败可能会中断对话,使您的代理感觉反应迟钝,从而严重影响用户体验。

LiveKit 推理服务通过几种重要方式减少延迟并提高可靠性:
全球共址
LiveKit 的云基础设施部署在全球数据中心网络中。当您将代理部署到 LiveKit Cloud 时,它与我们的推理服务在同一个数据中心运行。您的代理和模型之间的 API 调用通过我们的私有网络骨干传输,避免了公共互联网上的拥塞。
预置容量
我们直接与模型提供商合作,以确保预置推理容量。这使我们能够专用访问他们的模型,并允许我们绕过公共推理端点,后者在高峰需求期间更容易出现拥塞。
动态路由(即将推出)
利用我们为在数据中心之间低延迟流式传输语音和视频数据而构建的路由基础设施,我们正在构建一个路由系统,用于监控跨区域和提供商的实时推理延迟和可用性。利用这些信息,当我们检测到速度减慢或中断时,我们可以智能地将请求重新路由到替代提供商或数据中心,从而为您的代理提供可预测的延迟和正常运行时间。
LiveKit 推理服务现已推出,可用于 Python 和 Node Agents SDK。一个很好的起点是我们的语音 AI 快速入门指南和我们的代理示例,它们已更新为默认使用它。
我们构建 LiveKit 推理服务是为了让开发者更容易专注于为客户构建语音驱动的 AI 产品,而我们则负责处理无差异的基础设施工作。试一试,并告诉我们您的想法!