C 轮融资:迈向语音驱动的计算时代
今天,我很荣幸地宣布 LiveKit 的 C 轮融资。通过本轮融资,我们实现了一个重要的里程碑:估值达到 10 亿美元。Index Ventures 领投了这笔 1 亿美元的投资,Salesforce Ventures、Hanabi Capital 以及我们的长期支持者 Altimeter 和 Redpoint Ventures 参与其中。
致我们的客户、用户、开源贡献者、投资者和核心团队:感谢你们,没有你们就没有今天的我们。
语音 AI:即将到来的浪潮
语音是我们拥有的最自然的界面——我们每天都用它与彼此交流。而历史上第一次,我们可以用同样的方式与计算机互动。
当我们在 2025 年 4 月宣布 B 轮融资时,语音 AI 已经从 ChatGPT 内部的一个功能,扩展到金融服务、医疗保健、零售、客户支持、教育和机器人技术等数千种应用。初创公司正在构建能够执行以下任务的语音代理:处理索赔、辅导学生、分诊患者、支持客户以及面试候选人。
如今,大型企业正在评估和构建语音代理,以实现工作流程自动化、改善客户体验并释放新的收入。虽然许多用例仍处于概念验证阶段,但有些已经投入生产并以真正的规模运行:Agentforce 语音代理为全球顶级品牌提供客户支持,而特斯拉则将语音 AI 用于销售、支持、保险和路边援助。
我们预计 2026 年将是语音 AI 在全球数千个用例中广泛部署的一年。
但为了支持这种新的计算范式,还有很多工作要做。
一种新型应用程序
语音 AI 应用程序与网络应用程序不同。每个网络应用程序的基础协议都是 HTTP,它旨在可靠地在计算机之间传输文本数据。每个 HTTP 请求都是独立的且无状态的,这意味着网络后端默认没有历史信息。需要时,网络应用程序会从数据库加载状态,这可能需要额外的时间。
对于可以像人一样与之交谈的应用程序,传统的网络基础设施就会失效。
语音 AI 应用程序是实时且有状态的。与语音代理的对话可能持续几分钟或几个小时,代理会持续监听、思考和响应,同时在整个会话中保持上下文。
应用程序层的这种转变,从使用键盘和鼠标到与语音代理交谈,改变了底层的一切。你不能用同样的方式构建应用程序。你不能用同样的方式测试它。你不能用同样的方式部署和运行它。你不能用同样的方式监控它。整个堆栈必须为具有人类原生界面的实时、有状态应用程序而重建。
我们正在构建这个堆栈。它的每一个部分都设计成无缝协同工作。
代理开发生命周期
代理仍然是应用程序,像所有应用程序一样,它们从设计到生产都要经历一系列阶段。
构建
与网络应用程序一样,语音 AI 应用程序也分为前端和后端。为了构建前端,LiveKit 为所有平台提供了客户端 SDK。
在后端,LiveKit Agents(模仿自我们在 ChatGPT 语音模式上的工作,每月下载量超过 100 万次)为您提供了对代理编排的完全程序化控制,可以访问数百种 AI 模型集成,并自动处理对话动态,如轮次检测和中断。
但不是每个人都想从代码开始。有时,最好能快速地从模板开始,调整提示或勾勒出工作流程,并与朋友或同事分享链接——为了这种体验,我们最近推出了 Agent Builder。
测试与评估
AI 模型是随机的。给定相同的输入,它们不会产生相同的输出,因此你无法对非确定性代码编写简单的断言。你必须以统计方式测试这些系统,就像我们通过考试和面试评估人类表现一样。
LiveKit Agents 现在支持对代理代码编写单元测试,你可以将跟踪连接到 OpenTelemetry 以进行更深入的分析。
对于模拟(AI 版本的集成测试),即一个语音代理调用另一个语音代理,并运行数千次对话,排列组合提示、语言和语音属性,以建立对代理行为的统计信心,我们与 Bluejay、Hamming 和 Roark 合作。同时,我们也在探索如何将模拟更直接地集成到 LiveKit 平台中。
部署与运行
虽然部署网络应用程序和语音代理都涉及将代码推送到云端,但相似之处仅此而已。你的用户可能与代理交谈不确定的时间,并且你的用户群中可能会出现计划外的需求高峰。这需要一种不同的容量、连接和变更管理、负载均衡以及故障转移方法。今年早些时候,我们发布了无服务器代理,使全球构建者可以轻松部署代理。
语音 AI 应用程序还需要新的网络基础设施,专为以尽可能低的延迟在代理和用户所在位置之间传输语音数据而构建。我们建立了一个由数据中心组成的全球网络,作为一个统一的结构,针对语音和视频数据的路由进行了优化。如今,我们的网络每年处理数十亿次语音代理与用户之间的通话,涵盖网络和移动应用程序以及电话通话。
最近,我们与世界各地的电话运营商合作,将 LiveKit 的网络直接连接到 PSTN。这使我们能够在通过电话与语音代理交谈时提供最低延迟的体验。
一旦你的语音代理处于实时通话中,每个对话轮次通常都会串联多个模型:语音转文本、轮次和中断检测、LLM 和文本转语音。这些模型可能与你的代理代码运行在同一服务器或数据中心上,但大多数时候,你的代理是通过模型提供商的云 API 访问它们。模型提供商将其模型托管在世界各地的不同区域,可能离你的代理很远。有时提供商的服务会积压,推理请求排队;有时提供商的服务会中断。这些编排挑战可能会对端到端延迟产生负面影响,使代理对话断断续续且不可靠。
LiveKit Inference 抽象了大部分复杂性。我们为实时监控和路由语音而构建的系统也可以在模型提供商之间路由推理。我们还开始在我们的数据中心托管我们的模型,以便它们与您部署到 LiveKit Cloud 的代理位于同一位置。
观察
在我们推出 Agent Observability之前,没有为语音代理构建的 Datadog 等效产品——无法真正了解代理和用户在实时通话中如何交互。代理接听电话花了多长时间?当用户指定他们正在服用的处方药时,代理“听到”了什么?用户是否按下了“0”以与人工操作员通话?整个通话的平均轮次延迟是多少?代理是否调用了正确的工具为用户安排预约?
通过会话重放、跟踪、时间对齐的对话转录以及错误日志来回答这些问题是生命周期的关键最终阶段。作为开发人员,有了这些学习和见解,您就可以回到构建步骤,修改您的代理代码,并进行另一次迭代。
构建语音 AI 堆栈
语音是计算领域最大的范式转变之一。现在还处于早期阶段——它始于语音已经是界面的地方:电话通话、汽车和智能扬声器。
在接下来的几年里,随着新的外形尺寸出现,模型在轮次转换、工具使用和可靠性方面变得更好,语音原生应用程序将从新奇事物转变为默认设置。软件给人的感觉将不再是你需要导航的东西,而更像是你可以委托的东西。
LiveKit 正在构建基础模型和终端用户应用程序之间的开发堆栈和运行时。我们的目标很简单:让构建和扩展语音 AI 就像构建和扩展网络一样容易。
本轮融资有助于我们更快地发展。我们很高兴能与我们的客户、社区和合作伙伴一起构建语音驱动的计算时代。
