介绍 OpenAI 新款语音转语音模型如何为协作式多模型系统而设计,使语音智能体能够将任务委托给后端模型而不阻塞对话循环。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @kwindla今天很高兴看到新的 GPT-Live-1 模型和 API 正式投入生产使用。 对我而言,这个新模型最令人兴奋的地方在于:它经过训练,天生就适合与其他模型协同工作。这一点非常重要,因为语音智能体需要持续保持响应能力——你不能阻塞语音对话循环。但智能体往往需要进行工具调用、与后端系统交互,并利用测试时计算资源。 因此,GPT-Live-1 原生支持与后端模型的协作工作模式。你可以分别为前端模型和后端模型设置提示词。 以下是 GPT-Live-1 文档中的一个示例片段: ``` Delegation policy: Backend tools: - Appointments: check available times and create, change, or cancel bookings. Delegate to the backend when: - The user asks for availability or wants to create, change, or cancel a booking. - A correction changes a booking task already in progress. - The answer needs careful reasoning beyond a simple reply. ``` 多模型系统是软件的未来。 如今,我为自己构建的几乎所有东西,以及我与客户和合作伙伴开展的大多数工作,都涉及多个模型、多个推理循环、多个提示词,以及多层上下文管理与共享。 无论我是在构建语音智能体、桌面软件,还是在为我家中和云端各台机器上持续运行的所有编程智能体拼凑管理工具,情况都是如此。 我们才刚刚开始探索那些能够轻松高效地在多个大语言模型之间分配工作、协调输出的抽象模式。 OpenAI 的"委托"模式就是这样一种抽象。很高兴看到这一模式被训练进了一个生产模型,使我们能够在提示词层面原生地加以利用。 GPT-Live-1 也是第一个能够同时说话和倾听的生产级语音转语音模型。这一能力解锁了更好的轮次检测和更自然的语音行为——例如发出一些小小的填充音,让对方知道你在认真倾听,这种行为被称为"反馈信号"(backchanneling)。 此前已有几个研究模型实现了全双工音频流,其中最具代表性的是 Kyutai 推出的 Moshi 模型。如果你对大语言模型架构感兴趣,却还没有深入研究过 2024 年关于 Moshi 的论文,请停下来,立刻打开浏览器去读那篇论文。我保证绝对值得。 但 Moshi 的规模远小于 GPT-Live-1,而且自 Moshi 发布以来,AI 研究已经取得了两年的整体进展。全双工是一个极具挑战性的问题,能看到一款突破音频能力前沿的模型以通用可用产品的形式发布、并由生产级 API 提供服务,实在令人振奋。 说到 API,OpenAI 团队对实时 API 进行了演进,使其支持一整套上下文工程和会话管理能力。我们现在可以构建状态机对话图、带线程/回溯功能的模式,以及结构化数据输入——这些在第一代语音转语音 API 中都颇为困难。 向所有参与这一模型和 API 开发的 OpenAI 同仁表示祝贺。很高兴看到……不对,是很高兴听到这一成果。:-)