AssemblyAI 发布 Universal-Streaming:毫秒级流式转录,重塑语音 Agent 交互体验

ADK AssemblyAI官方 / ADK编译 2025-06-02 4 分钟 104 次浏览
速览导读 / Summary

AssemblyAI 正式推出专为语音 Agent 设计的 Universal-Streaming 模型。该模型以约 300ms 的超低延迟提供不可变(Immutable)流式转录,解决了传统 STT 方案中“先出后改”的痛点。相比 Deepgram Nova-3,其词发射延迟降低 41%,P99 延迟缩短近一倍,并在实体识别准确率上提升 12%。凭借仅$0.15/小时的透明定价与无限并发能力,Universal-Streaming 成为构建高响应、高可靠语音交互系统的理想选择。

词发射延迟 (Median) ~300ms 相比 Nova-3 降低 41%
P99 延迟 1,012ms 相比 Nova-3 缩短近 2 倍
整体识别准确率 91% 在嘈杂真实音频环境下
实体识别错误率 -21% 数字和字母组合错误减少
定价模式 $0.15/hour 基于会话时长,无限并发

Key Insights / 核心看点

  • 1 推出 Universal-Streaming 模型,提供约 300ms 的不可变流式转录,彻底解决传统 STT‘先出后改’的痛点。
  • 2 相比 Deepgram Nova-3,中位词发射延迟降低 41%,P99 延迟缩短近 2 倍,实现极速响应。
  • 3 在关键实体(邮箱、代码、ID)识别上表现卓越,整体准确率提升 12%,专有名词识别提升 5%。
  • 4 抗噪能力显著增强,相比 Deepgram Nova-2 减少 73% 的噪声误听,相比 Nova-3 提升 28%。
  • 5 采用 $0.15/小时透明定价,支持无限并发,无容量限制,适合大规模语音 Agent 部署。

AssemblyAI 发布 Universal-Streaming:毫秒级流式转录,重塑语音 Agent 交互体验

语音智能体(Voice Agents)在过去一年中发展迅猛,但在实际落地中仍面临诸多挑战:账户号码听错、尴尬的停顿、以及过早打断用户发言等问题,直接影响了任务完成率与用户体验。为填补这一空白,AssemblyAI 于 2025 年 6 月推出了全新定制的 Universal-Streaming 流式语音识别(Speech-to-Text)模型。

核心突破:不可变流式转录与极致速度

Universal-Streaming 最显著的创新在于其不可变(Immutable)流式转录机制。传统方案通常采用“先输出部分结果,最终再修正”的模式,导致开发者必须在等待最终结果或处理易变的中间数据之间做权衡。

Universal-Streaming 彻底颠覆了这一范式:

  • 极速响应:单词发射延迟(Word Emission Latency)低至 ~300ms。相比 Deepgram Nova-3(516ms),其中位延迟降低 41%,P99 延迟更是缩短了近 2 倍(从 1,907ms 降至 1,012ms)。
  • 即时可用:从 WebSocket 接收到的每一个字符都是最终结果,永不修改。这意味着语音 Agent 可以在用户尚未说完时,基于已转录的内容进行实时判断(例如区分“嗯”、“啊”等回音与实质性打断)。
  • 灵活配置:支持按需切换标点符号和自动大小写功能,以最大化响应速度。

精准识别:攻克关键实体与噪声挑战

在语音交互中,准确识别邮箱地址、验证码、产品 ID 等关键实体至关重要。Universal-Streaming 在保持低延迟的同时,大幅提升了这些领域的准确率:

  • 整体识别准确率提升 12%:在嘈杂的真实世界音频环境下,整体词准确率高达 91%
  • 实体识别优化:数字和字母组合(如订单号、ID)的错误率减少 21%,专有名词(人名、品牌名)识别准确率提升 5%
  • 抗噪能力增强:相比 Deepgram Nova-2,因噪声导致的错误输出减少 73%;相比 Nova-3 提升 28%

此外,该模型有效解决了“自信性误听”问题,即系统看似听懂了实则错误的情况(如将“周二”听成“周四”),从而避免后续流程的连锁错误。

智能断句与透明定价

  • 智能断句(Intelligent Endpointing):结合声学特征与语义分析,比传统仅依赖静音检测(VAD)的方法更精准地判断对话结束,并内置了可靠的降级机制。
  • 无限并发与透明计费:采用基于会话时长的定价模式,$0.15/小时。无论并发量是 5 还是 50,000,均无上限、无预留费用,让开发者能按实际使用量灵活扩展。

开发者价值总结

Universal-Streaming 不仅是一个工具,更是构建自然、流畅语音交互的基石。正如 Granola 的软件工程师 Jonathan Kim 所言:

"Universal-Streaming 对于我们的实时笔记功能效果惊人。速度差异立竿见影,用户几乎能即时看到对话转录结果。这种响应感远超我们之前的方案,这正是语音 AI 领域急需的突破。"

通过消除转录延迟与错误,Universal-Streaming 助力开发者实现更自然的人机对话,提升任务完成率,并让用户在复杂环境中也能获得可靠的语音服务。

Universal-Streaming delivers the streaming speech-to-text voice agents have been missing: faster immutable transcripts, higher accuracy, built-in endpointing, and pricing that scales with you.

JD Prater, Head of Product Marketing at AssemblyAI

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-08

Accio Work 2026 安全剃须刀刀片评测指南发布:覆盖敏感肌与硬茬胡须的全场景解决方案

Accio Work 于 2026 年 9 月发布最新评测指南,针对 2026 年湿剃市场的演变,深度解析了 8 款最佳安全剃须刀刀片。指南涵盖从 Astra Superior Platinum 的全能王者到 Feather Hi-Stainless 的极致锋利,特别强调了针对敏感肌肤(如 Derby Extra Super Stainless)和环保需求(如 Personna Lab Blue)的专项解决方案,为不同肤质与胡须类型的用户提供精准选型建议。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 发布厨房研磨工具智能指南:材料选择与性能优化解析

Accio Work 发布了一篇关于研磨钵(Mortar and Pestle)最佳材料选择的深度指南。文章详细对比了花岗岩、大理石、陶瓷、木材及不锈钢等主流材质在研磨性能、耐用性、维护难度及美学风格上的差异。该指南旨在帮助消费者及零售商根据烹饪需求(如香料粉碎、酱汁制作)做出精准决策,体现了 Accio Work 在垂直领域知识库构建与搜索优化方面的技术实力。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 2026 年迷你喷射快艇设计趋势:电动化与模块化重塑水上运动

Accio Work 发布 2026 年迷你喷射快艇设计趋势报告,展示了 9 款重新定义水上运动的新概念。核心亮点包括革命性的充气式电动快艇、热插拔电池系统的通勤者设计、以及专为家庭安全优化的模块化构建方案。这些设计利用先进复合材料与零排放电动动力,解决了传统水上运动便携性差、续航焦虑及安全性不足的问题,为个人娱乐与商业租赁市场提供了全新灵感。

Accio Work官方 / ADK编译 3 分钟