AssemblyAI 发布 Universal-3.5 Pro:原生支持 18 语种代码切换与高精度说话人分离

ADK AssemblyAI官方 / ADK编译 2026-07-07 5 分钟 162 次浏览
速览导读 / Summary

AssemblyAI 正式推出旗舰级异步语音转写模型 Universal-3.5 Pro。该模型原生支持跨 18 种语言的代码切换(Code-Switching),无需后处理即可精准识别混合语种对话;同时采用联合建模架构,实现了业界最准确的说话人分离(Speaker Diarization),有效解决重叠语音与短轮次对话的归因难题。相比竞品,其在代码切换场景下的词错误率(WER)显著降低,为复杂会议记录与客服质检提供全新标准。

代码切换平均 WER 7.69% 显著低于竞品,优于 Deepgram Nova-3 (12.22%) 和 ElevenLabs (8.77%)
支持语言数量 18 种 原生内置多语种代码切换能力
架构模式 联合建模 说话人分离与转写一体化,无需时间戳对齐

Key Insights / 核心看点

  • 1 原生支持 18 种语言的代码切换,无需后处理即可精准识别混合语种对话,WER 低至 7.69%。
  • 2 采用联合建模架构,将说话人分离与语音转写整合,有效解决重叠语音与短轮次对话的归因难题。
  • 3 在代码切换场景下,性能显著优于 Deepgram、ElevenLabs 及 OpenAI 等主流竞品。
  • 4 专为现实世界音频设计,能够处理背景噪音、口音差异及复杂的语言切换逻辑。

AssemblyAI 发布 Universal-3.5 Pro:原生支持 18 语种代码切换与高精度说话人分离

7 月 7 日,语音识别巨头 AssemblyAI 宣布推出其最新旗舰异步语音转写模型——Universal-3.5 Pro。该模型专为应对现实世界音频的复杂性而设计,核心突破在于原生支持代码切换(Code-Switching)说话人分离(Speaker Diarization)的联合优化,彻底改变了传统 STT 系统在处理多语种混合对话时的局限性。

核心突破:原生代码切换与多语言支持

在传统的语音转写系统中,代码切换通常被视为边缘案例。大多数模型被迫将对话强制归一化为单一语言,导致混合语种(如英印双语、法英混合)的对话出现严重误译或信息丢失。

Universal-3.5 Pro 摒弃了这种“一刀切”的策略,实现了原生代码切换

  • 18 语种无缝切换:模型内置了 18 种语言的支持,能够根据说话人实际使用的语种实时转录,无需额外的配置或后处理步骤。
  • 上下文感知能力:模型能够理解语言切换背后的语义逻辑。例如,在英印双语对话中,当说话人从英语切换到印地语时,模型能准确捕捉到语法标记(如“了”字)所蕴含的时间状态变化,而非像竞品那样将其简单翻译为英文。
  • 基准测试表现:在代码切换音频的归一化词错误率(Normalized WER)测试中,Universal-3.5 Pro 在平均 WER 上达到了 7.69%,显著优于 Deepgram Nova-3 Multilingual (12.22%)、ElevenLabs Scribe v2 (8.77%) 以及 OpenAI GPT-4o Transcribe (44.58%)。

技术革新:联合建模实现精准说话人分离

说话人分离(Diarization)长期以来是语音识别的“事后补充”,通常独立于转写系统运行,仅通过时间戳对齐来标注说话人。这种分离式架构在处理重叠语音、打断和快速轮转时往往失效。

Universal-3.5 Pro 采用了联合建模(Joint Modeling)架构,将“说什么”与“谁在说”整合在同一个模型中:

  • 端到端标注:模型直接输出带说话人标签的转录文本,而非先转写再标注。
  • 捕捉复杂交互:能够精准识别短轮次对话、快速来回应答以及重叠语音,避免了传统方法中句子被错误分割或归因的问题。
  • 业务价值:在呼叫中心场景中,这一特性对于区分客服与客户的意图、分析情绪交互至关重要。相比仅依赖时间区域(DER)的传统指标,Universal-3.5 Pro 采用了结合转写准确率与说话人归因的综合评估体系,在真实通话数据中展现了更高的可靠性。

实际应用价值

对于开发者而言,Universal-3.5 Pro 降低了多语种会议记录与客服质检的门槛。企业无需再维护复杂的混合语种规则引擎或外挂的说话人分离模块,即可直接获得高质量、带说话人标签的原始对话数据。这对于需要处理全球多语言客户、跨国会议记录以及高噪音环境下的语音分析场景具有极高的实用价值。

“Universal-3.5 Pro 是专门为现实世界音频设计的,它原生处理代码切换,将说话人分离与转写整合为单一模型,从而捕捉到真实对话的完整复杂性。” —— AssemblyAI 团队

关键指标总结

指标 值/描述 备注
支持语种 18 种 原生代码切换支持
平均 WER (代码切换) 7.69% 优于竞品约 30%-40%
架构类型 异步 (Async) 联合建模 (Joint Modeling)
输出特性 说话人标注转录 无需后处理对齐

AssemblyAI 表示,随着模型在代码切换和说话人分离上的持续迭代,Universal-3.5 Pro 将成为处理复杂多语种语音任务的首选方案。

Universal-3.5 Pro handles real-world audio the way it actually happens. Native code-switching across 18 languages captures every word in the language it was spoken.

AssemblyAI Team

同主题深度资讯

查看更多 →
模型发布 2026-09-08

Framer AI 发布 CMS List Field:重构重复内容管理,赋能动态网站构建

Framer 于 2026 年 9 月正式发布 CMS List Field,彻底革新了重复内容(如 FAQ、产品特性)的管理方式。该更新引入原生列表字段,支持通过 Framer Agent 一键迁移旧数据,并优化了编辑器的内容复用与排序能力。此次更新不仅解决了垂直视频嵌入等长期存在的 Bug,还显著提升了大型 CMS 集合的滚动性能,为开发者提供了更强大的动态内容构建工具。

Framer AI官方 / ADK编译 4 分钟
模型发布 2026-09-08

Ajelix 自研 GPU 基础设施并推出企业级 Agentic 平台,解决数据主权与生产落地难题

Agentic AI 平台 Ajelix 宣布投资自建 GPU 计算基础设施,并正式发布面向企业的 Ajelix Enterprise Platform。此举旨在解决企业级 AI 落地中数据不可控、审计困难及中断风险等痛点。新平台提供从智能体编排、RAG 知识库到严格治理的全栈能力,支持私有化部署,助力企业将 AI 从实验阶段平稳过渡到生产运营。

Ajelix官方 / ADK编译 4 分钟
AI 工具 2026-09-08

DreamFace 发布 AI 直播生成器:零设备打造虚拟主播,重塑内容创作流程

DreamFace 正式推出 AI 直播生成功能,彻底消除传统直播对相机、灯光及推流软件的依赖。用户仅需上传照片或选择虚拟形象,配合脚本即可在数分钟内生成具备真实直播节奏与能量的视频。该工具支持游戏、带货、播客等多种模板,让创作者无需露脸即可测试新内容形式,大幅降低内容生产的门槛与试错成本。

DreamFace官方 / ADK编译 3 分钟
技术解读 2026-09-08

Accio Work 发布 F1 电视转播技术深度解析:8K 流媒体与超低延迟架构揭秘

Accio Work 深度编译 F1 TV 如何永久改变体育转播的历程,聚焦于日本市场策略、8K 流媒体技术革新及超低延迟架构。文章揭示了现代体育直播对带宽、编码及 CDN 的极致要求,包括 45% 的带宽消耗增长和亚 200ms 延迟标准。同时探讨了数字观众如何驱动 23 亿美元的周边销售,为开发者与架构师提供了从传统广播向数字化、智能化转型的宝贵案例与技术指标参考。

Accio Work官方 / ADK编译 3 分钟