模型发布 - AI 资讯
20万页 智能选型深度横向博弈,紧密跟踪前沿大模型发布与 AI 落地实战应用解析。
Otter.ai 宣布 2025 年里程碑:营收破 1 亿美元,首发行业首个 AI 会议代理与全球企业版
Otter.ai 于 2025 年底宣布达成年度经常性收入(ARR)1 亿美元大关,并推出行业首个 AI 会议代理(Meeting Agents)套件。此次更新标志着 Otter 从单纯的会议转录工具转型为综合企业知识库,支持 HIPAA 合规,并新增法语、西班牙语及日语支持,旨在将非结构化语音数据转化为可量化的商业价值。
DomoAI 发布 Seedance 2.5:打造电影级短视频的新一代 AI 工作流
DomoAI 正式推出 Seedance 2.5,旨在解决短视频创作中‘素材匮乏’与‘风格割裂’的痛点。该版本通过引入电影级镜头语言理解、动态角色一致性控制及多模态提示工程,将 AI 视频生成从简单的动画复刻升级为具备叙事能力的短片创作工具。开发者可利用其 API 快速构建自动化短片生成管线,实现从剧本到成片的全流程自动化。
Mootion 发布:基于 Transformer 与 Diffusion 的下一代 3D 动画生成引擎
Mootion 正式发布,标志着 3D 动画行业迎来范式转移。该平台融合 Transformer 与 Diffusion 技术,构建全球最大规模的高质量 3D 运动数据库,支持从文本、图像到视频的多种输入生成逼真 3D 角色动画,大幅降低创作门槛并提升生产效率。
Hedra 登顶 2026 年度 AI 视频生成平台榜首:从模型聚合到视觉协作工作流
Hedra 在 2026 年 AI 视频生成平台排名中荣登榜首,其核心定位从传统的‘提示词生成视频’工具转型为‘AI 视觉协作工作流’。作为拥有自研推理能力的研究机构,Hedra 摒弃了复杂的节点式操作,强调多用户实时协作与异步任务处理。本文深度解析 Hedra 如何整合 Veo、Nano Banana 等多模型能力,打造类似 Claude 的 AI 智能体工作流,为专业团队提供从创意构思到成品交付的一站式解决方案。
Felo AI 发布视频生成新特性:文本/图片一键生成电影级短视频
Felo AI 正式强化其视频生成能力,支持从文本或单张图片直接创作电影级短片段。此次更新重点优化了生成质量与效率,并推出了限时优惠活动。开发者与创作者可利用其强大的上下文理解能力,快速产出高质量视觉内容,满足短视频营销与个人创作需求。
WaveSpeedAI 发布 Seedance 2.5 与 Wan 3.0:视频生成新纪元,重塑广告与电商内容工作流
WaveSpeedAI 于 2026 年 8 月 31 日重磅推出 Seedance 2.5 与 Wan 3.0 两款新一代视频生成模型,聚焦广告创意、电商产品视频及 UGC 内容生产。文章深度解析了模型在复杂镜头运动、角色一致性保持、图像转视频等场景下的表现边界,明确了创作者与开发者在不同工作流中的最佳实践,为商业视频内容生产提供了全新的技术基准。
Seedance 2.5 发布:原生 4K 画质与 30 秒长视频重塑 AI 商业内容生产
RunningHub 正式推出 Seedance 2.5 视频生成模型,针对商业内容生产痛点进行深度升级。相比 Seedance 2.0,2.5 版本支持原生 4K 画质、单次生成 30 秒长视频,并引入最多 50 个多模态参考输入。这些改进显著提升了人物一致性、场景连贯性及画面质感,使 AI 视频生成从“创意测试”迈向“规模化商业交付”,特别适合电商广告、短剧制作及品牌营销场景。
Krisp 发布语音翻译 API:企业级实时 Speech-to-Speech 翻译引擎开源
Krisp 正式推出 Voice Translation API,将运行于企业呼叫中心的高精度实时语音翻译引擎以自助服务形式开放给开发者。该 API 基于超过 100 万分钟真实通话数据训练,支持 30 种语言,在真实嘈杂环境下的翻译准确率高达 96%,显著解决了通用模型在真实场景中的幻觉与断连问题,为客服、医疗及金融领域提供生产级语音交互能力。
AssemblyAI 发布 Universal-3.5 Pro:原生支持 18 语种代码切换与高精度说话人分离
AssemblyAI 正式推出旗舰级异步语音转写模型 Universal-3.5 Pro。该模型原生支持跨 18 种语言的代码切换(Code-Switching),无需后处理即可精准识别混合语种对话;同时采用联合建模架构,实现了业界最准确的说话人分离(Speaker Diarization),有效解决重叠语音与短轮次对话的归因难题。相比竞品,其在代码切换场景下的词错误率(WER)显著降低,为复杂会议记录与客服质检提供全新标准。
Resemble AI 发布 2026 上半年深度伪造威胁报告:821 起攻击,Grok 主导合成文件
Resemble AI 于 2026 年 8 月发布《2026 年上半年深度伪造威胁报告》,揭示过去六个月全球范围内发生了 821 起经核实的深度伪造攻击。报告指出,攻击者利用 Grok 等模型生成了超过 346 万份合成文件,媒体曝光量达到 2928 亿次。报告强调了非自愿性色情内容(NCII)的严峻性,并详细分析了法律监管与民事赔偿的巨额风险,为开发者与合规团队提供了关键的安全基准。
Playground AI 发布 v3 模型:专为图形设计打造,Argus 视觉语言模型实现精准控制
Playground AI 正式发布 Playground v3 (PGv3),这是一款专为图形设计能力定制的大模型。与通用图像模型不同,PGv3 在提示词理解、排版、色彩精度及布局控制上实现突破。同时,团队推出了 Argus 视觉语言模型,能超越人类描述图像细节。此次更新标志着 AI 从“生成图像”向“精准设计”的跨越,为开发者提供了更强大的图形创作工具。
Luma AI Ray 3.2 发布:专为创意团队打造的智能视频生成新范式
Luma AI 正式发布 Ray 3.2 模型,旨在解决创意团队在广告与品牌内容生产中“生成即结束”的痛点。Ray 3.2 引入自我评估与重试机制,支持多关键帧序列控制,并整合 Veo、Kling 等多模型引擎。相比传统工具,它强调迭代优化而非重复生成,帮助团队在客户修改与本地化需求下高效完成从概念到交付的全流程。