小红书发布 UniNote:统一多模态嵌入,重构搜索与推荐架构

ADK APIMart官方 / ADK编译 2024-11-01 5 分钟 72 次浏览
速览导读 / Summary

小红书推出 UniNote 模型,旨在打破文本、图像、音频和视频的模态壁垒,将各类内容映射至单一共享向量空间。通过两阶段训练策略(InfoNCE 损失与 Hard Negative Mining)及检索 - 排名统一框架,UniNote 在跨模态检索任务中实现了高达 26 个百分点的 NDCG@10 提升。该方案致力于简化系统架构,减少因模型分裂导致的语义漂移,为构建高效的多模态搜索与推荐系统提供了新范式。

NDCG@10 提升幅度 26% 相比标准 CLIP 模型在共享空间中的表现
视频上下文窗口 3-25 秒 当前支持的视频时间片段限制
训练阶段 2 阶段 包含对比学习与相关性优化

Key Insights / 核心看点

  • 1 构建单一共享向量空间,实现文本、图像、音频、视频的统一检索与排名。
  • 2 采用两阶段训练策略,结合 InfoNCE 损失与 Hard Negative Mining 提升排序精度。
  • 3 在跨模态检索任务中实现 NDCG@10 高达 26 个百分点的性能提升。
  • 4 通过检索与排名模型统一,消除语义漂移,简化系统架构设计。
  • 5 支持可变长度嵌入,平衡存储成本与检索效率。

UniNote:小红书统一多模态嵌入架构深度解析

在 AI 应用日益复杂的今天,如何高效处理文本、图像、音频和视频的混合内容,一直是搜索与推荐系统的核心挑战。近日,小红书(Xiaohongshu)发布了其最新的多模态模型 UniNote,提出了一种革命性的思路:“一个笔记,一个嵌入,一条搜索路径”

核心突破:从“分治”到“统一”

传统多模态系统通常将不同模态内容分别处理,导致检索(Retrieval)与排名(Ranking)阶段往往依赖不同的模型或索引,这不仅增加了系统复杂度,还容易引发语义漂移(Drift)。

UniNote 的核心创新在于构建单一的共享向量空间

  1. 统一表示:利用 ASR(语音识别)、OCR(光学字符识别)和 VLM(视觉语言模型)将音频、图像、视频转化为统一的笔记格式,最终映射到同一个高维向量空间中。
  2. 检索与排名一体化:摒弃了传统的双模型架构,UniNote 使用同一套嵌入系统同时服务于候选检索和最终排名,确保两个阶段对“相关性”的理解完全一致。

关键技术架构

UniNote 的成功依赖于严谨的训练策略与架构设计:

1. 两阶段训练策略

  • 第一阶段:对比学习 采用 InfoNCE loss 进行训练,迫使模型将同一笔记的不同模态表示拉近,即使它们来自不同的数据源。
  • 第二阶段:相关性优化 引入 Hard Negative Mining(困难负样本挖掘)。模型不仅学习匹配内容,更要学会区分“看似相关实则不相关”的干扰项。这种机制显著提升了排序的锐度。

2. 可变长度嵌入

系统支持根据任务需求动态调整嵌入长度,在保留精度的同时优化存储成本与检索速度,实现了效率与效果的平衡。

3. 跨模态检索增益

在 Item-to-Item 检索任务中,UniNote 展现了惊人的性能提升。通过共享空间对齐,其 NDCG@10 指标相比标准 CLIP 模型提升了高达 26 个百分点。这意味着在匹配图片与商品详情页、视频片段与文本描述等场景下,系统能更精准地找到用户意图。

局限性与未来展望

尽管 UniNote 在架构简化与检索性能上取得了显著成果,但也存在一些当前限制:

  • 细粒度匹配挑战:当视觉与文本信号冲突时,仍可能出现排名错误或幻觉。
  • 视频时间窗口限制:目前主要支持 3 到 25 秒 的时间上下文,对于长视频的深度序列理解仍有待突破。

对开发者的价值

对于致力于构建搜索、发现或推荐系统的开发者,UniNote 的启示在于:统一的嵌入空间可以大幅降低系统维护成本,减少因多模型协同带来的不一致性。 虽然对齐质量仍是决定用户体验的关键,但 UniNote 证明了通过架构层面的统一设计,可以在不增加额外模型负担的前提下,显著提升跨模态交互的流畅度与准确性。

UniNote 的核心思想很简单:一个笔记,一个嵌入,一条搜索路径。我们不再将文本、图像、视频和音频视为孤立的系统,而是将它们放入同一个共享向量空间,用于检索和排名。

小红书技术团队

同主题深度资讯

查看更多 →
模型发布 2026-09-08

Framer AI 发布 CMS List Field:重构重复内容管理,赋能动态网站构建

Framer 于 2026 年 9 月正式发布 CMS List Field,彻底革新了重复内容(如 FAQ、产品特性)的管理方式。该更新引入原生列表字段,支持通过 Framer Agent 一键迁移旧数据,并优化了编辑器的内容复用与排序能力。此次更新不仅解决了垂直视频嵌入等长期存在的 Bug,还显著提升了大型 CMS 集合的滚动性能,为开发者提供了更强大的动态内容构建工具。

Framer AI官方 / ADK编译 4 分钟
模型发布 2026-09-08

Ajelix 自研 GPU 基础设施并推出企业级 Agentic 平台,解决数据主权与生产落地难题

Agentic AI 平台 Ajelix 宣布投资自建 GPU 计算基础设施,并正式发布面向企业的 Ajelix Enterprise Platform。此举旨在解决企业级 AI 落地中数据不可控、审计困难及中断风险等痛点。新平台提供从智能体编排、RAG 知识库到严格治理的全栈能力,支持私有化部署,助力企业将 AI 从实验阶段平稳过渡到生产运营。

Ajelix官方 / ADK编译 4 分钟
AI 工具 2026-09-08

DreamFace 发布 AI 直播生成器:零设备打造虚拟主播,重塑内容创作流程

DreamFace 正式推出 AI 直播生成功能,彻底消除传统直播对相机、灯光及推流软件的依赖。用户仅需上传照片或选择虚拟形象,配合脚本即可在数分钟内生成具备真实直播节奏与能量的视频。该工具支持游戏、带货、播客等多种模板,让创作者无需露脸即可测试新内容形式,大幅降低内容生产的门槛与试错成本。

DreamFace官方 / ADK编译 3 分钟
技术解读 2026-09-08

Accio Work 发布 F1 电视转播技术深度解析:8K 流媒体与超低延迟架构揭秘

Accio Work 深度编译 F1 TV 如何永久改变体育转播的历程,聚焦于日本市场策略、8K 流媒体技术革新及超低延迟架构。文章揭示了现代体育直播对带宽、编码及 CDN 的极致要求,包括 45% 的带宽消耗增长和亚 200ms 延迟标准。同时探讨了数字观众如何驱动 23 亿美元的周边销售,为开发者与架构师提供了从传统广播向数字化、智能化转型的宝贵案例与技术指标参考。

Accio Work官方 / ADK编译 3 分钟
code · 免费
★ 5.0 · 120评测
A

APIMart

一站式 AI API 平台,多主流模型统一访问

APIMart是一站式 AI API 平台,提供对 500 多个主流 AI 模型的统一访问,涵盖聊天、视频生成、图像生成等多类 AI 能力。与 OpenAI 的 API 格式完全兼容,用户只需修改一行代码即可从 OpenAI 迁移到 APIMart,享受更低的成本和更高的性能。APIMart核心优势在于高性价比,相比竞品可节省 30% 至 70% 的成本,同时提供 99.9% 的高可用性。智能路由技术确保低延迟响应,支持超高并发,适合大规模应用场景。APIMart提供详细的用量分析和成本跟踪,帮助用户优化费用。

查看 APIMart 使用教程与功能