Qdrant 与 Minima 联手实现 GPU 小时内智能体 RAG 任务量提升 2.92 倍

ADK Qdrant官方 / ADK编译 2026-08-13 5 分钟 155 次浏览
速览导读 / Summary

Qdrant 与 Minima 联合发布最新案例研究,通过优化混合检索策略与延迟交互重排序(Late-Interaction Reranking),在单卡环境下将智能体 RAG 任务吞吐量提升 2.92 倍。新方案结合 BM25 稀疏检索与 ColBERT 风格重排序,显著降低首轮检索失败率,实现从 1,350 到 3,750 任务的 GPU 小时产出飞跃,同时上下文 token 消耗减少 56%。

任务吞吐量 3,750 tasks/GPU-hour 较基准提升 179%
首轮检索成功率 87% 较基准提升 15 个百分点
上下文 Token 消耗 2.3K tokens 较基准减少 56%
任务延迟 (Median) 7.7 seconds 较基准降低 63.8%

Key Insights / 核心看点

  • 1 智能体 RAG 任务吞吐量提升 2.92 倍,单 GPU 小时产出从 1,350 增至 3,750
  • 2 首轮检索证据满足率从 72% 提升至 87%,显著减少智能体循环迭代
  • 3 检索上下文 token 消耗减少 56%,从 5.2K 降至 2.3K,大幅降低推理成本
  • 4 结合 BM25 稀疏检索与 ColBERT 延迟交互重排序,解决语义与精确匹配难题

Qdrant 与 Minima 联手实现 GPU 小时内智能体 RAG 任务量提升 2.92 倍

在检索增强生成(RAG)智能体日益复杂的今天,检索效率与成本已成为制约应用扩展的关键瓶颈。当智能体在循环中反复规划、检索、验证证据并重新生成时,每一次额外的检索请求和模型调用都会累积延迟、上下文开销及推理成本。

针对这一痛点,Qdrant 与 Minima 联合推出了一项突破性实践,展示了如何通过精细化的检索架构优化,在单张 96GB NVIDIA RTX PRO 6000 Blackwell GPU 上,将智能体 RAG 任务的吞吐量提升了 2.92 倍

核心突破:混合检索与延迟交互重排序

传统方案多依赖单一稠密向量检索,难以兼顾语义相似度与精确匹配(如文档 ID、版本号)。Qdrant + Minima 的联合方案采用了更复杂的混合策略:

  1. 双路检索融合:结合 Qdrant 的稠密向量检索与 BM25 稀疏检索,利用 Reciprocal Rank Fusion (RRF) 算法融合结果,确保既能捕捉语义关联,又能精准定位特定文档片段。
  2. 延迟交互重排序:引入 ColBERT 风格的 Late-Interaction Reranking 机制,在生成阶段对候选结果进行细粒度的 Token 级重排序,显著提升上下文精度。
  3. 动态 Payload 过滤:利用 Qdrant 强大的 Payload Filter 能力,在查询阶段即剔除无关租户或版本数据,从源头减少无效检索。

实测数据:效率与精度的双重飞跃

在涵盖 SciFact、FiQA、HotpotQA 及自定义租户策略测试集的 1,800 个任务与 10,000 个完整智能体回合中,新架构展现了惊人的性能提升:

  • 吞吐量爆发:任务吞吐量从基准的 1,081 提升至 3,158 任务/GPU 小时(峰值达 3,750),较 BF16 推理基准提升 179%
  • 首轮检索成功率:首次检索即满足证据需求的比例从 72% 跃升至 87%,大幅减少了智能体循环迭代次数。
  • 上下文压缩:平均检索上下文从 5.2K tokens 降至 2.3K tokens,减少 56%,显著降低显存压力与生成成本。
  • 延迟优化:中位任务延迟从 21.3 秒降至 7.7 秒,P95 延迟控制在 43.2 毫秒以内。

技术架构细节

该方案严格限定硬件资源,仅使用一张 Blackwell GPU 运行 Qwen3.6-27B 模型(Minima 采用 NVFP4 W4A4 量化及原生 Blackwell 内核),而检索与编码工作由 CPU 端 FastEmbed 服务完成。这种分离架构确保了 GPU 资源完全专注于高价值的推理任务,最大化单位算力产出。

“在智能体循环中,一次失败的初次检索所引发的额外规划与重试成本,远高于一次额外的搜索请求。” —— Qdrant 与 Minima 团队

对开发者的价值

对于构建企业级 RAG 智能体的开发者而言,这一案例提供了极具参考价值的架构范式:

  1. 成本控制:通过减少无效检索和上下文长度,直接降低 Token 消耗与 GPU 算力成本。
  2. 精度保障:混合检索策略有效解决了长尾查询与精确匹配难题,提升答案的“Groundedness”( grounded task success 从 80.1% 升至 84.2%)。
  3. 扩展性:Qdrant 的 Payload Filter 机制使得多租户、多版本管理变得高效且自动化,无需人工干预即可通过测试。

此次合作不仅验证了 Qdrant 在混合搜索领域的深度,也展示了 Minima 在量化推理与智能体编排上的强大能力,为下一代高效智能体系统树立了新的性能标杆。

Inside an agent loop, a weak first retrieval costs more than one extra search. It triggers another round of planning, re-retrieval, and ultimately, wasted compute.

Qdrant and Minima Engineering Team

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-08

Accio Work 2026 安全剃须刀刀片评测指南发布:覆盖敏感肌与硬茬胡须的全场景解决方案

Accio Work 于 2026 年 9 月发布最新评测指南,针对 2026 年湿剃市场的演变,深度解析了 8 款最佳安全剃须刀刀片。指南涵盖从 Astra Superior Platinum 的全能王者到 Feather Hi-Stainless 的极致锋利,特别强调了针对敏感肌肤(如 Derby Extra Super Stainless)和环保需求(如 Personna Lab Blue)的专项解决方案,为不同肤质与胡须类型的用户提供精准选型建议。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 发布厨房研磨工具智能指南:材料选择与性能优化解析

Accio Work 发布了一篇关于研磨钵(Mortar and Pestle)最佳材料选择的深度指南。文章详细对比了花岗岩、大理石、陶瓷、木材及不锈钢等主流材质在研磨性能、耐用性、维护难度及美学风格上的差异。该指南旨在帮助消费者及零售商根据烹饪需求(如香料粉碎、酱汁制作)做出精准决策,体现了 Accio Work 在垂直领域知识库构建与搜索优化方面的技术实力。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 2026 年迷你喷射快艇设计趋势:电动化与模块化重塑水上运动

Accio Work 发布 2026 年迷你喷射快艇设计趋势报告,展示了 9 款重新定义水上运动的新概念。核心亮点包括革命性的充气式电动快艇、热插拔电池系统的通勤者设计、以及专为家庭安全优化的模块化构建方案。这些设计利用先进复合材料与零排放电动动力,解决了传统水上运动便携性差、续航焦虑及安全性不足的问题,为个人娱乐与商业租赁市场提供了全新灵感。

Accio Work官方 / ADK编译 3 分钟