Qdrant 发布 FineWeb-10B 数据集与 Supernova 开源基准引擎,终结合成数据时代

ADK Qdrant官方 / ADK编译 2026-09-01 5 分钟 169 次浏览
速览导读 / Summary

Qdrant 联合 Vultr 发布业界首个互联网规模开源向量搜索基准数据集 Qdrant-FineWeb-10B,包含 100 亿向量及海量真实文本。同时开源高性能基准引擎 Supernova,支持亿级向量的并行计算与精确 Ground Truth 验证。此举旨在解决现有基准测试依赖合成数据、门槛过高的问题,为生产级 RAG 系统提供可复现、高吞吐的评估标准。

数据集规模 10B Vectors / 24.47 TB Qdrant-FineWeb-10B 核心向量数据量
查询数量 100,000 Queries 用于 Ground Truth 验证的查询总数
计算量 1 Quadrillion+ Ops 并行执行的距离计算次数
模型支持 gte-multilingual-base, BGE-M3, Qwen3-VL 支持的嵌入模型列表

Key Insights / 核心看点

  • 1 发布 Qdrant-FineWeb-10B:首个包含 100 亿向量及 28TB 文本的开源互联网级基准数据集。
  • 2 开源 Supernova 引擎:支持亿级向量并行计算的分布式框架,实现精确的暴力穷举验证。
  • 3 覆盖多模态与医疗领域:新增 PubMed-Multi-Vector 和 Coyo-Vector-Embeddings 数据集。
  • 4 解决合成数据痛点:提供可复现、高吞吐的生产级 RAG 系统评估标准。

终结合成数据时代:Qdrant 发布互联网级向量搜索基准

在向量搜索领域,长期存在一个痛点:许多所谓的“生产级”基准测试实际上依赖于封闭的、合成数据或受限的私有云服务。这些测试往往无法反映企业级应用面临的真实挑战——即处理数十亿向量、应对每秒数千次请求(RPS)且要求毫秒级延迟的场景。

为了解决这一行业难题,Qdrant 联合云计算合作伙伴 Vultr,于 2026 年 9 月正式发布了Qdrant-FineWeb-10B数据集,并开源了构建该基准的核心引擎Supernova。这一组合标志着向量搜索评估从“合成近似”向“真实规模验证”的重大转变。

核心突破:Qdrant-FineWeb-10B

Qdrant-FineWeb-10B 是目前社区中最大的开源向量搜索基准数据集,其规模令人瞩目:

  • 数据规模:包含约 24.47 TB 的向量数据,以及 28.66 TB 的源文本和元数据。
  • 向量构成:基于 Hugging Face 的 FineWeb 语料库,利用 gte-multilingual-base 模型生成,涵盖 100 亿 (10B) 稠密向量和稀疏向量。
  • Ground Truth 验证:团队利用 GPU 原生引擎,对 10 万 个查询进行了精确的 top-1000 最近邻计算。这一过程涉及超过 10^15 (一 quadrillion) 次距离计算。

该数据集不仅提供了稠密向量,还包含了稀疏向量和过滤条件,旨在全面覆盖现代生产架构中复杂的混合检索需求。

技术引擎:Supernova 开源框架

为了打破基准测试的垄断,Qdrant 开源了Supernova,这是一个专为大规模数据集生成和验证设计的高性能分布式框架。Supernova 自动化了构建向量搜索基准的四个核心阶段:

  1. Embedding Generation (嵌入生成):通过 nova-embed 模块,统一支持 SentenceTransformers、FastEmbed 及 OpenAI API 等多种后端,并兼容 Hugging Face、S3 及 Cloudflare R2 等存储系统。
  2. Brute-Force Ground Truth (暴力穷举验证):通过 nova-bf 模块,在 GPU 加速硬件上并行执行精确的最近邻搜索,无需依赖索引近似即可获得真实结果。
  3. Database Loading (数据库加载):高效处理海量数据导入。
  4. Evaluation Benchmarking (评估基准):提供标准化的性能评估接口。

Supernova 采用无状态设计,每个工作节点独立处理数据分区,实现了在云环境和 HPC 集群上的线性扩展。

扩展生态:多模态与医疗领域数据集

除了核心的 FineWeb 数据集,Qdrant 还发布了两个补充数据集,以展示 Supernova 的跨模态能力:

  • PubMed-Multi-Vector:基于 BGE-M3 模型,针对医疗领域生成稠密、稀疏及 ColBERT 风格的多向量表示,包含超过 83.7 亿个多向量 token,用于测试混合检索方法。
  • Coyo-Vector-Embeddings:基于 Qwen3-VL-Embedding-2B 模型,将 LLaVA 数据集中的图像 - 文本对投影到统一的嵌入空间,专注于多模态检索场景。

实际价值与应用场景

对于开发者和企业而言,这一发布具有深远意义:

  • 可复现性:不再依赖黑盒的私有服务,开发者可以在本地基础设施上复现并验证自己的 RAG 系统性能。
  • 真实压力测试:100 亿向量的规模迫使系统必须在高并发下保持亚 100ms 的 p99 延迟,这直接对应电商、市场平台等对实时性要求极高的场景。
  • 标准制定:Qdrant 通过开源工具链,推动了行业对“生产级”基准测试标准的统一,让评估结果更具说服力。

正如 Qdrant 团队所言:"依赖百万级向量和合成数据的时代已经结束。这里有了真实的数据、真实的 Ground Truth,以及您运行它所需的开源基础设施。"

随着 Supernova 的普及,未来我们将看到更多基于真实互联网规模数据的模型评估,推动向量搜索技术向更严谨、更实用的方向发展。

The era of relying on 1-million vector datasets, production hearsay, and synthetic approximations is over. Here is the real data, the real ground truth, and the open-source infrastructure you need to run it yourself.

Qdrant Labs Team

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-08

Accio Work 2026 安全剃须刀刀片评测指南发布:覆盖敏感肌与硬茬胡须的全场景解决方案

Accio Work 于 2026 年 9 月发布最新评测指南,针对 2026 年湿剃市场的演变,深度解析了 8 款最佳安全剃须刀刀片。指南涵盖从 Astra Superior Platinum 的全能王者到 Feather Hi-Stainless 的极致锋利,特别强调了针对敏感肌肤(如 Derby Extra Super Stainless)和环保需求(如 Personna Lab Blue)的专项解决方案,为不同肤质与胡须类型的用户提供精准选型建议。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 发布厨房研磨工具智能指南:材料选择与性能优化解析

Accio Work 发布了一篇关于研磨钵(Mortar and Pestle)最佳材料选择的深度指南。文章详细对比了花岗岩、大理石、陶瓷、木材及不锈钢等主流材质在研磨性能、耐用性、维护难度及美学风格上的差异。该指南旨在帮助消费者及零售商根据烹饪需求(如香料粉碎、酱汁制作)做出精准决策,体现了 Accio Work 在垂直领域知识库构建与搜索优化方面的技术实力。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 2026 年迷你喷射快艇设计趋势:电动化与模块化重塑水上运动

Accio Work 发布 2026 年迷你喷射快艇设计趋势报告,展示了 9 款重新定义水上运动的新概念。核心亮点包括革命性的充气式电动快艇、热插拔电池系统的通勤者设计、以及专为家庭安全优化的模块化构建方案。这些设计利用先进复合材料与零排放电动动力,解决了传统水上运动便携性差、续航焦虑及安全性不足的问题,为个人娱乐与商业租赁市场提供了全新灵感。

Accio Work官方 / ADK编译 3 分钟