Yext 实测:Label Studio Enterprise 构建 AI 在环标注基准,LLM 表现逼近人工共识

ADK Label Studio官方 / ADK编译 2026-08-06 5 分钟 100 次浏览
速览导读 / Summary

Yext 利用 Label Studio Enterprise 成功构建了首个 AI 在环(AI-in-the-loop)标注基准,验证了 LLM 作为标注者的可行性。通过对比 GPT-5 与人类标注者的分歧率,研究发现 LLM 在 Few-shot 提示下的表现已接近人工共识水平。该案例不仅展示了 Label Studio 在统一人机协作与模型评估方面的强大能力,更揭示了如何利用标注分歧优化提示词与分类体系。

实验规模 12,745 条帖子 覆盖 6 个行业垂直领域与 3,055 个地点
人类 - 人类分歧率基准 50.5% 作为衡量一致性的初始标准
GPT-5 (Few-shot) 分歧率 36.3% (Funnel Stage) 显著优于人类基准,接近金标准水平
分歧价值转化 >50% 分歧被用于优化提示词与分类指南,而非视为模型失败

Key Insights / 核心看点

  • 1 构建首个 AI 在环标注基准,验证 LLM 作为标注者的可行性,在 Few-shot 模式下表现接近人工共识。
  • 2 Label Studio Enterprise 实现人类标注与 LLM 评估的统一工作流,支持直接对比与分歧追溯。
  • 3 通过分析人类与 LLM 的分歧,发现超过 50% 的分歧揭示了人类错误或分类体系模糊,而非单纯模型失败。
  • 4 GPT-5 在 Funnel Stage 分类任务中,将分歧率从人类基准的 41.1% 降低至 36.3%。

Yext 实测:Label Studio Enterprise 构建 AI 在环标注基准,LLM 表现逼近人工共识

在数字化转型的浪潮中,高质量的数据标注是 AI 模型训练与评估的基石。然而,随着标注任务规模扩大,传统的人工标注模式面临成本高、周期长、难以应对突发需求的瓶颈。Yext,一家领先的数字存在管理平台,正面临这一挑战:如何在大规模营销分类任务中,既保证数据可靠性,又降低运营成本?

为此,Yext 团队与 Label Studio 合作,利用 Label Studio Enterprise 构建了一个创新的 AI-in-the-loop(AI 在环)标注基准。该项目旨在探索 LLM(大语言模型)能否作为“虚拟标注者”,在保持数据可信度的前提下,分担繁重的人工标注工作。

挑战:规模化标注的瓶颈

Yext 的项目涉及 12,745 条品牌社交媒体帖子,涵盖六个行业垂直领域及 3,055 个不同地点。每条帖子需根据两个分类体系进行标注:漏斗阶段(Funnel Stage)(如可见性、考虑、转化、忠诚)和意图(Intent)(如教育、促销、互动、启发)。

Yext 原有的工作流程采用“双人标注 + 仲裁”机制:两名人类标注员独立标注,分歧由第三名仲裁员解决。虽然产出可靠,但在高并发项目下,这种流程造成了巨大的运营负担。

团队的核心疑问是:如果引入 LLM 作为标注者,能否在减少工作量的同时,产出值得信赖的结果?

方案:LLM 作为标注者的评估实验

Yext 在 Label Studio Enterprise 中部署了一套结构化的评估工作流,将人类标注流程与 LLM 评估管道整合在同一环境中。

核心实验设计

团队利用 GPT-5 和 GPT-5 Mini 模型,结合 Zero-shot(零样本)和 Few-shot(少样本)提示策略,进行了多维度的对比测试:

  1. 人类 - 人类分歧 (Human-Human Disagreement):作为基准线,衡量两名训练有素标注员的一致性。
  2. 人类 - LLM 分歧 (Human-LLM Disagreement):衡量 LLM 与单人人类标注员的分歧程度。
  3. 金标准 - LLM 分歧 (Gold-LLM Disagreement):衡量 LLM 与最终仲裁标签的分歧程度。

关键发现:LLM 表现逼近人工共识

实验结果显示,在 Few-shot 提示设置下,GPT-5 与人类标注员的分歧率与人类之间的分歧率相当,甚至在某些任务中更优。

分类任务 人类 - 人类分歧率 人类 - LLM 分歧率 金标准 - LLM 分歧率
Funnel Stage 41.1% 36.3% 32.3%
Intent 21.5% 23.6% 21.1%
Either 50.5% 48.2% 43.6%

注:分歧率越低,代表一致性越高。

分歧背后的深层洞察

仅仅看分歧率是不够的。Yext 团队深入分析了分歧产生的原因,发现了一些有趣的模式:

  • 人类倾向:往往为了标注“可见性”和“转化”,而忽略了“考虑”阶段的标注。
  • LLM 倾向:倾向于过度标注“转化”,而低估“考虑”。

更重要的是,通过对分歧样本的定性审查,团队发现超过 50% 的分歧实际上揭示了人类标注的错误或分类体系本身的模糊性,而不仅仅是模型的失败。这证明了 LLM 可以作为一面“镜子”,帮助团队发现标注指南中的漏洞。

价值总结:Label Studio Enterprise 的核心优势

此次实验的成功,离不开 Label Studio Enterprise 提供的强大基础设施:

  1. 统一的工作流环境:允许人类标注员和 LLM 在同一平台上协作,无需切换系统即可对比结果。
  2. 可追溯的评估:能够直接比较选定的人类标注、金标准标签与 LLM 预测,便于审查分歧并追踪决策演变。
  3. 促进人机协同进化:将“分歧”转化为优化提示词(Prompt)和分类体系的信号,推动了标注质量的螺旋式上升。

正如 Yext 团队所言:*“随着 AI 越来越多地用于评估其他 AI 系统,保持这种测量和可追溯性变得至关重要。Label Studio 让我们能够在一个共享系统中测试模型如何与人类标注员一起参与大规模营销分类任务。"

这一案例为行业树立了新标杆,证明了 LLM 不仅是生成内容的工具,更是高质量数据生产线上不可或缺的合作伙伴。

Having the option to compare selected human annotations and gold labels with LLM predictions directly in the Label Studio platform was a true game-changer for the evaluation process.

Yext 团队

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-08

Accio Work 2026 安全剃须刀刀片评测指南发布:覆盖敏感肌与硬茬胡须的全场景解决方案

Accio Work 于 2026 年 9 月发布最新评测指南,针对 2026 年湿剃市场的演变,深度解析了 8 款最佳安全剃须刀刀片。指南涵盖从 Astra Superior Platinum 的全能王者到 Feather Hi-Stainless 的极致锋利,特别强调了针对敏感肌肤(如 Derby Extra Super Stainless)和环保需求(如 Personna Lab Blue)的专项解决方案,为不同肤质与胡须类型的用户提供精准选型建议。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 发布厨房研磨工具智能指南:材料选择与性能优化解析

Accio Work 发布了一篇关于研磨钵(Mortar and Pestle)最佳材料选择的深度指南。文章详细对比了花岗岩、大理石、陶瓷、木材及不锈钢等主流材质在研磨性能、耐用性、维护难度及美学风格上的差异。该指南旨在帮助消费者及零售商根据烹饪需求(如香料粉碎、酱汁制作)做出精准决策,体现了 Accio Work 在垂直领域知识库构建与搜索优化方面的技术实力。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 2026 年迷你喷射快艇设计趋势:电动化与模块化重塑水上运动

Accio Work 发布 2026 年迷你喷射快艇设计趋势报告,展示了 9 款重新定义水上运动的新概念。核心亮点包括革命性的充气式电动快艇、热插拔电池系统的通勤者设计、以及专为家庭安全优化的模块化构建方案。这些设计利用先进复合材料与零排放电动动力,解决了传统水上运动便携性差、续航焦虑及安全性不足的问题,为个人娱乐与商业租赁市场提供了全新灵感。

Accio Work官方 / ADK编译 3 分钟