Glean 发布智能成本优化策略:Token 成本降低 81%,优于 Claude Cowork 78%

ADK Glean官方 / ADK编译 2026-08-26 5 分钟 68 次浏览
速览导读 / Summary

Glean 正式发布其智能成本优化策略,通过 Pareto 前沿分析(Pareto Frontier Analysis)实现模型自动路由。内部测试显示,Glean 在 180+ 企业级任务中比 Claude Cowork 节省 81% 的 Token 成本,且 78% 的用户更偏好其回答。文章详细解析了 GPT-5.6 Luna、GLM 5.2 等模型在成本与性能上的权衡,为开发者提供了基于企业生产环境的模型选型新范式。

Token 成本节省 81% 相比 Claude Cowork 固定模型策略
用户偏好率 78% 用户更倾向于 Glean 回答的比例
测试任务数 180+ 内部基准测试覆盖的企业级任务
模型对比规模 37 个模型 Pareto 前沿分析覆盖的模型家族数量
对抗测试组数 81 模型配对头对头测试的总组数

Key Insights / 核心看点

  • 1 Glean 通过智能自动路由,在 180+ 企业任务中比 Claude Cowork 节省 81% 的 Token 成本。
  • 2 发布基于企业生产环境的 Pareto 前沿分析,精准描绘模型在成本与性能间的最佳权衡点。
  • 3 揭示模型市场格局:从 GPT-5.6 Luna 到 Claude Opus 5,36 倍成本差距仅带来 22% 的质量提升。
  • 4 提供 81 组模型头对头对抗测试数据,建立新的模型质量评分标准(Glean Quality Score)。

Right-sizing intelligence: Glean 重塑企业 AI 成本与性能平衡

在 2026 年的 AI 浪潮中,单纯追求前沿智能(Frontier Intelligence)已成为企业难以承受的重负。Uber 和服务现在短短数月内便耗尽了 AI 预算,这标志着“盲目追逐最强模型”时代的终结。Glean 工程团队与产品团队联合发布了一项关键策略:Right-sizing intelligence(智能尺寸匹配),旨在通过精细化的模型路由,让正确的智能服务于正确的任务。

核心突破:81% 成本节省与 78% 用户偏好

Glean 通过两项关键分析验证了其策略的有效性:

  1. 内部基准测试:Glean Assistant(开启自动路由)与 Claude Cowork(固定使用日常任务推荐模型 Claude Sonnet 5)在 180+ 个企业级任务中进行对比。
    • 成本对比:Claude Cowork 平均任务成本为 $2.98,而 Glean 仅为 $0.58节省 81%
    • 用户偏好:在 78% 的情况下,用户更倾向于选择 Glean 的回答。
  2. Pareto 前沿分析:Glean 构建了基于企业生产环境的模型评估体系,绘制了成本与性能的帕累托前沿曲线,指导自动路由决策。

技术深度:基于生产环境的 Pareto 前沿分析

传统的模型评估多依赖公开数据集,难以反映企业级工作的复杂性与多样性。Glean 的创新在于其基于安全评估的企业生产流量分析

  • 评估方法:采用 Bradley-Terry 方法,对 11 个模型家族在默认推理水平下的 81 组模型配对进行头对头(Head-to-Head)对抗测试。
  • 评估维度:专注于正确性、任务完成度和输出就绪度,由智能代理裁判(Agentic Judge)打分。
  • 质量评分:Glean 质量分数代表模型在对抗随机竞争对手时获胜的概率。例如,60 分意味着在 60% 的任务中表现优于随机对手。

关键发现:模型成本与性能的权衡

Glean 的分析揭示了模型市场并非由单一厂商主导,不同模型在成本与质量间存在显著差异:

模型 推理级别 Glean 质量分 成本 (美元/任务) 特点
GPT-5.6 Luna xhigh 55 $0.0819 成本效率极高,位于前沿
GLM 5.2 high 57 $0.3489 开源爱好者首选,性价比略高
Kimi K3 high 63 $0.8995 平衡点,质量显著提升
Gemini 3.7 Flash high 61 $0.4748 优质且成本可控
Claude Opus 5 high 67 $2.9605 性能最强,但成本高昂

数据显示,从最便宜的 Luna 到最贵的 Opus 5,成本相差 36 倍,但质量分数仅提升了 22%。这意味着对于大多数非极致复杂任务,使用 GPT-5.6 Luna 或 Kimi K3 即可满足需求,无需支付高昂的 Opus 费用。

对开发者的价值

Glean 的这一更新为开发者提供了全新的架构思路:

  1. 智能路由(Auto Routing):不再需要手动指定模型,Glean 会根据任务所需的努力程度和能力要求,自动匹配最优模型。
  2. 动态推理级别:系统能够识别何时需要高推理级别的模型(如 Kimi K3),何时可以使用低成本的模型(如 GPT-5.6 Luna)。
  3. 可解释的成本优化:通过 Pareto 前沿图,开发者可以直观地理解不同模型在特定任务上的性价比,从而优化应用架构。

正如 Glean 团队所言:“理解不同模型在成本与性能之间的权衡,并利用这种理解将正确的智能放在正确的工作上,远比单纯追逐前沿智能更重要。” 这一策略不仅解决了企业 AI 预算失控的问题,也为未来 AI 应用的规模化部署提供了坚实的技术基础。

At Glean, we've long believed that prioritizing intelligence in isolation, without considering cost, is the wrong approach.

Glean Engineering & Product Team

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-08

Accio Work 2026 安全剃须刀刀片评测指南发布:覆盖敏感肌与硬茬胡须的全场景解决方案

Accio Work 于 2026 年 9 月发布最新评测指南,针对 2026 年湿剃市场的演变,深度解析了 8 款最佳安全剃须刀刀片。指南涵盖从 Astra Superior Platinum 的全能王者到 Feather Hi-Stainless 的极致锋利,特别强调了针对敏感肌肤(如 Derby Extra Super Stainless)和环保需求(如 Personna Lab Blue)的专项解决方案,为不同肤质与胡须类型的用户提供精准选型建议。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 发布厨房研磨工具智能指南:材料选择与性能优化解析

Accio Work 发布了一篇关于研磨钵(Mortar and Pestle)最佳材料选择的深度指南。文章详细对比了花岗岩、大理石、陶瓷、木材及不锈钢等主流材质在研磨性能、耐用性、维护难度及美学风格上的差异。该指南旨在帮助消费者及零售商根据烹饪需求(如香料粉碎、酱汁制作)做出精准决策,体现了 Accio Work 在垂直领域知识库构建与搜索优化方面的技术实力。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 2026 年迷你喷射快艇设计趋势:电动化与模块化重塑水上运动

Accio Work 发布 2026 年迷你喷射快艇设计趋势报告,展示了 9 款重新定义水上运动的新概念。核心亮点包括革命性的充气式电动快艇、热插拔电池系统的通勤者设计、以及专为家庭安全优化的模块化构建方案。这些设计利用先进复合材料与零排放电动动力,解决了传统水上运动便携性差、续航焦虑及安全性不足的问题,为个人娱乐与商业租赁市场提供了全新灵感。

Accio Work官方 / ADK编译 3 分钟