OpenRouter 发布 Ori Eval:让 AI 模型选择从“拍脑袋”转向数据驱动

ADK OpenRouter官方 / ADK编译 2026-08-03 5 分钟 128 次浏览
速览导读 / Summary

OpenRouter 推出 Ori Eval,一款专为开发者设计的自动化模型评估框架。针对当前市场上 500+ 模型选择困难且缺乏系统评估方法的痛点,Ori Eval 通过自动扫描代码库、生成评估脚本、并行测试候选模型并引入 LLM 裁判,帮助开发者以最低成本找到最适合其特定应用场景的最佳模型,并有效防止回归风险。

支持模型数量 500+ 覆盖主流及新兴实验室模型
评估脚本生成 全自动 基于自然语言需求自动生成 .eval.ts 文件
并行测试能力 多模型并发 同时运行多个候选模型以获取最优解
裁判机制 LLM-as-a-Judge 内置大模型裁判自动评分开放性问题

Key Insights / 核心看点

  • 1 零门槛评估:自动扫描代码库并生成评估脚本,无需开发者具备编写 eval 的经验。
  • 2 智能推荐引擎:基于成本、延迟、准确率等多维度指标,并行测试最新模型并给出带理由的推荐。
  • 3 CI/CD 集成:生成的评估文件可直接作为测试用例,自动阻断回归风险,支持定期自动更新模型。
  • 4 全链路覆盖:支持从工具调用准确性到开放性问题质量评分的全方位评估。

OpenRouter 发布 Ori Eval:让 AI 模型选择从“拍脑袋”转向数据驱动

随着 AI 功能在应用中的普及,开发者面临着前所未有的挑战:如何在超过 500 个可用模型中做出最佳选择?传统的做法往往依赖社交媒体推荐、基准测试排行榜或主观直觉,但这些方法存在明显局限——基准测试仅针对固定任务集,而推荐则反映了他人场景下的表现,无法准确预测模型在您特定的应用、数据、提示词和基础设施上的行为。

OpenRouter 深知这一痛点。他们推出了 Ori Eval,旨在解决“没有绝对最好的模型,只有最适合您构建之物的模型”这一核心命题。

核心突破:无需评估经验,自动构建评估体系

Ori Eval 最大的创新在于极大地降低了 AI 模型评估的门槛。对于从未写过评估脚本(eval)的开发者,它提供了一套零门槛的解决方案。

1. 智能代码扫描与需求访谈

Ori Eval 会主动扫描您的代码库,识别所有调用模型的节点。随后,它会像一位经验丰富的工程伙伴一样,与您进行“访谈”,询问哪些指标对您最重要:是成本($/PR)、延迟、速度、工具调用准确率,还是开放性问题回答的质量?

2. 自动化评估脚本生成

基于您的回答,Ori Eval 会自动编写 review.eval.ts 文件。这是一个标准的测试文件,您可以直接将其集成到 CI/CD 流水线中(如 GitHub Actions)。它不仅定义了测试用例,还内置了 LLM 裁判机制,用于自动评分开放性问题。

3. 并行测试与精准推荐

系统会在后台并行运行候选模型(默认选择最新的 5 个符合您需求的模型),并输出详细的对比表格,包含关键指标:

模型 错误捕获率 (catch) P50 延迟 成本/千次请求 结果
anthropic/claude-opus-5 94% 38s $0.041 pass
openai/gpt-5.6-sol 92% 44s $0.038 pass
moonshotai/kimi-k3 90% 31s $0.019 pass
z-ai/glm-5.2 86% 26s $0.008 pass
google/gemini-3-pro 84% 52s $0.062 fail (cost)

系统不仅给出推荐,还会附带理由,例如:“在您的成本约束下,该模型提供了最高的错误捕获率,且若错误审查量增长,该模型仍具性价比”。

实际应用价值:构建可维护的 AI 基础设施

Ori Eval 不仅仅是一次性的选型工具,更是一套持续优化的工程实践。

阻断回归,确保稳定性

评估文件本质上是代码。开发者可以将其纳入 CI 流程,一旦评估失败,构建即被阻止。这意味着任何导致模型表现下降的变更(回归)都无法进入生产环境。

动态模型迭代

由于评估脚本是纯代码,开发者可以轻松调度定期运行(如每月一次)。当新的模型发布并优于现有模型时,系统会自动生成 Pull Request,开发者只需合并即可体验性能提升,无需重新思考评估逻辑。

解决具体 Bug 的测试用例

对于已知 Bug(例如客服代理在未检查订单的情况下直接退款),开发者可以用自然语言描述,Ori Eval 会生成断言代码(如 lookup_order.toBeCalled()),确保该逻辑始终被测试覆盖。

如何开始使用

开发者只需向他们的编程助手发送一条指令即可启动:

curl -fsSL https://openrouter.ai/skills/spawn-ori-eval

随后跟随输出中的指引操作,Ori Eval 将引导您完成从需求确认到模型选型的整个过程。

“我们深知,在模型层出不穷的今天,没有‘最好’的模型,只有‘最适合’的模型。Ori Eval 就是为了帮您找到那个唯一的最佳解,并用数据向您证明。” —— OpenRouter 团队

There is no definitive best model - only the best model for what you're building.

OpenRouter 官方团队

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-08

Accio Work 2026 安全剃须刀刀片评测指南发布:覆盖敏感肌与硬茬胡须的全场景解决方案

Accio Work 于 2026 年 9 月发布最新评测指南,针对 2026 年湿剃市场的演变,深度解析了 8 款最佳安全剃须刀刀片。指南涵盖从 Astra Superior Platinum 的全能王者到 Feather Hi-Stainless 的极致锋利,特别强调了针对敏感肌肤(如 Derby Extra Super Stainless)和环保需求(如 Personna Lab Blue)的专项解决方案,为不同肤质与胡须类型的用户提供精准选型建议。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 发布厨房研磨工具智能指南:材料选择与性能优化解析

Accio Work 发布了一篇关于研磨钵(Mortar and Pestle)最佳材料选择的深度指南。文章详细对比了花岗岩、大理石、陶瓷、木材及不锈钢等主流材质在研磨性能、耐用性、维护难度及美学风格上的差异。该指南旨在帮助消费者及零售商根据烹饪需求(如香料粉碎、酱汁制作)做出精准决策,体现了 Accio Work 在垂直领域知识库构建与搜索优化方面的技术实力。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 2026 年迷你喷射快艇设计趋势:电动化与模块化重塑水上运动

Accio Work 发布 2026 年迷你喷射快艇设计趋势报告,展示了 9 款重新定义水上运动的新概念。核心亮点包括革命性的充气式电动快艇、热插拔电池系统的通勤者设计、以及专为家庭安全优化的模块化构建方案。这些设计利用先进复合材料与零排放电动动力,解决了传统水上运动便携性差、续航焦虑及安全性不足的问题,为个人娱乐与商业租赁市场提供了全新灵感。

Accio Work官方 / ADK编译 3 分钟
code · 免费+付费
★ 5.0 · 120评测
O

OpenRouter

AI 模型 API 聚合平台,一个接口调用400多个模型

OpenRouter 是领先的 AI 模型API 聚合平台,一个接口调用 400 多个 AI 模型。OpenRouter通过智能路由技术优化模型选择和成本,支持自动故障转移和负载均衡,具备高可用性和性能。OpenRouter 提供隐私保护功能,支持零日志模式,支持用户根据数据政策选择合适的提供商。OpenRouter具备工具调用、实时网络搜索、图像和 PDF 处理等高级功能。OpenRouter统计功能能追踪模型使用情况,反映市场表现和用户偏好。OpenRouter 能简化 AI 的使用和管理,助力高效开发与部署。

查看 OpenRouter 使用教程与功能