Shortcut 发布 Pivot 0.5:27B 参数模型以 1/3 成本逼近 Sonnet 4.5 金融建模能力

ADK Shortcut官方 / ADK编译 2026-07-01 5 分钟 145 次浏览
速览导读 / Summary

Shortcut 正式推出其首款自研模型 Pivot 0.5,这是一个基于 Qwen3.5-27B 微调的垂直领域大模型。该模型在金融与电子表格任务上实现了显著突破,在 ShortcutBench v1 基准测试中得分达 64.4%,性能逼近 Sonnet 4.5,但任务成本仅为后者的 1/3。文章详细披露了其基于真实用户数据的训练集构建、OPD 蒸馏与 RLVR 强化学习训练流程,以及自研的 Mog 环境加速技术,展示了小团队构建前沿垂直模型的可能性。

模型参数 27B 基于 Qwen3.5 微调
基准测试得分 64.4% ShortcutBench v1 Spreadsheet Agent
成本效率 3.5x 相比 Sonnet 4.5 的任务成本降低倍数
训练加速 20-30x Mog 环境相比商业引擎的执行速度提升

Key Insights / 核心看点

  • 1 Pivot 0.5 在 ShortcutBench v1 上得分达 64.4%,性能逼近 Sonnet 4.5 但成本降低 3.5 倍。
  • 2 采用 OPD 蒸馏与 RLVR 强化学习双阶段训练,利用真实用户数据构建 10 级任务分类法。
  • 3 发布自研 Mog 环境,将 RL 训练执行速度提升 20-30 倍,显著加速模型迭代。
  • 4 完全在内部训练,不依赖付费或企业数据,仅基于免费 tier 用户交互构建高质量数据集。
  • 5 在 8 项关键金融基准中击败基座模型 7 项,并大幅优于 9 个月前的 Sonnet 4.5。

Shortcut 发布 Pivot 0.5:27B 参数模型以 1/3 成本逼近 Sonnet 4.5 金融建模能力

在应用研究实验室必须有能力训练自身前沿模型以掌控命运的信念驱动下,Shortcut 今天发布了其首个模型——Pivot 0.5。这是一款专为金融和电子表格建模任务设计的 27B 参数模型,旨在重新定义垂直领域 AI 的效率边界。

核心突破:成本与性能的极致平衡

Pivot 0.5 的核心价值在于其在“精度 vs. 混合价格/任务”这一关键指标上的卓越表现。数据显示,Pivot 0.5 在保持与 Sonnet 4.5 相当准确性的前提下,将任务成本降低了约 3.5 倍

  • 基准测试表现:在 ShortcutBench v1 的 Spreadsheet Agent 基准测试中,Pivot 0.5 的得分从基线模型的 44% 跃升至 64.4%
  • 横向对比:该模型不仅击败了基座模型 Qwen3.5 在 8 项关键公开金融与电子表格基准中的 7 项,其表现也接近当前顶尖的开源模型 DeepSeek v4 Pro (67.2%)。
  • 效率优势:与 DeepSeek v4 Pro 相比,Pivot 0.5 每任务成本仅为 $0.2(对比 $1.4),且处理速度提升 40%(15.8 分钟 vs 26.9 分钟/任务)。

技术架构:从数据到强化学习的完整闭环

Shortcut 强调其训练过程完全在内部完成,并为此构建了全新的电子表格环境。其训练策略分为两个关键阶段:

1. 基于真实用户数据的构建

训练数据完全来源于免费 tier 用户的真实交互,构建了涵盖 99% 任务的电子表格工作分类法(taxonomy)。

  • 数据规模:处理约 30 万条智能体轨迹,提炼出 1981 个节点、1274 个叶节点的 10 级任务树。
  • 意图分布:四大顶层意图覆盖了 99% 的任务,其中单纯的电子表格编辑(如写入值、公式、结构)占比高达 73%。
  • 合成任务:通过这种分类,团队能够生成与真实用户分布一致的合成任务,确保模型训练 grounded in reality。

2. 双阶段训练策略

  • 第一阶段:On-Policy Distillation (OPD) 利用 GLM-5.1 对模型自身输出的反馈进行训练,采用跨分词器损失(cross-tokenizer loss),将性能从 44% 提升至 53%。
  • 第二阶段:RLVR (RL with Verifiable Rewards) 引入 GPT-5.5 作为可验证奖励的评判者。评判者首先根据任务生成检查清单(如目标单元格、预期公式),锁定评估范围,随后对候选工作簿进行批量评分。这一阶段将最终准确率推高至 64.4%

基础设施创新:Mog 环境加速

为了加速强化学习训练,Shortcut 发布了其内部生产级的电子表格环境 Mog。该环境相比商业电子表格引擎,将 RL 环境执行速度提升了 20-30 倍,极大地缩短了模型迭代周期。

愿景与展望

"前沿质量的行业专用模型不应需要前沿规模的实验室。Pivot 0.5 是我们首个证据,表明小团队可以通过协同优化栈中的每一层,以低成本构建顶级表现模型。"

Shortcut 表示将定期发布 Pivot 的更新,并计划开源内部基准测试 ShortcutBench v1,该基准将作为 Shortcut.ai 生产版发布的门禁标准。

开发者现在可以在 Shortcut.ai 的研究预览版中免费尝试 Pivot 0.5,选择模型即可体验这一新的效率前沿。

Frontier-quality industry-specific models shouldn't require a frontier-sized lab. Pivot 0.5 is our first evidence that a small team can build top-performing models at low-cost by co-optimizing every layer of the stack.

Shortcut 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-09-08

Framer AI 发布 CMS List Field:重构重复内容管理,赋能动态网站构建

Framer 于 2026 年 9 月正式发布 CMS List Field,彻底革新了重复内容(如 FAQ、产品特性)的管理方式。该更新引入原生列表字段,支持通过 Framer Agent 一键迁移旧数据,并优化了编辑器的内容复用与排序能力。此次更新不仅解决了垂直视频嵌入等长期存在的 Bug,还显著提升了大型 CMS 集合的滚动性能,为开发者提供了更强大的动态内容构建工具。

Framer AI官方 / ADK编译 4 分钟
模型发布 2026-09-08

Ajelix 自研 GPU 基础设施并推出企业级 Agentic 平台,解决数据主权与生产落地难题

Agentic AI 平台 Ajelix 宣布投资自建 GPU 计算基础设施,并正式发布面向企业的 Ajelix Enterprise Platform。此举旨在解决企业级 AI 落地中数据不可控、审计困难及中断风险等痛点。新平台提供从智能体编排、RAG 知识库到严格治理的全栈能力,支持私有化部署,助力企业将 AI 从实验阶段平稳过渡到生产运营。

Ajelix官方 / ADK编译 4 分钟
AI 工具 2026-09-08

DreamFace 发布 AI 直播生成器:零设备打造虚拟主播,重塑内容创作流程

DreamFace 正式推出 AI 直播生成功能,彻底消除传统直播对相机、灯光及推流软件的依赖。用户仅需上传照片或选择虚拟形象,配合脚本即可在数分钟内生成具备真实直播节奏与能量的视频。该工具支持游戏、带货、播客等多种模板,让创作者无需露脸即可测试新内容形式,大幅降低内容生产的门槛与试错成本。

DreamFace官方 / ADK编译 3 分钟
技术解读 2026-09-08

Accio Work 发布 F1 电视转播技术深度解析:8K 流媒体与超低延迟架构揭秘

Accio Work 深度编译 F1 TV 如何永久改变体育转播的历程,聚焦于日本市场策略、8K 流媒体技术革新及超低延迟架构。文章揭示了现代体育直播对带宽、编码及 CDN 的极致要求,包括 45% 的带宽消耗增长和亚 200ms 延迟标准。同时探讨了数字观众如何驱动 23 亿美元的周边销售,为开发者与架构师提供了从传统广播向数字化、智能化转型的宝贵案例与技术指标参考。

Accio Work官方 / ADK编译 3 分钟
productivity · 付费
★ 5.0 · 120评测
S

Shortcut

AI Excel 超级智能体,处理复杂 Excel 任务

Shortcut 是 AI Excel 超级智能体,能快速处理复杂的 Excel 任务,例如分析数据、生成图表、构建金融模型等。Shortcut在 Excel 世界锦标赛的复杂案例中表现出色,准确率超过 80%,速度比人类快 10 倍。用户只需输入提示词,Shortcut 能快速执行任务,支持绘制像素艺术。Shortcut的高效性和智能化功能使其成为处理 Excel 任务的理想选择,适合需要快速整理和分析数据的用户。

查看 Shortcut 使用教程与功能