Cursor 发布“自动驾驶代码库”:千 Agent 协同构建浏览器引擎

ADK Cursor官方 / ADK编译 2026-02-05 5 分钟 39 次浏览
速览导读 / Summary

Cursor 正式披露其“自动驾驶代码库”研究项目,展示了由数千个 Agent 协同工作、连续运行一周并自动完成浏览器引擎构建的突破性成果。文章详细阐述了从单 Agent 到多 Agent 架构的演进过程,重点介绍了根规划器(Root Planner)、Worker 及“新鲜度”机制等核心设计。该研究揭示了在大规模并发场景下,如何通过合理的职责划分、动态任务分发及容错策略,实现无需人工干预的自动化软件开发。

峰值吞吐量 1,000 commits/hour 基于 1,000 万次工具调用,连续运行一周
Agent 规模 数千个 协同工作的智能体数量
运行时长 连续 7 天 无需人工干预的自主运行时间

Key Insights / 核心看点

  • 1 发布“自动驾驶代码库”项目,展示数千个 Agent 协同构建浏览器引擎的突破性成果。
  • 2 引入递归式规划架构,通过根规划器与子规划器的分工,实现任务的高效拆解与责任归属。
  • 3 设计“新鲜度”机制,通过定期重写和动态调整,防止 Agent 在长时间运行中偏离预期。
  • 4 探索大规模并发下的权衡策略,接受可控错误率以换取更高的系统吞吐量和稳定性。
  • 5 揭示了多 Agent 系统对指令清晰度和基础设施(如并发存储)的深层依赖。

Cursor 发布“自动驾驶代码库”:千 Agent 协同构建浏览器引擎

Cursor 近日在其官方博客上披露了一项名为“自动驾驶代码库”(Self-Driving Codebases)的前沿研究项目。该项目展示了 Cursor 在长时间运行自主编码(Long-running Autonomous Coding)领域的最新突破:通过编排数千个 Agent,系统能够连续运行一周,几乎无需人工干预地构建出一个完整的 Web 浏览器引擎。

研究背景与挑战

这项研究最初源于 Cursor 内部对模型极限的探索。团队选择构建一个“不含 JavaScript 的浏览器”作为评测基准,旨在利用其高复杂度和多子系统协同需求,暴露当前 AI 模型的局限。

早期的尝试仅依靠单个 Agent 或简单的并行任务分配,效果并不理想。模型往往在复杂实现细节上停滞,或者过早宣称完成任务。核心问题在于任务过于庞大,缺乏动态的协同机制。

从单 Agent 到多 Agent 架构的演进

Cursor 经历了一个从简单测试框架到复杂多智能体系统的迭代过程:

  1. 初步尝试与瓶颈:最初尝试让多个 Agent 共享状态文件进行协调,但很快发现锁机制(Locking)导致了严重的资源争用。Agent 之间缺乏结构化分工,导致吞吐量极低,大部分时间都在等待锁。
  2. 引入角色与职责:团队重新设计了架构,明确了规划器(Planner)执行者(Executor)工作者(Worker)的角色。规划器负责拆解任务并生成子规划器,执行者全权负责特定范围的落实,而工作者则专注于具体任务的执行,互不干扰。
  3. 持续执行器(Continuous Executor):最终设计移除了独立的规划器,由执行者同时负责规划和实现。系统不再依赖静态计划,而是动态调整方向,确保代码库的“新鲜度”。

核心架构设计亮点

1. 递归式的规划与委派

最终系统采用了一种递归的规划机制:

  • 根规划器(Root Planner):理解用户指令的整体范围,生成具体任务,但不编写代码,也不直接执行。
  • 子规划器(Sub-Planners):当任务可拆分时,递归生成子规划器,全权负责被委派的小块范围。
  • Worker:领取任务并在本地代码副本上工作,完成后提交交接说明(包括已完成事项、备注、偏差等)。

这种设计模拟了现代软件团队的运作方式,既保证了吞吐量(通过并行拉起 Worker),又确保了责任归属(每个规划器对分配的任务负全责)。

2. “新鲜度”机制与动态调整

为了防止 Agent 在长时间运行中偏离预期或陷入死循环,Cursor 引入了“新鲜度”机制:

  • 定期重写:鼓励 Agent 接近上下文上限时自动总结,并经常从头重写 scratchpad.md
  • 自我反思:在 System Prompts 中加入反思指令,鼓励 Agent 质疑既有假设。
  • 移除 Judge:由于系统具备自我纠错能力,团队移除了独立的审查者(Judge),以保持系统简单和动态性。

3. 权衡与容错策略

在追求极致吞吐量的过程中,Cursor 做出了有意的取舍:

  • 接受可控错误率:不要求每次提交前达到 100% 正确,允许错误出现但相信其他 Agent 会迅速修复。这避免了因微小错误导致的系统停摆。
  • 简化同步开销:接受偶发的文件冲突(“乱流”时刻),让系统自然收敛,而非引入复杂的分布式锁机制。

性能指标与启示

  • 吞吐量:在一周运行中,系统峰值吞吐量约为每小时 1,000 次 Commit,基于 1,000 万次工具调用。
  • 稳定性:系统能够连续运行一周,无需人工干预。

这项研究不仅展示了技术可行性,更对开发者提出了深刻启示:

  1. 指令的重要性:即使拥有强大的算力,模糊或次优的指令也会导致灾难性后果。明确的目标、超时配置和防御性编程至关重要。
  2. 基础设施限制:在单体机器上运行数百个 Agent 会导致磁盘 I/O 成为瓶颈,提示未来需要更高效的并发存储机制。

Cursor 表示,部分用户将有机会试用这项研究成果,标志着多 Agent 协同开发正式从实验走向应用探索。

即便存在一些小问题,数千个 agent 能够协同工作,产出几乎完全无需人工干预就能运行的成果,这一点本身就让我们觉得值得分享。

Cursor 官方团队

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-08

Accio Work 2026 安全剃须刀刀片评测指南发布:覆盖敏感肌与硬茬胡须的全场景解决方案

Accio Work 于 2026 年 9 月发布最新评测指南,针对 2026 年湿剃市场的演变,深度解析了 8 款最佳安全剃须刀刀片。指南涵盖从 Astra Superior Platinum 的全能王者到 Feather Hi-Stainless 的极致锋利,特别强调了针对敏感肌肤(如 Derby Extra Super Stainless)和环保需求(如 Personna Lab Blue)的专项解决方案,为不同肤质与胡须类型的用户提供精准选型建议。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 发布厨房研磨工具智能指南:材料选择与性能优化解析

Accio Work 发布了一篇关于研磨钵(Mortar and Pestle)最佳材料选择的深度指南。文章详细对比了花岗岩、大理石、陶瓷、木材及不锈钢等主流材质在研磨性能、耐用性、维护难度及美学风格上的差异。该指南旨在帮助消费者及零售商根据烹饪需求(如香料粉碎、酱汁制作)做出精准决策,体现了 Accio Work 在垂直领域知识库构建与搜索优化方面的技术实力。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 2026 年迷你喷射快艇设计趋势:电动化与模块化重塑水上运动

Accio Work 发布 2026 年迷你喷射快艇设计趋势报告,展示了 9 款重新定义水上运动的新概念。核心亮点包括革命性的充气式电动快艇、热插拔电池系统的通勤者设计、以及专为家庭安全优化的模块化构建方案。这些设计利用先进复合材料与零排放电动动力,解决了传统水上运动便携性差、续航焦虑及安全性不足的问题,为个人娱乐与商业租赁市场提供了全新灵感。

Accio Work官方 / ADK编译 3 分钟
code · 免费+付费
★ 5.0 · 120评测
C

Cursor

AI代码编辑器,快速进行编程和软件开发

Cursor是Anysphere公司推出的AI代码编辑器,基于GPT3.5、GPT4.0模型,支持Python、Java、C#、JavaScript等多语言,通过快捷键操作,实现代码自动生成、编辑、讨论等功能,显著提升开发效率。Cursor具备代码重构、理解、优化等高级功能。Cursor推出网页端和移动端 Agent。能在任何设备上无缝衔接地使用 AI 编程代理。可以并行运行多个 Agent 任务。每月提供200次GPT3.5和50次GPT4.0的使用次数,满足大多数用户需求。 全新升级的Cursor 2.0 ,搭载自研编码模型 Composer,能在 30 秒内完成复杂任务,代码生成速度达 250 tokens/秒,比同行快 400%。Cursor 2.0支持语音生成代码、原生浏览器工具测试代码、多 Agent 同时运行等功能,界面从“以文件为中心”变为“以 Agent 为中心”。Composer 基于强化学习和 MoE 架构训练,直接在真实环境中运行,具备强大的推理和泛化能力。 Cursor 2.2 版本新增调试模式,可在应用运行时植入日志,帮助开发者快速定位、修复复杂 Bug。计划模式也得到改进,新增内联流程图和任务分配功能,让团队协作更高效。多智能体“裁判”机制能自动评估多个智能体的结果、推荐最佳方案,附带详细评语,省去筛选结果的烦恼。

查看 Cursor 使用教程与功能