Qodo 发布 SWE-bench Verified 71.2% 高分:Claude 4 驱动下的生产级代码智能体突破

ADK Qodo官方 / ADK编译 2025-08-11 5 分钟 161 次浏览
速览导读 / Summary

Qodo 宣布其 CLI 智能体 Qodo Command 在业界权威基准 SWE-bench Verified 中取得 71.2% 的卓越成绩,无需微调即可直接运行。该成果得益于与 Anthropic 的深度合作(采用 Claude 4 模型)、基于 LangGraph 的架构优化以及针对复杂代码库的上下文摘要与执行规划机制。此次突破标志着 AI 代码智能体从“辅助补全”向“独立解决真实工程问题”的重大跨越。

SWE-bench Verified 得分 71.2% 业界最高基准测试成绩
底层大模型 Claude 4 Anthropic 深度合作伙伴关系
架构框架 LangGraph 支持结构化工作流与状态管理
部署方式 开箱即用 无需微调或特定调整

Key Insights / 核心看点

  • 1 Qodo Command 在 SWE-bench Verified 基准测试中取得 71.2% 的卓越成绩,无需微调即可直接运行。
  • 2 深度集成 Claude 4 模型,依托 Anthropic 合作伙伴关系打造自适应代码智能体。
  • 3 基于 LangGraph 架构,结合上下文摘要、计划优先策略及自适应重试机制,解决复杂多文件代码库难题。
  • 4 配备文件系统、Shell、Ripgrep 等专家级工具,支持模糊匹配回退,大幅提升代码执行成功率。

Qodo 斩获 SWE-bench Verified 71.2%:生产级代码智能体的里程碑

Qodo 近日宣布,其命令行智能体 Qodo Command 在衡量 AI 代理在真实世界软件工程任务中表现的最权威基准 SWE-bench Verified 中取得了 71.2% 的得分。这一成绩不仅刷新了行业记录,更向业界发出强烈信号:Qodo 的智能体架构专为生产环境开发而设计,无需针对特定基准进行微调(fine-tuning)或特殊调整,开箱即用即可交付高质量代码。

核心突破:从“补全”到“解决真实问题”

传统的 AI 代码评测往往在隔离、简化的环境中进行,而 SWE-bench Verified 则模拟了真实的 GitHub Issue 场景,要求智能体在复杂的 Python 开源库中,基于原始代码状态进行推理、规划和迭代修复。

Qodo Command 的成功并非源于对基准的“作弊”,而是其架构天然契合了真实开发挑战:

1. 上下文摘要与多文件理解

面对多文件依赖复杂的代码库,Qodo 摒弃了简单的模式匹配,转而采用上下文摘要(Context Summarization)技术。它将多层级代码蒸馏为高信号量的结构化摘要,确保语言模型在每一步仅接收最相关的上下文。这不仅避免了上下文窗口限制,更保证了深度推理的准确性。

2. 计划优先的执行策略

Qodo 采用计划优先(Plan-first)的默认策略。在实施前,智能体首先深度分析用户意图,将其分解为清晰的可执行子任务,形成执行路线图。完成度不仅由输出结果判定,更严格遵循原始计划,任何偏差都会触发反馈与重试循环,直至完全对齐。

3. 自适应重试与回退机制

当工具调用失败时,Qodo 不会停止,而是提取错误反馈,利用 LLM 诊断问题并智能调整参数。智能体被授权最多重试三次,若仍无法解决,则自动切换至替代策略。这种重试与回退机制(Retry and Fall-back Mechanisms)极大地提升了任务的鲁棒性。

技术架构:LangGraph 与 Claude 4 的强强联合

架构基石:Powered by LangGraph

Qodo Command 基于 LangGraph 框架构建,该框架为需要结构化、模块化及状态管理的智能体工作流提供了坚实基础。LangGraph 的图式编排能力使得 Qodo 能够复用并扩展 Qodo Gen(IDE 插件)中经过验证的代码分析、摘要及安全扫描组件,同时保持工作流的灵活拆分与扩展。

模型选择:Claude 4 的深度整合

虽然 Qodo 支持所有顶级 LLM,但在 SWE-bench Verified 测试中,Claude 4 表现最为优异。得益于与 Anthropic 的紧密合作伙伴关系,Qodo 成为“Powered by Claude”解决方案。双方正协同构建全球最适应性与学习型最强的代码智能体,充分利用了目前最先进的语言模型能力。

关键工具链:模拟专家开发者

Qodo Command 配备了一套强大的执行工具集,使其行为更接近资深开发者:

  • 文件系统工具 (FileSystem):支持读写和编辑文件。针对 SOTA 模型在精确匹配编辑时可能出现的错误,Qodo 实现了模糊匹配(fuzzy matching)回退机制,显著提升成功率。
  • Shell 工具 (Shell Tool):模拟真实开发者操作,可执行构建脚本、运行 Linter、运行测试套件并实时验证假设。
  • Ripgrep 集成:原生支持 ripgrep 递归搜索工具,实现对大型代码库的深层理解与快速定位。
  • 顺序思维 (Sequential Thinking):通过将任务拆解为可执行的步骤来辅助推理。虽然默认未开启,但可通过 MCP 协议轻松集成到任何使用 Qodo Command 的自定义智能体中。

总结

Qodo 在 SWE-bench Verified 上的表现证明了其智能体在代码审查、编写测试、修复 Bug 及生成功能等场景中的实用价值。正如官方所言,这不仅是分数的提升,更是工程能力的体现——Qodo Command 已经准备好协助开发者应对最复杂的现实世界挑战。

“我们很高兴宣布 Qodo Command 在 SWE-bench Verified 中取得了 71.2% 的分数。这是一个强有力的信号,表明 Qodo 的智能体是为生产开发现实而构建的。” —— Qodo 官方团队

This achievement is a strong signal that Qodo’s agents are built for the realities of production development.

Qodo 官方团队

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-08

Accio Work 2026 安全剃须刀刀片评测指南发布:覆盖敏感肌与硬茬胡须的全场景解决方案

Accio Work 于 2026 年 9 月发布最新评测指南,针对 2026 年湿剃市场的演变,深度解析了 8 款最佳安全剃须刀刀片。指南涵盖从 Astra Superior Platinum 的全能王者到 Feather Hi-Stainless 的极致锋利,特别强调了针对敏感肌肤(如 Derby Extra Super Stainless)和环保需求(如 Personna Lab Blue)的专项解决方案,为不同肤质与胡须类型的用户提供精准选型建议。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 发布厨房研磨工具智能指南:材料选择与性能优化解析

Accio Work 发布了一篇关于研磨钵(Mortar and Pestle)最佳材料选择的深度指南。文章详细对比了花岗岩、大理石、陶瓷、木材及不锈钢等主流材质在研磨性能、耐用性、维护难度及美学风格上的差异。该指南旨在帮助消费者及零售商根据烹饪需求(如香料粉碎、酱汁制作)做出精准决策,体现了 Accio Work 在垂直领域知识库构建与搜索优化方面的技术实力。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 2026 年迷你喷射快艇设计趋势:电动化与模块化重塑水上运动

Accio Work 发布 2026 年迷你喷射快艇设计趋势报告,展示了 9 款重新定义水上运动的新概念。核心亮点包括革命性的充气式电动快艇、热插拔电池系统的通勤者设计、以及专为家庭安全优化的模块化构建方案。这些设计利用先进复合材料与零排放电动动力,解决了传统水上运动便携性差、续航焦虑及安全性不足的问题,为个人娱乐与商业租赁市场提供了全新灵感。

Accio Work官方 / ADK编译 3 分钟
code · 免费+付费
★ 5.0 · 120评测
Q

Qodo

(原CodiumAI)AI开发平台

Qodo (原CodiumAI)是专注于提升代码质量和开发效率的 AI 驱动开发平台。通过智能代理技术,无缝集成到开发者的日常工作流程中,包括 IDE、终端和 Git 平台等。Qodo 提供了代码生成、测试生成、代码审查等功能,能根据项目需求生成符合最佳实践的代码和测试用例,在拉取请求中提供上下文感知的代码建议和自动化的审查工作流。利用多智能体架构和 Retrieval-Augmented Generation (RAG) 技术,高效收集代码上下文信息,生成高质量的代码和测试内容。Qodo 仅分析必要的代码,确保数据安全和隐私,并通过 SSL 加密传输,同时获得了 SOC2 认证。

查看 Qodo 使用教程与功能