InfCode 在 SWE-Bench Verified 刷新世界最佳,多智能体架构重塑企业级 AI 编程范式

ADK InfCode官方 / ADK编译 2025-10-01 5 分钟 133 次浏览
速览导读 / Summary

词元无限联合北航研发的 InfCode 智能体在 SWE-Bench Verified 基准上以 79.4% 的 Pass@1 得分刷新世界最佳(SOTA),显著超越 GPT-5 等顶尖模型。InfCode 首创基于功能意图的代码定位、AST 结构化检索及对抗式双智能体修复机制,在 C++ 等系统语言上表现尤为突出,标志着 AI 编程从单体生成向全流程自主工程进化的关键跨越。

SWE-Bench Verified Pass@1 79.4% 刷新世界最佳成绩,远超行业平均水平
C++ 修复率 25.58% 在系统语言复杂场景下表现卓越
迭代轮次 5 轮 生成阶段并行迭代,确保方案多样性
架构类型 对抗式双智能体 代码修复与测试增强闭环交互

Key Insights / 核心看点

  • 1 在 SWE-Bench Verified 基准上以 79.4% 的 Pass@1 得分刷新世界最佳(SOTA),远超 GPT-5 等主流模型。
  • 2 首创基于功能意图的代码定位机制与 AST 结构化检索引擎,在 C++ 等系统语言上修复率高达 25.58%。
  • 3 构建对抗式双智能体闭环架构,通过“代码补丁生成”与“测试补丁生成”的交替迭代,实现工程级质量的持续进化。
  • 4 采用生成与筛选两阶段工程化流程,通过多容器并行探索与真实环境重放,确保补丁的鲁棒性与可维护性。

InfCode 刷新 SWE-Bench Verified 世界最佳,开启 AI 编程智能体新纪元

近日,词元无限(Tokfinity)与北京航空航天大学复杂关键软件环境全国重点实验室联合发布的 AI 编程智能体 InfCode,在业界权威基准 SWE-Bench Verified 上取得了 79.4% 的 Pass@1 得分。这一成绩不仅刷新了当前的 SOTA(State-of-the-Art)记录,更远远领先于 GPT-5、Claude 等公开排行榜上的顶尖模型(约 65%),标志着 AI 编程正式从“代码片段生成”迈向“全流程自主工程修复”的新阶段。

01 突破系统语言瓶颈:C++ 修复率领跑

传统大模型在 Python 等高级语言上表现尚可,但在涉及内存管理、模板机制和复杂编译链的 C++、Rust 等系统语言上往往力不从心。Multi-SWE-bench 数据显示,C++ 项目通常涉及跨文件、大规模修改(单次修改超 200 行,涉及 7 个文件),导致主流模型解决率不足 8%。

InfCode 在 C++ 子集上取得了 25.58% 的 Pass@1 解决率,展现了其在复杂系统代码中的卓越能力。这得益于其独特的代码意图分析(Code Intent Analysis)机制,能够超越传统的字面匹配,理解自然语言描述背后的功能语义,并精准映射到具体的实现单元(函数或类),从而在无堆栈追踪的情况下直达根因代码。

02 三大核心突破:从“盲搜”到“精准手术”

InfCode 之所以能实现如此高的修复成功率,主要归功于以下三大技术突破:

1. 超越 RAG:基于功能意图的复杂上下文定位

传统基于向量相似度的检索(RAG)往往只能找到包含关键词的注释或变量,容易停留在“字面相关”而非“逻辑归属”的层面。InfCode 通过融合语义推理与架构理解,让智能体具备“理解全局意图、直达根因代码”的能力,解决了在大型工程中定位问题代码的痛点。

2. 增强工具:基于 AST 的结构化检索

针对 C++ 等语言中同一标识符可能代表类名、函数或变量的歧义问题,InfCode 自研了基于抽象语法树(AST)的结构化检索引擎。它利用 Tree-Sitter 构建完整语法树,提供 FindClassFindFunction 等语法层 API,实现了真正的“语法感知搜索”,避免了传统 Grep 的高噪声问题。

3. 多智能体生成:对抗式双智能体闭环

InfCode 摒弃了传统的单智能体单向修复模式,首创对抗式双智能体架构

  • 代码补丁生成器:负责修改代码以通过测试集。
  • 测试补丁生成器:负责生成更强的测试用例,捕捉边界场景。 两者在闭环中交替迭代,形成“越测越强、越修越稳”的进化机制,确保补丁具备生产级别的鲁棒性与完备性。

03 工程化细节:生成与筛选的双重保障

在实际工程落地中,InfCode 采用了严谨的两阶段修复流程:

  1. 生成阶段(Generate):并行启动多个独立容器,运行修复链路,最多经历五轮迭代,产生多样化的候选补丁组合。
  2. 筛选阶段(Select):在真实构建和测试环境中重放每个补丁,不仅验证测试通过,还评估行为一致性、稳定性和副作用,最终选出质量最高的修复方案。

这种“广泛探索 + 精准筛选”的策略,有效防止了模型过拟合或生成脆弱修改,使其产出可直接集成于生产仓库的工程级补丁。

结语:从单体提效到组织进化

InfCode 的成功不仅是算法模型的胜利,更是 AI 编程范式的变革。正如官方团队所言,这代表了 AI 从“单体提效”走向企业“组织进化”的新范式。对于希望在企业场景引入 AI Coding 的决策者而言,InfCode 展示了智能体在复杂软件工程中自主规划、工具调用与自我修正的完整能力,为构建下一代可信、高效的智能软件环境奠定了坚实基础。

更多技术细节可参考团队发表于 arXiv 的最新报告:

这些数字背后,是一套面向企业场景设计的多智能体体系。对于希望在企业场景引入 AI Coding 的决策者而言,这是 AI 从「单体提效」走向企业「组织进化」的新范式。

词元无限研发团队与北航实验室

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-08

Accio Work 2026 安全剃须刀刀片评测指南发布:覆盖敏感肌与硬茬胡须的全场景解决方案

Accio Work 于 2026 年 9 月发布最新评测指南,针对 2026 年湿剃市场的演变,深度解析了 8 款最佳安全剃须刀刀片。指南涵盖从 Astra Superior Platinum 的全能王者到 Feather Hi-Stainless 的极致锋利,特别强调了针对敏感肌肤(如 Derby Extra Super Stainless)和环保需求(如 Personna Lab Blue)的专项解决方案,为不同肤质与胡须类型的用户提供精准选型建议。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 发布厨房研磨工具智能指南:材料选择与性能优化解析

Accio Work 发布了一篇关于研磨钵(Mortar and Pestle)最佳材料选择的深度指南。文章详细对比了花岗岩、大理石、陶瓷、木材及不锈钢等主流材质在研磨性能、耐用性、维护难度及美学风格上的差异。该指南旨在帮助消费者及零售商根据烹饪需求(如香料粉碎、酱汁制作)做出精准决策,体现了 Accio Work 在垂直领域知识库构建与搜索优化方面的技术实力。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 2026 年迷你喷射快艇设计趋势:电动化与模块化重塑水上运动

Accio Work 发布 2026 年迷你喷射快艇设计趋势报告,展示了 9 款重新定义水上运动的新概念。核心亮点包括革命性的充气式电动快艇、热插拔电池系统的通勤者设计、以及专为家庭安全优化的模块化构建方案。这些设计利用先进复合材料与零排放电动动力,解决了传统水上运动便携性差、续航焦虑及安全性不足的问题,为个人娱乐与商业租赁市场提供了全新灵感。

Accio Work官方 / ADK编译 3 分钟
code · 免费+付费
★ 5.0 · 120评测
I

InfCode

词元无限推出的企业级AI编程工具

InfCode 是词元无限推出的企业级AI 编程工具,深度集成主流 IDE,如 JetBrains 全系列和 VS Code。InfCode 通过智能体技术,为企业开发者提供高效、安全的编程支持。InfCode 聚焦于解决企业落地 AI 产品的痛点,提升个人开发效率,能通过管理驾驶舱助力团队实现规模化提效。InfCode 支持私有化部署,确保企业数据安全,同时优化大规模代码库和复杂逻辑处理,让企业研发在安全可控的环境中实现智能化转型,助力企业在复杂软件开发中实现简单交付。

查看 InfCode 使用教程与功能