Kimi 发布 K2 Thinking:测试时缩放与智能体推理的里程碑突破

ADK Kimi智能助手官方 / ADK编译 2026-07-13 5 分钟 149 次浏览
速览导读 / Summary

Kimi 正式推出 K2 Thinking,一款专为智能体设计的开源推理模型。该模型通过测试时缩放(Test-time Scaling)技术,在保持 INT4 量化高效推理的同时,实现了长达 200-300 步的工具调用与复杂任务规划。在 HLE、SWE-Bench 等权威基准测试中创下多项 SOTA 记录,显著提升了代码生成、深度搜索及长文本创作能力,标志着 AI 智能体从‘单步响应’向‘自主长期规划’的跨越。

HLE 基准得分 44.9% Humanity's Last Exam 智能体搜索与编程新纪录
BrowseComp 得分 60.2% 远超人类基准线 (29.2%),展现深度网页推理能力
SWE-Bench Verified 71.3% 代码修复与软件工程任务表现优异
最大连续工具调用 200-300 次 无需人类干预的自主长程规划能力
推理精度 INT4 通过 QAT 技术实现 2 倍生成速度提升

Key Insights / 核心看点

  • 1 推出 K2 Thinking 开源模型,通过测试时缩放(Test-time Scaling)技术,实现 200-300 步连续工具调用与长程规划。
  • 2 在 HLE、BrowseComp 等权威基准测试中刷新 SOTA 记录,HLE 得分达 44.9%,BrowseComp 得分达 60.2%。
  • 3 采用 Quantization-Aware Training (QAT) 技术,支持 INT4 量化推理,在保持高性能的同时实现 2 倍生成速度提升。
  • 4 显著增强代码生成与调试能力,在 SWE-Bench Verified 上得分 71.3%,能处理复杂前端与多语言开发任务。
  • 5 支持博士级数学问题求解,通过动态循环的‘思考 - 搜索 - 代码’模式解决跨学科难题。

Kimi 发布 K2 Thinking:测试时缩放与智能体推理的里程碑突破

7 月 13 日,Kimi 正式推出了其最新力作 Kimi K2 Thinking。这不仅仅是一次模型参数的更新,更是 Kimi 在 Test-time Scaling(测试时缩放) 领域的重大突破。作为目前最强大的开源推理模型之一,K2 Thinking 被设计为一个具备自主规划能力的 Thinking Agent,能够在无需人类干预的情况下,通过数百个步骤的连续工具调用来解决极其复杂的跨学科问题。

核心突破:测试时缩放与高效推理

K2 Thinking 的核心创新在于将推理能力与工具调用深度结合。不同于传统模型仅依赖上下文窗口,K2 Thinking 通过 Scaling both thinking tokens and tool calling steps(同时扩展思考令牌和工具调用步骤),实现了真正的长程规划。

  • 超长序列执行:模型能够连续执行 200–300 次工具调用,在“思考 - 搜索 - 代码 - 验证”的动态循环中保持逻辑连贯性。
  • INT4 量化加速:针对推理模型通常因解码长度过长而导致量化效果不佳的痛点,Kimi 采用了 Quantization-Aware Training (QAT) 技术。通过 INT4 权重量化 MoE 组件,K2 Thinking 在保持 SOTA 性能的同时,实现了 2 倍的生成速度提升,大幅降低了 GPU 显存占用。

性能实测:多项基准测试刷新纪录

Humanity's Last Exam (HLE)BrowseCompSWE-Bench Verified 等严苛基准测试中,K2 Thinking 展现了卓越的多领域专家级推理能力:

基准测试 得分 关键表现
HLE (Humanity's Last Exam) 44.9% 覆盖 100+ 学科,创下智能体搜索与编程新纪录
BrowseComp 60.2% 远超人类基准线 (29.2%),擅长深度网页信息检索
SWE-Bench Verified 71.3% 代码修复与软件工程任务表现优异
SWE-Multilingual 61.1% 多语言代码生成能力强劲

应用场景与能力进化

K2 Thinking 的能力不仅体现在分数上,更体现在解决实际问题的深度:

1. 深度代码开发与调试

模型能够处理复杂的 HTML、React 及组件密集型的前端任务。在智能体编程模式下,它能将抽象需求转化为可交互的产品原型,并流畅地集成到软件代理中执行多步开发工作流。

2. 自主搜索与问题解决

BrowseComp 测试中,K2 Thinking 展示了其 Goal-directed, web-based reasoning(目标导向的网页推理)能力。面对模糊的开放性问题,它能将其分解为可执行的子任务,通过动态的 think → search → browser use 循环,最终给出严谨的答案。例如,它曾成功通过 23 次交错推理和工具调用 解决了一个 博士级别的数学问题

3. 创意与实用写作增强

  • 创意写作:文本风格更加生动,意象更具深度,故事和剧本更具人性与情感共鸣。
  • 实用写作:在学术研究和长文分析中,逻辑更加严密,指令遵循度更高,能够系统地覆盖每一个要求点。

生态落地

Kimi K2 Thinking 现已在 kimi.ai 的聊天模式中上线,并开放了 API 接口。随着全功能智能体模式(Full Agentic Mode)的即将推出,开发者们可以利用这一强大的推理引擎,构建具备长期记忆、自主规划和复杂工具使用能力的下一代 AI 应用。

"K2 Thinking marks our latest efforts in test-time scaling, by scaling both thinking tokens and tool calling steps." — Kimi 官方团队

Kimi K2 Thinking 的发布,标志着 AI 智能体正从简单的指令执行者,进化为能够独立处理复杂、长程任务的通用问题解决专家。

K2 Thinking marks our latest efforts in test-time scaling, by scaling both thinking tokens and tool calling steps.

Kimi 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-09-08

Framer AI 发布 CMS List Field:重构重复内容管理,赋能动态网站构建

Framer 于 2026 年 9 月正式发布 CMS List Field,彻底革新了重复内容(如 FAQ、产品特性)的管理方式。该更新引入原生列表字段,支持通过 Framer Agent 一键迁移旧数据,并优化了编辑器的内容复用与排序能力。此次更新不仅解决了垂直视频嵌入等长期存在的 Bug,还显著提升了大型 CMS 集合的滚动性能,为开发者提供了更强大的动态内容构建工具。

Framer AI官方 / ADK编译 4 分钟
模型发布 2026-09-08

Ajelix 自研 GPU 基础设施并推出企业级 Agentic 平台,解决数据主权与生产落地难题

Agentic AI 平台 Ajelix 宣布投资自建 GPU 计算基础设施,并正式发布面向企业的 Ajelix Enterprise Platform。此举旨在解决企业级 AI 落地中数据不可控、审计困难及中断风险等痛点。新平台提供从智能体编排、RAG 知识库到严格治理的全栈能力,支持私有化部署,助力企业将 AI 从实验阶段平稳过渡到生产运营。

Ajelix官方 / ADK编译 4 分钟
AI 工具 2026-09-08

DreamFace 发布 AI 直播生成器:零设备打造虚拟主播,重塑内容创作流程

DreamFace 正式推出 AI 直播生成功能,彻底消除传统直播对相机、灯光及推流软件的依赖。用户仅需上传照片或选择虚拟形象,配合脚本即可在数分钟内生成具备真实直播节奏与能量的视频。该工具支持游戏、带货、播客等多种模板,让创作者无需露脸即可测试新内容形式,大幅降低内容生产的门槛与试错成本。

DreamFace官方 / ADK编译 3 分钟
技术解读 2026-09-08

Accio Work 发布 F1 电视转播技术深度解析:8K 流媒体与超低延迟架构揭秘

Accio Work 深度编译 F1 TV 如何永久改变体育转播的历程,聚焦于日本市场策略、8K 流媒体技术革新及超低延迟架构。文章揭示了现代体育直播对带宽、编码及 CDN 的极致要求,包括 45% 的带宽消耗增长和亚 200ms 延迟标准。同时探讨了数字观众如何驱动 23 亿美元的周边销售,为开发者与架构师提供了从传统广播向数字化、智能化转型的宝贵案例与技术指标参考。

Accio Work官方 / ADK编译 3 分钟
chat · 免费+付费
★ 5.0 · 120评测
K

Kimi智能助手

月之暗面推出的AI智能助手

Kimi智能助手是北京月之暗面推出的AI智能助手,支持联网搜索能力,可实时获取最新信息结合搜索结果为用户提供准确且详细的回答。支持多种文件格式(如PDF、Word、Excel、PPT等),能帮助用户快速整理和提取关键信息。Kimi智能助手具备长文本处理能力,最高支持200万字的输入和输出,适合处理复杂的长篇内容。 k2.5:月之暗面开源的全新一代全能旗舰模型,具备顶尖的代码生成、视觉理解能力,支持自主 Agent 集群协作 k2:月之暗面Kimi推出的具备超强代码和 Agent 能力的 MoE 架构基础模型,发布即开源。 k1.5:月之暗面Kimi推出的多模态思考模型,具备强大的推理和多模态处理能力。 用户可以通过网页端、手机端APP或浏览器插件使用Kimi智能助手。具备Kimi探索版和Kimi+等特色功能,能满足用户在不同场景下的多样化需求。

查看 Kimi智能助手 使用教程与功能