Thinking Machines 发布 Inkling-Small:276B MoE 模型仅需 12B 激活参数,支持百万级上下文

ADK APIMart官方 / ADK编译 2024-11-01 5 分钟 123 次浏览
速览导读 / Summary

Thinking Machines 正式推出 Inkling-Small,一款基于 2760 亿参数混合专家(MoE)架构的多模态开源模型。其核心突破在于仅需 120 亿激活参数即可运行,同时支持高达 100 万 token 的超长上下文窗口。该模型在 SWE-bench Verified 上取得 77.6% 的优异成绩,并在终端基准测试中以三分之一 token 成本匹配 Nemotron 3 Ultra 表现,为开发者提供了低成本、高灵活性的私有化部署方案。

总参数规模 276 Billion MoE 架构总参数
激活参数 12 Billion 每次请求激活参数
上下文窗口 1,000,000 tokens 自托管最大上下文
SWE-bench Verified 77.6% 代码问题解决能力
License Apache 2.0 开源协议

Key Insights / 核心看点

  • 1 采用 2760 亿参数 MoE 架构,仅需 120 亿激活参数即可运行,大幅降低推理成本。
  • 2 支持高达 100 万 token 的超长上下文窗口,完美适配大型代码库与长文档分析。
  • 3 原生支持文本、图像、音频多模态输入,输出涵盖代码、JSON 及自然语言。
  • 4 在 SWE-bench Verified 上得分 77.6%,以三分之一 token 成本匹配 Nemotron 3 Ultra 表现。
  • 5 提供 Apache 2.0 开源权重及 Hugging Face 下载,支持 NVIDIA GPU 4-bit 量化部署。

Thinking Machines 发布 Inkling-Small:276B MoE 模型仅需 12B 激活参数,支持百万级上下文

Thinking Machines 于近日发布了其最新的开源模型 Inkling-Small。这是一款极具竞争力的多模态混合专家(Mixture-of-Experts, MoE)模型,旨在解决当前开源领域“要么算力昂贵,要么能力不足”的痛点。尽管名为"Small",但其 2760 亿参数的庞大架构与独特的 MoE 设计,使其在保持高效的同时,具备了处理复杂代码、长文档及多模态任务的能力。

核心突破:极致效率与超长上下文

Inkling-Small 最引人注目的特性在于其惊人的参数效率。

  • 架构设计:采用 Decoder-only MoE 架构,总参数高达 2760 亿,但每次请求仅需激活约 120 亿 参数。相比之下,其旗舰模型虽总参数达 9750 亿,但激活参数高达 410 亿。这种设计大幅降低了推理成本。
  • 超长上下文:支持高达 1,000,000 tokens 的上下文窗口。这对于处理大型代码库、长篇技术文档或长时间会议记录至关重要,无需像传统方案那样将输入切碎,从而避免信息丢失。
  • 多模态输入:原生支持 文本、图像和音频 作为输入,输出则涵盖自然语言、代码及 JSON 格式。

性能表现:以三分之一成本匹配顶级模型

在关键基准测试中,Inkling-Small 展现了超越预期的实力,证明了"Small"并非意味着"Weak"。

  • SWE-bench Verified:得分 77.6%,优于 NVIDIA Nemotron 3 (71.9%),在解决真实软件开发问题方面表现优异。
  • Terminal Bench 2.1:在终端任务上匹配 Nemotron 3 Ultra 的表现,但 token 成本仅为后者的 三分之一
  • StrongREJECT:得分 98.6%,显示出极强的指令遵循能力和安全拒绝机制。

部署与生态:开源权重与灵活选择

Thinking Machines 提供了多种部署路径,满足不同团队的需求:

  1. 完全开源 (Self-Hosting)

    • 模型权重已开源至 Hugging Face,采用 Apache 2.0 许可。
    • 提供 4-bit NVFP4 量化版本,可在 NVIDIA GPU 上高效运行。
    • 支持全量 100 万 token 上下文,适合对隐私和数据控制有严格要求的企业。
  2. 托管服务 (Tinker API)

    • 提供快速接入的托管 API,无需复杂的本地基础设施搭建。
    • 支持企业级微调、Web 搜索及响应长度控制。
    • 上下文窗口限制为 256,000 tokens,适合快速原型验证。

对开发者的价值

Inkling-Small 的发布为美国团队及全球开发者提供了一个清晰的替代方案。它打破了封闭 API 的垄断,允许团队在保持低成本的同时,实现私有化部署和深度定制。无论是构建智能客服 Agent、进行代码审查,还是分析海量文档,Inkling-Small 都能提供强大的多模态处理能力,且无需承担高昂的推理费用。

"Inkling-Small 为团队提供了一个清晰的选项,使其能够在无需锁定于封闭 API 的情况下,以较低成本进行私有部署和长上下文多模态工作。" —— Thinking Machines 团队

随着 APIMart 等集成平台的出现,Inkling-Small 正逐渐融入多模态生产工作流,成为构建下一代 AI 应用的关键基石。

Inkling-Small gives U.S. teams a clear option for lower-cost deployment, private setup, and long-context multimodal work without being locked into a closed API.

Thinking Machines 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-09-08

Framer AI 发布 CMS List Field:重构重复内容管理,赋能动态网站构建

Framer 于 2026 年 9 月正式发布 CMS List Field,彻底革新了重复内容(如 FAQ、产品特性)的管理方式。该更新引入原生列表字段,支持通过 Framer Agent 一键迁移旧数据,并优化了编辑器的内容复用与排序能力。此次更新不仅解决了垂直视频嵌入等长期存在的 Bug,还显著提升了大型 CMS 集合的滚动性能,为开发者提供了更强大的动态内容构建工具。

Framer AI官方 / ADK编译 4 分钟
模型发布 2026-09-08

Ajelix 自研 GPU 基础设施并推出企业级 Agentic 平台,解决数据主权与生产落地难题

Agentic AI 平台 Ajelix 宣布投资自建 GPU 计算基础设施,并正式发布面向企业的 Ajelix Enterprise Platform。此举旨在解决企业级 AI 落地中数据不可控、审计困难及中断风险等痛点。新平台提供从智能体编排、RAG 知识库到严格治理的全栈能力,支持私有化部署,助力企业将 AI 从实验阶段平稳过渡到生产运营。

Ajelix官方 / ADK编译 4 分钟
AI 工具 2026-09-08

DreamFace 发布 AI 直播生成器:零设备打造虚拟主播,重塑内容创作流程

DreamFace 正式推出 AI 直播生成功能,彻底消除传统直播对相机、灯光及推流软件的依赖。用户仅需上传照片或选择虚拟形象,配合脚本即可在数分钟内生成具备真实直播节奏与能量的视频。该工具支持游戏、带货、播客等多种模板,让创作者无需露脸即可测试新内容形式,大幅降低内容生产的门槛与试错成本。

DreamFace官方 / ADK编译 3 分钟
技术解读 2026-09-08

Accio Work 发布 F1 电视转播技术深度解析:8K 流媒体与超低延迟架构揭秘

Accio Work 深度编译 F1 TV 如何永久改变体育转播的历程,聚焦于日本市场策略、8K 流媒体技术革新及超低延迟架构。文章揭示了现代体育直播对带宽、编码及 CDN 的极致要求,包括 45% 的带宽消耗增长和亚 200ms 延迟标准。同时探讨了数字观众如何驱动 23 亿美元的周边销售,为开发者与架构师提供了从传统广播向数字化、智能化转型的宝贵案例与技术指标参考。

Accio Work官方 / ADK编译 3 分钟
code · 免费
★ 5.0 · 120评测
A

APIMart

一站式 AI API 平台,多主流模型统一访问

APIMart是一站式 AI API 平台,提供对 500 多个主流 AI 模型的统一访问,涵盖聊天、视频生成、图像生成等多类 AI 能力。与 OpenAI 的 API 格式完全兼容,用户只需修改一行代码即可从 OpenAI 迁移到 APIMart,享受更低的成本和更高的性能。APIMart核心优势在于高性价比,相比竞品可节省 30% 至 70% 的成本,同时提供 99.9% 的高可用性。智能路由技术确保低延迟响应,支持超高并发,适合大规模应用场景。APIMart提供详细的用量分析和成本跟踪,帮助用户优化费用。

查看 APIMart 使用教程与功能