BrowserOS 发布 BrowserVLM:0.54B 超轻量 GUI 定位模型,重构浏览器 Agent 点击精度

ADK BrowserOS官方 / ADK编译 2026-08-17 5 分钟 91 次浏览
速览导读 / Summary

BrowserOS 正式发布 BrowserVLM,一款仅 0.54B 参数的 GUI 定位视觉语言模型。该模型在 ScreenSpot-V2 和 ScreenSpot-Pro 基准测试中分别取得 79.10 和 36.37 的分数,平均表现优于 UI-TARS-7B 且参数量仅为后者的十二分之一。通过创新的“分块 - 子块 - 位置”三级定位架构及递归深度改造,BrowserVLM 实现了像素级点击精度,同时大幅降低计算成本,使本地化运行浏览器 Agent 成为可能。

模型参数量 0.54B 仅解码器参数,含视觉塔约 400M
ScreenSpot-V2 分数 79.10 超越 UI-TARS-7B 的 7B 模型
ScreenSpot-Pro 分数 36.37 硬难度高分辨率测试表现优异
推理效率提升 12x 相比同类 7B 模型,参数量减少约 12 倍

Key Insights / 核心看点

  • 1 BrowserVLM 以仅 0.54B 参数实现了像素级 GUI 定位,在 ScreenSpot 基准测试中超越 7B 级模型 UI-TARS-7B。
  • 2 创新采用 'Patch-Subpatch-Location' 三级离散定位架构,彻底解决高分辨率下坐标回归精度衰减问题。
  • 3 引入 RRT(Relaxed Recursive Transformers)深度改造,在保持性能的同时进一步压缩模型体积。
  • 4 支持高频交互,单次截图推理成本大幅降低,使本地化运行浏览器 Agent 成为现实。
  • 5 基于 SigLIP2 视觉塔与 Qwen3 风格解码器融合,具备极强的屏幕结构理解与细节捕捉能力。

BrowserVLM:0.54B 超轻量 GUI 定位模型,重构浏览器 Agent 点击精度

在浏览器自动化与计算机操作领域,Agent 的核心瓶颈往往在于“点击决策”——即根据截图和指令,将意图精确映射到屏幕上的单个像素。传统的解决方案依赖庞大的视觉语言模型(VLM),如 Kimi-VL (16B) 或 Qwen2.5-VL (72B),这些模型虽然准确,但推理成本高昂(需 144GB VRAM),且单次截图消耗数千 Token,严重限制了交互频率。

针对这一痛点,BrowserOS 联合其研究实习生 Neel Gupta 推出了 BrowserVLM,一款专为浏览器 Agent 设计的 0.54B 参数 GUI 定位模型。其核心目标是在保持极低资源占用的同时,实现像素级的点击精度。

核心突破:小模型,大精度

BrowserVLM 在性能上实现了显著的“以小博大”。在业界公认的 ScreenSpot-V2ScreenSpot-Pro 基准测试中,BrowserVLM 分别取得了 79.1036.37 的分数,平均分为 57.73。这一成绩不仅超越了现有的 7B 级 GUI 专家模型(如 UI-TARS-7B),更在硬难度高分辨率测试中展现出卓越的能力。

关键优势:BrowserVLM 的参数量仅为 UI-TARS-7B 的约 1/12,却能在高保真度下提供像素级定位,彻底解决了大模型在长轨迹中上下文溢出和延迟过高的问题。

技术架构:从“回归坐标”到“离散定位”

BrowserVLM 摒弃了传统模型通过文本回归坐标(Regression)的方式,转而采用 离散化定位(Discrete Grounding) 策略,确保定位精度不随图像分辨率升高而衰减。

1. 三级精确定位机制

模型采用 Patch → Sub-patch → Location 的三级递归细化流程:

  • Patch (粗粒度):将屏幕划分为网格,模型首先定位到包含目标元素的粗略区域。
  • Sub-patch (中粒度):在选定的 Patch 内部进行二次细化,恢复因池化而丢失的细节。
  • Location (细粒度):在 Sub-patch 内确定最终点击坐标。

这种设计使得空间精度独立于图像分辨率(Resolution-independent),无论屏幕是 1080p 还是 4K,点击精度均能维持在像素级。

2. 递归深度改造 (RRT Retrofit)

为了在保持深度的同时进一步压缩模型体积,BrowserVLM 引入了基于 Relaxed Recursive Transformers (RRT) 的改造方案。该方案将深度转化为循环结构,在保持有效深度的同时,将存储的解码器大小缩减了约 9%,进一步降低了显存占用。

3. 架构融合

模型采用 SigLIP2 视觉塔与 Qwen3 风格 解码器的融合架构。图像被智能分块(Tiling)处理,预训练阶段最多 8 个 Crop,后训练阶段提升至 48 个 Crop,确保高细节屏幕信息的完整摄入。

实际应用价值

BrowserVLM 的发布标志着浏览器 Agent 从“云端依赖”向“本地高效”迈出了关键一步:

  • 降低门槛:0.54B 的体量使其能在普通消费级 GPU 甚至 CPU 上运行,无需昂贵的 A100 集群。
  • 提升效率:单次点击推理成本大幅降低,支持每分钟数十次的高频交互,不再受限于大模型的 Token 消耗。
  • 增强鲁棒性:在复杂 GUI 界面和高分辨率截图下,依然能保持稳定的点击准确率,解决了传统模型在细节元素上容易“失焦”的问题。

BrowserVLM 不仅是一个模型,更是构建下一代高效、低成本、本地化浏览器 Agent 的基础设施。随着相关代码与权重的开源,开发者有望借此大幅优化自身的自动化流程。


注:模型权重与代码库预计近期开源,具体细节请参阅官方技术论文。

Small enough to run beside your agent, not instead of it.

BrowserOS Co-Founder

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-08

Accio Work 2026 安全剃须刀刀片评测指南发布:覆盖敏感肌与硬茬胡须的全场景解决方案

Accio Work 于 2026 年 9 月发布最新评测指南,针对 2026 年湿剃市场的演变,深度解析了 8 款最佳安全剃须刀刀片。指南涵盖从 Astra Superior Platinum 的全能王者到 Feather Hi-Stainless 的极致锋利,特别强调了针对敏感肌肤(如 Derby Extra Super Stainless)和环保需求(如 Personna Lab Blue)的专项解决方案,为不同肤质与胡须类型的用户提供精准选型建议。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 发布厨房研磨工具智能指南:材料选择与性能优化解析

Accio Work 发布了一篇关于研磨钵(Mortar and Pestle)最佳材料选择的深度指南。文章详细对比了花岗岩、大理石、陶瓷、木材及不锈钢等主流材质在研磨性能、耐用性、维护难度及美学风格上的差异。该指南旨在帮助消费者及零售商根据烹饪需求(如香料粉碎、酱汁制作)做出精准决策,体现了 Accio Work 在垂直领域知识库构建与搜索优化方面的技术实力。

Accio Work官方 / ADK编译 3 分钟
AI 工具 2026-09-08

Accio Work 2026 年迷你喷射快艇设计趋势:电动化与模块化重塑水上运动

Accio Work 发布 2026 年迷你喷射快艇设计趋势报告,展示了 9 款重新定义水上运动的新概念。核心亮点包括革命性的充气式电动快艇、热插拔电池系统的通勤者设计、以及专为家庭安全优化的模块化构建方案。这些设计利用先进复合材料与零排放电动动力,解决了传统水上运动便携性差、续航焦虑及安全性不足的问题,为个人娱乐与商业租赁市场提供了全新灵感。

Accio Work官方 / ADK编译 3 分钟
agent · 免费
★ 5.0 · 120评测
B

BrowserOS

免费开源的 AI Agent 浏览器

BrowserOS 是免费开源的AI Agent 浏览器,BrowserOS 将强大的 AI 智能体直接集成到浏览器中,运行在本地,支持自动化任务(如填写表单、安排会议)和深度研究功能。BrowserOS 注重隐私,支持本地运行模型(如 Ollama),数据不会上传到云端。BrowserOS 提供语义搜索、本地 AI 聊天和生产力工具,兼容所有 Chrome 扩展,界面与Google  Chrome 类似,用户无需学习成本即可上手。

查看 BrowserOS 使用教程与功能