DeepMind 发布 SIMA 2:通用 AI 代理在 3D 虚拟环境中实现自主规划与推理
DeepMind 于 2025 年 11 月正式推出 SIMA 2,一款专为 3D 虚拟环境设计的通用 AI 代理。与早期版本相比,SIMA 2 在复杂场景下的导航、物体操作及多步任务规划能力上实现了质的飞跃。该模型能够理解空间关系、模拟物理交互,并具备自我反思与纠错机制,标志着 AI 从平面交互向沉浸式空间智能的重大跨越。
Google推出的AI聊天对话机器人Gemini
Gemini是谷歌推出的生成式人工智能模型系列,具备强大的多模态能力,能处理文本、图像、音频等多种内容。包含多个版本,如Gemini Pro、Gemini Flash、Gemini Ultra和Gemini Nano,分别适用于不同复杂度和效率需求的场景。Gemini具有深度研究功能,可以整合网络信息生成专业报告,支持45余种语言,具备超长上下文窗口,能处理复杂问题。能与谷歌应用互联,实现自动化操作,如根据日历安排任务。Gemini的代码辅助功能可帮助开发者提供代码建议,功能“Gems”能让用户创建专属的AI专家,如家教或健身教练等。Gemini通过实时联网功能,可以访问互联网上的最新信息,为用户提供全面且及时的答案。 Gemini 的免费互动工作区 Canvas 推出新功能,用户仅需一个提示词或上传一份文件,能快速生成 PPT。生成的幻灯片能自动搭配主题和相关图片,且支持导出到 Google Slides 进行编辑和团队协作,目前该功能已向个人账户和 Workspace 账户开放。
访问谷歌AI Studio:打开谷歌AI Studio的官方链接:https://aistudio.google.com 。在页面左下角点击Sign in登录,使用任意谷歌账号(Gmail账号)进行登录。
选择使用Gemini模型的方式:登录后,你可以选择直接在谷歌AI Studio中使用Gemini模型,或生成API使用。选择Use Google AI Studio,然后点击New Prompt。
谷歌AI Studio操作界面:界面分为左、中、右三部分,具体功能如下:项目名称(Untitled prompt):位于界面顶部,用于为当前的Prompt项目自定义命名。系统提示词(System Instructions):提供可选的语气和风格指令,定义AI生成内容的上下文、语气、风格等。聊天输入框(Type something):位于界面底部,在这里输入问题或指令与模型交互。模型选择(Model):在右侧菜单中,可以通过下拉框选择不同的Gemini模型,并查看模型的详细信息和Token计数。温度(Temperature):位于右侧菜单的中间,通过滑块调整生成内容的随机性。工具(Tools):包括Structured output、Code execution、Function calling、Grounding等选项,可根据任务需求启用。
创建新Prompt:点击左侧导航栏的Create new prompt可以创建一个新的Prompt任务。
DeepMind 于 2025 年 11 月正式推出 SIMA 2,一款专为 3D 虚拟环境设计的通用 AI 代理。与早期版本相比,SIMA 2 在复杂场景下的导航、物体操作及多步任务规划能力上实现了质的飞跃。该模型能够理解空间关系、模拟物理交互,并具备自我反思与纠错机制,标志着 AI 从平面交互向沉浸式空间智能的重大跨越。
DeepMind 正式推出 Genie 3,标志着世界模型(World Models)发展进入全新阶段。该模型在视觉、语言及因果推理能力上实现全面跃升,能够自主规划复杂任务并理解物理规律。Genie 3 不仅支持多模态输入,更具备在零样本场景下生成高质量推理链的能力,为通用人工智能(AGI)研究提供了关键基础设施。
DeepMind 正式发布 Genie 3,标志着其在世界模型(World Models)领域的重大突破。作为首个具备通用智能能力的架构,Genie 3 实现了从单一任务模型向多模态、多任务协同的范式转变。该模型在无需微调的情况下,能够自主规划复杂任务、理解物理规律并生成高质量内容,为通用人工智能(AGI)研究提供了新的技术路径。
DeepMind 于 2025 年 11 月正式发布 SIMA 2,一款专为 3D 虚拟环境设计的通用 AI 代理。该模型突破了传统 Agent 在复杂空间导航与多模态交互中的瓶颈,能够自主规划路径、进行逻辑推理并执行长序列任务。SIMA 2 通过引入动态上下文窗口与强化学习微调,显著提升了在开放世界中的适应能力,为元宇宙交互、游戏 AI 及虚拟仿真应用树立了新标杆。
DeepMind 推出 AlphaEarth Foundations,一款能整合海量地球观测数据的 AI 模型,被誉为“虚拟卫星”。它通过生成 64 维统一嵌入(Embedding),以 10x10 米分辨率精准描绘陆地与沿海水域,并在存储效率上较竞品降低 16 倍。该模型已集成至 Google Earth Engine,助力合作伙伴在农业监测、森林砍伐追踪等领域实现前所未有的精度与速度提升。
Gemini通常提供免费试用或免费基础版本,高级功能和更大使用量需要付费订阅。具体价格方案请以官网最新信息为准。
正规的聊天工具通常会采取数据加密和隐私保护措施,但建议避免上传敏感个人信息或商业机密内容。使用前请仔细阅读产品的隐私政策。
Gemini适合对聊天有需求的人群使用,包括个人用户、自由职业者、中小企业以及大型企业的相关部门。具体适用场景因产品定位而异。
多数AI聊天助手支持一定长度的上下文记忆,可以在对话过程中记住之前提到的信息,但记忆长度有限。
不同产品支持的文本长度不同,一般在数千到数十万字符之间。长文本处理能力因产品型号而异。