各厂语言模型

Gemini Task Automation 正式上线:AI 首次真正替你操作手机 App,已扩展至 40+ 应用

2026年7月23日1 次阅读
Gemini Task Automation 正式上线:AI 首次真正替你操作手机 App,已扩展至 40+ 应用

Google 的 Gemini Task Automation 从 beta 测试正式推出,成为首个能在手机上自主操作 App 的 AI 助手。你只需要说一句话——"帮我叫一辆 Uber 去机场"——Gemini 就会打开 App,替你一步步完成操作。目前该功能已扩展至 40+ 应用,在 Pixel 10 和 Galaxy S26 系列手机上首发可用。

一句话让 AI 替你操作手机

Gemini Task Automation 的核心逻辑很简单:你用自然语言描述需求,Gemini 自动打开对应的 App,在虚拟窗口里逐步点击、选择、填写信息,完成整个操作流程。比如你说"帮我点一份鸡肉套餐送到家",它会打开 DoorDash,找到对应餐厅,选择菜品,添加到购物车——全程你都可以看着它操作,也可以让它后台默默干活。

关键的安全设计是:最后一步——确认下单、确认付款——始终留给用户自己。Gemini 不会替你按下那个确认按钮。如果中途需要你做选择(比如"大份还是小份")或者遇到问题(比如需要授权位置权限),它会暂停通知你。

三层技术栈:从 API 到纯推理

Gemini 的 App 操作能力基于三层技术。最底层是 MCP(Model Context Protocol)和 Android App Functions 框架——开发者可以主动暴露 App 的操作接口,让 AI 更精准地调用。中间层是 Android 系统级的 App Functions,Google 从 2024 年就开始铺垫。最上层则是纯推理:当 App 既没有 MCP 也没有 App Functions 支持时,Gemini 3 模型会直接"看"App 界面,靠推理能力自行摸索操作路径。

Android 生态系统总裁 Sameer Samat 的表述很直白:"我们把它看作一系列技术栈,用户根本不在乎底层是哪一层——他们只想让事情办成。" 这三层的存在,意味着 Gemini 理论上可以操作任何 App,而不需要开发者主动适配。

实际体验:9 分钟点了一份餐,但准确度不错

The Verge 的编辑花了 5 天时间实测这个功能。结论是:慢,但靠谱。

点一份鸡肉套餐,Gemini 花了大约 9 分钟。它需要理解"半份 + 半份 = 一份"的逻辑(因为 App 里的鸡肉是按半份卖的),最终选对了。但在找"配菜"这个选项时绕了不少弯路——明明就在屏幕顶部,AI 却花了好一会儿才找到。

真正让人眼前一亮的是跨应用推理能力。编辑在日历里放了一个旧金山的航班信息,然后只跟 Gemini 说"帮我安排明天去机场的 Uber"。Gemini 自己去翻了日历和邮件,找到了航班时间,推算出应该 11:30 或 11:45 出发(考虑到编辑住得离机场近),然后询问是否要预约。这种从模糊指令到具体执行的闭环,是之前任何手机 AI 都做不到的。

失败的情况通常发生在前 1-2 分钟——比如 App 需要位置权限,或者默认地址还是上次出差的地方。一旦手动解决这些问题,重新启动自动化就能顺利完成。

可用范围:首批设备 + 两个国家

目前 Gemini Task Automation 的官方支持设备包括:Pixel 10、Pixel 10 Pro、Pixel 10 Pro XL,以及三星 Galaxy S26 系列。地区限美国和韩国。支持的应用已从 beta 期间的少量扩展到 40+ 款,包括 Uber、DoorDash、Grubhub 等主流服务。

值得注意的是,这项能力不会一直绑死在 Gemini 上。Samat 透露,Android 的下一个大版本(Android 17)将把 App 自动化作为系统级功能开放,这意味着其他 AI 助手也能调用同样的能力。

对 App 开发者的冲击

AI 替用户操作 App,意味着用户可能永远不会看到 App 里精心设计的推荐位、促销横幅和会员推广。当 Gemini 帮你叫车时,它不会停下来让你考虑 Uber One 会员优惠。对此 Samat 的回应是:"技术已经在发生了,问题是开发者社区如何找到正确的方式拥抱它。"

这可能是 AI Agent 时代对移动互联网最根本的冲击:App 从"用户界面"变成了"AI 界面",而开发者需要适应一个自己不再是用户直接对话对象的世界。

---

基于 The Verge 等多家媒体转述整理。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...