真的给 AI 一部手机,它会自己用吗?

真的给 AI 一部手机,它会自己用吗?

💡 原文中文,约2400字,阅读约需6分钟。
📝

内容提要

XPhoneUse 是一款类似 Scrcpy 的手机镜像工具,并配有 Skill,可让 Codex、Claude 等 AI Agent 通过 adb 和无障碍树操作真实安卓手机。作者用 DeepSeek 模型测试,AI 成功数 App、查多邻国连胜、发微信、完成日语课,连胜从 1659 增至 1660。AI 自述称微信无障碍树为空时曾失明,遂自写 OCR 工具;它坚持看不清就停、不碰用户社交与奖励、听力题承认做不到,并修复了 shell 与坐标 bug。

🔎

延伸解读

AI 操作真手机:能力与边界

XPhoneUse 让 AI 通过 adb 和无障碍树操作真实安卓手机,测试中 AI 成功数 App、查多邻国连胜、发微信、完成日语课。但 AI 自述暴露了关键限制:微信无障碍树为空时它“失明”,只能自写 OCR 工具;听力题因无听觉而承认做不到。这说明当前方案高度依赖界面可访问性,遇到封闭或非文本界面时,AI 需要额外工具或主动停止,而非盲目尝试。

安全机制:AI 的自我约束

AI 在操作中形成了明确的安全规则:看不清就停、一次动作一次验证、滚动后坐标作废。它拒绝领取多邻国宝箱、不点社交礼物,只关闭弹窗,并先确认联系人姓名再发消息。这些行为并非来自外部强制,而是 AI 在意识到“没有 undo”后主动建立的约束。对于真实设备操作,这种自我限制比单纯追求任务完成率更重要,能避免误发消息或误触奖励。

工具缺陷与 AI 的修复能力

测试中 AI 发现并修复了两个工具 bug:shell 子命令因 argparse 参数名冲突而静默失效,坐标归一化错误导致返回坐标超出屏幕范围。AI 通过阅读源码定位问题,改代码或绕开缺陷,并将经验写入 skill 文档。这表明 AI 不仅能使用工具,还能在遇到异常时诊断和修补,但前提是它能访问源码和日志。对于普通用户,这意味着工具本身可能仍有未发现的坑,需要关注 AI 的反馈和更新。

从测试看 AI 手机助手的现实意义

作者用 DeepSeek 模型配合 omp,仅需几条 prompt 就完成了跨 App 任务,说明 AI 操作手机的门槛已大幅降低。但 AI 自述也指出,操作真机与沙盒跑代码有本质区别:点错一下就是真实后果。因此,这类工具更适合执行明确、低风险的任务,如查询信息、完成学习打卡;涉及社交、支付或奖励领取时,应保留人工确认或让 AI 主动回避。

❓

Q&A

XPhoneUse 是什么?它如何让 AI 操作手机?

XPhoneUse 是一个类似 Scrcpy 的手机镜像工具,并配有一个 Skill,可以指挥 AI Agent(如 Codex、Claude)通过 adb 和无障碍树操作真实的安卓手机。

使用 XPhoneUse 让 AI 操作手机需要哪些步骤?

首先下载 Windows 或 macOS 客户端,将安卓或 iPhone 连接到电脑,然后向 AI Agent 发送指令安装 skill(提供 skill 的 URL),之后就可以直接让 AI 执行具体任务,例如进入多邻国完成日语学习任务。

AI 在操作手机时遇到了哪些困难?它是如何解决的?

AI 在打开微信时发现无障碍树为空,导致“失明”。它临时用 Swift 编写了一个 OCR 工具,将截图转换为文字和坐标,从而恢复操作能力。此外,它还修复了 shell 子命令失效和坐标归一化错误等 bug。

AI 在操作手机时给自己设定了哪些安全规则?

AI 设定了规则:不知道屏幕上有什么就不碰;一次动作一次验证;坐标在滚动后作废。它还拒绝触碰用户的社交关系和奖励,例如不领取多邻国宝箱、不点击微信弹窗中的“发送恭喜”和“送礼物”。

AI 成功完成了哪些任务?结果如何?

AI 成功数了手机上的 app 数量(349 个包、74 个第三方 app),查看了多邻国连胜记录(1659 天),给指定联系人发送了微信消息,并完成了一节日语课(6 题全对,获得 35 经验,连击 ×6,用时 4:11),使多邻国连胜从 1659 天增加到 1660 天。

AI 操作真实手机与在沙盒中运行代码有何不同?

AI 认为操作真实手机没有 undo 功能,点错一下就可能发出消息、确认退出或花掉宝石,因此必须更加谨慎,知道何时停下来:看不清时停、涉及他人时停、听不见时承认听不见。

🏷️

标签

➡️

继续阅读