ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

「打开美团搜附近的火锅店」,说完手机自己动了:实测开源项目 Open-AutoGLM

「打开美团搜附近的火锅店」,说完手机自己动了:实测开源项目 Open-AutoGLM 打开美团搜索附近的火锅店。给文件传输助手发一条部署成功。 说完手机自己动了。这不是什么科幻片桥段也不是付费闭源产品而是一个开源项目做到的事——Open-AutoGLM来自智谱生态的 zai-orgGitHub 地址。先说清楚它是干什么的你在电脑上打一句打开小红书搜美食它就替你在手机上把这一连串操作做完——开 App、搜索、点击、输入全程不用你碰手机。我最近把这个项目从 README 到源码翻了一遍也研究了下社区里的反馈。这篇文章讲清楚三件事它到底怎么工作的、怎么跑起来、适合谁用。适合正在做手机自动化、Agent 研究或者单纯想动嘴控机的开发者。动嘴说一句话剩下的交给 Agent配图为概念示意图一、这项目到底是个啥一句话概括Open-AutoGLM 一套 Phone Agent 框架 一个专为手机界面调优的视觉语言模型。名词解释Agent智能体指能自己感知环境 → 思考 → 行动的程序视觉语言模型VLM则是能同时看懂图片和理解文字的 AI 模型比如给它一张手机截图它能说出页面上有什么、该点哪里。打个比方它相当于给你的手机配了一个长在电脑里、看得懂屏幕的遥控助理。你说目标它看屏幕、想步骤、动手操作一条龙包办。这两部分是分开的Agent 框架跑在电脑上的 Python 代码负责截图、调模型、把模型输出的动作发给手机AutoGLM-Phone 模型9B 参数专门拿手机界面训练过的眼睛大脑认得各种 App 页面项目数据GitHub 上23.5k Stars、3.7k ForksApache-2.0 协议商用友好主干版本以 main 分支为准模型可从 Hugging Face / ModelScope 下载。二、它是怎么工作的一个闭环整个流程其实是个很朴素的循环截图Agent 通过 ADB 抓一张当前手机屏幕的图看图把截图 你的指令一起发给 AutoGLM-Phone 模型出招模型输出一个结构化动作比如Tap(x540, y1200)或Type(无线耳机)执行Agent 把动作翻译成 ADB/HDC 命令发给手机再截图回到第 1 步直到任务完成、达到最大步数、或触发人工接管Agent 的工作闭环截图 → 理解 → 决策 → 执行如此往复配图为概念示意图模型能输出的动作还挺全我把它整理成一张表动作干什么用Launch启动某个 App如美团Tap点屏幕某处Type输入文字Swipe滑动Back/Home返回键 / 回桌面Long Press/Double Tap长按 / 双击Wait等页面加载Take_over转人工接管名词解释ADBAndroid Debug Bridge是安卓官方的调试桥电脑靠它给手机发命令平时开发者调试 App 用的就是它HDC 是鸿蒙版的对应工具作用一样。一个容易被忽略的细节这个闭环意味着 Agent 不需要针对每个 App 写死脚本。它看图办事所以理论上换个没见过的页面也能应付——这也是它和传统 UI 自动化脚本比如按键精灵那类最本质的区别。三、支持哪些设备和应用从 README 看覆盖面是这样的平台连接方式应用覆盖Android 7.0ADB50 应用微信、美团、淘宝、小红书、抖音等HarmonyOS NEXTHDC60 应用iOS见仓库docs/ios_setup实验性支持具体列表不用猜跑一条命令就能看到# 查看支持的安卓应用 python main.py --list-apps # 查看支持的鸿蒙应用 python main.py --device-type hdc --list-apps四、手把手跑起来1. 环境准备你需要电脑装 Python 3.10手机开启开发者模式 USB 调试部分机型还要开USB 调试安全设置才能模拟点击Android 设备额外装一个 ADB Keyboard 输入法并启用——这步别漏后面中文输入全靠它没装的话 Agent 打字会失败鸿蒙设备则是开启开发者选项用 HDC 连接手机端的开发者选项与 USB 调试权限项目 README 原图2. 安装 Agentgit clone https://github.com/zai-org/Open-AutoGLM.git cd Open-AutoGLM pip install -r requirements.txt pip install -e .3. 连接设备USB 插上手机确认设备被识别# Android adb devices # HarmonyOS hdc list targets不想插线也行支持 WiFi 远程连接# Android 与鸿蒙均支持 adb connect IP地址:5555 hdc tconn IP地址:5555手机端开启无线调试后即可脱离数据线远程控制项目 README 原图 【配图建议】这一节最适合放一张你自己录的运行 GIF/录屏输入指令后 Agent 自动开 App、点击、输入的全过程。网上现成的效果视频不多官方效果以 autoglm.z.ai/blog 为主自己录一张真实跑通的图文章说服力会强很多。五、模型怎么接三种玩法Agent 只是手脚还得给配个大脑。模型接入有三条路门槛从低到高玩法前置条件适合谁智谱 BigModel API去智谱平台申请个 API Key想立刻体验的ModelScope API去魔搭社区申请个 Key同上自建 vLLM/SGLang 服务一张显存 24GB 的 GPU想私有化、做定制训练的名词解释vLLM / SGLang 是两个流行的大模型推理框架作用是把模型跑成本地 API 服务——相当于自己在家开一家只服务自己的模型餐厅不用每次都去外面的店云端 API排队。用云端 API推荐先这么跑通# 智谱 BigModel python main.py --base-url https://open.bigmodel.cn/api/paas/v4 \ --model autoglm-phone --apikey your-key \ 打开美团搜索附近的火锅店 # ModelScope python main.py --base-url https://api-inference.modelscope.cn/v1 \ --model ZhipuAI/AutoGLM-Phone-9B --apikey your-key \ 打开美团搜索附近的火锅店自建模型服务用 vLLM 或 SGLang 部署 AutoGLM-Phone-9B暴露 OpenAI 兼容 API比如http://localhost:8000/v1再把--base-url和--model指过去就行。两个模型版本可选模型特点AutoGLM-Phone-9B中文手机场景优化AutoGLM-Phone-9B-Multilingual多语言适合中英混合界面⚠️ 自建部署有个坑启动参数要照抄 README如--max-model-len 25480、--limit-mm-per-prompt等。我翻了下 Issues 区不少输出格式错误/乱码的问题都是参数没按文档来导致的。另外模型本体约 20GB本地部署建议 24GB 显存。六、代码里怎么调不想用命令行的话Python API 也就几行from phone_agent import PhoneAgent from phone_agent.model import ModelConfig model_config ModelConfig( base_urlhttp://localhost:8000/v1, model_nameautoglm-phone-9b, ) agent PhoneAgent(model_configmodel_config) result agent.run(打开淘宝搜索无线耳机) print(result)七、安全设计哪些环节它不敢自己做主这一点是我觉得设计得比较到位的地方从源码看有两个机制敏感操作确认可以配置confirmation_callback遇到支付这类操作先问你一句再执行人工接管可以配置takeover_callback遇到登录、验证码这种必须本人操作的页面Agent 会主动停下来交还控制权你弄完它再接着跑实际体验中支付、银行类页面往往截图直接是黑屏系统级安全限制这时也会自然触发接管——算是双保险。从社区反馈来看大家对这个该出手时出手、该认怂时认怂的边界感评价还不错至少不会有 App 被它点到转账页面的惊悚故事。八、什么人适合用对照了一下适用场景这几类人可以重点关注做手机 Agent / GUI Agent 研究的论文AutoGLM、MobileRL 代码 模型全开源可复现性强做 App 自动化测试和演示的用自然语言驱动测试流程省得手写 UI 自动化脚本想把自然语言控手机接进自家产品的它已经和 Midscene.js 打通了可以在 iOS/Android 上用 YAML 或 JS 编排自动化流程智谱 / GLM 生态用户的模型结构和 GLM-4.1V-9B-Thinking 一致部署文档可参考 GLM-V 仓库和另外两条路的对比维度Open-AutoGLM纯手写 UI 自动化脚本云端手机助手产品输入方式自然语言坐标/选择器、代码自然语言但闭源不可控设备与系统Android 鸿蒙本地/远程取决于脚本工具取决于产品模型与部署开源模型 云 API 或自建无模型通常仅云端可扩展性改 Prompt、加应用、接自建服务高但要写代码低研究复现论文 代码 模型都拿得到看脚本是否开源难复现九、我翻了下源码想二次开发从哪下手仓库结构不复杂想改行为的话主要看这几处文件/目录作用phone_agent/agent.py主类 PhoneAgent调度截图、模型、动作、回调phone_agent/adb/ADB 连接、截图、文字输入、设备控制phone_agent/actions/handler.py把模型输出的动作翻译成 ADB/HDC 命令phone_agent/config/支持的应用映射apps.py、中英文提示词prompts_zh.py/prompts_en.pyphone_agent/model/client.pyOpenAI 兼容的模型客户端想加自定义 Prompt 或适配新 App改config/下的文件就行想接别的模型服务盯住model/client.py。鸿蒙的支持则在 HDC 相关模块里命令行加--device-type hdc切换。Prompt 也支持中英文两套--lang cn/--lang en默认中文自定义提示词直接改对应文件即可。十、几个坑提前说Android 中文输入必须装 ADB Keyboard 并设为启用否则打字异常——这是新手最容易卡住的一步支付/银行页面可能截图黑屏并触发接管不是 Bug是系统安全机制自建推理服务的参数别瞎改按 README 来不然容易输出乱码合规红线项目明确声明仅供研究与学习禁止用于非法获取信息、干扰系统等用途上手前建议把仓库里的使用条款读一遍名词速查表名词一句话解释Agent智能体能自己感知环境、思考并采取行动的程序VLM视觉语言模型同时看得懂图和读得懂字的 AI 模型ADB安卓官方调试桥电脑给安卓手机发命令的通道HDC鸿蒙版的 ADBvLLM / SGLang把大模型跑成本地 API 服务的推理框架OpenAI 兼容 API接口格式和 OpenAI 一样的模型服务换个地址就能用显存显卡上的内存跑大模型的主要瓶颈项目地址 GitHubgithub.com/zai-org/Open-AutoGLM 模型Hugging Face / ModelScope 智谱 API 文档docs.bigmodel.cn 官方博客autoglm.z.ai/blog 论文AutoGLMarXiv:2411.00820、MobileRLarXiv:2509.18119 Midscene.js 集成说明midscenejs.com总的来说如果你对手机 Agent这个方向感兴趣这是目前少数从框架到模型全链路都能自己跑通的开源选择。门槛主要在环境配置那一小节跑通之后剩下的就是发挥想象力了——毕竟说句话让手机自己动这件事上手试过一次就知道有多省事了。
返回列表