ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Open Computer Use 安装与使用方法全解:从零配置到跑通第一个任务

Open Computer Use 安装与使用方法全解:从零配置到跑通第一个任务 1. 为什么我建议你先在本地把 Open Computer Use 跑起来Open Computer Use 是一个开源的 AI 计算机控制平台简单说就是让 AI Agent 像人一样真正操作电脑打开浏览器搜索、在终端里跑命令、点击桌面 UI、把多步流程串起来自动执行。它和只会“聊任务”的聊天机器人不一样Agent 会实际动手浏览器自动化、终端访问、桌面控制三条执行路径都覆盖定位接近 Anthropic 的 Claude Computer Use但完全开源、可扩展在 OSWorld 基准上做到过 82% 的水平。它适合谁适合第一次接触 Computer Use 概念、想在自己机器上验证“AI 真的能操作电脑”的开发者也适合想把重复性桌面流程填表、巡检、截图、跑脚本自动化掉的人。这篇就按“从零配置到跑通第一个任务”的路径写目标是你跟着敲完命令30 分钟内看到 Agent 在本地执行一次真实桌面操作。需要提前说清楚Open Computer Use 的完整形态依赖 Docker 跑一个隔离的 Linux 桌面 VM所以本地环境要装 Docker如果你只想先体验对话和任务编排可以先用轻量方式接入后面再补 VM。下面每一步我都给可复制的命令和配置骨架遇到报错直接对照第 5 节排查。2. 前置准备环境、依赖与 TaoToken 接入2.1 本地环境要求先把基础依赖确认一遍缺什么补什么Node.js 20前端 Next.js 15 需要Python 3.10后端 FastAPI 需要Docker用于跑 ai-desktop 容器也就是 Agent 操作的“电脑”Git验证命令node -v # 期望 v20.x 或更高 python3 -V # 期望 3.10 docker -v # 期望 Docker version 20 git --version如果 Docker 没装去官网按系统装桌面版即可装完执行docker run hello-world确认能拉镜像。2.2 为什么这里要提 TaoTokenOpen Computer Use 本身是编排框架真正“思考”的那一步要调用大模型。项目支持多家供应商但如果你手头没有现成的 OpenAI / Anthropic Key或者想统一管理模型调用和额度可以用 TaoToken 作为模型接入层。它的 API 地址是https://taotoken.net/api兼容常见的大模型调用格式拿到 Key 后填进环境变量就能用不用改代码结构。TaoToken 在这里的角色是“模型供应商入口”不是替代 Open Computer Use 本身。你仍然需要本地跑前端、后端和 VM只是把模型请求指向 TaoToken。官网入口在 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 注册后在控制台创建 API Key。2.3 获取 Key 与配置环境变量登录后进入控制台在 API Keys 页面新建一个 Key复制保存。然后回到项目目录配置环境变量。先克隆仓库git clone https://github.com/coasty-ai/open-computer-use.git cd open-computer-use复制环境变量模板cp .env.oss.example .env.local打开.env.local最小可用配置如下把占位符换成你自己的值# 模型接入以 TaoToken 为例 OPENAI_API_KEY你的_TaoToken_Key OPENAI_BASE_URLhttps://taotoken.net/api # 前端可访问的 Supabase本地开发可先用官方免费项目 NEXT_PUBLIC_SUPABASE_URLhttps://your-project.supabase.co SUPABASE_SERVICE_ROLEyour-service-role-key # 加密与 CSRF ENCRYPTION_KEY随便一串32位以上随机字符串 CSRF_SECRET另一串随机字符串注意OPENAI_BASE_URL这类变量名以项目实际读取的为准不同版本可能叫AI_BASE_URL或供应商专属变量。填之前先grep -r BASE_URL backend/ app/搜一下避免配了不生效。如果你暂时不想接 Supabase只想验证 Agent 执行链路可以先把前端跑起来、用沙箱 Key 走通任务编排数据库相关功能后面再补。3. 可复制配置安装依赖、启动后端与 VM3.1 安装前端依赖并启动npm install npm run dev看到ready - started server on http://localhost:3000就说明前端起来了。此时打开浏览器访问http://localhost:3000应该能看到聊天界面。如果页面报 Supabase 连接错误说明 2.3 里的 Supabase 变量没填对先补上再刷新。3.2 启动后端 FastAPI新开一个终端进入项目根目录cd backend python3 -m venv .venv source .venv/bin/activate # Windows 用 .venv\Scripts\activate pip install -r requirements.txt uvicorn main:app --reload --port 8001启动成功后访问http://localhost:8001/docs能看到 Swagger 交互文档就对了。这个文档后面排查接口问题很有用比如任务提交失败时可以直接在这里手动发请求看返回。3.3 启动本地 VM 容器Open Computer Use 的 Agent 需要一台“被操作的电脑”本地开发用 Docker 跑cd docker/ai-desktop docker build -t ai-desktop:local . docker run -d --name ai-desktop \ -p 5900:5900 \ -p 8080:8080 \ -p 9222:9222 \ ai-desktop:local三个端口分别是5900 是 VNC你可以用 VNC 客户端看 Agent 在干什么、8080 是 VM 内 WebSocket Agent 服务、9222 是 Chrome CDP 调试端口。启动后执行docker ps | grep ai-desktop确认容器状态是Up。如果容器起来又退出用docker logs ai-desktop看日志常见原因是镜像构建时依赖没装全。3.4 配置文件骨架在项目根目录建一个config/local.yaml如果项目没有默认配置目录就按后端读取路径放内容参考vm: provider: docker host: localhost ws_port: 8080 vnc_port: 5900 chrome_cdp_port: 9222 agent: planner: model: gpt-4o-mini max_steps: 20 browser: headless: false terminal: timeout: 120 desktop: screenshot_interval: 2 approval: mode: smart_approve # full_control / smart_approve / approve_all / offapproval.mode建议第一次跑用smart_approve只读操作自动放行破坏性操作会等你确认安全一些。等你熟悉流程后再考虑full_control。4. 验证请求跑通第一个桌面自动化任务4.1 确认各服务连通在提交任务前先做三步连通性检查# 前端 curl -I http://localhost:3000 # 后端 curl http://localhost:8001/docs # VM 内 Agent 服务 curl http://localhost:8080/health三个都返回 200 或正常响应说明链路通了。如果 8080 不通回到 3.3 检查容器端口映射。4.2 提交第一个任务打开http://localhost:3000新建一个会话在输入框里写一个足够简单、可验证的任务比如打开浏览器访问 example.com截图保存到桌面然后告诉我页面标题是什么。这个任务同时用到了 Browser Agent导航、截图和 Desktop Agent保存文件适合作为首个验证。提交后你会看到聊天区流式输出 Planner 拆解的子任务工具调用卡片依次出现browser_navigate、browser_screenshot 等如果开了 VNC能看到容器桌面里 Chrome 真的被打开、页面在动4.3 用 API 直接验证可选如果你想脱离前端单独验证后端可以直接调接口curl -X POST http://localhost:8001/api/chat \ -H Content-Type: application/json \ -d { message: 打开浏览器访问 example.com 并截图, machineId: local-docker, model: gpt-4o-mini }返回如果是流式的 SSE你会看到一段段 JSON 事件如果是普通 JSON检查status字段是否为success。这一步能帮你区分“前端展示问题”还是“后端执行问题”。4.4 成功结果长什么样任务跑完你应该看到类似输出[Planner] 任务拆解为 3 个子任务 [Browser] 导航到 https://example.com 完成 [Browser] 截图已保存: /home/user/Desktop/screenshot_001.png [Planner] 页面标题: Example Domain 任务完成耗时 18s同时在 VNC 里能看到桌面多了一张截图文件。到这一步说明安装、依赖、VM、模型调用、Agent 编排全链路都通了。5. 本篇常见错排查5.1 npm install 卡住或报 peer dependency 冲突Next.js 15 React 19 的组合对依赖版本比较敏感。先确认 Node 是 20然后rm -rf node_modules package-lock.json npm install --legacy-peer-deps--legacy-peer-deps能绕过一部分严格 peer 校验但不建议长期用装完能跑就先这样。5.2 后端启动报 ModuleNotFoundError多半是虚拟环境没激活或者requirements.txt没装全。确认终端提示符前有(.venv)然后pip install -r requirements.txt --upgrade如果某个包编译失败比如带 C 扩展的先装系统级依赖Ubuntu 下常见的是build-essential和python3-dev。5.3 VM 容器起来了但 Agent 连不上现象是任务提交后一直卡在“连接 VM”。排查顺序docker logs ai-desktop --tail 50 curl http://localhost:8080/health如果 health 不通检查容器内服务是否监听在0.0.0.0而不是127.0.0.1。很多 WebSocket 服务默认只绑本地容器外就访问不到需要在启动参数或配置里改成0.0.0.0。5.4 模型调用返回 401 或超时401 基本是 Key 或 Base URL 配错。检查.env.local里 Key 有没有多余空格、Base URL 是不是https://taotoken.net/api注意结尾不要多加/v1除非项目文档明确要求。超时的话先curl一下模型接口确认网络可达curl https://taotoken.net/api/v1/models \ -H Authorization: Bearer 你的Key能返回模型列表说明接入层没问题问题在后端读取环境变量的逻辑用grep搜一下变量名是否一致。5.5 任务执行到一半停住审批弹窗没出现如果你把approval.mode设成了approve_all每个操作都要确认但前端审批组件没渲染出来任务就会挂起。先切回smart_approve验证流程再单独排查审批 UI。另外检查浏览器控制台有没有报错审批状态通常走 WebSocket 推送连接断了就收不到。6. 接下来怎么用从跑通到长期编码与 Agent第一个任务跑通后你可以往两个方向走。一是把常用流程固化成定时任务或触发器让 Agent 定期执行二是把 Open Computer Use 接到日常编码工作流里比如让它帮你跑测试、填表单、做巡检。如果你打算长期用它做编码辅助或 Agent 编排模型调用量会上来这时候建议用 Coding Plan 这类按周期计费的方式管理额度比单次调用更可控入口在 https://taotoken.net/api 对应的控制台里可以找到。需要新建或轮换 Key 时直接去 API Keys 页面操作https://taotoken.net/api-keys 。接入文档和参数说明在 https://taotoken.net/doc 遇到模型名、请求格式的问题先翻这里。想先不写代码、直接对话验证模型效果可以用模型对话页面https://taotoken.net/chat 。而如果你更关心把 Agent 接到 Claude Code 这类编码工具里参考 ClaudeCodeAnthropic 的接入说明https://taotoken.net/claude-code-anthropic 。最后提醒一句Open Computer Use 的桌面控制能力很强第一次跑建议全程开着 VNC 盯着确认 Agent 的每一步操作符合预期再逐步放开审批级别。跑通一个截图任务只是开始真正的价值在于把你手上那些“每天都要点一遍”的流程交给它。
返回列表