ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Nanobrowser 用自己的模型跑起来有多快:免费 AI 浏览器 Agent 实战指南

Nanobrowser 用自己的模型跑起来有多快:免费 AI 浏览器 Agent 实战指南 Nanobrowser 用自己的模型跑起来有多快免费 AI 浏览器 Agent 实战指南【免费下载链接】nanobrowserOpen-Source Chrome extension for AI-powered web automation. Run multi-agent workflows using your own LLM API key. Alternative to OpenAI Operator.项目地址: https://gitcode.com/GitHub_Trending/na/nanobrowserNanobrowser 是一个开源 Chrome 扩展把一句任务交给 AI它自己驱动浏览器点击、输入、检索全程在你本地浏览器里完成。这篇文章按实际使用路径讲清楚怎么装起来、内部两个 Agent 如何分工、哪些配置项会直接影响成本和稳定性。为什么值得把浏览器交给 AI用 OpenAI Operator 这类商业 AI 浏览器代理的人第一反应通常是矛盾的确实好用但确实贵月费约 200 美元而且登录态和浏览数据要经过第三方云。Nanobrowser 的做法相反Agent 不进云端装进你自己的浏览器。扩展跑在 Chrome 或 Edge 里模型走你自己的 API Key页面内容和账号信息不出本机。成本上只按自己的 API 用量计费没有订阅。这种形态适合三类人想让 AI 自动处理重复网页任务抓取、填表、跨页信息汇总又不想写 Selenium 脚本的在意隐私、希望敏感数据只在本机流转的想自己挑模型在效果和成本之间找平衡的。两个 Agent 的分工Nanobrowser 的核心是一个双 Agent 循环源码都在 chrome-extension/src/background/agent/ 下两个角色职责完全不同Planner规划者默认每隔 3 步介入一次看当前进展输出现状、难点、下一步、是否完成的结构化结论字段定义见 planner.ts走偏时负责纠偏。Navigator执行者拿到页面 DOM 快照输出一批结构化动作交给动作注册表执行——点击某个序号、输入文本、跳转 URL、切换标签页、滚动、缓存内容等动作全集在 schemas.ts。外层循环由 Executor 驱动每一轮 Planner 定期校对进度 Navigator 执行一批动作。Planner 判定完成就输出最终答案收尾步数达到上限默认 100还没完成则判失败。这个设计的好处是单点动作出错还有下一轮规划拉回来的机会不会一步错步步错。一个细节值得注意Navigator 定位元素靠的是给可点击元素标注的序号。一批动作之间如果页面发生变化框架会中止后续动作并把情况交回 Planner而不是继续拿旧序号点错地方。两个 Agent 还能配不同的模型——这是控制成本的关键下一节展开。最小接入从 clone 到第一个任务最省事的路径是直接装 Chrome Web Store 里的稳定版。要拿最新特性或者参与开发就 clone 源码自己构建需要 Node.js 22.12、pnpm 9.15git clone https://gitcode.com/GitHub_Trending/na/nanobrowser cd nanobrowser pnpm install pnpm build产物在dist目录打开chrome://extensions/开启开发者模式加载已解压的扩展选中该目录即可。想边改边试跑pnpm dev工程自带 HMR 热更新。装完必做的一步进设置面板侧栏右上角齿轮图标填上你用的模型服务商的 API Key并给每个 Agent 指定模型。内置服务商覆盖 OpenAI、Anthropic、DeepSeek、Gemini、Grok、Ollama、Groq、Cerebras、Llama、OpenRouter 以及各种 OpenAI 兼容服务清单和默认参数见 types.ts。然后在侧栏面板里直接说一句话就行比如去 TechCrunch 抓取过去 24 小时的 10 条重要头条在 Amazon 上找 50 美元以下、防水、续航 10 小时以上的便携蓝牙音箱执行过程会在侧栏逐步展示每个 Agent 的实时状态任务结束后还能就已完成任务追问上下文问题历史会话也保存在本地。值得了解的配置项设置分块存放在 packages/storage/lib/settings/挑最影响结果的三块说按 Agent 分派模型每个 Agentplanner / navigator可独立配置服务商和模型temperature、topP 也有按服务商、按 Agent 的默认值见 agentModels.ts。README 给出的三档组合追效果Planner 用大推理模型如 Claude Sonnet 4Navigator 用快的小模型如 Claude Haiku 3.5——规划者多思考、执行者多跑量按角色分配最划算。追成本两个 Agent 都挂小模型Haiku、GPT-4o-mini、Gemini 2.5 Flash 一类开销降下来但复杂任务的稳定性会变差迭代轮数可能变多。全本地接 Ollama 跑本地模型Qwen、Falcon、Mistral 等API 成本归零。README 特别提醒本地模型需要更具体、拆解清楚的任务描述模糊指令容易跑偏。循环上限与安全边界generalSettings.ts 里几个默认值值得知道maxSteps 100、maxActionsPerStep 5、maxFailures 3、planningInterval 3规划频率。如果任务明确是个短平快活把 maxSteps 调低能避免失控任务白烧 API。firewall 默认开启支持白名单和黑名单Agent 访问不在允许范围内的 URL 会直接抛出 URLNotAllowedError 被拦下。用在真实工作流时建议先用白名单圈定范围这是最有价值的安全开关之一。视觉模式与历史重放默认 Navigator 只读 DOM 结构useVision 关闭图片多、动态内容重的页面可以打开Planner 是否用视觉可单独配置。另一个开关是 replayHistoricalTasks开启后每个 Agent 的步骤历史会存到本地之后能重放一遍当时的操作序列重放自带元素索引修正页面变了会重新匹配元素和单步最多 3 次重试适合回归验证跑通过一次的流程。选型与避坑几个开工前要知道的事浏览器兼容官方只支持 Chrome 和 EdgeFirefox、Safari 及其他 Chromium 变体Opera、Arc 等不在保证范围内。弱模型别接复杂任务低成本路线可用但适合搜索、点击、提取这类路径明确的任务多步决策类任务给小模型Planner 容易反复绕圈。失败容忍有边界单步动作错误累计超过 3 次会中断该步整任务超过步数上限判失败这些规则都在 errors.ts 里能查到。本地模型参数偏保守Ollama 一类本地服务商的默认 temperature 更低用小本地模型时建议对照 README 的推荐清单和社区实测结果调。下一步建议先用 Web Store 版跑通查 GitHub trending 仓库这类示例任务熟悉 Planner / Navigator 的交互节奏后再接一个本地 Ollama 模型把成本下限摸出来。完整功能清单可以看 README.md。【免费下载链接】nanobrowserOpen-Source Chrome extension for AI-powered web automation. Run multi-agent workflows using your own LLM API key. Alternative to OpenAI Operator.项目地址: https://gitcode.com/GitHub_Trending/na/nanobrowser创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表