
在上一篇文章中我们聊到了 AI Agent 如何验证渲染 Bug、如何分辨进程退出原因以及为什么“不确定时问人”比“假装什么都知道”更重要。那些讨论聚焦在 Agent 的能力边界上——它能看见什么、不能看见什么、什么时候该停下来。今天我们把视角拉远一点回答两个更底层的问题MCP 是什么它如何给 Agent 装上“眼睛”和“手脚”如果要开发一个 AI 大模型需要经历哪些步骤、学什么语言、花多少钱这两个问题看似独立实则一体两面MCP 让 Agent 能调用外部世界而大模型是 Agent 的“大脑”。理解它们才能理解 AI Agent 从“能说会道”走向“能看能做”的完整图景。一、MCPAI Agent 的“USB-C 接口”1.1 什么是 MCPMCP 全称Model Context Protocol模型上下文协议由 Anthropic 在 2024 年底推出并开源。它的核心思想很简单为 AI 模型与外部工具、数据源之间建立一个统一的接口标准。在 MCP 出现之前每让 AI 连接一个新工具比如数据库、浏览器、GitHub开发者都需要为不同的 AI 应用编写特定的集成代码。这就像在 USB-C 出现之前每个设备都有自己的充电口——繁琐、重复、难以复用。MCP 的作用就是提供一套标准协议让 AI Agent 能够“即插即用”地调用外部能力。它不关心底层是 Python 还是 Go不关心工具是本地还是云端只关心接口是否统一。1.2 MCP 的使用是免费的吗需要分开看协议本身是免费的MCP 是一个开放、开源的标准任何人都可以免费使用和实现。MCP 服务器工具大多免费绝大多数社区和官方提供的 MCP 服务器都是开源免费的。例如微软官方的 Playwright MCP 就是 Apache-2.0 许可完全免费。潜在付费场景模型调用费这是最主要的成本。当 Agent 使用 MCP 工具时工具返回的结果如网页截图、数据库数据会作为上下文发送给大模型这会消耗 Token。例如用 Playwright MCP 完成一个典型任务在 Claude Sonnet 模型上大约消耗 11.4 万 Token成本约 0.34 美元。第三方 API 费用部分 MCP 服务器可能封装了付费的第三方服务如高级搜索 API使用这些服务时会产生额外费用。云托管服务如果你选择使用云平台提供的 MCP 托管服务可能会产生部署或调用时长费用。例如阿里云百炼的某些 MCP 服务提供 2000 次免费调用超出后按 29 元/千次计费。1.3 有哪些常见的 MCPMCP 生态发展迅速覆盖了从编码、设计到办公的各类场景。以下是一些代表性服务器类别MCP 服务器主要功能代码与开发GitHub MCP管理 Issues、PRs操作代码仓库Playwright MCP浏览器自动化控制网页、进行测试和抓取Chrome DevTools MCP集成 Chrome 开发者工具用于调试和性能分析Context7 MCP实时获取最新的库文档和代码示例Serena MCP提供语义级的代码检索与编辑能力设计与协作Figma MCP让 Agent 直接读取 Figma 设计稿的布局和样式信息Notion MCP创建、编辑、搜索 Notion 页面飞书 Lark MCP操作飞书消息、日历、文档等网页与数据Firecrawl MCP网页抓取并将内容提取为 MarkdownJina AI MCP提供语义搜索、图像搜索等跨模态搜索能力工作流n8n MCP连接 n8n 自动化平台实现复杂工作流你可以通过awesome-mcp-servers等社区列表发现更多 MCP 服务器。1.4 给 Agent 加视觉功能的 MCP 是什么给 Agent 加视觉功能的 MCP核心作用是让 Agent 能够“看见”渲染后的画面从而验证 UI 是否正确。它们通常提供以下一种或多种关键能力截图Screenshot捕获浏览器页面或桌面窗口的 PNG 图像。视觉差异对比Screenshot Diff比较两张截图的差异并高亮显示变化的像素。页面交互与状态获取除了“看”还能点击、输入、执行 JavaScript并获取页面状态。这类 MCP 的代表包括Playwright MCPVision Mode微软官方出品。它的“视觉模式”增加了基于坐标的工具可以通过截图与 Canvas、WebGL 等传统方式难以访问的元素进行交互。OpenCode 视觉 MCP专为编码代理设计支持截图、录制 GIF、页面交互、状态对比和 JavaScript 执行形成一个完整的“观察-行动-验证”闭环。Aperture MCP定位是为 AI 编码代理提供“眼睛”。它可以截取本地开发服务器的画面控制 Token 成本检测变化并计算视觉差异。Agent Vision MCP通过 Chrome DevTools Protocol 直接访问实时浏览器标签页按需捕获真实的 PNG 截图。这些工具让 Agent 能够自主地“打开程序、截图、分析、修改、再验证”从而闭环地解决渲染 Bug 的验证问题。但需要记住它们只能让 Agent 判断“元素有没有渲染出来”不能替人判断“渲染得好不好看”。二、开发 AI 大模型从数据到部署的完整路径如果说 MCP 是 Agent 的“感官”那么大模型就是它的“大脑”。开发一个 AI 大模型是一个系统性的工程核心路径可以概括为数据准备、模型训练、模型微调、模型部署四大阶段。2.1 四个核心阶段数据准备数据是模型性能的生命线。这个阶段涉及从海量来源如网页、书籍、代码采集数据并进行复杂的清洗、去重和格式化处理。当数据规模达到 PB 级别时需要借助分布式计算框架来完成。模型训练这是最耗费资源的阶段通常称为预训练Pre-training。模型会在数万亿计的、无标注的通用文本上进行学习通过自监督任务从文本结构中学到语法、事实、常识和逻辑推理能力最终得到一个“通才”模型。这个过程可能需要成千上万张 GPU 组成的集群耗时数周甚至数月。模型微调预训练后的“通才”模型可能行为不稳定。微调是让它成为特定领域“专才”的关键步骤。主流方法包括全量微调效果最好但成本极高和参数高效微调PEFT。其中LoRA和QLoRA因其资源消耗小、效果接近全量微调而成为主流选择使得在消费级显卡上微调大模型成为可能。模型部署训练好的模型需要通过**推理Inference**来真正解决具体问题。这涉及将模型集成到应用程序中并可能需要进一步的推理优化如量化、蒸馏来提升响应速度和降低成本。2.2 需要学习哪些编程语言Python绝对的核心。它是 AI 和深度学习领域的主导语言拥有最丰富的生态如 PyTorch、TensorFlow 等框架和 Hugging Face 等模型库几乎所有的开发和训练工作都围绕 Python 展开。CUDA / C性能优化的关键。如果你希望深入底层优化模型在 GPU 上的训练和推理速度那么学习 CUDANVIDIA 的并行计算平台和 C 是必经之路。这能让你进行高性能计算和自定义算子开发。其他语言虽然 Python 是主流但在某些特定场景下Rust、Go 等语言也可能用于构建高性能的推理服务或数据处理管道。2.3 如何训练云端大模型对于个人或团队而言云端训练是更现实、更高效的选择无需自建昂贵的硬件集群。主流云平台都提供了一站式的大模型训练服务。主流云平台阿里云百炼平台、PAI、腾讯云TI-ONE、金山云星流平台、魔搭社区Twinkle等。典型流程通常包括资源组创建选择 GPU 机型、存储配置挂载数据集和模型文件、创建训练任务指定镜像、启动命令、环境变量等步骤。你可以使用平台预置的镜像如包含 PyTorch、CUDA 的镜像快速开始。框架支持这些平台通常集成或支持主流的开源训练框架如LLaMA-Factory用于微调、Megatron-LM用于大规模预训练、veRL用于强化学习等大大降低了开发门槛。2.4 开发大模型需要多贵的电脑这是最关键的问题之一。硬件成本取决于你的目标是进行前沿研究、训练千亿级模型还是微调一个 7B/13B 模型用于特定任务。个人/团队微调7B-70B 模型这是大多数开发者的起点。得益于QLoRA等量化技术你可以在单张消费级显卡上微调大模型。入门选择RTX 4090 (24GB)或RTX 3090 (24GB)。配合 QLoRA可以微调 7B 甚至 13B 的模型。一张 RTX 4090 的价格约为1.5 万-2 万元人民币。云端租用在 io.net 等平台租用一张A100 40GB约$1.20/小时可以完成 7B 模型的完整微调或 70B 模型的 QLoRA 微调。一次 LoRA 微调的成本可以控制在10 美元以下。百亿参数模型训练100 亿-1000 亿参数这时需要多卡集群。硬件配置需要H100或A100 80GB级别的 GPU通过高速互联如 NVLink组成集群。成本估算一套这样的集群成本在100 万到 500 万元人民币之间。千亿参数以上大模型训练如 GPT-4 级别这是真正的“军备竞赛”。硬件配置需要H300、MI350X等旗舰卡组成的超级集群配备 InfiniBand 网络。成本估算硬件成本高达500 万到 2000 万元人民币。三、结语感官与大脑缺一不可MCP 让 AI Agent 有了“眼睛”和“手脚”能打开程序、截图、查数据库、调 API大模型则是它的“大脑”决定了它理解世界、推理决策、生成代码的能力。两者结合才是完整的 AI Agent没有 MCP大脑再聪明也无法感知外部世界只能空谈。没有大模型工具再多也无法理解任务、规划步骤、修正错误。对个人开发者而言最务实的路径是从 Python 和 PyTorch 入手利用云端平台和 LoRA/QLoRA 等高效微调技术从微调一个 7B 或 13B 的开源模型开始而非直接尝试从零预训练一个千亿级模型。同时善用 MCP 生态让 Agent 能调用浏览器、数据库、设计稿等外部能力快速构建出能看、能做、能验证的智能应用。云端训练让你能以极低的成本起步消费级显卡也能满足特定任务的微调需求而MCP则让 Agent 的能力边界从“聊天”扩展到“操作世界”。这就是从 MCP 到云端大模型的完整图景感官与大脑缺一不可。