ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【AI 应用 -- 白话大模型(篇八)】《从零系统学习 AI Skill之起源发展、文件结构、编写原则、机制原理与项目实战案例》

【AI 应用 -- 白话大模型(篇八)】《从零系统学习 AI Skill之起源发展、文件结构、编写原则、机制原理与项目实战案例》 Skill1.背景关键时间时间线从 2023 年到 2026 年AI 大模型 “调用工具” 和 “执行任务” 的能力经历了四次关键跃迁。这条时间线记录了从工具调用雏形到多代理生态平台的完整技术路径。2023.06OpenAI Function Calling —— 工具调用的雏形这是最早让 AI 模型能够主动请求调用外部函数的标准化接口首次赋予大模型与外部系统交互的能力为后续所有工具调用协议奠定基础。2024.11Anthropic MCP —— 连接工具与数据的开放协议MCP模型上下文协议把工具调用从单点功能升级为标准化开放协议统一 AI 连接数据库、API、本地文件等外部资源的方式工具生态开始具备互操作性。2025.10Anthropic Agent Skills ——“SKILL.md 文件夹” 的技能封装Skills 首次将任务流程、专业知识、脚本工具打包成可复用的技能单元SKILL.md。这标志 AI 能力从临时调用工具演进为长期可复用的标准化能力模块。2025.12Agent Skills 成为开放标准GitHub Copilot 正式支持Anthropic 开放 Skills 协议允许各类 AI 平台接入。同月 GitHub Copilot 率先集成 Skills该标准得到主流开发工具认可。2025.12OpenAI Codex 产品线支持 SkillsOpenAI 跟进在 Codex 系列产品CLI、IDE、App实现 Skills 扫描与安装扩大该标准在编程辅助场景的覆盖。2026.01Cursor 将 Skills Hooks 作为 Agent 关键机制新一代 AI 编辑器 Cursor 在 Nightly 版本深度整合 Skills 与 Hooks将其作为 Agent 行为控制的核心实现更精细的任务编排与触发响应。2026.02GitHub 集成多家第三方 Coding Agent成为多代理枢纽GitHub 从单纯支持 Skills 走向平台化接入多款第三方编码智能体演变为多代理协作中枢。AI 编码生态由此从单模型工具迈入多代理协同新阶段。2.什么是Skilla. Skill 的起源与发展Skill 最早由 Anthropic 提出作为大模型 Claude 的能力扩展机制初衷是让用户为 Claude 添加自定义功能与工具。 随着方案逐步成熟并获得社区认可Skills 现已成为绝大多数 Agent 开发框架与 IDE 兼容的标准化扩展规范。b. Skill 的形态结构一个 Skill 本质是包含SKILL.md的文件夹SKILL.md说明书存放技能元数据名称、描述以及指导智能体完成任务的执行指令Scripts操作脚本可运行的工具脚本References参考资料文档、模板、经验材料等辅助资源。 简单理解它把完整工作流程、经验方案、工具脚本打包成一套可复用的能力包。c. Skill 的通俗理解Skill 相当于为 AI Agent 加装的专项能力模块。 Agent 原生仅具备对话能力搭载不同 Skill 后获得专业功能 ☁ 天气 Skill → 查询实时天气 文件 Skill → 文档读写管理 代码 Skill → 编写、运行程序d. 总结核心定义Skill 是以文件夹形式分发、由说明文档 脚本 资料组成的可复用能力包用于给 Agent 扩展专项任务能力目前已经形成通用开发规范。官⽹是 Agent Skills Overview - Agent Skills这个⽹站是 Agent Skills 开放标准的官⽅主⻚提供标准的技术规格、完整⽂档、使⽤指南和客⼾端⽀持列表。这是 Agent Skills 官方概述文档它定义了一套轻量化的开放规范用来拓展 AI 智能体的能力边界。什么是 Agent Skills它采用轻量、开放的组织形式给 AI 智能体补充专业知识与完整工作流程。 一项技能其实就是一个文件夹里面必须有 SKILL.md 文件。这份文件至少写明技能名称、简介等基础信息同时告诉智能体该怎样完成对应的任务。文件夹里还可以存放运行脚本、参考资料、各类模板等配套资源。 文件夹结构 SKILL.md必备存放基础信息与任务指引 scripts可选放置可执行代码 references可选相关文档资料 assets可选模板与其他资源文档板块分布页面上方是概述部分简单说明这套规范是什么、有什么作用。 左侧导航栏分成三组内容 1Overview 总览、Specification 规范说明、客户端实际案例 2给想要制作技能的开发者准备快速上手教程、开发最佳实践、优化技能描述、技能效果评测、脚本使用方法 3给平台开发人员准备讲解如何在自家产品里兼容 Agent Skills。右侧的文章内目录依次讲解概念、设计初衷、运行原理、可用平台、开源模式以及入门步骤。简单概扩一下Agent Skills 是一项开放技术标准依靠文件夹搭配 SKILL.md 的方式打包工作流程与工具资源让 AI 智能体可以自由加载、复用各类专项能力。这份文档兼顾两类读者既教大家制作技能包也指导平台接入这套标准。3.Skill的⽂件结构⼀个 Skill 就是⼀个⽂件夹结构如下my-skill/ ├── SKILL.md # 核⼼⽂件指令 元数据 ├── scripts/ # 可选该技能专属的可执⾏代码 ├── references/ # 可选技术⽂档、领域知识参考 └── assets/ # 可选模板、静态资源 └── ... # 其他⽂件或者⽬录信息a.SKILL.mdSKILL.md是主技能⽂件包含了元数据如名称和描述以及告知智能体如何执⾏特定任务的详细指令。md中的字段信息如下字段必需说明name是Skill 名称最长 64 字符只能使用小写字母、数字和-并且不能以-开头或结尾description是功能与使用场景说明最长 1024 字符不能为空license否许可证名称或者指向 Skill 自带的许可证文件compatibility否环境与依赖说明产品、系统包、网络权限等最长 500 字符metadata否自定义键值对用来扩展元数据例如作者、版本号等信息allowed‑tools否允许调用的工具列表使用空格分隔属于实验性功能SKILL.md 包含2 项必填字段name、description与4 项可选扩展字段用来描述技能基本信息、运行依赖、附加属性与可用工具。b.Scripts包含该技能专属的⾃动化脚本如 Python、Bash 或 Node.js。当某些任务通过纯 Prompt 难以稳定实现或者需要进⾏复杂的数值计算、⽂件处理时Agent 可以直接运⾏这些脚本。c.ReferencesReferences存放该领域的专业⽂档、API ⼿册、技术标准或常⻅问题解答FAQ。Agent 会在需要时按需读取这些参考资料这既能保证专业性⼜避免了将所有知识硬编码在提⽰词中。d.Assetsassets存放各种静态资源例如配置模板、数据⽂件、⽤于对⽐的⽰例图像或预定义的JSONSchema。这些资源为 Agent 提供了执⾏任务所需的原材料4.Skill的样例1. 官⽅仓库⾥⾯WORD处理的示例地址来源https://github.com/anthropics/skills/tree/main/skills/docx点击链接进去选择上一级目录会看见各种各样的skill这一些下载到本地交给Trae整体结构3 大块红框顶部元数据第一红框技能基础配置namedocx一段触发规则什么时候调用此技能、哪些场景不能用license 版权声明。用来告诉 AI 什么时候启用这个 Word 处理技能。任务总表第二红框3 类核心任务给出实现路线1.创建新 docx写 docx‑js 脚本2.编辑已有 docx解压--修改内部 xml--重新打包3.读取文档内容用 pandoc 转 markdown 注明脚本路径相对于技能文件夹。docx‑js 避坑要点第三红框开头开始罗列新建 Word 文档时大量容易出错的细节页面尺寸、横向排版、表格、列表、图片、分页、目录、换行、制表符等限制与正确写法。侧边文件树整套技能包目录scripts存放 python 辅助脚本批注、合并文本、接受修订、office 转换工具LICENSE.txt许可文件SKILL.md技能指令文档图中预览内容这是一份完整 Word (docx) Agent 技能先定义触发条件再给新建 / 编辑 / 读取 3 种工作方案然后详细列出开发踩坑规范配套一堆 python 脚本完成底层文档操作用来指导 AI 自动处理 Word 文件。2. 腾讯⽂档的Skill点击文档有个模板进行立即使用腾讯文档的skill:我们会发现它是挂在MCP下的它是根据MCP这个工具进行线上操作的点击配置说明有各种安装方式还有手动按装得到文档进行解压下载到本地交给Trae显示如下5.Skill体验1. 认识下QClawOpenClaw也被社区亲切地称为“⻰虾”因为它的图标是⼀只红⻰虾官⽅⽹站OpenClaw — Open-Source AI Assistant是⽬前 AI 领域最受关注的开源⾃主⼈⼯智能助理Autonomous AI Agent项⽬。不同于传统的聊天机器⼈如⽹⻚版 ChatGPTOpenClaw是⼀款开源的AI智能体Agent。简单说它就像⼀个能住在你电脑⾥的数字管家。你只要⽤⾃然语⾔给它下指令它就能直接操作你的电脑去完成任务⽐如帮你写代码、发邮件、整理⽂件甚⾄控制浏览器.OpenClaw需要配置环境、编辑配置⽂件、⾃备⼤模型 API Key对普通⽤⼾⽽⾔上⼿⻔槛极⾼,随后腾讯、字节、阿⾥、百度、⼩⽶、智谱、⽉之暗⾯……国内各⼤⼚纷纷下场推出⾃家的虾。QClaw是腾讯电脑管家团队基于开源AI智能体框架 OpenClaw 深度开发的产品可以理解为OpenClaw 的“精装修版”。它保留了“⼩⻰虾”内核的同时极⼤地降低了使⽤⻔槛⽬标是让⾮技术背景的普通⽤⼾也能轻松上⼿。我们本次内容用的是这个QClaw - 微信远程办公 AI 助手 | 腾讯出品下⾯是国内外常⻅的⻰虾产品产品简介网址OpenClaw生态起源。最强 “内核”但代码庞大https://openclaw.ai/腾讯 QClaw你的微信遥控 “龙虾管家”https://qclaw.qq.com/WorkBuddy (腾讯云)腾讯云面向企业办公场景的产品采用云端 本地混合部署模式提供更多样化的 AI 服务。https://www.codebuddy.cn/work/ArkClaw (字节跳动)字节跳动旗下开箱即用的云端 SaaS 版深度集成飞书生态。https://www.volcengine.com/docs/87732/2300663?langzhDuClaw (百度)百度的 “零部署” 云端服务无需用户自行配置服务器或 API Key。https://cloud.baidu.com/product/du.htmlKimiClaw月之暗面Kimi推出的云端托管式 AI Agent。https://www.kimi.com/botMaxClaw(MiniMax)MiniMax 推出的云端 AI 智能体平台https://agent.minimaxi.com/max-clawZeroClaw用 Rust 语言重写追求极致轻量与速度。https://github.com/zeroclaw-labs/zeroclaw2. 认识下腾讯⽂档腾讯⽂档是腾讯推出的⼀款可多⼈实时协作的云端Office办公软件。它就像⼀个放在云端的“公共办公桌”打破了传统 Office 软件在时间和设备上的限制让团队协作变得简单⼜⾼效。⽀持在线⽂档、表格、幻灯⽚、PDF、思维导图、流程图等多种⽂件格式覆盖电脑、⼿机、平板和⽹⻚内容实时同步不受设备限制单⽂档⽀持500⼈同时在线编辑内容实时保存还能查看修订记录彻底告别反复传输⽂件的混乱内置海量模板涵盖会议纪要、项⽬管理、⽇报周报等⾼频场景⼀键套⽤省时省⼒3. 接下来我们来安装微信⻰虾QClaw进⼊官⽹QClaw - 微信远程办公 AI 助手 | 腾讯出品下载对应系统版本的安装包也直接可以扫码使用4. 下载完成后执⾏安装5. 启⽤之后因为要确定是操作的谁的⽂档点击链接把腾讯⽂档激活并且完成授权6. 可以看到⻰虾右侧已经有了技能我们也可以添加多个技能7. 进⼊设置技能管理找到腾讯⽂档技能点击启⽤8. 让⻰虾⽣成⽂案发送到腾讯⽂档⽣成⼀个⼩红书AI课程种草爆款⽂案并且使⽤腾讯⽂档技能发送到我的腾讯⽂档⽅便后续编辑⽂档 名称为AI课程⽂案9. 可以看到直接调⽤⼯具⽣成了就多了AI课程文案10. 有没有调⽤技能呢这里说的是没有但是QCLaw也作出了解释11. 我们让他使⽤skill读取下内容12. 我们新建⽬录让他把⽬录挪动过去13. 进⼊腾讯⽂档后台查看可以看到我们需要的⽂档已经⽣成了6.Skills常⻅的安装⽬录目录适用场景类别project/.your-client/skills/某个客户端可用的技能Projectproject/.agents/skills/跨多个客户端项目Project~/.agents/skills/通用目录User~/.your-client/skills/客户端技能目录User~/.claude/skills/编程助手‑Claude CodeUser~/.cursor/skills/编程助手‑CursorUser~/.workbuddy/skills/办公助手 WorkBuddyUser~/.qclaw/skills/腾讯龙虾 QClawUser~/.codex/skills/编程助手‑CodexUser~/.copilot/skills/编程助手‑GitHub CopilotUser~/.gemini/skills/编程助手‑Gemini CLIUser~/.config/opencode/skills/编程助手‑OpenCodeUser~/.windsurf/skills/编程助手‑WindsurfUser~/.cline/skills/编程助手‑ClineUser~/.trae/skills/编程助手‑TraeUserSkill 给 AI 智能体自定义的能力 / 规则。 规定了 AI 去哪里加载技能文件分两类位置 1Project项目目录只在当前这个项目生效仅限本项目里的 AI 客户端使用多客户端共享技能2User用户家目录全局生效电脑上所有项目都能用不同 AI 工具Cursor、Claude、QClaw、WorkBuddy 等各自有独立的技能文件夹project/.your-client/skills/ project/.agents/skills/ %USERPROFILE%/.agents/skills/ %USERPROFILE%/.workbuddy/skills/ %USERPROFILE%/.qclaw/skills %USERPROFILE%/.trae/skills/project/ 当前项目根目录项目级只对本项目生效project/.your-client/skills/单客户端专属技能只给当前这一款 AI 工具加载project/.agents/skills/项目通用技能本项目里所有 AI 客户端都能读取%USERPROFILE%/ Windows 用户主目录全局 / 用户级电脑所有项目都生效%USERPROFILE%/.agents/skills/全局通用技能全部 AI 共享%USERPROFILE%/.workbuddy/skills/WorkBuddy 全局技能%USERPROFILE%/.qclaw/skillsQClaw 全局技能%USERPROFILE%/.trae/skills/Trae 全局技能7.为什么需要skill智能体能力很强但实际用起来总让人抓狂。原因很简单它每次都是 空降兵不了解你的规矩、你的流程、你的偏好。 Skill 就是把这些 规矩 打包成可插拔的文件夹让智能体按需加载。要说清楚它为什么必要得先看看没有它时有多痛苦按需加载解决 脑子不够用你给智能体配了 10 套规范 —— 周报格式、代码审查清单、合同审核要点、客户回复话术…… 它全记在 脑子 里。结果执行代码审查时脑子里还飘着周报的格式要求时不时在审查结果里给你带一句 本周进展顺利。 就像你让一个厨师同时记着 100 道菜的菜谱去做番茄炒蛋他脑子里全是红烧肉怎么收汁、清蒸鱼什么时候出锅 —— 这菜能做好吗 Skill 就像一张随取随用的菜谱卡做番茄炒蛋时只掏这一张做完收起来。脑子里只装当前这道菜清清爽爽。固化经验解决 不会做把特定领域的专业流程法律审查、数据分析、PPT 规范捕获为可重用的指令。智能体不用重新学习直接掌握 最佳实践。 就像你学会了番茄炒蛋把步骤写在卡片上。以后每次做菜不用再回忆照着卡片来 ——Skill 就是智能体的 菜谱卡。相互隔离解决 改一个乱一片你发现周报里不需要写 下步计划 了于是去改 周报 那套规则。结果改完发现代码审查的输出也跟着变了 —— 因为两套规则写在一个 大杂烩 里一动全动。 就像你把番茄炒蛋和红烧肉的菜谱写在同一张纸上想改一下番茄炒蛋的放糖量结果发现红烧肉的收汁时间也被划掉了。 Skill 把每道菜的菜谱单独写在一张卡片上。改番茄炒蛋的卡片红烧肉不受影响。改错了只扔这一张重新写就行。即拷即用解决 换个地方重新教今天你是 周报撰写者明天你是 代码审查官后天你是 合同审阅律师。每次切换都得把对应的流程、规范、示例重新给智能体配置一遍。换个新智能体从头再来。 就像你把菜谱卡复印几份发到群里室友照着做味道一样换个炒菜机器人插上卡也能炒出妈妈的味道。Skill 就是一个完整的卡片包用哪个身份就插哪张卡。换个智能体文件夹拷过去直接用 —— 构建一次随处使用。Skill 把流程拆成标准步骤哪一步偏了、哪一步漏了一对照就知道。可追溯、可优化。8.Skill社区1. Anthropic 官⽅ Skills 仓库-https://github.com/anthropics/skills2. ModelScope Skills中⼼-ModelScope - Skills 技能中心3. skill合集 - https://github.com/voltagent/awesome-agent-skills4. 聚合市场-Agent Skills Marketplace | Codex Claude Skills | SkillsMP5. Vercel 官⽅排⾏榜-The Agent Skills Directory6. ⼩⻰虾的官⽅仓库 -ClawHub7. ⼩⻰虾的国内镜像仓库-ClawHub 中国官方镜像站8. 为中国区优化的skillhub -SkillHub-专为中国用户优化的Skills社区9.核⼼机制渐进式披露在真实的业务场景中一个 Agent 不可能只干一件这么简单的事。大家试想一下如果你要给 AI 装 50 个技能每个技能都有几千字的说明书要是系统一启动就把这些全塞进 AI 的脑子Context Window里那么就会 成本爆炸每次对话可能都会消耗几万 Token。 AI 的注意力也会被分散变得 “这也想干那也想干”。Skill 的出现就是为了解决这种问题它有一个非常核心的机制叫渐进式披露Progressive Disclosure。说人话就是按需加载用多少拿多少。渐进式披露是 Agent Skills 的核心设计理念它通过分阶段加载信息来优化上下文窗口的使用效率。 这个机制可以类比为 按需加载 或 懒加载 策略。总结就是业务里 AI 会配备大量技能如果一次性全部送入 AI 上下文会造成Token 费用暴涨、AI 思路混乱。渐进式披露懒加载不要一次性加载全部技能文档AI 需要哪个技能再临时读取载入只带入当下任务所需信息节省成本、减少干扰。这是Skill 三层分层渐进式加载架构用来解决一次性载入全部技能带来 Token 开销巨大、AI 注意力分散的问题对比传统 MCP 一次性全量加载的缺陷。Layer1 元数据 Metadata启动载入每个技能只保留简短简介单条约 100token。智能体开机只加载全部技能的简介50 个技能仅消耗 5000token。AI 只知道 “有哪些技能、各自能干什么”不加载详细步骤。Layer2 指令 Instructions任务匹配时载入当任务匹配上某个技能才加载该技能完整流程、范例与规范单份约 1000‑5000token拿到详细操作指导。Layer3 脚本与参考 Scripts References临时按需载入只有执行过程真正用到时才加载代码、模板、数据等附属资源随用随取没有 token 上限。和旧方案对比传统 MCP启动就把所有技能的全部内容一次性灌入上下文数万 token成本高、AI 容易混乱。Skill 三层架构渐进式披露分阶段懒加载先看简介→匹配成功再读详细指令→用到资源最后加载最小化常驻上下文节省 token减少干扰。举个例子假如一共 50 个技能Layer1 元数据单个≈100 tokenLayer2 详细指令单个≈3000 token取区间中间值Layer3 脚本 / 参考文档按需加载本次暂时不用方案 A传统一次性全加载MCP启动直接把 50 套【元数据 详细指令】全部塞进上下文 总 token 50 × (1003000) 155000 token不管你用不用巨额 token 常驻每次对话都花钱AI 被大量无关规则干扰。方案 B三层渐进加载Skill1启动阶段只加载全部技能的元数据目录 50 ×100 5000 tokenAI 仅仅知道我有哪些技能、每个技能大概能干啥没有详细流程。开销很小。2接到任务文档解析匹配到DocumentAnalysis这 1 个技能 只加载这 1 个技能的 Layer2 详细指令其余 49 个技能的详细文档不载入 新增 3000 token当前上下文合计50003000 8000 token3执行中途需要解析 PDF再按需载入 Layer3 的 pdf 解析脚本比如 2000token 合计 8000200010000 token对比结果老方案常驻155000 tokenSkill 渐进加载全程只用10000 token巨大的 token 节约而且不会把 49 套无关技能规则喂给 AI避免注意力混乱。三个阶段的⼯作流程阶段⼀发现阶段Discovery Phase在这个阶段智能体启动时只会扫描所有技能⽂件夹中的 SKILL.md ⽂件头部的元数据YAML Frontmatter。它仅读取每个技能的name 技能名称description 简短描述等基础信息时Agent 的上下⽂中只有⼀个轻量级的技能索引表就像书籍的⽬录⼀样。这个阶段消耗的 token ⾮常少即使有数百个技能也不会造成负担。阶段⼆激活阶段Activation Phase⽤⼾提出具体任务时Agent 会1. 分析⽤⼾意图判断需要哪项技能2. 根据技能的 description 进⾏匹配3. ⼀旦确定需要某个技能才会完整读取该技能的 SKILL.md ⽂件内容例如⽤⼾说帮我合并这三个 PDF ⽂件Agent 会识别关键词合并、PDF在技能索引中找到PDF合并技能此时才将完整的 PDF 处理指令加载到上下⽂中阶段三执⾏阶段Execution Phase在执⾏过程中Agent 会根据 SKILL.md 中的指引按需读取 references/ ⽬录中的参考⽂档如遇到特殊情况才查阅故障排查指南调⽤ scripts/ 中的⾃动化脚本使⽤ assets/ 中的模板或配置⽂件这些资源不是⼀次性全部加载⽽是⽤到什么加载什么。⽐如只有在处理扫描件 PDF 时才会读取 references/ocr-guide.md 。10.Skill的编写原则1. description很关键description 决定了 AI 什么时候会触发这个 Skill 。写得太模糊该触发的时候不触发写得太宽泛不该触发的时候乱触发。这就好⽐你去买⽔果和店家说要苹果店家会给你苹果⽽不会递给你⾹蕉、葡萄、草莓。好的 description: 从 PDF ⽂件中提取⽂本和表格、填充表单、合并⽂档。在处理 PDF ⽂件或 ⽤⼾提及 PDF、表单或⽂档提取时使⽤。 坏的 帮助处理PDF⽂档2. 只写 AI 不知道的东西就这样想如果你要把这个⼯作交接给你经验丰富的同事你需要告诉他什么Excel 怎么做这种就不⽤教了吧。告诉它你的私有规则、个⼈习惯、⾏业⾥的特殊流程等等这些才值得写。⽐如“⼯作周从周三算起”“⽼板只看柱状图不看饼图”。每写⼀句想想这个信息 AI 会知道吗如果知道可以删掉。3. 信息分层按需加载核⼼规则放主⽂件参考资料、模板放单独⽂件AI 需要时再去调⽤读取。主⽂件控制在 500 ⾏以内引⽤保持⼀层深度。SKILL.md 直接引⽤参考⽂件就好⽐如“需要参考格式时请读取references/output-example.md”4. 复杂流程加验证环节AI 可能在某⼀步出错但要到后⾯才暴露。如果是⽐较复杂的任务就可以在关键步骤后加检查点验证通过才继续。可以在关键步骤后加⼀句“做完这步先检查 XX 是否正确确认没问题再继续下⼀步”5. 先跑起来再慢慢打磨修改Skill 很难做到⼀次就是完美的可以先做⼀些尝试哪⾥不对再优化。6. skill.md要简单上下⽂窗⼝是⼀种公共资源⾥⾯包含系统提⽰词、对话历史等⽽Skill再最开始占⽤的成本不⾼但是如果过⼀定决定要加载了那么skill的内容会被加载进去上下⽂所以skill保持简洁很关键。好的案例# 提取 PDF ⽂本 使⽤ pdfplumber 进⾏⽂本提取 python import pdfplumber with pdfplumber.open(file.pdf) as pdf: text pdf.pages[0].extract_text() 坏的案例## 提取 PDF ⽂本 PDF便携式⽂档格式⽂件是⼀种常⻅的⽂件格式包含 ⽂本、图像和其他内容。要从 PDF 中提取⽂本您需要 使⽤⼀个库。有许多库可⽤于 PDF 处理但 建议使⽤ pdfplumber因为它易于使⽤并能处理⼤多数情况。 ⾸先您需要使⽤ pip 安装它。然后您可以使⽤下⾯的代码...7. 对复杂任务使⽤指定步骤或者⼯作流## 研究综合⼯作流 复制此清单并跟踪您的进度 研究进度 - [ ] 步骤 1阅读所有源⽂档 - [ ] 步骤 2识别关键主题 - [ ] 步骤 3交叉参考声明 - [ ] 步骤 4创建结构化摘要 - [ ] 步骤 5验证引⽤ **步骤 1阅读所有源⽂档** 查看 sources/ ⽬录中的每个⽂档。记下主要论点和⽀持证据。 **步骤 2识别关键主题** 寻找跨源的模式。哪些主题重复出现源在哪⾥⼀致或不同 **步骤 3交叉参考声明** 对于每个主要声明验证它出现在源材料中。记下哪个源⽀持每个点。 **步骤 4创建结构化摘要** 按主题组织发现。包括 - 主要声明 - 来⾃源的⽀持证据 - 相互⽭盾的观点如果有 **步骤 5验证引⽤** 检查每个声明都引⽤了正确的源⽂档。如果引⽤不完整返回步骤 3。8. 更多参考1Best practices for skill creators - Agent Skills2https://platform.claude.com/docs/en/agents-and-tools/agent-skills/best-practices11.Skill VS 提⽰词Skills 和传统 Prompt 最⼤的区别是按需加载 渐进式披露只在需要时才把厚厚的流程信息塞进上下⽂极⼤节省 token。对比维度普通 Prompt传统提示词Skills 机制技能封装核心逻辑一次性口语指令每次对话都得重新 “教育” AI封装好的 “岗位说明书 SOP”AI 自动按章办事加载方式全量强塞随用户消息或系统指令一次性灌入渐进式披露索引常驻正文仅在命中时动态注入上下文占用Token持续巨量消耗无论这轮用不用几千字都占着上下文极致节俭未触发时仅占约 50 Token触发后按需加载输出稳定性极差抽卡模式换个说法、换次对话结果风格大变极高工业化模式固定 Checklist 输出模板质量稳定如一触发机制完全被动必须由用户显式在对话框输入指令主动决策 被动响应AI 判断任务匹配时自主决定调用工程化管理几乎为 0无法做 Git 版本控制改乱了找不回支持 Git 全链路追踪可 Code Review、可回滚、可分工协作传统 Prompt每次重复输入一大段提示词全部内容一次性送入 AI 上下文Token 开销大AI 输出波动大、不稳定只能人工下达指令难以版本管理不适合项目工程化落地。Skills 机制把工作流程打包成独立技能文件只常驻简短索引用到才加载详细规则节省 Token依靠固定流程模板输出质量稳定AI 能够自己判断什么时候调用技能文件化存储支持版本管理、多人协作适合工业化使用。一句话对比Prompt 是临时口头吩咐Skills 是可维护、可复用、按需调取的标准化工作手册12.Skill VS MCPSkill 是嵌⼊ AI 的“标准作业程序”SOP教它按规范完成任务MCP是 AI 的“通⽤插头”帮它即插即⽤地连接外部⼯具和数据。对比维度MCP (模型上下文协议)Skill (技能)核心定义一种开放的标准通信协议类比 AI 的 USB‑C 接口。一个封装好的能力包 / 知识包包含 Prompt、脚本、知识库。交互方式动态双向交互。客户端Host通过协议调用远程服务器的工具Tools和资源Resources。静态 / 半静态注入。启动时或对话中将指令、文件挂载到 System Prompt 上下文中。开发复杂度较高。需实现 JSON‑RPC 服务端、定义 InputSchema、处理鉴权。较低。只需编写 Markdown 指令和整理文件夹结构类似写 Prompt 工程。典型用途获取实时天气、操作 Jira/GitHub、读写云盘文件、执行系统命令。固定代码风格规范审查、特定财报分析流程、邮件草稿生成模板、法律文书初审。MCP 是通信协议主打远程双向调用外部工具、实时操作外部系统需要搭建服务开发门槛高适合联动第三方平台。Skill 是本地能力包把流程、模板、规则打包成文件加载进 AI 上下文即可使用开发简单适合固化标准化工作流程。一句话区分MCP 用来外接外部系统Skill 用来沉淀内部固定工作 SOP二者可以搭配使用。13.实战-编写skill安装下OpenCode简介OpenCode 是⼀款开源的 AI 编程智能体AI Coding Agent专为终端命令⾏环境设计能够深度理解项⽬上下⽂并直接执⾏开发任务如写代码、调试、重构、⽣成⽂档等。核⼼特点开源免费代码完全公开⽆⼚商锁定可本地运⾏保护隐私 。命令⾏优先在终端中直接运⾏不依赖⽹⻚或 IDE适合习惯 CLI 的开发者 。项⽬级理解⾃动读取整个项⽬结构理解⽂件依赖与整体架构⽽⾮仅处理粘贴的代码⽚段 。多模型⽀持兼容 75 ⼤模型提供商如 GPT、Claude、GLM、DeepSeek、Llama 等⽀持本地模型与商业 API 。协作与复⽤会话可分享、导出便于团队协作 。⽀持⾃定义命令Commands和技能Skills将重复操作封装为⼀键执⾏ 。官⽹OpenCode | The open source AI coding agent安装使⽤1.OpenCode下载进⼊官⽹OpenCode | 下载下载可以看到OpenCode有命令⾏GUI插件3种版本a. 命令⾏就是⽀持cmd/shell等⽆界⾯窗⼝运⾏b. GUI有可视化界⾯c. 插件通过和第三⽅软件的界⾯协作完成运⾏2. 我们安装OpenCode的GUI版本⽅便快速上⼿安装⽐较简单下⼀步下⼀步就好了3.新建会话4. 和常⻅的ide⼀样我们可以进⾏聊天构建应⽤我们让他⽣成⼀个简单的应⽤⽣成⼀个3d粒⼦两束光交缠⻚⾯基于html js css来完成考虑three.js库5. ⽣成效果如下14.实战-编写skill--安装skill-creator技能安装anthropics官⽅技能这里在安装之前一定要创建文件路径为%USERPROFILE%\.agents\skillsnpx skills add https://github.com/anthropics/skills --all安装完成后我们重启OpenCode输⼊/可以看到有很多skill已经可以使⽤了⽤skill-creator创建⼀个word和pdf转换markdown的技能/skill-creator 创建⼀个名为 doc-to-markdown 的技能技能描述使⽤中⽂。 技能功能 - 接收⽤⼾上传的 .docx 或 .pdf ⽂件或通过 URL 提供⽂档。 - 使⽤ Python 库 markitdown微软开源将⽂档转换为 Markdown 格式。 - 输出⼀个同名的 .md ⽂件或由⽤⼾指定⽂件名。 实现要求 - 依赖Python 3.7以及 markitdown[all] 包。 - 封装为⼀个简单的 Python 脚本提供命令⾏调⽤python convert.py 输⼊⽂件 [输出⽂ 件]。提示你创建成功利用Trae打开6. ⽣成了评估报告7.使⽤创建的技能转换markdown加这句话把这个 Word 文件 E:\code\lessonprj\skillcreate\Tencent WorkBuddy 简介.docx 转换为 md8.转换后的效果
返回列表