ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

微软开源 SkillOpt:像训练神经网络一样自动优化 AI 技能,52 项测试全拿第一

微软开源 SkillOpt:像训练神经网络一样自动优化 AI 技能,52 项测试全拿第一 微软开源 SkillOpt像训练神经网络一样自动优化 AI 技能52 项测试全拿第一前言做 AI Agent 开发的朋友一定遇到过这样的场景给 Skill 文件里加一句「不要这么做」格式不对又补一句「输出的格式要求」。改来改去文件越来越长Agent 不但没更听话反而更不稳定了。问题出在哪不是模型不够聪明而是 Skill 写得不到位。最近微软研究院开源了一个项目SkillOpt直接把 Skill 文件变成可训练的参数用训练神经网络的流程去自动化优化它。上线不到三个月GitHub 已收获16,000 StarMIT 开源协议可以自由商用。一、SkillOpt 是什么一句话概括首个把深度学习训练范式搬到文本空间的项目。它把 Skill 文档当作「可训练参数」用训练神经网络的那套流程去优化它——有 epoch、有 batch size、有学习率、有验证集——但完全不碰模型权重。最终产物是一份 300~2000 token 的best_skill.md文件部署时直接作为系统指令或注入到系统提示词中不需要额外模型调用推理成本为零。二、核心理念双模型搭班子SkillOpt 的核心架构是两个模型协同工作1. 执行模型Target Model负责按照当前 Skill 执行任务。一批任务跑完后记录哪些做对了、哪些做错了形成完整的轨迹日志。2. 优化器模型Optimizer Model分析执行轨迹找出规律成功的案例吸收经验提炼成更明确的规则失败的案例找共同模式是不是总在同一个地方出错然后动手修改 Skill 文件——加内容、删内容、改描述。每次只改 4 处左右论文实测的最佳值防止步子太大把原本好用的规则也改废了。3. 验证回退机制改完不算完能否保留还得通过测试。SkillOpt 会安排一批没做过的新任务用改动后的 Skill 去执行结果变好 → 保留结果没变好 → 立刻回退到上一个版本被否掉的改动也不会浪费存进「失败记录」档案往后优化时就知道哪些路走不通不会在原地打转。每跑完一轮框架还会做一次全局复盘把整份 Skill 重新梳理一遍避免越跑越偏。三、效果实测52 项测试全拿第一论文给出的测试数据非常亮眼维度数据测试范围6 类任务 × 7 个模型 52 次测试综合成绩全部拿到第一或并列第一GPT-5.5 平均提升23.5 分表格类任务提升接近 39 分最终产物大小300~2000 token推理成本零额外成本仅作为系统指令更关键的是这些提升完全不依赖模型本身的更新纯靠优化 Skill 文件就拿到了。迁移能力在一个模型上训练出来的 skill可以直接用在另一个模型上Codex 上优化的技能 → Claude Code 上也能用跨 benchmark 有泛化性这意味着你只需要用强大的优化器模型训练一次产出的 skill 可以部署到更便宜的模型上执行。四、快速上手安装pipinstallskillopt或者从源码安装体验最新功能gitclone https://github.com/microsoft/SkillOpt.gitcdSkillOpt pipinstall-e.配置模型SkillOpt 支持 OpenAI、Azure OpenAI、Anthropic、Qwen、MiniMax 等主流模型后端。以 Azure OpenAI 为例exportAZURE_OPENAI_ENDPOINThttps://your-resource.openai.azure.com/exportAZURE_OPENAI_API_KEY你的密钥Claude 配置exportANTHROPIC_API_KEY你的密钥本地部署 QwenvLLMexportQWEN_CHAT_BASE_URLhttp://localhost:8000/v1准备数据SkillOpt 需要两份带标准答案的测试题目训练集用于训练优化验证集用于评估改动效果数据格式需与项目内置的 benchmark 对齐如 SearchQA、SpreadsheetBench 等。启动训练python scripts/train.py\--configconfigs/searchqa/default.yaml\--optimizer_modelgpt-5.5\--target_modelgpt-5.5参数说明optimizer_model负责分析轨迹、生成编辑补丁建议用强模型target_model负责执行任务的目标模型可以用较弱模型训练完成后会生成best_skill.md这就是你训练出来的最终技能。评估已有技能python scripts/eval_only.py\--configconfigs/searchqa/default.yaml\--skillckpt/searchqa/gpt5.5_skill.mdWebUI 监控面板项目自带可视化面板可以直观看到训练过程pipinstall-e.[webui]python-mskillopt_webui.app默认运行在 7860 端口浏览器打开http://localhost:7860即可查看。加--share参数还能生成公开的 Gradio 链接方便团队协作。五、SkillOpt-Sleep夜间离线自我进化v0.2.02026 年 7 月发布新增的SkillOpt-Sleep功能相当于一个夜间离线自我进化引擎Agent 白天干完活晚上自动执行以下流程复盘回顾白天的执行轨迹挖矿从失败的案例中挖掘可改进的模式回放在验证集上验证改动效果固化把验证通过的技能写入skill.md同时还接入了Claude、Codex、Copilot、Devin、OpenClaw等工具链跨平台能力更强了。六、与 Hermes Agent 的关联与思考这套思路对使用 Hermes Agent 的开发者来说有很强的参考价值对比项传统做法SkillOpt 做法Skill 编写手工调试凭感觉自动化优化数据驱动变更验证靠直觉判断验证集自动化评估版本管理手动回退自动回退 失败记录档案迁移复用需重新调试跨模型跨任务通用Hermes Agent 本身也是 Skill 驱动的 Agent 框架将 SkillOpt 的优化思路引入有望让 Skill 的维护从「手工调参」走向「自动化训练」。七、总结过去调优 Skill 全凭手感改好了也说不出原因。SkillOpt 把它变成了一件可验证、可回退、可自我迭代的事。每次失败都成了让 Skill 变得更稳的经验。对于正在做 Agent 产品的团队这个方向值得认真研究——不调模型参数、不改推理代码只优化一个 Markdown 文件Agent 准确率就能提升近 40 分。资源链接GitHub 仓库https://github.com/microsoft/SkillOpt论文https://arxiv.org/abs/2605.23904项目主页https://microsoft.github.io/SkillOpt免责声明本文内容基于公开资料整理仅供技术交流参考。
返回列表