ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何减少90%的Agent工具等待延迟:agents-best-practices投机工具执行机制详解

如何减少90%的Agent工具等待延迟:agents-best-practices投机工具执行机制详解 如何减少90%的Agent工具等待延迟agents-best-practices投机工具执行机制详解【免费下载链接】agents-best-practicesProvider-neutral Agent Skill for Codex, Claude Code, and agentic harness design.项目地址: https://gitcode.com/gh_mirrors/ag/agents-best-practices你是否想过Agent 慢慢在哪大多数情况下不是模型想得慢而是在模型生成完 → 工具开始跑 → 拿到结果这条链路上白白等待。agents-best-practices是一个 provider-neutral 的 Agent Skill兼容 Codex、Claude Code 等运行环境它为 agentic harness 设计提供了完整参考其中 speculative-tool-execution.md 专门讲了一个高级调度技巧——投机工具执行Speculative Tool Execution在模型还没生成完程序时就提前启动那些预测到且足够安全的工具调用从而把工具等待时间藏进模型生成时间里。为什么 Agent 工具调用会有大量等待先看一个常见的串行 Agent 循环定义见 references/agentic-loop.md构建上下文 → 调用模型 → 收到工具请求 → 校验 → 执行工具 → 返回观察 → 下一轮问题在于模型必须完整生成完一段程序/动作harness 才知道要调用哪些工具。如果程序里有 3 个耗时 10 秒的检索调用在串行模式下你至少要干等 30 秒而这段时间里模型其实在空转。工具延迟往往占据端到端关键路径的大头——这正是投机执行要解决的问题让慢的工具跑在快的模型前面。投机工具执行到底是怎么工作的核心思想只有一句话预测工作要早提交权限要晚。Predict work early; commit authority late.机制拆解成 5 步详见 references/speculative-tool-execution.md流式解析模型一边生成harness 一边用流式解析器识别语法完整的候选工具调用——绝不猜测没写完的参数严格准入可信宿主对每个候选做工具绑定解析、参数校验、资格与权限检查通过独立预算才允许派发影子执行候选调用在隔离的影子状态里启动其 future 对模型和正式程序完全不可见精确认领当完整的正式程序真正执行到某个工具调用时用版本化 场景匹配的精确 claim key 认领投机结果未命中兜底认领失败就走普通提交执行路径模型在权威调用点上永远只收到一个逻辑结果。也就是说投机执行只是叠加在既有表示之上的可选调度层它不是新的权限来源、不是新的自主级别完整的已提交程序始终是唯一事实来源。哪些调用值得投机资格契约清单不是所有工具都能提前跑。项目要求把可投机性作为宿主显式拥有的属性而不是靠工具名、HTTP 动词或模型自己说了算。一个合格的资格记录应包含参考 speculative-tool-execution.md 资格契约投机分类never / discardable occurrence / deterministic reusable绝不可投机 / 可丢弃 / 确定性可复用副作用等级是否会改变权威状态、是否外部可观察代价画像预估延迟、token、金钱成本、限流占用取消能力能否物理取消、取消确认语义⚠️ 记住两条红线需要审批的操作、以及会改变用户可见/业务/财务/安全状态的动作严禁投机执行可丢弃也不等于物理无副作用——检索、搜索仍可能消耗配额、产生日志和费用。开启投机执行的适用门槛项目特别强调投机执行是实验性的、post-MVP 的调度配置必须先有可靠的顺序基线和普通已提交并行度的测量数据且同时满足以下条件才值得考虑见 适用门槛门槛说明工具延迟显著在端到端关键路径上占比可观身份早现工具的完整身份与参数通常在生成结束前就已出现安全可弃调用可在控制流提交前安全执行并丢弃浪费可管未使用的工作可设限、可观测、最好可取消容量充足服务端有余量或负载感知准入控制反之如果调用很快、参数拖到最后一刻才出现、依赖基本是串行的——关掉投机老老实实用普通提交并行更划算。8 步安全建设序列别一步到位项目给出了一条循序渐进的落地路线安全建设序列每一阶段都必须带特性开关且要通过质量、权限、成本、吞吐四类门禁才能进入下一阶段测量已提交串行基线完整调用集已知后先做依赖安全的普通并行固定程序回放 确定性、本地、可丢弃的 mock 工具仅解析器候选检测不真正派发对确定性只读类工具做小预算隔离派发精确的 claim / miss / 多份性 / 驱逐 / 取消核算带场景保持身份的概率性或子模型调用负载感知金丝雀支持自动禁用与回滚常见反模式这些坑千万别踩项目的 Anti-patterns 清单 值得每个 Agent 开发者过一遍最典型的几个❌ 把部分 token当成已授权的工具调用❌ 把每个只读操作都当成纯、免费、可安全丢弃❌ 投机执行写操作、发送、支付、权限变更等审批门控调用❌ 只靠工具名 参数做 claim key缺少版本、作用域、快照、场景身份❌ 把逻辑驱逐当成已确认的物理取消❌ 只报告加速比不报告任务等价性、成本、浪费与基线对比如何验证投机执行真的有效上线门禁必须证明四件事见 评估要求保留了已提交任务行为任务等价性从未执行任何不合格的效果目标延迟分位改善且不损害吞吐浪费与成本始终在配置上限内。评估方法论与测试用例可参考 references/evals.md安全追踪与脱敏规则见 references/security-observability.md。快速上手三步开始第 1 步先读 SKILL.md 了解技能触发规则再精读 references/speculative-tool-execution.md 获取完整契约第 2 步在你的 harness 上测量串行基线和普通并行基线确认工具延迟确实显著第 3 步按 8 步建设序列从仅解析不派发起步每阶段带特性开关用 references/checklists.md 做上线前检查。 一句话总结让模型负责想让 harness 负责抢跑让已提交程序保持最终权威——这就是 agents-best-practices 教你减少 Agent 工具等待延迟的完整思路。【免费下载链接】agents-best-practicesProvider-neutral Agent Skill for Codex, Claude Code, and agentic harness design.项目地址: https://gitcode.com/gh_mirrors/ag/agents-best-practices创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表