ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Autoresearch:reason 深度解析:盲审团+对抗式辩论如何让主观决策收敛到最优解

Autoresearch:reason 深度解析:盲审团+对抗式辩论如何让主观决策收敛到最优解 Autoresearch:reason 深度解析盲审团对抗式辩论如何让主观决策收敛到最优解【免费下载链接】autoresearchClaude Autoresearch Skill — Autonomous goal-directed iteration for Claude Code. Inspired by Karpathys autoresearch. Modify → Verify → Keep/Discard → Repeat forever.项目地址: https://gitcode.com/gh_mirrors/auto/autoresearchAutoresearch 是一个面向 Claude Code 的自主迭代技能Skill其中/autoresearch:reason子命令是专门解决主观决策难题的 AI 对抗式辩论工具它用一组互相隔离的 AI 智能体生成候选方案让批评者发起攻击、让盲审评委团盲选反复循环直到方案收敛到最优解。对于架构选型、产品策略、文案打磨这类没有客观分数可以量化的决策这套盲审团对抗式辩论的机制让主观判断第一次变得可重复、可追踪、可回溯。为什么单模型自改会失效传统的LLM 自己改自己的输出循环有一个致命问题谄媚式退化sycophancy。同一个智能体反复打磨自己的答案结果只是越来越好听并不一定越来越好。reason命令的设计者直接点破了这个问题单模型精化循环会坍缩成自我编辑——听起来更顺实际没提升。在没有客观指标的主观领域架构决策、产品策略、内容创作、法律论证单模型精化系统性失败。这句话来自官方指南 guide/autoresearch-reason.md也是整个命令存在的核心理由。8 个阶段的对抗式辩论循环每一轮 reason 辩论包含 8 个阶段每个阶段都是一个冷启动的全新智能体阶段角色做什么1Setup解析任务、领域、模式校验配置2Author-A只看任务描述冷启动写出第一版候选方案3Critic全新智能体攻击 A必须找出至少 3 个弱点4Author-B看到任务A批评针对性产出 B 方案5Synthesizer只看任务AB看不到批评融合出 AB 混合版6Judge PanelN 个盲审评委随机乱序标签盲选赢家7Convergence同一赢家连赢 N 轮→收敛检测震荡并预警8Handoff写出谱系文件触发下游命令链这里最关键的工程设计是上下文隔离不变量批评者从未参与写过 A融合者从未看过批评内容评委看到的不是 A/B/AB而是随机打乱的 Label-X/Y/Z——他们无法锚定作者身份。这意味着评委团实际上充当了主观领域的适应度函数fitness function——相当于核心循环里的val_bpb验证指标只不过这里验证的是哪个方案更强。完整规则见 reason-judge-protocol.md。盲审团如何防止评委被带节奏盲审机制有三个防偏见设计这是主观决策能收敛的关键1. 标签随机化消除位置偏见每位评委拿到的三个候选都带着随机标签Label-X/Y/Z。评委不知道哪个是原始方案、哪个是融合版只能凭内容质量排序。2. 强制比较禁止和稀泥评委协议明确规定all are good is not a valid verdict——都不错不是合法裁决。每位评委必须给出 1/2/3 名排序 一段论证理由。平票时融合版Label-Z获胜因为融合版天然吸收了 A 和 B 的长处。3. 评委人数必须是奇数--judges参数只接受 3、5、73–7 的奇数。偶数评委可能打出平票僵局3 票是默认值5 票更严谨7 票适合深度决策。评委还会按领域加载专属评分标准领域评审维度软件架构可扩展性、可维护性、性能、安全、简洁产品策略市场匹配、可行性、差异化、风险、时间线商业决策ROI、风险、目标对齐、资源、可逆性安全方案覆盖度、误报率、可落地性、合规性研究假设可检验性、新颖性、证据支撑、解释力内容/写作清晰度、准确性、吸引力、完整性、可行动性收敛与震荡检测什么时候该停盲审团选出赢家后收敛计数器开始工作——这也是主观决策收敛到最优解的数学保障收敛判定同一在位者incumbent连续赢得--convergence N轮默认 3 轮宣告收敛并停止。这说明方案已经稳定地优于挑战者。震荡防护如果在最近 8 轮里在位者换人超过 5 次说明任务存在真正相互竞争的权衡reason 会强制建议提前停止并报告震荡。官方特别强调震荡不是失败而是信息——它提醒你先明确哪个权衡更重要再重跑。两种模式的行为差异见 reason-judge-protocol.mdconvergent默认连赢即停、creative永不自动停用于探索备选方案、debate隐含跳过融合最适合A vs B二选一。一键上手常用调用方式reason 的调用参数很少核心是TaskDomain 迭代次数。下面是最常见的三种场景有界的架构决策/autoresearch:reason Task: Should we use event sourcing for our order management system? Domain: software Iterations: 85 评委的产品文案打磨/autoresearch:reason --judges 5 --iterations 10 Task: Write a compelling Series A pitch for our AI analytics platform Domain: business纯 A vs B 辩论模式/autoresearch:reason --mode debate --judges 5 Task: Microservices vs monolith for a 5-person startup Domain: software完整参数说明与更多示例都在 guide/autoresearch-reason.md。收敛之后链式驱动下游命令reason 的价值不止于选出赢家。收敛后可以通过--chain把结果自动交给下游命令继续处理链效果--chain debug收敛后的设计 → debug 实证检验--chain plan收敛后的提案 → plan 生成实施计划--chain fix收敛后的代码提案 → fix 落地实现--chain security批评主题 → 针对性安全审计--chain predict收敛设计 → 5 位专家人格压力测试--chain ship收敛内容 → 直接作为交付物发布--chain learn完整迭代谱系 → ADR 架构决策记录官方推荐的最强验证路径是--chain predict,scenario对抗式精化 → 多人格压力测试 → 边界案例探索。详见 chains-and-combinations.md。输出产物辩论为什么赢全程留痕reason 每次运行会在reason/{日期}-{时间}-{主题}/目录留下一整套文档其中最重要的是 lineage.md 谱系文件——它记录每一轮谁赢了、为什么赢、批评者说了什么reason/{YYMMDD}-{HHMM}-{slug}/ ├── overview.md 任务、领域、收敛状态、震荡报告 ├── lineage.md 逐轮追踪谁赢、为什么、批评内容 ├── candidates.md 最终轮完整候选A、B、AB ├── judge-transcripts.md 解码后的评委推理标签已还原 ├── reason-results.tsv 每轮日志赢家、票数、收敛计数 ├── reason-lineage.jsonl 机器可读的完整轮次历史 └── handoff.json 链式交接数据对架构决策来说lineage.md本身就是 ADR架构决策记录对内容创作它是编辑决策档案对战略讨论它是决策日志。这是 reason 相比让 AI 直接给个答案最本质的提升决策依据可审计。什么时候该用 reason什么时候该直接上官方给了一条极简判断规则如果你会基于判断而非测量来评价结果是好还是坏就用 reason。具体对照适合 reason不适合 reason没有客观指标有机械指标 → 用核心/autoresearch循环多种合理方案在竞争存在唯一正确答案决策需要留下书面理由只需要执行一个动作架构、设计、策略类决策修 bug → 用/autoresearch:debug同时官方列出了几条反模式要避开不要用偶数评委会平票、不要把--convergence设成 1单次赢不代表稳定、creative 模式一定要配--iterations否则永不自动停止、不要把 reason 的更好论证等同于更好的代码——它产出的是更强的论证链实证验证仍需 debug/regression 等命令补位。总结主观决策的收敛算法/autoresearch:reason的本质是把主观决策改写成一道可收敛的优化题对抗式辩论批评者必须攻击保证每一轮都有真实压力方案不会原地打转盲审团随机标签强制排序奇数票保证评判不受作者身份和位置偏见污染收敛检测连赢 N 轮即停震荡检测频繁换人即预警保证过程可终止、且失败模式可读全链路留痕lineage.md保证最终赢家为什么赢永远可以回溯。这也是整个 Autoresearch 技能中唯一针对不可微系统Karpathy 称之为 non-differentiable systems见 COMPARISON.md设计的命令——当指标不存在时辩论本身就是指标。更多安装与使用细节可参考 getting-started.md 与 guide/README.md。【免费下载链接】autoresearchClaude Autoresearch Skill — Autonomous goal-directed iteration for Claude Code. Inspired by Karpathys autoresearch. Modify → Verify → Keep/Discard → Repeat forever.项目地址: https://gitcode.com/gh_mirrors/auto/autoresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表