
摘要本文解读 ASE 2025NIER Track论文《Towards Automated Governance: A DSL for Human-Agent Collaboration in Software Projects》。该论文提出Governance DSL——一套用于定义与强制执行软件项目治理策略的领域特定语言通过融合治理策略元模型抽象语法、ANTLR 文法具体语法与决策引擎操作语义把散落在 contributing.md 里的隐性规则变成机器可读、可强制的程序其特别之处在于把人类参与者画像与 AI agent 的自治程度、可解释性、置信度统一进同一套加权投票构造。对 25 个高星 GitHub 项目的复现研究显示68% 的项目至少披露一项治理维度上一轮仅 32%但四项齐全者仅 8%、采用 DSL 者 0%说明治理已经被写了却尚未被执行为开源社区与多智能体软件工程提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQGovernance DSL 到底解决了什么问题为什么必须用 DSL而不是写一份更详细的治理文档AI agent 在这套语言里是工具还是参与者这套 DSL 支持哪些决策程序这篇论文的结论有多强的实证支撑这项工作对多智能体软件工程有什么意义参考链接论文基本信息项目内容标题英文Towards Automated Governance: A DSL for Human-Agent Collaboration in Software Projects标题中文面向人机协作的自动化治理软件项目治理策略 DSL作者Adem Ait, Gwendal Jouneaux, Javier Luis Cánovas Izquierdo, Jordi Cabot机构卢森堡大学Uni.lu 卢森堡科技研究院LIST 加泰罗尼亚开放大学UOC会议ASE 202540th IEEE/ACM International Conference on Automated Software EngineeringNew Ideas and Emerging Results TrackarXivhttps://arxiv.org/abs/2510.14465项目网站工具与文法实现https://doi.org/10.5281/zenodo.15856633背景与动机治理是软件协作的地基。开源软件OSS项目尤其依赖明确的规则来说明角色、责任与决策程序谁有权接受代码、一个贡献要在多久内被处理、怎样才能成为贡献者。但现实是多数项目要么没有显式治理规则要么把规则写得含混且散落在不同资源里让贡献者难以理解。论文复刻了 2023 年发表于 CACM 的前人对 25 个高星 GitHub 项目的治理分析把治理拆成四类可独立判定的维度贡献流程是否存在有别于典型 pull-based 的开发方式、决策权谁有权接受代码、以及如何决定、评审时限评审或接受一个贡献需要多久、准入路径怎样才能成为贡献者。结果是一个很直白的缺口至少披露一项治理维度的项目占 68%比上一轮研究的 32% 有明显提升但仍有 24% 的项目一项都没有四项齐全的只有 8%也就是两个项目而没有任何项目采用 DSL来形式化治理策略。这条缺口在 2025 年变得更尖锐因为参与者结构变了。人类一侧性别、种族与认知多样性已被证实与创新性产出、软件生产率正相关但既有研究大多停在描述多样性没有把它接入决策程序。Agent 一侧LLM 让机器人从持续集成、代码检查、依赖管理等例行任务升级为能推理、能沟通、能参与复杂决策的协作者。与之相对现有的 AI 治理框架无论来自公司还是国家层面都把 AI 当作产品或服务来治理而不是当作开发过程中的参与者来治理。也正因如此最相关的前作是 2015 年 Cánovas Izquierdo 与 Cabot 在 ICSE-SEIS 上提出的治理规则 DSL那是第一次让 OSS 治理规则可以被定义并被强制但它不支持参与者多样性、不确定性的 AI agent也没有加权决策。本文的定位正是把这条线推进到人机协作的语境里治理规则必须能被机器读取与执行而这需要一个有形式语义的语言而不是一份更长的文档。研究主线从问题到结论图 2Governance DSL 的研究主线——治理规则散落文档导致不可执行论文用复现研究量化缺口再以抽象语法、具体语法、决策引擎三要素把规则变成可强制的程序Mermaid 流程图基准/方法设计论文把治理策略的形式化拆成与领域特定语言方法论一致的三个部分缺一不可抽象语法元模型限定哪些治理模型是合法的并定义概念之间如何连接。每个符合元模型的实例就是一组具体的治理政策。具体语法文法块状文本记号容器引用用嵌套块表达非容器引用用标识符指向目标元素文法由 ANTLR 定义解析出抽象语法树AST。操作语义决策引擎把 AST 转换成元模型实例交给自己实现的一台决策引擎去强制执行。设计上有四组核心要素参与者、策略、作用域与条件、组合策略。其中参与者一侧同时容纳人类与 agent——人类可用 Profile 刻画 gender、race 等属性agent 则带autonomy_level、explainability、confidence三个指标两者共同受vote_value加权例如高自治的 agent 可以拿到更高权重而可解释性低的 agent 的票只作为参考。分类全景图 3Governance DSL 的分类全景——Participant 分化为人类 Profile 与 Agent 属性Policy 分化为投票、共识与领导者驱动Scope 与 Condition 约束生效范围与时机Mermaid 分类图方法细节具体语法的样子可以直接看一段真实策略Participants段里人类 Joe 带着vote value与profile而 Mike 标注为(Agent)、只带confidenceMajorityPolicy声明作用域为具体任务、决策类型为BooleanDecision、参与名单为Maintainer角色Conditions里写了 10 天截止时间并把一个参与者排除在计票之外Parameters把通过比例设为 0.4。形式化一点说投票策略的通过条件可以写成比例约束通过比例由 $ratio \in [0,1]$ 控制、默认 0.5每个参与者拥有票权 $v_i$当参与者的加权赞成量超过阈值时决策通过——这让加权投票从口号变成了可计算的判据。策略类型覆盖三类主流决策程序VotingPolicy多数与合格多数ratio可调、ConsensusPolicy含 lazy consensus 这一实践中最常用的形式、LeaderDrivenPolicy可带兜底策略。决策类型则分BooleanDecision接受/拒绝如 PR 审批与CandidateChoice多选一如选举新领导者。作用域是Project→Activity→Task的三层结构条件分pre与post可表达截止时间、最低参与人数与参与者排除组合策略用sequential、require_all、carry_over三个开关把简单策略拼成复杂场景。图 1本文 DSL 的抽象语法元模型Participant 分化为带 Profile 的人类与带 autonomy_level、explainability、confidence 的 AgentPolicy 分化出投票、共识与领导者驱动三类策略并以 Scope 与 Condition 约束生效范围与触发时机决策引擎的运行是一个清晰的循环协作事件发生例如新建一个 pull request时引擎捕获事件、建立内部状态按作用域匹配适用策略并设置截止检查投票发生时把符合资格的票连同理由与时间戳登记进票箱形成完整审计线索截止时间到达时分析票数并执行决策例如合并这个 pull request。组合策略则按阶段顺序或并行解析并用合取或析取合并各阶段结果。实验设计与结果论文的证据分两条线。第一条是复现研究复刻前人对 25 个高星 GitHub 项目的治理分析四维度编码证据载体包括 contributing.md、governance.md 与项目文档网站。第二条是概念验证元模型用 Python 类实现具体语法用 ANTLR 文法实现再把 AST 转换成元模型实例表达力的验证方式是把背景分析中识别到的真实治理策略逐条翻译成 DSL 语法强制力的验证方式是在 GitHub 后端上跑完整的决策循环。完整实现连同文法与引擎开源在 Zenodo 上DOI: 10.5281/zenodo.15856633。复现研究的逐维度结果如下表。可以看出披露率的提升几乎完全由贡献流程一项带动而真正定义权力与责任的决策权与时限依旧是最薄弱的两环。治理维度披露比例说明至少一项治理维度68%上一轮研究为 32%几乎全靠贡献流程带动贡献流程非典型 pull-based68%本轮增长的主要来源谁有权接受代码、以及如何24%权力归属依旧稀缺如何成为贡献者20%准入路径低披露评审 / 接受贡献的时限16%最低披露维度四项齐全8%仅 2 个项目附录 A 把四个维度的判定口径拆得更细贡献流程看是否存在有别于典型 pull-based 的开发方式决策权看谁有权接受代码以及如何决定时限看评审或接受的预期时长准入看怎样才能成为贡献者。逐维度的分布是 68%、24%、20%、16%而四项齐全只有 8%2 个项目、零项为 24%。需要提醒的是原文并未把这四个维度画成图原稿中的 governance-top25.png 的 figure 环境整段被注释掉了因此这些数值全部来自正文文字而且 68% 与 24% 之和为 92%、并不构成 100% 的完整划分。结果对比总结图 4复现研究的结果对比——至少一项披露 68%、四项齐全仅 8%、采用 DSL 为 0%决策权 24% 与时限 16% 仍是最薄弱的两环Mermaid 流程图关键发现披露在改善但改善集中在一处至少披露一项治理维度的项目从上一轮的 32% 升到 68%而贡献流程一项就占 68%也就是说增长几乎全由流程贡献决策权只有 24%。权力与时限仍然缺席谁有权接受代码24%、如何成为贡献者20%、评审或接受的时限16%三项都不到三分之一四项齐全的只有 8%即 25 个项目里的 2 个。载体错位是根因没有任何项目提供 governance.md规则寄生在 contributing.md 或文档网站里——对人类可读对机器不可读采用 DSL 的项目是 0 个。表达力得到验证论文把背景分析中识别到的真实治理策略逐条翻译成 DSL 语法覆盖投票、共识含 lazy consensus与领导者驱动三类决策程序。强制力得到验证在 GitHub 后端上引擎按作用域匹配策略、登记带理由与时间戳的投票、在截止时间到达后自动执行合并治理形成从事件到投票再到决策的完整审计链。agent 是一等参与者autonomy level、explainability 与 confidence 直接参与权重计算使低可解释性 agent 的票只作参考这类政策可以被表达出来而这正是既有 AI 治理框架缺失的一环。局限性作为一篇愿景vision论文它的局限几乎就是它路线图的前半部分只有表达力与强制力的概念验证没有真实项目部署也没有用户研究DSL 的可用性并没有被量化。平台单一首个实现只接 GitHub其他协作平台与其他语言的适配尚未验证。采纳门槛块状文本语法面向技术用户面向非技术用户作者计划提供 chatbot 等替代界面。规则被形式化不等于被遵守治理模型是否真的改变了社区行为需要纵向研究观察。公平性只有机制、没有评估vote_value与参与者排除能表达加权与排除但是否因此更公平尚无实证。作者给出的路线图有五条新语法与界面含 BESSER agentic chatbot、纵向研究对比项目显式化治理前后贡献的演化、多 agent 协作评估借助 SWE-bench 量化治理对协作的影响、参与者识别与偏见缓解以及治理走出软件领域例如用同一套语言比较 NGO 的决策结构。常见问题FAQGovernance DSL 到底解决了什么问题它把治理规则从自然语言文档变成机器可读、可强制的程序。规则被写成语言构造之后可以由决策引擎按作用域匹配、按条件触发、按加权投票计算并产生带理由与时间戳的完整审计链。为什么必须用 DSL而不是写一份更详细的治理文档因为文档只能被人类阅读而 agent 参与决策前必须先有机器可读的决策程序。复现研究显示25 个明星项目里没有任何一个提供 governance.md、也没有一个采用 DSL规则寄生在 contributing.md 与文档网站里——这正是写了但不可执行的根源。AI agent 在这套语言里是工具还是参与者是参与者。Agent 与人类共享同一个 Participant 元模型并额外携带 autonomy_level、explainability、confidence 三个属性通过vote_valueagent 的投票影响力可以被显式加权例如高自治 agent 权重更高、低可解释性 agent 的票只作参考。这套 DSL 支持哪些决策程序三类主流程序投票策略多数与合格多数通过比例可调、共识策略含 lazy consensus、领导者驱动策略可带兜底策略。决策类型分布尔决策接受/拒绝如 PR 审批与候选选择多选一如选举新领导者并可用顺序、全部满足与结果传递三个开关组合成复杂场景。这篇论文的结论有多强的实证支撑需要区分两类证据复现研究是实测的25 个项目、四个维度、68%/8%/0% 等具体比例而 DSL 本身目前只有表达力与强制力的概念验证——把真实治理策略翻译成 DSL 语法并在 GitHub 后端跑通决策循环尚无真实部署与用户研究。这项工作对多智能体软件工程有什么意义它给出了让多 agent 系统在受控前提下协作的基础设施前提只有当角色、责任与决策程序都是机器可读的多 agent 协作的约束才可能被自动执行。作者也把借 SWE-bench 评估治理对 agent 协作的影响列为后续方向。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2510.14465工具实现文法与决策引擎https://doi.org/10.5281/zenodo.15856633前作Cánovas Izquierdo Cabot,Enabling the Definition and Enforcement of Governance Rules in Open Source Systems, ICSE-SEIS 2015治理透明度实证Cánovas Izquierdo Cabot,For a More Transparent Governance of Open Source, Communications of the ACM (CACM) 2023评估基准Jimenez et al.,SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, ICLR 2024实践定义The Apache Software Foundation,Lazy Consensus给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件