ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【CHI 2026】Human-Agent Collab 论文解读:以人人协作为镜的开放可配置人-智能体协作研究平台|从CSCW受控实验视角

【CHI 2026】Human-Agent Collab 论文解读:以人人协作为镜的开放可配置人-智能体协作研究平台|从CSCW受控实验视角 摘要本文解读 CHI 2026 论文《Through the Lens of Human-Human Collaboration: A Configurable Research Platform for Exploring Human-Agent Collaboration》。该论文提出一个开放、可配置、理论驱动的人-智能体协作研究平台通过融合CSCW 经典协作范式、声明式实验配置语言ECL与Agent Context ProtocolACP让人与 LLM agent 能够在同一套感知与行动约束下受控协作其特别之处在于把重写一遍实验系统变成了改一份配置。实验表明关闭私聊后人类最终财富反而从 365.8 美元升至 406.4 美元且关掉信息看板对人类几乎无影响却使 agent 财富从 254.0 降到 218.1 美元为人-智能体协作研究提供了可复现、可累积的方法学基础设施。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么人-智能体协作实验缺少基础设施研究主线从问题到结论基准/方法设计一个平台、四条原则、四个组件分类全景四层可配置的交互控制方法细节ECL 配置语言与 ACP 协议实验设计与结果结果对比总结关键发现局限性常见问题FAQ这个平台和 AutoGen 这类多智能体框架有什么本质区别ACP 协议为什么是必需的ECL 声明式配置到底省了什么关闭私聊为什么会让人赚得更多关掉信息看板为什么对人类影响不大却重创 agent平台目前能支持哪些实验范式参考链接论文基本信息项目内容标题英文Through the Lens of Human-Human Collaboration: A Configurable Research Platform for Exploring Human-Agent Collaboration标题中文以人人协作为镜面向人-智能体协作的开放可配置研究平台作者Bingsheng Yao, Jiaju Chen, Chaoran Chen, April Wang, Toby Jia-jun Li, Dakuo Wang机构Northeastern University, Rice University, University of Notre Dame, ETH Zurich会议CHI 2026ACM CHI Conference on Human Factors in Computing SystemsarXiv2509.18008项目网站neuhai/human-agent-collab背景与动机为什么人-智能体协作实验缺少基础设施HCI 与 CSCW 社区很早就指出一个落差智能系统长期被当作工具而不是协作者。论文把它拆成四类具体障碍——awareness 与 common ground 的缺失、mixed-initiative 与自适应性不足、可问责性与信任校准困难以及相互依赖与角色协商的缺位。这些障碍会直接损害信任、共同理解与协调质量进而削弱人的能动性。LLM agent 的出现改变了设计空间自然语言成为共享媒介角色扮演 agent 能展现可信的社会与认知行为。于是本文提出一个核心类比作为分析透镜——LLM agent 应当被视作远程人类协作者二者同样依赖文本等结构化通道同样缺少面部表情与语调这类非语言线索。作者也主动承认类比的局限可问责性、知识接地与身份持续性不同但正是这个类比让 40 年 CSCW 结论可以迁移过来测试。真正的瓶颈在基础设施。既有平台分成几类但各有缺口平台类别代表工作关键局限群体软件与通用行为实验平台Share、GroupKit、LabintheWild、Empirica、oTree、nodeGame只服务人类被试无 agent 接入协议无法通过界面操纵协作变量游戏化协作环境Overcooked、PairIt域特定机制写死难以复用为不同协调结构的范式多智能体框架与社会模拟AutoGen、AgentVerse、CAMEL、WebArena、Melting Pot优化任务自动化或仿真保真度不以实验自变量操纵为核心最接近的工作PairIt2025对比 human-human 与 human-agent但缺乏跨范式可配置性与界面控制因此本文的立论是缺的不是更强的 agent而是一个开放、可配置、理论驱动的受控实验平台。把这项放进历史线索看会更清楚1985 至 2004 年间Stasser 与 Titus 的 Hidden Profile、CHI 2002 的 DayTrader 与 CSCW 2004 的 Shape Factory 确立了缩小任务、隔离变量的实验室协作方法学2016 至 2021 年oTree 与 Empirica 把行为实验做成了可复现、可共享的软件基础设施但只服务人类被试2023 年以后Generative Agents、PairIt 等让 LLM agent 展现出可信的社会行为而本文把 CSCW 范式、交互控制与 ACP 协议整合为一个开放平台实现人与 agent 在同一实验装置内的受控对比。这条线索的意义在于可归因、可复现与可扩展单一自变量操纵配合过程日志使哪些协作原则依然成立成为可检验的命题。图 2既有协作研究平台全景——人类被试研究工具与智能体框架之间缺少一个同时提供智能体接入协议与 CSCW 界面控制的受控实验平台研究主线从问题到结论图 10Human-Agent Collab 研究主线——从缺实验基础设施到交互控制可隔离出可测效应Mermaid 流程图基准/方法设计一个平台、四条原则、四个组件平台的目标是让同步的、界面中介的混合人-机团队能够被系统研究其设计由四条原则驱动DP1 用抽象换通用性把资源分配、轮流发言、信息不对称这些跨范式反复出现的交互机制从具体实验内容中剥离交给 ECL 描述同时把参与者界面拆成可独立定制的视觉模块。DP2 把协作理论翻译成可测控制workspace awareness、media richness、social signaling 等高阶发现必须落成可切换、可限制、可定制的界面选项才能成为有效的自变量。DP3 用标准化人-机对等保证可复现系统必须强制 agent 与远程人类协作者处在同样的感知与时间约束下且接入方式不随模型架构变化。DP4 同步过程日志把界面事件、人类消息与动作、agent 的提示与工具调用对齐到同一条时间线使结果差异可以追溯到具体的协调动作或崩溃点。实现上平台由四个组件构成研究者界面配置实验、监控实时会话、分析结果、参与者界面三列布局的五个可配置模块、Agent Context Protocol标准化智能体接入层与实验控制器执行引擎与日志系统。参与者界面左侧是私有状态与个人动作My Status、My Actions、My Tasks中间是承载交易与私聊的 Social 模块右侧是共享信息看板研究者界面则把建流流程固化为实验选择、参数配置、交互控制、参与者注册与参与者定制五个步骤。研究者界面并非一次成型而是由一次认知走查迭代出来的。五位 HCI 研究者含助理教授、博后、高年级博士生与应用科学家在远程会话中完成新建会话与结果分析两个场景并全程出声思考暴露出四类问题实验选择页认知负荷偏高、目标与研究重点挤在一起参数语义缺少反馈改动参数看不到参与者界面会怎么变形成执行鸿沟配置模板与会话模板的区分令人困惑全屏标签页迫使研究者在不同阶段之间来回切换结果页一次呈现所有指标与配置信息密度过高反而不易检索。对应的修订是用结构化概览与示意图替代密集介绍文字新增Live Preview让交互控制的调整即时映射到参与者界面预览简化术语如把Chat Mode改为Private Chat并用横向导航加层级菜单替代标签页结果页改为默认展示高层摘要、按需渐进披露细节。图 1平台核心架构——研究者界面、参与者界面、实验控制器与 Agent Context Protocol 四个模块共同保证实验变量可单独操纵、过程数据可完整记录分类全景四层可配置的交互控制平台把协作理论落成四层可操纵的控制变量这是它区别于通用多智能体框架的关键。图 11平台的四层可配置交互控制——信息流、行动结构、社会框架与智能体响应性Mermaid 分类图四层控制的语义分别是信息流层决定哪些信息可见看板可整体开关并能按群体定制可见性、更新频率与粒度——真值还是文本摘要以及沟通通道是私聊、群聊还是完全禁用行动结构层决定协商协议是严格接受或拒绝还是允许还价以及能否同时挂出多个报价社会框架层决定 agent 的显示名、persona 与群体归属是否可见并用配色与分组标识研究内群/外群效应智能体响应性层管理响应延迟、正在输入或思考的指示器、自适应反馈策略以及是否主动给出理由。方法细节ECL 配置语言与 ACP 协议ECLExperiment Configuration Language是一个声明式语言用四个原语描述实验Objects表示实验中的实体与属性金钱、形状、角色、队伍分数Actions定义参与者可执行的操作及其代价与状态影响Policies是逻辑约束前置条件、时限、胜负条件Views把内部状态与呈现层彻底分开声明哪些对象与属性渲染到界面、以什么形式渲染。View 与 State 的分离正是混淆隔离的实现基础——研究者可以在不动实验核心逻辑的前提下操纵信息可见性。ACPAgent Context Protocol则解决智能体接入的一致性问题。它的灵感来自 model context protocol但目标不同不是连接更多工具而是保证实验对等性。ACP 包含四个模块——Experiment Rules任务设置与约束、Experiment Specifications参与者角色与资源、Permitted Actions with Schemas沟通与交易的结构化格式、Private and Public States对参与者与 agent 可见的信息。控制器会从配置构造实验专属上下文由 perception interval 驱动周期性状态摘要先按 schema 与 policy 校验动作非法动作回传错误并要求 agent 重新生成通过后才原子提交并写日志。以 DayTrader 的配置为例objects段落声明了 Participant含 income、endowment、Session含 total_group_contrib、avg_group_contrib与 Contribution含 participant、invest_type、amount三类实体variables段落把max_invest_per_session设为 20、个人收益倍数设为 2.0、集体收益倍数设为 3.0constraints段落保证参与者的投资额满足 $0 \le a \le 20$ 且不超过自身禀赋policies段落开放 SubmitDecision 给 human 与 agent 两类角色并通过可见性声明关闭交易页与任务模块views段落则把状态绑定到 segmented 与 number 控件上用过滤与映射表达式渲染个人投资历史。整份配置是声明性的没有任何过程式代码。图 3Shape Factory 参与者界面——五个完全可配置的模块组成三列布局模块可由 ECL 重排、启用或禁用图 4研究者界面的建流工作流——五个步骤中可定制 agent 的 persona profile该版式由认知走查反馈迭代产生图 5Agent Context Protocol——无论 agent 内部架构如何都以同一套协议与实验控制器通信从而实现人机对等图 9ECL 的 DayTrader 配置样例——同一套对象与动作逻辑仅通过调整可见性声明与视图绑定就能得到完全不同的实验界面实验设计与结果评估分三阶段两个受控实验加一次认知走查分别验证平台的研究效力、范式可扩展性与对研究者的可用性。Shape Factory资源协商16 名被试每场六人由一名人类与五个 GPT-4o agent 组成。每人被分配一种自己生产成本较低的专长形状但订单列表里不含该形状因此必须在合作取形与竞争定价之间权衡。研究采用交叉组内设计Communication Level 与 Awareness Level 两因素交叉每名被试参与两场每个条件八人并用顺序抵消平衡控制次序效应。agent 通过 ACP 以 15 秒为感知间隔接收状态摘要。Hidden Profile协作决策16 名被试三人一场一名人类加两个 agent三位候选人中候选人 C 拥有 7 项优势与 3 项劣势但其优势信息是分散且不共享的只有通过讨论汇总才能识别最优解。研究采用组间设计操纵 agent 的主动性主动条件下 agent 每 30 秒执行一次自主的感知与预测循环被动条件下只在人类发言后回应。行为结果如下表研究操纵的变量条件人类平均最终财富智能体平均财富CS_CL私聊开关对照有私聊365.8 美元SD 92.9—CS_CL私聊开关实验无私聊406.4 美元SD 66.7—CS_AL看板开关对照有看板375.1 美元SD 118.3254.0 美元SD 39.27CS_AL看板开关实验无看板376.6 美元SD 123.0218.1 美元SD 38.80Hidden Profile 的结果同样清晰条件Agent 响应性团队决策准确率人均消息数平均消息长度主动每 30 秒自主 perceive-predict16.7%13.1SD 2.677.2SD 36.2被动仅在人类发言后回应8.3%10.75SD 3.895.3SD 46.7主观感知层面高支持条件下的感知信任显著更高$M_c4.60$ 对 $M_e4.31$$p0.03$工作区感知同样显著$4.76$ 对 $4.19$$p0.01$社交临场感差异最明显$2.78$ 对 $2.00$$p0.01$。值得注意的是体力负荷与挫败感在所有条件下都显著低于中性点$p0.01$说明平台本身没有给参与者施加额外负担。这些主观指标来自一份33 题问卷由五个量表构成组织信任量表选取 6 题、工作区感知理论框架改编 9 题、共享心智模型量表 10 题、社交临场感量表 2 题以及完整的 6 项 NASA-TLX 负荷量表所有量表以原始格式在 Qualtrics 施测题项措辞仅作轻微调整例如把队友改为本实验中的参与者。Hidden Profile 一侧还额外做了过程编码把每条原子事实标注为 shared 或 unique记录首次提及时间、被提及次数以及是否被整合进支持或反对某位候选人的论证并计算 agent 发起回合占比与轮流平等性——这种做法把主动性与单纯消息量分开避免了把发言多误读为贡献大。定性证据也支持这一判断在主动条件下一个 agent 指出候选人 C 的人际能力有利于团队协作但自我中心可能带来挑战另一个补充其营造积极氛围的能力人类参与者随即表示需要进一步了解 C 的细节——这类由 agent 发起的互补讨论正是信息汇总得以发生的具体形态。平台还能支持纵向分析人类最终财富从第一场到第四场持续上升普通最小二乘回归确认场次顺序是显著预测因子系数 $26.11$$p0.015$最终财富与成功交易数及交易效率的相关系数约为 $r\approx 0.53$与平均成交价的关联更弱$r\approx 0.33$。图 7CS_CL沟通水平协作结果——关闭私聊后成功交易更多、最终财富更高最右侧柱形展示被试逐步适应平台的学习曲线图 8CS_AL感知水平协作结果——人类表现几乎不受信息看板影响agent 表现则明显受损呈现人机适应性的不对称此外平台的可配置性还体现在对其它经典范式的适配能力上DayTrader 只需禁用交易页与任务模块、把 My Actions 改造为投资决策入口、让看板展示集体投入与个人收入、开放群聊承载讨论Essay Ranking 把论文材料放进 My Status、用 My Actions 承担排序输入Passcode 这类两人轮流猜词的游戏只要把行动结构配置为顺序的、单词级的消息交换即可。所有这些适配都只涉及配置与视图绑定的改动。图 6平台对其它经典范式的适配——仅靠配置与视图绑定的改动即可复现 DayTrader、Essay Ranking 与 Passcode无需重写核心逻辑结果对比总结图 12三组操纵的效果对比——沟通可得性、工作区感知与智能体主动性Mermaid 对比图关键发现沟通限制不降低效率反而提升任务聚焦关闭私聊后人类平均最终财富从 365.8 升至 406.4 美元提升 40.6 美元成功交易数也更多——行为从拉锯式谈判转向快速市场化信号。工作区感知对 agent 的影响远大于对人类关闭信息看板时人类财富几乎不变375.1 对 376.6 美元而 agent 平均财富从 254.0 降到 218.1 美元。这个不对称说明感知支持对当前 LLM agent 接近必要条件。主动性改变信息汇总的路径而非数量主动 agent 让团队准确率从 8.3% 翻倍到 16.7%被动条件下人类只发 10.75 条消息却平均长达 95.3 字明显长于主动条件下的 13.1 条、77.2 字说明沟通负担被单条消息承载。平台支持纵向设计与学习效应分析人类财富随场次递增OLS 回归给出系数 $26.11$$p0.015$最终财富与成功交易数、交易效率的相关系数约 0.53。主观感知与行为结果相互印证高沟通/高感知条件下感知信任$p0.03$、工作区感知$p0.01$与社交临场感$p0.01$显著更高。交互控制具备混淆隔离能力四层控制让研究者能够单独操纵沟通、感知、主动性与社会框架把效应归因到具体自变量而非 agent 实现细节。可用性达到可接受水平五名 HCI 研究者含助理教授、博后与博士生都在 45 分钟内完成了实验配置与结果分析两个场景任务。局限性agent 保真度有限提示工程造出了可信的协作者但 LLM agent 仍可能缺乏人类协作背后的深层社会与认知基础这限制了信任与社会动力学结论向 human-human 场景的直接外推。被试也确实把基础 prompt agent 评为更像机器$M2.35$$p0.05$与更不 competent$M2.45$$p0.05$。验证的是平台而非研究结论作者用 Shape Factory 与 Hidden Profile 验证平台作为研究工具的效力并未复现原研究的议题也未实证检验 DayTrader、Essay Ranking 等其它范式。抽象实验室任务Shape Factory 与许多经典 CSCW 实验一样是抽象任务结论如何迁移到高风险真实场景仍是开放问题。控制变量覆盖不全两个案例只操纵了少部分交互控制平台其余控制的有效性尚待逐一检验。过程数据仍需人工编码支撑Hidden Profile 的原子事实标注、论证整合判定等环节依赖人工过程编码规模化时成本不可忽略。常见问题FAQ这个平台和 AutoGen 这类多智能体框架有什么本质区别目标不同。AutoGen 优化的是多智能体任务自动化流水线而本文平台优先实验自变量操纵——研究者可以刻意削弱沟通例如关闭私聊、隐藏信息或引入延迟来检验关于依赖的假设。平台把声明式配置模型与智能体接入协议分开实现使实验控制与技术栈解耦。ACP 协议为什么是必需的没有 ACP把 LLM agent 接进行为实验系统通常需要大量临时工程例如另建 WebSocket 服务处理流式输出而且无法保证 agent 与人类被试处在同样的信息与时间约束下。ACP 从配置构造实验专属上下文用 schema 与 policy 校验动作并要求原子提交从而让人机差异可以归因到协作行为而不是系统特权。ECL 声明式配置到底省了什么省掉了每换一个范式就重写一遍实验系统。ECL 用 objects、actions、policies、views 四个原语描述实验同一套对象与动作逻辑只通过调整可见性声明与视图绑定就能得到完全不同的界面。论文演示了 DayTrader、Essay Ranking 与 Passcode 的适配改动仅限配置。关闭私聊为什么会让人赚得更多论文的解释是沟通开销被消除后参与者从拉锯式谈判转向快速的市场化信号交换成功交易数因此上升最终财富从 365.8 升至 406.4 美元。这也提示研究者更丰富的沟通渠道并非总是提升协作产出渠道带宽与任务聚焦之间存在权衡。关掉信息看板为什么对人类影响不大却重创 agent人类可以从交易记录与消息中推断其他参与者的状态而当前基于基础提示的 agent 缺少这种推断能力一旦共享工作区感知被剥夺其策略协调能力明显下降平均财富从 254.0 降到 218.1 美元。这个不对称正是平台能够揭示的、关于 agent 架构设计的可研究问题。平台目前能支持哪些实验范式论文演示了资源协商Shape Factory与信息汇总Hidden Profile两类并说明 DayTrader社会困境投资、Essay Ranking协作排序、想法生成与问题求解、Passcode两人轮流猜词都能通过配置实现。平台面向同步、界面中介的混合人-机团队并支持多人类、多 agent 的角色与状态设定。参考链接论文 arXiv 摘要页arXiv:2509.18008平台开源仓库 neuhai/human-agent-collabBos et al., Effects of Four Computer-Mediated Communications Channels on Trust Development (CHI 2002)Bos et al., Group Formation and Communication in a Collocated/Remote Team: The Shape Factory (CSCW 2004)Almaatouq et al., Empirica: A Virtual Lab for High-Throughput Macro-Level Experiments (Nature Human Behaviour 2021)Park et al., Generative Agents: Interactive Simulacra of Human Behavior (UIST 2023)Wu et al., AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表