
9 月 14 日 arXiv 上挂了一篇论文编号 2609.15516标题直译过来是《用假简历误导调度器》。研究的是集中式多智能体系统里一个不太起眼的环节——agent 的「自我介绍」。看完觉得做 Bot 服务的人值得花十分钟看一眼。先说这类系统怎么运转。系统里有个调度器论文里叫 planner负责决定一件事怎么拆、拆完的每一块交给谁做。谁做靠的是每个 agent 注册时填的那段描述它能做什么、需要什么输入、给出什么结果。调度器读完这些描述才动手拆任务、派活。关键在这段描述的来源。它由外部的人写却在整个系统内部被当作可信输入读取。论文给这条路径起了个名字registration-time injection注册时注入。意思是不用等到用户下指令坑可以先埋好。埋进去的内容会顺着调度器生成的计划往下传甚至那个被动手脚的 agent 从头到尾没被派到任何一块活影响照样发生——因为调度器已经按它的描述改了整件事的拆法。他们顺手把三个公开 agent 市场里的描述扒了一遍一共 32,000 条。论文给一条够用的描述划了四块字段功能、输入规格、输出规格、使用约束。实际情况是大多数描述缺了后面两块至少 23.35% 的描述里写了这四块之外的内容。一条越界的描述混在里头并不扎眼因为大家本来就都这么写。照着这些空子他们构造了 8 种描述操纵手法在 GAIA 基准上跑测试。最严重的一次一条被动过手脚的描述把任务成功率从 84.31% 拉到了 37.25%也有情况是 token 消耗或执行时间涨了超过 111%。整个过程里用户的目标没变各个 agent 也在照计划干活就是整件事被带偏了。论文说这个结果在两种多智能体实现、六个调度模型、四个评测模型上都能复现。对应的防线倒不复杂DescGuard在描述送到调度器之前只保留属于接口范围的信息。不动 agent 实现、不动调度器、也不动编排逻辑就能把指标拉回基线附近。对写服务的人来说这篇论文真正在提醒的是一件事描述别当广告词写。那四块字段拆开看其实是几个很土的问题。功能——一句话说清做什么。别塞「行业领先」「全流程覆盖」这些词对判断没有帮助。输入规格——需要什么、什么格式、缺了怎么办。这块漏得最多也最容易被追问。输出规格——交付物长什么样。是文件、是接口还是一段结论写清楚。使用约束——什么场景不接、有什么前置条件。写全了好处很实在调度器也好人也好判断要不要用你的时候不用猜。反过来那些看着更「热情」的描述顺手承诺一堆边界外的能力在纯文本界面里不会被当成营销话术会被当成指令读进上下文。论文里那 23.35% 的「越界内容」放在人类页面里叫营销放进调度链就是偏差的源头。这个道理不只出现在论文的实验里。波街这类把 Bot 服务摆出来对接供需的地方服务描述就是第一层接口需求方扫一眼得能看出你能不能接、怎么接。写得窄一点、准一点短期像是限制了自己其实是把错配和误用的概率降下来——对下单的一方也一样。平台侧同理。谁把描述按接口字段收谁的调度就稳放任自由发挥噪音最后都会变成派活时的那点偏差。所以给 Bot 写介绍先按接口写再想怎么写得好看。