ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

关于 Personal Agent 的几点想法:它靠什么认识你

关于 Personal Agent 的几点想法:它靠什么认识你 开篇之前写了一篇思考文章《从 Perplexity 看「以用户为中心」的新型商业模式》当时是读了一篇讲 User-Centric Agent 的论文加上 Aravind 的一场访谈总结了几个判断AI 服务要从「用户 → 平台」变成「用户 → Agent → 平台」平台中心化的根本问题是被困在碎片化日志里比如淘宝不知道你刚在小红书干了什么第三方 Agent 靠爬虫和模拟点击走不远平台不会心甘情愿交出入口半年过去这件事好像有了名字Personal Agent。Personal Agent 的上下文要围绕「人」Personal Agent 和办公 Agent 最本质的区别就是在上下文怎么组织。办公 Agent 的上下文是围绕任务修一个 Bug就读相关代码、报错和测试文件任务结束这组上下文的作用也就结束了。但是 Personal Agent 的上下文要围绕人它不仅要知道你这次要订酒店还要知道你过去住什么样的酒店、预算大概多少一件事隔了几周不能因为对话结束就从零开始。这里问题就来了这个围绕「人」的上下文要从哪来呢现在常见的 agent 有两条路。一条是和它聊天它慢慢积累记忆另一条就是连接器授权它读邮件、日历、订单它从这些数据里自己去判断。但它们都是碎片化且是被动的。你在 ChatGPT 里花两年积累的记忆换一个 Agent 就要重新再教一遍。记忆是 Agent 的副产品锁在某家产品里而不属于你。并且一个人的数字生活散在十几个地方公众号、小红书、微信、知乎、GitHub、笔记软件...每个平台都只有一部分而且平台之间互不开放。所以现在 Personal Agent 更像是「有手有脚、但不知道自己在替谁做事」。它能行动但它对你的认识是从零开始、一点点攒出来的而且攒出来的东西还很难带走。☹️Agent 替你做事之前先得有一份「关于你的知识库」所以Personal Agent 需要一个对应物一份属于本人的、机器可读的、由本人维护的、跨平台的知识库Agent 不需要再从零认识你它来读这份知识库就行了。这个想法听起来好像很古老把自己的一切整理到一个地方。从 1945 年 Vannevar Bush 的 Memex到微软研究院 2001 年起让 Gordon Bell 把一辈子的信件、照片、通话全部数字化的 MyLifeBits试了八十年没有一次真正普及。原因很一致不是采集难是维护难。交叉引用要更新旧说法被新说法推翻要标记分类要保持一致...今年 4 月 Andrej Karpathy 发了一个叫 llm-wiki 的 gist回答的就是这个问题。RAG 要每次提问都从原始文档重新检索、重新拼凑没有积累而他的这个替代方案是让 LLM 持续维护一个 wiki。三层结构非常简单raw 层原始素材你负责放进去不可修改是事实来源。wiki 层由 LLM 生成和维护的 Markdown 页面——摘要、实体、概念、对比、综述互相链接。你读LLM 写。schema 层一份约定文件告诉 LLM 目录怎么组织、页面什么格式、新素材进来要做哪几步。对应着有三个动作新素材进来叫 IngestLLM 读完更新所有被波及的页面提问叫 QueryLLM 先读目录再钻页面好的回答回填成新页面定期体检叫 Lint找页面之间的矛盾、被新来源推翻的旧说法、没人引用的孤页。 Bush 的 Memex 没解决的是「谁来维护」现在 LLM 来维护。Karpathy 的 wiki 第一条写的就是「Personal归档日记、文章、笔记随时间建立一幅关于你自己的结构化图景」。这样来看一份关于自己的 wiki 里可以至少包含这些身份和经历你是谁、做过什么、什么时候做的。作品你写过的、做过的、能拿出来的东西以及它们最早出现在哪里。长期观点你对一些事情怎么看。但这里有一个要紧的细节要标清楚哪些是事实、哪些是你的判断、哪些只是猜想以及每条是什么时候形成的、后来变没变。一个人的观点是会变的一份好的知识库不应该把你描述成一个永远正确的人而应该保留变化本身。偏好和约束你的预算、你的禁忌、你不希望 Agent 替你做的事。它和 Agent 记忆的关系是知识库是记忆的上游。记忆是 Agent 在使用过程中产生的、属于 Agent 的而知识库是你主动整理的、属于你的Agent 来读它、在此基础上再积累记忆。换 Agent 的时候记忆可能丢但知识库不会。有技术能力的人可以自己做没有的人怎么办对于有技术能力的人这件事完全能自己动手把散落各处的内容收到一个地方按 Karpathy 那种方式整理再让 Agent 去读。但绝大多数人可能不会去为此写代码。那他们的那一份从哪里来呢可能会有三种形式第一种平台托管。比如小红书给每个创作者生成一份机器可读的档案微信给每个人一个 Agent 可读的名片。这个的门槛几乎为零。但它的问题也是 3 月那篇的结尾说的刚逃出一个围墙花园又掉进另一个 格式由平台定义哪些字段开放由平台决定在小红书的那一份和在微信的那一份还是两片。平台会以帮用户的名义做这件事但做出来的东西首先服务于平台。第二种工具层。Notion、飞书、印象笔记这类本来就在用的工具加一个「发布为个人档案」的按钮或者更底层操作系统来做。Apple Intelligence 那种系统级上下文天然能看到所有 App 的活动。这一种比平台托管中立一些但系统级的方案又回到了 OS 巨头降维打击的老问题操作系统能看到所有 App 的活动这既是它做个人上下文的优势也意味着谁能读这份上下文、读多少都由它说了算。‍️第三种Agent 自己成为那一份。Agent 不只替你做事它开始持有你的身份别人的 Agent 直接来问你的 Agent。但这同样会带来一个问题就是当一个 Agent 声称代表你回答「你怎么看某件事」时它说的到底是你写过的事实还是它凭自己的理解补全的这个问题在 Karpathy 的 gist 评论区里有一条很有意思的经验有人照着做了一个实现第一版把 Ingest 做成黑盒用户的反应是「AI 在背后改我的笔记」第二版改成每次先列出它准备改什么你批准了才写作者说这是他做过的最大的信任改进。还是协议层的问题但多了一层3 月那篇文章最后结论是主权在协议层谁定义意图级 API 的格式、谁控制归因和结算规则谁才是主权者。现在再看这个结论要再加一层除了「意图」的格式还有「人」的格式。Personal Agent 要向平台证明“我代表这个用户”但用户允许你代表我不等于平台承认你可以进来。关于「我是谁」的知识库面对的是同一个问题谁来承认这一份代表这个人如果格式由每家平台各自定义那一个人就会有十几个互不兼容的“我”Agent 读哪一个如果有一个开放格式那它才真正属于人而不是平台。但开放格式在商业上总是弱的。所以一个统一的标准不一定会出现更可能的是平台各做各的工具层做一些桥接少数人自己维护一份完整的而大多数人的“我”继续散落着。但不管容器是什么一个人的信息要被 Agent 准确理解就需要被结构化地表达。哪条是事实、哪条是判断、什么时候形成的、后来变没变、哪些能公开。这些格式问题不会因为换了容器就消失。最后也许现在就需要开始有意识地把散落的东西往一个地方收不用等平台给你一份可以先有一份粗糙的。记忆是 Agent 的但知识库是你的。先有知识库再谈个人 Agent。
返回列表