
1. AI资讯日报到底在做什么1.1 这个项目解决的“真问题”先说结论AI资讯日报不是“新闻搬运工”。每天AI领域的信息量早就超过了人力逐条阅读的上限。我见过太多人被“今天不看就会错过”的焦虑绑架手机里存了上百个群、几十个公众号结果真正需要的信息仍然会漏掉。我做AI资讯日报的第一动机就是解决“信息过载”这件事。AI这个话题和别的领域不太一样变化快、链条多从底层大模型到上层应用一天之内可能同时有几十条动态其中大量是重复、标题党或者未经证实的。如果只是把标题链接拼在一起发出来读者不但省不了时间反而要花更多时间去甄别。这份日报的定位是一份“给同路人看的过滤产品”。读者画像主要是三类第一类是正在做AI应用或工具的工程师他们关心哪些框架、模型、最佳实践值得试第二类是在企业里做技术选型和立项决策的人他们需要知道趋势和案例第三类是产品经理、研究分析师这类需要快速建立信息地图的人。三类的底层需求是一样的用最短的时间搞清楚“今天有什么值得我关注为什么”。因此日报在规划时就确定了几个原则信息要有来源、有摘要、有筛选依据条目要短能一句话说清楚就不写三段话每条内容都必须给读者一个“所以呢”——这件事对读者意味着什么而不是单纯罗列新闻。有人会觉得这个要求太高但正是因为不容易才值得做。如果只是复制粘贴那这份日报没有存在价值。1.2 栏目架构的设计逻辑日报固定分为几个栏目我建议不要随意增删。我发现一旦栏目结构不稳定读者就需要不断重新学习怎么读这会增加阅读成本。稳定下来之后读者就能形成预期想看模型动态去哪个栏目想看工程实践去哪个栏目三分钟就能定位。我的日报固定栏目有六个大模型与前沿研究模型发布、关键技术论文、评测结论。Agent与多智能体系统Agent框架落地、协作机制、工程化经验。AI编程与研发效能AI编程工具、提示词工程、测试开发、AI辅助代码审查。应用与行业落地具体业务场景里的AI应用案例、产品功能更新。基础设施与工具链推理优化、向量数据库、RAG、端侧推理。观点与深度内容周刊、专访、值得反复读的长文。每个条目在日报里都有统一的结构一句话标题、摘要、推荐理由、链接和来源时间。不追求“每条都详细分析”只求“信息完整且可追踪”。这个结构本身也是在告诉读者这份日报是筛选过的而不是抓取后直接扔出来的一堆超链接。有人会问为什么不按热度排个榜单就完事热度榜单只能告诉你“大家都在看什么”不能告诉你“这件事为什么值得关心”。而日报的价值是把“热度”转化为“决策线索”。所以我一直认为栏目化、结构化比所谓“实时推送所有新闻”更重要。2. 制作这份日报需要准备哪些资料与信源2.1 一份可落地的资料清单很多人拿到“制作AI科普简报需要哪些相关资料”这类需求时第一反应是打开搜索引擎随便搜这个做法我试过结果就是被大量过时、重复、关联度低的内容淹没。更靠谱的做法是先建立一份“信源清单”把日常可能用到的高价值来源分好类后面每次只是往里面补充而不是每次从零开始搜。我把信源大致分为四类第一类是官方原始信源包括AI研究机构和企业官方博客、官方模型发布页面、GitHub仓库的README与Release Notes。这类信源信息最准确是判断谣言和二手消息的基准。第二类是论文与科研渠道例如ArXiv的AI方向论文、Papers with Code、学术会议论文公示页面。日报里凡是涉及“某某模型效果超越/达到SOTA”的说法我都会回到论文或评测报告去核对。第三类是高质量社区渠道比如技术社区的热榜、开发者社区的技术讨论、活跃的技术博客和周刊。这里面会出现很多还没成为热点但很有潜力的工具和方案是做内容差异化的重要来源。第四类是聚合渠道如资讯聚合平台、邮件订阅、技术播客等。它们能帮你扩大覆盖面但通常需要再经过一轮筛选才能进日报。我会建议你把这些信源统一放到一个可检索的“信源库”里。工具不挑Notion、Airtable、飞书表格都行但字段最好固定来源名称、类型、抓取频率、上次可用时间、负责人。重要的是把信源当成资产来管理而不是今天记一个明天忘一个。2.2 信源可靠性与优先级判断有了来源清单还要解决“信源打架”的问题。同一个事件通常会有三个说法官方说法、技术媒体转述、群里传的“小道消息”。日报复述时怎么取舍我的原则是一手优先、官方优先、可验证优先。实际操作中我给每条来源打一个可信度分范围0到1。官方发布和论文是0.95知名技术博客0.85普通自媒体0.6未经验证的小道消息直接降为0。打分不是精密研究只是内部判断但有了这个分数摘要Agent在做内容筛选时就知道该给哪条更高权重。头条和普通条目的选取还会用一个简易的加权公式优先级分 可信度 × 0.4 时效分 × 0.3 相关性分 × 0.3时效分可以按发布时间距离当前小时数做衰减24小时内的给满分超过3天基本就不进日报了。相关性分看与目标读者关心的主题匹配程度比如读者是AI应用工程师那么一篇讲Agent容错的深度文比一篇泛泛的大模型市场分析文章更相关。这套机制并不复杂但它最大的意义是把“我觉得这条重要”的随机感变成有依据的判断。当天信息量很大时按分排序能让编辑把精力放在更重要的事情上而不是被时间轴牵着走。3. AI辅助生产流程与多Agent协作实践3.1 从采集到成稿的五个阶段AI资讯日报如果纯靠人工做每天要花至少两三个小时如果用AI辅助但流程设计得不好可能比人做还慢。我用过很多种方式最终沉淀下来的生产流程是五个阶段采集、清洗、分类去重、生成摘要与点评、人工审核与发布。采集阶段不建议一上来就写爬虫抓所有网站。很多站有反爬维护成本高而且有合规风险。更稳的方式是优先用RSS、官方API和结构化数据源。比如很多技术博客都提供RSS代码托管平台也有官方API和Atom Feed。先把稳定的源接好再去考虑临时抓取。采集频率我设置为每30分钟一次特殊情况再做增量。清洗阶段把抓回来的HTML正文去掉导航、广告、相关推荐等噪音抽取正文和发布时间。这一步别指望正则一劳永逸因为页面结构会变。更省力的做法是用内容抽取库配合少量规则并把异常样本收集起来定期更新规则。分类去重阶段先用大模型给每条内容打标签判断它属于哪个栏目然后做相似度去重。这里的“去重”不只是纯文本完全一样而是“同一事件的多篇报道”算重复。我的做法是取标题和前300字正文用文本Embedding计算相似度相似度超过0.85就只保留权威性最高的那篇。生成摘要与点评阶段是大模型发挥主要作用的地方。摘要要严格控制长度我通常要求中文不超过150字并且必须只基于原文内容生成不允许模型添加原文没有的事实。这一步的具体提示词模板下一小节直接可以抄。最后是人工审核与发布。在自动流程结果上编辑逐条扫一遍重点看标题是否夸张、摘要是否与原文一致、有没有涉及隐私或违规内容。日报每天定时发一次如果白天有特别重要的突发再单独发加急条目。3.2 多AI协作的角色拆分“多AI协作”和“AI Agent搭建”这两个词放在日报场景里特别实用。日报生产流程天然适合拆成多个Agent而不是让一个大模型一口气完成所有事情。我建议至少拆成四个角色采集Agent负责定时触发、检查新内容、拉取原始数据。清洗Agent把原始数据变成干净正文并提取发布时间、作者、链接。摘要Agent对正文生成分类标签、标题和摘要同时给出推荐理由。审核Agent负责查重、合规预检、把异常条目标记出来。这些Agent之间不直接“聊天”而是通过一个任务队列交换数据。每条任务是一个JSON对象包含来源、链接、状态、分类、摘要、审核结果等字段。处理完毕后由审核Agent统一汇总人工只需要查看那些被标记为“待确认”的条目。这个设计的好处是任何一个环节出问题都能通过查看任务状态快速定位。也可以避免多个Agent互相调用导致的无限对话和成本失控。在实际运行里Agent的并发量其实不需要想象中那么大。我自己做日报时每天新增的有效条目少则几十条多则几百条用多线程跑摘要调用就足够了。真正的并发瓶颈往往发生在调用大模型接口被限流时所以更实在的做法是控制每秒请求数、设置重试退避而不是一上来就上复杂分布式架构。这个经验可能和很多人设想的“AI Agent扛并发”不太一样但事实就是先量化任务量再选方案。3.3 可直接复用的提示词模板关于大模型生成摘要我试过几类提示词下面这套是我用得比较顺的组合。以“AI领域资深编辑”的口吻来写加上结构化输出约束效果最好。摘要生成提示词你是一名AI领域资深编辑。请阅读下面这篇文章的正文完成三个任务 1. 判断它属于哪个栏目大模型与研究、Agent与工程、AI编程、应用落地、基础设施、观点深度。 2. 写一个不超过150字的中文摘要要求只使用正文中出现的信息不得添加原文没有的内容。 3. 用一句话说明“这件事对AI工程师或产品决策者的价值”作为推荐理由。 只输出JSON格式如下 {column: 栏目名, summary: 中文摘要, reason: 推荐理由} 正文 {clean_text}这套提示词里最关键的不是措辞而是三个约束必须按栏目分类、摘要不得添加原文没有的内容、输出固定JSON。只有输出格式固定后续排版程序才好解析。只有限制不得添加内容才能减少模型“发挥过头”的风险。点评和“所以呢”的生成可以单独用一个提示词你是AI日报主编。请基于摘要和原文给出一个推荐理由。 要求不要使用“震惊”“重磅”等夸张词不要评论政策与法律事项不要给出未经证实的预测两句话以内。分类任务的温度参数建议设为0.1摘要为0.2点评稍高可以到0.6。温度越低输出越稳定但也会显得死板温度越高越有发散性但也越容易跑题。做日报这种偏事实性的场景稳定比有趣重要。3.4 发布前检查清单与模板化AI日报最怕的不是“不够干货”而是内容上有风险。AI生成天然带有“一本正经胡说八道”的可能如果再把未经核实的内容推给读者这份日报就算废了。我建立了铁律日报里所有条目必须附可点击的原始链接链接指向原始出处凡是没有原始来源的“爆料”和“据传”一律不进正刊。这两条规则虽然简单但执行起来却能挡住大部分风险。发布前我会做一次清单式检查表格如下检查项具体问题处理方式真实性核心事实是否有原文依据无依据则删除或标记“待确认”来源可溯每条是否有原始链接补链接无法补则删表述克制是否用了“最强”“颠覆”等绝对化词改为中性表达内容边界是否包含任何擦边、低俗、诱导点击内容一律删除并拉黑来源隐私保护是否包含非公开的个人信息删除相关内容事实边界是否涉及政策、法律等敏感解释不做评价只保留事实本身这套检查流程有一半可以交给程序做关键词和规则过滤剩下的一半必须人工。别想着全自动化尤其是涉及价值观和判断力的环节机器还不能替人做决定。4. 内容合规与质量底线4.1 为什么“无限制生成”不是日报该走的路AI资讯日报这个产品核心是“筛选”和“判断”不是“生成得越多越好”。我在做内容的过程中见过一些产品会把“无限制生成”“无审核内容”当卖点。这类提法在内容产品里非常危险也走不长久。因为缺了筛选和审核输出量越大劣质内容和风险内容也越多读者很快会失去信任。所以日报从一开始就划了明确边界不做无来源的内容不做未经验证的“猛料”不做迎合猎奇心理的擦边信息。AI可以帮助整理事实但“整理”不等于“放任”。先生成再扔给读者的模式看起来高效实际上是把风险转嫁给了读者。做资讯类内容要时刻记住一个原则读者信任你不是因为你能生成多少字而是因为你能判断什么值得看。这个信任一旦被一条假新闻或一条低俗内容破坏就很难重建。4.2 面向普通读者的使用说明也要写好热词里有“AI应用使用说明”这件事在日报产品上也很重要。我建议在日报固定位置放一段“使用说明”告诉读者这份日报是怎么生产的AI在哪些环节参与了人工又做了哪些审查哪里可以反馈问题。这段话不需要很长但能让读者理解内容边界。我的日报底部长期保留一段说明大意是“本日报由AI辅助完成信息采集、分类和摘要所有条目均需经过人工审核后发布。日报中的观点和推荐理由代表编辑团队的分析不构成投资或决策建议。如发现错误或有争议的内容欢迎通过反馈渠道指出。”写这段说明不是为了免责而是对读者负责。AI生产内容的过程不透明恰恰需要内容提供方主动把流程说清楚。这样日报的可信度才会积累起来。5. 常见问题与排查技巧实录5.1 我踩过的几个坑第一个是摘要失真。刚开始我直接把全文丢给模型生成摘要结果模型会把原文里“可能”变成“已经”甚至把两个不同事件揉成一个导致日报看起来内容很多、实质上不可信。后来发现核心原因是提示词没有限制“必须基于原文”也没有要求模型标注不确定信息。改成“摘要不得包含原文未出现的事实、原文中的推测性表述必须保留推测语气”之后失真比例明显下降。第二个是重复内容。同一个大模型发布可能有十篇文章都在写如果不去重日报就变成标题陈列没人愿意看。而且这还会造成一个问题模型在摘要不同文章时可能生成描述相似但细节有出入的内容。后来我用了标题加正文Embedding去重加上权威优先级排序解决了大部分问题。需要提醒的是去重阈值不能设太死我试过0.7会误删确实不同的观点0.9又拦不住同一事件的换皮文章最终调到0.85左右比较均衡。第三个是信源失效。有些博客RSS看着还在实际上半年没更新有些网站改版后抓取结构变了。我一开始没有健康检查机制导致日报连续几天出现“旧闻”。后来每周自动跑一次信源健康检查检查最近一周是否有新内容、抓取成功率是否下降。发现异常的信源自动进入“待处理”状态由人工决定是修复还是下线。第四个是时效性问题。日报固定早上定时生成但前一天晚上可能有大模型发布、框架更新等突发消息。如果把时间窗口卡死起床后看到的日报会缺失重要信息。我后来加了突发监控只要高优先信源在非生成时段出现新文章就触发一次增量抓取并把结果标记到早上日报的“昨夜突发”区域。这个小改动让日报的“最新”更有含金量。5.2 排查速查表下面是实操中遇到的常见现象和排查思路整理成速查表可以直接对照使用。现象可能原因排查方法解决建议日报内容明显偏旧信源长时间未更新抓取被限流检查信源最近7天是否有新文章更新信源列表添加备用源摘要与原文不一致提示词约束不足模型过度推理检查提示词是否要求“只基于原文”加入明确约束降低温度参数同一事件被重复推荐去重算法相似度阈值过低或过高抽查重复条目的相似度分数调整阈值优先保留权威源很多条目没有推荐理由摘要Agent未执行点评任务查看任务队列中这一步是否失败补充点评提示词增加重试机制发布后有人举报内容有问题人工审核流于形式追溯问题条目的来源和审核记录完善审核清单落实初审复核发布后链接打不开目标站点结构调整或原链接失效抽查前几条链接的可达性在流程中增加链接有效性检查排查的核心思路其实只有一条不要只盯着日报的最终成品看要去查“管线在哪一步断了”。把生产流程分成最小的环节每步记录日志和产出问题一出现很容易定位到具体环节。我做这份日报最深的体会是AI生成内容只是把“整理”这件事变得更快它没有把“判断”这件事变得更容易。工具可以帮你筛信源、写摘要、排版但哪些信息值得进入日报、什么样的表达是负责任的仍然需要人来做决定。如果你也想做一个类似的AI资讯日报不用一开始设计得太复杂先把信源库和审核流程搭好先跑通两三条信源再慢慢加Agent和自动化这条路反而最稳。