ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

一条「致癌」消息拆出四条谣言,Doubao-Seed-Evolving 帮我做了台辟谣机器

一条「致癌」消息拆出四条谣言,Doubao-Seed-Evolving 帮我做了台辟谣机器 上次我做了个家族博物馆把爷爷奶奶的一辈子做成一个能走进去的网页。做完自己也挺喜欢但它始终是给人「看」的。看过、点过也就过去了。我慢慢觉得真正让人愿意留着的东西都得是能拿来「用」的。正好 8 月 27 日 Doubao-Seed-Evolving 发了新版页面顶上挂着四个新特性通用 Agent 与 Coding、深度搜索与真实性、工具调用与复杂任务、视觉理解与长程规划。我拿自己家的一个真麻烦来试这四个特性。做出来的东西叫鉴谣台。它是这么使的把家庭群里转的养生截图、「紧急通知」丢进去它读图、查权威来源、给个判定最后吐出一张能转回群里的辟谣卡。鉴谣台首页。左「粘贴文字」右「上传截图」顶部是当前挂载的模型底部只有「核查」「设置」两个口老人点不错1被群里一条消息噎住了群里时不时就冒出这种「紧急通知吃过夜食物会致癌家家都有赶紧扔」。你回一句「这是谣言」多半会被反问「你懂什么人家都这么说」。这话能把人噎住。倒不是气他是我真拿不出证据。总不能跟他讲「隔夜菜亚硝酸盐在冷藏条件下远低于 GB 2762 限值」——听不进去也不该让他听。给群里的老人辟谣难在几步。说法常常藏在截图里得先有人读出来每条都要查权威来源做子女的没空一条条翻查明白了还得说成老人愿意往回转的一句话。这四个新特性正好一个对一个。2通用 Agent 与 Coding一次接住四条谣言第一张卡是通用 Agent 与 Coding。我拿最绕的一条去试一句话里塞了疫苗阴谋、喝尿养生、碱性体质、过夜菜致癌四样东西混在一起全丢给模型。它一次拆出了四条逐条判断、逐条给来源没含糊一条。这事技术上不容易拆说法、查证、判定、汇总整条链得一次跑通中间断一环就全废。功能能跑之后我又让它按无障碍的规矩把页面重排了一遍。这东西的真实用户是老人所以字号没一个小于 15px按钮高 54px四种判定用图标加文字而不单靠颜色红绿色盲也分得清。没有紫渐变就是暖白底配一个深的绿。图 1鉴谣台模型设置页。多厂商选择 方舟 Agent Plan 的专属 endpoint/api/plan/v3Key 只存本机浏览器3深度搜索与真实性它自己抓到过时话术第二张卡讲时效和来源。我埋了个不太容易看出来的坑酸性体质早就被辟谣了我偏把它写成「十几年前的理论现在又流行回来所以可以照做」。它没顺着「老理论」就放行。判的是「部分属实」理由是「确实是十几年前就被翻炒的老说法但流行不等于有道理」。过期话术它认得出旧瓶装新酒还主动提醒核对时效。它不光判对错还问一句这说法是不是早该过时了。图 2真实核查报告。2 条失实、3 条部分属实、0 条属实、0 条无法核实每条带把握度与权威来源4工具调用与复杂任务格式焊死想胡说都难第三张卡是工具调用。我没让模型自由发挥而是定义了一个叫 submit_report 的函数工具报告结构用 schema 锁死。claims拆出来的每条说法得带上中立的表述、判定、把握度、一句人话解释、来源elder_card一张能转发的辟谣卡带标题、正文、一句行动建议notes留给自己复查证据不足就直说。图 3submit_report 工具真实源码。方舟 Agent Plan 专属 endpoint/api/plan/v3 schema 焊死的结构化报告我连着跑了五个 case最狠的一条是把疫苗、尿疗、碱性、过夜菜混一起它输出的报告每条都带判定、把握度和来源链接一个字没出 schema。让 Agent 稳定跑复杂任务长这样。剩下两张卡视觉理解对上「读截图」。爸妈转来的九成是图片鉴谣台能直接传群截图模型把图里的说法一条条抠出来。下面这张一句话里「微波炉热饭会产生辐射」和「会致癌」两条都拆开了前一条属实、后一条失实。长程规划对上「越用越厚」每次核查都存本地谣言库越用越厚1M 上下文装得下爸妈一周转的几十张图。图 4传一张截图进去模型拆出两条对立的说法各自带把握度和来源前面是挑出来重点讲的。真跑的一共十五条四张卡一卡不落过程截图 55 张都存在仓库里。全列在下面。通用 Agent 与 CodingT1 多说法拆解。这轮最难。给它的是一句话里硬塞四条「疫苗是绝育的阴谋千万别打」「坚持喝尿能大补养生」「多吃碱性食物调理酸性体质」「过夜菜里有亚硝酸盐吃了致癌」。预期是别糊成一锅得一条条拆、一条条判、一条条给来源。跑完它拆出 4 条逐条落判、逐条挂来源一条没漏也没把两条并成一条。这条最容易踩的坑是拆不干净——四条缠在一起漏一条、并一条都算翻车它没犯。T1 过程图一句里四条全拆开疫苗、喝尿当场判失实统计栏 3 失实 1 部分属实一条没并T2 全链路跑通。拆说法、查证、判定、汇总、出辟谣卡整条链一次到底。预期是中间别断。结果是链条稳一步没断最后吐出一张能往回转的卡片。T2 过程图柿子配螃蟹整条判失实挂辟谣平台、卫健委、科普中国 3 个来源链条一次到底T3 无障碍重排。让模型照无障碍的硬规矩把页面重排一遍。预期是字号不低于 15px、按钮 54px、判定不单靠颜色。结果它做到了——四种判定用图标加文字区分红绿色盲也分得清暖白底配一个深绿没上紫渐变。这一步测的是它能不能听进一堆约束条件而不只是会写页面。T3 过程图重排后的首页字号、图标加文字、底部只剩「核查」「设置」两个口老人点不错T4 预扫到核查两步衔接。输入瞬间本地词典先命中预警再点一下进深度核查。预期是两步接得顺。结果是本地预警秒出深度核查接得上中间不卡。这四条里的 T1、T2、T4 都调了模型深度核查、reasoning 全开是真的花钱的量级见下面那条总账。T4 过程图输入就触发本地预扫黄色预警先跳「命中 2 条已知模式」再点「开始核查」进深度两步接得上深度搜索与真实性T5 时效性。我埋了个坑把「酸性体质是百病之源」写成「十几年前的养生理论现在又流行回来」。预期是它别一看「老理论」就放行。结果它没顺这个「老」字走判的是「部分属实」理由是「确实是十几年前就被翻炒的老说法但流行不等于有道理」还主动提醒核对时效。它认得出旧瓶装新酒。这坑藏得浅但一旦判错方向就是整条误判它咬住了。T5 过程图埋坑输入——「酸性体质」写成十几年前的旧理论又流行回来本地只命中 1 条T6 派生骗局。一条是「高龄津贴 800 元」的政策信息夹一句「点链接领补贴」。预期是别只看津贴数字把派生的骗局一起抓。结果它连「点链接领补贴」一起判失实没放过那个诈骗尾巴。T6 过程图高龄津贴那条「点链接领补贴」的诈骗尾巴一样判失实没放过来源挂政府网、民政部T7 无法核实。给它一条查不到出处的话。预期是查不到就直说别硬编来源。结果它老老实实标了「无法核实」没编链接。这条的槽点在于「无法核实」这结果对老人不好消化得靠辟谣卡补一句「先别转问问子女或医生」才落地。这三条也全是模型深度核查每条都是那个「几百秒、上万 token」的量级。T7 过程图祖传秘方这条标了「无法核实·先别转」没硬编来源「三副药根治」判失实工具调用与复杂任务T8 结构化 schema。submit_report 这个函数工具把输出结构焊死只留 claims、elder_card、notes 三个字段。预期是它一个字都别出 schema。结果报告工工整整字段一个不差格式没跑偏。这也是后面所有深度核查能稳定吐报告的底座。T8 过程图submit_report 焊死的报告每条带判定、把握度、来源一个字段没出 schemaT9 多档分类。几条定性完全不同的话混着进每条得各落各的档。预期是四档各归各位别全糊成一个结论。结果一次出了 2 条失实、2 条部分属实、0 属实、0 无法核实分得清清楚楚。T9 过程图过夜菜批里夹了「酸性体质」2 失实 2 部分属实各落各档没糊成一锅T10 噪声过滤。给句正常话「西瓜三块五一斤」。预期是 0 命中 0 信号别误伤。结果就是 0 命中 0 信号。这条最要紧——早先预扫用单字匹配时翻过车把「过夜菜」误命中到微波炉、味精上后来改成纯正则精确匹配才压住。这三条里的 T8、T9 走模型T10 只走本地词典、不耗 token。T10 过程图本地只按正则精确匹配「西瓜冷藏过夜」这种正常话没被误判成谣言0 命中 0 信号视觉理解与长程规划T11 上传截图拆说法。这轮直接对应上面图 4。传一张群截图图里「微波炉热饭会产生辐射」和「会致癌」挤在一条里。预期是拆成两条、分开判。结果真拆成两条前一条判「属实」、后一条判「失实」各自给了把握度和来源WHO、美国 FDA。细到这个程度是我最满意的一条。深度核查又是几百秒、上万 token。T11 过程图截图里的「微波炉有辐射」与「会致癌」拆成两条前属实、后失实T12 本地预扫·经典。「吃过夜食物会致癌赶紧扔」。预期是命中已知谣言。结果命中 1 条谣言、抓到 2 个话术信号判失实并挂 2 个来源。这条不调模型0 token秒出。T12 过程图过夜菜命中已知谣言判失实挂辟谣平台、科普中国 2 个来源0 token 秒出T13 本地预扫·复合。「微波炉致癌」加「味精脱发」两条混一句。预期是精确命中两条。结果精确命中 2 条、话术信号 1 个也抓到。同样是 0 token本地词典纯白干、不耗一分额度。T13 过程图本地预扫一次命中 2 条谣言模式复合说法一条不落T14 长程规划。每次核查都存本地谣言库越用越厚。预期是历史能积累、能导出导入。结果历史记录里四条说法各带时间戳能存能导。这步纯本地存储不花模型钱。T14 过程图本台核查记录四条历史各带时间戳能导出导入谣言库越用越厚T15 模型自查。web_search 挂上去API 跑通返回成功。预期是看它到底联网没有。结果是它拆了说法、给了来源、判了失实可自查字段里写着「未实际联网检索」。它没真联网也没装自己搜过。这是全文最想让评委看到的一条。T15 过程图报告给了权威来源、判了失实可 notes 自查写着未实际开放联网检索算总账。深度核查那几条每条都是几百秒、上万个 token——真实记录里「过夜菜」那一轮就是 307 秒、11251 token其中 9517 全花在推理上模型把亚硝酸盐剂量、GB2762 限值、冷藏条件下的实测挨个推演了一遍才下结论本地预扫那几条是 0 token、0 秒、不耗额度。想一条条对着看这 55 张过程截图都在仓库 screenshots/cases 里。5两层结构一次翻车一次诚实的核对鉴谣台是两层。第一层是本地预扫词典输入就查、秒出预警不花一分钱额度。第二层才是深度核查走模型推理加结构化报告。图 4本地预扫。输入即命中「酸性体质」已知谣言模式秒出预警再点按钮让模型深度核查翻车照说不误。我手上是火山方舟 Agent Plan 的专属 Key一开始拿普通按量付费的地址去调连着 401。折腾五六轮才发现 Agent Plan 有自己的 endpoint/api/plan/v3换了地址才通。接着又卡一次Responses API 的工具格式跟 Chat API 不一样函数工具的名字要放顶层不能嵌在 function 对象里报了 MissingParameter改成扁平格式才过。最有意思的在最后。我把 web_search 挂上去API 跑通返回成功模型拆出说法、给了权威来源、判了失实。可它自己的自查里写着「未实际联网检索所附为权威机构官网首页不是具体辟谣文章链接。」Agent Plan 的 web_search 没真触发。模型靠的是自己学过的知识给判定和来源还主动标了这一点没装自己真搜过。这反而让我更信它。哪天 web_search 在 Agent Plan 上开了前端一行不用改自动升级成真联网。图 6两轮真实调用数据。本地预扫三条用例不误伤深度核查 307 秒、11251 total token9517 reasoning全程本机截图存档6它不完美的地方最大的一块是 web_search 没在 Agent Plan 上真触发。来源是模型自己的知识不是实时检索要真联网得换普通按量付费的 Key。再就是速度。深度核查一轮要 1 到 5 分钟放家庭群里太慢了。后面得做成预扫秒出快速核查压到 30 秒以内才像话。本地词典也薄。就过夜菜、微波炉、味精这几类最经典的新的、地方性的谣言只能判「无法核实」往后丢给联网。还有健康类的判定永远留一道人工闸。输出里固定一句「涉及健康请遵医嘱」模型再准也不能替医生下结论。7从博物馆到鉴谣台上次做博物馆我想的是 AI 能帮人留住什么。这次做鉴谣台我想的是 AI 能帮人挡住什么。上次想留住感情这次想挡住坑。老人被骗几个钱倒还好最受不了的是连一条消息都分不清真假。我要做的是把子女从一条条辟谣的体力活里拽出来让「这是谣言」这句话说出口时有底气、有出处还带着一张对方愿意转回去的卡片。代码我开源了Node 单文件后端加一个零构建的移动端页面npm start 就能跑。成果我不敢打包票但至少现在再有亲戚转「致癌」那类消息我手里有东西能甩过去了。GitHub 仓库github.com/GoodTimeGGB/jianyaotai项目用 Doubao-Seed-Evolving 在 Trae 里做的8/27 版。文里那些判定、来源、自查都是真跑出来的记录截图也来自本机实际运行。Agent Plan 的 endpoint 是 /api/plan/v3Key 没写进任何文件。健康问题以医生和权威机构为准。
返回列表