
为什么要用 283 万字语料量化「AI 味」解读 lieflat-less-ai-tone 去 AI 味的对照语料库研究方法【免费下载链接】lieflat-less-ai-tone一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study项目地址: https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tonelieflat-less-ai-tone 是一个基于 283 万字语料统计的去 AI 味 skill它用对照语料库的语言学方法把什么是 AI 味从主观感觉变成可复算的频率数据再将有区分度的特征转写成改写规则帮你把中文文本里的 AI 生成痕迹清理掉。一、为什么「AI 味」不能只靠感觉 写作者圈子里流传着一份判别清单破折号用太多、不是 A 而是 B反复出现、句长太均匀、比喻包装抽象概念……这些条目靠社交传播几乎成了常识。问题在于这些条目从未被系统检验过。其中哪些真有统计区分力哪些只是观察者偏差甚至有没有方向是反的lieflat-less-ai-tone 的研究目标不是发明新清单而是对既有清单逐项做对照实验并给出可复算的判定程序——这就是为什么要用 283 万字语料量化 AI 味的由来只有样本足够大、两侧足够对齐倍率数字才站得住。二、对照语料库是怎么搭起来的整个方法的核心是一个严格控制的对照语料库侧篇数汉字数句数段数AI 生成5 个模型 × 60 篇3001,179,10537,64214,549人类写作3291,647,86757,90931,172合计6292,826,97295,55145,7211. 控制三类混淆因素要让AI 写的和人写的差异可归因必须先排除干扰主题与文体对齐两侧写同类话题否则测出的可能是文体差异五个模型各 60 篇单一模型的癖好容易被误读成 AI 的共性——早期用 2 个模型 30 篇测出的破折号是某模型独有扩样后就被推翻了生成条件干净不联网、不下风格指令只给话题测出的才是模型默认倾向。2. 人类侧分组统计329 篇人类文章按来源分组独立统计用来检验组间一致性——如果某特征只在个别组偏高说明那是个人风格不是人类共性。单字虚词和破折号就是靠这一步被识别为不可靠指标的。三、26 项候选特征实测11 项通过3 个反直觉发现研究检验了 26 项候选特征逐项计算频率比R AI 侧频率 ÷ 人类侧频率R≥ 2.0 才纳入。结果11 项通过、15 项排除其中三项与流行认知方向相反 流行认知实测结果AI 爱用比喻包装抽象概念人类比喻频率是 AI 的2.4 倍AI 爱设问自答正文设问句人类是 AI 的17 倍AI 句长过于均匀修正切分缺陷后比值为 0.87无差异通过检验的 11 项集中在篇章与结构层面区分力最强的是段首零回指评论R 4.4AI 在新段落开头直接抛评论、不交代对象读者得回头找。模型间的「AI 味」各不相同特征每千字ClaudeDeepSeekGeminiGPTKimi破折号4.255.160.510.112.32提示性冒号0.380.430.220.250.32问句小标题0.0430.0860.1730.0080.000同一特征跨模型极差可达40 倍。所谓AI 文风并非单一形态——这也是为什么语料必须覆盖多个模型。四、从统计到规则改写规则怎么来的统计显著 ≠ 可执行。11 项通过的特征被转写成改写规则时附加了三重硬约束白名单原则只处理清单内的 11 项未命中的句子逐字保留标题层级、段落次序一律不动信息守恒不许新增姓名、数字、日期、因果也不许删减观点与限定词——把可能提升改成提升属于篡改不属于去 AI 味排除语义判断比喻贴不贴切、案例算不算堆砌无法转写成可执行规则一律不碰。规则全文见 SKILL.md完整结果表与被推翻的预设记录在 RESEARCH.md。五、研究方法中最值得学的 3 个点分母选错会给出反向结论AI 每篇小标题约 10 个、人类 1–2 个。用每千字算问句小标题是 32 倍换成占小标题比例差异直接消失。分母要匹配被测特征依附的语言单位。先抽样检视再采信数字正则匹配的是字面形态而非语义算子过宽会误纳实例。研究公开记录了6 次因算子设计缺陷导致的测量失误及其修正如问句小标题 32 倍最终被证伪规程是任何算子采信前先抽查 20 条命中实例。公开失败与局限文末如实讨论语料不可核验、话题未严格配对、结论有时效性等局限——频率数值应视为特定时点的观测。六、如何使用这个去 AI 味 skill 拿到仓库后有两种用法# 方式一安装到本地 Agent git clone https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tone npx skills add larashero3-dotcom/lieflat-less-ai-tone方式一安装后直接丢一段文本进去即按 11 条规则处理方式二把 SKILL.md 直接当作 system prompt适配任何支持自定义指令的写作工具。如果你只想复算统计数字仓库 scripts/ 目录下有三个脚本按目录读取.md文件即可跑全部指标脚本用途scripts/compare-human-ai.py句层各特征在两侧语料的频率与比值scripts/check-structure.py段落层相邻句同构、段首零回指scripts/check-translationese.py译文句式频率算子定义位于各脚本首部可直接修改与复核替换成自有语料即可复算全部指标。七、小结lieflat-less-ai-tone 的价值不在于又给出一份AI 味清单而在于演示了一条完整的研究路径用 629 篇对照语料把流行判断逐项送检15 项被证伪、11 项存活再把存活项落成带硬性边界、可验收的改写规则。对于被 AI 写作痕迹困扰的新手来说这套对照语料库方法同样可以迁移先控制话题与文体再选对分母最后用你自己的语料复算——感觉之外的数据才值得写进规则里。【免费下载链接】lieflat-less-ai-tone一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study项目地址: https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tone创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考