)
批量改写整个文件夹的AI草稿humanizer批处理脚本完整教程长文分段数字核对报告【免费下载链接】humanizer项目地址: https://ai.gitcode.com/hf_mirrors/jialinyyzz/humanizerhumanizer 是一个在本地运行的 12B 改写模型把一个文件夹里的 AI 草稿丢进去批处理脚本就能把整批文本改写成更像人写的样子并自动给长文分段、生成一份数字核对报告。全程不联网、不上传数字、日期、人名、引用都尽量原样保留。它和逐条粘贴最大的区别就是你不需要一篇一篇地手动处理——丢进一个文件夹脚本把里面的.txt全部跑一遍。1. 这个批处理脚本到底能做什么humanizer 是一个 12B 的文本续写模型微调自 Gemma。你给它一篇 AI 写的草稿它接着写出改写。官方配套的批处理脚本humanize_folder.py完整代码见 USAGE.md 第 9 节把四件最烦人的事都包办了长文自动分段长文件按空行拆成若干块逐块改写后再拼回去不会撑爆上下文自动防照抄某一段改写如果和草稿重合度太高会自动重采样一次保留抄得少的版本数字核对报告草稿里出现、但改写里找不到的数字统一写进report.tsv让你人工复查断点续跑输出文件夹里已经存在的文件会被跳过中途停了重新跑不会重复劳动。 它改写的是你自己的草稿输出只有改写后的正文不会替你偷偷改动内容。2. 跑批处理前先准备什么选对模型文件按内存大小模型文件就放在本仓库根目录按你的内存挑一个即可你的内存选这个文件大小32 GB 及以上humanizer-12b-Q8_0.gguf推荐约 12.7 GB16 GBhumanizer-12b-Q6_K.gguf约 10.0 GB16 GB / 硬盘紧张humanizer-12b-Q4_K_M.gguf约 7.6 GB同时还需要 prompt_format.json它存着脚本逐字拼接提示词用的指令和分隔符必须和模型文件放一起中文草稿也用里面这段英文指令不要翻译。启动本地推理服务用 llama.cpp 的llama-server把模型起成一个本地服务脚本就会连上去# 内存 ≥ 32GB 用 Q8_016GB 把文件名换成 Q6_K / Q4_K_M llama-server -m ./humanizer-12b-Q8_0.gguf -c 8192 -np 1 -ngl 99 --host 127.0.0.1 --port 8080-c 8192指令 草稿 改写共用的上下文-np 1一次只处理一个请求整个上下文都给它-ngl 99把所有层放到显卡上显存不够就调小这个数。看到offloaded N/N layers且 N 等于总数说明模型跑在显卡上如果是 0就是在 CPU 上会很慢。3. 一键运行把整个文件夹改写完把 USAGE.md 第 9 节的humanize_folder.py存成本地文件然后两条命令跑起来# 批量改写 drafts/ 里的每个 .txt结果写进 rewrites/ python3 humanize_folder.py drafts/ rewrites/ # 服务不在默认端口或想调大单块 token 数 python3 humanize_folder.py drafts/ rewrites/ --url http://127.0.0.1:8080 --max-tokens 1500它做的事情按文件逐个打印进度[3/20] xxx.txt: 2 piece(s), copy 0.12把长文件按空行拆成不超过--max-tokens默认 1500token 的块每块单独改写改写后和草稿的重合度超过 0.35 就重采样一次保留抄得少的那个所有块用空行拼回完整文件写进rewrites/草稿里有、改写里没找到的数字追加写进rewrites/report.tsv。4. 读懂数字核对报告 report.tsv批处理最有价值的输出就是report.tsv它是一行一个源文件的清单四列列含义文件名被改写的那个草稿piece(s)这个文件被拆成了几块copy整篇改写和草稿的整体重合度0~1越低越去 AI 味check numbers草稿里出现、改写里找不到的数字空格分隔没有就写-⚠️这一列不是给你自动修复的而是让你人工复查的。模型偶尔会把37 起投诉写成37% 的投诉、把日期重新排版数字对不上时脚本会把它列出来。发送前对照草稿把这些数字、日期、人名再核一遍即可。5. 长文分段为什么不会被截断模型的上下文是8192 token指令 草稿 改写共用改写通常和草稿差不多长所以单块草稿要留足余量。脚本的默认策略已经很稳只在空行段落边界处切绝不在句子中间断开每块默认不超过 1500 token长块还能继续按句拆每块独立改写所以块与块之间语气可能略有差异建议拼回去后通读一遍。如果你只改写散文、想保留标题和代码块建议只用脚本改散文、结构自己留官方另有一个hz命令能一块一块地保结构见 USAGE.md 第 14 节。6. 改写质量数字、日期、引用都保得住吗在评测集上一个从严的事实判官对 420 篇英文改写跑了一遍指标表现未挑出事实问题376 / 420约 90%丢了格式元素28 / 420与草稿的中位重合度0.165越低越不像原文被判出问题的改写超过九成只要改一个词或短语。所以发出去之前读一遍不是客套话。中文使用的小提示详见 USAGE.zh.md 第 11 节中文和英文用同一段英文指令不要翻译中文里数字更容易换形态三→3、6月14日→6.14纯数字检查看不见这种变化靠读来核对中文改写有时更贴近原文看着太像草稿就重跑一次。7. 常见问题速查现象原因怎么办输出以 Sure 开头 / 复读指令 / 停不下来套了通用聊天模板用续写接口/completion别用聊天接口输出几乎和草稿一样采样运气差或温度太低确认 temperature 1.0重跑一次加载时内存不足文件太大换 Q6_K / Q4_K_M调低-ngl速度很慢跑在 CPU 上看offloaded N/N layers装 Metal/CUDA/Vulkan 版8. 相关文件批处理脚本完整代码与参数USAGE.md第 9 节「Rewrite a whole folder」中文使用说明USAGE.zh.md提示词指令与分隔符prompt_format.json给 AI Agent 的安装/调用说明AGENTS.md模型总览与评测结果README.md【免费下载链接】humanizer项目地址: https://ai.gitcode.com/hf_mirrors/jialinyyzz/humanizer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考