
llama.cpp 调优迁移先守住模型输出一致性替换推理底座时最先变化的往往不是速度而是模板渲染、采样参数、停止词和流式输出的细节。只要这些条件没有对齐同一个模型文件也可能给出不同结果。先冻结可比较的请求准备一组覆盖多轮对话、工具调用格式、长上下文和空结果的请求。记录模型文件摘要、聊天模板、系统提示词、采样参数、上下文长度和停止条件。比较时既看最终文本也看结构化输出、错误类型和首个 token 前的等待。输出带随机性时不要要求逐字符相等。可以固定随机种子做诊断线上则用格式校验、关键字段和人工抽样判断是否出现语义回退。切换前处理资源边界模型加载、KV cache 和并发队列共享同一份内存预算。先设置能观测的排队上限和拒绝方式再谈把并发开到多大。流式连接断开时确认服务端会回收生成任务而不是让没有读者的请求继续占着 slot。逐步放量回退不靠人工补救先让只读、可容忍降级的接口走新后端保留旧路径和配置开关。遇到输出格式不符合契约、资源达到保护阈值或依赖异常时切回应只改变路由不应要求人工修改会话或缓存数据。迁移记录要能回答三个问题这次比较用了什么模型和参数差异出现在哪类请求回退时影响了哪些流量。这样后续调优才不是反复猜测。推理底座可以替换接口契约不能跟着漂移。