
1. 从会说话到会做决定Jev 模型要跨过的那道坎大多数人第一次接触大模型都是从生成开始的——写文案、改代码、翻译、总结。这类模型本质上是在做一件事给定上文预测下一个最合理的词。它很擅长说得像但不太擅长选得对。Jev 模型研究里最核心的一条主线就是把这两件事拆开看生成式大模型负责表达决策式模型负责选择。前者是能说会道后者是知道该干什么、不该干什么。这个区分听起来像文字游戏但落到实际项目里差别巨大。你让一个纯生成模型去处理用户投诉该不该升级到人工客服这种问题它可能会给你一段非常通顺、非常有道理的分析然后给出一个模棱两可的结论。而决策式模型要做的是在有限信息下输出一个明确的动作升级、不升级、或者再问一轮。Jev 模型研究的价值就在于它试图把生成能力和决策能力放进同一个框架里讨论而不是各说各话。这篇内容适合谁看如果你正在做智能体、自动化流程、客服路由、风控初筛、推荐策略这类需要模型做判断的场景那 Jev 模型这套思路会很有参考价值。如果你只是拿大模型写写文章那这篇可能偏硬但里面关于 System One 和 RLCD 校准的部分依然能帮你理解为什么同一个模型有时候很聪明、有时候很蠢。我先把结论放在前面Jev 模型不是要造一个更大的生成模型而是要解决生成模型在决策场景下的校准问题。它借用了认知科学里 System One快思考和 System Two慢思考的框架用 RLCDReinforcement Learning from Comparative Decisions基于比较决策的强化学习来做偏好校准最后划出一条采用边界——哪些任务可以交给模型自动决策哪些必须留给人。下面我按这个逻辑一层层拆。2. System One 在 Jev 模型里到底指什么2.1 不是快慢这么简单而是直觉策略的建模很多人一看到 System One第一反应是快思考、直觉、不假思索。这个理解不算错但在 Jev 模型的语境里它更准确的含义是一个在大量经验上压缩出来的策略网络能在不展开完整推理链的情况下直接输出动作。它不追求每一步都可解释追求的是在熟悉场景下反应足够快、足够稳。你可以把它类比成老司机开车。新手变道要看后视镜、打灯、扭头、确认、再动这是一套显式推理流程老司机变道几乎是条件反射眼睛一扫手就动了。Jev 模型里的 System One 就是要把这种条件反射学出来用在那些高频、低风险、模式稳定的决策上。这里有个关键点容易被忽略System One 不是简化版推理而是另一种能力。它依赖的是训练分布内的模式匹配一旦遇到分布外的情况它不会告诉你我不确定而是会自信地给一个错误答案。这就是为什么 Jev 模型必须配一套校准机制不能只靠 System One 裸奔。2.2 为什么决策场景特别需要 System One纯生成模型做决策有个天然缺陷它每次都要想一遍。你让它判断一万条工单的优先级如果每条都走完整推理链延迟和成本都受不了。而实际业务里80% 的工单都是那几类常见问题完全可以用一个快速策略直接分流。Jev 模型研究里对 System One 的定位就是承担那 80% 的高频决策把慢推理留给真正需要仔细想的 20%。这个分工不是拍脑袋定的而是基于一个很朴素的观察决策的边际成本应该和决策的难度匹配。简单问题用重推理是浪费复杂问题用快策略是冒险。我在实际项目里试过类似的分层做法先用一个轻量分类模型做初筛置信度高的直接走自动流程置信度低的转给大模型慢推理。结果发现真正需要慢推理的比例往往不到 15%但就是这 15% 决定了整体体验的上限。Jev 模型把 System One 单独拎出来讨论本质上是在强调快策略不是降级方案而是一等公民。2.3 System One 的训练数据从哪来这是实操里最头疼的问题。System One 要学直觉但直觉不是凭空来的它需要大量状态-动作配对。在 Jev 模型的框架里这些数据通常有三个来源历史决策日志过去人工或系统做过的决策带结果标签。这是最直接的数据但往往有偏因为历史决策本身可能就不优。模拟环境回放在可控环境里让策略跑一遍记录动作和反馈。好处是可以探索坏处是模拟和真实有 gap。对比数据同一个状态下不同动作的优劣对比。这类数据不要求绝对正确只要求A 比 B 好标注成本低很多。提示如果你手上只有正确动作标签没有对比数据System One 很容易学成一个只会模仿历史的复读机。Jev 模型强调 RLCD很大程度上就是为了补上对比这一环。3. RLCD 校准让决策式模型知道自己该有多自信3.1 RLCD 和传统 RLHF 的区别在哪RLHF基于人类反馈的强化学习大家比较熟核心是用人类对生成结果的排序来训练奖励模型。RLCD 把生成换成了决策把哪个回答更好换成了哪个动作更优。这个替换看似小实则改变了整个校准的目标。生成任务的偏好是读起来舒服、事实正确、风格合适决策任务的偏好是长期收益高、风险可控、符合约束。前者可以靠单次输出判断后者往往要看一串动作之后的累积结果。所以 RLCD 的奖励信号不能只看单步得看轨迹。Jev 模型研究里对 RLCD 的处理我理解是把它当成一个比较式校准器不要求标注者给出绝对分数只要求在两两对比中选出更好的决策。这样做的好处是标注一致性高坏处是需要设计合理的对比采样策略否则容易在简单样本上过拟合。3.2 校准到底在校什么很多人以为校准就是调温度、调阈值。那只是表面。Jev 模型里的校准核心是让模型的置信度和实际正确率对齐。一个校准良好的决策模型当它说我有 80% 把握时实际应该有大约 80% 的情况是对的。为什么这很重要因为决策系统通常有个自动执行阈值。置信度高于阈值就自动做低于就转人工。如果模型过度自信阈值就会形同虚设错误决策直接放行如果模型过度保守阈值又会导致大量转人工自动化率上不去。校准做不好整个分层决策的架构就塌了。我踩过的一个坑是早期用生成模型的输出概率当置信度结果发现它和实际正确率几乎不相关。生成模型的概率是下一个词的概率不是这个决策正确的概率。Jev 模型把决策式模型单独拿出来校准就是为了避免这种张冠李戴。3.3 RLCD 的实操流程拆解按 Jev 模型的思路RLCD 校准大致可以拆成这么几步构造对比对从历史决策或模拟轨迹里采样状态对同一状态生成两个候选动作确保两者有实质差异。收集偏好由人工或一个更强的裁判模型判断哪个动作更优记录偏好。训练奖励模型用偏好数据训练一个打分器输入状态和动作输出相对优劣。策略优化用奖励模型作为信号优化 System One 策略同时加约束防止跑偏。校准验证在留出集上检查置信度-正确率曲线必要时做后处理校准。这套流程里第 1 步和第 5 步最容易被敷衍。对比对如果都是明显好 vs 明显差奖励模型学不到细粒度校准验证如果只看准确率不看曲线等于没校。环节常见做法容易出的问题改进方向对比对构造随机采样两个动作差异过大信号弱按难度分层采样偏好收集单人标注主观偏差大多人交叉一致性检查奖励模型直接回归分数过拟合简单样本加入 margin 约束策略优化纯奖励最大化钻奖励模型空子加 KL 约束和规则兜底校准验证只看整体准确率掩盖局部失准分桶看可靠性曲线3.4 校准之后模型会变笨吗会而且这是正常的。未校准的模型往往过度自信看起来什么都敢答校准之后它会开始说这个我不确定。在演示场景里这显得不够惊艳在生产场景里这是救命的能力。Jev 模型研究里有个观点我很认同决策式模型的价值不在于它答对了多少而在于它知道自己什么时候可能答错。一个 90% 准确率但校准良好的模型配一个合理阈值可以做到 99% 的自动决策正确率一个 95% 准确率但过度自信的模型自动决策正确率可能只有 85%。这就是校准的杠杆效应。4. 采用边界哪些决策能交给 Jev 模型哪些不能4.1 边界不是技术问题是风险问题讨论采用边界时很多人第一反应是模型能力够不够。但 Jev 模型研究里更强调的是错误代价的可承受性。同样准确率的模型用在推荐排序上可能完全没问题用在资金划转上就是灾难。边界的第一维度是风险第二维度才是能力。我一般用两个问题来划边界第一这个决策错了最坏结果是什么第二这个错误能不能被及时发现和回滚如果最坏结果不可接受或者错误很难被发现那不管模型多准都不该全自动。4.2 一个可操作的边界划分框架结合 Jev 模型的思路我把决策场景分成四类高频低风险如工单分类、内容打标。适合 System One 全自动校准阈值可以放宽。高频高风险如交易拦截、权限审批。适合 System One 出建议人工确认或者只做拦截不做放行。低频低风险如一次性配置生成。可以用慢推理人工抽检。低频高风险如重大策略调整。模型只做辅助分析决策权必须留给人。这个框架的关键在于它不追求最大化自动化率而是追求风险调整后的效率。很多团队一上来就想把自动化率拉到 90%结果在少数高风险决策上翻车最后整个系统被叫停。Jev 模型的采用边界思路是先守住底线再逐步扩边界。4.3 边界会随校准质量动态移动边界不是画一次就固定的。随着 RLCD 校准数据积累模型在某个场景的可靠性提升边界就可以往外推。反过来如果监控发现某个场景的校准曲线变差边界就要收回来。这就要求系统具备在线监控校准质量的能力。具体做法是对自动决策的样本做定期抽样复核计算实际正确率和模型置信度的偏差偏差超过阈值就触发告警。Jev 模型研究里把这一步看作闭环的一部分而不是上线后的运维杂事。注意抽样复核的样本不能只抽高置信度的那样永远发现不了问题。要按置信度分层抽样低置信度区间反而要加大抽样比例。4.4 人在边界上的角色变化采用边界划清楚之后人的角色会从执行者变成边界管理者。以前人工做决策现在人工主要做三件事处理模型转来的疑难样本、复核自动决策的抽样、调整边界和阈值。这个转变对团队能力的要求其实更高了。执行者只需要按流程做边界管理者要理解模型行为、看懂校准曲线、判断风险变化。Jev 模型研究里反复提到人机协同我觉得落到实处就是这句话人不再和模型抢活干而是负责决定模型能干多少活。5. 把 Jev 模型思路落地时我踩过的几个坑5.1 拿生成指标评估决策模型这是最常见的错误。用困惑度、BLEU 这类指标去评估一个决策模型就像用作文分数去评估司机水平。决策模型要看的是动作准确率、校准曲线、累积收益不是文本流畅度。我早期做过一个工单路由的决策模型训练时 loss 降得很好看上线后路由准确率却一般。后来发现loss 衡量的是预测下一个动作的概率而业务关心的是这个动作对不对。两者在类别不平衡时差异巨大。换成按类别加权的决策准确率之后优化方向才对齐。5.2 对比数据里混入了伪偏好RLCD 依赖对比数据但对比数据很容易被污染。比如标注者偷懒总是选第一个或者两个动作其实差不多硬要选一个引入了噪声。这些伪偏好会让奖励模型学到错误的信号。我的处理办法是加入平局选项允许标注者说这两个差不多同时对标注者做一致性检验一致性太低的标注者数据降权。Jev 模型研究里对数据质量的要求其实比模型结构更值得重视。5.3 阈值定得太聪明有些团队喜欢用动态阈值根据当天流量、模型置信度分布自动调整。听起来很智能实际很容易震荡。阈值频繁变动会导致自动决策的比例忽高忽低业务方完全无法预期。我的建议是阈值调整要有冷却期比如一周最多调一次且每次调整幅度有限制。校准质量监控可以实时但边界调整要稳。Jev 模型强调采用边界的稳定性我觉得这是被低估的一点。5.4 忽略了 System One 的分布漂移System One 是快策略它对分布变化特别敏感。业务规则一变、用户行为一変原来的直觉可能就失效了。而且因为它快错误会迅速放大。对策是给 System One 配一个轻量的分布检测器监控输入特征的统计变化。一旦检测到显著漂移自动降低自动决策比例转人工兜底。这个机制不复杂但很多团队上线时根本没做。6. 从 Jev 模型研究里能带走的三条实操原则第一条先分清生成和决策再谈模型选型。如果你的任务本质是选一个动作就别拿生成模型的输出概率当决策依据。Jev 模型把这两类能力分开讨论最大的价值就是帮你避免这个混淆。第二条校准比准确率更值得投入。一个校准良好的中等模型配合理阈值能比一个校准差的高准确率模型创造更大价值。RLCD 这套比较式校准方法核心就是让模型知道自己几斤几两。第三条边界要保守起步用数据推动扩张。不要一上来就追求全自动。先把低风险高频场景跑通积累校准数据再逐步把边界往外推。Jev 模型研究里对采用边界的讨论本质上是一种工程上的克制。我在实际项目里的体会是决策式模型落地最难的不是训练而是建立一套让业务方敢用的信任机制。这套机制的核心就是校准和边界模型知道自己什么时候不确定系统知道什么时候该转人工业务方知道最坏情况是什么。把这三件事说清楚比模型涨几个点准确率有用得多。最后分享一个小技巧如果你刚开始做决策式模型别急着上 RLCD。先用历史数据训一个基线 System One把校准曲线画出来看看它在哪些区间失准。很多时候光是做后处理校准比如 Platt scaling 或 isotonic regression就能把可靠性提升一大截。等基线稳了再上 RLCD 做策略优化投入产出比会高很多。