ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

LLM 文本标注不再写长答案:Jev 直接返回分类、评分和判断概率

LLM 文本标注不再写长答案:Jev 直接返回分类、评分和判断概率 温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。作者艾米丽 (连享会)邮箱lianxhcn163.comTitle: LLM 文本标注不再写长答案Jev 直接返回分类、评分和判断概率Keywords: Jev, 大语言模型, 文本分析, 概率校准, 文本分类提要: 使用 LLM 构造文本变量时研究者最终往往只需要一个类别、分数或 yes/no 判断却要先让模型生成一段文字再从中提取结果。TypeSafe AI 最近发布的 Jev 采用了另一种路线直接对研究者事先定义的问题作出判断并返回相应概率。本文介绍 Jev 的基本工作方式讨论它与生成式 LLM、Structured Outputs 和传统分类模型的差别并结合独立评测分析其概率输出、速度、成本和适用边界。1. 为什么要让 LLM 先写一段答案假设我们希望从上市公司年报中构造管理层信心指标。原文中有这样一句话虽然市场需求仍面临一定压力但随着重点项目逐步投产公司预计下半年经营状况将有所改善。如果把这段文字交给 GPT 或 Claude我们可以要求模型判断管理层对未来经营状况是否乐观说明判断理由再按照 1–5 分进行评分并以 JSON 格式返回结果。模型可能先生成一段解释公司承认当前市场需求仍存在压力但同时预计重点项目投产后经营状况将有所改善。整体语气体现出谨慎但偏积极的预期因此管理层信心处于中等偏上水平。最后再返回{ optimism: 4 }如果我们真正需要的只是数据表中的一列变量前面的解释通常不会进入后续回归。研究者最终保存的仍然只是Optimismi4Optimismi​4文本不多时这种做法没有什么问题。生成式 LLM 给出的解释甚至可以帮助研究者检查模型为什么这样判断。但如果需要处理十万份年报、几百万条新闻或者上千万份招聘广告情况就不一样了。模型为每条文本生成几十甚至几百个 token需要时间和费用最后还要把这些文字重新解析成类别、数值或者 JSON。这就带来一个很实际的问题如果研究最终需要的只是一个变量我们为什么还要让 LLM 先写出一段答案2026 年 9 月 15 日TypeSafe AI 发布了 Jev并把它称为第一个System One Model。与 GPT、Claude 这类生成式 LLM 不同Jev 不以生成自然语言回答为主要目标。研究者提供一份待分析内容 (state)再告诉模型需要判断哪些问题Jev 直接返回预先定义好的类别、分数和相应概率。TypeSafe 将这种工作方式概括为输入非结构化信息输出可以直接供程序使用的类型化概率判断。Jev 官方发布说明仍以上面的年报为例我们可以围绕同一段文字提出三种问题。Choice用于有限类别之间的选择。例如问管理层对未来经营状况的整体态度属于哪一类候选答案预先限定为「悲观」「中性」「谨慎乐观」「乐观」。Jev 不只返回最终类别还会返回各个选项的概率例如P(Y悲观)0.04,P(Y中性)0.14,P(Y谨慎乐观)0.57,P(Y乐观)0.25P(Y悲观)0.04,P(Y中性)0.14,P(Y谨慎乐观)0.57,P(Y乐观)0.25Score用于有序评分例如判断管理层信心处于 1–5 级中的哪个等级。Noul则用于 yes/no 判断例如管理层是否明确预计未来经营状况改善模型直接返回 P(yes)P(yes)。同一份待分析内容可以同时对应多个问题而且这些问题可以共享一次调用。Guo et al. (2026) 对 Jev 的描述也是如此Noul返回 yes 的概率Choice返回有限选项上的概率分布Score返回有序等级上的概率分布。下图把两种工作流放在同一段文本上比较。生成式 LLM 通常先生成自然语言答案再从中提取研究变量Jev 则直接围绕预先定义的问题返回类别、评分和判断概率。Jev 最容易理解的特点是它保留了模型理解自然语言的能力但不要求模型先把判断写成一段自然语言答案。2. Jev 省掉的究竟是什么GPT、Claude 已经支持 JSON Schema 和 Structured Outputs因此「能够返回结构合法的 JSON」并不是 Jev 的核心差别。OpenAI 在 2024 年推出的 Structured Outputs 可以要求生成式模型严格遵循开发者给出的 JSON Schema避免漏掉必需字段或生成 schema 之外的枚举值。普通生成式 LLM 即使最后只输出{label: optimistic}底层仍然执行自回归文本生成只是输出空间受到 schema 约束。Jev 的目标不同答案空间事先已经限定模型直接在这些候选答案之间作判断并返回概率。按照 TypeSafe 的官方比较普通 LLM 主要输出字符串而 Jev 输出预先定义类型的结构化值前者采用逐 token 的顺序生成后者强调直接完成多个有限判断。TypeSafe 自己提供的开源 System One Adapter 很能说明这个边界。它可以把 OpenAI、Anthropic 和 Gemini 等普通 LLM 包装成与 Jev 相近的Choice、Score和Noul接口还可以使用这些模型原生的 Structured Outputs并要求普通 LLM 按统一接口返回一组类别概率在需要时再进行归一化。这意味着 Jev 的价值不能简单概括成「别人只能写文字它能够输出概率 JSON」。普通 LLM 同样可以被包装成这种接口。Jev 真正试图省掉的是当最终任务只需要一个有限判断时那次没有必要的自由文本生成。它和传统监督分类模型也不完全相同。普通分类器通常先确定标签空间再利用一批有标签数据{(Xi,Yi)}i1N{(Xi​,Yi​)}i1N​训练一个任务专属模型。例如研究者先人工标注几千份年报再训练「悲观 / 中性 / 乐观」分类器。只要任务长期不变这种方案可以很快、很便宜也很容易做样本内外验证。但任务一旦变化原来的标签和训练数据未必还能继续使用。Jev 的问题和答案是在调用阶段定义的。今天可以判断管理层态度明天改成融资约束后天又按照另一套 codebook 判断供应链风险不需要为每套标签重新训练模型。不过这种「没有任务专属训练样本也能处理新标签」的能力并不是 Jev 才开始出现。Yin, Hay, and Roth (2019) 已经系统讨论 zero-shot text classification并把不同领域、不同含义的未见类别统一到自然语言推断框架中。所以与其把 Jev 描述成一种全新的分类思想不如把它放在三类工具之间理解。传统分类器适合任务固定、训练数据充分的场景生成式 LLM 适合任务灵活而且需要复杂推理、解释或生成内容的场景Jev 主要瞄准的是任务可以动态定义但最终只需要有限判断的场景。TypeSafe 还声称 Jev 使用了新的模型架构、parallel sampler以及一种名为Reinforcement Learning for Calibrated Decisions (RLCD)的训练方法。官方发布材料明确作出了这些主张但截至 2026 年 9 月 28 日尚未公开足够完整的架构和训练细节供外部独立复现因此本文不据此判断 Jev 是否已经形成一种新的基础模型架构。TypeSafe 宣传中的Zero Hallucinations更准确地说是类型层面的结构保证Jev 不会输出 schema 之外的答案但仍然可能把文本判断错。因此答案一定合法不等于答案一定正确。温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。
返回列表