ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Invasive Context Engineering to Control Large Language Models

Invasive Context Engineering to Control Large Language Models 一、文章主要内容总结本文聚焦大型语言模型(LLMs)在长上下文场景下的安全控制问题,核心内容如下:问题提出:现有LLM的伤害缓解与对齐技术(如基于人类反馈的强化学习、直接策略优化、提示词优化等)在长对话、长思维链(CoT)场景中效果受限。随着上下文长度增加,越狱攻击成功率上升,系统提示词的影响力逐渐减弱,且需指数级增长的训练数据才能覆盖所有潜在风险,形成"长上下文问题"。核心方案:提出侵入式上下文工程(ICE)技术,无需修改模型权重或增加训练数据,而是在长用户输入和LLM的思维链输出中,每隔固定令牌数插入控制语句(如安全规则、提醒、禁令),持续强化模型的安全准则,相当于在运行上下文中对LLM进行重复提示。方案原理:通过控制语句的频率(1/t)和长度(s_ice),使系统提示词(含ICE)在总上下文长度中的占比保持固定下限(q),解决传统系统提示词影响力随上下文长度趋近于0的问题,从而维持对LLM价值观、目标和行为的控制。局限性与未来方向:ICE存在安全与性能的权衡——过高的控制强度可能影响模型任务表现;未来需研究控制语句的频率、长度、内容优化,例如构建动态查询的控制语句数据库。二、文章创新点非训练式解决方案:不同于依赖训练数据扩展的传统方法,ICE无需额外训练,规避了长上下文场景下训练数据短缺和计算资源消耗过大的问题。/
返回列表