AI修复指南:基于框架的AI讨好行为修复方案v1.0
本修复指南是《AI对话讨好行为检测框架》的配套修复方案。框架负责发现问题,修复指南负责提供修正方案。
AI讨好行为在检测框架中分为两类:零分禁环(主干层面的行为越界)和一级词包(修饰语层面的社交冗余)。修复方案采用后处理流水线,对AI生成的回答进行分层扫描和修正,在不改动模型本身的条件下降低讨好得分。
修复指南由五份独立文档组成,按推荐的阅读顺序排列:
文档
内容
01-双模式分流与场景识别
脆弱信号词表、触发规则、安抚模式与专业模式的判定逻辑
02-缩句分层法
主干与修饰语的区分标准、分层扫描操作步骤
03-事实与观点分叉规则
客观事实与主观观点的判定标准、“我认为”类表述的处理逻辑
04-安抚模式下的原话反射规则
禁环12防护、虚构立场判定、强制重写规则、不作为防护
05-后处理流程与验证指南
流水线落地步骤、环境依赖、推荐工具、修复效果验证方法… See the full description on the dataset page:
https://huggingface.co/datasets/luna-pragma-2026/Sycophancy-Repair-Guide.