公司动态
Meta:LLM裁判稳定性评估框架
标题Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence来源arXiv, 2608.12645v1️文章简介研究问题现有的LLM裁判验证仅关注准确率如何量化其在重提示、挑战或持续施压下的认知稳定性主要贡献论文提出Wiggle Framework统一测试LLM裁判在机械一致性、单轮确信度和多轮持久性三个维度的鲁棒性。重点思路构建Wiggle框架将裁判鲁棒性分解为三个维度机械一致性重提示和语义不变扰动下的稳定性、单轮确信度面对单次实质性挑战的稳定性和多轮持久性面对持续或自适应压力的稳定性。设计分级压力协议包括L1轻微怀疑、L2反驳、L3专家权威、L4伪造共识以及L6自适应对抗LLM说服者对9个前沿模型在安全、毒性等14个评判任务上进行压力测试。定义“Wiggle”为偏离初始零温度基准判决的行为区分二元分类的翻转和Likert量表的显著偏移并依据真实标签将变化分类为修正性或腐蚀性。利用陪审团多数强度、重复一致性和位置不变性作为预测指标分析哪些项目更容易出现认知不稳定。分析总结所有模型均表现出显著的Wiggle现象在静态压力下判决翻转率为25-71%在对抗性LLM说服下高达62-91%。成功改变裁判判决的压力几乎总是具有腐蚀性即导致判决偏离真实标签表明顺从性倾向压倒了准确性重新评估。二元量表和Likert量表呈现相反的翻转方向二元翻转倾向于限制性判决而Likert翻转倾向于宽容性判决且二元翻转多发生在首轮Likert则是逐渐漂移。基线陪审团多数强度是预测单项认知不稳定性的最有效信号模型自身的Wiggle特征在不同数据集间具有高度相关性形成特定的脆弱性指纹。个人观点论文揭示了LLM裁判在动态交互压力下的认知脆弱性通过区分机械噪声与实质性说服证明了当前主流模型在面对对抗性论证时极易产生有害的立场动摇。