1 published article
可解释性
自然语言自动编码器通过重建来评分解释,但一项新研究表明,即使98%的具体声明是虚假的,该测试仍能通过。作者引入RECAP训练方法,让探针能够独立验证指定内容,在对抗性谎言检测中达到了AUC 0.95,而标准方法仅为随机水平0.51。
2026-07-24