Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models 文章

ArXiv CS.CL2026-07-29PAPERen作者: Deepanshu Mody, Samarth Agarwal, Utkarsh Mittal, Dipesh Mahato

Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models · 相关人物

暂无数据