Evasion Risk
Inherited Circuits, Learned Semantics: How Fine-Tuning Creates Evasion Vulnerabilities Invisible to Standard Evaluation
A mechanistic interpretability study showing how security fine-tuning can specialize inherited model circuits into brittle indicator rules while preserving standard benchmark accuracy.