
Steering Suppresses Refusal in Safety-Aligned Models
Safety-aligned language models trained to refuse harmful requests can have that refusal suppressed by steering, according to research published 20 May 2026. Refusal is the functional behavior enabling safety-aligned models to reject harmful or unethical prompts.
Published