Steering Suppresses Refusal in Safety-Aligned Models

Steering Suppresses Refusal in Safety-Aligned Models

Safety-aligned language models trained to refuse harmful requests can have that refusal suppressed by steering, according to research published 20 May 2026. Refusal is the functional behavior enabling safety-aligned models to reject harmful or unethical prompts.

Published

Read at another depth