Attackers may use role-play, obfuscation, encoding, multi-turn pressure, or instruction conflicts. Defenses combine model training with input analysis, output checks, tool restrictions, and ongoing adversarial testing.
A jailbreak is an input or interaction strategy intended to make a model bypass its behavioral restrictions.
Attackers may use role-play, obfuscation, encoding, multi-turn pressure, or instruction conflicts. Defenses combine model training with input analysis, output checks, tool restrictions, and ongoing adversarial testing.