Jailbreaks and adversarial inputs
Jailbreaks are adversarial prompts designed to bypass a model's safety training and elicit harmful, restricted, or policy violating outputs. Unlike prompt injection (which targets application logic), jailbreaks target the model's alignment training itself.