What is Adversarial Robustness

Definition

Adversarial robustness is a model's ability to resist adversarial attacks, inputs deliberately crafted with subtle perturbations to fool it, maintaining correct behaviour even when attackers try to manipulate its predictions through carefully designed malicious inputs.
« Back to Glossary Index
  • Hardens models against deliberately crafted deceptive inputs
  • Protects high-stakes systems from manipulation and evasion
  • Improves reliability under worst-case, not just typical, inputs
  • Reduces security risk in AI-driven decisions

Real World Example

A security team tests its image-classifier with adversarial examples, finding that tiny pixel changes could make it misread a stop sign, then improves adversarial robustness through adversarial training before deployment.

FAQs

What is an adversarial attack?

It is a deliberately crafted input with subtle changes designed to make a model produce an incorrect or attacker-chosen output.

How is adversarial robustness improved?

Through adversarial training, input sanitisation, and defensive techniques that make models resilient to crafted perturbations.

Why does adversarial robustness matter?

In security-sensitive uses, attackers may exploit model weaknesses, so resisting manipulation is essential for trust and safety.

Hello popup window