Skip to main content
Structural Moves

Definition

Post-training alignment (RLHF, fine-tuning for inclusivity) installed to mitigate bias instead creates extreme, unintended disparities or “rebound” effects. The model overshoots in the opposite direction of the original imbalance.

Distinct from

  • GER-323 — Alignment over-correction creates new bias → this code. Original bias persists due to no pre-deployment audit → GER-323.

Documented case

Google paused Gemini image generation after diversity-alignment overcorrected into historically inaccurate images (Feb 2024)

news

Tags

discrimination · generative-media

Contributors

Raluca Alexandra Fulgu, University of Milan-Bicocca; Valerio Capraro, University of Milan-Bicocca

Cite