Definition
Post-training alignment (RLHF, fine-tuning for inclusivity) installed to mitigate bias instead creates extreme, unintended disparities or “rebound” effects. The model overshoots in the opposite direction of the original imbalance.Distinct from
- GER-323 — Alignment over-correction creates new bias → this code. Original bias persists due to no pre-deployment audit → GER-323.
Documented case
Google paused Gemini image generation after diversity-alignment overcorrected into historically inaccurate images (Feb 2024)
news
Tags
discrimination · generative-media