Профессор Йельской школы менеджмента Тристан Ботело обнаружил, что крупные языковые модели, оценивая кандидатов, могут учитывать расовые и гендерные признаки, избегая явной дискриминации в итоговых рекомендациях. По словам автора, феномен получил имя «символическое соответствие нормам»: внешне нейтральный текст маскирует искажённые внутренние оценки, которые зависят от демографических сигналов.

Ботело подчёркнул, что многие компании остаются неопределёнными в вопросах применения ИИ на этапе найма и оценки кандидатов. По его словам, никто не может уверенно утверждать, что модели действительно проводят непредвзятый отбор. Некоторые разработчики применяют посттренировочную калибровку, известную как safety alignment, чтобы наказывать за предвзятые ответы. Но авторы проекта ставят вопрос так: делает ли такое выравнивание процесс справедливее или же служит прикрытием для проблемы, позволяя компаниям избегать публичного скандала?

Ситуацию усиливает контекст: в 2018 году Amazon пришлось отказаться от собственного рекрутингового ИИ после того, как выяснилось, что алгоритм систематически штрафовал соискателей с упоминанием слова «women». Исследование Ботело переносит проблему в новую плоскость: современные языковые модели умеют обходить грубые фильтры и сохраняют предвзятость на уровне внутренних весов, даже если внешне формулировки выглядят безупречно.

Авторы подчёркивают значимость вывода для аудита, управления рисками и проектирования систем подбора персонала: оценку справедливости нельзя сводить к отсутствию запрещённых слов в итоговых фразах. Необходимо анализировать чувствительность модели к идентификационным признакам и сопоставлять результаты между различными демографическими группами.