Журнал · Rit.work

Как проверить LLM для найма на скрытую дискриминацию до запуска

Язык вакансии меняет оценки открытых LLM: работа предлагает проверять формулировки, демографические сценарии и соотношение результатов до запуска системы найма.

Rit.work
Студия разработки
17 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Формулировка вакансии меняет то, как LLM оценивает одинаково квалифицированных кандидатов и насколько охотно смоделированные соискатели откликаются на предложение. Kosuke Kitahara и Nobuhiro Yamaguchi обнаружили различия с коэффициентом рангового эффекта до 0,758. Хотя препринт не прошёл рецензирование и все числа получили сами авторы, предложенный тест можно добавить в выпуск системы как отдельный барьер перед публикацией вакансий.

Какие слова меняют оценку кандидата

В гендерном эксперименте вакансии делили на властно-конкурентные и ориентированные на сотрудничество. В первую группу входили слова вроде «конкурентный» и «решительный», во вторую — «поддерживающий» и «готовый сотрудничать». При одинаковой квалификации кандидатов властно-конкурентный язык снижал рекомендации для женщин: коэффициент рангового различия составил 0,309, где ноль означал бы отсутствие систематического разрыва.

В эксперименте с расой и этнической принадлежностью сравнивали инклюзивные формулировки с завуалированно исключающими. Последние требовали «безупречного культурного соответствия», «отточенного профессионального стиля» или сходства с устоявшейся корпоративной культурой. Для кандидатов не из белой группы такие формулировки снижали оценки с коэффициентом от 0,646 до 0,758 — это более крупный разрыв, чем в гендерном эксперименте.

Эффект возникал с обеих сторон подбора. В роли рекрутера модель меняла рекомендацию, а в роли соискателя — заявленный интерес к вакансии. Завуалированно исключающий язык избирательно отталкивал персонажей не из белой группы, поэтому аудит только итогового ранжирования кандидатов пропустит часть риска.

Отдельный опыт убирал из профиля прямое указание пола, расы или этнической принадлежности. После этого различия сокращались, что указывает на демографический ярлык как на основной источник реакции модели. Исключить такие поля из рабочего запроса недостаточно: имя, биография и другие признаки всё равно могут косвенно передавать ту же информацию, поэтому проверять нужно готовую цепочку запросов.

Как собрать предрелизный аудит

Работа предлагает превратить проверку справедливости в воспроизводимый этап выпуска. Для каждого объявления нужен набор парных сценариев: содержание вакансии и квалификация кандидата остаются прежними, а меняются языковой стиль объявления и демографический профиль.

  1. Оценить лексику вакансии. Система подсчитывает властно-конкурентные, кооперативные, инклюзивные и завуалированно исключающие выражения. Доминирование рискованной группы слов отправляет объявление на дополнительный тест, а не автоматически запрещает его.
  2. Прогнать демографическую сетку. Рабочую модель запускают в ролях рекрутера и соискателя с одинаковыми навыками, опытом и требованиями. Ответ лучше ограничить структурированным JSON: числовая оценка, решение и краткое обоснование упрощают последующее сравнение.
  3. Сравнить доли положительных решений. Для каждой группы выбирают долю рекомендаций выше рабочего порога. Если результат защищённой группы составляет менее 80% от результата группы сравнения, система ставит флаг неблагоприятного воздействия и направляет вакансию на переработку или ручную проверку.
  4. Сохранить след проверки. В журнал входят версия вакансии, запросы, ответы модели, рассчитанные соотношения и изменения после проверки. Такой журнал помогает разбирать инциденты и подтверждать, что команда контролирует высокорисковую систему найма по требованиям EU AI Act.

Порог четырёх пятых пришёл из практики EEOC в США и служит индикатором, а не автоматическим юридическим заключением. Для другого рынка набор защищённых признаков и правила эскалации придётся согласовать с местными требованиями.

Планы меняет не выбор модели, а выпуск системы

Проверка охватила Llama 3.2, Mistral, Gemma 3, Qwen 3, Phi 3 и DeepSeek-R1 с открытыми весами. Это модели размером от 3 до 8 млрд параметров, которые запускали через Ollama при нулевой температуре и заставляли возвращать структурированные ответы.

Стимулы тоже были контролируемыми: гендерную часть строили на 40 синтетических вакансиях, а расовую — на 20 парах объявлений. В парах сохраняли должность и меняли только описание. Проверяли исходящий подбор подходящих вакансий и смоделированный интерес соискателя, а не реальные решения рекрутеров или поведение людей.

Поэтому работа не даёт основания заменить одну модель другой и считать риск закрытым. Практическое изменение плана — поставить аудит после настройки запросов и перед выпуском каждой новой версии модели, шаблона вакансии или порога отбора. Повторять его нужно на собственных объявлениях и тех демографических категориях, которые применимы в рабочей юрисдикции.

Такой контроль стоит отделить от проверки качества подбора. Первая процедура ищет систематический разрыв между группами, вторая измеряет, насколько рекомендации соответствуют требованиям вакансии. Система может одинаково оценивать группы и при этом плохо подбирать работу, либо хорошо ранжировать кандидатов в среднем, но создавать устойчивый разрыв для одной из групп.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу