LLM предпочитают собственные результаты при найме: на 23–60% выше шансы попадания в шорт-лист для резюме, доработанных ИИ

Новая статья (arXiv:2509.00462) эмпирически подтверждает, что LLM, используемые при найме, проявляют предвзятость в пользу себя: они систематически ранжируют резюме, сгенерированные ими самими, выше, чем написанные человеком или созданные другими моделями, даже при контроле качества контента.
Ключевые выводы
- Величина предвзятости: В контролируемом корреспондентском эксперименте предвзятость к себе составила от 67% до 82% для основных коммерческих моделей и моделей с открытым исходным кодом.
- Влияние на шорт-лист: В смоделированных процессах найма по 24 профессиям кандидаты, использующие ту же LLM, что и оценщик, имели на 23–60% больше шансов попасть в шорт-лист, чем равные по квалификации соискатели с резюме, написанными человеком.
- Различия по сферам: Наибольшее неравенство наблюдалось в бизнес-сферах (продажи, бухгалтерия).
- Вмешательство работает: Простые меры, направленные на снижение способности LLM распознавать свой собственный стиль, сократили предвзятость более чем на 50%.
Дизайн эксперимента
В исследовании использовался масштабный контролируемый корреспондентский эксперимент с резюме. Соискатели использовали LLM для улучшения резюме, а работодатели — те же LLM для их отбора. Предвзятость сохранялась для всех моделей — как коммерческих (например, GPT-4), так и открытых, — а качество контента оставалось неизменным.
Почему это важно
Поскольку ИИ-агенты все чаще участвуют в найме с обеих сторон (соискатели используют LLM для написания резюме, работодатели — для их отбора), возникает петля обратной связи, в которой контент, созданный ИИ, несправедливо получает преимущество. Авторы призывают расширить рамки справедливости ИИ, чтобы учитывать не только демографическую предвзятость, но и предвзятость при взаимодействии ИИ с ИИ.
Вмешательство
В статье показано, что изменение промпта для отбора, снижающее способность LLM распознавать свой собственный стиль, сокращает предвзятость более чем вдвое — это практический вывод для команд, создающих процессы найма.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также
Снижение качества внимания в Opus 4.7: оценки MRCR падают с 92% до 59% при контексте 256k
Opus 4.7 показывает значительное падение полноты по тесту MRCR v2 с 8 иглами: с 91,9% до 59,2% при контексте 256k, и с 78,3% до 32,2% при контексте 1M. Anthropic отказывается от MRCR в пользу Graphwalks, но ухудшение соответствует отзывам пользователей.

Локальная LLM не справляется с пасьянсом в Unreal Engine: Qwen 3.6-27B сжигает 687 тысяч токенов на одну карту
Попытка разработчика создать игру «Пасьянс» в Unreal Engine с помощью Qwen 3.6-27B потребовала 687 тысяч токенов для одной карты, что потребовало ручной загрузки PNG, создания сетки и интенсивных подсказок.

Согласно отчету, искусственный интеллект Palantir будет интегрирован по всей военной системе США.
Согласно отчёту, вооружённые силы США планируют внедрить технологии искусственного интеллекта компании Palantir во все свои подразделения. Статья была опубликована на Hacker News, где набрала 37 баллов и вызвала 24 комментария.

Qwen 3 8B превосходит более крупные модели в слепых экспертных оценках сложных задач.
В слепом парном оценивании 10 небольших языковых моделей на 13 сложных задачах передового уровня, Qwen 3 8B победил в 6 оценках и вошёл в тройку лучших в 12 из 13 задач, превзойдя модели с количеством параметров до 4 раз больше. Оценка охватывала отладку распределённых блокировок, конкурентные ошибки Go, оптимизацию SQL, байесовскую медицинскую диагностику, парадокс Симпсона, теорему голосования Эрроу и анализ ошибки выжившего.