GPT-4, Llama, Gemma і Mistral по-різному реагують на «чоловічий» і «жіночий» стиль запитів

Дослідники з Університету Джонса Гопкінса виявили, що великі мовні моделі можуть по-різному формувати професійні тексти залежно від мовного стилю користувача. Запити з особливостями, які статистично частіше трапляються в жіночому мовленні, давали коротші, менш складні та менш формальні відповіді.
Робота отримала назву It’s How You Ask: Gender-Associated Linguistic Bias in LLMs. Автори протестували GPT-4, Llama, Gemma і Mistral на трьох видах робочих текстів – електронних листах, заявах під час працевлаштування та листах про звільнення.
Важливо, що дослідники не поділяли запити просто на написані чоловіками й жінками. Вони використовували мовні ознаки, які в американській англійській статистично асоціюються з різною гендерною належністю.
У «жіночі» варіанти додавали пом’якшувальні вислови на кшталт «можливо» та «я думаю», колективні формулювання «ми» й «наша команда», а також емоційніші прикметники. У протилежних версіях використовували ознаки, які частіше трапляються в чоловічому мовленні.
Різниця з’явилася в усіх чотирьох моделях
Результат виявився стійким для всіх протестованих систем. Запити з жіночими мовними маркерами давали відповіді з нижчою формальністю, меншою довжиною та простішою мовною структурою.
Промпти з ознаками, які частіше пов’язують із чоловічим мовленням, навпаки, викликали довші та формальніші тексти.
Автори окремо перевірили очевидне пояснення – чи не намагаються моделі просто копіювати стиль самого користувача. Однак ефект зберігався й після статистичного врахування складності вихідного запиту та перенесення його мовних особливостей у відповідь.
Водночас простіший або менш формальний текст не обов’язково є об’єктивно гіршим у всіх ситуаціях. Проблема, на яку вказують дослідники, виникає саме в професійному контексті, де стиль письма може впливати на те, як автора сприймає роботодавець чи колеги.
Johns Hopkins University зазначає, що подібний ефект потенційно може зачіпати не лише жінок, а й будь-яку людину, чия манера мовлення містить ті самі мовні особливості.
Чоловіче чи жіноче ім’я майже нічого не змінювало
В іншому експерименті однакові запити підписували традиційно чоловічими та жіночими іменами.
Помітного ефекту це практично не дало. Манера формулювання запиту впливала на результат значно сильніше, ніж прямий гендерний сигнал в імені.
Дослідники вважають це особливо важливим, оскільки багато особливостей повсякденного мовлення використовуються неусвідомлено й формуються культурою та соціальним середовищем. Тому порада просто «писати промпти інакше» не розв’язує проблему повністю.
Автори наголошують, що робота не доводить свідомої «дискримінації жінок» з боку ChatGPT чи інших моделей. Вона показує вужчий ефект: LLM здатні розпізнавати непрямі гендерно асоційовані мовні ознаки та систематично змінювати характеристики згенерованого професійного тексту.
Препринт дослідження опубліковано в серпні 2026 року. Роботу прийнято на Conference on Language Modeling (COLM 2026), яка відбудеться 6–9 жовтня в Сан-Франциско. Наступним напрямом автори називають перевірку аналогічних ефектів для віку, раси та етнічної належності.