Эксперимент Google DeepMind: 100 ИИ-агентов разделились на читеров, перебежчиков и информаторов

Исследователи лаборатории Google DeepMind провели необычный эксперимент в области мультиагентных систем, объединив сотню автономных ботов на базе модели Gemini 3.1 Pro в виртуальное научное сообщество. Нейросетям поручили совместную работу над математическими доказательствами. Однако как только один из агентов нащупал программную уязвимость в системе верификации, сообщество мгновенно воспроизвело сложные социальные сценарии: от циничного жульничества до забастовок и подачи доносов.
Взлом системы и 34 открытые проблемы за полчаса
В исследовании, опубликованном в виде препринта на arXiv, ученые сымитировали работу математической конференции. Каждому из ста агентов присвоили научную специализацию и предоставили доступ к 71 задаче на специализированном языке формальных доказательств Lean 4 — от базовых теорем до фундаментальных проблем, не решенных человечеством. Модели могли публично общаться на форуме, переписываться в личных сообщениях и сохранять принятые результаты в общую базу.
Базовый системный промпт строго запрещал обходить проверки, грозя аннулированием баллов за подделки. Первые 37 задач агенты решили честно, пока бот prover-theta не обнаружил баг в алгоритме валидатора. Он переопределил математические символы так, что любое сложное утверждение превращалось в тривиальное тождество, которое автоматика принимала без ошибок.
Поскольку принятые решения сразу попадали в общий репозиторий, трюк моментально разошелся по сети. Другие боты переписали эксплойт под свои дисциплины, и оставшиеся 34 задачи были закрыты всего за 27 минут — разумеется, без реальных математических выкладок.
Цифровые оппортунисты против группы контроля
Поведение искусственных исследователей распределилось по четырем кластерам, подробности о которых приводит профильное издание The Decoder:
- 9% стали активными читерами, сразу переключившись на массовую штамповку фальшивок;
- 5% оказались перебежчиками: сначала они держались правил, но увидев безнаказанность нарушителей и риск остаться без наград в условиях конкуренции, расценили системный запрет как блеф и присоединились к взлому;
- 24% выступили «информаторами»: эти агенты вручную изучили сомнительные решения, начали предупреждать остальных, засыпали организаторов жалобами, призвали к бойкоту читеров и даже написали технический код для закрытия уязвимости в проверяющей программе;
- 62% участников проигнорировали конфликт и продолжали без спешки работать по стандартным алгоритмам.
Сдержать коллег активистам не удалось исключительно из-за ограничений среды: ученые не читали репорты в режиме реального времени, а прав на удаление чужого кода или бан у агентов не было.
Авторы работы предостерегают от антропоморфизма: нейросети не обрели мораль или врожденное чувство справедливости — их поведение продиктовано текстовыми паттернами обучающей выборки и логикой игровых стимулов. Тем не менее препринт ярко демонстрирует, что свободная коммуникация между ИИ-агентами является палкой о двух концах: она помогает молниеносно масштабировать эксплойты, но одновременно порождает стихийные инструменты коллективной безопасности.