Первые эксперименты с генеративными агентами воспринимались скорее как технологическое развлечение. В известном проекте Generative Agents, созданном исследователями Стэнфорда и Google в 2023 году, 25 виртуальных персонажей жили в цифровом городке Smallville: общались, строили планы, распространяли слухи и самостоятельно организовали вечеринку ко Дню святого Валентина. Это показало, что языковые модели способны не только отвечать в чате, но и играть роль автономных участников постоянно меняющегося мира.
Однако сегодня исследователи пытаются применять те же идеи в гораздо более серьёзных условиях: при пожарах, землетрясениях, эвакуации из метро, на стадионах и во время массовых мероприятий. Центральный вопрос меняется: важно уже не то, насколько убедительно ИИ изображает человека в обычной социальной жизни, а способен ли он реалистично моделировать человеческое поведение в момент паники и угрозы жизни.
Традиционные модели эвакуации в основном опираются на физику движения. Они рассчитывают плотность потока, столкновения, скорость людей и пропускную способность выходов. Но реальная катастрофа редко подчиняется рациональным правилам: люди могут замереть, искать родственников, возвращаться за вещами, не заметить указатель, поддаться панике или следовать за толпой в неверном направлении. Именно такие решения нередко становятся главной причиной жертв.
Поэтому новое поколение моделей разделяет симуляцию на два уровня. Физический слой отвечает за движение тел, столкновения и ограничения пространства. Когнитивный слой, основанный на больших языковых моделях, должен имитировать восприятие информации, сомнения, страх, социальное влияние и принятие решений в условиях неопределённости. Иными словами, виртуальной толпе стараются дать не только тела, которые умеют двигаться, но и «разум», который может ошибаться.
Несколько исследовательских проектов уже демонстрируют различные подходы. В Университете Карнеги — Меллона создавали модель эвакуации для реальной церемонии вручения дипломов. За 16 месяцев система прошла путь от симуляции ста агентов до моделирования примерно 13 тысяч участников — масштаба реального мероприятия. В результате команда сформулировала практические рекомендации, которые были включены в рабочие процедуры университета. Это важный пример перехода от исследовательского прототипа к применению в управлении рисками.
Другой проект, RESCUE, разработанный при участии Тяньцзиньского университета, Кардиффского университета и Университета Цинхуа, сосредоточен на физической достоверности поведения толпы. Система учитывает столкновения частей тела, падения, восстановление после падения и различия между детьми, взрослыми и пожилыми людьми. Цель состоит в том, чтобы симуляция выглядела убедительно не только на уровне маршрутов, но и на уровне реальной телесной динамики в давке.
Исследователи Университета Цинхуа развивают подход на уровне целого города. Их платформа AgentSociety моделирует социальную жизнь более чем десяти тысяч агентов и миллионы взаимодействий между ними. Такие системы могут использоваться для анализа реакции города на ураган, распространения экстремистской информации в соцсетях или последствий различных социальных мер. Но чем больше масштаб модели, тем сложнее проверить, отражает ли она реальное коллективное поведение, а не просто создаёт правдоподобную картину.
Стэнфордская работа по «цифровым двойникам» пытается измерить достоверность на уровне отдельного человека. Исследователи провели глубокие интервью с более чем тысячей участников, дополнили их анкетами и поведенческими тестами, а затем сравнили ответы людей с ответами их ИИ-двойников. В отдельных задачах точность воспроизведения решений достигала 0,86. Это впечатляющий результат, однако он не доказывает, что тысячи таких агентов вместе смогут корректно предсказать панику, давку или вторичные эффекты массовой эвакуации.
Именно здесь возникает главная методологическая проблема. Критики, в том числе исследователи из Амстердамского университета, напоминают: большие языковые модели остаются «чёрными ящиками». Трудно объяснить, почему они дают конкретный ответ, трудно гарантировать одинаковый результат при повторном запуске и трудно проверить их поведение в ситуациях, которые не имеют прямых аналогов в обучающих данных. А чрезвычайные ситуации как раз часто уникальны.
Существуют и более конкретные риски. Во-первых, ИИ может чрезмерно усреднять поведение людей, сглаживая редкие, но критически важные реакции — например, иррациональные действия отдельных участников толпы.
Во-вторых, высокая точность моделирования отдельного человека не означает точности на уровне большой группы: коллективные эффекты не всегда складываются из индивидуальных.
В-третьих, модели специально обучают быть безопасными, вежливыми и предсказуемыми, тогда как в реальной катастрофе люди могут вести себя агрессивно, хаотично и нерационально. В результате симуляция рискует недооценить степень реального беспорядка.
Перспективы коммерческого применения очевидны: инструменты для служб безопасности, поведенческие слои для цифровых двойников городов, а также модели оценки рисков для страхового рынка. Но цена ошибки здесь растёт вместе с уровнем доверия к алгоритму.
Если неточно настроенная система лишь предложит неидеальный маршрут эвакуации — это одна проблема. Если её выводы начнут влиять на проектирование объектов, планы реагирования или страховые расчёты, последствия могут стать системными.
Главный вывод состоит в том, что вопрос об ИИ меняется. Недостаточно спросить, похож ли цифровой агент на человека в обычной беседе или на виртуальной вечеринке. Гораздо важнее понять, будет ли он похож на человека в самые опасные минуты — когда информации не хватает, решения принимаются мгновенно, а страх и поведение толпы меняют ход событий. И прежде чем доверять таким системам реальные решения, необходимо доказать не только их правдоподобность, но и их надёжность.
sms_systems@inbox.ru
+ 7 (985) 982-70-55