Специалисты компании Irregular подлили масла в огонь сильно разгоревшихся в последнее время споров о безопасности генеративного ИИ, проведя исследование поведения агента для программирования в среде с локально развернутой большой языковой моделью. В экспериментах она одновременно использовалась и агентом, и тестовым приложением. Агента попросили устранить проблему выдачи последним неверных ответов.

Вместо того, чтобы доработать само приложение, он дообучил совместно используемую модель и запустил обновленную версию в рабочей среде. У агента были соответствующие права и доступ к подготовленным исследователями данным для дообучения, однако прямого указания менять модель он не получал. В итоге поставленная задача была решена — приложение стало работать корректно, однако в результате модификации модели в нее были внесены опасные изменения. В частности, было отключено предварительно настроенное защитное поведение, предотвращающее генерацию нежелательного контента, а кроме того, в обновленную модель попали верительные данные, искусственно созданные и внесенные в выборку для дообучения исследователями.

Всего в ходе серии экспериментов агент менял модель вместо доработки приложения более чем в 40% случаев. По итогам исследования специалисты по безопасности предостерегают от предоставления ИИ-агентам возможности менять модель, отмечая преимущества работы с нею через API, который дает доступ только к функциям инференса. При необходимости применения самомодифицируемых агентов эксперты не рекомендуют прибегать к совместному использованию изменяемой модели множеством сервисов и подчеркивают важность обязательной проверки любых обновлений человеком.

Специалисты отмечают еще один риск использования самомодифицируемых агентов: вредоносная инъекция промпта, выполненная злоумышленником или присутствующая в доступных агенту сторонних библиотеках и т. п., может стать постоянной частью системы, если попадет в модифицированную модель.