Исследователи из ETRI, POSTECH и Университета Сонгюнгван разработали технологию MemEIC. Она позволяет мультимодальному ИИ запоминать новую информацию и не забывать старую. В тестах точность ответов выросла вдвое по сравнению с существующими методами. Об этом сообщает «Хайтек» со ссылкой на препринт на arXiv.
У современных мультимодальных моделей, которые работают и с картинками, и с текстом, есть серьёзный недостаток. Когда такую модель учат чему-то новому, она может забыть то, что знала раньше. Это называют катастрофическим забыванием. Особенно тяжело приходится, когда новые знания затрагивают и зрение, и язык одновременно. Информация смешивается, и ИИ начинает ошибаться.
Представьте, что модели сначала показывают фото десерта и говорят: «Это дубайское жевательное печенье». Потом добавляют: «Оно популярно в Корее». После этого спрашивают: «В какой стране популярен этот десерт?» Обычные модели часто галлюцинируют. Например, утверждают, что на фото шоколадный трюфель и что он популярен в Европе.
Авторы MemEIC подошли к проблеме иначе. Раньше знания в модель вносили, напрямую меняя её внутренние параметры. Это напоминает операцию на мозге. Вместо этого исследователи создали внешнюю память. Новые сведения хранятся отдельно и подключаются только тогда, когда нужны. Сама модель остаётся нетронутой.
Структуру подсмотрели у человеческого мозга. Зрительная информация хранится в одном адаптере, языковая — в другом. Когда приходит вопрос, требующий понимания и картинки, и текста, специальный соединитель связывает два хранилища и выдаёт ответ.
Систему проверили на бенчмарке из 1278 вопросов. В модель последовательно загружали сотни новых фактов и смотрели, как она справляется со сложными вопросами, где нужно объединить визуальные и текстовые данные. MemEIC дала около 70 процентов точных ответов. Существующие технологии держались в коридоре от 36 до 52 процентов. Рост более чем вдвое.
Кроме того, подтвердилась локальность. Это когда ответы на старые вопросы не меняются после добавления новых знаний.
Разработка важна тем, что решает сразу две задачи: непрерывное обновление знаний и способность собирать ответ из разных источников. Технология пригодится там, где информация постоянно обновляется: законы, каталоги товаров, промышленные данные. Исследователи планируют дорабатывать систему, чтобы она надёжно работала с реальными данными с производственных площадок.
Обложка: magnific