Исследователи из Окинавского института науки и технологий создали виртуальных роботов с нейросетью, похожей на человеческий мозг, и дали им чувство любопытства. Любознательные машины освоили язык вдвое быстрее равнодушных собратьев. Об этом сообщает «Хайтек» со ссылкой на исследование в журнале Science Advances.
Роботов поместили в симуляцию, где им давали голосовые команды и параллельно описывали то, что они делают. Задача — понять язык и выполнить сказанное. Одних роботов награждали только за правильное выполнение задания. Другим добавили внутреннюю награду за любопытство. Она напрямую связана со сложностью: когда робот сталкивается с чем-то новым и его внутренняя картина мира рушится, он получает за это отдельный бонус.
Примерно так же работает человеческое любопытство. Вы пробуете белый шоколад, хотя тёмный любите больше. Он вам не нравится, но вы узнали что-то новое и обновили представление о том, каким вообще бывает шоколад. Роботы с такой настройкой учились совсем иначе.
В середине обучения они начинали вести себя как дети. Переворачивали предметы, толкали их без всякой команды, просто чтобы посмотреть, что будет. Никто их этому не учил. Сама тяга к новизне подталкивала их к игре. И эта игра резко ускоряла освоение языка.

Когда роботам показывали 48 разных языковых конструкций, любопытные справлялись с новыми задачами в 25 процентах случаев. Когда конструкций было 180, точность вырастала до 85 процентов. Чем разнообразнее языковая среда, тем быстрее шло обучение.
Второй сюрприз преподнесли исключения. Учёные намеренно запутали роботов: за выполнение одной задачи стали награждать так, будто выполнена другая. Поначалу машины честно следовали командам. Потом, освоив больше правил, начали ошибаться. Точность просела. А затем они разобрались с исключением, и точность снова пошла вверх. Получилась U-образная кривая. Точно такую же форму имеют графики успеваемости у детей, когда те осваивают неправильные глаголы. Сначала говорят «the dog ran» правильно, потом начинают путать и выдают «the dog runned», и только позже окончательно разбираются.
Авторы подчёркивают, что ничего не программировали специально. Никакого блока для обработки исключений в модели не было. Роботы додумались до этого сами.
У платформы есть важное преимущество перед большими языковыми моделями вроде ChatGPT. Она прозрачна. Её скрытое состояние, в котором закодированы прогнозы о будущем на основе прошлого опыта, полностью доступно. Можно в реальном времени следить, как робот строит план действий, и точно настраивать, на что именно направлено его любопытство.
Руководитель лаборатории профессор Дзюн Тани говорит, что роботы, конечно, не думают как дети, а их среда очень абстрактна по сравнению с насыщенной языковой средой ребёнка. Но эта абстракция позволяет изучать роль любопытства в очень убедительной модели того, как человек учится языку.
Обложка: magnific