Собран набор данных, чтобы учить ИИ самостоятельно принимать решения

Опубликован крупнейший общедоступный набор данных для контекстного обучения с подкреплением, сообщает пресс-служба Института искусственного интеллекта AIRI.

Исследователи из российского Института искусственного интеллекта AIRI и лаборатории T-Bank AI Research опубликовали два общедоступных набора данных для контекстного обучения с подкреплением на основе среды XLand-MiniGrid. Упрощенная версия содержит чуть меньше 20 млрд кортежей — упорядоченных наборов данных фиксированной длины, полная — свыше 112 млрд.

Наборы данных валидировали с помощью графиков обучающих историй — траектории были естественным образом упорядочены по возрастанию суммарной награды за эпизод, сообщают разработчики. Они считают, что наборы помогут настраивать ИИ-системы для решения новых задач без вовлечения узкопрофильных специалистов, а также станут источником полезных синтетических данных.

Контекстное обучение с подкреплением (In-Context Reinforcement Learning) сфокусировано на создании моделей, которые хорошо работают не только на тренировочных задачах, но и способны максимально эффективно дообучаться за минимальное время. Например, большинство чат-ботов можно научить новой задаче, добавив в промпт некоторое количество примеров ее решения.

Такие методы подходят, чтобы обучать ИИ принимать решения, объясняют разработчики. ИИ-агент должен исследовать среду (exploration) и понять, какие действия ведут к хорошему исходу, а какие — к плохому. Затем он должен остановиться и перейти в фазу «эксплуатации хороших действий» (exploitation). Задача exploration — exploitation заключается в том, чтобы найти механизм обучения, который на горизонте N шагов обеспечивает наилучший результат за меньшее количество шагов.

В области контекстного обучения с подкреплением нет стандартизации, и авторы всех ранее существующих работ были вынуждены каждый раз собирать новый датасет с нуля, добавляют разработчики. Они полагают, что опубликованные наборы данных помогут демократизировать исследования, ускорят развитие этого направления обучения и масштабирование технологий.


Читать далее:

Посмотрите, как выглядит полярное сияние из космоса

Случайность спасла Землю от мощнейшей солнечной вспышки

Пациенту впервые пересадили титановое сердце на магнитной подвеске

На обложке: Изображение от freepik, сведения о лицензии

Подписывайтесь
на наши каналы в Telegram

«Хайтек»новостионлайн

«Хайтек»Dailyновости 3 раза в день

Первая полоса
Мошенники обманывают россиян через Telegram-ботов: какие сообщения они рассылают 
Новости
Оружие будущего скоро испытают в Японии: что это и как работает 
Новости
В такси будут только российские авто: Госдума приняла новый закон
Новости
Польша провела первый запуск суборбитальной ракеты: как прошли испытания
Новости
Этот символ блокирует сообщения в iOS: в чем причина сбоя
Новости
Посмотрите, что научился делать робот Tesla Optimus
Новости
Вирус-вымогатель впервые встроили прямо в процессор. Удалить его невозможно
Новости
В стерильных комнатах НАСА нашли 26 видов бактерий: они выживают в экстремальных условиях
Космос
Обсидиановые артефакты раскрыли огромную торговую сеть ацтеков
Наука
В России запустили отечественный ИИ-сервис для создания 3D-моделей
Новости
В подвале аргентинского суда нашли 80 коробок с нацистской пропагандой
Наука
НАСА озвучило «крик» умирающей звезды
Космос
Стартап запускает производство древесины, которая прочнее стали
Наука
Уборка перестает быть мучением: обзор моющего пылесоса Trouver X4 Pro
Кейсы
Посмотрите на парового робота, который ползает и цепляется за ветки
Новости
На Юпитере «моросит дождь» из частиц: «Уэбб» раскрыл детали полярных сияний газового гиганта
Космос
В Сколтехе создали «фонарик» для исследования сосудов изнутри
Наука
Большой взрыв мог быть менее «ярким»: другие источники света нашли на заре Вселенной
Космос
В доме в Помпеях нашли следы попытки жителей спастись от катастрофы
Наука
Простое решение заставляет рой роботов двигаться вместе без ИИ и датчиков
Новости