«Казнить нельзя помиловать»: запятые и точки влияют на точность работы ИИ

Исследователи из Института AIRI выяснили, что отсутствие знаков препинания и артиклей в запросах к языковым моделям может снижать точность их работы — вплоть до 20%. Об исследовании «Хайтеку» сообщили в пресс-службе организации.

Ученые установили, что элементы языка, которые часто воспринимаются как малозначимые — знаки препинания и артикли — на самом деле играют важную роль в понимании искусственными интеллектом текстов. Анализ показал: именно в этих «незаметных» деталях содержится критически важная информация для корректной интерпретации контекста.

Специалисты разработали методику, которая позволяет отслеживать, какие данные сохраняются в связке с конкретными токенами. Это минимальные элементы текста, на которых основана работа языковых моделей. Первый эксперимент заключался в обучении модели восстанавливать исходный текст по последовательности токенов, включая знаки препинания и стоп-слова. Неожиданно оказалось, что именно стоп-слова, обычно считающиеся неинформативными, несли наибольшую нагрузку для понимания контекста.

Затем исследователи провели дополнительные тесты на стандартных наборах задач MMLU и BABILong. Из текстов намеренно удалялись «малозначимые», с точки зрения логики, элементы. Чтобы уточнить, что можно убрать без потери смысла для человека, ученые задали этот вопрос языковым моделям — включая ChatGPT.

Результаты подтвердили гипотезу: при исключении из формулировок даже, казалось бы, несущественных символов, точность выполнения задач снижалась — в некоторых случаях до 20%.

Изучение принципов действия языковых моделей – одна из главных задач нашей научной группы. Мы работаем над этим уже два года. Глубокое понимание того, как модели принимают решения, поможет сделать их не только эффективнее, но и безопаснее.

Антон Разжигаев, руководитель группы «Интерпретируемый ИИ» лаборатории FusionBrain Института AIRI

Исследователи опубликовали код для анализа работы языковых моделей по ссылке.


Читать далее:

Ученые в тупике: «Уэбб» засек невозможный свет в галактике

Вселенная внутри черной дыры: наблюдения «Уэбба» подтверждают странную гипотезу

Миллионы «невидимых» людей: ученые нашли ошибку в оценке населения Земли

На обложке: Изображение от jcomp на Freepik, сведения о лицензии

Подписывайтесь
на наши каналы в Telegram

«Хайтек»новостионлайн

«Хайтек»Dailyновости 3 раза в день

Первая полоса
ИИ ускорил поиск дефектов трубопроводов в 30 раз
Новости
Под пирамидами Гизы нашли «скрытый город», но с учеными согласны не все
Наука
В Земле нашли «червоточину»: что происходит с литосферой
Наука
Появились новые фото угрожающего Земле астероида
Космос
Российский ИТ-рынок замедляется: почему это происходит и что дальше
Новости
«Яндекс» запустил конкурента Google и ChatGPT: чем отличается и как работает
Новости
Трагедию с Xiaomi на автопилоте начали расследовать в Китае
Новости
Посмотрите, как выглядит самый быстрый пассажирский самолет в мире
Новости
Странная форма материи меняет планеты: как она повлияет на Землю
Космос
Новые фотодиоды в 10 раз чувствительнее аналогов: они пригодятся в медицине
Наука
В России создадут региональный совет по дронам: зачем он нужен
Новости
Государство компенсирует бизнесу 20% затрат на роботов: как работает система
Новости
Разработан маршрутизатор для фотонов: он объединит квантовые компьютеры в единую сеть
Наука
ИИ обнаружил два новых гена, которые влияют на риск ишемического инсульта
Наука
Создание изображений в стиле Ghibli привело к рекордной нагрузке на ChatGPT
Новости
Физики МГУ оценили потенциал фотонных процессоров для нейросетей
Новости
Телескоп НАСА для изучения ранней Вселенной сделал первые снимки
Космос
Путин подписал закон против кибермошенничества: что изменится для россиян
Новости
Генератор изображений OpenAI теперь доступен бесплатно, но с ограничениями  
Новости
Apple готовит iOS 19: какие iPhone не получится обновить  
Новости