Три новых патента покрывают прогнозирование движений глаз при чтении на 13 языках, оценку качества таких моделей и способ ускорять обучение языковых алгоритмов. Об этом сообщает «Хайтек».
Исследователи получили патент на систему прогнозирования взгляда человека при чтении текста. Она предсказывает, как человек будет читать текст на английском, корейском, немецком и ещё десяти языках. В основе лежит одна нейросетевая архитектура, которая объединяет многоязычную модель и трансформер, обученный на записях движения глаз носителей разных языков. Система генерирует синтетические последовательности фиксаций взгляда и оценивает их по вероятности пропуска слов, количеству фиксаций при первом чтении и другим критериям.
Руководитель Лаборатории ИИ в медицине Университета Иннополис Илья Першин пояснил, что синтетические данные часто остаются единственным выходом при нехватке реальных записей айтрекинга. Они удешевляют обучение и делают возможным то, что раньше казалось невозможным. В одном из исследований такой подход помог на 20–30 процентов точнее предсказывать взгляд врача на рентгеновских снимках.
Второй патент связан с оценкой генерации движения глаз при чтении текстов. Раньше не было единого протокола. Новый подход сравнивает траектории взгляда по пространственным и временным характеристикам, оценивает признаки движений на уровне всего текста, отдельных слов и предложений. Также анализируется, как длина и частота слов влияют на взгляд, и проверяется работа моделей на текстах, которых не было в обучающей выборке.
Третий патент на способ обучения языковых моделей с синтетическими траекториями взгляда интегрирует данные о зрительном внимании в обучение с подкреплением на основе обратной связи от человека. Он встраивает данные о зрительном внимании в обучение с подкреплением на основе обратной связи от человека. Специалист лаборатории Иван Стебаков объяснил: на реальных предпочтениях людей учат вспомогательную ИИ-модель, которая затем автоматически оценивает ответы большой языковой модели. Технология ускоряет обучение в полтора-два раза, снижает затраты на вычисления, воспроизводит паттерны внимания человека с точностью до 93 процентов и работает даже для языков с малым объёмом данных.
Обложка: magnific