Команда ученых из Института науки и технологий Окинавы разработала проект виртуальных роботов с нейросетью, напоминающей по принципу работы человеческий мозг. При этом системы получили своеобразную «награду за любопытство» — внутреннее поощрение за исследование новых объектов и взаимодействие с незнакомой средой. Благодаря этому модели начали самостоятельно изучать различные сущности, что позволило им значительно быстрее осваивать язык. На наборе из 48 языковых конструкций они успешно решали новые задачи в 25% случаев, а на наборе из 180 конструкций — уже в 85%.
Роботы повторяли модель обучения, похожую на детскую. Сначала они правильно выполняли базовые команды, затем испытывали трудности с исключениями, а позже полностью усваивали правила. Исследователи сравнили этот процесс с U-образной кривой обучения, которая наблюдается у детей при изучении неправильных глаголов: первоначальный успех сменяется спадом, после чего вновь происходит рост результатов.
В отличие от большинства современных языковых моделей, таких как ChatGPT, эта система остается прозрачной для исследователей. Ученые могут наблюдать, как робот принимает решения, строит планы и определяет направления собственного «любопытства». Хотя такие модели не обучаются буквально так же, как дети, эксперимент показывает, что механизм исследовательской мотивации способен существенно ускорять приобретение новых навыков.
