Домой ИИ и технологии Физики Гарварда вывели формулу интеллекта нейросетей

Физики Гарварда вывели формулу интеллекта нейросетей

Масштабирование ИИ подчиняется законам статистической механики: почему «раздувание» моделей теряет эффективность.

Группа физиков-теоретиков из Гарварда представила исследование, объясняющее математическую природу успеха современных нейросетей. Ученые доказали, что эффективность ИИ подчиняется строгим физическим законам, а не является результатом случайных экспериментов. Эта работа позволяет перейти от эмпирических догадок к точному моделированию процессов машинного обучения.

Физика в основе нейросетей

Успех современных моделей при увеличении объемов данных и количества параметров объясняется принципами статистической механики. Используя аппарат теории случайных матриц, исследователи вывели аналитические формулы для «законов масштабирования» (scaling laws), которые позволяют инженерам прогнозировать способности нейросетей еще до начала их обучения.

Центральной концепцией исследования стала перенормировка, заимствованная из квантовой теории поля. Физики обнаружили, что статистический шум в обучающих данных ведет себя как квантовые флуктуации: он «перенормирует» параметры модели. Даже в архитектурах без явных ограничений, шум индуцирует регуляризацию, обеспечивая стабильность системы в режимах перепараметризации.

Математический «чит-код»

Для упрощения вычислений ученые применили S-преобразование из свободной теории вероятностей. Этот инструмент заменил трудоемкие методы вроде «метода реплик» элегантными алгебраическими уравнениями. С его помощью авторы научились связывать ошибку обучения с ошибкой теста (train-test gap), что позволяет оценивать качество ИИ без проведения дорогостоящих испытаний на гигантских выборках.

Исследование четко определяет факторы, от которых зависит скорость обучения: показатель степени в законах масштабирования напрямую определяется структурой данных и сложностью задачи. Физики выделили четыре режима работы нейросетей — от доминирования сигнала до ограничения шумом.

Физики Гарварда вывели формулу интеллекта нейросетей
Физики Гарварда вывели формулу интеллекта нейросетей — иллюстрация к материалу. Источник: ixbt.com

Пределы бесконечного масштабирования

В индустрии сложилось мнение, что чем больше нейросеть, тем она эффективнее. Однако авторы работы доказали существование «барьера инициализации» (режим ограничения дисперсией). В определенных условиях случайность начальных параметров инициализации начинает подавлять полезный сигнал.

В таких ситуациях бесконечное увеличение ширины модели не дает прироста качества, а становится бессмысленным. Для дальнейшего прогресса требуются иные подходы, например, ансамблирование — объединение нескольких нейросетей в единую систему.

Физическая природа «двойного спуска»

Исследование также объясняет феномен «двойного спуска» (double descent), при котором рост сложности модели не всегда ведет к переобучению, а может улучшить точность. Гарвардские физики доказали, что этот эффект является не аномалией, а закономерной физической сингулярностью. По мере увеличения объема данных «эффективный параметр» системы плавно эволюционирует, помогая модели находить более простые и точные решения.

Работа гарвардской группы создает своего рода «карту» производительности нейросетей, указывающую на узкие места, ограничивающие развитие ИИ. Перенос нагрузки с эмпирического перебора на интеллектуальное проектирование архитектур становится главным условием создания эффективных систем в эпоху, когда стоимость тренировки моделей исчисляется миллиардами долларов.

Источник: https://www.ixbt.com