Это самое изящное исправление законов масштабирования нейросетей за долгое время. Исторически разработчики языковых моделей предполагали, что размер архитектуры и объем тренировочных данных влияют на финальную ошибку независимо друг от друга. На практике это приводило к систематическим погрешностям на крайних полюсах — когда данных критически мало или когда модель намеренно переобучают. Исследователи из Meta нашли способ починить эту математику.
В свежей работе авторы представили Skaling law — обновленную формулу, которая связывает емкость модели и размер датасета через единый параметр взаимодействия. Добавление всего одного связующего компонента снижает среднюю абсолютную процентную ошибку в 1,5–3 раза. Метод одинаково хорошо показывает себя как при интерполяции внутри известных значений, так и при прогнозировании за их пределами.
Для индустрии это означает колоссальную экономию вычислительных ресурсов! В связке с правильной стратегией тестирования новый закон позволяет точно предсказывать поведение будущих гигантов, затрачивая на предварительные тесты в 10 раз меньше вычислений. Теперь инженеры могут уверенно распределять огромные бюджеты на обучение новых архитектур, опираясь на результаты недорогих локальных экспериментов.
Поделиться:
Кризис в Google DeepMind: отставка Хассабиса и провалы Gemini
Интеграция UA-аналитики в производство игровых видеокреативов на примере студии SVMD