Закон уплотнения для больших языковых моделей: новые горизонты
Представлен новый «закон уплотнения», согласно которому максимальная плотность способностей больших языковых моделей (LLM) удваивается около каждых 3,5 месяца. Введена метрика «плотность способностей», позволяющая сравнивать фактические параметры моделей с референсными для оценки их эффективности. Анализ на базе нескольких бенчмарков показывает устойчивый экспоненциальный рост плотности, что указывает на эффективность обучения. При фиксированном качестве число необходимых параметров сокращается, что значительно снижает стоимость инференса токенов. Это связано с законом Мура, который предсказывает, что более мощные модели смогут работать на потребительском оборудовании без облачных решений. В результате акцент смещается на оптимизацию плотности моделей, что требует новых архитектурных подходов и методов обучения. Таким образом, традиционное увеличение параметров теряет свою актуальность.