Команда из Иллинойса снижает издержки «забывания» для больших языковых моделей

Команда из Иллинойса снижает издержки «забывания» для больших языковых моделей

Компании часто обнаруживают, что при тонкой настройке моделей одним из эффективных способов адаптации большой языковой модели (LLM) под конкретные задачи и ее привязки к определенным данным является частичная потеря моделью своих способностей. После дообучения некоторые модели «забывают», как выполнять определенные задачи или те функции, которым они научились ранее.

В исследовании Университета Иллинойса в Урбане-Шампейне предлагается новый метод переобучения моделей, который позволяет избежать «катастрофического забывания», при котором модель теряет часть своих прежних знаний. Работа сосредоточена на двух конкретных многомодальных LLM, генерирующих ответы на основе изображений: LLaVA и Qwen 2.5-VL.

Этот подход побуждает компании переобучать лишь узкие компоненты LLM, чтобы не проводить полную переобутку всей модели и не нести значительные затраты на вычисления. Исследователи утверждают, что катастрофическое забывание — это на самом деле не потеря памяти, а побочный эффект смещения смещения (bias drift).

«Обучение новой многомодальной языковой модели может стоить миллионы долларов, занять недели времени и привести к выбросу сотен тонн CO2, поэтому поиск более эффективных и действенных способов обновления существующих моделей является насущной задачей», — пишут авторы в своей работе. «Основываясь на этом результате, мы исследуем рецепты настройки, которые сохраняют способность к обучению и одновременно ограничивают сдвиг выходных данных».

Исследователи сосредоточили свое внимание на многослойном перцептроне (MLP) — внутреннем компоненте модели, принимающем решения.

Катастрофическое забывание

Сначала исследователи хотели подтвердить само существование и причину катастрофического забывания в моделях.

Для этого они создали набор целевых задач для выполнения моделями. Затем модели прошли тонкую настройку и оценку, чтобы определить, приводит ли это к существенному забыванию. Однако по мере продвижения процесса исследователи обнаружили, что модели восстанавливают некоторые из своих способностей.

«Мы также заметили неожиданный результат: производительность модели значительно падала на отложенных бенчмарках после обучения на задаче подсчета, но в основном восстанавливалась на PathVQA — другой специализированной задаче, которая плохо представлена в бенчмарках», — отмечают они. «Между тем, проводя эксперименты по смягчению эффекта забывания, мы также попробовали отдельно настраивать только проекцию самовнимания (SA Proj) или слои MLP, исходя из того, что настройка только LLM в целом была лучше, чем настройка всей модели. Это привело к еще одному очень удивительному результату: настройка исключительно слоев проекции самовнимания обеспечивала очень хорошее усвоение целевых задач без падения производительности на отложенных задачах, даже после последовательного обучения всех пяти целевых задач».

По мнению исследователей, «то, что после тонкой настройки на узкой целевой задаче выглядит как забывание или интерференция, на самом деле является смещением в распределении выходных данных из-за сдвига распределения задач».

Точечное переобучение

Это открытие стало ключом к эксперименту. Исследователи отметили, что настройка MLP увеличивает вероятность «вывода числовых токенов и сопутствующего сильного падения точности на отложенных задачах». Это показало, что забывание моделью части своих знаний носит лишь временный, а не долгосрочный характер.

«Чтобы избежать смещения распределения выходных данных, мы настраиваем повышающие/геттерованные проекции (up/gating projections) MLP, оставляя проекцию вниз (down projection) замороженной, и обнаруживаем, что это обеспечивает результаты обучения, сопоставимые с полной настройкой MLP, но с минимальным забыванием», — заявили исследователи.

Это позволяет применять более простой и воспроизводимый метод тонкой настройки модели.

Сосредоточившись на узком сегменте модели, а не на ее полной переподготовке, предприятия могут сократить вычислительные расходы. Это также позволяет лучше контролировать дрифт выходных данных.

Тем не менее, исследование охватывает лишь две модели, а именно те, которые работают с визуальными данными и текстом. Исследователи отметили, что из-за ограниченности ресурсов они не смогли провести эксперимент с другими моделями.

Однако их выводы могут быть применимы и к другим LLM, особенно при работе с различными модальностями.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.