Самосовершенствующиеся языковые модели уже здесь благодаря обновленной методике SEAL от MIT
Исследователи из Массачусетского технологического института (MIT) привлекли к себе новое внимание благодаря разработке и публикации в открытом доступе методики, которая позволяет большим языковым моделям (LLM) — подобным тем, что лежат в основе ChatGPT и большинства современных ИИ-чат-ботов — совершенствоваться самостоятельно за счет генерации синтетических данных для дообучения.
Эта методика, получившая название SEAL (Self-Adapting LLMs), была впервые описана в научной статье, опубликованной еще в июне, и тогда же освещалась изданием VentureBeat.
Значительно расширенная и обновленная версия статьи была выпущена в прошлом месяце, а также исходный код был опубликован на GitHub (под лицензией MIT, разрешающей коммерческое и корпоративное использование), что на этой неделе вызвало новую волну обсуждений среди продвинутых пользователей ИИ в социальной сети X.
SEAL позволяет LLM автономно генерировать и применять собственные стратегии дообучения. В отличие от традиционных моделей, опирающихся на фиксированные внешние данные и созданные людьми конвейеры оптимизации, SEAL дает моделям возможность эволюционировать, производя собственные синтетические обучающие данные и соответствующие директивы для оптимизации.
Разработка принадлежит команде исследователей из Лаборатории перспективного искусственного интеллекта MIT (Improbable AI Lab), в которую вошли Адам Цвайгер (Adam Zweiger), Джотиш Пари (Jyothish Pari), Хан Го (Han Guo), Экин Акюрек (Ekin Akyürek), Юн Ким (Yoon Kim) и Пулкит Агравал (Pulkit Agrawal). Их исследование недавно было представлено на 39-й конференции по нейронным системам обработки информации (NeurIPS 2025).
Предыстория: от «статичного ИИ» к самоадаптивным системам
Ранее в этом году VentureBeat впервые сообщил о SEAL как о ранней концептуальной структуре, позволяющей языковым моделям генерировать данные и обучаться на собственных синтетических материалах, что потенциально решает проблему стагнации предобученных моделей после их развертывания.
На том этапе SEAL позиционировалась как концептуальное доказательство (proof-of-concept), способное позволить корпоративным ИИ-агентам непрерывно обучаться в динамичных средах без ручного переобучения.
С тех пор исследование значительно продвинулось вперед. Новая версия расширяет предыдущий фреймворк, демонстрируя, что способность SEAL к самоадаптации масштабируется с ростом размера модели, более эффективно интегрирует обучение с подкреплением для снижения катастрофического забывания, а также формализует двухконтурную структуру SEAL (внутреннее контролируемое дообучение и внешнюю оптимизацию с подкреплением) для обеспечения воспроизводимости результатов.
В обновленной статье также представлены результаты оценки различных форматов промптов, улучшена стабильность в ходе циклов обучения и рассмотрены практические проблемы развертывания на этапе инференса.
Решение проблем статических моделей
Хотя LLM продемонстрировали впечатляющие возможности в генерации и понимании текста, их адаптация к новым задачам или знаниям часто носит ручной, хрупкий характер или зависит от контекста.
SEAL бросает вызов этому положению дел, наделяя модели способностью генерировать то, что авторы называют «саморедакцией» (self-edits), — тексты на естественном языке, определяющие, как модель должна обновить свои веса.
Такие саморедакции могут принимать форму переформулированной информации, логических следствий или конфигураций инструментов для аугментации и обучения. После генерации модель дообучает себя на основе этих правок. Процесс направляется обучением с подкреплением, где сигнал вознаграждения поступает от улучшения производительности в прикладной задаче.
Этот подход имитирует то, как человек-учащийся может перефразировать или реорганизовать учебные материалы для лучшего усвоения информации. Подобная реструктуризация знаний перед их усвоением дает ключевое преимущество перед моделями, которые пассивно потребляют новые данные «как есть».
Производительность в различных задачах
SEAL прошла тестирование в двух основных областях: внедрение знаний и обучение в условиях малого количества примеров (few-shot learning).
В сценарии внедрения знаний исследователи оценивали, насколько хорошо модель может усваивать новый фактологический контент из отрывков текста, аналогичных датасету SQuAD — эталонному набору данных для проверки понимания прочитанного, представленному Стэнфордским университетом в 2016 году и состоящему из более чем 100 000 созданных краудсорсингом пар «вопрос-ответ» на основе статей Википедии (Rajpurkar et al., 2016).
Вместо дообучения непосредственно на тексте отрывка, модель генерировала синтетические следствия из этого текста, а затем дообучалась на них.
После двух раундов обучения с подкреплением точность ответов на вопросы возросла с 33,5% до 47,0% на версии SQuAD без контекста, превзойдя результаты, полученные с использованием синтетических данных, сгенерированных GPT-4.1.
В сценарии few-shot learning эффективность SEAL оценивалась с использованием подмножества бенчмарка ARC, где задачи требуют рассуждения на основе всего нескольких примеров. В этом случае SEAL генерировала саморедакции, определяющие аугментацию данных и гиперпараметры.
После обучения с подкреплением успешность решения отложенных задач подскочила до 72,5% по сравнению с 20% при использовании саморедакций, сгенерированных без обучения с подкреплением. Модели, полагавшиеся исключительно на контекстное обучение без какой-либо адаптации, показали результат 0%.
Технический фреймворк
SEAL работает по двухконтурной схеме: внутренний контур выполняет контролируемое дообучение на основе саморедакций, в то время как внешний контур использует обучение с подкреплением для уточнения стратегии (политики), которая эти саморедакции генерирует.
Используемый алгоритм обучения с подкреплением основан на подходе ReSTEM, который объединяет выборку (сэмплирование) с отфильтрованным клонированием поведения. В процессе обучения закрепляются только те саморедакции, которые приводят к улучшению производительности. Такой подход эффективно учит модель тому, какие типы правок наиболее полезны для обучения.
Для эффективности SEAL применяет дообучение на базе LoRA вместо обновления полных параметров, что обеспечивает быстрое проведение экспериментов и недорогую адаптацию.
Преимущества и ограничения
Исследователи сообщают, что SEAL способна создавать высокоэффективные обучающие данные с минимальным надзором, превосходя даже крупные внешние модели, такие как GPT-4.1, в определенных задачах.
Они также демонстрируют, что SEAL обладает способностью к обобщению за пределами своей первоначальной настройки: система продолжает эффективно работать при переходе от однократных обновлений к сценариям непрерывного преобучения по множеству документов.
Тем не менее, у фреймворка есть свои ограничения. Одной из проблем является катастрофическое забывание, при котором обновления для интеграции новой информации могут ухудшить производительность на ранее изученных задачах.
Отвечая на этот вопрос, соавтор работы Джо Пари (Jyo Pari) сообщил VentureBeat по электронной почте, что обучение с подкреплением (RL), по-видимому, смягчает проблему забывания более эффективно, чем стандартное контролируемое дообучение (SFT), сославшись на недавнюю статью по этой теме. Он добавил, что объединение этого понимания с принципами SEAL может привести к созданию новых вариантов, где SEAL обучается не только на тренировочных данных, но и на функциях вознаграждения.
Еще одна сложность связана с вычислительными затратами: оценка каждой саморедакции требует дообучения и тестирования производительности, что может занимать от 30 до 45 секунд на одну правку, что значительно дольше по сравнению со стандартными задачами обучения с подкреплением.
Как пояснил Джо: «Обучение SEAL нетривиально, так как требует двух циклов оптимизации: внешнего RL и внутреннего SFT. На этапе инференса обновление весов модели также потребует новой системной инфраструктуры». Он подчеркнул необходимость будущих исследований в области систем развертывания как критического пути для практического внедрения SEAL.
Кроме того, текущий дизайн SEAL предполагает наличие парных задач и эталонных ответов для каждого контекста, что ограничивает ее прямое применение к неразмеченным корпусам данных. Тем не менее, Джо уточнил, что до тех пор, пока существует прикладная задача с вычисляемым вознаграждением, SEAL может быть обучена соответствующей адаптации — даже в критически важных для безопасности областях. В принципе, модель, обученная с помощью SEAL, сможет научиться избегать обучения на вредоносных или злонамеренных входных данных, если ею руководит соответствующий сигнал вознаграждения.
Реакция ИИ-сообщества
Сообщество исследователей и разработчиков в сфере ИИ встретило статью о SEAL со смесью энтузиазма и предположений. В соцсети X (бывший Twitter) несколько видных аккаунтов, посвященных искусственному интеллекту, высказались о потенциальном влиянии этой разработки.
Пользователь @VraserX, называющий себя преподавателем и энтузиастом ИИ, назвал SEAL «рождением непрерывно самообучающегося искусственного интеллекта» и предсказал, что модели уровня GPT-6 от OpenAI могут перенять схожую архитектуру.
По их словам, SEAL знаменует собой «конец эпохи замороженных весов», предвещая появление систем, которые эволюционируют по мере изменения окружающего мира.
Они подчеркнули способность SEAL формировать постоянную память, корректировать знания и обучаться на данных в реальном времени, сравнив это с фундаментальным шагом к моделям, которые не просто используют информацию, а впитывают ее.
В то же время @alex_prompter, соучредитель ИИ-стартапа в сфере маркетинга, охарактеризовал SEAL как скачок к моделям, которые буквально переписывают самих себя. «MIT только что создал ИИ, который может переписывать собственный код, чтобы становиться умнее», — написал он. Ссылаясь на ключевые результаты статьи — рост фактической памяти на 40% и превосходство над GPT-4.1 с использованием самостоятельно сгенерированных данных, — он охарактеризовал выводы как подтверждение того, что «LLM, которые дообучают себя сами, больше не относятся к области научной фантастики».
Этот энтузиазм отражает более широкую потребность ИИ-сообщества в моделях, способных эволюционировать без постоянного переобучения или участия человека — особенно в быстро меняющихся сферах или при персонализированных сценариях использования.
Будущие направления и открытые вопросы
Отвечая на вопросы о масштабировании SEAL на более крупные модели и задачи, Джо указал на эксперименты (Приложение B.7), показывающие, что по мере роста размера модели увеличивается и ее способность к самоадаптации. Он сравнил это со студентами, которые со временем совершенствуют свои методы учебы: более крупные модели просто лучше справляются с генерацией полезных самореправок.
На вопрос о том, распространяется ли способность SEAL обобщать на новые стили подсказок (промптов), он ответил утвердительно, сославшись на Таблицу 10 в статье. Тем не менее, он также признал, что команда еще не тестировала способность SEAL переноситься на совершенно новые предметные области или архитектуры моделей.
«SEAL — это начальная работа, демонстрирующая возможности», — сказал он. — «Но она требует гораздо большего тестирования». Он добавил, что способность к обобщению может улучшиться по мере обучения SEAL на более широком распределении задач.
Интересно, что команда обнаружила, что всего несколько шагов обучения с подкреплением уже приводят к измеримому приросту производительности. «Это захватывает», — отметил Джо, — «потому что означает, что при больших вычислительных ресурсах мы, надеемся, сможем добиться еще больших улучшений». Он предположил, что в будущих экспериментах можно будет изучить более продвинутые методы обучения с подкреплением помимо ReSTEM, такие как групповая относительная оптимизация политик (GRPO).
К более адаптивным и агентным моделям
SEAL представляет собой шаг в сторону моделей, способных автономно совершенствоваться с течением времени — как за счет интеграции новых знаний, так и путем перенастройки того, как именно они учатся. Авторы видят будущие расширения, где SEAL сможет помогать в самопреобучении, непрерывном обучении и разработке агентных систем — моделей, которые взаимодействуют с меняющейся средой и адаптируются инкрементально.
В таких сценариях модель могла бы использовать SEAL для синтеза обновлений весов после каждого взаимодействия, постепенно усваивая модели поведения или идеи. Это могло бы снизить потребность в повторном надзоре и ручном вмешательстве, особенно в условиях дефицита данных или в специализированных предметных областях.
Поскольку тексты в общедоступном интернете исчерпываются, а дальнейшее масштабирование LLM упирается в ограничения доступности данных, такие самоуправляемые подходы, как SEAL, могут сыграть критическую роль в расширении границ возможного для языковых моделей.
Ознакомиться с проектом SEAL, включая исходный код и дополнительную документацию, можно по адресу: https://jyopari.github.io/posts/seal



