Thinking Machines бросает вызов масштабированию ИИ
В то время как ведущие мировые компании в сфере искусственного интеллекта ведут гонку за создание всё более масштабных моделей, делая миллиардные ставки на то, что один лишь масштаб позволит достичь общего искусственного интеллекта, исследователь из одного из самых засекреченных и ценных стартапов индустрии на этой неделе выступил с резким возражением против этой устоявшейся догмы: путь вперед заключается не в тренировке всё более крупных систем, а в более качественном обучении.
«Я считаю, что первый суперъинтеллект будет сверхчеловеком-учеником», — заявил во вторник на конференции TED AI в Сан-Франциско Рафаэль Рафайлов (Rafael Rafailov), исследователь в области обучения с подкреплением из стартапа Thinking Machines Lab. — «Он сможет очень эффективно разбираться в ситуации и адаптироваться, выдвигать собственные теории, предлагать эксперименты, использовать окружающую среду для проверки, получать информацию и повторять этот процесс в цикле».
Это кардинально расходится с подходами, которых придерживаются OpenAI, Anthropic, Google DeepMind и другие ведущие лаборатории, вложившие миллиарды в увеличение размеров моделей, объемов данных и вычислительных мощностей ради достижения всё более сложных возможностей рассуждения. Рафайлов утверждает, что стратегия этих компаний перевернута с ног на голову: современным передовым системам ИИ не хватает вовсе не масштаба, а способности по-настоящему учиться на собственном опыте.
«Обучение — это то, что делает разумное существо», — сказал Рафайлов, процитировав фразу, которая показалась ему недавно весьма убедительной. — «А тренировка — это то, что делают с ним».
Это различие затрагивает самую суть того, как совершенствуются системы ИИ и сможет ли текущая траектория индустрии оправдать самые амбициозные ожидания. Высказывания Рафайлова приоткрывают редкую завесу над тем, как мыслят в Thinking Machines Lab — стартапе, сооснователем которого в феврале стала бывший технический директор OpenAI Мира Мурати (Mira Murati) и который привлек рекордные 2 миллиарда долларов в рамках начального раунда финансирования при оценке в 12 миллиардов долларов.
Почему современные помощники по программированию забывают всё, чему научились вчера
Иллюстрируя проблему нынешних систем ИИ, Рафайлов привел сценарий, знакомый каждому, кто работал с самыми современными инструментами для написания кода.
«Если вы используете агента-программиста, попросите его сделать что-то действительно сложное — реализовать функцию, изучить ваш код, попытаться понять его, осмыслить логику, что-то написать, пройти несколько итераций, — он может преуспеть», — пояснил он. — «А затем вернитесь на следующий день и попросите его реализовать следующую функцию, и он сделает всё то же самое с нуля».
Проблема, по его словам, заключается в том, что эти системы не усваивают то, чему научились. «В некотором смысле для моделей, которые у нас есть сегодня, каждый день — это их первый рабочий день», — отметил Рафайлов. — «Но разумное существо должно уметь усваивать информацию. Оно должно уметь адаптироваться. Оно должно уметь менять свое поведение так, чтобы с каждым днем становиться лучше, знать больше, работать быстрее — точно так же, как нанятый вами человек со временем лучше справляется со своей работой».
Проблема изоленты: как текущие методы обучения учат ИИ искать обходные пути вместо решения проблем
Рафайлов указал на конкретную особенность поведения агентов-программистов, которая обнажает более глубокую проблему: их склонность оборачивать ненадежный код в блоки try/except — конструкцию программирования, которая перехватывает ошибки и позволяет программе продолжать работу.
«Если вы пользуетесь агентами для написания кода, вы, возможно, замечали их крайне раздражающую привычку использовать конструкции try/except pass», — сказал он. — «По сути, это просто изолента, которой заклеивают программу, чтобы спасти ее от единичной ошибки».
Почему агенты так поступают? «Они делают это, потому что понимают: какая-то часть кода может оказаться неверной», — объяснил Рафайлов. — «Они понимают, что там может быть подвох, что это рискованно. Но в условиях жестких ограничений — у них есть ограниченное время на решение проблемы и ограниченное количество взаимодействий — они обязаны сосредоточиться исключительно на своей цели: реализовать функцию и исправить баг».
Результат: «Они просто откладывают проблему в долгий ящик».
Такое поведение проистекает из систем обучения, оптимизированных для немедленного завершения задачи. «Единственное, что имеет значение для нашего нынешнего поколения моделей, — это решение конкретной задачи», — заявил он. — «А всё общее, всё, что не относится напрямую к этой единственной цели, — пустая трата вычислительных ресурсов».
Почему увеличение вычислительных мощностей не создаст суперъинтеллект, считает исследователь Thinking Machines
Самый прямой вызов индустрии Рафайлов бросил, заявив, что дальнейшего масштабирования будет недостаточно для достижения общего искусственного интеллекта (AGI).
«Я не считаю, что мы упираемся в какие-либо точки насыщения», — уточнил он. — «Я думаю, мы находимся лишь у истоков следующей парадигмы — масштабирования обучения с подкреплением, в рамках которого мы переходим от обучения наших моделей тому, как мыслить и как исследовать пространство мысли, к наделению их возможностями универсальных агентов».
Иными словами, существующие подходы позволят создать всё более способные системы, которые смогут взаимодействовать с внешним миром, бороздить просторы интернета и писать код. «Я полагаю, что через год или два мы будем смотреть на сегодняшних агентов-программистов, исследовательских или поисковых агентов так же, как смотрим на модели для суммаризации или перевода из прошлых лет», — сказал он.
Однако универсальная агентность, по его словам, не то же самое, что общий интеллект. «Куда более интересный вопрос: станет ли это AGI? И всё ли у нас готово — неужели нам нужен всего лишь еще один раунд масштабирования, еще один раунд сред, еще один раунд обучения с подкреплением, еще один раунд вычислений, и на этом наша работа закончена?»
Его ответ был недвусмысленным: «Я так не считаю. Я убежден, что при наших текущих парадигмах, при любом масштабе, мы не сможем справиться с задачей создания общего искусственного интеллекта и искусственного суперъинтеллекта. И я верю, что при нынешних подходах нашим моделям будет не хватать одной фундаментальной способности — способности учиться».
Учить ИИ как студентов, а не как калькуляторы: учебный подход к машинному обучению
Чтобы объяснить альтернативный подход, Рафайлов обратился к аналогии из математического образования.
«Подумайте о том, как мы обучаем нынешнее поколение моделей для рассуждений», — сказал он. — «Мы берем конкретную математическую задачу, сильно усложняем ее и пытаемся решить, вознаграждая модель за правильный ответ. И на этом всё. Как только этот опыт исчерпан, модель выдает решение. Всё, что она открыла в процессе — любые выученные абстракции, любые теоремы, — мы отбрасываем, а затем просим ее решить новую задачу, и ей приходится заново изобретать те же самые абстракции».
Такой подход искажает представление о том, как накапливается знание. «Наука и математика работают совсем иначе», — отметил он. — «Мы строим абстракции не обязательно потому, что они решают наши текущие проблемы, а потому, что они важны. Например, мы развили раздел топологии для расширения евклидовой геометрии — не для того, чтобы решить какую-то конкретную задачу, с которой евклидова геометрия не справлялась, а потому, что математики и физики понимали фундаментальную важность этих концепций».
Решение таково: «Вместо того чтобы давать нашим моделям по одной задаче за раз, мы могли бы дать им учебник. Представьте себе очень продвинутый учебник уровня аспирантуры, и мы просим наши модели проработать первую главу, затем первое упражнение, второе, третье, четвертое, затем перейти ко второй главе и так далее — точно так же, как настоящий студент может самостоятельно изучить предмет».
При этом коренным образом изменится сама цель: «Вместо того чтобы вознаграждать их за успех — то есть за количество решенных задач, — нам нужно вознаграждать их прогресс, их способность учиться и их способность совершенствоваться».
Этот подход, известный как «метаобучение» (или «обучение тому, как учиться»), имеет прецеденты в более ранних системах ИИ. «Подобно тому, как идеи масштабирования вычислений на этапе инференса (test-time compute), поиска и исследований во время работы сначала проявили себя в области игр» — в таких системах, как AlphaGo от DeepMind — «то же самое справедливо и для метаобучения. Мы знаем, что эти идеи работают в малых масштабах, но нам нужно адаптировать их к масштабам и возможностям базовых (foundation) моделей».
Недостающие компоненты для по-настоящему обучающегося ИИ — это не новые архитектуры, а лучшие данные и более умные целевые функции
Когда Рафайлов затронул вопрос о том, почему современные модели лишены этой способности к обучению, его ответ оказался неожиданно простым.
«К сожалению, думаю, ответ звучит довольно прозаично», — сказал он. — «Считаю, что у нас просто нет правильных данных и нет правильных целевых функций. Я искренне верю, что большая часть базовой архитектурно-инженерной базы уже создана».
Вместо того чтобы выступать за принципиально новые архитектуры моделей, Рафайлов предположил, что путь вперед лежит через перепроектирование распределения данных и структур вознаграждения, используемых для обучения моделей.
«Само по себе обучение — это алгоритм», — пояснил он. — «У него есть входные данные — текущее состояние модели. У него есть данные и вычислительные ресурсы. Вы пропускаете их через некую структуру, выбираете свой любимый алгоритм оптимизации и получаете на выходе, надеемся, более мощную модель».
Возникает вопрос: «Если модели рассуждений способны изучать общие алгоритмы логического вывода и поиска, а агентные модели способны обучаться общей агентности, сможет ли следующее поколение ИИ самостоятельно изучить сам алгоритм обучения?»
Его ответ: «Я твердо верю, что ответ на этот вопрос — да».
Технический подход будет заключаться в создании таких обучающих сред, в которых «обучение, адаптация, исследование, самосовершенствование, а также генерализация необходимы для успеха».
«Я считаю, что при наличии достаточных вычислительных ресурсов и достаточно широкого охвата универсальные алгоритмы обучения могут возникнуть в результате масштабного обучения», — заявил Рафайлов. — «Подобно тому, как мы обучаем наши модели общим рассуждениям на математике и коде и потенциально — действиям в универсальных доменах, мы сможем научить их эффективно обучаться в самых разных приложениях».
Забудьте о богоподобных мыслителях: первый суперъинтеллект станет суперучеником
Это видение подводит нас к принципиально иному представлению о том, как может выглядеть искусственный суперъинтеллект.
«Я считаю, что если это возможно, то это станет последним недостающим элементом для достижения по-настоящему эффективного общего интеллекта», — сказал Рафайлов. — «А теперь представьте себе такой интеллект, чьей главной целью является исследование, обучение, сбор информации, самосовершенствование и который наделен универсальными возможностями агента — способностью понимать внешний мир и исследовать его, способностью использовать компьютеры, способностью проводить исследования, способностью управлять роботами».
Подобная система и будет представлять собой искусственный суперъинтеллект. Но совсем не тот, который часто рисуют в научной фантастике.
«Я считаю, что этот интеллект не будет представлять собой единую божественную модель, которая выступает в роли мыслителя божественного уровня или божественного решателя математических задач», — отметил Рафайлов. — «Я верю, что первый суперъинтеллект окажется сверхчеловеком-учеником, способным очень эффективно во всем разбираться и адаптироваться, выдвигать собственные теории, предлагать эксперименты, использовать среду для проверки, добывать информацию и повторять этот процесс в цикле».
Это видение контрастирует с акцентом OpenAI на создании всё более мощных систем рассуждения или сосредоточенностью Anthropic на «конституциональном ИИ». Судя по всему, Thinking Machines Lab делает ставку на то, что путь к суперъинтеллекту лежит через системы, способные непрерывно совершенствоваться за счет взаимодействия с окружающей средой.
Ставка в 12 миллиардов долларов на обучение, а не на масштабирование, сталкивается с серьезными трудностями
Выступление Рафайлова состоялось в непростой для Thinking Machines Lab момент. Компания собрала впечатляющую команду примерно из 30 исследователей из OpenAI, Google, Meta и других ведущих лабораторий. Однако в начале октября стартап понес потерю: Эндрю Таллок (Andrew Tulloch), сооснователь и эксперт по машинному обучению, ушел обратно в Meta после того, как та развернула то, что The Wall Street Journal назвала «лномасштабным рейдом» на стартап, предложив более чем десятку сотрудников компенсационные пакеты на сумму от 200 миллионов до 1,5 миллиарда долларов с выплатой в течение нескольких лет.
Несмотря на это давление, слова Рафайлова свидетельствуют о том, что компания остается верна своему особому техническому курсу. В октябре компания выпустила свой первый продукт — Tinker, API для дообучения языковых моделей с открытым исходным кодом. Однако выступление Рафайлова намекает на то, что Tinker — лишь фундамент для гораздо более амбициозной исследовательской программы, сосредоточенной на метаобучении и самосовершенствующихся системах.
«Это непросто. Это будет очень сложно», — признал Рафайлов. — «Нам потребуется множество прорывов в области памяти, инженерии, данных и оптимизации, но я считаю это принципиально возможным».
В заключение он использовал игру слов: «Мира мало (The world is not enough), но нам нужен правильный опыт и правильный тип вознаграждения за обучение».
Вопрос для Thinking Machines Lab и всей индустрии ИИ в целом заключается в том, удастся ли воплотить это видение в жизнь и в какие сроки. Примечательно, что Рафайлов не стал называть конкретных прогнозов относительно того, когда могут появиться подобные системы.
В отрасли, где руководители регулярно делают громкие заявления о том, что AGI появится через считанные годы или даже месяцы, такая сдержанность бросается в глаза. Она говорит либо о необычной научной скромности, либо о признании того, что Thinking Machines Lab выбрала гораздо более долгий и сложный путь, чем ее конкуренты.
Пока же самой показательной деталью может быть как раз то, о чем Рафайлов умолчал во время своего выступления на TED AI. Никаких сроков появления сверхчеловека-ученика. Никаких прогнодов о том, когда ждать технических прорывов. Лишь убежденность в том, что эта способность «принципиально возможна» — и что без нее все масштабы мира не будут иметь значения.



