Модели LFM2 от Liquid AI меняют представление об ИИ на устройствах
Когда стартап Liquid AI, основанный исследователями компьютерных наук из MIT в 2023 году, представил свою вторую серию базовых моделей Liquid Foundation Models (LFM2) в июле 2025 года, суть предложения была проста: предоставить самые быстрые краевые (on-device) базовые модели на базе новой «жидкой» архитектуры с такой эффективностью обучения и инференса, которая делает небольшие модели серьезной альтернативой облачным большим языковым моделям (LLM), таким как серия GPT от OpenAI и Gemini от Google.
Первый релиз включал плотные чекпоинты (dense checkpoints) с параметрами 350M, 700M и 1.2B, гибридную архитектуру с большим упором на короткие свертки с механизмом шлюзования (gated short convolutions), а также результаты бенчмарков, которые ставили LFM2 впереди сопоставимых по размеру конкурентов вроде Qwen3, Llama 3.2 и Gemma 3 как по качеству, так и по пропускной способности процессора. Сигнал для бизнеса был ясен: работающие в реальном времени конфиденциальные ИИ-системы на телефонах, ноутбуках и в автомобилях больше не требуют жертв в виде задержек ради производительности.
За месяцы, прошедшие с момента релиза, Liquid расширила LFM2 до более широкой линейки продуктов, добавив варианты, специализированные под определенные задачи и домены, небольшую модель для загрузки и анализа видео и ориентированный на периферийные устройства стек развертывания под названием LEAP, а также позиционировала модели в качестве управляющего слоя для краевых и локальных агентных систем.
Теперь, с <публ>=публикацией подробного 51-страничного технического отчета по LFM2, компания делает следующий шаг: открыто публикует процесс поиска архитектуры, набор обучающих данных, цель дистилляции, стратегию учебного плана (curriculum strategy) и конвейер постобучения, стоящие за этими моделями.
И в отличие от более ранних открытых моделей, LFM2 построена на основе воспроизводимого рецепта: процесса поиска с аппаратным циклом (hardware-in-the-loop), учебного плана, компенсирующего меньший бюджет параметров, и конвейера постобучения, настроенного на следование инструкциям и использование инструментов.
Вместо того чтобы просто предлагать веса и API, Liquid фактически публикует подробный чертеж, который другие организации могут использовать в качестве справочника для обучения собственных небольших и эффективных моделей с нуля, настроенных под их собственное железо и ограничения развертывания.
Семейство моделей, разработанное с учетом реальных ограничений, а не лабораторных GPU
Технический отчет начинается с предпосылки, хорошо знакомой бизнесу: реальные системы ИИ упираются в ограничения задолго до того, как это делают бенчмарки. Бюджеты задержек, ограничения пиковой памяти и тепловой троллинг определяют то, что действительно может работать в продакшене — особенно на ноутбуках, планшетах, обычных серверах и мобильных устройствах.
Для решения этой задачи Liquid AI провела поиск архитектуры непосредственно на целевом оборудовании, включая мобильные SoC Snapdragon и процессорные ядра Ryzen для ноутбуков. Результатом стал стабильный показатель для всех размеров: минималистичная гибридная архитектура, в которой доминируют блоки коротких сверток со шлюзами (gated short convolution blocks) и небольшое число слоев группированного внимания (grouped-query attention — GQA). Этот дизайн неоднократно выбирался в пользу более экзотических гибридов с линейным вниманием и SSM, поскольку он обеспечивал лучший профиль «качество — задержка — память» (Парето-оптимальность) в условиях реальных устройств.
Это важно для корпоративных команд по трем причинам:
-
Предсказуемость: архитектура проста, эффективна с точки зрения параметров и стабильна при размерах моделей от 350M до 2.6B.
-
Операционная переносимость: плотные варианты и варианты с разреженной смесью экспертов (MoE) используют один и тот же структурный базис, упрощая развертывание в смешанном парке оборудования.
-
Практичность на устройствах: пропускная способность префилла и декодирования на CPU примерно в 2 раза превышает показатели сопоставимых открытых моделей во многих сценариях, что снижает необходимость перекладывать рутинные задачи на облачные инференс-эндпоинты.
Вместо оптимизации ради академической новизны отчет выглядит как систематическая попытка спроектировать модели, которые бизнес может реально запустить в продакшен.
Это примечательно и более практично для предприятий в сфере, где многие открытые модели молчаливо предполагают наличие многокластерных сред H100 во время инференса.
Конвейер обучения, настроенный на поведение, важное для бизнеса
LFM2 использует подход к обучению, который компенсирует меньший масштаб своих моделей структурой, а не грубой силой. Ключевые элементы включают в себя:
-
Предобучение на 10–12 трлн токенов и дополнительную фазу промежуточного обучения с контекстом 32K, которая расширяет полезное окно контекста модели без взрывного роста затрат на вычисления.
-
Цель декомпозированной дистилляции знаний Top-K (decoupled Top-K knowledge distillation objective), которая обходит стороной нестандартную нестандартную KL-дистилляцию, когда учителя предоставляют лишь частичные логиты.
-
Трехэтапную последовательность постобучения — SFT, выравнивание предпочтений с нормализацией длины и слияние моделей, призванное обеспечить более надежное следование инструкциям и использование инструментов.
Для корпоративных разработчиков ИИ это означает, что модели LFM2 ведут себя меньше как «крошечные LLM» и больше как практичные агенты, способные следовать структурированным форматам, придерживаться JSON-схем и управлять многошаговыми диалогами. Многие открытые модели аналогичного размера терпят неудачу не из-за отсутствия способности к рассуждениям, а из-за хрупкого соблюдения шаблонов инструкций. Рецепт постобучения LFM2 напрямую устраняет эти шероховатости.
Другими словами: Liquid AI оптимизировала небольшие модели для операционной надежности, а не просто для таблиц рекордов.
Мультимодальность, спроектированная с учетом ограничений устройств, а не лабораторных демо
Варианты LFM2-VL и LFM2-Audio отражают еще один сдвиг: мультимодальность, построенную вокруг эффективности токенов.
Вместо того чтобы встраивать массивный визуальный трансформер непосредственно в языковую модель, LFM2-VL подключает кодировщик SigLIP2 через коннектор, который агрессивно уменьшает количество визуальных токенов с помощью операции PixelUnshuffle. Ввод с высоким разрешением автоматически запускает динамическую разметку на тайлы, сохраняя бюджет токенов под контролем даже на мобильном железе. LFM2-Audio использует разветвленный аудиопуть — один для эмбеддингов, один для генерации — поддерживая транскрипцию в реальном времени или преобразование речи в речь на скромных центральных процессорах.
Для корпоративных архитекторов платформ этот дизайн указывает на практичное будущее, где:
-
Понимание документов происходит непосредственно на конечных устройствах, таких как полевые терминалы.
-
Аудиораспознавание и речевые агенты работают локально для соблюдения конфиденциальности.
-
Мультимодальные агенты функционируют в рамках фиксированных задержек без потоковой передачи данных с устройства.
Основная мысль та же: мультимодальные возможности без необходимости содержать ферму графических процессоров.
Модели извлечения информации для агентных систем, а не устаревшего поиска
LFM2-ColBERT расширяет поиск с поздним взаимодействием (late-interaction retrieval) до компактных размеров, достаточных для корпоративных развертываний, которым требуется многоязычная генерация с дополненным поиском (RAG) без накладных расходов на специализированные ускорители векторных БД.
Это особенно важно по мере того, как организации начинают оркестрировать парки агентов. Быстрый локальный поиск, работающий на том же оборудовании, что и модель рассуждений, снижает задержки и дает преимущество в управлении: документы никогда не покидают периметр устройства.
В совокупности варианты VL, Audio и ColBERT показывают LFM2 как модульную систему, а не как единичный выпуск модели.
Формирующийся чертеж для гибридных корпоративных ИИ-архитектур
Во всех вариантах отчет по LFM2 имплицитно обрисовывает то, как будет выглядеть завтрашний корпоративный ИИ-стек: гибридная локально-облачная оркестрация, где небольшие быстрые модели, работающие на устройствах, справляются с критичными по времени задачами восприятия, форматирования, вызова инструментов и оценки, в то время как более крупные модели в облаке предлагают тяжелые рассуждения при необходимости.
Здесь сходятся несколько тенденций:
-
Контроль затрат: запуск рутинного инференса локально позволяет избежать непредсказуемых счетов от облачных провайдеров.
-
Детерминизм задержек: время до первого токена (TTFT) и стабильность декодирования имеют значение в рабочих процессах агентов; локальная работа на устройстве исключает сетевой джиттер.
-
Управление и комплаенс: локальное выполнение упрощает обработку персональных данных (PII), локализацию данных и аудит.
-
Отказоустойчивость: агентные системы деградируют плавно, если облачный путь становится недоступным.
Предприятия, внедряющие эти архитектуры, вероятнее всего, будут рассматривать небольшие краевые модели как «управляющий элемент» (control plane) агентных рабочих процессов, а крупные облачные модели — в качестве ускорителей по требованию.
LFM2 — одна из самых четких открытых основ для этого слоя управления на сегодняшний день.
Стратегический вывод: краевой ИИ (On-device AI) теперь — это конструктивное решение, а не компромисс
Годами организации, создающие функции на базе ИИ, смирялись с тем, что «настоящий ИИ» требует облачного инференса. LFM2 бросает вызов этому предположению. Модели демонстрируют конкурентоспособные результаты в задачах рассуждения, следования инструкциям, многоязычных задачах и RAG, одновременно достигая существенного снижения задержек по сравнению с другими открытыми семействами небольших моделей.
Для директоров по информационным технологиям (CIO) и техническим директорам (CTO), финализирующих дорожные карты на 2026 год, вывод очевиден: небольшие, открытые краевые модели теперь достаточно сильны, чтобы нести значительную долю производственных нагрузок.
LFM2 не заменит передовые облачные модели для масштабных рассуждений на грани возможностей. Но он предлагает то, в чем бизнес нуждается гораздо сильнее: воспроизводимую, открытую и операционно реализуемую основу для агентных систем, которые должны работать везде — от телефонов и промышленных терминалов до изолированных защищенных комплексов (air-gapped facilities).
В расширяющемся ландшафте корпоративного ИИ LFM2 — это в меньшей степени веха исследований и в большей степени знак архитектурной конвергенции. Будущее — это не облако или периферия, а их сочетание, работающее согласованно. Такие релизы, как LFM2, предоставляют строительные блоки для организаций, готовых строить это гибридное будущее осознанно, а не случайно.



