Thinking Machines представляет Inkling Small — открытую ИИ-модель, приближающуюся по производительности к предшественнику при примерно четверти его размера
Источник: VentureBeat · Carl Franzen
Всего через две недели после того, как компания Thinking Machines выпустила Inkling, свою первую открытую языковую ИИ-модель, хорошо финансируемый стартап под руководством бывшего технического директора OpenAI Миры Мурати сегодня представил Inkling-Small, не пожертвовав практически никакой производительностью — напротив, новая модель превосходит своего более крупного предшественника в ряде бенчмарков.
Inkling Small — это мультимодальная модель рассуждения с 276 миллиардами параметров и мягкой лицензией Apache 2.0, которая отстает всего на один балл от своего более крупного аналога в стороннем индексе интеллекта Artificial Analysis, несмотря на то что оригинальная Inkling насчитывала 975 миллиардов параметров (внутренние настройки модели). Она принимает текстовые, визуальные и звуковые входные данные, генерирует текст и поддерживает контекстное окно до одного миллиона токенов.
В Inkling Small используется 12 миллиардов активных параметров на токен по сравнению с 41 миллиардом активных параметров у Inkling, при этом сохраняется большая часть возможностей флагмана в написании кода, рассуждениях и мультимодальной производительности.
Для предприятий привлекательность заключается не просто в том, что Inkling-Small меньше по размеру. Главное — разработчики практически не теряют в возможностях, одновременно снижая требования модели к вычислительным ресурсам, затратам на инференс и развертыванию.
Модель по-прежнему остается слишком большой для ноутбука или обычной рабочей станции, но с ней гораздо проще работать, чем с флагманом, который превосходит ее по размеру в 3,5 раза. Это делает ее отличным выбором для компаний, у которых есть некоторое количество графических процессоров (GPU), но не в промышленных масштабах.
Thinking Machines опубликовала полные веса на Hugging Face и добавила поддержку дообучения (fine-tuning) через свой интерфейс программирования приложений (API) для обучения моделей Tinker.
На момент запуска компания рекламирует ограниченную по времени скидку 50%, в результате чего стоимость API для стандартной модели Inkling-Small с контекстом 64K составляет 0,58 долл. США за миллион токенов префилла (входных данных), 1,44 долл. США за миллион сэмплированных (выходных) токенов и 1,73 долл. США за миллион токенов обучения, а кэшированные запросы префилла оцениваются в 0,116 долл. США за миллион токенов. Также доступен вариант с контекстом 256K по более высоким расценкам.
Практически та же производительность при четверти размера
Artificial Analysis присвоила Inkling-Small 40 баллов в своем индексе интеллекта по сравнению с 41 баллом у Inkling.
Этот результат примечателен тем, что Inkling-Small имеет 276 миллиардов общих параметров и 12 миллиардов активных параметров, в то время как у Inkling — 975 миллиардов общих параметров и 41 миллиард активных параметров.
В Artificial Analysis также сообщили, что ни одна модель с открытыми весами размером с Inkling-Small или меньше не набрала более высокого балла в этом индексе.
Модель не просто приближается к совокупному баллу флагмана. По ряду оценок она превосходит Inkling.
Thinking Machines сообщает, что Inkling-Small набирает 80,2% на SWE-bench Verified против 77,6% у Inkling и 64,7% на Terminal Bench 2.1 против 63.8% у более крупной модели. Она также немного опережает конкурента в SciCode, Humanity’s Last Exam, GPQA Diamond и CritPt.
Однако улучшения наблюдаются не везде. Inkling сохраняет явное преимущество в фактических знаниях и некоторых агентных задачах. Inkling-Small набирает 15,5% в τ³-Banking против 23,7% у Inkling, а ее показатель AA Omniscience является отрицательным, что отражает более слабое покрытие фактических данных, хотя заявленный уровень галлюцинаций у нее немного ниже.
Этот компромисс важен для бизнеса. Inkling-Small может быть привлекательна для ассистентов программирования, систем с использованием инструментов, генерации с дополненным поиском (RAG), анализа документов и мультимодальных рабочих процессов, но организациям, использующим ее для критически важных задач, связанных с фактами, все равно потребуется поиск, верификация и проверка человеком.
Как модель с 276 млрд параметров использует одновременно всего 12 млрд
Inkling-Small — это разреженная модель типа «сообщество экспертов» (Mixture-of-Experts). Согласно карте модели, опубликованной Thinking Machines, ее 42-слойный декодер направляет каждый токен к шести из 256 специализированных экспертов, а также к двум общим экспертам, которые остаются активными для каждого токена.
Эта архитектура помогает объяснить разницу между общим количеством параметров модели (276 миллиардов) и ее активными параметрами (12 миллиардов). Система сохраняет большой объем обученной емкости, но задействует лишь ее часть на каждом этапе инференса.
Она также является изначально мультимодальной. Изображения, звук и текст проецируются в общее представление и обрабатываются декодером совместно, а не через совершенно отдельные внешние системы. Thinking Machines относит к областям ее применения помощников по написанию кода, агентские приложения, чат-боты, RAG-системы и другие мультимодальные задачи.
Компания также поддерживает вариативные усилия на этапе рассуждения, позволяя разработчикам увеличивать или уменьшать вычислительную мощность модели во время тестов в зависимости от сложности задачи. Это дает инженерным командам прямой инструмент для балансировки качества, задержки и затрат для различных рабочих нагрузок.
К сожалению, «маленькая» не значит, что она запустится на ноутбуке
Несмотря на название, Inkling-Small не является моделью потребительского уровня.
По данным Thinking Machines, стандартная контрольная точка BF16 требует не менее 600 ГБ совокупной памяти GPU. Компания приводит две поддерживаемые конфигурации: 4 графических процессора NVIDIA B300 или 8 графических процессоров NVIDIA H200.
Квантованная контрольная точка NVFP4 снижает требования примерно до 180 ГБ совокупной видеопамяти. По словам Thinking Machines, эта версия может работать в режиме W4A4 на одном NVIDIA B300 или в режиме W4A16 на двух графических процессорах H200.
Это исключает обычные ноутбуки, MacBook, настольные игровые ПК и большинство рабочих станций разработчиков. Даже мощные локальные системы обычно сильно не дотягивают до требуемого объема памяти.
Практическими целями для развертывания являются корпоративные серверы GPU, облачные кластеры и специализированные провайдеры инференса. Таким образом, пометка «Small» (маленькая) относительна по сравнению с Inkling, а не с более широким спектром локальных моделей.
Тем не менее, сокращение существенно. Модель, которая приближается по производительности к Inkling, но требует значительно меньше совокупной памяти, может снизить затраты на хостинг, облегчить планирование емкости и расширить круг организаций, способных развернуть ее самостоятельно.
Для компаний, которые хотят контролировать данные, поведение модели и дообучение, этот меньший размер может оказаться важнее погони за максимально возможным баллами в бенчмарках.
И конечно, ее открытый исходный код означает, что она, без сомнения, будет быстро квантована (сделана менее точной, но требующей меньше вычислений) и, вероятно, объединена с другими моделями, чтобы стать еще меньше для аппаратного обеспечения потребительского уровня.
Apache 2.0 — золотой стандарт для корпоративных моделей с открытым исходным кодом
Лицензия здесь может иметь не меньшее значение, чем бенчмарки.
Inkling-Small выпускается под лицензией Apache 2.0, одной из самых привычных разрешительных лицензий в индустрии программного обеспечения. Как правило, она позволяет организациям использовать, модифицировать, дообучать, перераспределять и коммерциализировать модель, в том числе внутри проприетарных продуктов, при условии соблюдения требований лицензии к уведомлениям и указанию авторства.
Это дает предприятиям гораздо большую юридическую гибкость, чем многие кастомные «открытые» ИИ-лицензии, которые могут включать пороги доходов, обязательства по брендингу, ограничения на использование или особые условия для крупномасштабного коммерческого развертывания.
Это различие становится все более актуальным по мере того, как все больше ИИ-компаний публикуют веса моделей без использования традиционной лицензии с открытым исходным кодом.
Например, китайский любимец в сфере ИИ Moonshot сделал веса своей передовой модели Kimi K3 доступными ранее на этой неделе под кастомной «открытой» лицензией, которая включает дополнительные коммерческие условия, а не относительно простые требования Apache 2.0.
Для юридических отделов, специалистов по закупкам и платформ это различие может существенно упростить внедрение. Apache 2.0 не избавляет от необходимости проверять правила допустимого использования, происхождение данных, регуляторные риски или обязательства по безопасности. Но он дает организациям более четкую отправную точку для создания внутренних систем, выпуска коммерческих продуктов и поддержки модифицированных версий модели.
Более воспроизводимый конвейер разработки моделей
Inkling-Small также демонстрирует, как быстро Thinking Machines превратила релиз своей первой крупной модели в повторяемый инженерный процесс.
Исследователь Thinking Machines Хорас Хе противопоставил два запуска в посте на X:
«Если для выпуска Inkling мне казалось, что потребовались усилия целой деревни, то с Inkling-Small все прошло гораздо более рутинно 😆 Мы просто взяли пайплайн, использованный для Inkling, передали модель поменьше, и вуаля — новая модель! Inkling Small выиграла за счет некоторых незначительных улучшений по сравнению с Inkling, но в запасе еще так много всего…»
Этот комментарий наглядно показывает, что компания больше не воспринимает каждую модель как разовый исследовательский проект. Вместо этого она строит многоразовый конвейер для предварительного обучения, последующего обучения, обучения с подкреплением, оценки и релиза.
В Thinking Machines отмечают, что Inkling-Small выиграла от улучшения набора данных для предварительного обучения, изменений в машинном обучении и дистилляции на основе политики с использованием Inkling в качестве учителя. Затем команда продолжила обучение с подкреплением для агентного кодирования в течение двух недель.
Мира Мурати подчеркнула тот же момент в своем посте, описав Inkling-Small как сопоставимую с Inkling при четверти ее размера и подчеркнув, что веса сразу же были открыты и доступны для дообучения на Tinker.
Как предприятиям и разработчикам ИИ относиться к Inkling Small
Компания также распространяет полные контрольные точки BF16 и NVFP4 и поддерживает развертывание с помощью инструментов SGLang, vLLM, TokenSpeed, Unsloth и Hugging Face.
Эта комбинация дает разработчикам несколько путей развертывания: использовать API, дообучать через Tinker, полагаться на стороннего провайдера инференса или запускать модель на частной инфраструктуре.
Inkling-Small — это не та модель, которую большинство людей скачают и запустят локально. Но для бизнеса, выбирающего между очень большим флагманом и более управляемой системой с открытыми весами, она представляет собой убедительный компромисс: практически тот же измеренный уровень интеллекта, лучшие результаты в ряде задач по написанию кода и рассуждениям, более низкая цена за токены, меньшие требования к оборудованию и лицензия, разрешающая широкую коммерческую разработку.
Более широкий сигнал может оказаться не менее важным. Thinking Machines показывает, что Inkling не была разовым релизом. Компания уже сжимает свое семейство моделей, совершенствует конвейер обучения и движется к ритму, при котором мультимодальные системы с открытыми весами могут производиться, совершенствоваться и развертываться более рутинно.



