Созданные в США модели с открытым исходным кодом Trinity Large и 10T-checkpoint от Arcee предоставляют редкую возможность заглянуть в «сырой» интеллект моделей
Базирующийся в Сан-Франциско разработчик в сфере искусственного интеллекта Arcee наделал немало шума в прошлом году, став одной из немногих американских компаний, которые обучают большие языковые языковые модели (LLM) с нуля и выпускают их под открытыми или частично открытыми лицензиями для широкой публики. Это позволяет разработчикам, индивидуальным предпринимателям и даже средним и крупным предприятиям использовать мощные ИИ-модели бесплатно и настраивать их по своему усмотрению.
Теперь на этой неделе Arcee возвращается с анонсом своей самой крупной и производительной открытой языковой модели на сегодняшний день: Trinity Large. Это смесь экспертов (MoE) с 400 миллиардами параметров, которая уже доступна в режиме предварительного просмотра.
Параллельно с флагманским релизом Arcee выпускает «сырую» контрольную модель Trinity-Large-TrueBase, которая позволяет исследователям изучать то, чему разреженный MoE с 400 миллиардами параметров учится исключительно на сырых данных — до применения настройки инструкций и обучения с подкреплением.
Предоставляя чистый лист на отметке в 10 триллионов токенов, Arcee позволяет создателям ИИ в строго регулируемых отраслях проводить аутентичные аудиты и собственную специализированную настройку (alignment) без унаследования предвзятости «черного ящика» или особенностей форматирования моделей общего назначения. Такая прозрачность обеспечивает более глубокое понимание различий между внутренними возможностями модели к рассуждению и полезным поведением, закладываемым на финальных этапах посттренинга.
Этот релиз появляется на фоне того, как рынок наводнили мощные китайские альтернативные открытые LLM от таких игроков, как Alibaba (Qwen), z.AI (Zhipu), DeepSeek, Moonshot и Baidu, которые фактически лидируют в этой категории за счет высокоэффективных архитектур.
Trinity Large также выходит в свет после того, как Meta заметно отступила с передовых позиций в сфере открытого исходного кода. Напомним дебют Llama 4 в апреле 2025 года, который встретили неоднозначно, а бывший исследователь Meta AI Ян ЛеКун позже подтвердил, что компания использовала несколько специализированных версий модели для искусственного завышения результатов в сторонних бенчмарках.
В условиях этого внутреннего вакуума только OpenAI — со своей семейством моделей gpt-oss, выпущенным летом 2025 года, — и Arcee продолжают нести знамя новых американских моделей с открытым исходным кодом, обученных полностью с нуля.
Максимальная разреженность
Trinity Large примечательна экстремальной разреженностью своего механизма внимания (attention). В архитектуре MoE «разреженность» (sparsity) означает способность модели выборочно активировать лишь крошечную долю от общего числа своих параметров для выполнения конкретной задачи.
Хотя Trinity Large содержит в общей сложности 400 миллиардов параметров, в любой момент времени активно лишь 1,56% из них (13 миллиардов параметров).
Этот архитектурный выбор имеет ключевое значение, поскольку позволяет модели обладать «знаниями» массивной системы при сохранении скорости инференса и операционной эффективности гораздо меньшей модели, достигая производительности примерно в 2–3 раза выше, чем у аналогов на том же «железе».
Суверенитет и философия «TrueBase»
Самым значительным вкладом этого релиза для исследовательского сообщества является Trinity-Large-TrueBase — «сырая» контрольная точка, обученная на 10 триллионах токенов.
В отличие от практически всех других «открытых» релизов, которые появляются уже «деформированными» в результате настройки инструкций и обучения с подкреплением, TrueBase предлагает редкий, неиспорченный взгляд на базовый интеллект.
В стремлении сделать модели полезными большинство лабораторий применяют контролируемую донастройку (SFT) и обучение с подкреплением на основе отзывов людей (RLHF) до того, как веса будут опубликованы. Хотя это делает модель лучшим собеседником, это может маскировать лежащие в основе распределения знаний.
TrueBase предоставляет «первоначальную базовую модель» (OG base model), которая еще не проходила через отжиг скорости обучения (learning rate anneals) или второй и третий этапы претренинга, на которых обычно внедряются данные инструкций.
Для исследователей и предприятий из строго регулируемых отраслей старт с TrueBase открывает возможности для аутентичного аудита и кастомной настройки. Как отметил Лукас Аткинс (Lucas Atkins), технический директор Arcee, в видеоразговоре с VentureBeat: «Интересно то, что сама по себе эта контрольная точка уже является одной из лучших базовых моделей в мире».
Технологии: инжиниринг через ограничения
Создание Trinity Large стало результатом не бесконечных ресурсов, а того, что Аткинс называет «инжинирингом через ограничения» (engineering through constraint).
Модель, на обучение которой ушло около $20 млн и всего 33 дня, представляет собой мастер-класс по эффективности капитала.
Arcee, команда всего из 30 человек, располагала совокупным капиталом чуть менее $50 млн, поэтому затраты на обучение в размере $20 млн стали ставкой «пан или пропал».
«Я всегда верил, что наличие ограничений — будь то финансовые, кадровые или любые другие — чрезвычайно важно для творчества, — пояснил Аткинс. — Когда у вас просто безлимитный бюджет, вам по определению не нужно искать инженерные выходы из сложных проблем».
Архитектура: разреженность 4-из-256 и SMEBU
В Trinity Large используется разреженная архитектура MoE 4-из-256, что означает активацию всего 4 из 256 экспертов для каждого токена.
Столь высокая степень разреженности — одна из самых высоких среди когда-либо успешно обученных моделей — создала серьезные проблемы со стабильностью во время претренинга.
Чтобы решить эту задачу, в Arcee разработали метод мягкого ограничения смещения экспертов с импульсом (Soft-clamped Momentum Expert Bias Updates — SMEBU). Этот механизм гарантирует, что эксперты специализируются и маршрутизируются равномерно по общему корпусу веб-данных, не позволяя нескольким экспертам превратиться в «победителей», пока остальные остаются необученным «мертвым грузом».
Высокая скорость обучения была достигнута благодаря раннему доступу Arcee к графическим процессорам Nvidia B300 (Blackwell). Эти чипы обеспечили примерно двукратное превосходство в скорости по сравнению с предыдущим поколением Hopper и значительное увеличение объема памяти.
«Претренинг занял 33 дня, — отметил Аткинс. — Мы могли бы сделать это на Hopper, и тогда это заняло бы, наверное, от двух до трех месяцев. А к тому моменту мы оказались бы в совершенно новом поколении моделей».
В партнерстве с DatologyAI компания Arcee задействовала более 8 триллионов токенов синтетических данных. Однако речь шла не о типичных «подражательных» синтетических данных, где меньшая модель учится говорить как более крупная.
Вместо этого ставилась задача взять «сырой» веб-текст (например, блоги или статьи из Википедии) и синтетически переписать его так, чтобы сжать информацию в меньшее общее количество токенов. Этот процесс помог модели научиться рассуждать над информацией, а не просто заучивать точные последовательности токенов.
Архитектурный дизайн также включает чередующиеся слои локального и глобального скользящего внимания (sliding window attention) в соотношении 3:1. Такой гибридный подход обеспечивает высокую эффективность модели в сценариях с длинным контекстом. Хотя обучение проводилось для последовательностей длиной 256k, Trinity Large нативно поддерживает контекст в 512k, а оценки показывают ее высокую производительность даже на горизонте в 1 миллион токенов.
Техническое сравнение: Trinity Large против gpt-oss-120b
Будучи американской альтернативой, Trinity Large сопоставима с моделью gpt-oss-120b от OpenAI.
Хотя обе модели используют разреженную архитектуру для достижения передовой производительности на базе мягких лицензий, они выполняют разные операционные задачи.
В то время как gpt-oss-120b в настоящее время сохраняет преимущество в определенных бенчмарках на рассуждение и математику, Trinity Large предлагает значительное превосходство в емкости контекста и глубине сырых параметров для сложных многошаговых агентных воркфлоу.
Суверенитет: заполнение вакуума
Выход Trinity Large — это в такой же степени геополитическое заявление, сколь и техническое. Генеральный директор Марк МакКуэйд (Mark McQuade) отметил в интервью VentureBeat, что вакуум американских моделей с открытым исходным кодом на передовом уровне заставил Arcee изменить стратегию.
«Произошел этакий сдвиг: игроки из США и западных стран перестали выкладывать эти модели в открытый доступ, — сказал МакКуэйд. — Мы полагаемся на эти модели, чтобы затем внедрять их в организации и развивать дальше… но китайские лаборатории просто начали… создавать передовые современные модели и открывать их исходный код».
По словам МакКуэйда, это породило зависимость, к которой американские компании относились все с большим дискомфортом. «Особенно в ходе бесед с крупными организациями мы видели, что они не могут использовать архитектуры на базе китайских разработок, — пояснил он. — Мы хотим быть этим флагманом в США. Сейчас [такого] по сути не существует».
Выпуская модель по лицензии Apache 2.0, Arcee предоставляет золотой стандарт разрешительной базы, позволяющий компаниям полностью «владеть» уровнем модели. Это критически важно для таких отраслей, как финансы и оборона, где использование модели, размещенной третьей стороной или в рамках ограничительного облачного провайдера, абсолютно исключено.
Баланс между интеллектом и полезностью
В настоящее время Arcee сосредоточена на «текущей модели мышления» (current thinking model), чтобы превратить Trinity Large из общей модели инструкций в полноценную модель рассуждений. Команда борется за баланс между «интеллектом и полезностью», стремясь создать модель, которая превосходно показывает себя в бенчмарках, но при этом не становится «болтливой» или неэффективной в реальных продакшн-приложениях.
«Мы создали Trinity, чтобы вы могли владеть ей», — заявляет команда, сигнализируя о возвращении к фундаментальным ценностям американского движения за открытый исходный код. По мере того как индустрия движется в сторону агентных рабочих процессов и огромных требований к контексту, Trinity Large позиционирует себя не как «обертку», а как суверенный уровень инфраструктуры, который разработчики наконец-то могут контролировать.



