GPT-5.5 Instant показывает, что он запомнил — просто не всё
OpenAI обновила модель по умолчанию для ChatGPT до новой GPT-5.5 Instant, а также добавила новую функцию памяти, которая наконец-то показывает, какой именно контекст повлиял на ответы — по крайней мере, для некоторых из них.
Это ограничение указывает на то, что модели начинают создавать второй, неполный уровень наблюдаемости памяти, который может конфликтовать с существующими системами аудита и логами агентов.
GPT-5.5 Instant заменяет GPT-5.3 Instant в качестве модели ChatGPT по умолчанию и представляет собой версию ее новой флагманской языковой модели GPT-5.5. Предполагается, что она более надежна, точна и умнее версии 5.3.
Но именно внедрение источников памяти, которые будут включены во всех моделях платформы, может помочь предприятиям в их проектах.
«Когда ответ персонализирован, вы можете видеть, какой контекст использовался, например, сохраненные воспоминания или прошлые чаты, а также удалить или исправить его, если что-то устарело или больше не актуально», — заявила OpenAI в своем блоге.
Когда пользователь задает ChatGPT вопрос, он может нажать кнопку источников (в нижней части ответа), чтобы узнать, к каким файлам или прошлым чатам обратилась модель для поиска ответа. Пользователи также имеют полный контроль над источниками, на которые могут ссылаться модели, и эти источники не будут переданы, если разговор отправляется другим.
Компания заявила, тем не менее, что источники памяти должны упростить персонализацию ответов моделей. Однако OpenAI признала, что модели «могут показывать не каждый фактор, сформировавший ответ», и пообещала со временем сделать эту функцию более полной.
Это означает, что источники памяти предлагают лишь видимость наблюдаемости в ответах ChatGPT, но пока не обеспечивают полную аудируемость.
Конкурирующие системы памяти
У предприятий уже есть система для решения части проблемы с памятью и контекстом в моделях и агентах.
Модели получают доступ к контексту через конвейеры генерации с дополненным извлечением (RAG): все, что агент извлекает из векторных баз данных, записывается в логи, а состояние агента сохраняется на уровне памяти. Все это отслеживается в логах приложения, обычно на уровне оркестрации или управления со встроенной наблюдаемостью. В идеале это позволяет командам прослеживать сбои по всему стеку.
Текущая система несовершенна; иногда точки сбоя непросто отследить, но она по крайней мере внутренне согласована. Для предприятий, использующих ChatGPT — будь то модель по умолчанию GPT-5.5 Instant или любая другая по их выбору, — это больше не так.
Модель выдает собственную версию с источниками памяти, которые полностью отделены от существующих логов извлечения — короче говоря, это контекст, о котором сообщает сама модель. Проблема возникает, если их невозможно надежно сопоставить. А поскольку источники памяти дают пользователям лишь часть общей картины (неясно, каков лимит цитирования источников памяти у ChatGPT), становится еще сложнее сопоставить то, на что, по утверждению GPT-5.5 Instant, она опиралась, с тем, что она фактически сделала в производственной среде.
Эта ситуация создает новый тип сбоя: конкурирующий журнал контекста. Если что-то кажется неверным, это может породить несоответствия, с которыми предприятиям приходится разбираться.
Малкольм Харкинс (Malcolm Harkins), директор по информационной безопасности и доверию в HiddenLayer, рассказал VentureBeat, что источники памяти «выглядят прагматичным компромиссом» в плане обеспечения некоторой прозрачности, но их ценность все еще непросто оценить.
«Для бизнеса это полезно в стратегическом плане, но само по себе недостаточно», — отметил Харкинс. — Реальная ценность будет зависеть от того, как это интегрируется с системами безопасности, управления, контроля доступа и аудита».
Более мощная модель по умолчанию
Как бы GPT-5.5 Instant ни управляла памятью, OpenAI называет ее улучшением по сравнению с GPT-5.3 Instant.
Внутренние оценки показали, что GPT-5.5 Instant выдает на 52,5% меньше галлюцинаций по сравнению с предыдущей моделью по умолчанию, особенно в таких критически важных областях, как медицина, юриспруденция и финансы. Количество неточных утверждений в сложных диалогах сократилось на 37,3%. Компания заявила, что модель улучшила анализ фотографий и загруженных изображений, ответы на вопросы из области точных наук (STEM), а также научилась лучше понимать, когда использовать собственную базу знаний, а когда — веб-поиск.
Питер Гостев (Peter Gostev), специалист по возможностям ИИ в независимой экспертной организации Arena, пояснил в электронном письме VentureBeat, что ключевым показателем для GPT-5.5 Instant является ее положение в общих текстовых рейтингах, особенно учитывая, что ее предшественница показала себя не лучшим образом.
«Начиная с GPT-4o, самой эффективной чат-моделью OpenAI на Arena была GPT-5.2-Chat, которая спустя месяцы после релиза все еще занимает 12-е место в общем текстовом рейтинге Arena», — сказал Гостев. Примечательно, что пользователи отдавали ей предпочтение даже перед вариантом GPT-5.2-High с расширенным рассуждением, который в настоящее время занимает 52-е место на Arena. «Для сравнения, GPT-5.3-Chat, предыдущая модель по умолчанию в ChatGPT, была значительно менее конкурентоспособной, занимая 44-е место в общем зачете — на 32 позиции ниже GPT-5.2-Chat».
Что предприятиям нужно делать с источниками памяти
Организациям, которые полагаются на ChatGPT в определенных задачах, потребуется формализовать принципы работы памяти для своего стека. Источники памяти не ограничиваются GPT-5.5 Instant; эта функция включена для всех моделей на платформе ChatGPT.
Чтобы решить проблему конкурирующих источников памяти, предприятиям необходимо провести аудит управления памятью. Контекст, о котором сообщает модель, может пересекаться с этими логами или противоречить им, поэтому лучше всего определить единый достоверный источник (source of truth). В случае сбоя администраторы будут точно знать, какому логу верить.
Также было бы неплохо решить, стоит ли предоставлять пользователям доступ к источникам памяти. ChatGPT показывает лишь определенное количество чатов или файлов, использованных для выполнения запроса. Некоторым пользователям такая прозрачность покажется более заслуживающей доверия.
В конечном счете, главное, что предприятия должны помнить об источниках памяти: контекст, о котором заявляет модель, не дает полной картины для проведения аудита. Это форма наблюдаемости, но она не выдерживает полноценной проверки.



