DeepSeek-OCR переосмысляет обработку текста с помощью ИИ
DeepSeek, китайская исследовательская компания в области искусственного интеллекта, которая неоднократно ставила под сомнение устоявшиеся представления о стоимости разработки ИИ, выпустила новую модель, которая кардинально меняет подход больших языковых моделей к обработке информации. При этом последствия данного шага выходят далеко за рамки скромного позиционирования новинки как инструмента оптического распознавания символов.
Фирменная модель DeepSeek-OCR, представленная в понедельник с полностью открытым исходным кодом и весами, реализует то, что исследователи называют инверсией парадигмы: сжатие текста посредством визуального представления с эффективностью, до 10 раз превышающей показатели традиционных текстовых токенов. Это открытие ставит под сомнение фундаментальное предположение в разработке ИИ и может проложить путь к языковым моделям с драматически расширенными окнами контекста, потенциально достигающими десятков миллионов токенов.
«Мы представляем DeepSeek-OCR в качестве предварительного исследования возможности сжатия длинных контекстов с помощью оптического двумерного маппинга, — написала исследовательская группа в своей технической статье. — Эксперименты показывают, что когда количество текстовых токенов не превышает количество визуальных более чем в 10 раз (то есть коэффициент сжатия < 10×), модель способна достигать точности декодирования (OCR) на уровне 97%».
Эти выводы на откликнулись во всем сообществе исследователей ИИ. Андрей Карпати, соучредитель OpenAI и бывший директор по искусственному интеллекту в Tesla, отметил в своей публикации, что данная работа поднимает фундаментальные вопросы о том, как именно системы ИИ должны обрабатывать информацию. «Возможно, имеет больший смысл, чтобы все входные данные для языковых моделей всегда представляли собой исключительно изображения, — написал Карпати. — Даже если у вас случайно есть чистый текстовый ввод, возможно, вы предпочтете сначала отрендерить его, а затем передать в таком виде».
Как DeepSeek добилась 10-кратного сжатия, обрабатывая текст как изображения
Хотя DeepSeek позиционировала релиз как модель OCR — технологию преобразования изображений текста в цифровые символы, — в исследовательской статье раскрываются более амбициозные цели. Модель демонстрирует, что визуальные представления могут служить превосходящей по эффективности средой сжатия для текстовой информации, инвертируя привычную иерархию, где текстовые токены считались более эффективными, чем визуальные.
«Традиционно токены визуальных языковых моделей казались чем-то второстепенным или «прикрученным» к парадигме языковых моделей, — написал Джеффри Эмануэль, исследователь в области ИИ, в подробном анализе статьи. — И 10 тысяч английских слов занимали бы гораздо больше места в мультимодальной языковой модели в виде различимых пикселей, чем в виде токенов… Но теперь идеи из этой работы переворачивают всё с ног на голову».
Архитектура модели состоит из двух основных компонентов: DeepEncoder, инновационного визуального энкодера с 380 миллионами параметров, и декодера языка на основе смеси экспертов (mixture-of-experts) с 3 миллиардами параметров (из которых 570 миллионов активны). DeepEncoder объединяет Segment Anything Model (SAM) от Meta для локального визуального восприятия с моделью CLIP от OpenAI для глобального понимания визуального контента, соединенных через 16-кратный модуль сжатия.
Чтобы подтвердить свои заявления о сжатии, исследователи DeepSeek протестировали модель на бенчмарке Fox — наборе данных с разнообразными макетами документов. Результаты оказались впечатляющими: используя всего 100 визуальных токенов, модель достигла точности в 97,3% на документах, содержащих 700–800 текстовых токенов, что соответствует эффективному коэффициенту сжатия 7,5x. Даже при коэффициентах сжатия, приближающихся к 20x, точность оставалась на уровне около 60%.
Практический эффект: обработка 200 000 страниц в день на одном графическом процессоре
Прирост эффективности напрямую отражается на производственных возможностях. По данным компании, один графический процессор Nvidia A100-40G способен обрабатывать более 200 000 страниц в день с помощью DeepSeek-OCR. При масштабировании до кластера из 20 серверов с восемью графическими процессорами на каждом пропускная способность достигает 33 миллионов страниц в сутки, чего достаточно для быстрого создания обучающих датасетов для других моделей ИИ.
В рамках OmniDocBench, комплексного бенчмарка для синтаксического анализа документов, DeepSeek-OCR превзошла GOT-OCR2.0 (которая использует 256 токенов на страницу), задействуя при этом всего 100 визуальных токенов. Что еще более показательно, модель обошла MinerU2.0, которой требуется в среднем более 6000 токенов на страницу, используя при этом менее 800 визуальных токенов.
DeepSeek спроектировала модель таким образом, чтобы она поддерживала пять различных режимов разрешения, каждый из которых оптимизирован под определенные коэффициенты сжатия и сценарии использования. Режим «Tiny» работает с разрешением 512×512 всего с 64 визуальными токенами, в то время как режим «Gundam» динамически комбинирует несколько разрешений для сложных документов. «Режим Gundam состоит из тайлов (локальных представлений) размером n×640×640 и глобального представления 1024×1024», — пишут исследователи.
Почему этот прорыв может открыть путь к окнам контекста в 10 миллионов токенов
Прорыв в области сжатия имеет немедленные последствия для одной из самых острых проблем в разработке ИИ: расширения контекстных окон, которые определяют, какой объем информации языковые модели могут удерживать в активном рассмотрении. Современные передовые модели обычно работают с контекстными окнами, измеряемыми сотнями тысяч токенов. Подход DeepSeek намекает на путь к окнам, которые в десять раз больше.
«Потенциал получения передовой языковой модели с контекстным окном в 10 или 20 миллионов токенов выглядит весьма воодушевляюще, — написал Эмануэль. — Вы можете по сути запихнуть все ключевые внутренние документы компании в преамбулу промта, закэшировать это в OpenAI, а затем просто добавлять поверх свой конкретный запрос или промт, не связываясь с поисковыми инструментами, и при этом сохранять высокую скорость и экономичность».
Исследователи прямо формулируют свою работу в контексте сжатия контекста для языковых моделей. «С помощью DeepSeek-OCR мы продемонстрируем, что визуально-текстовое сжатие позволяет добиться значительного сокращения токенов (в 7–20 раз) для различных этапов исторического контекста, предлагая многообещающее направление для решения проблем длинного контекста в больших языковых моделях», — отмечают они.
В документе приведена спекулятивная, но интригующая схема, иллюстрирующая, как этот подход может реализовать механизмы увядания памяти, схожие с человеческим познанием. Более старые раунды беседы могут постепенно подвергаться субдискретизации до более низких разрешений, потребляя меньше токенов при сохранении ключевой информации — форма вычислительного забывания, зеркально отражающая биологическую память.
Как визуальная обработка может решить проблему «некрасивых» токенизаторов
Помимо сжатия, Карпати подчеркнул, как этот подход бросает вызов фундаментальным предположениям о том, как языковые модели должны обрабатывать текст. Традиционные токенизаторы — системы, разбивающие текст на единицы для обработки — долгое время подвергались критике за их сложность и ограничения.
«Я уже высказывался о том, как сильно мне не нравится токенизатор, — написал Карпати. — Токенизаторы уродливы, отдельны и не работают по принципу end-to-end. Токенизатор «импортирует» всю некрасивость Юникода, байтовых кодировок, наследует массу исторического багажа и рисков безопасности/взлома (например, байты продолжения). Из-за него два символа, которые выглядят абсолютно одинаково для человеческого глаза, внутри сети могут выглядеть как два совершенно разных токена».
Визуальная обработка текста может устранить эти проблемы, одновременно открывая новые возможности. Этот подход естественным образом учитывает информацию о форматировании, которая теряется при чисто текстовом представлении: жирный шрифт, цвета, верстку, встроенные изображения. «Теперь входные данные могут обрабатываться с помощью двунаправленного внимания легко и по умолчанию, а не авторегрессионного внимания — это гораздо мощнее», — отметил Карпати.
Эти выводы перекликаются с когнитивными науками о человеке. Эмануэль провел параллель с Гансом Бете, знаменитым физиком, который запоминал огромные объемы справочных данных: «Иметь огромные массивы специфических для задачи знаний в рабочей памяти чрезвычайно полезно. Это выглядит как очень умный и аддитивный подход к потенциальному расширению этого банка памяти в 10 и более раз».
Обучение модели: 30 миллионов страниц PDF на 100 языках
Возможности модели базируются на обширном цикле обучения с использованием разнообразных источников данных. Компания DeepSeek собрала 30 миллионов страниц PDF, охватывающих примерно 100 языков, причем на китайский и английский приходится 25 миллионов страниц. Данные для обучения охватывают девять типов документов: академические статьи, финансовые отчеты, учебники, газеты, рукописные заметки и другие.
Помимо документного OCR, в обучение были внедрены данные так называемого «OCR 2.0»: 10 миллионов синтетических графиков, 5 миллионов химических формул и 1 миллион геометрических фигур. Модель также получила 20% общих визуальных данных для таких задач, как описание изображений и обнаружение объектов, плюс 10% чисто текстовых данных для поддержания языковых возможностей.
В процессе обучения использовался конвейерный параллелизм (pipeline parallelism) на 160 графических процессорах Nvidia A100-40G (20 узлов по 8 графических процессоров в каждом), причем визуальный энкодер был разделен между двумя стадиями конвейера, а языковая модель — еще между двумя. «Для мультимодальных данных скорость обучения составляет 70 млрд токенов в день», — сообщили исследователи.
Релиз с открытым исходным кодом ускоряет исследования и порождает вопросы о конкуренции
Оставаясь верной принципам открытой разработки DeepSeek, компания выпустила полные веса модели, код обучения и скрипты для инференса на GitHub и Hugging Face. По данным Dataconomy, репозиторий на GitHub набрал более 4000 звезд в течение 24 часов после релиза.
Этот прорыв вызывает вопросы о том, не разработали ли другие ИИ-лаборатории аналогичные методы, но сохранили их в секрете. Эмануэль предположил, что модели Gemini от Google, отличающиеся большими окнами контекста и высокой производительностью OCR, могут использовать сопоставимые подходы. «Насколько нам известно, Google могла уже разработать нечто подобное, что могло бы объяснить, почему у Gemini такой огромный размер контекста и почему она так хороша и быстра в задачах OCR», — написал Эмануэль.
Модель Gemini 2.5 Pro от Google предлагает окно контекста на 1 миллион токенов с планами расширения до 2 миллионов, хотя компания публично не детализировала технические подходы, обеспечивающие эту возможность. GPT-5 от OpenAI поддерживает 400 000 токенов, в то время как Claude 4.5 от Anthropic предлагает 200 000 токенов, а окно на 1 миллион токенов доступно в режиме бета-тестирования для соответствующих критериям организаций.
Открытый вопрос: способна ли языковая модель рассуждать на основе сжатых визуальных токенов?
Хотя результаты сжатия впечатляют, исследователи признают наличие важных открытых вопросов. «Не до конца понятно, как именно это взаимодействует с другими нисходящими (downstream) когнитивными функциями языковой модели, — отметил Эмануэль. — Способна ли модель рассуждать столь же интеллектуально на основе этих сжатых визуальных токенов, как и при использовании обычных текстовых токенов? Не делает ли это модель менее артикулированной из-за принудительного перехода к более ориентированной на визуальное восприятие модальности?»
Статья DeepSeek фокусируется в первую очередь на возможностях сжатия-декомпрессии, измеряемых по точности распознавания текста (OCR), а не на производительности последующих рассуждений. Это оставляет открытым вопрос о том, могут ли языковые модели эффективно рассуждать в рамках больших контекстов, представленных преимущественно в виде сжатых визуальных токенов.
Исследователи признают, что их работа представляет собой «первичное исследование границ визуально-текстового сжатия». Они отмечают, что «одного лишь OCR недостаточно для полной валидации истинного оптического сжатия контекста», и планируют дальнейшую работу, включая «цифро-оптическое чередующееся преобучение текста, тестирование на поиск иголки в стоге сена (needle-in-a-haystack) и другие оценки».
DeepSeek закрепила за собой репутацию компании, добивающейся конкурентных результатов при значительно меньших вычислительных ресурсах, чем западные ИИ-лаборатории. Более ранний релиз компании — модель DeepSeek-V3 — по сообщениям, обомшелся всего в 5,6 миллиона долларов на обучение (хотя эта цифра отражает только финальный прогон обучения и исключает расходы на R&D и инфраструктуру) по сравнению со ста миллионами долларов для аналогичных моделей от OpenAI и Anthropic.
Отраслевые аналитики ставят под сомнение цифру в 5,6 миллиона долларов: по некоторым оценкам, совокупные инфраструктурные и операционные расходы компании составляют ближе к 1,3 миллиарда долларов, что все же ниже затрат американских конкурентов.
Более широкая картина: должны ли языковые модели обрабатывать текст как изображения?
DeepSeek-OCR ставит перед разработкой ИИ фундаментальный вопрос: должны ли языковые модели обрабатывать текст как текст или как изображения текста? Исследование демонстрирует, что, по крайней мере в целях сжатия, визуальное представление предлагает значительные преимущества. Переведется ли это в эффективные рассуждения на базе огромных контекстов — еще предстоит выяснить.
«С другой стороны, оптическое сжатие контекста по-прежнему предоставляет значительный простор для исследований и улучшений, представляя собой перспективное новое направление», — заключили исследователи в своей статье.
Для индустрии ИИ эта работа добавляет новое измерение в гонку за более длинные контекстные окна — соревнование, которое усилилось по мере того, как языковые модели применяются для все более сложных задач, требующих огромных объемов информации. Открытый релиз гарантирует, что эта техника будет широко изучена, протестирована и, возможно, интегрирована в будущие системы искусственного.
Как сформулировал более глубокий смысл Карпати: «OCR — это лишь одна из многих полезных задач преобразования «визуальное → текст». И задачи «текст → текст» могут быть превращены в задачи «визуальное → текст». Но не наоборот». Другими словами, путь вперед для ИИ может пролегать не через лучшие токенизаторы — он может вообще обойти текстовые токены.



