Новая модель DeepSeek-OCR: Революция в распознавании текста
Команда исследователей из DeepSeek продемонстрировала инновационный подход к распознаванию текста с помощью своей новой модели DeepSeek-OCR. В отличие от традиционных систем, которые работают с текстовыми токенами, данная модель использует визуальные представления страниц. Это кардинально меняет методы хранения и анализа данных.
Традиционные OCR-системы преобразуют текст в токены, что требует значительных вычислительных ресурсов, особенно для длинных документов. DeepSeek предлагает альтернативу: текст сначала преобразуется в изображение, затем кодируется в компактные визуальные токены с помощью DeepEncoder и в итоге восстанавливается обратно в текст. Это позволяет значительно сократить затраты при сохранении аналогичной точности.
В ходе экспериментов модель показала впечатляющие результаты. При сжатии в десять раз точность составила около 97%, а при двадцатикратном — около 60%. Это открывает возможности для хранения длинных документов без потери смысла и делает процесс более эффективным.
Архитектура DeepSeek-OCR включает три основных этапа: локальное внимание для детального захвата, свёрточное сжатие в 16 раз и глобальное внимание для анализа структуры страницы. Также внедрён механизм забывания, который позволяет постепенно снижать разрешение старого контекста, освобождая место для новой информации.