Команда исследователей из Meta AI создала инновационную модель обработки изображений под названием Pixio. Эта модель обучается путем реконструкции пикселей и показывает лучшие результаты по сравнению с более сложными методами, такими как DINOv2 и DINOv3, несмотря на меньшее количество параметров. В отличие от традиционных подходов, где скрывают части изображений для заполнения, Pixio использует улучшенный маскированный автокодировщик (MAE) с тремя ключевыми изменениями: более мощный декодер, увеличенные замаскированные области и добавление токенов классов.
Команда собрала два миллиарда изображений для обучения, избегая оптимизации под конкретные тестовые наборы, что позволяет Pixio демонстрировать высокую точность, превышающую DINOv3 на 16% при оценке монокулярной глубины. Однако метод имеет ограничения, и исследователи рассматривают возможность перехода на обучение с использованием видео, что может улучшить результаты. Код модели доступен на GitHub.