Недавно была представлена новая нейросеть под названием CLIP (Contrastive Language–Image Pre-training), которая способна эффективно обучаться визуальным концепциям на основе естественного языкового управления. Это открывает новые горизонты для компьютерного зрения. В отличие от традиционных моделей, требующих большого объема помеченных данных, CLIP использует текстовые изображения, доступные в интернете, что значительно снижает затраты на создание обучающих наборов данных.
CLIP позволяет выполнять классификацию изображений без необходимости дополнительного обучения на конкретных задачах, что аналогично принципам «zero-shot» GPT-2 и GPT-3. Это означает, что моделям достаточно просто знать названия визуальных категорий для успешного выполнения задач.
Ключевое преимущество CLIP заключается в его гибкости: он может адаптироваться к разнообразным задачам классификации. При этом модели обеспечивают высокую точность, сравнимую с полностью обученными моделями, но без необходимости в дополнительных данных. Это может кардинально изменить подходы к обучению и применению нейросетей в компьютерном зрении.
*компания Meta Platforms Inc. признана экстремистской организацией, ее деятельность на территории России запрещена
