Назад в раздел
Событие · 2021-01

Мультимодальное понимание

CLIP

Общее пространство для текста и изображений — фундамент, на котором выросла вся генерация картинок.

CLIP обучалась сопоставлять изображения с текстовыми описаниями из интернета и тем самым поместила две модальности в общее пространство признаков. Это позволило задавать визуальные категории словами без отдельной разметки под каждую задачу и стало важной опорой для последующих генеративных и мультимодальных систем.

Источники
OpenAIОткрыть первоисточник