Событие · 2021-01
Мультимодальное понимание
CLIP
Общее пространство для текста и изображений — фундамент, на котором выросла вся генерация картинок.
CLIP обучалась сопоставлять изображения с текстовыми описаниями из интернета и тем самым поместила две модальности в общее пространство признаков. Это позволило задавать визуальные категории словами без отдельной разметки под каждую задачу и стало важной опорой для последующих генеративных и мультимодальных систем.
Источники
OpenAIОткрыть первоисточник