CLIP
Общее пространство для текста и изображений — фундамент, на котором выросла вся генерация картинок.
Одной и той же модели теперь можно показать картинку, дать послушать запись или включить видео — и она поймёт всё это вместе, а не по отдельности.
Одна модель принимает текст, картинку, звук и видео и отвечает в реальном времени. Компьютер получил органы чувств вместо поля ввода.
Общее пространство для текста и изображений — фундамент, на котором выросла вся генерация картинок.
Распознавание речи дошло до уровня, при котором звук стал обычным входом, а не отдельной задачей.
Зрение как штатная часть большой модели.
Задержка диалога упала до человеческой.
Час записи модель уже принимает, но следить за сюжетом и причинами внутри него ещё не умеет.
Модальности, для которых пока нет ни дешёвых датчиков, ни больших наборов данных.