InstructGPT
Выравнивание по инструкциям — модель начала слушаться.
Модель научили отвечать так, как人 удобно человеку: обычными словами, по делу и следуя просьбе. Ради этого людей просили сравнивать варианты ответов, и на этих сравнениях модель дообучали.
Обучение на человеческих предпочтениях превратило языковую модель в собеседника. Естественный язык стал универсальным интерфейсом к вычислениям.
Выравнивание по инструкциям — модель начала слушаться.
Самое быстрое проникновение технологии в истории.
Обучение по своду принципов вместо ручной разметки каждого ответа.
Результаты человеческого уровня на профессиональных экзаменах вывели ИИ из категории игрушек.
Модель, обученная нравиться, склонна соглашаться. Отучить её поддакивать — открытая задача выравнивания.
Заменить оценку «понравился ли ответ» на оценку «сработал ли результат в реальности».