Для задротов
RLHF
обучение с подкреплением на оценках людей / reinforcement learning from human feedback
- Что это
- Люди сравнивают ответы модели, и её учат давать те, что оценят выше
- По-человечески
- Учёба на оценках людей
- Зачем вам это знать
- Объясняет, откуда склонность угождать
Подробно — в главах
Точнее: гл. 2, «Для задротов».