Для задротов

RLHF

обучение с подкреплением на оценках людей / reinforcement learning from human feedback

Что это
Люди сравнивают ответы модели, и её учат давать те, что оценят выше
По-человечески
Учёба на оценках людей
Зачем вам это знать
Объясняет, откуда склонность угождать

Подробно — в главах

Точнее: гл. 2, «Для задротов».

Встречается в тексте