Пчелин К.К. - Машинное обучение с подкреплением - 8. DPO и семейство offline-методов

3 тыс. подписчиков

12+
12+

9 просмотров

3 месяца назад

ПожаловатьсяНарушение авторских прав

Пчелин К.К. - Машинное обучение с подкреплением - 8. DPO и семейство offline-методов

3 тыс. подписчиков

12+
12+

9 просмотров

3 месяца назад

ПожаловатьсяНарушение авторских прав
12+
12+

9 просмотров

3 месяца назад

Direct Preference Optimization и семейство offline-методов Пчелин Константин Константинович 00:16 Введение 03:47 Мотивация: ограничения RLHF с PPO 06:39 Вывод DPO 19:43 Rejection Sampling Fine-Tuning 27:15 Патологии DPO и практические рецепты 42:01 IPO, KTO и другие методы семейства 52:35 Оценка алгоритмов выравнивания 55:23 Сравнение алгоритмов Ссылка на плейлист Teach-In: https://teach-in.ru/course/reinforcement-learning Ссылка на плейлист YouTube: https://www.youtube.com/playlist?list=PLcsjsqLLSfNBlD-_pB_YGAVNNOu1BKHPW Ссылка на плейлист VK: https://vkvideo.ru/playlist/-176441665_867 Ссылка на плейлист RuTube: https://rutube.ru/plst/1513664 #teach_in #мгу #msu #мехмат #mechanics_and_mathematics #лекции #lectures #Пчелин #Pchelin #Миронов #Mironov #машинное_обучение #machine_learning #обучение_с_подкреплением #reinforcement_learning #RL #DPO #offline_методы #offline_methods #RFT #rejection_sampling_fine_tuning #IPO #KTO #SimPO

, чтобы оставлять комментарии