Пчелин К.К. - Машинное обучение с подкреплением - 6. Actor-Critic и Proximal Policy Optimization
Пчелин К.К. - Машинное обучение с подкреплением - 6. Actor-Critic и Proximal Policy Optimization
Actor-Critic и Proximal Policy Optimization Пчелин Константин Константинович 00:16 Вступление 02:16 REINFORCE: краткое повторение 07:54 Advantage-функция и TD-ошибка 16:15 Actor-Critic 37:14 Trust Region: основы 51:51 Proximal Policy Optimization (PPO) 01:12:25 PPO для языковых моделей (RLHF) 01:17:58 Практические советы для PPO и RLHF Ссылка на плейлист Teach-In: https://teach-in.ru/course/reinforcement-learning Ссылка на плейлист YouTube: https://www.youtube.com/playlist?list=PLcsjsqLLSfNBlD-_pB_YGAVNNOu1BKHPW Ссылка на плейлист VK: https://vkvideo.ru/playlist/-176441665_867 Ссылка на плейлист RuTube: https://rutube.ru/plst/1513664 teach_in #мгу #msu #мехмат #mechanics_and_mathematics #лекции #lectures #Пчелин #Pchelin #Миронов #Mironov #машинное_обучение #machine_learning #обучение_с_подкреплением #reinforcement_learning #RL #policy_gradient_method #REINFORCE #actor_critic #TRPO #PPO #RLHF