Пчелин К.К. - Машинное обучение с подкреплением - 9. GRPO и online RL с верифицируемыми наградами
Пчелин К.К. - Машинное обучение с подкреплением - 9. GRPO и online RL с верифицируемыми наградами
GRPO и online RL с верифицируемыми наградами Пчелин Константин Константинович 00:16 Введение 01:58 Почему после RFT нужен онлайн RL 19:18 Постановка задачи 25:39 Групповая относительная награда 34:01 GRPO как вариант PPO без critic 41:46 Верифицируемые награды и best-of-G эффект 46:41 Псевдокод и практические рецепты 53:03 Failure modes и борьба с ними Ссылка на плейлист Teach-In: https://teach-in.ru/course/reinforcement-learning Ссылка на плейлист YouTube: https://www.youtube.com/playlist?list=PLcsjsqLLSfNBlD-_pB_YGAVNNOu1BKHPW Ссылка на плейлист VK: https://vkvideo.ru/playlist/-176441665_867 Ссылка на плейлист RuTube: https://rutube.ru/plst/1513664 #teach_in #мгу #msu #мехмат #mechanics_and_mathematics #лекции #lectures #Пчелин #Pchelin #Миронов #Mironov #машинное_обучение #machine_learning #обучение_с_подкреплением #reinforcement_learning #RL #GRPO #online_RL #PG_theorem