会员
众包
新闻
博问
闪存
云市场
所有博客
当前博客
a56爆大奖在线娱乐的博客
a56爆大奖在线娱乐的园子
账号设置
简洁模式
...
退出登录
注册
登录
月出兮彩云归 ?
首页
新随笔
联系
订阅
管理
2024年1月21日
offline RL | ABM:从 offline dataset 的好 transition 提取 prior policy
摘要: 对于 policy improvement,maximize Q(s, π(s)) ,同时约束 π 与一个 prior policy 的 KL 散度,prior policy 用 advantage 非负的 offline 状态转移计算。
阅读全文
posted @ 2024-01-21 11:26 MoonOut
阅读(70)
评论(0)
推荐(0)
编辑
PbRL | 速通 ICLR 2024 RLHF · PbRL
摘要: OpenReview 检索关键词:ICLR 2024、reinforcement learning、preference、human feedback。
阅读全文
posted @ 2024-01-21 11:17 MoonOut
阅读(173)
评论(0)
推荐(0)
编辑
公告