1. Offline RL: SAC+BC
回忆提纲
做什么:从 offline (s, a) dataset 中采样. BC loss 让 policy(s_sample) 接近 a_sample。Q loss 让 policy(s_sample) 的得分更高.
本章节训练部分的 Q loss 和 SAC 基本一样,但魔改为 2 critic + 2 target critic (上划线为 target):

而 actor loss 添加了 alpha * BC 损失. alpha 取值 3 ~ 1000 不等,显然这个东西比较难调.

回答问题
Cube 任务:看起来模仿学习权重 300 和 100 是比较好的,对权重也是相当敏感(另外,我代码里忘记除以 |A| 了):

根据教程,q_min 应该收敛到 -50 ~ -70 而 q_max 应该收敛到 0,确实如此:

Ant soccer 任务:
看起来 a = 3 和 a = 10 比较好:


2. IQL
回忆提纲

回答问题
下图中的 a 是指数 exp(alpha * A) 的 alpha. 可以看出,cube 任务 a=1,3,10 都不错,而 ant 任务是 a=10 最好.

