2 Matching Annotations
  1. Last 7 days
    1. 行为克隆(Behavior Cloning)与负对数似然训练目标
      1. 行为克隆:通过监督学习拟合专家的状态到动作映射。
      2. 负对数似然(NLL)为什么能训练行为克隆?设计loss时, 最大化专家动作的预测概率。 注意:最大化的是专家动作的概率,不是直接最大化机器人完成任务的成功率。两者相关,但并不完全等价。
    1. 单体式与层次式如何取舍

      分2类: 1. 单体式:同一个网络承接多个任务。 同时又分为 单系统(同时生成文字和动作指令)和双系统(外挂一个专家模型)。 2. 层次式:先规划再执行。