推理和正确率
-
推理长度越长不一定会让正确率提高
核心贡献:本文用 Bayesian empirical likelihood 构造 contextual bandit policy value 的联合后验和差值后验,使小样本 off-policy policy evaluation 与 policy comparison 能获得更稳健的不确定性量化。
核心贡献:本文在 DSACv1 基础上提出 DSAC-T/DSACv2,通过 expected value substitution、twin value distribution learning 和 variance-based critic gradient adjustment 降低 critic 梯度随机性与 Q-value 估计偏差,在连续控制基准和真实移动机器人任务中提升稳定性与性能。