Ting

Ting

满怀希望就会所向披靡

AI Agent· 第六讲 生成式人工智能后训练

后训练简介 Post training(Continual Learning)

  • alignment和post training的区别
    • 后训练使用的fundation model可以是instruct model(已经经历过alignment的model),也可以是pre-training之后的。而alignment的只是pre-training后的
    • alignment的偏好调整是让模型的行为更符合人类或产品希望的偏好(不一定要训练,训练是实现的一个方法),post-training的偏好调整是对模型本身的再训练
  • 后训练的例子(给某个模型训练另一种语言)

论文 · Bayesian Inference of Contextual Bandit Policies via Empirical Likelihood

基础信息

  • 会议/期刊:Journal of Machine Learning Research 27 (2026), 1-28
  • 关键词:empirical likelihood, contextual bandit, off-policy evaluation, Bayesian inference, policy comparison

核心贡献:本文用 Bayesian empirical likelihood 构造 contextual bandit policy value 的联合后验和差值后验,使小样本 off-policy policy evaluation 与 policy comparison 能获得更稳健的不确定性量化。

论文 · Distributional Soft Actor-Critic With Three Refinements

基础信息

  • 会议/期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence, Vol. 47, No. 5, May 2025
  • 关键词:reinforcement learning, soft actor-critic, distributional RL, value overestimation, continuous control

核心贡献:本文在 DSACv1 基础上提出 DSAC-T/DSACv2,通过 expected value substitution、twin value distribution learning 和 variance-based critic gradient adjustment 降低 critic 梯度随机性与 Q-value 估计偏差,在连续控制基准和真实移动机器人任务中提升稳定性与性能。

0%