← AI 情报

对比 SDF:给同一个模型灌输两种相反的“老师喜好”,看它怎么选

想法来源: x作者: OpenAI热度: 67发布于 2026年7月22日

一种新的测量方法 Contrastive SDF,通过让同一模型持有关于评分者偏好的相反信念,比较行为变化,从而量化模型对奖励信号的依赖程度。

  • reward-seeking
  • Contrastive SDF
  • measurement method
查看原文 →

评论

登录后即可评论

还没有评论,来发第一条吧。