
關於KL懲罰,Frozen Model,Entropy,Advantage Function ,Value Function,Bradley-Terry 偏好模型
(Ken Cen出品)Generative AI第28部 LLM 對齊革命 - PPO X DPO 策略優化
InstructorKen CenDuration5h 18m
Students86
Rating5.0 (1)

關於KL懲罰,Frozen Model,Entropy,Advantage Function ,Value Function,Bradley-Terry 偏好模型
InstructorKen Cen






