(Ken Cen出品)Generative AI第27部 強化學習模型RLHF 與 策略梯度優化

關於 Reward Model 獎勵模型,Trajectory 軌跡,Q function Q 函數, Value function 價值函數, Advantage function 優勢函數, Offline Policy 離線策略

(Ken Cen出品)Generative AI第27部 強化學習模型RLHF 與 策略梯度優化

InstructorKen Cen
Duration5h 4m
Students85
Rating5.0 (2)