@@ -581,7 +581,7 @@ <h1>Source code for ding.policy.ppg</h1><div class="highlight"><pre>
581581 < span class ="n "> policy_output</ span > < span class ="o "> =</ span > < span class ="bp "> self</ span > < span class ="o "> .</ span > < span class ="n "> _learn_model</ span > < span class ="o "> .</ span > < span class ="n "> forward</ span > < span class ="p "> (</ span > < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'obs'</ span > < span class ="p "> ],</ span > < span class ="n "> mode</ span > < span class ="o "> =</ span > < span class ="s1 "> 'compute_actor'</ span > < span class ="p "> )</ span >
582582 < span class ="n "> policy_error_data</ span > < span class ="o "> =</ span > < span class ="n "> ppo_policy_data</ span > < span class ="p "> (</ span >
583583 < span class ="n "> policy_output</ span > < span class ="p "> [</ span > < span class ="s1 "> 'logit'</ span > < span class ="p "> ],</ span > < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'logit'</ span > < span class ="p "> ],</ span > < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'action'</ span > < span class ="p "> ],</ span > < span class ="n "> policy_adv</ span > < span class ="p "> ,</ span >
584- < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'weight'</ span > < span class ="p "> ]</ span >
584+ < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'weight'</ span > < span class ="p "> ], </ span > < span class =" kc " > None </ span >
585585 < span class ="p "> )</ span >
586586 < span class ="n "> ppo_policy_loss</ span > < span class ="p "> ,</ span > < span class ="n "> ppo_info</ span > < span class ="o "> =</ span > < span class ="n "> ppo_policy_error</ span > < span class ="p "> (</ span > < span class ="n "> policy_error_data</ span > < span class ="p "> ,</ span > < span class ="bp "> self</ span > < span class ="o "> .</ span > < span class ="n "> _clip_ratio</ span > < span class ="p "> )</ span >
587587 < span class ="n "> policy_loss</ span > < span class ="o "> =</ span > < span class ="n "> ppo_policy_loss</ span > < span class ="o "> .</ span > < span class ="n "> policy_loss</ span > < span class ="o "> -</ span > < span class ="bp "> self</ span > < span class ="o "> .</ span > < span class ="n "> _entropy_weight</ span > < span class ="o "> *</ span > < span class ="n "> ppo_policy_loss</ span > < span class ="o "> .</ span > < span class ="n "> entropy_loss</ span >
@@ -1236,7 +1236,7 @@ <h1>Source code for ding.policy.ppg</h1><div class="highlight"><pre>
12361236 < span class ="c1 "> # Policy Phase(Policy)</ span >
12371237 < span class ="n "> policy_output</ span > < span class ="o "> =</ span > < span class ="bp "> self</ span > < span class ="o "> .</ span > < span class ="n "> _learn_model</ span > < span class ="o "> .</ span > < span class ="n "> forward</ span > < span class ="p "> (</ span > < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'obs'</ span > < span class ="p "> ],</ span > < span class ="n "> mode</ span > < span class ="o "> =</ span > < span class ="s1 "> 'compute_actor'</ span > < span class ="p "> )</ span >
12381238 < span class ="n "> policy_error_data</ span > < span class ="o "> =</ span > < span class ="n "> ppo_policy_data</ span > < span class ="p "> (</ span >
1239- < span class ="n "> policy_output</ span > < span class ="p "> [</ span > < span class ="s1 "> 'logit'</ span > < span class ="p "> ],</ span > < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'logit'</ span > < span class ="p "> ],</ span > < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'action'</ span > < span class ="p "> ],</ span > < span class ="n "> policy_adv</ span > < span class ="p "> ,</ span > < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'weight'</ span > < span class ="p "> ]</ span >
1239+ < span class ="n "> policy_output</ span > < span class ="p "> [</ span > < span class ="s1 "> 'logit'</ span > < span class ="p "> ],</ span > < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'logit'</ span > < span class ="p "> ],</ span > < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'action'</ span > < span class ="p "> ],</ span > < span class ="n "> policy_adv</ span > < span class ="p "> ,</ span > < span class ="n "> policy_data</ span > < span class ="p "> [</ span > < span class ="s1 "> 'weight'</ span > < span class ="p "> ], </ span > < span class =" kc " > None </ span >
12401240 < span class ="p "> )</ span >
12411241 < span class ="n "> ppo_policy_loss</ span > < span class ="p "> ,</ span > < span class ="n "> ppo_info</ span > < span class ="o "> =</ span > < span class ="n "> ppo_policy_error</ span > < span class ="p "> (</ span > < span class ="n "> policy_error_data</ span > < span class ="p "> ,</ span > < span class ="bp "> self</ span > < span class ="o "> .</ span > < span class ="n "> _clip_ratio</ span > < span class ="p "> )</ span >
12421242 < span class ="n "> policy_loss</ span > < span class ="o "> =</ span > < span class ="n "> ppo_policy_loss</ span > < span class ="o "> .</ span > < span class ="n "> policy_loss</ span > < span class ="o "> -</ span > < span class ="bp "> self</ span > < span class ="o "> .</ span > < span class ="n "> _entropy_weight</ span > < span class ="o "> *</ span > < span class ="n "> ppo_policy_loss</ span > < span class ="o "> .</ span > < span class ="n "> entropy_loss</ span >
0 commit comments