Skip to content

Commit 21b9a30

Browse files
committed
Deploying to gh-pages from @ aa780e6 🚀
1 parent beddcea commit 21b9a30

1 file changed

Lines changed: 2 additions & 2 deletions

File tree

_modules/ding/policy/ppg.html

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -581,7 +581,7 @@ <h1>Source code for ding.policy.ppg</h1><div class="highlight"><pre>
581581
<span class="n">policy_output</span> <span class="o">=</span> <span class="bp">self</span><span class="o">.</span><span class="n">_learn_model</span><span class="o">.</span><span class="n">forward</span><span class="p">(</span><span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;obs&#39;</span><span class="p">],</span> <span class="n">mode</span><span class="o">=</span><span class="s1">&#39;compute_actor&#39;</span><span class="p">)</span>
582582
<span class="n">policy_error_data</span> <span class="o">=</span> <span class="n">ppo_policy_data</span><span class="p">(</span>
583583
<span class="n">policy_output</span><span class="p">[</span><span class="s1">&#39;logit&#39;</span><span class="p">],</span> <span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;logit&#39;</span><span class="p">],</span> <span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;action&#39;</span><span class="p">],</span> <span class="n">policy_adv</span><span class="p">,</span>
584-
<span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;weight&#39;</span><span class="p">]</span>
584+
<span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;weight&#39;</span><span class="p">],</span> <span class="kc">None</span>
585585
<span class="p">)</span>
586586
<span class="n">ppo_policy_loss</span><span class="p">,</span> <span class="n">ppo_info</span> <span class="o">=</span> <span class="n">ppo_policy_error</span><span class="p">(</span><span class="n">policy_error_data</span><span class="p">,</span> <span class="bp">self</span><span class="o">.</span><span class="n">_clip_ratio</span><span class="p">)</span>
587587
<span class="n">policy_loss</span> <span class="o">=</span> <span class="n">ppo_policy_loss</span><span class="o">.</span><span class="n">policy_loss</span> <span class="o">-</span> <span class="bp">self</span><span class="o">.</span><span class="n">_entropy_weight</span> <span class="o">*</span> <span class="n">ppo_policy_loss</span><span class="o">.</span><span class="n">entropy_loss</span>
@@ -1236,7 +1236,7 @@ <h1>Source code for ding.policy.ppg</h1><div class="highlight"><pre>
12361236
<span class="c1"># Policy Phase(Policy)</span>
12371237
<span class="n">policy_output</span> <span class="o">=</span> <span class="bp">self</span><span class="o">.</span><span class="n">_learn_model</span><span class="o">.</span><span class="n">forward</span><span class="p">(</span><span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;obs&#39;</span><span class="p">],</span> <span class="n">mode</span><span class="o">=</span><span class="s1">&#39;compute_actor&#39;</span><span class="p">)</span>
12381238
<span class="n">policy_error_data</span> <span class="o">=</span> <span class="n">ppo_policy_data</span><span class="p">(</span>
1239-
<span class="n">policy_output</span><span class="p">[</span><span class="s1">&#39;logit&#39;</span><span class="p">],</span> <span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;logit&#39;</span><span class="p">],</span> <span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;action&#39;</span><span class="p">],</span> <span class="n">policy_adv</span><span class="p">,</span> <span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;weight&#39;</span><span class="p">]</span>
1239+
<span class="n">policy_output</span><span class="p">[</span><span class="s1">&#39;logit&#39;</span><span class="p">],</span> <span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;logit&#39;</span><span class="p">],</span> <span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;action&#39;</span><span class="p">],</span> <span class="n">policy_adv</span><span class="p">,</span> <span class="n">policy_data</span><span class="p">[</span><span class="s1">&#39;weight&#39;</span><span class="p">],</span> <span class="kc">None</span>
12401240
<span class="p">)</span>
12411241
<span class="n">ppo_policy_loss</span><span class="p">,</span> <span class="n">ppo_info</span> <span class="o">=</span> <span class="n">ppo_policy_error</span><span class="p">(</span><span class="n">policy_error_data</span><span class="p">,</span> <span class="bp">self</span><span class="o">.</span><span class="n">_clip_ratio</span><span class="p">)</span>
12421242
<span class="n">policy_loss</span> <span class="o">=</span> <span class="n">ppo_policy_loss</span><span class="o">.</span><span class="n">policy_loss</span> <span class="o">-</span> <span class="bp">self</span><span class="o">.</span><span class="n">_entropy_weight</span> <span class="o">*</span> <span class="n">ppo_policy_loss</span><span class="o">.</span><span class="n">entropy_loss</span>

0 commit comments

Comments
 (0)