joshua400 commited on
Commit
5fdf073
ยท
1 Parent(s): 4a433cc

๐Ÿ FINAL SUBMISSION: Fair-GRPO-RLVR (The Honest Version)

Browse files
Files changed (1) hide show
  1. build_notebook_user.py +2 -0
build_notebook_user.py CHANGED
@@ -368,6 +368,8 @@ print("Multi-objective RL with fairness, safety, and utility optimization")
368
  b_r = df['baseline_reward'].mean()
369
  t_r = df['trained_reward'].mean()
370
  b_f = df['baseline_fairness'].mean()
 
 
371
  improvement_r = t_r - b_r
372
  improvement_f = t_f - b_f
373
  percent_r = (improvement_r / (abs(b_r) + 1e-5)) * 100
 
368
  b_r = df['baseline_reward'].mean()
369
  t_r = df['trained_reward'].mean()
370
  b_f = df['baseline_fairness'].mean()
371
+ t_f = df['trained_fairness'].mean()
372
+
373
  improvement_r = t_r - b_r
374
  improvement_f = t_f - b_f
375
  percent_r = (improvement_r / (abs(b_r) + 1e-5)) * 100