Spaces:
Sleeping
Sleeping
joshua400 commited on
Commit ·
067b681
1
Parent(s): 1c2fa82
Fix Pydantic typing error for Request
Browse files- README.md +3 -3
- assets/fairness_vs_episode.png +0 -0
- assets/fairness_vs_steps.png +0 -0
- assets/reward_vs_episode.png +0 -0
- assets/reward_vs_steps.png +0 -0
- assets/score_heatmap.png +0 -0
- assets/training_loss.png +0 -0
- assets/training_results.png +0 -0
- assets/utility_vs_fairness.png +0 -0
- fairness_vs_episode.png +0 -0
- fairness_vs_steps.png +0 -0
- reward_vs_episode.png +0 -0
- reward_vs_steps.png +0 -0
- server/app.py +1 -1
- utility_vs_fairness.png +0 -0
README.md
CHANGED
|
@@ -122,17 +122,17 @@ Prompt --> LLM generates action (JSON) --> Environment executes
|
|
| 122 |
### Reward vs Training Step
|
| 123 |
Shows reward improvement over GRPO training iterations compared to random baseline.
|
| 124 |
|
| 125 |
-
|
| 126 |
|
| 127 |
### Fairness: Baseline vs Trained
|
| 128 |
Demonstrates that the trained agent achieves better fairness scores (closer to 0) than the random baseline.
|
| 129 |
|
| 130 |
-
|
| 131 |
|
| 132 |
### Component Rewards Breakdown
|
| 133 |
Shows how R_exec (utility) and R_fair (fairness) improve after training.
|
| 134 |
|
| 135 |
-
|
| 136 |
|
| 137 |
---
|
| 138 |
|
|
|
|
| 122 |
### Reward vs Training Step
|
| 123 |
Shows reward improvement over GRPO training iterations compared to random baseline.
|
| 124 |
|
| 125 |
+
`plots/reward_vs_episode.png`
|
| 126 |
|
| 127 |
### Fairness: Baseline vs Trained
|
| 128 |
Demonstrates that the trained agent achieves better fairness scores (closer to 0) than the random baseline.
|
| 129 |
|
| 130 |
+
`plots/fairness_vs_episode.png`
|
| 131 |
|
| 132 |
### Component Rewards Breakdown
|
| 133 |
Shows how R_exec (utility) and R_fair (fairness) improve after training.
|
| 134 |
|
| 135 |
+
`plots/component_rewards.png`
|
| 136 |
|
| 137 |
---
|
| 138 |
|
assets/fairness_vs_episode.png
CHANGED
|
|
Git LFS Details
|
assets/fairness_vs_steps.png
CHANGED
|
|
Git LFS Details
|
assets/reward_vs_episode.png
CHANGED
|
|
Git LFS Details
|
assets/reward_vs_steps.png
CHANGED
|
|
Git LFS Details
|
assets/score_heatmap.png
CHANGED
|
|
Git LFS Details
|
assets/training_loss.png
CHANGED
|
|
Git LFS Details
|
assets/training_results.png
CHANGED
|
|
Git LFS Details
|
assets/utility_vs_fairness.png
CHANGED
|
|
Git LFS Details
|
fairness_vs_episode.png
CHANGED
|
|
Git LFS Details
|
fairness_vs_steps.png
CHANGED
|
|
Git LFS Details
|
reward_vs_episode.png
CHANGED
|
|
Git LFS Details
|
reward_vs_steps.png
CHANGED
|
|
Git LFS Details
|
server/app.py
CHANGED
|
@@ -7,6 +7,7 @@ Mirrors hallucination-detector-gym server/app.py pattern exactly.
|
|
| 7 |
from __future__ import annotations
|
| 8 |
import os, sys
|
| 9 |
from typing import Optional
|
|
|
|
| 10 |
|
| 11 |
sys.path.insert(0, os.path.dirname(os.path.dirname(__file__)))
|
| 12 |
|
|
@@ -24,7 +25,6 @@ configure_logging(json_output=True, log_level="INFO")
|
|
| 24 |
|
| 25 |
|
| 26 |
def _build_app():
|
| 27 |
-
from fastapi import FastAPI, Request
|
| 28 |
from fastapi.responses import JSONResponse, RedirectResponse
|
| 29 |
import gradio as gr
|
| 30 |
|
|
|
|
| 7 |
from __future__ import annotations
|
| 8 |
import os, sys
|
| 9 |
from typing import Optional
|
| 10 |
+
from fastapi import FastAPI, Request
|
| 11 |
|
| 12 |
sys.path.insert(0, os.path.dirname(os.path.dirname(__file__)))
|
| 13 |
|
|
|
|
| 25 |
|
| 26 |
|
| 27 |
def _build_app():
|
|
|
|
| 28 |
from fastapi.responses import JSONResponse, RedirectResponse
|
| 29 |
import gradio as gr
|
| 30 |
|
utility_vs_fairness.png
CHANGED
|
|
Git LFS Details
|