DeepShopper Reward V1 β€” pairwise Bradley-Terry outfit reward (Qwen3-4B)

Reward V1: a Qwen3-4B AutoModelForSequenceClassification (scalar value head) warm-started from V0 and trained with margin Bradley-Terry loss on gold-vs-corrupted preference pairs β€” to discriminate good outfits, fixing V0's gender/structure blindness.

  • Data: flavianv/deepshopper-reward-pairs β€” 93k train pairs, 5 corruption types (gender_flip, item_swap, duplicate_role, count_drop, cross_need); larger margin for gender_flip.
  • Held-out ranking accuracy: overall 0.995, gender_flip 0.999 (V0 was flat on gender), duplicate_role 1.0, count_drop 0.998, cross_need 0.993, item_swap 0.987.
  • Use: score an outfit (system bundle prompt + need + ### Item i: role\ntitle) β†’ scalar reward (higher = better).
  • Note: "good" = resembling observed/sold bundles (purchase-likeness), the intended objective; still a learned proxy for real sales.

Code: https://github.com/clijo/reco-rl (branch outfit_bundle).

Downloads last month
40
Safetensors
Model size
4B params
Tensor type
BF16
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for flavianv/qwen4b-reward-pairwise-v1

Finetuned
Qwen/Qwen3-4B
Finetuned
(1029)
this model