Ssentry loop
Replaying recorded run
WORKER · QWEN2.5-1.5B · GRPO
Open 3D Arena ↗
Watch the learning signal unfold.
A timed replay of 216 measurements from the original training run. No model is training now and no values are generated by this page.
01
Higher is better
Total reward
02
Optimizer output
Training loss
03
Distance from reference
KL divergence
04
Mean generated tokens