Ssentry loop
Replaying recorded run
WORKER · QWEN2.5-1.5B · GRPO

Watch the learning signal unfold.

A timed replay of 216 measurements from the original training run. No model is training now and no values are generated by this page.

Open 3D Arena ↗
STEP000 / 216optimizer update
REWARDgroup mean
LOSSoptimization signal
KLpolicy divergence
MEAN LENGTHoutput tokens
01

Total reward

Higher is better
02

Training loss

Optimizer output
03

KL divergence

Distance from reference
04

Completion length

Mean generated tokens