MaxRL vs REINFORCE
Based on Tajwar et al. 2025 —
"Maximum Likelihood Reinforcement Learning"
← lcrh.github.io
Default Grid
Random Grid
Edit Grid
Single Start
Hard: 50%
Play
Reset
Speed
RL: max E
maze
[ p(success|maze) ]
MaxRL: max E
maze
[ log p(success|maze) ]
vibecoded by claude