No-regret learning experiments

Setup

We perform experiments on a Bernoulli bandit environment. When you pull an arm, you get either a unit reward or nothing. Each arm has a different fixed probability of giving you the reward. Start by trying it yourself!

Pulled 0 times
Total reward: 0
Average reward: NaN
Pulled 0 times
Total reward: 0
Average reward: NaN
Pulled 0 times
Total reward: 0
Average reward: NaN
Pulled 0 times
Total reward: 0
Average reward: NaN