During each optimization round, Thompson sampling selects a hypothesis by drawing a random win probability \(\theta_i \sim \text{Beta}(\alpha_i, \beta_i)\) for each candidate claim within a chosen rank factor class, selecting \(\arg\max \theta_i\) to balance testing unproven edits against exploiting high-performing patterns.
Referenced by