Posterior win probability models each optimization claim as a Beta distribution parameterised by \(\alpha\) and \(\beta\), where observed rank improvements act as successful Bernoulli trials to update the expected win rate for subsequent Thompson sampling.
flowchart TD
subgraph Prior["Prior Belief"]
P0["Beta(α₀, β₀)<br/>Flat / Initial Uncertainty"]
end
subgraph Trials["Observed Snippet Trials"]
T1["Snippet vs Competitor Re-ranking"]
S["Successes (k)<br/>Rank Improvement"]
F["Failures (n - k)<br/>No Gain / Drop"]
end
subgraph Posterior["Posterior Win Probability"]
P1["Beta(α₀ + k, β₀ + n - k)<br/>Peaked Win Rate Distribution"]
end
subgraph Decision["Next Iteration"]
TS["Thompson Sampling<br/>Select Next Claim / Edit"]
end
P0 --> T1
T1 --> S
T1 --> F
S --> P1
F --> P1
P1 --> TS
TS -.->|Iterate| T1