The optimization loop models each hypothesis as a Beta(α, β) distribution, using an acquisition policy to select claims, test iterative edits across multiple ranker samples, and update posterior probabilities until the target page reaches rank one or rounds expire.

sequenceDiagram
    participant S as Seeder
    participant A as Acquisition
    participant I as Ideator
    participant R as Ranker
    participant B as Beta Posterior

    S->>B: Seed initial claims & priors Beta(α, β)
    loop Each Round (until Rank 1 or limit)
        B->>A: Sample claims via Acquisition Policy
        A->>I: Select winning claim/hypothesis
        I->>R: Generate edited snippet/page
        R->>R: Rank variant vs competitors (N samples)
        alt Observed Rank Improved
            R->>B: Reward = 1 (α += 1)
        else Observed Rank Stagnant / Worse
            R->>B: Reward = 0 (β += 1)
        end
    end