The optimization loop models each hypothesis as a Beta(α, β) distribution, using an acquisition policy to select claims, test iterative edits across multiple ranker samples, and update posterior probabilities until the target page reaches rank one or rounds expire.
sequenceDiagram
participant S as Seeder
participant A as Acquisition
participant I as Ideator
participant R as Ranker
participant B as Beta Posterior
S->>B: Seed initial claims & priors Beta(α, β)
loop Each Round (until Rank 1 or limit)
B->>A: Sample claims via Acquisition Policy
A->>I: Select winning claim/hypothesis
I->>R: Generate edited snippet/page
R->>R: Rank variant vs competitors (N samples)
alt Observed Rank Improved
R->>B: Reward = 1 (α += 1)
else Observed Rank Stagnant / Worse
R->>B: Reward = 0 (β += 1)
end
endReferenced by