The optimization loop uses acquisition policies like Thompson sampling to select and test content-rewrite hypotheses against competitor pages, iteratively updating Beta distribution win probabilities based on rankings from judge models.
flowchart TD
A[Seeder: Beta Priors] --> B[Thompson Sampling Selection]
B --> C[Ideator: Rewrite Content]
C --> D[Judge Model: Rank vs Competitors]
D --> E[Reward Calculation]
E --> F[Update Beta Distribution]
F -->|Iterate| B
F -->|Target Confidence Met| G[Converged Champion Content]Referenced by