The optimization loop uses acquisition policies like Thompson sampling to select and test content-rewrite hypotheses against competitor pages, iteratively updating Beta distribution win probabilities based on rankings from judge models.

flowchart TD
    A[Seeder: Beta Priors] --> B[Thompson Sampling Selection]
    B --> C[Ideator: Rewrite Content]
    C --> D[Judge Model: Rank vs Competitors]
    D --> E[Reward Calculation]
    E --> F[Update Beta Distribution]
    F -->|Iterate| B
    F -->|Target Confidence Met| G[Converged Champion Content]