Relevance probing accepts 1 to 100 samples per item-model pair, scaling API calls linearly while metered through usage-based credit billing.

Proactive Suggestion: Higher sample counts on stochastic models significantly reduce score variance, but sampling above 10 yields diminishing statistical returns for standard binary recommendations.