Runs execute ungrounded prompts across models in fixed round batches, extracting full-sentence fact lines and assigning position-based confidence scores to evaluate unprompted recall stability.