Because token log-probability metrics cannot be directly compared across different model architectures, multi-model evaluation relies on standardized ranking position and cross-run appearance frequency rather than raw logprobs.
Referenced by