[1]
Wright, E. et al. 2025. Committee-of-Judges: Multi-Agent Consensus for Reliable LLM Evaluation under Difficult Reasoning Tasks. Journal of Information Technology and Informatics Engineering. 1, 2 (Sep. 2025), 13–22.