Return to Issue Details Committee-of-Judges: Multi-Agent Consensus for Reliable LLM Evaluation under Difficult Reasoning Tasks Download Download PDF