LLMs1 min read
UniRRM: Unified Reasoning Reward Models
Researchers introduced UniRRM, a multilingual reasoning reward model and dataset, to improve reward model reliability in open-ended tasks. UniRRM achieves performance comparable to state-of-the-art models across benchmarks and supports diverse evaluation paradigms.
From arXiv cs.CL
