Post #2179
248
ΠΡΠΎ ΠΎΡΠ΅Π½ΠΊΡ LLM ΠΏΠ°ΠΉΠΏΠ»Π°ΠΉΠ½ΠΎΠ² Ρ Π΄Π΅ΠΊΠΎΠΌΠΏΠΎΠ·ΠΈΡΠΈΠ΅ΠΉ Π½Π° ΡΡΠ±ΡΠΈΠΊΠΈ https://arxiv.org/abs/2604.01375
arXiv.org RIFT: A RubrIc Failure Mode Taxonomy and Automated Diagnostics Rubric-based evaluation is widely used in LLM benchmarks and training pipelines for open-ended, less verifiable tasks. While prior work has demonstrated the effectiveness of rubrics using...