Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
Why it matters
The widespread use of AI in occupational settings necessitates reliable evaluation methods. This research highlights a critical discrepancy: while LLMs can order outcomes by quality, their ability to…
arXiv: Computers and SocietyHigh: verified source confidence1 min
