Gold Standards, Uneven Ground
Rethinking Evaluation for Low-Resource Language Technology
DOI:
https://doi.org/10.0000/meridian.demo.2026.002Keywords:
low-resource languages, benchmarking, annotation qualityAbstract
Evaluation sets are frequently called gold standards even when annotation conditions, speaker coverage, and domain assumptions differ sharply across languages. This paper proposes a transparent reporting framework for low-resource evaluation and demonstrates how uncertainty-aware interpretation changes comparisons between systems.
Downloads
Published
2026-06-18
Issue
Section
Articles