Gold Standards, Uneven Ground

Rethinking Evaluation for Low-Resource Language Technology

Authors

DOI:

https://doi.org/10.0000/meridian.demo.2026.002

Keywords:

low-resource languages, benchmarking, annotation quality

Abstract

Evaluation sets are frequently called gold standards even when annotation conditions, speaker coverage, and domain assumptions differ sharply across languages. This paper proposes a transparent reporting framework for low-resource evaluation and demonstrates how uncertainty-aware interpretation changes comparisons between systems.

Downloads

Published

2026-06-18