The methodology standardizes model adaptation, prompting, and measurement so results can be traced across use cases. It reports multiple dimensions rather than collapsing quality, efficiency, robustness, and fairness into one score. Coverage is limited to the scenarios and models included in a given release.