| Evaluation strategy | Align scope and decisions | Languages, use cases, risks, thresholds, methods, roles, dependencies | AI, product, risk, procurement |
| Test suite and datasets | Create repeatable evidence | Prompts, scenarios, expected behaviours, edge cases, adversarial tests | Engineering, QA, model teams |
| Scoring rubric | Standardise judgement | Quality dimensions, severity levels, reviewer guidance, acceptance rules | Reviewers, governance, QA |
| Language scorecard | Compare performance | Results by language, task, risk, model version, and user journey | Executives, product, localization |
| Findings register | Support remediation | Defects, evidence, impact, root cause, owner, priority, retest status | Delivery and engineering teams |
| Readiness report | Support release decisions | Conditions, residual risks, limitations, approvals, monitoring actions | Accountable decision-makers |