| Evaluation plan | Objectives, scope, systems, scenarios, measures, thresholds, roles and exclusions | Document and working register | Planning | Use cases, risks, owners and decision needs |
| Benchmark test set | Representative prompts, expected characteristics, categories and metadata | Structured dataset | Design | Examples, logs, policies and source material |
| Scoring rubric | Definitions, rating scales, decision rules and evaluator guidance | Rubric and handbook | Design | Quality and risk thresholds |
| Evaluation results | Scores, evidence, confidence, exceptions and comparison views | Dashboard or report | Testing | System responses and review access |
| Failure taxonomy | Error classes, severity, frequency, impact and likely cause | Issue register | Analysis | Business-impact validation |
| Remediation backlog | Prioritised prompt, retrieval, guardrail, workflow and governance actions | Backlog and roadmap | Improvement | Technical ownership and feasibility input |
| Executive assurance summary | Observed performance, limitations, unresolved risks and decision options | Presentation or memo | Decision | Stakeholder review and acceptance |