Unified evaluation framework for trustworthy LLMs, agentic AI, and multimodal systems (arXiv:2609.19524v1)
This arXiv preprint proposes a unified evaluation framework that assesses LLMs, agentic systems, and multimodal models across eight trustworthiness dimensions (capability, robustness, safety, fairness, transparency, governance, oversight, efficiency). It maps system-specific metrics to common performance bands with uncertainty estimates, includes a meta-evaluation layer for the validity and reproducibility of assessments, and adds safety-critical overrides plus mappings to governance frameworks and EU regulatory requirements; empirical validation is noted as a necessary next step.