Британский AISI публикует верифицированные результаты бенчмарков через Evaluation Cards EvalEval
Британский Институт безопасности ИИ (AISI) использует схему Every Eval Ever и платформу Evaluation Cards коалиции EvalEval для открытой публикации верифицированных запусков оценки из экспериментов Terminal-Bench 2.0; релиз сопровождает статью AISI «How Inference Compute Shapes Frontier LLM Evaluation» и включает данные по сериям Claude Opus и версиям GPT-5. Сотрудничество нацелено на повышение воспроизводимости и контекстуализации метаданных оценок и данных запусков.