ИССЛЕДОВАНИЕ · RESEARCH · #808
Британский AISI публикует верифицированные результаты бенчмарков через Evaluation Cards EvalEval
Британский Институт безопасности ИИ (AISI) использует схему Every Eval Ever и платформу Evaluation Cards коалиции EvalEval для открытой публикации верифицированных запусков оценки из экспериментов Terminal-Bench 2.0; релиз сопровождает статью AISI «How Inference Compute Shapes Frontier LLM Evaluation» и включает данные по сериям Claude Opus и версиям GPT-5. Сотрудничество нацелено на повышение воспроизводимости и контекстуализации метаданных оценок и данных запусков.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Британский Институт безопасности ИИ (AISI) использует схему Every Eval Ever и платформу Evaluation Cards коалиции EvalEval для открытой публикации верифицированных запусков оценки из экспериментов Terminal-Bench 2.0; релиз сопровождает статью AISI «How Inference Compute Shapes Frontier LLM Evaluation» и включает данные по сериям Claude Opus и версиям GPT-5.
- Сотрудничество нацелено на повышение воспроизводимости и контекстуализации метаданных оценок и данных запусков.
- Открытые релизы в единой схеме с данными о настройках и запусках повышают воспроизводимость бенчмарков LLM и облегчают сопоставление исследований.
ПОЧЕМУ ЭТО ВАЖНО
Открытые релизы в единой схеме с данными о настройках и запусках повышают воспроизводимость бенчмарков LLM и облегчают сопоставление исследований.