Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #808

Британский AISI публикует верифицированные результаты бенчмарков через Evaluation Cards EvalEval

Британский Институт безопасности ИИ (AISI) использует схему Every Eval Ever и платформу Evaluation Cards коалиции EvalEval для открытой публикации верифицированных запусков оценки из экспериментов Terminal-Bench 2.0; релиз сопровождает статью AISI «How Inference Compute Shapes Frontier LLM Evaluation» и включает данные по сериям Claude Opus и версиям GPT-5. Сотрудничество нацелено на повышение воспроизводимости и контекстуализации метаданных оценок и данных запусков.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Британский Институт безопасности ИИ (AISI) использует схему Every Eval Ever и платформу Evaluation Cards коалиции EvalEval для открытой публикации верифицированных запусков оценки из экспериментов Terminal-Bench 2.0; релиз сопровождает статью AISI «How Inference Compute Shapes Frontier LLM Evaluation» и включает данные по сериям Claude Opus и версиям GPT-5.
  2. Сотрудничество нацелено на повышение воспроизводимости и контекстуализации метаданных оценок и данных запусков.
  3. Открытые релизы в единой схеме с данными о настройках и запусках повышают воспроизводимость бенчмарков LLM и облегчают сопоставление исследований.

ПОЧЕМУ ЭТО ВАЖНО

Открытые релизы в единой схеме с данными о настройках и запусках повышают воспроизводимость бенчмарков LLM и облегчают сопоставление исследований.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1