Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

МОДЕЛЬ · ENTITY #6542

Claude Opus 4.6

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

IntLawNER: набор разметки NER и бенчмарк для международного права (arXiv)

Статья представляет IntLawNER — токенный датасет NER и бенчмарк для кодифицированных текстов международного права: 2 987 золотых предложений и 8 094 сущностных аннотации из решений МУС, резолюций Совета Безопасности ООН и решений ЕСПЧ с семью типовыми метками. Авторы описывают гибридный конвейер (извлечение кандидатов, проверка LLM, ручная валидация), сокращающий 468 тыс. исходных предложений до итоговой выборки, анализируют расхождения серебряной и золотой разметки и показывают, что few-shot примеры сильно улучшают LLM; Claude Opus 4.6 достигает 0.873 micro-F1.

6.0

RESEARCH · 1 ИСТОЧН. · Hugging Face

Британский AISI публикует верифицированные результаты бенчмарков через Evaluation Cards EvalEval

Британский Институт безопасности ИИ (AISI) использует схему Every Eval Ever и платформу Evaluation Cards коалиции EvalEval для открытой публикации верифицированных запусков оценки из экспериментов Terminal-Bench 2.0; релиз сопровождает статью AISI «How Inference Compute Shapes Frontier LLM Evaluation» и включает данные по сериям Claude Opus и версиям GPT-5. Сотрудничество нацелено на повышение воспроизводимости и контекстуализации метаданных оценок и данных запусков.

7.0