Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · RESEARCH · #138

Identity Is More Than Recall — PAI-Bench: бенчмарк персистентной идентичности в развернутых AI-агентах (arXiv)

В статье на arXiv представлен PAI-Bench — нейтральный бенчмарк и протокол оценки, который отделяет фактическое воспоминание от выражения идентичности и поведенческого воплощения в развернутых AI-агентах. Исследование проводит две фиксированные кампании для 16 синтетических профилей (1 536 сохранённых ответов) и фиксирует зависимость присутствия компонентов идентичности от промптов и начальных меток, а также различия в оценивателях (например, Claude vs. Astra); авторы отмечают одиночные образцы на условие и пост‑хок проверки.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье на arXiv представлен PAI-Bench — нейтральный бенчмарк и протокол оценки, который отделяет фактическое воспоминание от выражения идентичности и поведенческого воплощения в развернутых AI-агентах.
  2. Исследование проводит две фиксированные кампании для 16 синтетических профилей (1 536 сохранённых ответов) и фиксирует зависимость присутствия компонентов идентичности от промптов и начальных меток, а также различия в оценивателях (например, Claude vs.
  3. Astra); авторы отмечают одиночные образцы на условие и пост‑хок проверки.

ПОЧЕМУ ЭТО ВАЖНО

Разделение воспоминания, выражения и воплощения идентичности закрывает практическую проблему доверия и безопасности у развернутых агентов и даёт воспроизводимый протокол для измерения разных аспектов точности идентичности.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1