Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #11593

Sense and Sensitivity benchmark

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Sense and Sensitivity: бенчмарк показывает, что LLM чаще врачей назначают ненужную помощь и чувствительны к изменениям текста

Статья на arXiv (arXiv:2609.38600v1) представляет бенчмарк более чем на 6 000 клинических сценариев, 7 000 аннотаций врачей и 225 000 ответов моделей для сравнения триажа LLM и врачей при искажениях текста. Авторы выявляют, что LLM с большей вероятностью, чем врачи, рекомендуют ненужную помощь в базовой ситуации, и что их рекомендации сильнее зависят от клинически несущественных изменений текста, таких как пол и тон.

7.0