ИССЛЕДОВАНИЕ · RESEARCH · #1320
Sense and Sensitivity: бенчмарк показывает, что LLM чаще врачей назначают ненужную помощь и чувствительны к изменениям текста
Статья на arXiv (arXiv:2609.38600v1) представляет бенчмарк более чем на 6 000 клинических сценариев, 7 000 аннотаций врачей и 225 000 ответов моделей для сравнения триажа LLM и врачей при искажениях текста. Авторы выявляют, что LLM с большей вероятностью, чем врачи, рекомендуют ненужную помощь в базовой ситуации, и что их рекомендации сильнее зависят от клинически несущественных изменений текста, таких как пол и тон.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья на arXiv (arXiv:2609.38600v1) представляет бенчмарк более чем на 6 000 клинических сценариев, 7 000 аннотаций врачей и 225 000 ответов моделей для сравнения триажа LLM и врачей при искажениях текста.
- Авторы выявляют, что LLM с большей вероятностью, чем врачи, рекомендуют ненужную помощь в базовой ситуации, и что их рекомендации сильнее зависят от клинически несущественных изменений текста, таких как пол и тон.
- Это важно, потому что демонстрирует, что рекомендации LLM по клиническому триажу могут быть более шумными и чувствительными к несущественным текстовым изменениям, что подчёркивает необходимость оценок и мер безопасности при развертывании.
ПОЧЕМУ ЭТО ВАЖНО
Это важно, потому что демонстрирует, что рекомендации LLM по клиническому триажу могут быть более шумными и чувствительными к несущественным текстовым изменениям, что подчёркивает необходимость оценок и мер безопасности при развертывании.