НОВОСТЬ · RESEARCH · #439
Препринт Cohere Labs: в пайплайнах LLM выявлен «культурный фильтр», опубликован набор данных CultureMarkers
Cohere Labs проанализировала более 5,6 млн образцов данных из этапов предобучения, SFT, выравнивания и reasoning и сообщает о постоянной тенденции — «культурном фильтре», когда культурное разнообразие сужается на пост-тренировочных этапах. Команда использовала модель Command A для автоматической разметки культурных сигналов, утверждает, что одной мультиязычности недостаточно для представления культуры, и опубликовала препринт на arXiv и набор данных CultureMarkers на Hugging Face.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Cohere Labs проанализировала более 5,6 млн образцов данных из этапов предобучения, SFT, выравнивания и reasoning и сообщает о постоянной тенденции — «культурном фильтре», когда культурное разнообразие сужается на пост-тренировочных этапах.
- Команда использовала модель Command A для автоматической разметки культурных сигналов, утверждает, что одной мультиязычности недостаточно для представления культуры, и опубликовала препринт на arXiv и набор данных CultureMarkers на Hugging Face.
- Показывает, что культурное представительство может теряться при подготовке и отборе данных, и призывает разработчиков учитывать культуру как ключевой фактор при выборе и документировании данных.
ПОЧЕМУ ЭТО ВАЖНО
Показывает, что культурное представительство может теряться при подготовке и отборе данных, и призывает разработчиков учитывать культуру как ключевой фактор при выборе и документировании данных.