Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · RESEARCH · #439

Препринт Cohere Labs: в пайплайнах LLM выявлен «культурный фильтр», опубликован набор данных CultureMarkers

Cohere Labs проанализировала более 5,6 млн образцов данных из этапов предобучения, SFT, выравнивания и reasoning и сообщает о постоянной тенденции — «культурном фильтре», когда культурное разнообразие сужается на пост-тренировочных этапах. Команда использовала модель Command A для автоматической разметки культурных сигналов, утверждает, что одной мультиязычности недостаточно для представления культуры, и опубликовала препринт на arXiv и набор данных CultureMarkers на Hugging Face.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Cohere Labs проанализировала более 5,6 млн образцов данных из этапов предобучения, SFT, выравнивания и reasoning и сообщает о постоянной тенденции — «культурном фильтре», когда культурное разнообразие сужается на пост-тренировочных этапах.
  2. Команда использовала модель Command A для автоматической разметки культурных сигналов, утверждает, что одной мультиязычности недостаточно для представления культуры, и опубликовала препринт на arXiv и набор данных CultureMarkers на Hugging Face.
  3. Показывает, что культурное представительство может теряться при подготовке и отборе данных, и призывает разработчиков учитывать культуру как ключевой фактор при выборе и документировании данных.

ПОЧЕМУ ЭТО ВАЖНО

Показывает, что культурное представительство может теряться при подготовке и отборе данных, и призывает разработчиков учитывать культуру как ключевой фактор при выборе и документировании данных.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1