IDEA Prune: Интегрированная схема «увеличить-и-обрезать» при предварительном обучении генеративных языковых моделей
В статье предлагается включать предварительное обучение увеличенных моделей в пайплайны структурной обрезки и рассматривать процесс «увеличить-и-обрезать» как единую систему. Авторам важно выяснить, стоит ли предобучать большую модель, если она никогда не будет развернута, и как оптимизировать пайплайн для эффективности по токенам.