Tech Meridian ← К СУЩНОСТЯМ
EN

КОМПАНИЯ · ENTITY #370

Large language models (LLMs)

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

OrchSLM: исследование динамики оркестровки малых языковых моделей

Этот препринт на arXiv представляет OrchSLM — фреймворк маршрутизации, который объединяет существующие неинтерактивные методы оркестровки для малых языковых моделей (SLM) и выделяет ключевые параметры проектирования. Авторы с помощью OrchSLM исследуют, как поведение оркестровки вытекает из структуры задачи, состава пула моделей и многоагентного консенсуса, что мотивировано ограничениями SLM по сравнению с облачными LLM.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

FLoKD: Адаптивный knowledge distillation для федеративного дообучения LLM с LoRA по беспроводным сетям

В препринте на arXiv предложен FLoKD — адаптивная схема knowledge distillation для федеративного дообучения LLM с LoRA по ограниченным по полосе пропускания беспроводным сетям. Вместо передачи полных параметров или логитов токенов FLoKD передаёт промежуточные LoRA-активации и выборочно транслирует наиболее информативные блоки трансформера и публичные образцы, близкие к локальному распределению; по результатам на WikiText-103, PTB и диалоговом наборе данных авторы сообщают снижение объёма передачи на 50–65% при сходимости к сопоставимому перплексиону по сравнению с базовыми методами.

6.0