Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #8361

pseudo-labeling

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Псевдометки для предобученных ASR на шумной полицейской аудио с оценкой LLM (arXiv:2609.30469v1)

В статье arXiv оценивают псевдометки для адаптации фундаментальных ASR-моделей (Whisper и Qwen3-ASR) к очень шумным корпусам Broadcast Police Communication (BPC) из Балтимора и Чикаго. Авторы показывают, что внутренние метрики доверия (log-probabilities, STAR) слабо различают качественные и некачественные псевдометки, предлагают внешнюю схему фильтрации с LLM как судьёй для отбрасывания контекстуально неправдоподобных расшифровок (что снижает WER обучающих наборов с псевдометками), и вводят кросс-модельную стратегию псевдометок, когда одна модель дообучается на псевдометках другой.

6.0

RESEARCH · 1 ИСТОЧН. · Apple Machine Learning Research

Полусуточное федеративное ASR: онлайн-псевдометки и стабилизация серверных обновлений

В работе исследуется полусуточное федеративное обучение для автоматического распознавания речи: ключевыми факторами являются выбор 'учителя' для генерации псевдометок (онлайн для каждого клиента или глобальный транслируемый) и серверный «якорь» — обучение на размеченных данных между раундами. С рекомендованной стратегией стабилизации (чередование серверного обучения и корректные настройки аугментации/размера батча) метод превосходит предыдущий лучший подход в 9 из 11 пар, сокращая разрыв до полностью размеченного FL на 20.8% в домене и на 10.0% при переносе.

7.0