Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #12441

small language models (SLMs)

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Измерение «разрыва приемлемости» SLM для микрозадач (arXiv:2610.00025v1)

Авторы собрали бенчмарк из четырёх микрозадач вокруг планировщика LLM (авто-подтверждение команд, запись памяти, выбор инструментов, ранжирование ходов) с заранее заданными CI-порогами приемлемости и протестировали готовые SLM (Qwen3 0.6/1.7/4/8B, FP16, без дообучения). Ни одна из 16 конфигураций модель×задача не прошла порог приемлемости (0/16). В работе предложен диагностический метод на основе logprob, разделяющий дефициты способностей и проблемы с порогом декодирования; показано, что 4-битная квантизация (RTN/GPTQ/AWQ) обычно ухудшает результаты и не переводит конфигурации в «приемлемые», эффект воспроизводится на Llama-3.x (12/12 не прошли) и устойчив к выбору якоря и парафразам подсказок; практическая рекомендация — ставить SLM за базовой моделью, соответствующей CI-порогам, и применять SLM только там, где базовый метод проваливается.

7.0