Tech Meridian ← К СУЩНОСТЯМ
EN

ТЕМА · ENTITY #592

large language models (LLMs)

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

9

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Чего мы ожидаем от LLM? Картирование дизайна бенчмарков LLM (arXiv:2609.19182v1)

В статье проанализированы 14 767 материалов с arXiv, представлявших или обновлявших ресурсы оценки для LLM с января 2022 по август 2026 года, с использованием пошагового отбора и автоматизированного кодирования полного текста. Авторы отмечают усиление фокуса на действиях, взаимодействии и профессиональных приложениях, рост использования оценки на основе LLM в оценках для агентов и неагентов и отсутствие сопоставимого устойчивого роста материалов, сгенерированных моделями.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Единая рамочная оценка надёжности LLM, агентных систем и мультимодальных моделей (arXiv:2609.19524v1)

В препринте на arXiv предложена единая рамочная система оценки для LLM, агентных и мультимодальных моделей по восьми измерениям надёжности (способность, устойчивость, безопасность, справедливость, прозрачность, управление, надзор, эффективность). Рамка сопоставляет специфические метрики с общими диапазонами производительности с оценками неопределённости, включает метаоценку валидности и воспроизводимости, механизмы безопасности и привязки к рамкам управления и требованиям ЕС; авторы отмечают, что эмпирическая валидация необходима далее.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Четырехэтапная декомпозиция математического рассуждения LLM; уязвимость к отвлекающим фразам локализована в этапе «планирование операций»

Авторы предлагают, что LLM решают школьные текстовые задачи по математике через четырехэтапный конвейер — Schema Abstraction, Operation Planning, Operand Binding и Computation — причём каждый этап формирует отдельное промежуточное представление в определённых слоях. Анализ отказов показывает, что добавление одной нерелевантной фразы нарушает именно этап Operation Planning, реализованный набором attention‑хедов, роль которых подтверждена каузальными вмешательствами в обоих направлениях.

7.0

REGULATION · 1 ИСТОЧН. · MIT Technology Review AI

MIT Technology Review: индустрия ИИ смещается в «думерскую» сторону после призыва CEO Anthropic замедлить развитие LLM

В выпуске The Algorithm от MIT Technology Review сообщается, что индустрия ИИ смещается в более пессимистичную, «думерскую» позицию после эссе CEO Anthropic Дарио Амодеи, в котором он призвал замедлить темпы развития больших языковых моделей (LLM), ссылаясь на возможные опасности технологии. Статья рассматривает этот призыв как заметный сигнал изменения настроений в отрасли.

7.0

RESEARCH · 1 ИСТОЧН. · AWS Machine Learning

Независимый от модели детектор PII на базе LLM

По данным AWS Machine Learning, разработан настраиваемый детектор, независимый от модели, который с помощью подсказок превращает любую LLM в Amazon Bedrock в детектор PII; поскольку типы сущностей задаются в подсказке, а не в коде, детектор может адаптироваться к новым сущностям без дообучения и (по утверждению AWS) превзошёл готовый инструмент на пяти публичных корпусах и в сравнении с девятью детекторами на базе LLM.

6.0

MODELS · 1 ИСТОЧН. · Hugging Face

Granite 4.2 LLM‑модели: как они построены

Hugging Face опубликовал материал под заголовком «Granite 4.2 LLM‑модели: как они построены», который, судя по названию, объясняет устройство семейства больших языковых моделей Granite 4.2; сам текст статьи в источнике не приведён. Дополнительных подробностей (архитектура, данные обучения или инструменты) из предоставленного источника нет.

6.0

RESEARCH · 1 ИСТОЧН. · Microsoft Research

EvoLib: превращение опыта в эволюционирующие знания

Microsoft Research опубликовала материал об EvoLib — подходе, призванном превращать накопленный опыт в эволюционирующие знания, извлекая повторно используемые умения и инсайты, которые помогают LLM обучаться и адаптироваться к задачам после развертывания. В статье делается акцент на том, что LLM не становятся умнее лишь за счёт хранения большего объёма памяти, и EvoLib предлагается как способ повторного использования опыта для долгосрочной адаптации.

6.0

REGULATION · 1 ИСТОЧН. · WIRED AI

Указ Трампа направляет федеральные закупки на «правдивый» ИИ в рамках политики «Preventing Woke AI»

Администрация Трампа опубликовала 28-страничный план по ИИ и указ «Preventing Woke AI in the Federal Government», в котором предлагается при федеральных закупках отдавать предпочтение так называемым «правдивым» системам ИИ и пересмотреть приказы эпохи Байдена с целью исключить упоминания о дезинформации, разнообразии, равных возможностях и изменении климата. Комментаторы предупреждают, что директива может вынудить компании подстраивать поведение моделей под политическое определение «правды» со стороны администрации; пока крупные ИТ‑компании публично не возражали, некоторые дали нейтральные или позитивные оценки.

7.0

RESEARCH · 1 ИСТОЧН. · Google Research

Google Research представила «Talk like a Graph» и бенчмарк GraphQA для кодирования графов для LLM

Исследователи Google (Бахаре Фатеми и Брайан Пероззи) предложили способы преобразования графов в текстовое представление, понятное большим языковым моделям, и представили бенчмарк GraphQA с задачами на рассуждение по графам и генераторами графов. Они отмечают, что производительность LLM зависит от метода кодирования, типа задачи и структуры графа, и выбор подходящего кодирования может повысить точность на графовых задачах примерно до 60%.

7.0