Tech Meridian ← К СУЩНОСТЯМ
EN

ТЕМА · ENTITY #1407

benchmarks

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

little m: ИИ-агент для формулирования моделей оптимизации промышленных процессов

Опубликована работа о 'little m' — ИИ-агенте, который сочетает специализированное хранилище знаний и взаимодействие на базе LLM для перевода разнородных промышленных спецификаций (текст и диаграммы процессов) в математические модели оптимизации. Авторы также представили IPC-Bench — набор из 50 мультимодальных сценариев для управления промышленными процессами; автоматические структурные проверки и слепая человеческая оценка показывают, что little m генерирует значительно более семантически корректные формулировки по сравнению с современными LLM, при этом работа не включает оценку применимости к решателям, физической корректности или замкнутой производственной производительности.

6.0

RESEARCH · 1 ИСТОЧН. · Apple Machine Learning Research

Agent Seer: синтез реалистичных сценариев оценки агентов на основе спецификаций инструментов

Agent Seer — метод синтеза реалистичных сценариев оценки для AI-агентов, который использует спецификации инструментов (имена функций, пояснения на естественном языке и типизированные схемы параметров) вместо ручной подготовки сценариев или запуска реальных инструментов. Этот подход призван масштабировать генерацию сценариев в экосистемах инструментов и избегать статичных бенчмарков, не успевающих за меняющимися API.

7.0