Профессиональные подсказки 'Scientific Agents' увеличивают стоимость и токены без повышения точности
Исследователи оценили открытый корпус Scientific Agents (503 профессиональных профиля AGENTS.md) с помощью Gemini 3.8 Flash через OpenRouter в среде Pi agent по девяти научным бенчмаркам и 60 задачам BioMysteryBench с использованием инструментов. Профили не дали заметного прироста точности (средняя разница профиль–базовый вариант −0.6 процентных пункта, 95% интервал [−1.5, +0.2]), генерировали в 1.5–2.3 раза больше токенов и стоили в 2.2–4.5 раза дороже за успешный вызов; на BioMysteryBench профиль работал хуже (46.7% vs 56.7% решений, −10.0 п.п.) из‑за остановок по лимитам, тогда как более длинные подсказки повысили устойчивость к сбоям API на SuperGPQA.