Оптимизация стоимости и задержки с кэшированием подсказок в Amazon Bedrock
Публикация AWS Machine Learning описывает кэширование подсказок в Amazon Bedrock, отмечая, что оно может сократить затраты на входные токены до 90% при повторной отправке одного и того же контекста в фундаментальные модели. В статье разобраны шесть практических сценариев кэширования подсказок для Converse API: содержимое сообщений, системные подсказки, определение инструментов, смешанное время жизни (TTL), изоляция арендаторов и интеграция с LangChain.