НОВОСТЬ · CODING · #226
Оптимизация стоимости и задержки с кэшированием подсказок в Amazon Bedrock
Публикация AWS Machine Learning описывает кэширование подсказок в Amazon Bedrock, отмечая, что оно может сократить затраты на входные токены до 90% при повторной отправке одного и того же контекста в фундаментальные модели. В статье разобраны шесть практических сценариев кэширования подсказок для Converse API: содержимое сообщений, системные подсказки, определение инструментов, смешанное время жизни (TTL), изоляция арендаторов и интеграция с LangChain.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Публикация AWS Machine Learning описывает кэширование подсказок в Amazon Bedrock, отмечая, что оно может сократить затраты на входные токены до 90% при повторной отправке одного и того же контекста в фундаментальные модели.
- В статье разобраны шесть практических сценариев кэширования подсказок для Converse API: содержимое сообщений, системные подсказки, определение инструментов, смешанное время жизни (TTL), изоляция арендаторов и интеграция с LangChain.
- Кэширование подсказок может существенно снизить расходы на токены и задержку при повторном использовании контекста в продакшн-приложениях и демонстрирует практические схемы интеграции (включая LangChain и изоляцию арендаторов) для пользователей Bedrock.
ПОЧЕМУ ЭТО ВАЖНО
Кэширование подсказок может существенно снизить расходы на токены и задержку при повторном использовании контекста в продакшн-приложениях и демонстрирует практические схемы интеграции (включая LangChain и изоляцию арендаторов) для пользователей Bedrock.