免费软件、软件分享、系统优化、AI工具
科技皮皮虾 > 科技要闻 > AWS在Bedrock中介绍面向查询的压缩方法降低RAG成本

AWS在Bedrock中介绍面向查询的压缩方法降低RAG成本

AWS介绍一种在Amazon Bedrock中执行查询感知压缩的方法,用于减少检索增强生成(RAG)请求发送给主模型的输入内容。

AWS Bedrock查询感知压缩RAG原创配图

该流程在检索和最终回答之间增加一次压缩调用,由较小模型根据用户问题从检索片段中保留相关原文,再把压缩后的上下文交给主模型生成答案。AWS示例使用Anthropic Claude Haiku执行压缩、Claude Sonnet完成回答,两次调用放在同一个AWS Lambda函数中。

AWS给出的测试显示,典型查询集的压缩方案成本节省从37%调整到26%,加入重排和压缩后从40%调整到30%,具体数值取决于查询集和基线。文章同时提示需要评估额外调用带来的延迟、回答质量和工作负载适配性。

来源:AWS Machine Learning Blog,发布时间:2026年8月21日。