AWS介绍一种在Amazon Bedrock中执行查询感知压缩的方法,用于减少检索增强生成(RAG)请求发送给主模型的输入内容。

该流程在检索和最终回答之间增加一次压缩调用,由较小模型根据用户问题从检索片段中保留相关原文,再把压缩后的上下文交给主模型生成答案。AWS示例使用Anthropic Claude Haiku执行压缩、Claude Sonnet完成回答,两次调用放在同一个AWS Lambda函数中。
AWS给出的测试显示,典型查询集的压缩方案成本节省从37%调整到26%,加入重排和压缩后从40%调整到30%,具体数值取决于查询集和基线。文章同时提示需要评估额外调用带来的延迟、回答质量和工作负载适配性。
来源:AWS Machine Learning Blog,发布时间:2026年8月21日。