AWS于8月21日介绍一种RAG查询感知压缩模式:常规检索为了提高召回率,会返回较宽的候选片段;在最终模型生成答案前,可由较小模型根据用户问题过滤片段,让主模型处理更少的输入。AWS同时提醒要评估成本、延迟和答案质量。对外贸知识库而言,减少无关上下文有价值,但压缩层本身也可能错误删除产品限制、适用条件或例外条款。
高召回与低上下文解决不同问题
检索阶段追求的是不要漏掉潜在相关证据,生成阶段希望输入集中、减少噪声。两者之间增加压缩层,不是把检索做得更小,而是对候选证据进行第二次选择。
外贸资料往往包含相似型号、多个市场版本和例外说明。只保留与问题表面词语最接近的片段,可能留下主参数却删掉温度边界、认证适用范围或交期条件。因此压缩规则必须围绕完整决策问题测试,而不只是比较最终答案是否流畅。
被删除的证据也要可回读
每次处理应保存查询、检索片段ID、来源文件版本、入选片段、排除片段、压缩模型与规则版本。线上回答可以只接收精简上下文,审计记录仍需允许负责人回看原始候选集合。
如果答案受到质疑,团队要能判断错误来自知识源过期、检索漏召回、压缩误删还是生成阶段误解。没有分层记录,所有问题都会被笼统归因于“AI不准”,也无法定位修复动作。
高风险问题设置不可压缩锚点
价格、合规、付款、客户身份、认证、交付承诺和合同条款不应只依赖概率过滤。企业可以为适用范围、禁止条件、有效日期、审批状态和来源链接设置不可压缩字段,或要求回答前强制检索这些证据。
若多个片段互相冲突,压缩层不能自行选择更方便的版本。系统应保留冲突、显示日期与来源,并把任务升级给有权限的人员确认。
对中国外贸企业的经营含义
外贸知识库通常在产品手册、报价规则、市场政策和历史沟通之间检索。随着资料量增加,直接把所有候选内容送入模型会增加成本与干扰;但错误压缩可能让输出失去关键边界。
生产验收应同时看输入量、响应时间、证据召回和关键限制保留率。节省令牌只是技术指标,只有在事实、版本和人工接管路径不受损时,才形成可用的业务优化。
对中英文输出还应使用同一组证据锚点。语言可以本地化,适用范围、日期与限制不能在翻译过程中被压缩掉。
可执行建议
- 为产品、报价、合规和交付问题建立代表性测试集。
- 保存原始候选、入选与排除片段及压缩规则版本。
- 为限制、例外、有效日期、审批状态和来源设置证据锚点。
- 对冲突片段停止自动选择,保留差异并升级人工确认。
- 分别监测令牌、延迟、答案质量和关键证据召回率。
- 知识源或模型更新后重跑基准,不沿用旧质量结论。
参考来源
- Amazon Web Services,Reduce RAG costs on Amazon Bedrock with query-aware compression,2026年8月21日:https://aws.amazon.com/blogs/machine-learning/reduce-rag-costs-on-amazon-bedrock-with-query-aware-compression/

