在面对跨越数百个文档的复杂分析任务(例如金融尽职调查或合规性审查)时,传统的检索增强生成 (#RAG)技术已经达到了瓶颈。尽管基于向量的相似度搜索能召回相关片段,但往往会遗漏复杂的跨文档关联。为了解决这一痛点,#AWS 提出了一种名为任务感知知识压缩 (TAKC)的新型技术,通过将整个知识库预压缩为特定任务的表示形式,并在 AWS 上进行部署。
设想一家私募股权公司正在评估对一家制造企业价值 5 亿美元的收购案。尽调团队需要分析 12 家子公司、跨越 5 年的财务报表,同时还面临 200 多个供应商合同、8 个厂区的环境合规报告以及 50 多个诉讼案件。当分析师询问基于当前供应商条款和未决诉讼的合并财务风险时,传统的 RAG 相似度检索无法给出答案,因为这些关联信息分布在数百个文档中,且不具备字面相似性。
TAKC 通过利用大语言模型(#LLM)生成简短的、针对特定任务的文档摘要来解决这一问题。相同的文档针对不同的任务会产生不同的压缩结果。例如,一份年度报告在进行财务分析时,需要保留营收、利润率和现金流数据;而针对合规性审查时,则需要提取监管引用和违规记录。通用的摘要技术试图面面俱到,反而稀释了特定场景的信息密度。TAKC 允许通过特定任务的视角来压缩文档,仅保留核心要素。
在生产部署中,任务类型提示词(Prompts)存储在版本化的配置服务中,例如 AWS Systems Manager Parameter Store 或专用的 Amazon S3 前缀中,确保提示词的更改可审计,并在更新时触发重新压缩。系统在离线状态下对每个文档进行针对特定任务的压缩(每个文档每种任务压缩一次)。在查询时,系统直接检索预压缩的表示,而非原始文档,并基于压缩版本回答问题。
如果压缩表示缺乏足够的技术细节,查询复杂度分析器(Query Complexity Analyzer)会将问题路由到保留更多上下文的低压缩等级分流中。TAKC 提供了对整个知识库压缩版本的访问能力,而不仅限于相似度搜索返回的 top-k 块。由于压缩过程是协同进行的,系统能够完美保留文档之间的深度脉络关联。
TAKC(任务感知知识压缩)的提出标志着企业级知识检索从“被动检索”向“主动语义重构”的范式转变。对比 GraphRAG,TAKC 在处理大规模异构非结构化数据时,避免了高昂的图谱构建与维护成本,同时通过离线的多维度压缩,极大地降低了在线推理时的 Token 消耗。对于 AI Agent 生态而言,这不仅是一次 RAG 的升级,更是 Agent “长期记忆”和“上下文窗口”管理的关键基础设施。未来的高级智能体(Advanced Agents)将不再依赖未经加工的原始文本检索,而是通过类似 TAKC 的“任务透镜”机制,动态加载预先压缩并结构化的多任务知识表示,这不仅极大地提升了 Agent 解决复杂决策链的精度,也为多 Agent 协同(Multi-Agent System)在企业核心业务场景的落地扫清了上下文膨胀与幻觉的障碍。