#AI模型训练利好
长上下文暴涨 20 点:亚马逊 AGI 重构微调范式
WooFun2026-08-31 20:34
核心要点
亚马逊AGI团队提出结合GRPO与RetrievalAttention的微调方案,解决KV缓存痛点。该方法使模型在HotpotQA基准提升20%,支持从3.2万泛化至100万token,代码已开源。
据 Woofun AI 消息,亚马逊 AGI 团队在长上下文处理领域取得关键突破,其核心主张在于:管理模型推理时内存的方式,从根本上决定了训练策略的有效性。这一视角颠覆了传统将训练与推理分离优化的惯例,直接指向长上下文场景中信息遗忘的痛点。通过重新定义训练目标,该研究旨在让模型在有限内存约束下,依然能够精准定位并利用深层信息,从而大幅缓解大语言模型在处理超长文档时的性能衰减问题。
这种从底层逻辑出发的创新,为提升模型在复杂任务中的稳定性提供了新的技术路径,标志着长上下文优化从单纯的工程压缩转向了算法层面的根本性重构。
这项题为'探索长上下文语言模型中上下文检索与高效 KV 缓存的微调方法'的研究,由 Francesco Maria Molfese、Momchil Hardalov、Rexhina Blloshmi、Bill Byrne 和 Adrià de Gispert 领导的团队提交至 arXiv。其技术核心在于引入群体相对策略优化(GRPO)这一强化学习技术,以应对键值对(KV 缓存)在长文本处理中的巨大挑战。当文档长度达到 3.2 万 token 或更多时,KV 缓存的存储成本与计算延迟急剧上升,传统的压缩方案往往因激进裁剪而丢失关键信息。为此,团队开发了 RetrievalAttention 方法,旨在帮助模型在缓存被裁剪时仍保留关键数据。
Woofun AI 整理数据显示,经此方法微调的模型,其上下文窗口不仅能在 3.2 万 token 的训练基础上稳定运行,更能泛化至 12.8 万 token,甚至在特定场景下支持高达 100 万 token 的超长上下文处理,同时显著增强了对缓存压缩的抵抗能力。
在实验验证环节,团队利用 HotpotQA 和 2WikiMultihopQA 两个多跳问答数据集进行了严格测试,这些基准要求模型综合文档多个部分的信息才能得出正确答案。域内性能表现尤为突出,与基线配置相比,使用 GRPO 微调在 HotpotQA 基准上最高带来了 20 个百分点的提升。在域外泛化能力方面,尽管结果更为微妙,但在金融相关问题(模型未专门训练的领域)测试中,微调模型的表现比检索增强生成(RAG)设置高出 9 个百分点。
值得注意的是,GRPO 与传统监督微调存在本质区别:后者仅要求模型模仿正确答案的模式,而前者则让模型生成多个候选答案,利用可验证奖励进行评分,并将模型策略推向持续产生正确结果的方向。
这种基于奖励的优化机制,使得模型在面对未见过的复杂推理任务时,展现出更强的鲁棒性和准确性。
该研究进一步引发了关于训练方法与推理效率之间关系的深层思考。大多数现有优化研究将训练与推理视为独立问题,先训练模型再设法加速运行。亚马逊团队的工作表明,将推理约束融入训练过程本身——即从一开始就教会模型在有限内存下高效工作——能产生优于独立优化的结果。团队已将代码公开发布在 GitHub 上,这一举措在可复现性极具挑战的 AI 领域尤为重要,意味着竞争对手和合作者均可在此基础上继续推进。这是继 RAG 技术普及后,长上下文模型在训练范式上的又一次重要演进,预示着未来大模型优化将更加注重训练与推理阶段的统一性与协同效应。
评论
暂无评论