128K 上下文准确率暴跌 62.8%:英伟达论文曝光 AI 长任务致命伤
核心要点
英伟达最新研究揭示AI智能体在长链条任务中表现恶化,随着上下文扩展至128K,平均准确率骤降62.8%,DeepSeek与Nemotron Super均现显著衰退,凸显结构化标识符与任务拆解的关键性。
据 Woofun AI 消息,于 2026 年 9 月 30 日发布论文《Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability》(arXiv:2609.38712),核心发现直指 AI 智能体在长程任务中的可靠性危机:随着上下文长度扩张,模型平均准确率暴跌 62.8%。
为精准诊断这一失效模式,研究团队构建了名为 的基准测试,刻意隔离'在长时间输入流中持续跟踪状态'这一单一变量。测试涵盖 7 个开源权重模型,任务设计极简,仅包含算术运算、UUID 排序、变量查找及表格转换。每个模型需处理 1440 份文档,采用贪心采样与精确匹配评分,答案非对即错。关键变量在于输入规模从 4000 个 token 激增至 128000 个 token 时的表现。
Woofun AI 整理数据显示,在此跨度下,平均准确率下滑 62.8%。具体模型衰退轨迹清晰:DeepSeek 在短上下文下得分 0.909,长上下文跌至 0.554;英伟达自家的 则从 0.711 断崖式下跌至 0.138,暴露出严重的长程维持能力缺失。
性能失稳并非仅由长度单一因素驱动,多重变量的叠加效应加剧了系统脆弱性。局部复杂度的提升与缺失的 ID 会对任务对齐产生连锁反应,导致一次微小失误即可引发后续步骤的全面跑偏。
这一发现呼应了 2025 年至 2026 年间学术界与产业界积累的共识:大语言模型与智能体在短任务上的优异表现,无法线性外推至生产级工作流。该研究的独特贡献在于,通过极简任务将'能否保持不掉线'作为唯一真实变量进行隔离测试,从而证实了长程任务中状态维持的极端困难性,揭示了当前模型架构在处理长链条、多步骤复杂任务时的根本性局限。
针对上述瓶颈,研究人员提出明确优化路径:将长任务拆解成更小的子任务,并为每个条目引入结构化标识符。对开发者而言,流水线设计的权重已不亚于模型选择本身。缺失标识符导致 64.3% 性能下滑的数据表明,打标签并非锦上添花,而是维持系统稳定性的必需品。作为 AI 产业核心算力硬件供应方,英伟达公开 Nemotron Super 跌至 0.138 的结果具有标志性意义,它打破了行业以往仅比拼'能接收多少文本'的迷思,确立了一个新标准:能接收文本与能可靠地处理完文本,是两种截然不同的能力,后者才是决定 AI 智能体能否真正落地生产环境的关键。

评论
暂无评论