利好
研究:2019 至 2025 年预训练效率提升主要来自数据
17:12
数据显示数据改进带来12倍效率增益,模型改进为3.7倍,二者加性效应解释88%方差。
Woofun AI 获悉,Dwarkesh Patel 与 Jerry Han 于 2026 年 9 月 8 日发布研究,量化了 2019 至 2025 年间数据与模型改进对预训练效率的贡献。在最高 1e19 FLOPs 计算预算下,数据改进带来的效率增益达 12.0 倍,模型改进为 3.7 倍,前者约为后者的 3.24 倍。
研究发现两者增益大体独立,线性模型下加性效应可解释 OLMES 分数 88% 的方差。模型侧涵盖从 GPT-2 到 OLMo-2 的优化器、位置编码等改进;数据侧则从 OpenWebText 演进至 UltraFineWeb 等更精细语料。
WOOFUN AI
影响力评估 · 一键速读
该研究量化了数据与模型架构对预训练效率的具体贡献比例,证实数据质量提升是过去几年效率增长的核心驱动力。数据侧 12 倍的效率增益远超模型侧的 3.7 倍,且二者呈独立加性关系,暗示单纯堆砌算力或微调架构的边际收益正在递减。未来大模型竞争焦点或将进一步向高质量语料构建与清洗技术倾斜,数据壁垒的重要性显著上升。
WOOFUN AI 生成 · 仅供参考,非投资建议
评论
暂无评论