利好

研究:2019 至 2025 年预训练效率提升主要来自数据

17:12

数据显示数据改进带来12倍效率增益,模型改进为3.7倍,二者加性效应解释88%方差。

Woofun AI 获悉,Dwarkesh PatelJerry Han 于 2026 年 9 月 8 日发布研究,量化了 2019 至 2025 年间数据与模型改进对预训练效率的贡献。在最高 1e19 FLOPs 计算预算下,数据改进带来的效率增益达 12.0 倍,模型改进为 3.7 倍,前者约为后者的 3.24 倍。

研究发现两者增益大体独立,线性模型下加性效应可解释 OLMES 分数 88% 的方差。模型侧涵盖从 GPT-2OLMo-2 的优化器、位置编码等改进;数据侧则从 OpenWebText 演进至 UltraFineWeb 等更精细语料。

WOOFUN AI

影响力评估 · 一键速读

该研究量化了数据与模型架构对预训练效率的具体贡献比例,证实数据质量提升是过去几年效率增长的核心驱动力。数据侧 12 倍的效率增益远超模型侧的 3.7 倍,且二者呈独立加性关系,暗示单纯堆砌算力或微调架构的边际收益正在递减。未来大模型竞争焦点或将进一步向高质量语料构建与清洗技术倾斜,数据壁垒的重要性显著上升。
WOOFUN AI 生成 · 仅供参考,非投资建议

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅