半秒降载 25%:AI 算力借挖矿机制化解电网危机

核心要点

卢克索公司在德州实验通过软件调度GPU功耗,借鉴Bitcoin挖矿需求响应机制,以牺牲少量延迟换取巨额输电成本节省,探索AI算力弹性化新路径。

据 Woofun AI 消息,人工智能数据中心正面临算力爆发与电网建设滞后的尖锐矛盾,卢克索公司率先引入比特币挖矿者掌握的'需求响应'机制,尝试通过软件弹性调度破解这一僵局。

每一个人工智能聊天机器人的回复背后,都是庞大电能的消耗。这些处理任务并非发生在用户终端,而是远在装有海量计算机芯片的数据中心内完成。芯片在运算中产生巨大热量,必须依赖冷却系统维持运转。当数百万次的查询、图像处理及商业任务汇聚时,发电厂和输电线路便承受了集中式负荷压力。单个大型数据中心的能耗堪比一座小城市,且建设速度远超电力基础设施的适应节奏。传统新建发电厂方案需投入数十亿美元并耗时数年,难以满足即时需求。因此,将部分非紧急计算任务调整至非高峰时段处理,成为突破瓶颈的关键思路。

该解决方案的核心在于通过软件区分任务的紧急程度。虽然聊天机器人回复需实时生成,但内部测试或夜间视频处理任务具备时间弹性。若软件能精准识别任务优先级,在电力紧张时暂缓低优先级任务,待电力充足后再行处理,即可平衡供需。

这种机制不仅缓解了电网瞬时压力,也为数据中心提供了在不增加硬件投入前提下提升能效的新路径,其本质是将计算负载的时间分布与电网负荷曲线进行动态匹配。

德克萨斯州的一项小型实验验证了该机制的可行性。实验中,芯片在执行推理运算时,接收软件指令降低功耗。结果显示,芯片功耗在半秒内降到了正常水平的约25%,期间处理的请求数量相应减少。

尽管受限状态下工作量下降导致用户等待时间延长,但因仅涉及单芯片测试,整体影响可控。这一权衡揭示了 AI 灵活性提升的关键变量:延迟频率、受影响用户群体及初始服务承诺。任何旨在提升弹性的方案,均需在这三者间寻找最优解,以确保用户体验与电网效益的平衡。

Woofun AI 整理数据显示,宏观层面,德州 ERCOT 数据揭示了巨大的电力缺口。在用电高峰期,1 兆瓦供电能力仅能满足 250 户居民需求,当前供电能力相当于 2200 多万户居民用电。阿博特公司要求监管机构审查新项目,因现有规划与实际承载能力严重脱节。

尽管 474 吉瓦的用电需求反映了对电力土地的迫切追求,但计划建设的设备远超输电线路承载极限。按 ERCOT 测算,这些设备高峰期仅能满足 18750 户居民或为 75000 台 1 千瓦级 GPU 供电,未计入处理器、冷却系统等额外能耗。这表明,单纯扩建基础设施已无法填补供需鸿沟,必须从需求侧挖掘潜力。

从单芯片扩展至全数据中心面临技术复杂性挑战。数据中心内含数以万计的芯片、服务器、存储设备、网络设备,电网规划者将其视为'固定负荷',要求随时足额供电。运营商希望昂贵的 GPU 持续运行,因每一分钟闲置都延误付费服务。大型 AI 任务中,数千颗芯片存在紧密相互依赖关系,一组芯片减速可能波及邻近芯片。

这种硬件耦合与任务关联性,使得功耗管理难度极大。然而,并非所有任务都需全速运行,部分任务可延迟或降速,甚至迁移至其他数据中心。通过识别这些弹性空间,可在不中断核心服务的前提下,减少特定时刻的电网取电量,实现负荷的动态调节。

比特币挖矿为该领域提供了成熟启示。挖矿机在批发电价上涨时暂停挖矿,紧急情况下因减少用电获得报酬,并通过避开夏季高峰降低输电费用。卢克索公司为比特币挖矿机提供软件、能源服务及金融产品,遂将此机制移植至 AI 系统。实验旨在验证服务用户的机器能否像挖矿机那样对电价变化做出响应。

这一跨界借鉴表明,算力资源的弹性化管理并非全新概念,而是通过软件定义,将原本刚性的计算负载转化为可调节的电力需求,从而参与电力市场的供需平衡。

训练与推理两种 AI 工作负载在功耗管理上呈现不同特征。训练是漫长且高耗算力的过程,通过海量数据优化模型,虽可在检查点暂停,但数千台机器同步停止难度极大。推理则包含数百万小规模请求,部分需即时回复,部分如自动化任务可排队等待,直至电力充足或价格更低时处理。调度器软件在此扮演关键角色,优先保障紧急任务,从截止时间宽松的任务中削减功耗。

这种分层调度策略,使得 AI 设施能在不牺牲核心服务质量的前提下,灵活调整能耗曲线,适应电网波动。

经济激励机制是驱动这一变革的核心动力。德州'四个同步高峰期'规则规定,大型用电户需为高压输电网络出资,费用取决于 6 月、7 月、8 月、9 月中系统用电需求最高的四个 15 分钟时段。由于高峰期时间不确定,用电户聘请预测专家监测电网、天气及需求,以预测峰值。若预测准确,在峰值前减少用电,即可节省巨额输电费用。按每千瓦每年 74.89 美元计算,100 兆瓦用电需求在四个高峰期的输电成本约 749 万美元。对于大型数据中心,夏季仅一小时的用电决策可能涉及数百万美元成本,因此提前数小时减载成为极具吸引力的投资。

卢克索公司的实验虽成功,但仍存诸多未知。测试仅涉及单颗 B200 芯片,未披露具体 AI 模型、降载持续时间、前置用电量及速度下降幅度。尽管代表验证了功耗降低,但缺乏独立分析。B200 芯片在大幅降载下虽能完成任务,但其对用户等待时间的影响、其他推理或训练任务的反应,以及全数据中心范围的省电效果尚不明确。GPU 仅占数据中心能耗一部分,冷却、网络、存储等设备同样耗电,即便芯片降载 75%,电表数值降幅可能有限。卢克索公司计划下一步在德州使用英伟达 H100 GPU 集群测试,以验证规模扩展可行性。

ERCOT 评估指出,德州虽具大量需求响应资源,但常错失风能和太阳能最低的用电最高峰。建造新基建需数年,而提升灵活性仅需数月。挑战在于确保灵活性在恰当时间发挥作用,并证明数据中心能可靠降载。若电网预计减少 50 兆瓦需求,需核实无限制电时的基准用电量及实际降幅,并监控降载持续时间及 GPU 恢复满负荷时的峰值风险。用户合同在此至关重要,数据中心可在保障交互式及安全任务的同时,将内部测试、数据索引等任务纳入灵活层级。用户或愿为灵活性支付较低代价,电网则付费换取可预测的电力削减。

这意味着 AI 计算任务不再同等紧迫,电力成本将成为排序新维度。电网紧张时,图像渲染或变长,训练任务或推迟,其他服务照常运行。卢克索公司实现的半秒级降载虽易,但在千颗 GPU 上实现且不违背用户承诺、确保电网供应可预测,任务艰巨。这正是其价值所在:AI 面临电力过耗,电网缺乏灵活性,数据中心处于核心位置。若能将任务延迟转化为稳定省电,AI 电力问题或可解决,电网亦能更好应对。人工智能发展的下一阶段,或许不再是单纯寻求足够电力,而是学会在恰当时间使用电力。

评论

回复 @用户
0/800

暂无评论

消息提醒

登录后查看消息
查看全部消息管理订阅