X
  • 能源中国IOS版

  • 能源中国安卓版

  • 陇上孟河

X
您的位置 > 首页 -> 电网频道

国网江西电力智算中心着力提升算力集约化运营能力

来源:中国能源新闻网 时间:2026-10-09 18:36

王松

  国网江西电力为提升人工智能规模化应用支撑能力,依托省级智算中心,聚焦异构设备管理分散、超大参数模型跨机通信受限、整卡分配资源闲置、低效模型长期占用算力等问题,统筹推进异构算力统一纳管和RoCE高速组网,开展国产算力虚拟化验证与存量模型治理,形成资源集中管理、模型协同运行、算力按需复用的运营路径,有效盘活存量资源、缓解新增业务算力供给压力,为电网业务智能化应用提供支撑。

  聚焦算力供给与运营难点

  一是异构算力资源统筹管理难。多品牌、多型号算力设备并存,管理方式和运行环境存在差异,设备状态、模型部署和业务调用数据分散,资源分配与实际使用情况难以贯通,影响算力供需匹配和统一运营。

  二是超大参数模型跨机协同难。超大参数模型对显存容量和多卡协同能力要求高,单机资源难以满足部分模型部署需求,跨机推理又依赖节点间高效通信,传统业务网络难以适应高频数据交换,制约集群算力协同发挥。

  三是整卡分配与实际负载不匹配。国产算力按整卡分配,小模型计算量和显存需求较小却独占整卡,大小模型业务繁忙时段不同,闲置资源难以灵活复用,形成“资源已分配、算力未用足”的结构性浪费。

  四是低效模型占用资源难回收。部分模型长期无调用、调用频次低或性能不满足需求,缺少结合业务实际的持续评估与退出机制,存量占用与新增需求叠加,加大算力供给压力。

  强化算力建设与运营协同

  一是建立异构算力统一纳管与穿透监测机制。依托省级智算机房和人工智能平台,统筹纳管多品牌异构设备,形成统一资源视图,国产算力占比高,为人工智能应用提供以国产算力为主的资源支撑。部署算力资源与模型服务监测探针,分钟级采集设备状态、算力利用率、模型部署和业务调用信息,贯通“算力—模型—场景”关联关系,使资源配置有台账、运行状态可感知、使用效能可分析,为容量评估、资源调配和低效治理提供依据,提升算力运营精细化水平。

  二是构建RoCE高速网络支撑超大参数模型跨机推理。面向大模型分布式推理需求,建设高性能智算网络,为节点间数据交换提供高速通信支撑,缓解多机协同中的通信瓶颈。结合国产多机多卡资源,支撑光明、DeepSeek等超大参数模型跨机部署与推理,将模型承载能力从单机拓展至集群,满足超出单机资源容量的部署需求。通过算力资源与高速网络协同建设,拓展国产集群的大模型服务能力,为智能问答、审计监督等业务场景提供支撑。

  三是推进国产算力共享复用提升业务承载能力。针对小模型独占整卡、闲时算力难以复用等问题,采用算力软切分、多副本部署和大小模型混部方式,推动资源按需分配、错峰共享。在绝缘子分类识别等业务模型的专项验证中,多副本并发处理速度提升近一倍,大模型空闲时小模型复用资源最高提速60%以上,受测语义大模型性能与精度基本保持稳定,实现同等算力资源下更高的识别处理效率和业务承载能力,为巡检识别等场景高效利用国产算力提供支撑。

  四是建立低效模型评估与算力回收闭环。依托运行监测数据,按照“清退无调用、统筹低调用、替换低效模型”原则开展常态化排查,与业务单位核实使用需求,分批实施模型下线整合和资源回收,将腾退资源重新配置给新增模型及紧缺业务。通过持续治理,累计节约算力约10Pflops以上,将低效占用资源转化为可用算力,有效补齐业务算力缺口、缓解资源紧缺压力,形成“监测发现、业务评估、资源回收、统筹调配”的运营闭环,推动算力保障由单纯增加资源向存量优化与按需供给协同转变。 

  责任编辑:江蓬新