新闻动态

  

克日,,, ,,,我院赵俊华教授团队立异性地提出了一种基于分层清静强化学习的风储一体化控制框架(Hierarchical Safe Deep Reinforcement Learning,,, ,,,HSDRL)。。。。。该框架通过清静约束驱动与层级决议协同,,, ,,,能够在多时间标准下协调风电机组与储能系统的功率输出,,, ,,,兼顾经济收益最大化与功率平滑清静约束,,, ,,,从而实现风储系统的智能化与清静化运行。。。。。香港中文大学(深圳)博士生王抒一为论文第一作者,,, ,,,我院赵俊华教授与香港理工大学赵焕博士为论文配合通讯作者。。。。。

通过在大规模拟真平台WindFarmSimulator上的系统验证,,, ,,,研究团队提出的HSDRL框架展现出业界领先的性能。。。。。研究进一步批注,,, ,,,该要领能够在重大风速与电价扰动情形下坚持高稳固性与清静性,,, ,,,为新型电力系统的智能调理与可再生能源并网运行提供了新的突破,,, ,,,也展示了其在未来大规模风储系统中的辽阔应用潜力。。。。。

 

期刊先容

IEEE Transactions on Smart Grid (TSG) 是IEEE电力与能源学会(IEEE Power & Energy Society, PES)旗下的旗舰级国际期刊,,, ,,,聚焦智能电网、可再生能源并网、能源治理与智能控制等领域的前沿研究。。。。。该期刊恒久坚持中科院一区TOP期刊职位,,, ,,,具有极高的学术影响力与严酷的审稿标准,,, ,,,任命率低,,, ,,,仅揭晓在智能电网及能源辖档挽域具有原创性、前瞻性与工程影响力的高水平研究效果。。。。。

 

研究配景

随着风能在全球能源结构中的占比一直提升,,, ,,,怎样在包管电网清静与稳固的条件下高效使用波动性风电成为新型电力系统中的要害科学问题。。。。。本文提出了一种基于分层清静强化学习的风储一体化功率平滑控制框架HSDRL,,, ,,,旨在协调风电机组与电池储能系统(BESS)的多时间标准控制,,, ,,,实现收益最大化与功率波动抑制的双重目的。。。。。该框架通过引入约束马尔可夫决议历程(CMDP)建模风储系统运行的清静界线,,, ,,,并团结原始-对偶优化头脑在差别层级间实现协调学习。。。。。上层智能体认真风电功率输出与恒久经济收益优化,,, ,,,下层智能体认真储能系统的实时功率调理与清静约束执行。。。。。通过在WindFarmSimulator仿真平台上的综合实验,,, ,,,所提出要领相较多智能体强化学习与模子展望控制基线模子抵达目今最先进性能。。。。。该研究为将强化学习清静引入风储系统控制提供了有用途径,,, ,,,展示了人工智能赋能新能源系统清静调理与稳固运行的重大潜力。。。。。

 

研究要领

如图1所示,,, ,,,本文提出的分层清静强化学习控制框架(Hierarchical Safe Deep Reinforcement Learning,,, ,,,HSDRL)由两级智能体组成,,, ,,,以实现风电机组与储能系统(BESS)在差别时间标准下的协同控制。。。。。上层智能体以风电场为焦点,,, ,,,认真长时间标准下的收益最大化与功率平滑目的设定;;; ;;;下层智能体则在短时间标准内通过控制储能充放电行为实现细腻化功率调理,,, ,,,从而包管系统运行的稳固与清静。。。。。

图1:分层清静强化学习控制框架图。。。。。

在算法设计上,,, ,,,研究团队将功率平滑控制问题形式化为两个约束马尔可夫决议历程(CMDPs),,, ,,,并提出了分层原始–对偶清静DDPG算法(Hierarchical Primal-Dual Safe DDPG, HPD-DDPG),,, ,,,实现对收益与约束的同步优化。。。。。与古板强化学习要领差别,,, ,,,HPD-DDPG通过引入拉格朗日对偶变量动态调理约束权重,,, ,,,能够在确保清静界线的条件下自顺应地学习最优战略。。。。。

同时,,, ,,,本文立异性地设计了三项要害机制以提升算法稳固性与训练效率:

1. 清静指导课程学习(Safety-Guided Curriculum Learning, SGCL)

通过逐步收紧清静阈值,,, ,,,指导智能体从宽松到严酷的学习阶段,,, ,,,实现平稳收敛与约束感知战略的逐步形成。。。。。

图2:清静指导课程学习历程。。。。。

2. 约束违例优先履历回放(Constraint Violation Prioritized Experience Replay, CVPER)

对爆发约束违例的样本付与更高采样优先级,,, ,,,确保智能体在训练历程中一连强化清静界线意识,,, ,,,显著改善样本使用效率。。。。。

3. 分层共享特征神经网络结构(Hierarchical Shared Feature Neural Network, HSFNN)

在上、下层智能体间实现Q网络参数共享,,, ,,,增进特征迁徙与跨层知识协同,,, ,,,加速整体训练收敛历程。。。。。

图3:分层共享特征神经网络结构。。。。。

为验证所提要领的有用性,,, ,,,研究团队基于WindFarmSimulator仿真平台举行了系统实验。。。。。实验综合思量了多风速情景与电价扰动,,, ,,,评估算法在收益、功率波动与约束违例等指标上的体现。。。。。效果批注,,, ,,,HSDRL框架相比多智能体强化学习(MA-DDPG、MA-SAC)与转动展望控制(R-MPC)等要领,,, ,,,平均收益提升15.3%,,, ,,,功率波动降低46.0%,,, ,,,约束违例镌汰71.4%。。。。。别的,,, ,,,算法在高波动风速场景下依然坚持快速收敛与高稳固性,,, ,,,展现出优异的鲁棒性与可扩展性。。。。。

图4:差别要领的学习历程。。。。。

图5:差别要领下的功率平滑效果和电池储能系统(BESS)控制行为。。。。。

 

研究孝顺

提出了一种分层清静强化学习控制框架(Hierarchical Safe Deep Reinforcement Learning, HSDRL)。。。。。该框架将风储一体化功率平滑控制问题建模为两个相互关联的约束马尔可夫决议历程(CMDPs),,, ,,,通太过层原始–对偶清静DDPG算法实现风机与储能系统在差别时间标准下的协同控制,,, ,,,兼顾收益最大化与清静约束。。。。。

提出了清静指导课程学习机制(Safety-Guided Curriculum Learning, SGCL)。。。。。该要领通过逐步收紧清静阈值指导智能体从宽松到严酷的学习阶段,,, ,,,显著提高了在重大约束情形下的稳固性与收敛效率。。。。。

设计了约束违例优先履历回放机制(Constraint Violation Prioritized Experience Replay, CVPER)。。。。。该机制对约束违例样本付与更高的采样优先级,,, ,,,从而强化智能体对清静界线的学习与影象,,, ,,,提高整体战略的清静性。。。。。

构建了分层共享特征神经网络结构(Hierarchical Shared Feature Neural Network, HSFNN)。。。。。该结构在多层智能体之间实现特征共享与参数协同,,, ,,,有用提升了特征提取能力与学习效率。。。。。

 

作者简介

文章通讯作者赵俊华教授现任香港中文大学(深圳)理工学院教授、CUHKSZ–CSIJRI智能储能团结研究中心执行主任、优德官网群体智能中心副主任、深圳金融研究院能源市场与金融实验室主任,,, ,,,深圳河套学院兼职教授。。。。。赵教授恒久从事智能电网、电力市场、低碳能源转型及人工智能在能源系统中的应用研究。。。。。赵教授曾任澳大利亚纽卡斯尔大学智能电力网络研究中心首席研究科学家,,, ,,,并拥有凌驾 11 年澳大利亚电力行业科研与工程履历。。。。。他揭晓学术论文 350 余篇,,, ,,,其中包括揭晓于Joule(Cell Press)、Patterns(Cell Press)、Scientific Data(Nature Publishing Group)及Engineering(中国工程院主理)等国际高水平期刊论文。。。。。其研究效果被引用凌驾19, 000次,,, ,,,H-index抵达67(Google Scholar)。。。。。
 

本文第一作者王抒一,,, ,,,香港中文大学(深圳)2020级盘算机与信息工程专业博士生,,, ,,,本科结业于香港中文大学(深圳),,, ,,,主要研究偏向为智能电网、强化学习、风储控制。。。。。

* 相关论文信息由论文作者提供