VPP Lean RL 中文站¶
安全强化学习 + 形式化验证
训练、过滤、验证
这里不是一个静态 README,而是一套面向工程师和研究者的站点: 真实 trace、交互式图表、可复现实验配方,以及从 Python RL 到 Lean verifier 的完整链路。
4 个场景
3 个 RL 算法
3 种 shield 模式
v3 trace schema
从哪里开始¶
系统结构¶
flowchart LR
A[Python Agent<br/>Q-learning / SARSA / Double Q] --> B[Safety Shield<br/>none / project / table_project]
B --> C[VPP Environment<br/>电池 + 光伏 + 负荷 + 电网]
C --> D[Trace 导出<br/>proposedAction / appliedAction / reasons]
D --> E[Lean 验证器]
F[Lean 规则表] --> B
示例画廊¶
示例 1
削峰场景无 Shield 基线
先看策略在没有在线安全过滤时究竟能学到什么,再去比较 shield 带来的变化。
示例 2
投影 Shield 对比
直接比较 proposed action 和 applied action,观察在线投影在什么时候真正介入。
示例 3
光伏外送实验
切换到中午光伏富余更明显的曲线,观察充电、外送和傍晚放电的变化。
示例 4
Stress Test 边界运行
更紧的约束、更频繁的边界状态,适合配合 trace schema 页面一起分析。
按目标推荐路径¶
在线入口¶
- 根语言入口页:
https://tigerneil.github.io/vpp/ - 中文站:
https://tigerneil.github.io/vpp/zh/ - 英文站:
https://tigerneil.github.io/vpp/en/