arXiv cs.LG· Fernando Martinez, Abhishek Satyam, Tao Li, Junaid Farooq, Ying Wang, Juntao Chen·· 6 小时前AI 评分22
Ask the Expert:用 LLM 引导强化学习实现自主网络防御
Ask the Expert: LLM-Guided Reinforcement Learning for Autonomous Cyber Defense
AI 导读
研究者提出 Ask the Expert 训练时引导框架,先总结困难的网络防御状态,再间歇性通过受限动作接口向 LLM 查询主机级防御建议,并将其转化为分层奖励塑形供 PPO 使用。在 TTCP CAGE CC1 和 CC2 及两类攻击者下,该设计提升了样本效率,优于 PPO 和所评估的 PBRS 基线,并保持最强的终端均值。由于训练后即丢弃 LLM,部署时是纯 RL 策略,无需依赖 LLM。
来源:arXiv cs.LG · arxiv.org