PyTorch强化学习实战——基于图像-文本融合的自动化网页导航
-
- 0. 前言
- 1. 在网页导航智能体中引入文本数据
- 2. 代码实现
- 3. 运行结果
- 相关链接
0. 前言
我们已经学习了强化学习在网页导航与浏览器自动化中的应用,介绍了 MiniWoB++ 基准测试,该环境提供像素观测、文本描述和 DOM 元素等多模态输入,动作空间涵盖鼠标键盘操作。并且实现了基于异步优势演员-评论家 (Asynchronous Advantage Actor-Critic, A3C) 算法的按钮点击智能体,将动作空间简化为网格化点击,通过卷积网络处理图像观测。实验结果表明该智能体能解决简单任务(如点击对话框),但在处理多步骤、依赖文本描述或违反马尔可夫性质的任务时效果不佳。 在本节中,我们将改进点击智能体,将把问题文本描述纳入模型。我们知道,某些任务包含关键信息(如需要点击的标签页索引或待勾选条目列表),这些信息通过文本描述提供。虽然相同信息会显示在图像观测顶部,但像素并非简单文本的最佳表征形式。
1. 在网页导航智能体中引入文本数据
为处理文本数据,需将模型输入从单一图像扩展为图像与文本的组合。借鉴



