欢迎光临
我们一直在努力

PyTorch强化学习实战——基于图像-文本融合的自动化网页导航

PyTorch强化学习实战——基于图像-文本融合的自动化网页导航

    • 0. 前言
    • 1. 在网页导航智能体中引入文本数据
    • 2. 代码实现
    • 3. 运行结果
    • 相关链接

0. 前言

我们已经学习了强化学习在网页导航与浏览器自动化中的应用,介绍了 MiniWoB++ 基准测试,该环境提供像素观测、文本描述和 DOM 元素等多模态输入,动作空间涵盖鼠标键盘操作。并且实现了基于异步优势演员-评论家 (Asynchronous Advantage Actor-Critic, A3C) 算法的按钮点击智能体,将动作空间简化为网格化点击,通过卷积网络处理图像观测。实验结果表明该智能体能解决简单任务(如点击对话框),但在处理多步骤、依赖文本描述或违反马尔可夫性质的任务时效果不佳。 在本节中,我们将改进点击智能体,将把问题文本描述纳入模型。我们知道,某些任务包含关键信息(如需要点击的标签页索引或待勾选条目列表),这些信息通过文本描述提供。虽然相同信息会显示在图像观测顶部,但像素并非简单文本的最佳表征形式。

1. 在网页导航智能体中引入文本数据

为处理文本数据,需将模型输入从单一图像扩展为图像与文本的组合。借鉴

赞(0)
未经允许不得转载:171主机测评 » PyTorch强化学习实战——基于图像-文本融合的自动化网页导航
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址