面向AI代理的开源浏览器

你好,HN,我fork了chromium,并构建了代理-浏览器协议(ABP),因为我注意到大多数浏览器代理失败其实并不是模型误解页面。相反,问题在于模型是在陈旧状态下推理。
ABP旨在确保执行代理在每一步都与浏览器同步。每次操作(点击、输入等)后,它会冻结JavaScript的执行和渲染,然后捕获生成的状态。
它还会汇总该动作循环中发生的显著事件,如导航、文件选择器、权限提示、警报和下载,并连同冻结页面状态的截图一起发送给代理。
结果是,浏览器交互开始更像是多模态聊天循环。代理采取行动后,获得新的视觉状态和结构化的事件摘要,然后决定下一步行动。这更符合大型语言模型的工作原理。
ABP帮助消除的几个常见浏览器使用失败:最后一张Playwright截图后出现模态,阻断代理即将使用的输入;动态过滤器使页面在步骤间重流;自动补全下拉菜单打开并覆盖代理计划的元素;alert / confirm会中断流程 * 下载已触发, 但代理无法可靠知道他们何时完成了 作为证明,ABP 作为 Opus 4.6 的驾驶员在 Online Mind2Web 基准测试中得分为 90.5%。
我认为现代大型语言模型已经理解网站,只是需要更好的工具来与网站互动。欢迎在下方评论区回答关于架构、分支Chrome或其他任何问题。
试试看:claude mcp add browser -- npx -y agent-browser-protocol --mcp(Codex/OpenCode 说明见文档) 演示视频:
评论
?
参与讨论