Browser Use Blog

RSS: https://browser-use.com/rss.xml
Browser Use 官方博客,分享 AI 浏览器自动化工具的技术洞察与产品更新。

基准测试的裁判,才是决定分数的关键

AI Agent 评测分数的 45% 来自裁判模型差异而非模型能力差异。Browser Use 团队实测发现,同一组 104 个完成任务用不同裁判模型打分,最高 83.7%、最低 62.5%,相差 21 分。他们把裁判升级为能访问完整工作区的 agent,用百分比替代 pass/fail,三次运行取中位数。最终对比显示 Luna xhigh 以 1/16 成本仅落后 Opus 5 两个任务。
评论点赞收藏9 天前

Browser Use CLI 3.0 发布:用 Python Harness 取代固定动作,提升 Agent 自主操作能力

Browser Use CLI 3.0 发布,核心变化是用可编辑的 Python Harness 替代了固定的动作菜单。这允许 AI Agent 在浏览器内自由执行 Python 代码,利用其擅长的编码循环进行自我检查和恢复,而非受限于预设的点击或输入指令。对于正在探索 Agent 自主控制能力的开发者,这是一个重要的工程实践参考,展示了如何通过赋予模型更多自由度来提升在线操作的准确率。
评论点赞收藏46 天前

如何利用 AI Agent 实现 QA 自动化

介绍使用 AI Agent(支持 Claude Code、Codex、Cursor)自动化 QA 测试的方法:将技能指向网站,模拟用户行为进行测试并打分,最后给出修复建议。对于正在探索 AI 辅助测试落地、希望提升回归测试效率的工程团队有直接参考价值。
评论点赞收藏46 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。