AI2推出开源代理MolmoWeb 仅靠视觉即可操控网页

2026年03月26日 10:40
本文共计794个字,预计阅读时长3分钟。
来源/aibase 责编/爱力方

艾伦人工智能研究所(AI2)近日发布了突破性的全开源网络代理 MolmoWeb。与传统依赖网页底层代码(DOM)的代理不同,MolmoWeb 仅通过读取屏幕截图进行决策,标志着“视觉驱动”网络导航技术的重大飞跃。

核心技术:像人类一样“看”网页

MolmoWeb 的运作逻辑非常直观:它捕获当前浏览器窗口的截图,通过视觉分析决定下一步操作(如点击、滚动、翻页),然后执行并重复。这种“所见即所得”的模式使其比传统代理更具鲁棒性,因为网页的视觉布局通常比底层代码更稳定,且其决策过程对人类用户而言完全透明、可解释。

QQ20260326-092046.jpg

性能飞跃:小模型击败巨头

尽管 MolmoWeb 的参数规模仅为4B 和8B,但在性能表现上却展现出“以小博大”的实力:

  • 榜单领跑:WebVoyager 测试中,8B 版本的得分高达 78.2%,不仅在开源模型中名列前茅,更逼近了 OpenAI 的专有模型 o3(79.3%)。

  • 潜力巨大: 研究发现,通过多次运行任务并筛选最优结果,其成功率可进一步跃升至 94.7%

  • 定位精准: 在 UI 元素定位基准测试中,它甚至超越了 Anthropic 的 Claude3.7。

数据支撑:史上最大的开放数据集

AI2此次不仅开源了模型权重,还贡献了名为 MolmoWebMix 的庞大数据集。该数据集包含:

  • 由人类志愿者完成的 3.6万次真实浏览任务

  • 超过 220万个 屏幕截图-问答对。

  • 通过 GPT-4o 验证的自动化合成数据。实验证明,合成数据在引导智能体寻找“最优路径”方面甚至优于人类轨迹。

QQ20260326-092350.jpg

开源精神与未来挑战

目前,MolmoWeb 已在 Hugging FaceGitHub 上通过 Apache2.0协议完全开放。尽管在处理复杂指令、登录验证及法律合规(如服务条款)方面仍面临挑战,但 AI2坚信,只有通过完全的透明和社区协作,才能真正对抗大型科技公司的数据垄断。

来源:AI2发布全开源网络代理 MolmoWeb:仅凭“视觉”即可掌控网页 | AIbase

声明:本文来自aibase,版权归作者所有。文章内容仅代表作者独立观点,不代表A³·爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 A³·爱力方

https://www.agent.ren/