
OpenAI开源BrowseComp 重塑Agent浏览器评测
《科创板日报》11日讯,今日凌晨,OpenAI开源了专门用于智能体浏览器功能的测试基准——BrowseComp。这个测试基准非常有难度,连OpenAI自己的GPT-4o、GPT-4.5准确率只有0.6%和0.9%几乎为0,即便使用带浏览器功能的GPT-4o也只有1.9%。但OpenAI最新发布的Agent模型Deep Research准确率高达51.5%,在自主搜索、信息整合、准确性校准方面非常优秀。
我要评论
反馈意见 

欢迎您发表有价值的评论,发布广告和不和谐的评论都将会被删除,您的账号将禁止评论。
评论(3)
热度
最新
cls-4roca611天前 · 陕西
🙂

回复0条回复
cls-180847211天前 · 上海
哈哈

回复0条回复
cls-3rpo3211天前 · 辽宁
利好泛微网络

回复0条回复
关联话题
5.09W 人关注
