OpenAI开源PaperBench，重塑顶级AI Agent评测

2025 年 4 月 2 日 - admin

BlockBeats 消息，4 月 3 日，据 AIGC 开放社区消息，今天凌晨 1 点，OpenAI 开源了一个全新的 AI Agent 评测基准——PaperBench。这个基准主要考核智能体的搜索、整合、执行等能力，需要对 2024 年国际机器学习大会上顶尖论文的复现，包括对论文内容的理解、代码编写以及实验执行等方面的能力。根据 OpenAI 公布的测试数据显示，目前知名大模型打造的智能体，还无法战胜顶级机器学习专业博士。但在辅助学习、了解科研内容方面很有帮助。

声明：本文所述观点不代表沐林数字货币安全教育网立场，文章内容仅供学习、阅读和参考。对购买、持有或出售任何数字资产不提供观点。投资存在风险，请自行评估。转载需注明来源，违者必究！

相关推荐

Polymarket上预测美国经济年内陷入衰退的概率升至47%

美联储副主席杰斐逊：不急于调整利率，政策定位良好

特朗普邀请萨尔瓦多总统于4月14日访问白宫