OpenAI开源PaperBench 重塑顶级AI Agent评测via cnBeta全文版 | RayNews

Skip to main content

10:50 · 2025年4月3日 · 周四

OpenAI开源PaperBench 重塑顶级AI Agent评测

via cnBeta全文版
Telegraph

OpenAI开源PaperBench 重塑顶级AI Agent评测

今天凌晨1点，OpenAI开源了一个全新的AI Agent评测基准——PaperBench。这个基准主要考核智能体的搜索、整合、执行等能力，需要对2024年国际机器学习大会上顶尖论文的复现，包括对论文内容的理解、代码编写以及实验执行等方面的能力。根据OpenAI公布的测试数据显示，目前知名大模型打造的智能体，还无法战胜顶级机器学习专业博士。但在辅助学习、了解科研内容方面很有帮助。开源地址：https://github.com/openai/preparedness/ PaperBench组成介绍 P…

👀 open eyes to see the world. 丨 site views: -