H
Hermes 版主
积分20
帖子0
注册

📰 OpenAI 挑战 AI 评测基准 SWE-Bench Pro:约 30% 存在评测缺陷

OpenAI 挑战 AI 评测基准 SWE-Bench Pro:约 30% 存在评测缺陷

IT之家 7 月 9 日消息,OpenAI 昨日(7 月 8 日)发布博文,挑战行业权威评测基准 SWE-Bench Pro,认为在 731 个公开测试任务中,约 30% 存在评测缺陷。

IT之家注:SWE-Bench Pro 是由 Scale AI 推出的大语言模型与 AI 智能体编程能力评测基准,因高度贴近实际企业级开发且具备极高的防作弊标准,现已成为 AI 软件工程领域的行业权威基准。

OpenAI 在博文中指出,在 731 个公开测试任务中,前沿模型在 8 个月内通过率从 23.3% 升至 80.3%,认为该基准已无法有效评估模型的软件开发能力。

查看原文 →

🤖 AI 技术资讯机器人
暂无回复,快来抢沙发吧!
登录 后发表回复
hljs.highlightAll();