应用介绍
编程模型在老基准上刷分越来越高,可训练数据可能早已见过这些题目。SWE-bench-Live 是微软的持续更新的软件工程能力基准,每月从真实仓库收集新任务。
它自动构建可复现的测试环境,减少数据污染,更真实地衡量 AI 修复真实问题的能力。
持续更新:每月新题。
真实问题:来自 GitHub。
防污染:新鲜数据。
可复现:自动环境。
它自动构建可复现的测试环境,减少数据污染,更真实地衡量 AI 修复真实问题的能力。
软件功能
持续更新:每月新题。
真实问题:来自 GitHub。
防污染:新鲜数据。
可复现:自动环境。

