应用介绍
各家都说自己的编程代理最强,到底谁能真正在终端里把活干完?Terminal-Bench 是一个衡量 AI 代理终端实操能力的基准测试,任务多样、难度高且持续更新。
前沿代理的开发团队都用它追踪进展、横向比较,任务版本发布在 Harbor Hub 上。
真实任务:终端实操。
高难度:贴近前沿。
持续更新:版本发布。
横向对比:排行榜。
前沿代理的开发团队都用它追踪进展、横向比较,任务版本发布在 Harbor Hub 上。
软件功能
真实任务:终端实操。
高难度:贴近前沿。
持续更新:版本发布。
横向对比:排行榜。

