公司动态

为什么我们需要TheAgentCompany:在真实软件公司环境中度量LLM Agent的终极基准

📅 2026/8/27 15:14:14
为什么我们需要TheAgentCompany:在真实软件公司环境中度量LLM Agent的终极基准
为什么我们需要TheAgentCompany在真实软件公司环境中度量LLM Agent的终极基准【免费下载链接】TheAgentCompanyAn agent benchmark with tasks in a simulated software company.项目地址: https://gitcode.com/gh_mirrors/th/TheAgentCompanyTheAgentCompanyThe Agent Company是一个专门用于度量 LLM Agent大语言模型智能体能力的开源基准测试Benchmark它把一台机器变成一家真实的软件公司内置 GitLab、Plane、ownCloud、RocketChat 四大办公服务并提供175 个真实职场任务——从排查崩溃服务、安排会议室到匹配发票让 AI Agent 像数字员工一样浏览网页、写代码、跑程序、与同事沟通最后自动批改打分。为什么现有 Agent 基准不够真实过去几年评估 AI Agent 的基准大多聚焦于日常生活场景订机票、查天气、逛电商。但真正决定 AI 能否进入生产环境的是它能否胜任专业工作任务——这需要领域知识、长链路操作和与他人的协作沟通。TheAgentCompany 的设计目标正是补上这块短板。官方在 docs/BACKGROUND.md 中说明它参考了美国劳工部的 O*NET 职业数据库以真实软件公司员工的工作任务为蓝本构造题目确保任务不是拍脑袋编出来的而是反映真实职场中重要且耗时的工作。简单说现有基准日常场景 → 测不出专业能力TheAgentCompany职场场景 → 覆盖软件工程、产品、数据、HR、财务、行政六大角色175 个任务 × 6 大角色一张数字公司任务清单基准的核心是workspaces/目录下的175 个任务每个任务都是一个独立的 Docker 镜像完整清单可在 workspaces/README.md 中查到。按角色前缀划分角色前缀岗位典型任务sde-软件工程师调试崩溃的服务、写单元测试、实现 HyperLogLogpm-产品经理更新迭代周期、跨工具同步 Issue 状态ds-数据科学家修复 Excel 表格、SQL 练习、数据可视化hr-人力资源海量简历筛选、考勤核对、生成 PPTfinance-财务发票匹配、预算差异分析、税额申报admin-行政会议室排期计算、翻译销售聊天记录ml-/qa-/research-机器学习/测试/研究生成 Grad-CAM、升级线上故障、复现论文图表以行政任务为例workspaces/tasks/admin-arrange-meeting-rooms/task.md 要求 Agent 阅读 6 个团队的会议时段计算出最少需要预订几间会议室再把答案通过 RocketChat 告诉指定同事并存档——一道同时考验阅读理解、推理与工具操作的综合题。一套命令拉起整家公司部署与运行指南一键部署模拟办公环境环境部署是本基准最省心的部分只需 Docker Docker Compose 30GB 磁盘一条安装脚本即可拉起全部服务详见 docs/SETUP.mdcurl -fsSL https://gitcode.com/gh_mirrors/th/TheAgentCompany/-/raw/main/servers/setup.sh | sh几分钟后你会看到这样的输出标志着整家公司开业了rocketchat is ready! owncloud is ready! gitlab is ready! plane is ready! All services are up and running!所有服务都预置了公司数据代码仓库、聊天记录、网盘文件、项目看板各服务的访问地址与账号在 servers/README.md 中列出。三步完成一次 LLM Agent 评估运行流程定义在 docs/EVALUATION.md 中概括为四步启动任务容器每个任务一个镜像docker run即可初始化环境执行/utils/init.sh脚本会自动重置数据并做健康检查让 Agent 干活任务指令在容器内/instruction/task.md基准测试的初始提示词简单到只有一句Complete the task in /instruction/task.md自动评分运行/utils/eval.py基于结果 子检查点sub-checkpoints打分支持确定性检查器与 LLM 评审两种模式 为防止 Agent偷看答案所有评分代码evaluator.py都经过加密存储只有评分阶段才解密——这是该基准公平性设计的一个亮点。如果想用 OpenHands 平台全自动跑完 175 题参考 evaluation/README.md配置好config.toml后执行run_eval.sh即可脚本幂等、可断点续跑。为什么它值得每一个 Agent 研究者关注真实感多 Agent 交互、NPC 同事由 LLM 扮演Agent 需要真正沟通才能拿到信息评分严谨以结果导向为主、过程检查点为辅并提供加密评分防作弊机制可扩展想加新任务照 workspaces/tasks/example/ 里的task.md、evaluator.py、checkpoints.md、dependencies.yml四个文件搭好结构即可见 docs/DEVELOPMENT.md可复现固定 Docker 环境 预烘焙数据全球研究者都能跑出可比结果如何快速开始3 分钟上手清单⬇️ 克隆仓库git clone https://gitcode.com/gh_mirrors/th/TheAgentCompany 运行安装脚本等待All services are up and running! 任选一个任务镜像如admin-arrange-meeting-rooms-image启动容器向你的 Agent 下达任务指令 跑eval.py查看得分与基准榜单上的其他 Agent 对比对想评估LLM Agent 职场能力的团队来说TheAgentCompany 目前是最完整的真实工作场景度量工具它回答的不再是AI 会不会订咖啡而是AI 能不能胜任一份真正的工作。【免费下载链接】TheAgentCompanyAn agent benchmark with tasks in a simulated software company.项目地址: https://gitcode.com/gh_mirrors/th/TheAgentCompany创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考