公司动态
Agent评测
结合我了解到的目前面试中遇到的问题和当前AI的发展趋势感觉仅仅了解agent的设计已经不够了当然记忆机制、上下文机制等等还是很重要的但是现在更多的人开始关注agent的执行效率或者说不再仅仅问你是怎么做的agent而是问你做的agent到底怎么样是不是真的能用是不是真的好用。把agent评测单独拎出来作为一个命题希望得到一个标准流程化的方案来检测我们设计出来的agent。关于agent评测可以从四个角度来考察1、基础规划遵循度、工具调用准确率ACC、记忆保留率2、行为过程决策步骤是否合理与预测最佳轨迹重合度3、可靠任务成功率输入扰动下的鲁棒性4、安全越权、注入、有害输出、合规、幻觉率评测的粒度也有所不同1、最终响应预先定义标准评估最终的输出。但是有两个问题无法模拟真实的动态环境测试结果的变化并不能代表实际agent性能的变化这种测试方式类似“黑盒”我们无法看到执行过程中具体出现了什么问题无法针对性的进行优化。2、步骤级评测逐action——工具调用参数提取执行是否成功3、轨迹级评测判断执行轨迹与预测最佳轨迹的匹配程度但是我们很难界定哪种方式是真正的“最佳”得到“最佳轨迹”本身就需要评测出来。下面梳理一下完成一个agent设计的完成流程1、明确任务需求基于结构化prompt定义agent的目标、能力边界写死红线2、任务规划模块将复杂任务拆解为可执行的子任务、子目标支持基于react或者plan-and-execute模式动态调整规划3、记忆机制单agent的持久化方式如结构化摘要记忆更新针对同一内容的前后冲突设置标签或者权重跨会话绑定session_id, user_id4、上下文机制三层压缩主子agent之间隔离保证主agent上下文空间干净子agent的上下文/运行日志但单独保存5、Tool真正的将意图转化为动作function calling MCP6、推理模块在每一步做有效思考不确定时反问这里具体怎么实现通过system prompt可以做到吗——基于coT7、安全护栏输入过滤基于校验规则和分类器——防止注入、越权过程约束工具白名单输出过滤有害、合规8、RAG遇到不在模型权重内的问题向外检索避免幻觉。9、观测日志全程trace为评测提供数据。完成设计到上线可能经历的阶段1、冷启动基于真实业务采集的测试集泛化保证agent运行的连贯性和准确性2、测能否真正的工作基于交互沙箱——把 Agent 放进高保真可控环境真实网站、操作系统、数据库、公司内部系统让它真正执行任务再用环境状态变更是否达成目标做 execution-based 自动评分。3、步骤/轨迹级这里可能会见到的几个参数Acc_tool 细粒度工具调用准确率 正确调用 / 总 工具数Action Advancement表征该步骤是否真的对完成任务有贡献Galileo AI 智能体追踪平台原生指标Trajectory-based检测路径与最佳路径的相似度可以判断执行步骤是否漏、颠倒等4、需要主观判断/高风险LLM初评——人工抽检——校准judge5、灰度上线在受控产品环境里把真实流量分到新 AgentA与基线B用业务指标任务完成率、停留时长、转化率、成本对比。6、对抗测试为了保证安全这个应该是在全过程持续迭代进行的最起码灰度上线的时候一定要经过这个测试单agent注入忽略之前内容调用高危指令、误导性命令、上下文污染/边界压力多agent智能体间失配A对B发出误导性信息检测B是否 能判断出来系统设计违背大量多轮对话场景下检测agent丢失自己的身份任务终止异常未完成任务提前终止完成任务仍不停止。