公司动态
AI Agent 基础架构解析:从 LLM 到 ReAct 循环与 Harness 工程的工程化路径
AI Agent 基础架构解析从 LLM 到 ReAct 循环与 Harness 工程的工程化路径本文基于开源技术书《深入理解 AI Agent》第一章系统梳理 AI Agent 的核心架构组件、运行机制和工程设计原则。该章从多个真实 Agent 产品出发建立了对 Agent 的工程化理解框架涵盖核心公式、ReAct 循环、Harness 工程以及从工作流到自主 Agent 的编排模式。Agent 的工程公式LLM 上下文 工具现代 Agent 的最小工程实现可以用一个公式表达Agent LLM 上下文 工具。这三个组件不是抽象的理论概念而是具体的工程组件LLM 是大脑决策内核其能力来自预训练积累的世界知识与后训练固化的决策策略。上下文是眼睛Agent 在每个决策点收到并保留的信息表示包括环境观察、用户记忆、领域知识和任务进展。工具是手脚Agent 用来感知或改变外部世界的接口。在强化学习视角下Agent 与 Environment 是闭环交互的两方。环境不断返回观察Agent 根据上下文选择行动行动改变环境状态新状态产生下一次观察。这个闭环是理解所有 Agent 交互的最小结构。图1-1 给出了两个抽象层次。外层是 Agent 与 Environment 的交互关系内层是 Agent 的 Model-Harness 结构Model 负责策略决策Harness 是环绕模型的运行与治理层负责构造上下文、暴露工具接口、维护循环和状态并实施权限、验证与纠正。观察空间与动作空间能力扩展的核心杠杆该章提出了一个关键的工程判断在底层模型固定时提升 Agent 任务表现最主要的系统工程手段往往就是重新定义或扩展观察空间与动作空间。许多看似需要更聪明模型的问题实际上只是接口问题——把任务所需的数据纳入上下文或把完成任务所需的操作封装成工具原本不可解的任务就可能变得可解。以 Manus 和 OpenClaw 为例两者的演进本质上都是观察空间和动作空间的扩展。Manus 把深度调研、代码生成和电脑操控三条原本独立的路线合并到同一个 Agent 中OpenClaw 则通过 WhatsApp、Telegram 等消息渠道和本地 Gateway把接口延伸到用户的整个数字生活。五类工具体系工具按 Agent 与外界互动的方向分为五类感知工具让 Agent 访问信息搜索引擎、文件系统、API执行工具让 Agent 改变世界代码执行、文件操作、系统命令协作工具让 Agent 与其他 Agent 分工合作委托子 Agent、请求人类确认事件触发工具外部输入驱动 Agent 开始执行新邮件、定时器、Webhook用户沟通工具Agent 主动与用户传递信息文字消息、语音通话、邮件工具调用Tool Calling的流程分四步在上下文声明工具可用性、模型自主决定调用、框架执行工具、结果追加到上下文。开发者只需定义工具和执行工具调用模型自主完成要不要调用、调哪个、传什么参数的决策。ReAct 循环Agent 的核心运行机制Agent 执行任务的核心模式是 ReActReasoning Acting包含三个环节模型先思考当前该做什么然后调用工具行动再观察工具返回的结果并继续思考。这个想-做-看的循环不断重复直到任务完成。每次调用 LLM 时的完整上下文由两部分组成静态前缀系统提示词 工具定义和轨迹动态消息历史包括用户消息、模型回复和工具执行结果。这揭示了一个关键事实Agent 的上下文 静态前缀 轨迹。采用 Apache 2.0 许可证