公司动态

2026 年从 0 开发 AI Agent 需要的 10 个技能

📅 2026/8/17 21:03:59
2026 年从 0 开发 AI Agent 需要的 10 个技能
本文介绍一下 从 0 开发 AI Agent 需要的 10 个技能。如果你也想一起来可私信我 沉浸式的体验从 0 开发一个 AI Agent 的详细过程。项目介绍先讲做什么再讲怎么做。Agent 是什么很多同学可能还不知道 Agent 到底是一个什么东西它和 AI LLM 有什么关系。AI 人工智能是一个很宽泛的概念泛指我们当前正在发展的人工智能行业中的所有内容LLM 大预言模型这个好理解就是现在常用的 GPT Claude Deepseek Qwen kimi 等大模型Agent 智能体指的是在大模型基础上创建的应用如 Claude Code、Cursor、Manus、OpenClaw Hermes 等。可以做一个比喻LLM 大模型就是大脑聪明但能力不足Agent 就是给大脑装配上手脚口鼻眼等不仅能思考还能真正的做事情。做一个什么项目去年做的第一版项目是一个 AI 面试官应用范围比较窄主要是优化简历、模拟面试、解答面试题…这次重构我要做一个通用的参考当前比较流行的 AI Agent 做一个像 OpenClaw 小龙虾一样的项目。只不过它目前是运行在控制台的像 Claude Code 一样。当前还不能连接飞书、钉钉等 IM 聊天工具。但功能、配置是和 OpenClaw 完全一样的。你可以和 AI 聊天、让它读写文档、配置 Skills 、设置定时任务、使用 MCP server 发送消息等…它也是一个优秀的个人 AI 助理而且更轻量级、低成本。语言和框架这次我依然选择使用 Typescript 语言和 Nodejs 运行时社区丰富且对前端开发人员很友好。继续使用 langChain 和 langGraph 框架它们可以很快的搭建和配置一个 Agent 。前端开发为何要学习 Agent 第一学习 Agent 开发才能让你更好的使用 Agent 工具例如 Claude Code Cursor Openclaw 和本项目有很多地方的设计是相同的。第二学习 Agent 开发让你有机会转型做 AI 工程师。这个项目几乎涵盖了所有 Agent 开发的必备技能让你从 0 作出一个优秀的 Agent 产品。AI Agent 架构设计去年开发的第一版是基于一个开源项目二次开发的是 AI chat 项目形式。现在重构的项目完全是我自己从 0 开始一步一步搭建出来的包含了当前 AI Agent 所有核心技术。包括 tools skills memory context permission subagent session command hook MCP-server …其他优秀的 Agent 如 claude-code cursor openclaw 也都是这些功能现在 Agent 已经发展的比较稳定了。LLMLLM 大模型是一切的基础所有的决策、每一个步骤都要经过 LLM 的推理和判断。一个通用的 Agent 应该支持所有常见的 LLM API 至少得支持国内的、本地的 LLM 接口。Query Engine有了 LLM 接口每一步的调用也需要单独封装要考虑很多种情况包括stream 流式输出模拟打字效果abort 取消接口调用出现失误可及时取消error 错误处理例如网络错误、接口错误retry 重试有错误要自动重试 2-3 次limit 限制例如 rate limit 调用频率限制token limit 上下文内容的限制等如下图用户发送了一个 AI 请求AI 流式输出回复内容中途你可以按 ESC 取消这个请求。ReAct AgentReAct Reasoning 推理 Action 执行一边推理一边执行这是当前 Agent 得基础流程。用户提交一个信息发送请求到 LLM看 LLM 的回复是否需要调用 tool 工具如果不需要调用 tool 则说明已经是最终答案直接回复给用户如果需要则调用 tool 得到结果再发送到 LLM继续第二部判断所以只要有 LLM 和 tools 外加这个流程设计就已经是一个 Agent 基础了。Tools 工具上文提到 ReAct Agent 基础版本就是LLM tools LLM 是大脑tools 是手脚。设计一个通用的 Agent 至少要内置如下 toolsread_file 读取一个文件的内容write_file 新建一个文件或重写一个文件exec 执行一个 shell 脚本web_search 搜索引擎web_fetch 获取或下载一个网络资源run_python 运行一段 python 脚本这只是最基础的没有这些 Agent 就跑不起来。但 tools 是贯穿 agent 全局的。例如下文的其他功能也会用到 tools 。再例如通过 MCP server 来扩展第三方能力也是用的 toolsSkills 技能一个 skill 就是一个技能手册skills 就是 Agent 的技能包和图书馆AI 会选择和主题相关的技能根据这些技能的指导回复质量会更高、更符合用户要求。甚至一个 skill 的文本都可以定义工作流LLM 能很好的理解。2025 年之前可都是通过画流程图来定义的那个很麻烦。这次重构的【智语】项目天生支持 skills 你安装和配置第三方 skill 你还可以创建自己的 skillSession 会话之前的项目是 AI Chat 形式左侧是对话列表右侧是聊天区域。重构以后就不是这个形式了但还得有对话的管理。使用 slash command 形式和 Claude Code 一样。使用/new可新开启一个会话使用/sessions命令获取最近 20 条历史对话使用/rewind xxx可回复到之前的某一个会话中。Context 上下文默认情况下每次 AI 接口请求Agent 会把当前所有聊天记录都发过去这样很容易造成 Context 内容臃肿因此会产生 AI 幻觉、token 用量大、花费大等问题。所以一个优秀的 Agent 一定得有 Context 压缩机制而且不能简单粗暴的裁剪、或让 AI 总结要结合情况分析。重构以后的【智语】项目有 4 层压缩机制压缩 tool 输入内容如果内容过多则存在硬盘只给一个文件地址让 Agent 按需读取。压缩聊天记录中的 tool message 这都是一些冗余信息简化它们压缩整个会话让 AI 总结核心内容 —— 但有要求和模板不是 AI 随意发挥裁剪聊天记录保底行为如下图当 Context 内容超过 80% 会自动开启压缩并建议使用/new命令开启新会话。PS. 上图为了测试刻意把 token limit 设置为 4000 测试完会还原为默认的 256,000Memory 记忆一个 Agent 个人助手必须有记忆功能。例如我告诉它“我叫双越我是一名程序员”它要能记住我的姓名、职业。它还要能记住我最近做的事情以及我的一些个人习惯。重构后的【智语】项目有 3 层记忆这也是其他开源 Agent 常用的设计方式短期记忆当前 session 的记忆就是 context 的内容长期记忆跨 session 的记忆会记录一段时间但随着时间因素而衰减Profile 记录用户画像Permission 权限记得 Openclaw 刚开始火爆网络时很多人担心它的安全问题不建议安装在个人电脑上。Agent 确实会有安全问题而且也确实无法真正 100% 保证绝对安全。任何软件都可能有漏洞。但我们能做的是尽量保证绝大部分应用场景下的安全考量拦截危险操作和危险目录。首先把当前所有 tools 设置权限级别read write exec network db安全级别低的 read network 可以直接执行 tool 安全级别高的需要其他防护措施。再判断当前操作的文件、目录等是否是系统敏感文件或敏感目录。如果是直接拒绝。如果不是敏感的要看是否是当前目录内的如果不是则争取用户同意。还要判断执行的 shell 脚本是否是危险命令如rm -rf /如果是则直接拒绝。agent 安全防护流程就是下面 4 个阶段阶段 1Bash 预检→ 阶段 2Deny 规则→ 阶段 3Allow 规则→ 阶段 4Ask如下图我想让 agent 读取我系统的一个敏感文件它提示无法读取。Hook 钩子Permission 权限的规则都是固定的且是 agent 项目内置的。你不能修改也不好扩展。Hook 就是一个让用户自定义权限规则的方式你可以在多种时机去定义自己的规则。例如在调用 tool 之前你可以定义什么文件不能被操作如.env例如在会话开始之前你可以定义聊天内容中添加什么内容Openclaw 社区中当前最火爆的 skill 叫做 self-improving-agent 它就可以使用 hook 来集成内容。说明 Hook 已经是 agent 的一个必备模块了。SubAgent 子智能体当一个聊天的内容越来越多、越来越乱就很容易导致 Context 超过 token limit 以及 AI 幻觉。解决这个问题的方式之一就是使用 subagent 来做一些独立的事情。subagent 上下文和 main-agent 上下文是完全分开的它不会影响到 main-agent context 大小。所以subagent 也是一个 agent 项目必备的能力。如下图我可以启动一个 subagent 帮我做一件事。无论你怎么做最后告诉我结果即可。其他以上是一个 AI Agent 得核心模块还有一些其他内容。一个 AI Agent 要能支配置 MCP server 一边扩展第三方能力。但 MCP server 也有很多局限性它会导致 agent 请求 AI 接口时携带大量 tools 影响效率和成本。现在很多人也在对比 MCP server 和 skills cli 后者也在社区中被推广。slash command 也是 agent 常见功能例如上文讲到的/new/rewind/sessions/compactRAG 检索增强生成以及 vector 向量数据库在当前 agent 设计中的重要性被降低了很多。主要是因为它的成本较高在个人使用的场景下用其他方式可以代替。还有由于是本地运行的 agent 它天生易于读取本地文件文档、表格、图片等只要 LLM 支持就没问题。另外后面我会考虑支持语音输入等高级功能让用户体验更好一些。这里给大家精心整理了一份全面的AI大模型学习资源包括AI大模型全套学习路线图从入门到实战、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等资料免费分享扫码免费领取全部内容1. 成长路线图学习规划要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。这里我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。2. 大模型经典PDF书籍书籍和学习文档资料是学习大模型过程中必不可少的我们精选了一系列深入探讨大模型技术的书籍和学习文档它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。书籍含电子版PDF3. 大模型视频教程对于很多自学或者没有基础的同学来说书籍这些纯文字类的学习教材会觉得比较晦涩难以理解因此我们提供了丰富的大模型视频教程以动态、形象的方式展示技术概念帮助你更快、更轻松地掌握核心知识。4. 2026行业报告行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5. 大模型项目实战学以致用当你的理论知识积累到一定程度就需要通过项目实战在实际操作中检验和巩固你所学到的知识同时为你找工作和职业发展打下坚实的基础。6. 大模型面试题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我们将提供精心整理的大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。7. 资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容