公司动态
SWE Agent工具系统详解:tree-sitter代码解析与代码库搜索如何给AI装上“代码雷达“
SWE Agent工具系统详解tree-sitter代码解析与代码库搜索如何给AI装上代码雷达【免费下载链接】swe-agent AI-powered software engineering multi-agent system with researcher and developer agents that automate code implementation through intelligent planning and execution. Built with LangGraph multi-agent workflows项目地址: https://gitcode.com/gh_mirrors/au/swe-agentSWE Agent 是一个 AI 驱动的软件开发多智能体系统靠智能规划与执行来自动完成代码实现。这篇文章带你拆解它的工具系统如何用tree-sitter 代码解析快速读取代码骨架、用像 IDE CmdF 一样的代码库搜索定位关键位置从而给 AI 装上一枚精准的代码雷达让它真正看懂代码而不是凭空猜测。为什么 AI 智能体需要一枚代码雷达让大模型直接改代码最大的难点是它看不见你的代码库。 一个中型项目动辄几千个文件全部塞进上下文既贵又超长度 模型不知道某功能在哪个文件、第几行只能靠猜 代码是有结构的类、函数、参数逐行读会淹没在细节里SWE Agent 的解法很朴素却有效给智能体配上一组眼睛——结构化解析 全文搜索 目录地图。这些工具全部集中在 agent/tools/ 目录只有三个文件文件职责agent/tools/codemap.py基于 tree-sitter 的代码解析工具agent/tools/search.py关键词代码库搜索工具agent/tools/write.py文件写入与目录结构工具总体架构两个智能体共享同一套雷达整个系统是一条两级流水线见agent/graph.pyArchitect架构师负责研究代码库、提出假设、产出实现计划Developer开发者按计划逐条执行生成精确的代码变更关键在于两个智能体绑定的是同一组搜索与解析工具见agent/architect/graph.py中的bind_tools(search_toolscodemap_tools)规划阶段的雷达和实现阶段的雷达是同一套保证开发者拿到的上下文与架构师调研时一致。tree-sitter 代码解析只读骨架不读全文agent/tools/codemap.py是这枚雷达的核心它利用tree-sitter把源码解析成语法树AST再用查询语句精准抽取结构信息而不是把整份文件丢给模型。它提供 4 个工具get_code_definitions抽取一个文件的类/函数签名概览——只输出第X行| class Foo:/def bar(...):这样的骨架正文用...省略。相当于文件的目录页token 消耗极低get_function_implementation按函数名精确取回某个函数的完整实现带行号想深挖哪个函数就查哪个️get_code_definitions_multi批量解析多个文件一次建立多模块的结构感get_raw_file_content读取文件原始内容用于配置文件等非代码文件支持 Python、JavaScript、TypeScriptpy/js/jsx/ts/tsx。这种先骨架、后细节的分层读取正是控制上下文成本的关键技巧。代码库搜索整个代码库的 CmdFagent/tools/search.py提供了search_keyword_in_directory工具定位非常明确——就像你在 IDE 里按 CmdF只不过范围是整个代码库在指定目录的Python 文件中做不区分大小写的关键词匹配每处命中自动附带前后 2 行上下文可通过context参数调整结果按文件 → 行号 → 代码片段格式化输出行号一目了然支持部分路径输入get_full_path会自动把短路径补全为工作目录下的完整路径架构师智能体在调研时就是靠它快速回答认证逻辑写在哪这个报错关键词出现在哪些文件这类问题。目录地图给 AI 一张楼层平面图在解析与搜索之前AI 需要先知道楼有多少层。agent/tools/write.py中的get_files_structure工具调用gitingest扫描目录生成整棵目录树JSON 结构输出为codebase_structure字段在架构师每步研究和开发者每步实现前都会刷新注入。另外两个写文件工具也有讲究create_file只创建新文件已存在则报错防止误覆盖write_to_file只覆盖已有文件不存在则报错一创一覆互相制约把误删代码这种事故挡在门外。雷达如何工作从假设到落地架构师阶段agent/architect/graph.py是一个假设驱动的循环基于目录地图提出研究假设come_up_with_research_next_step先校验假设是否已经调研过check_research_step避免绕圈执行研究模型自由调用搜索/解析工具conduct_research→tools节点循环调研足够后提炼出结构化的ImplementationPlan文件级任务 原子改动步骤数据模型定义在agent/common/entities.py开发者阶段agent/developer/graph.py则按原子任务逐个执行每个任务开工前仍会再次使用同一套搜索/解析工具补充上下文research_tool_node随后生成带行号的 diff 并精确写回文件——雷达在写之前先确认读大幅降低改错位置的概率。快速上手三步跑起 SWE Agent1️⃣克隆仓库git clone https://gitcode.com/gh_mirrors/au/swe-agent cd swe-agent2️⃣准备环境需要 Python 3.12 和uvuv sync cp .env.example .env.local # 填入你的 Anthropic API key3️⃣放入目标代码库并启动# 把你要让 AI 改造的仓库放到 ./workspace_repo langgraph dev之后在界面提交一段自然语言需求如支持图片输入架构师就会开始调用这枚代码雷达展开调研。总结小而准的工具组合拳SWE Agent 的工具系统没有花哨的向量数据库或 embedding靠的是四件小而准的武器工具位置一句话角色get_code_definitionsagent/tools/codemap.py读文件骨架省 tokenget_function_implementationagent/tools/codemap.py精确取回单个函数实现search_keyword_in_directoryagent/tools/search.py代码库级关键词搜索get_files_structureagent/tools/write.py生成目录结构地图这正是给 AI 装代码雷达的本质结构解析回答长什么样关键词搜索回答在哪里目录地图回答全貌如何。理解了这个工具组合的设计思路你也可以为自己手头的大模型应用设计出同样高效的代码理解能力。【免费下载链接】swe-agent AI-powered software engineering multi-agent system with researcher and developer agents that automate code implementation through intelligent planning and execution. Built with LangGraph multi-agent workflows项目地址: https://gitcode.com/gh_mirrors/au/swe-agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考