公司动态
如何安全驱动AI-Infra-Auto-Driven-SKILLS:Codex与Claude Code全自动权限模式最佳实践
如何安全驱动AI-Infra-Auto-Driven-SKILLSCodex与Claude Code全自动权限模式最佳实践【免费下载链接】AI-Infra-Auto-Driven-SKILLS项目地址: https://gitcode.com/gh_mirrors/ai/AI-Infra-Auto-Driven-SKILLSAI-Infra-Auto-Driven-SKILLS 是一套面向 AI 基础设施工程师的 Agent 技能库Agent-ready playbooks覆盖 LLM 推理基准测试、SGLang/vLLM 性能优化、torch-profiler 分析与生产事故分诊。要在 Codex 与 Claude Code 中以全自动权限模式安全地驱动它核心是三条原则隔离环境、限定检出、保留证据。为什么这个技能库值得全自动驱动AI-Infra-Auto-Driven-SKILLS 提供 13 个核心技能包括推理基准搜索skills/llm-serving-auto-benchmark/、容量规划、profiler 三表分诊、SGLang/vLLM SOTA 优化循环、SGLang 模型 Day-0 支持以及 66 份模型 PR 优化历史档案model-pr-optimization-history/。这些技能设计的执行方式是让编码 Agent 真正干活跑数小时的 GPU 基准、修改 SGLang 源码、生成优化补丁、持续监控远程 Campaign。这也正是风险所在——全自动权限模式下Agent 拥有执行任意命令的能力因此必须把权限放大和安全围栏同时做足。⚠️一键安装Claude Code 与 Codex 两种姿势Claude Code插件一步安装在 Claude Code 会话中依次输入/plugin marketplace add BBuf/AI-Infra-Auto-Driven-SKILLS /plugin install ai-infra-auto-driven-skillsai-infra-auto-driven-skills /reload-plugins重装后 13 个技能会以ai-infra-auto-driven-skills:skill-name的命名空间出现例如ai-infra-auto-driven-skills:sglang-sota-humanize-loop。Codex克隆仓库 软链接单个技能git clone https://gitcode.com/gh_mirrors/ai/AI-Infra-Auto-Driven-SKILLS.git cd AI-Infra-Auto-Driven-SKILLS mkdir -p ~/.codex/skills ln -s $PWD/skills/sglang-diffusion-auto-optimize ~/.codex/skills/sglang-diffusion-auto-optimize安装后重启 Codex。技能本质是纯SKILL.md目录也兼容 Kimi 等其他 Agent 运行时。权限模式速查auto、bypassPermissions 与 full-access 怎么选项目官方给出的驱动方式只有一条经验法则默认用保留权限系统的全自动跳权限模式只给隔离沙箱用。运行时启动命令权限特性适用场景Claude Codeclaude --model opus --permission-mode autoAuto 模式自动批准常规操作仍保留权限系统日常开发、绝大多数场景Claude Code--dangerously-skip-permissionsbypassPermissions跳过一切审批仅限隔离沙箱理想情况下断网Codexcodex --sandbox danger-full-access --ask-for-approval never无沙箱、不弹审批仅限隔离环境 限定检出 独立验证门禁说明opus是别名始终跟踪 Claude Code 当前 Opus 模型无需手钉版本号。Codex 的命令是刻意去沙箱化的作者明确要求它只能配合独立环境 限定 checkout 自有基准/正确性门禁一起使用。全自动模式六条安全最佳实践1. 隔离优先把 Agent 关进独立环境运行全自动 Agent 的机器应当是隔离容器、VM 或专用 GPU 节点且 Agent 只持有范围有限的 checkout。Codex 官方建议里还提到跳权限沙箱理想情况下不要有互联网访问。技能库自身的update_prompt.md刷新流程也演示了同样的纪律——每轮刷新在独立 artifact 目录中产出证据完成后必须清理进程、确认nvidia-smi显存归零。2. 保护现场脏工作区不是优化工作区skills/sglang-diffusion-auto-optimize/references/remote-ownership.md规定启动前必须保留用户未提交的改动控制器从自己的裸缓存创建 detached worktree绝不把用户脏 checkout 当优化现场。同样地启动前只做只读检查GPU 进程、可用显存、ref 解析不 reset、不 clean、不覆盖。3. GPU 纪律不碰别人的进程跑完必须归零启动前执行只读 GPU 与进程检查选择没有占用冲突的空闲 GPU不 kill、不抢占其他用户的进程每个模型验证结束后 kill server并确认nvidia-smi显存回到 0 再做下一个。4. 凭据只走环境变量技能契约明确要求SSH 密钥、token 等凭据通过进程环境变量继承传递严禁写入goal.yaml、请求文件或任何公开控制器。请求模板skills/sglang-diffusion-auto-optimize/references/request-template.yaml也刻意不包含任何主机名、地址或容器 ID。5. 用门禁代替信任基准与正确性验证不能省全自动 ≠ 无人验收。该仓库的证据标准要求基准行必须包含模型、框架、GPU 数、工作负载、并发、启动与基准命令和原始产物profiler 报告 prefill/decode 分离输出 kernel、overlap、fuse 三张表SOTA 结论必须锚定到确切的模型、硬件、框架 commit、精度与 SLA。以sgl-engine-sglang-diffusion/控制器为例它保留 Sol-Engine 正确性与质量门禁且失败即关闭fail closed补丁只有在锁定工作负载上复现目标加速并通过 clean-room 重验证才算TARGET_REACHED搜索耗尽只会给出SEARCH_SPACE_EXHAUSTED而不是理论上不可能。6. 清理要克制禁止广撒网式破坏命令远程所有权文档明确禁止在 Campaign 自有路径之外使用宽泛pkill、递归删除、git reset --hard或 worktree 清理重启用只允许重启本次 Campaign 记录的watchdog 进程组。幂等性也是一道安全阀重复提交同一请求会复用既有 Campaign而不是重跑基线或开第二个 Campaign。放权之后如何监控进度、Token 与审计全自动不等于失控。sgl-diffusion-engine progress --campaign campaign --watch可附接到同一持久 Campaign实时查看性能进度条、搜索轮次、各技术的独立验证加速比与 token 预算消耗。几个值得新手记住的监控要点进度只来自持久化证据而不是 Executor 自报的 microbenchmark 数字token 计数只在 Agent 运行时输出精确用量时记录永不按文本大小估算各技术加速比独立测量integrated stack在组合后重新实测绝不相加Campaign 结束后远端产物与 detached worktree 保留供审计只清理本 Campaign 名下的进程与临时路径。常见误区清单在开发主力机上开 bypassPermissions / full-access——正确做法是专用隔离环境必要时断网。把 skip-permissions 当日常模式——--permission-mode auto才是保留权限系统的全自动模式日常首选。凭据写进 YAML 或脚本——一律走环境变量继承。让 Agent 直接改用户脏工作区——应使用控制器自建的 detached worktree。看到搜索空间耗尽就下不可能更快的结论——只有带可核查下界证书的UNREACHABLE_CERTIFIED才是强结论。结语AI-Infra-Auto-Driven-SKILLS 的价值在于把 AI 基础设施工程师的操作记忆固化成了可执行的技能包而 Codex 的 full-access 与 Claude Code 的 auto/bypass 模式则是把这些技能放到生产级 GPU 工作流上的油门。记住本次分享的核心心法权限放大一分围栏就要加固一分——隔离环境、限定检出、凭据走环境变量、门禁保留、清理克制、证据留痕。做到这六条你就可以放心地让 Agent 通宵跑完一整个 SGLang 优化 Campaign而第二天早上等待你的是一份可审计的补丁和完整的进度证据。【免费下载链接】AI-Infra-Auto-Driven-SKILLS项目地址: https://gitcode.com/gh_mirrors/ai/AI-Infra-Auto-Driven-SKILLS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考