公司动态
text-generation-webui 本地大模型部署:5 分钟启动与 3 个配置文件说明
text-generation-webui 本地大模型部署5 分钟启动与 3 个配置文件说明【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgentext-generation-webui 是一个本地大模型部署的桌面应用。它支持纯文本对话、视觉输入、工具调用并内置 OpenAI 兼容 API数据完全留在本机。本文按场景讲解依赖选择、启动参数和容器方案照做约 5 分钟能在本机看到对话界面。快速验证5 分钟看到对话界面克隆仓库运行对应系统的启动脚本即可。脚本会自动创建 Python 环境、安装依赖。安装完成、日志加载成功后浏览器会打开 http://localhost:7860。git clone https://gitcode.com/GitHub_Trending/te/textgen cd textgen ./start_linux.shLinux 用 start_linux.shWindows 用 start_windows.batmacOS 用 start_macos.sh。安装器会根据你的硬件自动读取 requirements/full/ 下对应的依赖文件。如果你打算手动安装环境就需要按下一节自己选对文件。按场景选配置不同硬件怎么选依赖文件依赖文件都在 requirements/full/ 目录下按硬件类型选一个硬件依赖文件理由NVIDIA 显卡requirements/full/requirements.txt默认配置带 CUDA 加速与 bitsandbytes 量化支持AMD 显卡requirements/full/requirements_amd.txt安装适配 ROCm 的 PyTorch 版本只有 CPUrequirements/full/requirements_cpu_only.txt安装 CPU 版 PyTorch不带 GPU 依赖Apple Siliconrequirements/full/requirements_apple_silicon.txtM 系列芯片走 MPS 加速如果 CPU 较老、没有 AVX2 指令集预编译包装不上。改用 requirements/full/requirements_nowheels.txt让 PyTorch 从源码编译。局域网访问、API 与省显存的启动参数参数写在命令行也可以持久化到 user_data/CMD_FLAGS.txt。文件里每行一个参数每次启动自动生效想让局域网访问--listen。服务默认只监听本机加上它才对网卡开放。想开 API--api。暴露 OpenAI 兼容接口方便其他程序调用。想省显存--load-in-4bit。量化把模型权重压缩成更少的位数来省显存后显存占用明显下降。想自动开浏览器--auto-launch。省去手动输入地址。不想污染本机环境时改用 Dockerdocker/ 目录按硬件分了四个子目录nvidia、amd、intel、cpu。以 NVIDIA 为例cd textgen/docker/nvidia cp ../.env.example .env docker compose up --build.env 里可以设 TORCH_CUDA_ARCH_LIST显卡计算能力和端口默认值覆盖 RTX 3090、4090。AMD、CPU 部署同理换子目录即可。细节见 docs/09 - Docker.md。参数怎么调三步优先级别一上来就调温度。按下面的顺序来出问题也容易定位是哪一步。第一步先确认显存够用truncation_length上下文截断长度。作用限定输入提示词的最大长度防止上下文超出模型上限。推荐取值模型上下文长度减 512给回答留出生成空间。什么时候调长对话时报显存溢出就调低它。第二步再定 max_new_tokensmax_new_tokens单次最大生成 token 数。作用限制一轮回答最多生成多少 token。推荐取值512 到 2048按需加长。什么时候调回答被截断就调高生成太慢、显存吃紧就调低。设太高还会挤占提示词的可用空间导致长提示词被截断。第三步最后碰 temperature 与 top_ptemperature输出随机性系数。作用数值越高采样越随机。推荐取值0.7 到 1.2日常聊天 0.8 左右即可。什么时候调回答跑题、出现编造内容就调低输出死板重复就调高。top_p核采样阈值。作用只在累计概率达到该值的候选 token 里抽取。推荐取值0.9 到 1.0。什么时候调一般保持默认先定好 temperature 再微调它。两个参数同时动很难判断是哪个起了作用。出错时先看这里现象原因处理动作加载模型报 CUDA out of memory该模型在显存里放不下降到 4 位量化或调低 truncation_length生成速度很慢模型过大或没跑在 GPU 上换更小的模型或在 Model 页确认加载器是 CUDA 版局域网访问不了服务只监听了 localhost在 CMD_FLAGS.txt 里加--listen依赖安装报错、版本冲突预编译包与本机环境不兼容换 requirements_nowheels.txt或直接用 Docker 跑下一步到这里本地大模型部署的三个配置文件——依赖文件、CMD_FLAGS.txt、Docker 的 .env——都已就位。接下来可以做三件事打开 user_data/presets/用内置的 Creative、Deterministic、Top-P 预设对比生成风格。读 docs/ 里的分模块说明重点看 Chat Tab 与 Model Tab 两篇。在 user_data/grammars/ 里试几个 GBNF 语法文件让输出严格符合 JSON 或列表格式。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考