公司动态
一台内网 GPU 全科室共用:Ollama 校对引擎部署记
科室八个人都要用 AI 校对但机器是涉密内网外网一个包都进不来全科室只有一台机器有 GPU。这是上个月我接到的活。最后落地方案那台 GPU 机器跑 Ollama 当推理底座全科室共用所有人 WPS 里的察元AI文档助手都指向它——文档和模型全程不出内网。这篇把部署过程按步骤记下来。为什么选 Ollama 当底座察元的模型配置支持任意 OpenAI 兼容端点Ollama、LM Studio、Xinference、OneAPI 都行。选 Ollama 是因为部署最省事、社区包最多配上 Qwen、DeepSeek 这些国产开源模型校对和润色的活够用。这两年国产模型本地部署的热度一直没降内网场景里它不是选择题是唯一解。第一步GPU 机器装 Ollama拉模型内网装包走离线安装这里不展开。模型提前在外网用好机器拉好摆渡进内网后导入或者直接在 GPU 机器上执行ollama pull qwen2.5:7b显存够就上更大的模型校对任务对推理要求不高7b 级别是性价比起点。拉完用ollama list确认模型都在免得端点配好了才发现模型名拼错——离线环境里排查这种低级错误格外烦人。第二步让 Ollama 监听内网地址Ollama 默认只听本机回环全科室共用必须改成监听所有网卡OLLAMA_HOST0.0.0.0 ollama serve改完在内网另一台机器上 curl 一下这个端口通了才算数。别忘了在内网防火墙上给这台机器放行对应端口这一步漏了能排查一下午。第三步各客户端配置察元的模型端点每台机器上的察元加载项里把模型端点指向http://GPU机器内网IP:11434——Ollama 的默认端口协议本来就是 OpenAI 兼容察元直接认。科室级更彻底的做法是上服务版Docker 网络版全科室共用一套服务管理起来比逐台配省心。逐台配置的小团队注意统一写法地址、端口、模型名三样做成一张卡片发群里谁配错了照着抄。别低估这件事——八台机器八种写法排查的时候够喝一壶。第四步两跳各验一次再收工验证别只验一半。先验文档工具链curlhttp://127.0.0.1:62588/healthz返回online说明本机 sidecar 正常。再验推理链路让任何一台客户端跑一遍校对 dryRun先跑一遍校对dryRun汇总问题列表不要先改正文我确认后再写成批注如果这一步报MODEL_NOT_CONFIGURED说明端点没配对——回第三步查三件事地址写没写对、端口通没通、防火墙放没放行。清一色的低级错误但占了部署问题的九成。还有一类隐蔽问题端点通了但模型名对不上报错不一定直观。让科室里最先跑通的那台机器当模板其余照抄配置是最笨也最稳的推广路径。部署后的账八个人共用一块 GPU白天高峰期推理排队几乎无感所有文档处理、模型推理都在内网完成一个字节不出域安全科那边一次验收通过。后续运维也省心模型升级只动 GPU 机器一台八台客户端无感知真要换推理底座——比如多模型并存的场景换 Xinference——客户端只改端点地址其他一律不动。唯一的代价是模型能力天花板摆在那儿复杂改写不如云端大模型——但内网场景里能用且合规的优先级永远排在效果拔群前面。边界照例讲清楚本地模型做校对建议最终采纳要人工过目密级标识、涉军涉装这类敏感判断工具提示只能当参考定密必须走人工流程。另外内网部署前记得照例走单位审批合规动作一个不能省。还有条经验先拿非涉密的日常材料试跑一周把误报率摸清楚再正式上量科室里对工具的信任是一次一次靠谱攒出来的。一台 GPU 撬动一个科室的 AI 校对这事在 2026 年已经不算稀奇稀奇的是有人还在把文档往外网传。