公司动态
macOS下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-macos-arm64.tar.gz)
文章目录1. llama.cpp 简介2. b10068 版本亮点3. 获取安装包4. 快速开始常用命令1. llama.cpp 简介llama.cpp 是 Georgi Gerganov 创建的开源项目用纯 C/C 实现大语言模型LLM推理引擎以最小配置和最优性能在本地及云端运行 AI 模型。Gerganov 同时也是 whisper.cpp语音识别、stable-diffusion.cpp 以及底层 ggml 张量计算库的作者这一系列项目构成了当前最活跃的本地 AI 推理开源生态之一。llama.cpp 的核心理念是零依赖——无需 Python 环境、无需复杂的深度学习框架一个可执行文件即可运行主流大语言模型。这使得它在资源受限的设备上也能高效运行极大降低了使用大语言模型的门槛。项目自发布以来获得广泛关注已成为 GitHub 上最受欢迎的 AI 推理项目之一吸引了大量社区贡献者参与开发并催生了 ollama、LM Studio、gpt4all 等众多知名下游项目。核心特点纯 C/C 实现零外部依赖编译后即可运行Apple Silicon 为第一优先级通过 ARM NEON、Accelerate 和 Metal 框架深度优化支持 1.5 位到 8 位整数量化大幅降低内存占用提升推理速度多 GPU 后端支持CUDANVIDIA、HIPAMD、Vulkan、SYCLIntelCPUGPU 混合推理可运行超出 VRAM 容量的超大模型兼容 OpenAI API 的 HTTP 服务器llama-server可替代云端推理服务支持数百种模型架构包括 LLaMA、Mistral、Qwen、Deepseek、Phi、Gemma 等2. b10068 版本亮点该版本为 llama.cpp 的最新构建版本build b10068。本版本主要包含以下更新DFlash K/V 缓存旋转优化#25823在使用 K/V 量化时对注入的 K/V 缓存进行旋转处理提升了 DFlash 注意力机制的推理质量。由 Georgi Gerganov 联合提交。此外该版本提供了覆盖 macOSarm64/x64、Linuxx64/arm64/s390x含 CPU/Vulkan/ROCm/OpenVINO/SYCL 等多种后端、WindowsCPU/CUDA/Vulkan/OpenVINO/SYCL/HIP、Androidarm64以及 iOSXCFramework的全平台预编译二进制包。3. 获取安装包如果访问 GitHub 不便安装包及中文文档https://hanshuixin.org/go/223S内含 llama-b10068-bin-macos-arm64.tar.gz、README 中英对照、发布说明中英对照和 LICENSE。macOS安装llama.cpp-b10068llama-b10068-bin-macos-arm64.zip ├── llama-b10068-bin-macos-arm64.tar.gz ├── macOS安装llama.cpp-b10068llama-b10068-bin-macos-arm64.pdf ├── README/ │ ├── README.md │ └── README-中文版.md ├── 发布说明/ │ ├── RELEASE-NOTES.md │ └── RELEASE-NOTES-中文版.md └── LICENSE适用硬件搭载 Apple Silicon 芯片M1/M2/M3/M4 等系列的 Mac运行 macOS。llama.cpp 对 Apple Silicon 进行了深度优化利用 ARM NEON 指令集、Accelerate 框架和 Metal GPU 后端实现高性能本地推理。4. 快速开始解压llama-b10068-bin-macos-arm64.tar.gz后在终端中进入解压目录即可使用以下命令行工具。llama.cpp需要 GGUF 格式的模型文件。可从 Hugging Face 下载兼容模型或使用-hf参数直接下载。常用命令# 使用本地模型文件进行对话llama-cli-mmodel.gguf# 直接从 Hugging Face 下载并运行模型llama-cli-hfggml-org/gemma-3-1b-it-GGUF# 启动兼容 OpenAI API 的本地服务器默认端口 8080llama-server-mmodel.gguf--port8080# 启动服务器并支持多用户并行最多 4 并发llama-server-mmodel.gguf-c16384-np4# 启用推测性解码加速推理llama-server-mmodel.gguf-mddraft.gguf# 运行推理性能基准测试llama-bench-mmodel.gguf# 测量模型在文本上的困惑度llama-perplexity-mmodel.gguf-ffile.txt